资源描述
Open-X Embodied Navigation Benchmark (OENB) 是首个开源具身智能导航评测基准数据集,覆盖12,000+真实家庭级3D场景(基于Habitat-Matterport构建),支持多模态指令输入(文本、模拟语音、手势轨迹),提供长程任务成功率、路径效率、能耗比等双维度评估指标,适用于机器人导航、具身AI、VLA(Vision-Language-Action)模型训练与评测。
详细内容
# Open-X Embodied Navigation Benchmark (OENB)
## 数据集背景与来源
OENB 由 Open-X AI 联盟发起并维护,旨在推动具身智能(Embodied AI)在真实家庭环境中的导航能力标准化评测。数据集基于 Matterport3D 高精度室内扫描数据,经 Habitat 平台重建为物理一致的可交互3D仿真环境(共12,157个独特家庭场景),所有场景均通过语义分割与功能区域标注(如厨房、卧室、走廊)增强空间理解基础。指令数据来源于真实人类导航行为采集与可控合成,涵盖日常家居任务(如‘把咖啡杯拿到客厅茶几上’),强调长程、多步、跨房间语义导航。
## 数据规模与标注信息
- **场景规模**:12,157个高保真3D家庭环境(分辨率 ≥ 1024×1024,支持光照/物理引擎模拟);
- **任务实例**:28,436条多模态导航指令,每条含:
- 文本指令(中英双语对齐,含指代消解与空间关系标注);
- 模拟语音波形(WAV,采样率16kHz,含环境噪声增强);
- 手势轨迹序列(2D屏幕坐标+置信度,模拟触摸屏/AR手势交互);
- **标注内容**:专家级最优路径(SE(3)位姿序列)、成功判定阈值(目标物体距离 < 0.5m & 朝向角误差 < 30°)、能耗估算(基于电机扭矩与移动距离建模);
- **评估协议**:支持 `Success Rate`、`SPL`(Success weighted by Path Length)、`Energy Efficiency Ratio`(EER)三重指标联合评测。
## 典型应用场景
- 训练与评测具身语言模型(ELM)和视觉-语言-动作(VLA)模型;
- 构建家庭服务机器人导航策略(如扫地机器人、助老机器人);
- 多模态指令理解与跨模态对齐研究(text-to-action, speech-to-navigation);
- 长期任务规划(Long-Horizon Task Planning)与分层强化学习验证;
- 仿真到现实(Sim2Real)迁移能力基准测试(配套提供部分真实设备采集的校准数据子集)。
## 使用注意事项
- 场景需通过 Habitat 1.4+ 或 AI2-THOR 4.4+ 加载,推荐使用 `habitat-lab==v0.3.2` 及配套 `habitat-sim==0.3.2`;
- 语音与手势模态为**模拟生成**,非原始录音/传感器数据,适用于算法鲁棒性测试,不可用于声纹或生物特征识别;
- 所有任务均以`/data/oemb/v1/`为根路径组织,结构遵循 `scenes/`, `tasks/`, `annotations/`, `eval/` 四级目录;
- 商业用途需遵守 [CC BY-NC-SA 4.0](https://creativecommons.org/licenses/by-nc-sa/4.0/) 协议,引用论文:*Open-X Embodied Navigation Benchmark: A Multimodal, Large-Scale Benchmark for Realistic Home Navigation*, CoRL 2024.