8.3 评价体系与基准:具身智能的评测难题
「我的 VLA 比你的好」——怎么证明?在 NLP 有 GLUE/MMLU,在视觉有 ImageNet/COCO,但具身智能评测远比这复杂。一个任务的成功涉及感知、决策、控制、长程执行多个维度,标准化极难。
8.3.1 具身智能评测的根本难题
| 难题 |
描述 |
| 任务定义模糊 |
「叠衣服」成功的标准是什么? |
| 环境开放 |
同一任务在不同环境难度差异大 |
| 硬件依赖 |
同一策略在不同机器人表现不同 |
| 长程任务 |
10 步任务「成功」要每步都成功 |
| 真机评测贵 |
一次评测消耗机器人时间和设备损耗 |
| 复现性差 |
不同实验室评测结果难以比较 |
这些难题让具身智能评测成为社区长期痛点。
8.3.2 评测的三大层次
| 层次 |
优势 |
劣势 |
| 仿真评测 |
可复现、便宜、标准化 |
Reality Gap |
| 真机评测 |
真实物理 |
贵、复现难 |
| 真实场景 |
终极检验 |
极贵、不可复现 |
8.3.3 主流仿真 Benchmark
CALVIN
CALVIN(Language-Conditioned Policy Learning)是长程操作任务基准:
- 场景:桌面机械臂环境(Franka)。
- 任务:推动方块、开关抽屉、转动开关等。
- 特点:长程多任务( chained 5 个任务),评测组合泛化。
- 指标:连续完成 5 个任务的成败。
CALVIN 是评测 VLA 长程任务能力的标准基准。
RoboCasa
RoboCasa(Robotic Casa, 2024):
- 场景:仿真家庭场景(厨房、客厅)。
- 任务:大规模日常操作(30+ 大类,1000+ 任务实例)。
- 特点:场景丰富、任务多样、含 articulated 物体。
- 指标:任务成功率、原子动作成功率。
RoboCasa 是当前最大的家庭场景仿真基准。
Habitat
Habitat(Meta):
- 场景:真实扫描的 3D 室内场景(Matterport、Gibson)。
- 任务:导航为主(PointNav、ObjectNav、ImageNav)。
- 特点:高保真视觉、大规模场景。
- 指标:导航成功率、路径效率。
Habitat 是导航 Agent 的标准基准,与操作基准(CALVIN/RoboCasa)互补。
LIBERO
LIBERO(Berkeley):
- 四个任务套件(spatial、object、goal、long)。
- 评测不同泛化维度(空间、物体、目标、长程)。
- 设计精良,社区采用度高。
ManiSkill2/3
ManiSkill(UCSD/UCB):
- 操作任务基准,含 articulated 物体。
- 强调 GPU 并行评测。
- 标准化指标和评测协议。
8.3.4 仿真 Benchmark 的局限
| 局限 |
描述 |
| Reality Gap |
仿真表现好 ≠ 真机好 |
| 任务设计偏差 |
仿真任务可能不代表真实任务 |
| 物体分布有限 |
仿真资产远少于真实世界 |
| 物理简化 |
接触、摩擦、变形简化 |
⚠️ 业界共识:仿真 benchmark 在论文中被广泛采用,但真机表现才是终极标准。一个在 CALVIN 上 SOTA 的策略,真机部署可能完全失败。读者看论文时要警惕「仿真 SOTA」与「真机可用」的差距。
8.3.5 真机评测的挑战
真机评测面临:
| 挑战 |
描述 |
| 昂贵 |
单次评测消耗设备和时间 |
| 不可复现 |
不同实验室设备状态不同 |
| 危险 |
错误可能损坏设备 |
| 慢 |
比 GPU 评测慢数百倍 |
| 标准化难 |
不同实验室评测协议不一 |
真机评测的标准化尝试
- 标准任务集:定义一组固定任务(如「把红方块放到蓝碗里」)。
- 标准物体集:用统一的物体(如 YCB 物体集)。
- 标准指标:成功率、完成时间、能量消耗。
- 共享硬件:云机器人实验室(远程访问相同硬件)。
但这些标准化仍处于早期,社区尚未达成完全共识。
8.3.6 评测指标的多样性
任务成功率只是最基本指标,更全面的评测包括:
| 指标 |
含义 |
| 成功率 |
完成任务的比例 |
| 完成时间 |
完成任务的速度 |
| 路径效率 |
实际路径 / 最短路径 |
| 能量消耗 |
总能量 |
| 失败模式分布 |
失败在哪里(感知/规划/控制) |
| 泛化能力 |
在新场景的退化程度 |
| 鲁棒性 |
在扰动下的稳定性 |
| 人机协作质量 |
主观打分 |
| 安全性 |
安全违规次数 |
单一指标(如成功率)会鼓励过拟合。多维度评测才能真实反映策略质量。
8.3.7 开放性评测难题
最难的评测是开放性任务——任务本身没有明确定义:
- 「整理这个房间」:什么算整理好?
- 「帮我做晚餐」:做什么菜?做多少?
- 「让这里更舒适」:主观判断。
这类任务需要:
- 人类评审:让人打分。
- 过程指标:拆解为子任务分别评测。
- 目标完成度:用 VLM 判断任务是否接近完成。
开放性评测是具身智能评测的真正前沿——它要求评测系统本身具备「理解任务」的能力。
8.3.8 LLM-as-Judge:用大模型评测
借鉴 LLM 的 LLM-as-Judge 思路,具身智能也开始用 VLM 做评测:
机器人执行任务 → 录制视频 → VLM 判断 "任务完成度如何?"
VLM 评测的优势:
劣势:
- VLM 自己有偏见。
- 评测结果不可复现。
- 评测能力受 VLM 限制。
VLM-as-Judge 是当前研究热点,但远未成熟。
8.3.9 真机评测的伦理
真机评测还涉及伦理:
- 机器人伤害人:测试时万一伤人?
- 设备损坏:错误动作损坏昂贵设备。
- 测试数据隐私:测试场景可能含隐私。
- 能耗与碳排放:大规模测试消耗能源。
这些让真机评测不仅是技术问题,也是社会问题。
8.3.10 当前评测的最佳实践
总结一套合理的具身智能评测实践:
- 多基准覆盖:不只看 CALVIN,要 CALVIN + RoboCasa + LIBERO。
- 真机验证必做:仿真 SOTA 不算数,至少小规模真机验证。
- 多指标评测:成功率 + 时间 + 能量 + 失败模式。
- 泛化专项:专门评测新物体、新场景的退化。
- 长程任务:评测多步任务的累积成功率。
- 开放报告:报告失败模式、限制、未覆盖场景。
- 复现努力:开源代码、模型、数据,便于复现。
8.3.11 评测的未来方向
| 方向 |
描述 |
| 统一标准 |
社区达成共识的标准协议 |
| 云机器人实验室 |
远程共享硬件,提升复现性 |
| VLM-as-Judge |
自动化开放任务评测 |
| 真实场景基准 |
标准化的家庭/工厂测试集 |
| 安全评测 |
专门的安全 violation 基准 |
| 持续评测 |
长期跟踪策略在真实部署的表现 |
本节小结
- 具身智能评测面临任务模糊、环境开放、硬件依赖、长程任务、复现性等根本难题。
- 三大层次:仿真评测(CALVIN/RoboCasa/Habitat)、真机评测、真实场景评测。
- 仿真 benchmark 主流:CALVIN(长程)、RoboCasa(家庭)、Habitat(导航)、LIBERO(泛化)、ManiSkill(操作)。
- 仿真 SOTA ≠ 真机可用,Reality Gap 让仿真评测有局限。
- 真机评测昂贵、不可复现,标准化尝试在早期。
- 多维度评测(成功率+时间+能量+失败模式)才能反映策略质量。
- 开放性任务需要 VLM-as-Judge 或人类评审。
- 评测最佳实践:多基准 + 真机验证 + 多指标 + 复现努力。
下一节《8.4 未来展望》将讨论世界模型、具身基础模型、具身 AGI 的未来方向。