8.3 评价体系与基准:具身智能的评测难题 「我的 VLA 比你的好」——怎么证明?在 NLP 有 GLUE/MMLU,在视觉有 ImageNet/COCO,但具身智能评测远比这复杂。一个任务的成功涉及感知、决策、控制、长程执行多个维度,标准化极难。 8.3.1 具身智能评测的根本难题 难题 | 描述 任务定义模糊 | 「叠衣服」成功的标准是什么? 环境开放 | 同一任务在不同环境难度差异大 硬件依赖 | 同一策略在不同机器人表现不同 长程任务 | 10 步任务「成功」要每步都成功 真机评测贵 | 一次评测消耗机器人时间和设备损耗 复现性差 | 不同实验室评测结果难以比较 这些难题让具身智能评测成为社区长期痛点。 8.3.
「我的 VLA 比你的好」——怎么证明?在 NLP 有 GLUE/MMLU,在视觉有 ImageNet/COCO,但具身智能评测远比这复杂。一个任务的成功涉及感知、决策、控制、长程执行多个维度,标准化极难。
| 难题 | 描述 |
|---|---|
| 任务定义模糊 | 「叠衣服」成功的标准是什么? |
| 环境开放 | 同一任务在不同环境难度差异大 |
| 硬件依赖 | 同一策略在不同机器人表现不同 |
| 长程任务 | 10 步任务「成功」要每步都成功 |
| 真机评测贵 | 一次评测消耗机器人时间和设备损耗 |
| 复现性差 | 不同实验室评测结果难以比较 |
这些难题让具身智能评测成为社区长期痛点。
| 层次 | 优势 | 劣势 |
|---|---|---|
| 仿真评测 | 可复现、便宜、标准化 | Reality Gap |
| 真机评测 | 真实物理 | 贵、复现难 |
| 真实场景 | 终极检验 | 极贵、不可复现 |
CALVIN(Language-Conditioned Policy Learning)是长程操作任务基准:
CALVIN 是评测 VLA 长程任务能力的标准基准。
RoboCasa(Robotic Casa, 2024):
RoboCasa 是当前最大的家庭场景仿真基准。
Habitat(Meta):
Habitat 是导航 Agent 的标准基准,与操作基准(CALVIN/RoboCasa)互补。
LIBERO(Berkeley):
ManiSkill(UCSD/UCB):
| 局限 | 描述 |
|---|---|
| Reality Gap | 仿真表现好 ≠ 真机好 |
| 任务设计偏差 | 仿真任务可能不代表真实任务 |
| 物体分布有限 | 仿真资产远少于真实世界 |
| 物理简化 | 接触、摩擦、变形简化 |
⚠️ 业界共识:仿真 benchmark 在论文中被广泛采用,但真机表现才是终极标准。一个在 CALVIN 上 SOTA 的策略,真机部署可能完全失败。读者看论文时要警惕「仿真 SOTA」与「真机可用」的差距。
真机评测面临:
| 挑战 | 描述 |
|---|---|
| 昂贵 | 单次评测消耗设备和时间 |
| 不可复现 | 不同实验室设备状态不同 |
| 危险 | 错误可能损坏设备 |
| 慢 | 比 GPU 评测慢数百倍 |
| 标准化难 | 不同实验室评测协议不一 |
但这些标准化仍处于早期,社区尚未达成完全共识。
任务成功率只是最基本指标,更全面的评测包括:
| 指标 | 含义 |
|---|---|
| 成功率 | 完成任务的比例 |
| 完成时间 | 完成任务的速度 |
| 路径效率 | 实际路径 / 最短路径 |
| 能量消耗 | 总能量 |
| 失败模式分布 | 失败在哪里(感知/规划/控制) |
| 泛化能力 | 在新场景的退化程度 |
| 鲁棒性 | 在扰动下的稳定性 |
| 人机协作质量 | 主观打分 |
| 安全性 | 安全违规次数 |
单一指标(如成功率)会鼓励过拟合。多维度评测才能真实反映策略质量。
最难的评测是开放性任务——任务本身没有明确定义:
这类任务需要:
开放性评测是具身智能评测的真正前沿——它要求评测系统本身具备「理解任务」的能力。
借鉴 LLM 的 LLM-as-Judge 思路,具身智能也开始用 VLM 做评测:
机器人执行任务 → 录制视频 → VLM 判断 "任务完成度如何?"
VLM 评测的优势:
劣势:
VLM-as-Judge 是当前研究热点,但远未成熟。
真机评测还涉及伦理:
这些让真机评测不仅是技术问题,也是社会问题。
总结一套合理的具身智能评测实践:
| 方向 | 描述 |
|---|---|
| 统一标准 | 社区达成共识的标准协议 |
| 云机器人实验室 | 远程共享硬件,提升复现性 |
| VLM-as-Judge | 自动化开放任务评测 |
| 真实场景基准 | 标准化的家庭/工厂测试集 |
| 安全评测 | 专门的安全 violation 基准 |
| 持续评测 | 长期跟踪策略在真实部署的表现 |
下一节《8.4 未来展望》将讨论世界模型、具身基础模型、具身 AGI 的未来方向。