8.3 评价体系与基准:具身智能的评测难题


文档摘要

8.3 评价体系与基准:具身智能的评测难题 「我的 VLA 比你的好」——怎么证明?在 NLP 有 GLUE/MMLU,在视觉有 ImageNet/COCO,但具身智能评测远比这复杂。一个任务的成功涉及感知、决策、控制、长程执行多个维度,标准化极难。 8.3.1 具身智能评测的根本难题 难题 | 描述 任务定义模糊 | 「叠衣服」成功的标准是什么? 环境开放 | 同一任务在不同环境难度差异大 硬件依赖 | 同一策略在不同机器人表现不同 长程任务 | 10 步任务「成功」要每步都成功 真机评测贵 | 一次评测消耗机器人时间和设备损耗 复现性差 | 不同实验室评测结果难以比较 这些难题让具身智能评测成为社区长期痛点。 8.3.

8.3 评价体系与基准:具身智能的评测难题

「我的 VLA 比你的好」——怎么证明?在 NLP 有 GLUE/MMLU,在视觉有 ImageNet/COCO,但具身智能评测远比这复杂。一个任务的成功涉及感知、决策、控制、长程执行多个维度,标准化极难。

8.3.1 具身智能评测的根本难题

难题 描述
任务定义模糊 「叠衣服」成功的标准是什么?
环境开放 同一任务在不同环境难度差异大
硬件依赖 同一策略在不同机器人表现不同
长程任务 10 步任务「成功」要每步都成功
真机评测贵 一次评测消耗机器人时间和设备损耗
复现性差 不同实验室评测结果难以比较

这些难题让具身智能评测成为社区长期痛点。

8.3.2 评测的三大层次

层次 优势 劣势
仿真评测 可复现、便宜、标准化 Reality Gap
真机评测 真实物理 贵、复现难
真实场景 终极检验 极贵、不可复现

8.3.3 主流仿真 Benchmark

CALVIN

CALVIN(Language-Conditioned Policy Learning)是长程操作任务基准:

  • 场景:桌面机械臂环境(Franka)。
  • 任务:推动方块、开关抽屉、转动开关等。
  • 特点:长程多任务( chained 5 个任务),评测组合泛化。
  • 指标:连续完成 5 个任务的成败。

CALVIN 是评测 VLA 长程任务能力的标准基准。

RoboCasa

RoboCasa(Robotic Casa, 2024):

  • 场景:仿真家庭场景(厨房、客厅)。
  • 任务:大规模日常操作(30+ 大类,1000+ 任务实例)。
  • 特点:场景丰富、任务多样、含 articulated 物体。
  • 指标:任务成功率、原子动作成功率。

RoboCasa 是当前最大的家庭场景仿真基准。

Habitat

Habitat(Meta):

  • 场景:真实扫描的 3D 室内场景(Matterport、Gibson)。
  • 任务:导航为主(PointNav、ObjectNav、ImageNav)。
  • 特点:高保真视觉、大规模场景。
  • 指标:导航成功率、路径效率。

Habitat 是导航 Agent 的标准基准,与操作基准(CALVIN/RoboCasa)互补。

LIBERO

LIBERO(Berkeley):

  • 四个任务套件(spatial、object、goal、long)。
  • 评测不同泛化维度(空间、物体、目标、长程)。
  • 设计精良,社区采用度高。

ManiSkill2/3

ManiSkill(UCSD/UCB):

  • 操作任务基准,含 articulated 物体。
  • 强调 GPU 并行评测。
  • 标准化指标和评测协议。

8.3.4 仿真 Benchmark 的局限

局限 描述
Reality Gap 仿真表现好 ≠ 真机好
任务设计偏差 仿真任务可能不代表真实任务
物体分布有限 仿真资产远少于真实世界
物理简化 接触、摩擦、变形简化

⚠️ 业界共识:仿真 benchmark 在论文中被广泛采用,但真机表现才是终极标准。一个在 CALVIN 上 SOTA 的策略,真机部署可能完全失败。读者看论文时要警惕「仿真 SOTA」与「真机可用」的差距。

8.3.5 真机评测的挑战

真机评测面临:

挑战 描述
昂贵 单次评测消耗设备和时间
不可复现 不同实验室设备状态不同
危险 错误可能损坏设备
比 GPU 评测慢数百倍
标准化难 不同实验室评测协议不一

真机评测的标准化尝试

  • 标准任务集:定义一组固定任务(如「把红方块放到蓝碗里」)。
  • 标准物体集:用统一的物体(如 YCB 物体集)。
  • 标准指标:成功率、完成时间、能量消耗。
  • 共享硬件:云机器人实验室(远程访问相同硬件)。

但这些标准化仍处于早期,社区尚未达成完全共识。

8.3.6 评测指标的多样性

任务成功率只是最基本指标,更全面的评测包括:

指标 含义
成功率 完成任务的比例
完成时间 完成任务的速度
路径效率 实际路径 / 最短路径
能量消耗 总能量
失败模式分布 失败在哪里(感知/规划/控制)
泛化能力 在新场景的退化程度
鲁棒性 在扰动下的稳定性
人机协作质量 主观打分
安全性 安全违规次数

单一指标(如成功率)会鼓励过拟合。多维度评测才能真实反映策略质量。

8.3.7 开放性评测难题

最难的评测是开放性任务——任务本身没有明确定义:

  • 「整理这个房间」:什么算整理好?
  • 「帮我做晚餐」:做什么菜?做多少?
  • 「让这里更舒适」:主观判断。

这类任务需要:

  • 人类评审:让人打分。
  • 过程指标:拆解为子任务分别评测。
  • 目标完成度:用 VLM 判断任务是否接近完成。

开放性评测是具身智能评测的真正前沿——它要求评测系统本身具备「理解任务」的能力。

8.3.8 LLM-as-Judge:用大模型评测

借鉴 LLM 的 LLM-as-Judge 思路,具身智能也开始用 VLM 做评测:

机器人执行任务 → 录制视频 → VLM 判断 "任务完成度如何?"

VLM 评测的优势:

  • 评测开放性任务。
  • 不需要人工标注。
  • 可大规模。

劣势:

  • VLM 自己有偏见。
  • 评测结果不可复现。
  • 评测能力受 VLM 限制。

VLM-as-Judge 是当前研究热点,但远未成熟。

8.3.9 真机评测的伦理

真机评测还涉及伦理:

  • 机器人伤害人:测试时万一伤人?
  • 设备损坏:错误动作损坏昂贵设备。
  • 测试数据隐私:测试场景可能含隐私。
  • 能耗与碳排放:大规模测试消耗能源。

这些让真机评测不仅是技术问题,也是社会问题。

8.3.10 当前评测的最佳实践

总结一套合理的具身智能评测实践:

  1. 多基准覆盖:不只看 CALVIN,要 CALVIN + RoboCasa + LIBERO。
  2. 真机验证必做:仿真 SOTA 不算数,至少小规模真机验证。
  3. 多指标评测:成功率 + 时间 + 能量 + 失败模式。
  4. 泛化专项:专门评测新物体、新场景的退化。
  5. 长程任务:评测多步任务的累积成功率。
  6. 开放报告:报告失败模式、限制、未覆盖场景。
  7. 复现努力:开源代码、模型、数据,便于复现。

8.3.11 评测的未来方向

方向 描述
统一标准 社区达成共识的标准协议
云机器人实验室 远程共享硬件,提升复现性
VLM-as-Judge 自动化开放任务评测
真实场景基准 标准化的家庭/工厂测试集
安全评测 专门的安全 violation 基准
持续评测 长期跟踪策略在真实部署的表现

本节小结

  • 具身智能评测面临任务模糊、环境开放、硬件依赖、长程任务、复现性等根本难题。
  • 三大层次:仿真评测(CALVIN/RoboCasa/Habitat)、真机评测、真实场景评测。
  • 仿真 benchmark 主流:CALVIN(长程)、RoboCasa(家庭)、Habitat(导航)、LIBERO(泛化)、ManiSkill(操作)。
  • 仿真 SOTA ≠ 真机可用,Reality Gap 让仿真评测有局限。
  • 真机评测昂贵、不可复现,标准化尝试在早期。
  • 多维度评测(成功率+时间+能量+失败模式)才能反映策略质量。
  • 开放性任务需要 VLM-as-Judge 或人类评审。
  • 评测最佳实践:多基准 + 真机验证 + 多指标 + 复现努力。

下一节《8.4 未来展望》将讨论世界模型、具身基础模型、具身 AGI 的未来方向。


发布者: 作者: 灏天文库 转发
评论区 (0)
U