7.1 遥操作数据采集:从人类示教到数据飞轮


文档摘要

7.1 遥操作数据采集:从人类示教到数据飞轮 VLA 模型的训练数据从哪来?答案是:人类手把手教机器人——这就是遥操作。它简单到像玩游戏,但要采到能训练出好模型的数据,背后有大量工程细节。 7.1.1 为什么需要遥操作 第 5 章讨论过,VLA 主要用行为克隆(BC)训练,需要大量「(图像, 指令, 动作)」三元组。这些数据从哪来? 数据源 | 规模 | 质量 | 成本 | 适用 遥操作(人类示教) | 万-百万条 | 高(真实任务执行) | 极高(人力 + 设备) | BC 主流 仿真 | 百万-亿条 | 中(域差) | 中 | 预训练、增强 互联网视频 | 亿级 | 低(无动作标签) | 低 | 预训练表征 自主探索(RL) | 视情况 | 中 | 高(算力 + 真机损耗) | RL

7.1 遥操作数据采集:从人类示教到数据飞轮

VLA 模型的训练数据从哪来?答案是:人类手把手教机器人——这就是遥操作。它简单到像玩游戏,但要采到能训练出好模型的数据,背后有大量工程细节。

7.1.1 为什么需要遥操作

第 5 章讨论过,VLA 主要用行为克隆(BC)训练,需要大量「(图像, 指令, 动作)」三元组。这些数据从哪来?

数据源 规模 质量 成本 适用
遥操作(人类示教) 万-百万条 高(真实任务执行) 极高(人力 + 设备) BC 主流
仿真 百万-亿条 中(域差) 预训练、增强
互联网视频 亿级 低(无动作标签) 预训练表征
自主探索(RL) 视情况 高(算力 + 真机损耗) RL 任务
跨本体聚合(Open X) 百万级 中高 共享 跨本体预训练

遥操作是当前 BC 训练最核心的数据来源——它是真实机器人在真实环境执行真实任务,质量最高。

7.1.2 遥操作的核心要求

好的遥操作数据要满足:

要求 描述
同步性 图像、力觉、动作的时间戳严格对齐(<10ms 偏差)
多样性 覆盖足够多的物体、场景、初始状态
质量 示教者执行任务成功(失败的也要标注,用于离线 RL)
自然性 动作流畅、符合人类直觉(避免生硬机械动作)
可扩展 采集效率高,单条成本低
跨操作者一致 不同人采集的数据风格一致

⚠️ 常被忽略的事实示教数据质量决定 VLA 上限。如果示教者动作粗糙、犹豫、错误,VLA 学出来的策略也会粗糙。数据采集人员需要培训,不是随便谁都能采到好数据。

7.1.3 主流遥操作方案

下面分别展开。

7.1.4 方案一:Leader-Follower(同构主从)

最经典也最直接的方案:用两个同构机器人,人操作「主端」(leader),「从端」(follower)跟随。

人手操作 leader 机械臂 → 实时位置/关节 → follower 机械臂 → 接触物体

记录 follower 的关节状态和外部观测,作为训练数据。

优势

  • 直观:人操作一个真实机械臂,所见即所得。
  • 高保真:主从同构,动作映射 1:1。
  • 力反馈:leader 端可加力反馈,人能感觉到接触。

劣势

  • 成本高:要两台机械臂。
  • 场地大:主从两套设备占空间。
  • 不能远程:操作员必须在设备旁。

代表:ALOHA 系统(Stanford),低成本双臂 leader-follower,推动了 2023-2024 年遥操作民主化。

7.1.5 方案二:VR 手柄(空间映射)

用 VR 手柄(如 Meta Quest 控制器)追踪人手位置,映射到机器人末端。

人手持 VR 手柄做动作 → VR 追踪手柄 6DoF 位姿 → 映射到机器人末端 → 执行

优势

  • 便宜:消费级 VR 设备几千元。
  • 便携:可以远程操作(人在 A 地,机器人在 B 地)。
  • 直观:手持操作符合直觉。

劣势

  • 无力反馈(标准 VR 手柄):人感觉不到接触。
  • 精度有限:VR 追踪精度 1cm 级。
  • 关节映射难:人手 6DoF 映射到 7DoF 机械臂有冗余。

代表:TCDM TeleMoMa、早期 OpenAI 的 HFH(Human Flourishing Hand)等。

7.1.6 方案三:动捕服(全身映射)

人穿动捕服做全身动作,映射到人形机器人。

人穿动捕服 → 全身关节捕捉 → 重定向到机器人 → 执行

优势

  • 全身映射:适合人形机器人(双手 + 双脚 + 躯干)。
  • 自然:人做人的动作。

劣势

  • 昂贵:专业动捕服几十万元。
  • 重定向难:人体 200+ DoF,人形机器人 30+ DoF,需要降维映射。
  • 物理不一致:人能做的动作机器人未必能(关节范围、力矩限制)。

代表:Figure、Tesla Optimus 等公司用人形遥操作数据采集。

7.1.7 方案四:Apple Vision Pro(MR 手势)

最新方案是用 Apple Vision Pro 等 MR 头显的手势追踪直接遥操作。

操作员戴 Vision Pro → 头显追踪双手 26 DoF → 映射到机器人灵巧手 → 执行

优势

  • 手势直接映射:无需手柄,最自然。
  • 手指级精度:26 DoF 手势够灵巧手用。
  • MR 沉浸感:操作员看到机器人视角的 3D 画面,沉浸感强。

劣势

  • 昂贵:Vision Pro 单台 3 万元+。
  • 生态封闭:开发接入复杂。
  • 无触觉反馈:操作员感觉不到接触。

代表:多家研究机构(如 Stanford、CMU)和公司(如 1X)用 Vision Pro 采集。

7.1.8 方案五:空间鼠标与触觉笔(低成本)

最便宜的方案:用空间鼠标(3Dconnexion SpaceMouse)或触觉笔操作。

优势

  • 极便宜:空间鼠标几千元。
  • 桌面级:不需要大场地。
  • 久经考验:工业远程操作(深海、太空)几十年验证。

劣势

  • 不直观:要训练才能熟练操作。
  • 维度有限:通常 6 DoF,难处理灵巧手。
  • :操作速度慢,单条数据成本高。

代表:早期的 OpenAI 抓取数据、很多学术实验室的快速原型。

7.1.9 方案对比

方案 成本 自由度 力反馈 远程 适合
Leader-Follower 高(2 台臂) 6-7 可有 双臂精细操作
VR 手柄 6 远程、低成本
动捕服 极高 全身 人形全身
Apple Vision Pro 26(手指) 灵巧手
空间鼠标 极低 6 部分 工业远程

💡 当前趋势VR + 灵巧手遥操作 是性价比最高的方案,被大多数研究机构采用。Vision Pro 等手势追踪 是新兴方向,正在快速迭代。Leader-Follower 仍是双臂精细操作的标杆(ALOHA 系统)。

7.1.10 遥操作的工程细节

采集高质量遥操作数据需要解决的工程问题:

时间同步

图像 30Hz、动作 100-1000Hz、力觉 500Hz——必须严格同步。常用方案:

  • 硬件触发:相机硬触发,所有传感器同步曝光。
  • 统一时间戳:所有数据带高精度时间戳,离线对齐。
  • 共享内存:高频数据通过共享内存传递,避免网络延迟。

动作平滑

人手抖动会引入噪声。处理:

  • 低通滤波:对原始动作信号做低通滤波。
  • 批处理:保留原始数据,训练时由模型自己平滑。
  • 不要过度平滑:会丢失快速接触事件。

失败标注

不是所有示教都成功。要:

  • 标注失败原因(碰不到、抓不起来、放下失败)。
  • 失败数据用于离线 RL(5.4 节),不要丢弃。
  • 质量分级:A 级(流畅)、B 级(犹豫但成功)、C 级(失败)。

多视角同步

遥操作通常多相机(头相机、手腕相机、外部相机):

  • 所有相机硬同步。
  • 内参外参标定准确(第 2.4 节)。
  • 同一时刻的多视角作为一条样本。

7.1.11 数据采集飞轮

生产级 VLA 公司(Physical Intelligence、Figure、1X)的数据采集是飞轮

这是 DAgger 思路(5.4 节)的工业化版本:

  1. 当前策略自主执行任务。
  2. 出错或困难时,人类遥操作介入纠正。
  3. 纠正数据加入训练集。
  4. 训练新策略,循环。

这种飞轮让数据集中在策略薄弱点——比纯随机采集效率高得多。这是当前 VLA 数据规模化的核心技术。

7.1.12 跨本体数据采集

Open X-Embodiment(Google + 21 个机构 2023)推动了一个理念:跨本体数据

不同机构的机器人(不同机械臂、不同相机配置、不同动作空间)采集的数据,统一为通用格式(RLDS、HuggingFace Hub)共享。一份 VLA 可以同时在多机器人上预训练。

这是「具身智能的 ImageNet 时刻」——一个共享的大规模数据集,让所有人都能训练更强的 VLA。Open X-Embodiment 包含 100 万+ episode、22 种机器人本体。

7.1.13 当前挑战

挑战 描述 应对
成本 一条数据 5-30 美元 自动化飞轮、共享数据
质量一致 不同人采的风格不同 培训、协议规范
多样性 容易过拟合采集环境 多场景、多物体
隐私 家庭场景含隐私 脱敏、合成数据替代
触觉缺失 大多遥操作无触觉记录 视触觉普及
跨本体 不同机器人数据格式异构 Open X 标准

⚠️ 现实判断:数据是当前具身智能最贵也最稀缺的资源。Physical Intelligence 据报道花了上亿美元采集数据,Open X-Embodiment 是 21 个机构联合才凑出 100 万 episode——相比之下,GPT-4 训练用了万亿 token。具身智能的数据规模要追上 LLM,还有数量级差距。

本节小结

  • 遥操作是 VLA 训练数据的核心来源,质量最高。
  • 五大主流方案:Leader-Follower(保真)、VR 手柄(低成本)、动捕服(人形全身)、Vision Pro(灵巧手)、空间鼠标(工业)。
  • 好的遥操作数据要同步、多样、高质量、自然、可扩展。
  • 工程挑战:时间同步、动作平滑、失败标注、多视角同步。
  • 数据采集飞轮(DAgger 工业化)让数据集中在策略薄弱点,效率最高。
  • Open X-Embodiment 推动跨本体数据共享,是「具身智能的 ImageNet 时刻」。
  • 数据是当前最稀缺资源,比 LLM 训练数据规模少数量级。

下一节《7.2 虚拟仿真环境》将讨论另一大数据来源——仿真平台。


发布者: 作者: 灏天文库 转发
评论区 (0)
U