7.1 遥操作数据采集:从人类示教到数据飞轮 VLA 模型的训练数据从哪来?答案是:人类手把手教机器人——这就是遥操作。它简单到像玩游戏,但要采到能训练出好模型的数据,背后有大量工程细节。 7.1.1 为什么需要遥操作 第 5 章讨论过,VLA 主要用行为克隆(BC)训练,需要大量「(图像, 指令, 动作)」三元组。这些数据从哪来? 数据源 | 规模 | 质量 | 成本 | 适用 遥操作(人类示教) | 万-百万条 | 高(真实任务执行) | 极高(人力 + 设备) | BC 主流 仿真 | 百万-亿条 | 中(域差) | 中 | 预训练、增强 互联网视频 | 亿级 | 低(无动作标签) | 低 | 预训练表征 自主探索(RL) | 视情况 | 中 | 高(算力 + 真机损耗) | RL
VLA 模型的训练数据从哪来?答案是:人类手把手教机器人——这就是遥操作。它简单到像玩游戏,但要采到能训练出好模型的数据,背后有大量工程细节。
第 5 章讨论过,VLA 主要用行为克隆(BC)训练,需要大量「(图像, 指令, 动作)」三元组。这些数据从哪来?
| 数据源 | 规模 | 质量 | 成本 | 适用 |
|---|---|---|---|---|
| 遥操作(人类示教) | 万-百万条 | 高(真实任务执行) | 极高(人力 + 设备) | BC 主流 |
| 仿真 | 百万-亿条 | 中(域差) | 中 | 预训练、增强 |
| 互联网视频 | 亿级 | 低(无动作标签) | 低 | 预训练表征 |
| 自主探索(RL) | 视情况 | 中 | 高(算力 + 真机损耗) | RL 任务 |
| 跨本体聚合(Open X) | 百万级 | 中高 | 共享 | 跨本体预训练 |
遥操作是当前 BC 训练最核心的数据来源——它是真实机器人在真实环境执行真实任务,质量最高。
好的遥操作数据要满足:
| 要求 | 描述 |
|---|---|
| 同步性 | 图像、力觉、动作的时间戳严格对齐(<10ms 偏差) |
| 多样性 | 覆盖足够多的物体、场景、初始状态 |
| 质量 | 示教者执行任务成功(失败的也要标注,用于离线 RL) |
| 自然性 | 动作流畅、符合人类直觉(避免生硬机械动作) |
| 可扩展 | 采集效率高,单条成本低 |
| 跨操作者一致 | 不同人采集的数据风格一致 |
⚠️ 常被忽略的事实:示教数据质量决定 VLA 上限。如果示教者动作粗糙、犹豫、错误,VLA 学出来的策略也会粗糙。数据采集人员需要培训,不是随便谁都能采到好数据。
下面分别展开。
最经典也最直接的方案:用两个同构机器人,人操作「主端」(leader),「从端」(follower)跟随。
人手操作 leader 机械臂 → 实时位置/关节 → follower 机械臂 → 接触物体
记录 follower 的关节状态和外部观测,作为训练数据。
代表:ALOHA 系统(Stanford),低成本双臂 leader-follower,推动了 2023-2024 年遥操作民主化。
用 VR 手柄(如 Meta Quest 控制器)追踪人手位置,映射到机器人末端。
人手持 VR 手柄做动作 → VR 追踪手柄 6DoF 位姿 → 映射到机器人末端 → 执行
代表:TCDM TeleMoMa、早期 OpenAI 的 HFH(Human Flourishing Hand)等。
人穿动捕服做全身动作,映射到人形机器人。
人穿动捕服 → 全身关节捕捉 → 重定向到机器人 → 执行
代表:Figure、Tesla Optimus 等公司用人形遥操作数据采集。
最新方案是用 Apple Vision Pro 等 MR 头显的手势追踪直接遥操作。
操作员戴 Vision Pro → 头显追踪双手 26 DoF → 映射到机器人灵巧手 → 执行
代表:多家研究机构(如 Stanford、CMU)和公司(如 1X)用 Vision Pro 采集。
最便宜的方案:用空间鼠标(3Dconnexion SpaceMouse)或触觉笔操作。
代表:早期的 OpenAI 抓取数据、很多学术实验室的快速原型。
| 方案 | 成本 | 自由度 | 力反馈 | 远程 | 适合 |
|---|---|---|---|---|---|
| Leader-Follower | 高(2 台臂) | 6-7 | 可有 | 否 | 双臂精细操作 |
| VR 手柄 | 低 | 6 | 否 | 是 | 远程、低成本 |
| 动捕服 | 极高 | 全身 | 否 | 是 | 人形全身 |
| Apple Vision Pro | 中 | 26(手指) | 否 | 是 | 灵巧手 |
| 空间鼠标 | 极低 | 6 | 部分 | 是 | 工业远程 |
💡 当前趋势:VR + 灵巧手遥操作 是性价比最高的方案,被大多数研究机构采用。Vision Pro 等手势追踪 是新兴方向,正在快速迭代。Leader-Follower 仍是双臂精细操作的标杆(ALOHA 系统)。
采集高质量遥操作数据需要解决的工程问题:
图像 30Hz、动作 100-1000Hz、力觉 500Hz——必须严格同步。常用方案:
人手抖动会引入噪声。处理:
不是所有示教都成功。要:
遥操作通常多相机(头相机、手腕相机、外部相机):
生产级 VLA 公司(Physical Intelligence、Figure、1X)的数据采集是飞轮:
这是 DAgger 思路(5.4 节)的工业化版本:
这种飞轮让数据集中在策略薄弱点——比纯随机采集效率高得多。这是当前 VLA 数据规模化的核心技术。
Open X-Embodiment(Google + 21 个机构 2023)推动了一个理念:跨本体数据。
不同机构的机器人(不同机械臂、不同相机配置、不同动作空间)采集的数据,统一为通用格式(RLDS、HuggingFace Hub)共享。一份 VLA 可以同时在多机器人上预训练。
这是「具身智能的 ImageNet 时刻」——一个共享的大规模数据集,让所有人都能训练更强的 VLA。Open X-Embodiment 包含 100 万+ episode、22 种机器人本体。
| 挑战 | 描述 | 应对 |
|---|---|---|
| 成本 | 一条数据 5-30 美元 | 自动化飞轮、共享数据 |
| 质量一致 | 不同人采的风格不同 | 培训、协议规范 |
| 多样性 | 容易过拟合采集环境 | 多场景、多物体 |
| 隐私 | 家庭场景含隐私 | 脱敏、合成数据替代 |
| 触觉缺失 | 大多遥操作无触觉记录 | 视触觉普及 |
| 跨本体 | 不同机器人数据格式异构 | Open X 标准 |
⚠️ 现实判断:数据是当前具身智能最贵也最稀缺的资源。Physical Intelligence 据报道花了上亿美元采集数据,Open X-Embodiment 是 21 个机构联合才凑出 100 万 episode——相比之下,GPT-4 训练用了万亿 token。具身智能的数据规模要追上 LLM,还有数量级差距。
下一节《7.2 虚拟仿真环境》将讨论另一大数据来源——仿真平台。