7.4 数据引擎与具身基础模型:规模化数据与自动标注 单个实验室采几千条数据,撑不起一个通用 VLA。要追上 LLM 的规模,需要工业级数据引擎——自动标注、合成数据、跨机构共享、数据农场。这一节讲清数据规模化的全图景。 7.4.1 数据规模化的三大赛道 下面分别展开。 7.4.2 赛道一:真实数据共享 Open X-Embodiment Open X-Embodiment(Google DeepMind + 21 个机构 2023)是具身智能的「ImageNet 时刻」: 100 万+ episode 真实操作数据。 22 种机器人本体(机械臂、四足、人形等)。 500+ 技能、28000+ 任务。 统一格式(RLDS),开源在 HuggingFace。
单个实验室采几千条数据,撑不起一个通用 VLA。要追上 LLM 的规模,需要工业级数据引擎——自动标注、合成数据、跨机构共享、数据农场。这一节讲清数据规模化的全图景。
下面分别展开。
Open X-Embodiment(Google DeepMind + 21 个机构 2023)是具身智能的「ImageNet 时刻」:
| 维度 | Open X 之前 | Open X 之后 |
|---|---|---|
| 数据规模 | 单机构几千-几万 | 跨机构百万 |
| 跨本体 | 各自为政 | 22 种本体统一 |
| 评测基准 | 不可比 | 标准化 |
| 复现性 | 难 | 数据可下载 |
Open X 让 RT-X、Octo、OpenVLA 等通用 VLA 成为可能——单机构数据不够,但聚合起来够了。
DROID(Distributed Robot Interaction Dataset, 2024)是另一个大规模真实操作数据集,由多个学术机构联合采集。特点:
DROID 与 Open X 互补——Open X 强调跨本体,DROID 强调同本体多场景。
| 挑战 | 描述 |
|---|---|
| 格式不统一 | 不同机构数据格式异构 |
| 质量参差 | 采集协议不一致 |
| 隐私问题 | 家庭场景含隐私 |
| 维护成本 | 大数据集持续维护 |
| 激励 | 机构为什么共享数据 |
Open X 通过统一格式(RLDS)和科研合作激励部分解决了这些,但跨机构共享仍是难题。
真实数据贵,合成数据便宜。合成数据(Synthetic Data) 用仿真 + 生成式模型大规模造数据。
第 7.2 节的仿真平台都能生成训练数据:
更新方向是用生成式 AI合成数据:
| 方法 | 思路 |
|---|---|
| 文本到图像扩散 | 用 Stable Diffusion 等生成多样化场景图像 |
| 图像编辑扩散 | 用 InstructPix2Pix 改物体、布局、纹理 |
| 3D 生成(DreamGaussian, Era3D) | 文本到 3D 模型 |
| 视频生成(Sora 等) | 文本到机器人操作视频 |
| 世界模型生成 | 学习世界模型,预测未来状态作为虚拟数据 |
RoboGen(CMU 2023)让 LLM 自动提议任务、设计仿真、生成训练数据:
LLM 提议: "学会打开抽屉" ↓ LLM 生成仿真配置: 抽屉 + 机械臂 + 任务目标 ↓ 仿真器自动生成场景 ↓ RL 训练 + 验证 ↓ 成功的策略加入技能库
这是「LLM 提议 + 自动验证」的合成数据生成范式,被认为是规模化扩充机器人技能的方向。
| 价值 | 局限 |
|---|---|
| 规模无限(仿真) | Reality Gap |
| 完美标注 | 仿真物体分布有限 |
| 可控、可重现 | 生成式模型可能产生不真实数据 |
| 极低单位成本 | 与真实数据混合比例难调 |
💡 当前最佳实践:仿真数据用于预训练,真实数据用于微调。预训练让模型学到通用表征,微调让模型适应真实分布。这是「ImageNet 预训练 + 下游微调」思路在机器人的延伸。
最前沿的方向是让机器人自主采集数据,减少人力依赖。
让大量机器人在仿真 + 真实场景中 24/7 自主运行,采集失败和成功的数据:
Physical Intelligence、Figure、1X 都在建这样的「数据农场」。这是把数据采集从「实验室手工」变成「工厂流水线」的范式转变。
让机器人自主探索,用自监督信号学习:
| 信号 | 学习目标 |
|---|---|
| 时间一致性 | 同一物体不同帧应识别为同物 |
| 多视角一致性 | 多相机看同一场景 |
| 物理一致性 | 物体不能穿透、不能悬空 |
| 可执行性 | 哪些动作能改变世界 |
自监督不需要人类标注,可大规模扩展。
让机器人在仿真或真机自主探索,用 RL 学习。OpenAI Dactyl、四足机器人 ANYmal 等都是这条路线。但真机 RL 成本高,多在仿真 + Sim-to-Real。
让机器人选择学习什么:
这是把数据采集从被动转为主动——只采集最有价值的样本。
为什么跨本体数据有效?核心是抽象。
不同机器人本体的低层细节(关节角、电机力矩)不同,但高层语义(「接近物体」「抓取」「移动」)是共享的。VLA 通过:
学到的视觉和语义表征可以跨本体迁移,让每个本体不需要从零学。
让 VLA 接收一个「本体标识」作为输入:
图像 + 指令 + 本体ID → VLA → 动作
不同本体用不同 ID,VLA 学会根据本体调整动作输出。Octo、OpenVLA 都用类似机制。
Open X 把不同本体的动作空间映射到一个标准化动作空间(如末端位姿 + 夹爪开合):
这让跨本体训练可行。
一个生产级数据引擎的完整架构:
每个环节都需要工程化:
数据多了不等于数据好。数据质量评估是关键:
| 维度 | 评估方法 |
|---|---|
| 多样性 | 物体、场景、初始状态分布 |
| 平衡性 | 各任务/技能数据量是否均衡 |
| 成功率 | 示教是否成功 |
| 自然度 | 动作是否流畅 |
| 同步性 | 时间戳对齐程度 |
| 标注质量 | 标签准确性 |
低质量数据不仅没用,还可能损害模型。数据质量比数量更重要。
把所有上述能力综合,目标是训练一个具身基础模型(Embodied Foundation Model):
这相当于 LLM 中的 GPT-4——一个通用底座,下游任务少量微调即可。
| 模型 | 规模 | 数据 | 特点 |
|---|---|---|---|
| RT-X | 基于 RT-2 | Open X | 跨本体泛化 |
| Octo | 93M | Open X | 开源通用 |
| OpenVLA | 7B | Open X | 开源 SOTA |
| π0 | 3B+ | 私有大数据 | 工业级复杂任务 |
| RDT | 1B | 双臂数据 | 双臂专精 |
| 各种行业模型 | 数 B - 数十 B | 行业数据 | 垂直优化 |
把所有要素综合,具身智能公司的终极数据飞轮:
这个飞轮的关键:
Physical Intelligence、Figure、Tesla Optimus 等公司都在建这样的飞轮,这也是为什么这些公司估值极高——数据飞轮是真正的护城河。
数据规模化也带来伦理问题:
| 问题 | 描述 |
|---|---|
| 隐私 | 家庭场景采集含隐私信息 |
| 劳动 | 数据采集员工作条件 |
| 集中 | 大公司垄断数据 |
| 偏见 | 数据集偏向特定文化/场景 |
| 安全 | 数据含敏感信息(如家庭布局) |
Open X 等开放数据集部分缓解了集中问题,但隐私、劳动、偏见仍是社区需要长期面对的议题。
至此第 7 章结束。你已经理解了具身智能的「进化」层:遥操作(7.1)、仿真(7.2)、Sim-to-Real(7.3)、数据规模化(7.4)。下一章《第 8 章 综合案例、挑战与未来展望》将把前 7 章整合到真实系统,并直面落地挑战。