7.4 数据引擎与具身基础模型:规模化数据与自动标注


文档摘要

7.4 数据引擎与具身基础模型:规模化数据与自动标注 单个实验室采几千条数据,撑不起一个通用 VLA。要追上 LLM 的规模,需要工业级数据引擎——自动标注、合成数据、跨机构共享、数据农场。这一节讲清数据规模化的全图景。 7.4.1 数据规模化的三大赛道 下面分别展开。 7.4.2 赛道一:真实数据共享 Open X-Embodiment Open X-Embodiment(Google DeepMind + 21 个机构 2023)是具身智能的「ImageNet 时刻」: 100 万+ episode 真实操作数据。 22 种机器人本体(机械臂、四足、人形等)。 500+ 技能、28000+ 任务。 统一格式(RLDS),开源在 HuggingFace。

7.4 数据引擎与具身基础模型:规模化数据与自动标注

单个实验室采几千条数据,撑不起一个通用 VLA。要追上 LLM 的规模,需要工业级数据引擎——自动标注、合成数据、跨机构共享、数据农场。这一节讲清数据规模化的全图景。

7.4.1 数据规模化的三大赛道

下面分别展开。

7.4.2 赛道一:真实数据共享

Open X-Embodiment

Open X-Embodiment(Google DeepMind + 21 个机构 2023)是具身智能的「ImageNet 时刻」:

  • 100 万+ episode 真实操作数据。
  • 22 种机器人本体(机械臂、四足、人形等)。
  • 500+ 技能、28000+ 任务。
  • 统一格式(RLDS),开源在 HuggingFace。

Open X 的意义

维度 Open X 之前 Open X 之后
数据规模 单机构几千-几万 跨机构百万
跨本体 各自为政 22 种本体统一
评测基准 不可比 标准化
复现性 数据可下载

Open X 让 RT-X、Octo、OpenVLA 等通用 VLA 成为可能——单机构数据不够,但聚合起来够了。

DROID

DROID(Distributed Robot Interaction Dataset, 2024)是另一个大规模真实操作数据集,由多个学术机构联合采集。特点:

  • 70 万+ episode。
  • 单一机器人平台(Franka)。
  • 多场景(厨房、办公室、实验室)。
  • 高质量多视角视频。

DROID 与 Open X 互补——Open X 强调跨本体,DROID 强调同本体多场景。

真实数据共享的挑战

挑战 描述
格式不统一 不同机构数据格式异构
质量参差 采集协议不一致
隐私问题 家庭场景含隐私
维护成本 大数据集持续维护
激励 机构为什么共享数据

Open X 通过统一格式(RLDS)和科研合作激励部分解决了这些,但跨机构共享仍是难题。

7.4.3 赛道二:合成数据生成

真实数据贵,合成数据便宜。合成数据(Synthetic Data) 用仿真 + 生成式模型大规模造数据。

仿真合成

第 7.2 节的仿真平台都能生成训练数据:

  • 大量随机场景、物体、初始状态。
  • 自动获取「完美标注」(深度图、语义分割、物体位姿)。
  • 频率可达真实数据的数千倍。

生成式模型合成

更新方向是用生成式 AI合成数据:

方法 思路
文本到图像扩散 用 Stable Diffusion 等生成多样化场景图像
图像编辑扩散 用 InstructPix2Pix 改物体、布局、纹理
3D 生成(DreamGaussian, Era3D) 文本到 3D 模型
视频生成(Sora 等) 文本到机器人操作视频
世界模型生成 学习世界模型,预测未来状态作为虚拟数据

RoboGen:LLM 自动生成任务

RoboGen(CMU 2023)让 LLM 自动提议任务、设计仿真、生成训练数据:

LLM 提议: "学会打开抽屉" ↓ LLM 生成仿真配置: 抽屉 + 机械臂 + 任务目标 ↓ 仿真器自动生成场景 ↓ RL 训练 + 验证 ↓ 成功的策略加入技能库

这是「LLM 提议 + 自动验证」的合成数据生成范式,被认为是规模化扩充机器人技能的方向。

合成数据的价值与局限

价值 局限
规模无限(仿真) Reality Gap
完美标注 仿真物体分布有限
可控、可重现 生成式模型可能产生不真实数据
极低单位成本 与真实数据混合比例难调

💡 当前最佳实践:仿真数据用于预训练,真实数据用于微调。预训练让模型学到通用表征,微调让模型适应真实分布。这是「ImageNet 预训练 + 下游微调」思路在机器人的延伸。

7.4.4 赛道三:自动化数据采集

最前沿的方向是让机器人自主采集数据,减少人力依赖。

数据农场(Data Farming)

让大量机器人在仿真 + 真实场景中 24/7 自主运行,采集失败和成功的数据:

  • 100 个机器人 × 24 小时 = 2400 机器人小时/天。
  • 自动标注(任务成功检测)。
  • 数据自动归档、清洗。

Physical Intelligence、Figure、1X 都在建这样的「数据农场」。这是把数据采集从「实验室手工」变成「工厂流水线」的范式转变。

自监督学习

让机器人自主探索,用自监督信号学习:

信号 学习目标
时间一致性 同一物体不同帧应识别为同物
多视角一致性 多相机看同一场景
物理一致性 物体不能穿透、不能悬空
可执行性 哪些动作能改变世界

自监督不需要人类标注,可大规模扩展。

自主探索 + RL

让机器人在仿真或真机自主探索,用 RL 学习。OpenAI Dactyl、四足机器人 ANYmal 等都是这条路线。但真机 RL 成本高,多在仿真 + Sim-to-Real。

主动学习

让机器人选择学习什么:

  • 评估当前策略的不确定性。
  • 主动请求标注/示教最不确定的样本。
  • 减少总标注量。

这是把数据采集从被动转为主动——只采集最有价值的样本。

7.4.5 跨本体学习的原理

为什么跨本体数据有效?核心是抽象

不同机器人本体的低层细节(关节角、电机力矩)不同,但高层语义(「接近物体」「抓取」「移动」)是共享的。VLA 通过:

  • 视觉编码器学到通用视觉表征。
  • 语言编码器学到通用语义。
  • 动作头本体特定(或本体条件化)。

学到的视觉和语义表征可以跨本体迁移,让每个本体不需要从零学。

本体条件化(Embodiment Conditioning)

让 VLA 接收一个「本体标识」作为输入:

图像 + 指令 + 本体ID → VLA → 动作

不同本体用不同 ID,VLA 学会根据本体调整动作输出。Octo、OpenVLA 都用类似机制。

动作空间标准化

Open X 把不同本体的动作空间映射到一个标准化动作空间(如末端位姿 + 夹爪开合):

  • 不同机械臂的关节空间不同,但末端位姿统一。
  • 末端位姿 + 本体运动学逆解 = 关节动作。

这让跨本体训练可行。

7.4.6 数据引擎的工程架构

一个生产级数据引擎的完整架构:

每个环节都需要工程化:

  • 采集:多渠道(遥操作 + 自主 + 农场)。
  • 处理:自动清洗、标注、验证。
  • 存储:分层(原始 + 结构化)。
  • 使用:版本化、可追溯。

7.4.7 数据质量评估

数据多了不等于数据好。数据质量评估是关键:

维度 评估方法
多样性 物体、场景、初始状态分布
平衡性 各任务/技能数据量是否均衡
成功率 示教是否成功
自然度 动作是否流畅
同步性 时间戳对齐程度
标注质量 标签准确性

低质量数据不仅没用,还可能损害模型。数据质量比数量更重要。

7.4.8 具身基础模型

把所有上述能力综合,目标是训练一个具身基础模型(Embodied Foundation Model)

  • 跨本体(22+ 机器人形态)。
  • 跨任务(数百-数千技能)。
  • 跨场景(家庭、办公、工厂)。
  • 可微调到新任务/新本体(少样本)。
  • 具备语言理解(开放词汇指令)。
  • 可持续进化(数据飞轮)。

这相当于 LLM 中的 GPT-4——一个通用底座,下游任务少量微调即可。

当前进展(2026)

模型 规模 数据 特点
RT-X 基于 RT-2 Open X 跨本体泛化
Octo 93M Open X 开源通用
OpenVLA 7B Open X 开源 SOTA
π0 3B+ 私有大数据 工业级复杂任务
RDT 1B 双臂数据 双臂专精
各种行业模型 数 B - 数十 B 行业数据 垂直优化

7.4.9 数据飞轮的终极形态

把所有要素综合,具身智能公司的终极数据飞轮:

这个飞轮的关键:

  1. 部署规模:机器人越多,数据越多。
  2. 失败采集:失败比成功更有价值(暴露薄弱点)。
  3. 人类介入:困难样本人类纠正,质量最高。
  4. 持续训练:模型持续进化。

Physical Intelligence、Figure、Tesla Optimus 等公司都在建这样的飞轮,这也是为什么这些公司估值极高——数据飞轮是真正的护城河。

7.4.10 数据规模化的伦理与隐私

数据规模化也带来伦理问题:

问题 描述
隐私 家庭场景采集含隐私信息
劳动 数据采集员工作条件
集中 大公司垄断数据
偏见 数据集偏向特定文化/场景
安全 数据含敏感信息(如家庭布局)

Open X 等开放数据集部分缓解了集中问题,但隐私、劳动、偏见仍是社区需要长期面对的议题。

本节小结

  • 数据规模化三大赛道:真实数据共享(Open X/DROID)、合成数据生成(仿真 + 生成式 AI)、自动化采集(数据农场)。
  • Open X-Embodiment 是「具身智能 ImageNet 时刻」,100 万+ episode、22 种本体。
  • 合成数据用仿真 + LLM 提议(RoboGen)大规模生成,但 Reality Gap 仍在。
  • 数据农场让大量机器人 24/7 自主采集,是工业级方向。
  • 跨本体学习通过视觉/语义抽象 + 本体条件化实现。
  • 数据引擎完整架构:采集 → 处理 → 存储 → 使用,每环工程化。
  • 数据质量比数量更重要,需多维度评估。
  • 具身基础模型是终极目标,类比 LLM 的 GPT-4。
  • 数据飞轮(部署 → 失败采集 → 纠正 → 训练)是大公司核心护城河。
  • 隐私、劳动、集中、偏见是数据规模化的伦理议题。

至此第 7 章结束。你已经理解了具身智能的「进化」层:遥操作(7.1)、仿真(7.2)、Sim-to-Real(7.3)、数据规模化(7.4)。下一章《第 8 章 综合案例、挑战与未来展望》将把前 7 章整合到真实系统,并直面落地挑战。


发布者: 作者: 灏天文库 转发
评论区 (0)
U