5.3 代表性 VLA 模型谱系:从 RT-1/RT-2 到 Octo/π0/OpenVLA


文档摘要

5.3 代表性 VLA 模型谱系:从 RT-1/RT-2 到 Octo/π0/OpenVLA VLA 领域过去三年发展速度堪比大语言模型。从 2022 年 RT-1 到 2024 年 π0,模型架构、数据规模、泛化能力都发生了数量级的跃迁。本节梳理这条演进线。 5.3.1 VLA 模型演进时间线 下面挑选 6 个最具代表性的模型深入剖析。 5.3.2 RT-1:VLA 的开山之作 RT-1(Robotics Transformer 1, Google 2022)是首个大规模端到端机器人 Transformer。虽然不严格是「VLA」(语言指令只是分类输入),但它奠定了 VLA 的工程基础。

5.3 代表性 VLA 模型谱系:从 RT-1/RT-2 到 Octo/π0/OpenVLA

VLA 领域过去三年发展速度堪比大语言模型。从 2022 年 RT-1 到 2024 年 π0,模型架构、数据规模、泛化能力都发生了数量级的跃迁。本节梳理这条演进线。

5.3.1 VLA 模型演进时间线

下面挑选 6 个最具代表性的模型深入剖析。

5.3.2 RT-1:VLA 的开山之作

RT-1(Robotics Transformer 1, Google 2022)是首个大规模端到端机器人 Transformer。虽然不严格是「VLA」(语言指令只是分类输入),但它奠定了 VLA 的工程基础。

架构

图像 (640×640) → ViT → 81 tokens 指令文本 → 语言 tokenizer → 语言 tokens [视觉 + 语言 tokens] → Transformer (35M 参数) → 动作 token

输出动作:11 维(7 关节 + 1 夹爪 + 3 个终止/位移),离散化为 256 bin 的 token。

数据

13 万条真实机器人 episode,每条包含图像、指令、动作三元组。这是当时最大规模的真实操作数据集。

贡献

  • 证明 Transformer 端到端策略在大规模真实数据上可行。
  • 动作 token 化范式被后续 RT-2、OpenVLA 继承。
  • 提出了大量工程经验(数据增强、动作平滑等)。

5.3.3 RT-2:VLA 的真正诞生

RT-2(Google DeepMind 2023.07)是真正意义上的第一个 VLA——它把视觉-语言模型(VLM)和机器人动作统一进一个模型。

核心创新:动作 token 化

把动作离散化为 token,与文本 token 共享词表:

原 VLM 词表: [BPE tokens, ~32000] 新 VLA 词表: [BPE tokens, ~32000] + [256 action tokens]

这样动作 token 与文本 token 在 Transformer 中无差别处理。模型可以同时输出文本(回答问题)和动作(执行任务)。

训练:协同微调

预训练 VLM (PaLM-E / PaLI-X) 在互联网图文数据 ↓ 协同微调 (Co-finetuning) 机器人数据 (RT-1 数据 + 网络数据) ↓ 得到 RT-2 模型

协同微调的关键:机器人和网络数据混合训练,让模型同时保留语言推理与机器人执行能力。

重大意义:涌现的语义泛化

RT-2 展示了惊人的语义泛化:

  • 给从未见过的物体(如「恐龙玩具」),仍能执行「把它移动到 XX」指令。
  • 能理解复合指令(「把草莓放进碗里」vs「把草莓放进盘里」)。
  • 能从语言推理出动作(理解「不烫」的物体才抓)。

这些能力不是直接训练得到的,而是从 LLM 的语言能力涌现出来——类似 GPT-3 从规模涌现少样本能力。RT-2 证明了 VLA = LLM + 机器人数据 的范式可行。

局限

  • 模型巨大(540B 参数版),推理慢。
  • 数据规模仍有限(不到 RT-1 的 2 倍)。
  • 单步自回归动作生成,建模多模态动作弱。

5.3.4 Octo:开源通用机器人策略

Octo(Berkeley 2023.10)是开源通用机器人策略的代表。与 RT-2 的「VLM + 机器人」不同,Octo 走「纯机器人基础模型」路线。

核心思想:通用策略

不依赖 LLM 预训练,从零开始训练一个机器人基础模型

  • 在 Open X-Embodiment 数据集(80 万+ episode,多种机器人形态)上预训练。
  • 用 diffusion 动作头处理多本体、多任务、多模态动作。
  • 输入:图像 + 任务 token(语言或目标图像)。

关键创新:扩散动作头 + Transformer 主干

Octo 用 Transformer 主干 + diffusion 动作头,处理多种机器人本体的不同动作空间(机械臂、四足、移动机器人)。

微调范式

Octo 设计为「预训练 + 下游微调」:

  • 预训练:在大规模跨本体数据上学通用表征。
  • 微调:在特定任务/本体的少量数据(10-100 条)上微调。

这是「机器人领域的 BERT/GPT 时刻」——一个通用预训练模型,下游任务少量数据微调即可。

贡献

  • 完全开源(模型权重、训练代码、数据)。
  • 证明跨本体预训练可行(一个模型控制多种机器人)。
  • 推动 Open X-Embodiment 成为社区标准。

5.3.5 OpenVLA:开源 7B 通用 VLA

OpenVLA(Stanford + Berkeley 2024.05)是当前最重要的开源 VLA 之一。它的目标是「开源 RT-2」。

架构

图像 → SigLIP 视觉编码器(384 tokens) 语言指令 → Llama 2 tokenizer [视觉 + 语言 + 本体感觉 tokens] → Llama 2 7B 主干 → 动作 token

7B 参数,使用 RT-2 的动作 token 化范式(256 bin × 动作维度)。

训练

在 Open X-Embodiment 子集(97 万 episode)上从零训练,约 600 GPU 天。

关键特性

  • 完全开源:权重 + 训练数据 + 代码 + 评测。
  • 可微调:支持 LoRA 微调到新任务。
  • 量化部署:支持 4-bit 量化,可在消费级 GPU 推理。
  • 跨本体:训练数据涵盖多机器人形态。

贡献

  • 让学术界能复现 RT-2 级别的能力。
  • 提供完整开源工具链,加速 VLA 研究民主化。
  • 成为后续开源 VLA 的基准(如 π0-FAST、RDT-1B 等都以 OpenVLA 为对比)。

5.3.6 π0:Physical Intelligence 的工业级 VLA

π0(Physical Intelligence 2024.10)是工业级 VLA 的代表,由 OpenAI 前 Robotics 团队核心成员创立。

架构

图像 → SigLIP 视觉编码器 语言 → PaliGemma 3B tokenizer [视觉 + 语言 + 本体感觉] → PaliGemma 3B 主干 → Flow Matching 动作头

关键差异:Flow Matching 动作头

π0 用 Flow Matching(5.2 节)作为动作头,相比 RT-2/OpenVLA 的离散 token 化,推理速度快、多模态能力强。

训练数据:跨本体大规模

  • 1 万+ 小时遥操作数据(自家采集)。
  • 涵盖多种机器人本体(单臂、双臂、人形)。
  • 任务涵盖折叠衣物、装袋、组装、烹饪等。

工程突破:复杂长程任务

π0 demo 展示了惊人的能力:

  • 折叠衣物(多步、非刚性物体)。
  • 装袋(接触丰富、几何复杂)。
  • 组装(精确对位、力控)。
  • 烹饪(多阶段、多物体)。

这些任务都是传统方法难以处理的,π0 展示了 VLA 在复杂长程任务上的潜力。

商业意义

π0 让 Physical Intelligence 成为估值数十亿美元的具身智能独角兽,证明 VLA 的商业可行性。

5.3.7 RDT:双臂 Diffusion Transformer

RDT(Real Dual-Arm Diffusion Transformer, 清华 2024.12)专注双臂操作,是中国团队的代表工作。

创新点

  • 双臂动作空间统一:处理 14+ 维双臂动作。
  • Diffusion Transformer 主干:扩散策略 + Transformer。
  • 大规模预训练:在双臂数据上预训练。

意义

证明中国团队在 VLA 前沿具备竞争力,双臂操作(人形核心场景)有专门优化。

5.3.8 VLA 模型对比表

模型 主干 动作头 数据规模 参数量 开源 特色
RT-1 Transformer 离散 token 13 万 ep 35M 开山之作
RT-2 PaLI-X/PaLM-E 离散 token 13 万 + 网络 5B-540B VLA 真正诞生
Octo Transformer Diffusion 80 万+ (OpenX) ~93M 通用开源策略
OpenVLA Llama 2 7B 离散 token 97 万 (OpenX) 7B 开源 SOTA
π0 PaliGemma 3B Flow Matching 10K+ 小时(私) 3B+ 工业级复杂任务
RDT DiT Diffusion 双臂数据 1B 双臂专精

5.3.9 VLA 演进的三大趋势

从这条演进线可以看出三大趋势:

趋势一:从专一到通用

  • RT-1:单一机器人、有限任务。
  • RT-2:保留 LLM 语义泛化。
  • Octo/OpenVLA:跨本体、跨任务。
  • π0:复杂长程任务。

VLA 朝着「通用机器人策略」演进。

趋势二:动作头从离散到连续

  • RT-1/RT-2/OpenVLA:离散 token 化(兼容 LLM)。
  • Octo/π0/RDT:扩散/Flow(连续,多模态强)。

离散便于复用 LLM 训练,连续更适合动作分布建模。两条路线并存。

趋势三:从封闭到开源

  • RT-1/RT-2/π0:闭源,公司独占。
  • Octo/OpenVLA/RDT:完全开源。

开源 VLA 让学术界能复现前沿,加速整体进步。

5.3.10 当前 VLA 的局限

尽管 VLA 进步神速,仍有显著局限:

局限 描述 当前应对
数据稀缺 真实操作数据 << 互联网图文 遥操作 + 仿真 + 跨本体聚合
泛化边界 陌生场景/物体仍失败 大规模预训练 + 微调
延迟 大 VLA 推理慢 量化、蒸馏、专用硬件
可解释性 黑盒,出错难诊断 注意力可视化(有限)
长程任务 数十步以上易失败 分层 + 记忆(第 4 章)
力控精度 VLA 输出动作,力控不直接 力反馈作为输入 + 阻抗控制
安全保证 难证明安全 安全过滤层 + 物理约束

💡 现实判断:截至 2026 年,VLA 在**结构化任务(抓取、放置、简单装配)已接近实用,但复杂精细任务(外科级装配、烹饪)**仍需大量工作。VLA 不是万能药,而是机器人智能拼图的关键一块。

本节小结

  • VLA 演进可分三个阶段:RT-1(奠基)、RT-2(VLA 诞生)、Octo/π0/OpenVLA(开源与商业化)。
  • RT-2 的核心是动作 token 化 + 协同微调,让 LLM 涌现机器人能力。
  • Octo 走通用基础模型路线,开源 + 跨本体 + diffusion 动作头。
  • OpenVLA 是开源 7B VLA 标杆,让学术界能复现 RT-2 级别能力。
  • π0 用 Flow Matching + 大规模跨本数据,展示工业级复杂任务能力。
  • RDT 等双臂 VLA 专注人形场景。
  • 三大趋势:专一到通用、离散到连续、封闭到开源。
  • VLA 当前局限在数据稀缺、泛化边界、延迟、可解释、长程、力控、安全。

下一节《5.4 策略学习范式 BC 与离线 RL》将讨论 VLA 怎么训练——行为克隆、模仿学习、离线强化学习的原理与取舍。


发布者: 作者: 灏天文库 转发
评论区 (0)
U