5.3 代表性 VLA 模型谱系:从 RT-1/RT-2 到 Octo/π0/OpenVLA VLA 领域过去三年发展速度堪比大语言模型。从 2022 年 RT-1 到 2024 年 π0,模型架构、数据规模、泛化能力都发生了数量级的跃迁。本节梳理这条演进线。 5.3.1 VLA 模型演进时间线 下面挑选 6 个最具代表性的模型深入剖析。 5.3.2 RT-1:VLA 的开山之作 RT-1(Robotics Transformer 1, Google 2022)是首个大规模端到端机器人 Transformer。虽然不严格是「VLA」(语言指令只是分类输入),但它奠定了 VLA 的工程基础。
VLA 领域过去三年发展速度堪比大语言模型。从 2022 年 RT-1 到 2024 年 π0,模型架构、数据规模、泛化能力都发生了数量级的跃迁。本节梳理这条演进线。
下面挑选 6 个最具代表性的模型深入剖析。
RT-1(Robotics Transformer 1, Google 2022)是首个大规模端到端机器人 Transformer。虽然不严格是「VLA」(语言指令只是分类输入),但它奠定了 VLA 的工程基础。
图像 (640×640) → ViT → 81 tokens 指令文本 → 语言 tokenizer → 语言 tokens [视觉 + 语言 tokens] → Transformer (35M 参数) → 动作 token
输出动作:11 维(7 关节 + 1 夹爪 + 3 个终止/位移),离散化为 256 bin 的 token。
13 万条真实机器人 episode,每条包含图像、指令、动作三元组。这是当时最大规模的真实操作数据集。
RT-2(Google DeepMind 2023.07)是真正意义上的第一个 VLA——它把视觉-语言模型(VLM)和机器人动作统一进一个模型。
把动作离散化为 token,与文本 token 共享词表:
原 VLM 词表: [BPE tokens, ~32000] 新 VLA 词表: [BPE tokens, ~32000] + [256 action tokens]
这样动作 token 与文本 token 在 Transformer 中无差别处理。模型可以同时输出文本(回答问题)和动作(执行任务)。
预训练 VLM (PaLM-E / PaLI-X) 在互联网图文数据 ↓ 协同微调 (Co-finetuning) 机器人数据 (RT-1 数据 + 网络数据) ↓ 得到 RT-2 模型
协同微调的关键:机器人和网络数据混合训练,让模型同时保留语言推理与机器人执行能力。
RT-2 展示了惊人的语义泛化:
这些能力不是直接训练得到的,而是从 LLM 的语言能力涌现出来——类似 GPT-3 从规模涌现少样本能力。RT-2 证明了 VLA = LLM + 机器人数据 的范式可行。
Octo(Berkeley 2023.10)是开源通用机器人策略的代表。与 RT-2 的「VLM + 机器人」不同,Octo 走「纯机器人基础模型」路线。
不依赖 LLM 预训练,从零开始训练一个机器人基础模型:
Octo 用 Transformer 主干 + diffusion 动作头,处理多种机器人本体的不同动作空间(机械臂、四足、移动机器人)。
Octo 设计为「预训练 + 下游微调」:
这是「机器人领域的 BERT/GPT 时刻」——一个通用预训练模型,下游任务少量数据微调即可。
OpenVLA(Stanford + Berkeley 2024.05)是当前最重要的开源 VLA 之一。它的目标是「开源 RT-2」。
图像 → SigLIP 视觉编码器(384 tokens) 语言指令 → Llama 2 tokenizer [视觉 + 语言 + 本体感觉 tokens] → Llama 2 7B 主干 → 动作 token
7B 参数,使用 RT-2 的动作 token 化范式(256 bin × 动作维度)。
在 Open X-Embodiment 子集(97 万 episode)上从零训练,约 600 GPU 天。
π0(Physical Intelligence 2024.10)是工业级 VLA 的代表,由 OpenAI 前 Robotics 团队核心成员创立。
图像 → SigLIP 视觉编码器 语言 → PaliGemma 3B tokenizer [视觉 + 语言 + 本体感觉] → PaliGemma 3B 主干 → Flow Matching 动作头
π0 用 Flow Matching(5.2 节)作为动作头,相比 RT-2/OpenVLA 的离散 token 化,推理速度快、多模态能力强。
π0 demo 展示了惊人的能力:
这些任务都是传统方法难以处理的,π0 展示了 VLA 在复杂长程任务上的潜力。
π0 让 Physical Intelligence 成为估值数十亿美元的具身智能独角兽,证明 VLA 的商业可行性。
RDT(Real Dual-Arm Diffusion Transformer, 清华 2024.12)专注双臂操作,是中国团队的代表工作。
证明中国团队在 VLA 前沿具备竞争力,双臂操作(人形核心场景)有专门优化。
| 模型 | 主干 | 动作头 | 数据规模 | 参数量 | 开源 | 特色 |
|---|---|---|---|---|---|---|
| RT-1 | Transformer | 离散 token | 13 万 ep | 35M | 否 | 开山之作 |
| RT-2 | PaLI-X/PaLM-E | 离散 token | 13 万 + 网络 | 5B-540B | 否 | VLA 真正诞生 |
| Octo | Transformer | Diffusion | 80 万+ (OpenX) | ~93M | 是 | 通用开源策略 |
| OpenVLA | Llama 2 7B | 离散 token | 97 万 (OpenX) | 7B | 是 | 开源 SOTA |
| π0 | PaliGemma 3B | Flow Matching | 10K+ 小时(私) | 3B+ | 否 | 工业级复杂任务 |
| RDT | DiT | Diffusion | 双臂数据 | 1B | 是 | 双臂专精 |
从这条演进线可以看出三大趋势:
VLA 朝着「通用机器人策略」演进。
离散便于复用 LLM 训练,连续更适合动作分布建模。两条路线并存。
开源 VLA 让学术界能复现前沿,加速整体进步。
尽管 VLA 进步神速,仍有显著局限:
| 局限 | 描述 | 当前应对 |
|---|---|---|
| 数据稀缺 | 真实操作数据 << 互联网图文 | 遥操作 + 仿真 + 跨本体聚合 |
| 泛化边界 | 陌生场景/物体仍失败 | 大规模预训练 + 微调 |
| 延迟 | 大 VLA 推理慢 | 量化、蒸馏、专用硬件 |
| 可解释性 | 黑盒,出错难诊断 | 注意力可视化(有限) |
| 长程任务 | 数十步以上易失败 | 分层 + 记忆(第 4 章) |
| 力控精度 | VLA 输出动作,力控不直接 | 力反馈作为输入 + 阻抗控制 |
| 安全保证 | 难证明安全 | 安全过滤层 + 物理约束 |
💡 现实判断:截至 2026 年,VLA 在**结构化任务(抓取、放置、简单装配)已接近实用,但复杂精细任务(外科级装配、烹饪)**仍需大量工作。VLA 不是万能药,而是机器人智能拼图的关键一块。
下一节《5.4 策略学习范式 BC 与离线 RL》将讨论 VLA 怎么训练——行为克隆、模仿学习、离线强化学习的原理与取舍。