第 5 章 · 具身决策与大脑(二):VLA 模型与端到端策略 如果说第 4 章是「LLM 当指挥官,技能库当士兵」的传统军队,那么本章就是「一个超级战士」——视觉-语言-动作模型(VLA)一口气从图像和指令直接输出连续动作,没有中间环节。这是当前具身智能最具想象力的范式。 章节摘要 视觉-语言-动作模型(Vision-Language-Action Model, VLA) 把视觉理解、语言理解、动作生成融合到一个端到端的神经网络中。本章从 VLA 的统一架构(视觉编码器 + 语言模型 + 动作头)出发,讲清 Transformer 在机器人控制中的应用、动作表征的离散化(action tokenization)与连续输出(diffusion/flow)两条路线;
如果说第 4 章是「LLM 当指挥官,技能库当士兵」的传统军队,那么本章就是「一个超级战士」——视觉-语言-动作模型(VLA)一口气从图像和指令直接输出连续动作,没有中间环节。这是当前具身智能最具想象力的范式。
视觉-语言-动作模型(Vision-Language-Action Model, VLA) 把视觉理解、语言理解、动作生成融合到一个端到端的神经网络中。本章从 VLA 的统一架构(视觉编码器 + 语言模型 + 动作头)出发,讲清 Transformer 在机器人控制中的应用、动作表征的离散化(action tokenization)与连续输出(diffusion/flow)两条路线;深入剖析生成式策略(Diffusion Policy、π0 的 Flow Matching)如何建模多模态动作分布;梳理 RT-1、RT-2、Octo、OpenVLA、π0、RDT 等代表性模型谱系的架构与数据规模差异;最后讨论策略学习的两大范式——行为克隆/模仿学习与离线强化学习(BC、DAgger、CQL、IQL),辨析各自的数据效率与分布偏移难题。本章是当前具身智能研究最活跃的前沿。
读完本章,你应当能够:
| 编号 | 子章节 | 核心问题 | 关联后续 |
|---|---|---|---|
| 01 | VLA 模型架构总览:视觉-语言-动作的统一建模 | VLA 长什么样?怎么把三类信号融合? | 第 8 章系统 |
| 02 | 策略表征与生成式策略:扩散策略与 Flow Matching | 动作是多模态的,怎么建模? | 第 7 章数据 |
| 03 | 代表性 VLA 模型谱系:从 RT-1/RT-2 到 Octo/π0/OpenVLA | 业界模型有哪些?怎么选? | 第 8 章综合案例 |
| 04 | 策略学习范式:行为克隆/模仿学习与离线强化学习 | 怎么训练 VLA?数据从哪来? | 第 7 章遥操作 |
四节构成「架构 → 表征 → 模型 → 训练」的递进,覆盖 VLA 的完整技术栈。
VLA 模型、视觉语言动作模型、Vision Language Action、Diffusion Policy、扩散策略、Flow Matching、RT-1、RT-2、Octo、OpenVLA、π0、RDT、ACT、行为克隆、模仿学习、DAgger、离线强化学习、CQL、IQL、action chunk、Transformer 机器人控制、具身基础模型。