第 5 章 · 具身决策与大脑(二):VLA 模型与端到端策略


文档摘要

第 5 章 · 具身决策与大脑(二):VLA 模型与端到端策略 如果说第 4 章是「LLM 当指挥官,技能库当士兵」的传统军队,那么本章就是「一个超级战士」——视觉-语言-动作模型(VLA)一口气从图像和指令直接输出连续动作,没有中间环节。这是当前具身智能最具想象力的范式。 章节摘要 视觉-语言-动作模型(Vision-Language-Action Model, VLA) 把视觉理解、语言理解、动作生成融合到一个端到端的神经网络中。本章从 VLA 的统一架构(视觉编码器 + 语言模型 + 动作头)出发,讲清 Transformer 在机器人控制中的应用、动作表征的离散化(action tokenization)与连续输出(diffusion/flow)两条路线;

第 5 章 · 具身决策与大脑(二):VLA 模型与端到端策略

如果说第 4 章是「LLM 当指挥官,技能库当士兵」的传统军队,那么本章就是「一个超级战士」——视觉-语言-动作模型(VLA)一口气从图像和指令直接输出连续动作,没有中间环节。这是当前具身智能最具想象力的范式。

章节摘要

视觉-语言-动作模型(Vision-Language-Action Model, VLA) 把视觉理解、语言理解、动作生成融合到一个端到端的神经网络中。本章从 VLA 的统一架构(视觉编码器 + 语言模型 + 动作头)出发,讲清 Transformer 在机器人控制中的应用、动作表征的离散化(action tokenization)与连续输出(diffusion/flow)两条路线;深入剖析生成式策略(Diffusion Policy、π0 的 Flow Matching)如何建模多模态动作分布;梳理 RT-1、RT-2、Octo、OpenVLA、π0、RDT 等代表性模型谱系的架构与数据规模差异;最后讨论策略学习的两大范式——行为克隆/模仿学习与离线强化学习(BC、DAgger、CQL、IQL),辨析各自的数据效率与分布偏移难题。本章是当前具身智能研究最活跃的前沿。

学习目标

读完本章,你应当能够:

  1. 画出 VLA 模型的统一架构图,说清视觉编码器、语言模型、动作头各自的职责。
  2. 解释动作 Token 化(离散化)与连续动作输出(扩散/Flow)两条路线的差异与取舍。
  3. 复述 Diffusion Policy 的去噪过程,理解它为何能建模多模态动作分布。
  4. 列举 RT-2、Octo、OpenVLA、π0、RDT 等代表模型,辨析其架构与数据规模。
  5. 区分行为克隆(BC)、DAgger、目标条件策略、离线 RL 的训练目标与适用场景。

子章节安排与导引

编号 子章节 核心问题 关联后续
01 VLA 模型架构总览:视觉-语言-动作的统一建模 VLA 长什么样?怎么把三类信号融合? 第 8 章系统
02 策略表征与生成式策略:扩散策略与 Flow Matching 动作是多模态的,怎么建模? 第 7 章数据
03 代表性 VLA 模型谱系:从 RT-1/RT-2 到 Octo/π0/OpenVLA 业界模型有哪些?怎么选? 第 8 章综合案例
04 策略学习范式:行为克隆/模仿学习与离线强化学习 怎么训练 VLA?数据从哪来? 第 7 章遥操作

四节构成「架构 → 表征 → 模型 → 训练」的递进,覆盖 VLA 的完整技术栈。

配图说明

  • Mermaid「VLA 模型数据流向(视觉→语言→动作)」:在第 01 节给出。
  • SVG「Diffusion Policy 迭代去噪过程」:在第 02 节给出。
  • Mermaid「代表性 VLA 模型时间线」:在第 03 节给出。
  • Mermaid「BC vs DAgger vs 离线 RL 对比」:在第 04 节给出。

SEO 关键词

VLA 模型、视觉语言动作模型、Vision Language Action、Diffusion Policy、扩散策略、Flow Matching、RT-1、RT-2、Octo、OpenVLA、π0、RDT、ACT、行为克隆、模仿学习、DAgger、离线强化学习、CQL、IQL、action chunk、Transformer 机器人控制、具身基础模型。

章节关联

  • 前置:第 2 章视觉感知与多模态融合、第 4 章 LLM/VLM 规划是 VLA 的前置知识。
  • 后续:第 6 章运动控制消费 VLA 输出的动作;第 7 章遥操作数据是 VLA 训练的关键来源;第 8 章综合案例会分析 VLA 在人形机器人中的实际部署。

发布者: 作者: 灏天文库 转发
评论区 (0)
U