视觉-语言-动作模型 视觉-语言-动作模型(vision-language-action model,VLA)把看、理解语言和行动统一进单个神经网络。本文件涵盖 VLA 架构、动作分词、RT-2、Octo、OpenVLA、预训练策略、泛化、与本体无关的模型以及基准评测。 在前几节中,我们介绍了感知(感知世界)和机器人学习(控制身体)。传统上,这些是分开的流水线:一个感知模块检测物体,一个语言模块解释命令,一个控制模块生成动作。每个模块都被独立地设计、训练和调试。 视觉-语言-动作模型(VLA)把这条流水线压缩进单个神经网络。模型接收图像(视觉)、一条自然语言指令(语言),输出电机命令(动作)。一个模型,端到端。