4.2 视觉-语言模型(VLM)与场景-指令对齐


文档摘要

4.2 视觉-语言模型(VLM)与场景-指令对齐 LLM 规划器要落地,必须先解决一个根本问题:当用户说「把那个红色杯子拿给我」,机器人怎么知道「红色杯子」对应场景里的哪个物体?这就是视觉-语言模型(VLM)的舞台。 4.2.1 VLM 要解决的核心问题 VLM 在机器人系统中的核心任务是视觉 grounding(视觉指代): 给定一张图像和一段语言描述,找出图像中对应语言的对象/区域/属性。

4.2 视觉-语言模型(VLM)与场景-指令对齐

LLM 规划器要落地,必须先解决一个根本问题:当用户说「把那个红色杯子拿给我」,机器人怎么知道「红色杯子」对应场景里的哪个物体?这就是视觉-语言模型(VLM)的舞台。

4.2.1 VLM 要解决的核心问题

VLM 在机器人系统中的核心任务是视觉 grounding(视觉指代)

给定一张图像和一段语言描述,找出图像中对应语言的对象/区域/属性。

这看似简单,实则包含多个层次:

任务层次 输入 输出 难度
类别识别 图像 「这是杯子」
指代消解 图像 + 「红色杯子」 杯子的位置
关系理解 图像 + 「桌上的杯子」 杯子(不是地上的)
属性推理 图像 + 「装了水的杯子」 装水的杯子(不是空的) 极难
隐式指代 图像 + 「我刚才说的那个」 上下文相关 极难

机器人操作主要需要中间三层:指代消解、关系理解、属性推理。

4.2.2 VLM 的技术演进

VLM 经历了三代演进:

第一代:双流对比学习(CLIP)

CLIP(OpenAI 2021)开启了 VLM 时代。核心思路(呼应第 2.4 节):

  • 图像编码器 + 文本编码器,分别提取向量。
  • 训练目标:匹配的图文对相似度高,不匹配的低。
  • 学成后,图像和文本在同一语义空间,可直接比对。

CLIP 的能力:

  • 零样本分类:用任意文本类别表做分类(不需训练分类头)。
  • 图像检索:用文本搜图,或反过来。
  • 作为感知底座:为下游任务提供对齐的视觉语言特征。

第二代:生成式多模态模型(BLIP/Flamingo)

BLIP(Salesforce 2022)和 Flamingo(DeepMind 2022)把 CLIP 的「检索式」升级为「生成式」:

  • 不仅能算图文相似度,还能生成图像描述、回答视觉问题。
  • BLIP-2 引入 Q-Former 桥接冻结的视觉编码器和冻结的 LLM。
  • Flamingo 用 Perceiver Resampler 把变长图像 token 化,喂给 LLM。

这一代 VLM 已经能做:图像描述、视觉问答、视觉对话。

第三代:原生多模态大模型(GPT-4V/Gemini/Claude)

GPT-4V(OpenAI 2023)、Gemini(Google 2023)、Claude 3.5 Sonnet(Anthropic 2024)把视觉能力直接训练进 LLM:

  • 视觉 token 与文本 token 在 Transformer 中统一处理。
  • 不仅识别,还能视觉推理:「这个杯子装了大约多少毫升水?」
  • 支持多图、视频、文档混合输入。

这一代 VLM 是当前机器人视觉理解的最强底座,几乎所有先进系统都接入它们做高层视觉推理。

4.2.3 VLM 在机器人中的三类用法

用法 输入 输出 典型应用
开放词汇检测 图像 + 「红色杯子」 物体位置 抓取目标定位
视觉问答(VQA) 图像 + 问题 答案 状态判断(杯里有没有水)
场景描述/字幕 图像 文字描述 给 LLM 规划器提供场景上下文

这三类用法覆盖了机器人 90% 的 VLM 调用场景。

4.2.4 开放词汇检测:从 CLIP 到 Grounding-DINO

机器人最常用的是开放词汇检测(Open-Vocabulary Detection, OVD)——用任意自然语言描述对象,定位其在图像中的位置。

模型 思路 输出
CLIP + Grad-CAM CLIP 算图文相似,Grad-CAM 找激活区域 粗略热图
GLIP 把检测统一为「视觉-语言 grounding」 边界框
Grounding-DINO DINO + 开放词汇,强零样本检测 边界框 + 置信度
OWLv2 开放词汇 + 自训练 边界框
SAM + CLIP SAM 分割 + CLIP 分类 像素掩膜 + 类别
Grounded-SAM Grounding-DINO + SAM 流水线 文本→精确掩膜

💡 典型流水线:用户说「把苹果给我」→ Grounding-DINO 检测「apple」边界框 → SAM 把边界框细化为像素掩膜 → 掩膜中心 + 深度相机得到 3D 位置 → 机械臂抓取。这是当前机器人开放词汇操作的标准链路。

4.2.5 指代消解的难点

「把那个拿给我」中的「那个」是什么?指代消解(Coreference Resolution)是 VLM 的难点:

难点 例子 当前应对
代词指代 「把它给我」 上下文历史 + LLM 推理
空间指代 「左边那个」「靠窗的」 空间关系理解 + 几何推理
比较指代 「更大的那个」「装水的」 属性比较 + VQA
历史指代 「我刚才说的」 对话状态跟踪
多模态指代 「这个」(指着) 手势识别 + 视觉聚焦

这些难点让机器人语言交互远比想象复杂——一个看似简单的对话,背后可能涉及多轮上下文、空间推理、属性比较的综合判断。

4.2.6 空间关系理解

「把杯子放到桌子左上角」——机器人必须理解空间关系。VLM 的空间关系理解分三层:

第一层:基本方位

  • 上下左右、前后、里外。
  • 通常用物体边界框的相对位置计算。
  • 简单场景:用边界框中心坐标比较。

第二层:相对关系

  • 「A 在 B 上面」「A 靠近 B」。
  • 需要几何推理(重叠、距离、接触)。
  • 当前 VLM 表现参差不齐,常需结合 3D 信息。

第三层:功能关系

  • 「适合阅读的位置」「人坐的地方」。
  • 需要常识与功能推理。
  • GPT-4V 等大 VLM 在这一层表现优于专门模型。

⚠️ VLM 的空间盲点:当前 VLM 在「左/右」「前/后」这类空间关系上仍易出错,特别是物体方向变化(机器人转 90° 后,左和右对调)。这是为什么生产系统常用「以机器人为坐标系」而非「以人为坐标系」描述位置。

4.2.7 VLM 集成到机器人系统的三种架构

VLM 怎么接入机器人?三种典型架构:

架构一:VLM 作为感知模块(黑盒 API)

图像 → VLM → 物体描述/位置 → LLM 规划器 → 技能 → 执行
  • VLM 封装为 API(如 find("cup") 返回位置)。
  • LLM 规划器不知道 VLM 内部细节。
  • 优点:解耦、易替换 VLM。
  • 缺点:VLM 延迟高、调用成本大。

架构二:VLM 作为 LLM 的「眼睛」(端到端多模态)

图像 + 用户指令 → 多模态 LLM (GPT-4V) → 子目标 → 技能 → 执行
  • 把图像直接喂给多模态 LLM。
  • LLM 内部完成视觉理解 + 任务规划。
  • 优点:架构简洁、视觉推理深入。
  • 缺点:每次都要传图、计算量大。

架构三:VLM 嵌入 VLA 端到端(第 5 章)

图像 + 指令 → VLA 模型 → 连续动作
  • VLM 与策略融合为一个模型。
  • 这是第 5 章 VLA 模型的核心思路。
  • 优点:端到端优化、信息无损。
  • 缺点:训练数据需求大。

💡 当前趋势:生产系统多用架构一(解耦),研究前沿多用架构三(端到端)。架构二是过渡形态,逐渐被专用 VLA 替代。

4.2.8 VLM 在机器人中的实际挑战

挑战 描述 应对
延迟 大 VLM 单次推理 0.5-3 秒 关键帧策略、模型蒸馏
幻觉 VLM 说看到不存在的物体 多模型投票 + 几何验证
细粒度差 把橘子认成橙子 任务相关微调
空间不精 给的位置粗略 VLM 给候选 + 几何精修
多物体混淆 三个杯子不知道指哪个 上下文 + 指代消解
成本 商用 API 调用费用高 自部署开源 VLM

⚠️ 生产痛点:VLM 在 demo 里惊艳,但在生产系统中延迟和成本是大问题。一个家庭机器人每秒调用一次 GPT-4V,月成本可能上千美元,且响应延迟让交互不流畅。这是为什么 2025 年开始大量工作转向自部署的开源 VLM(Qwen-VL、InternVL、OpenVLA)。

4.2.9 一个完整的指令执行流水线

把所有概念综合,看一个机器人响应「把红色杯子端到厨房」的完整流水线:

注意三处 VLM 的作用:

  1. 检测:定位「红色杯子」(开放词汇检测)。
  2. 推理:判断杯里是否装水(VQA),决定抓取方式(防洒要更稳)。
  3. 规划:LLM 综合视觉信息生成动作链。

这就是「LLM 大脑 + VLM 眼睛 + 技能库手脚」的完整协作。

本节小结

  • VLM 在机器人中的核心任务是视觉 grounding——把语言指令对齐到场景物体。
  • VLM 三代演进:CLIP(对比)、BLIP/Flamingo(生成)、GPT-4V/Gemini(原生多模态)。
  • 三类用法:开放词汇检测、视觉问答、场景描述。
  • 开放词汇检测主流流水线:Grounding-DINO → SAM → 深度反投影 → 3D 位置。
  • 指代消解(代词、空间、属性、历史)是难点,需要上下文 + 几何 + 推理综合。
  • 三种集成架构:黑盒 API、多模态 LLM、VLA 端到端,分别对应解耦、简洁、融合。
  • 生产挑战主要在延迟、成本、幻觉、细粒度。

下一节《4.3 记忆、反思与重新规划》将讨论机器人长程任务执行时,如何用记忆与反思机制应对出错与偏离。


发布者: 作者: 灏天文库 转发
评论区 (0)
U