第5章 跨模态融合:从对齐到交互


文档摘要

第5章 跨模态融合:从对齐到交互 章节摘要 第4章讲的对比学习让视觉向量与文本向量落入了同一语义空间,但「对齐」并不等于「交互」——CLIP 能告诉你哪段文本与图像最相似,却无法基于图像内容回答开放性问题、生成描述、做视觉推理。要实现这些复杂能力,必须让视觉与文本在计算图中真正交互,这就是「跨模态融合(Cross-modal Fusion)」。本章从 Cross-Attention 的计算逻辑出发,系统梳理三种融合范式——早期融合(拼接 token)、中期融合(Cross-Attention 桥接)、晚期融合(独立编码后拼接);

第5章 跨模态融合:从对齐到交互

章节摘要

第4章讲的对比学习让视觉向量与文本向量落入了同一语义空间,但「对齐」并不等于「交互」——CLIP 能告诉你哪段文本与图像最相似,却无法基于图像内容回答开放性问题、生成描述、做视觉推理。要实现这些复杂能力,必须让视觉与文本在计算图中真正交互,这就是「跨模态融合(Cross-modal Fusion)」。本章从 Cross-Attention 的计算逻辑出发,系统梳理三种融合范式——早期融合(拼接 token)、中期融合(Cross-Attention 桥接)、晚期融合(独立编码后拼接);深入拆解 Flamingo 的 Perceiver Resampler 与 Gated Cross-Attention、BLIP-2 的 Q-Former 架构、LLaVA 的线性投影直连方案,对比它们在参数效率、训练成本、表达力上的取舍。章末提供 LLaVA-NeXT、MiniGPT-4、Qwen-VL 等融合架构的 SOTA 速览。掌握本章后,你将理解为何同样是「视觉 + LLM」,不同架构在效果与成本上会有数倍差异,并能根据自己的算力与任务特点做出合理选型。

学习目标

完成本章后,你应当能够:

  1. 写出 Cross-Attention 的完整公式,并说明它与 Self-Attention 的关键区别
  2. 区分早期融合、中期融合、晚期融合三种范式的结构特征与典型模型
  3. 画出 LLaVA、BLIP-2、Flamingo 三种融合架构的数据流图
  4. 解释 Q-Former 的「可学习查询」机制如何压缩变长视觉特征为固定 token 数
  5. 说出 Gated Cross-Attention 中的 tanh 门控为什么能保护预训练 LLM 不被破坏
  6. 在为自己的多模态任务选型时,能根据算力、数据量、任务类型选择合适的融合方案

核心概念速览

  • Cross-Attention(跨模态注意力):让一个模态的序列(Q)去查询另一个模态的序列(K, V)
  • 早期融合(Early Fusion):把视觉 token 与文本 token 直接拼接,送进统一 Transformer(LLaVA 路线)
  • 中期融合(Middle Fusion):在 LLM 中插入 Cross-Attention 层,让 LLM 在生成时查询视觉特征(Flamingo 路线)
  • 晚期融合(Late Fusion):两个模态分别独立编码,最后拼接(Qwen-VL 部分思路)
  • Q-Former:BLIP-2 提出的可学习查询模块,用一组固定 query 抽取视觉特征
  • Perceiver Resampler:Flamingo 的视觉特征压缩模块,类似 Q-Former 但结构不同
  • Gated Cross-Attention:带门控的 Cross-Attention,训练初期近似恒等映射,保护 LLM
  • 视觉 token 数:高分辨率图像可能产生几千个视觉 token,是计算瓶颈

子章节导览

本章共 6 个子节,按「机制 → 分类 → 经典架构 → 关键组件 → 前沿」的逻辑展开:

  • 5.1 Cross-Attention 计算逻辑 —— 把第2章的 Self-Attention 推广到跨序列场景,给出 Q/K/V 的来源规则
  • 5.2 融合架构分类:早中晚融合 —— 三种融合范式的结构对比、典型模型、优缺点
  • 5.3 Flamingo 与 BLIP-2 架构 —— 中期融合两大代表,Perceiver Resampler 与 Q-Former 的设计
  • 5.4 Q-Former 与 Adapter 设计 —— 深入 Q-Former 的可学习查询机制,以及 Adapter 系列的轻量化思路
  • 5.5 SOTA 前沿速览 —— LLaVA-NeXT、MiniGPT-4、Qwen-VL、InternVL 等融合架构对比

子节之间是层层深入的关系:5.1 给出融合的核心算子,5.2 把算子组装成三种架构模式,5.3 用 Flamingo/BLIP-2 这两个最有教学价值的中期融合案例展开,5.4 钻进 Q-Former 这个关键组件的设计哲学,5.5 把视角拉到当代 SOTA。

前置知识与后续衔接

前置知识

  • 第2章的 Self-Attention(Cross-Attention 是它的推广)
  • 第3章的 ViT 与视觉 token 概念
  • 第4章的 CLIP 对齐空间(很多融合模型用 CLIP 视觉塔)

后续衔接

  • 第6章的预训练任务设计会基于本章的融合架构(不同架构对应不同预训练目标)
  • 第7章的 LLaVA 指令微调建立在 5.2-5.4 讲的融合架构之上
  • 第8章的 VQA、文生图等应用直接使用本章的融合机制

本章是连接「对齐」(第4章)与「训练」(第6、7章)的关键桥梁——对齐建立了空间,融合建立了交互,训练填充了能力。

章节知识图谱


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U