第5章 跨模态融合:从对齐到交互
章节摘要
第4章讲的对比学习让视觉向量与文本向量落入了同一语义空间,但「对齐」并不等于「交互」——CLIP 能告诉你哪段文本与图像最相似,却无法基于图像内容回答开放性问题、生成描述、做视觉推理。要实现这些复杂能力,必须让视觉与文本在计算图中真正交互,这就是「跨模态融合(Cross-modal Fusion)」。本章从 Cross-Attention 的计算逻辑出发,系统梳理三种融合范式——早期融合(拼接 token)、中期融合(Cross-Attention 桥接)、晚期融合(独立编码后拼接);深入拆解 Flamingo 的 Perceiver Resampler 与 Gated Cross-Attention、BLIP-2 的 Q-Former 架构、LLaVA 的线性投影直连方案,对比它们在参数效率、训练成本、表达力上的取舍。章末提供 LLaVA-NeXT、MiniGPT-4、Qwen-VL 等融合架构的 SOTA 速览。掌握本章后,你将理解为何同样是「视觉 + LLM」,不同架构在效果与成本上会有数倍差异,并能根据自己的算力与任务特点做出合理选型。
学习目标
完成本章后,你应当能够:
- 写出 Cross-Attention 的完整公式,并说明它与 Self-Attention 的关键区别
- 区分早期融合、中期融合、晚期融合三种范式的结构特征与典型模型
- 画出 LLaVA、BLIP-2、Flamingo 三种融合架构的数据流图
- 解释 Q-Former 的「可学习查询」机制如何压缩变长视觉特征为固定 token 数
- 说出 Gated Cross-Attention 中的 tanh 门控为什么能保护预训练 LLM 不被破坏
- 在为自己的多模态任务选型时,能根据算力、数据量、任务类型选择合适的融合方案
核心概念速览
- Cross-Attention(跨模态注意力):让一个模态的序列(Q)去查询另一个模态的序列(K, V)
- 早期融合(Early Fusion):把视觉 token 与文本 token 直接拼接,送进统一 Transformer(LLaVA 路线)
- 中期融合(Middle Fusion):在 LLM 中插入 Cross-Attention 层,让 LLM 在生成时查询视觉特征(Flamingo 路线)
- 晚期融合(Late Fusion):两个模态分别独立编码,最后拼接(Qwen-VL 部分思路)
- Q-Former:BLIP-2 提出的可学习查询模块,用一组固定 query 抽取视觉特征
- Perceiver Resampler:Flamingo 的视觉特征压缩模块,类似 Q-Former 但结构不同
- Gated Cross-Attention:带门控的 Cross-Attention,训练初期近似恒等映射,保护 LLM
- 视觉 token 数:高分辨率图像可能产生几千个视觉 token,是计算瓶颈
子章节导览
本章共 6 个子节,按「机制 → 分类 → 经典架构 → 关键组件 → 前沿」的逻辑展开:
- 5.1 Cross-Attention 计算逻辑 —— 把第2章的 Self-Attention 推广到跨序列场景,给出 Q/K/V 的来源规则
- 5.2 融合架构分类:早中晚融合 —— 三种融合范式的结构对比、典型模型、优缺点
- 5.3 Flamingo 与 BLIP-2 架构 —— 中期融合两大代表,Perceiver Resampler 与 Q-Former 的设计
- 5.4 Q-Former 与 Adapter 设计 —— 深入 Q-Former 的可学习查询机制,以及 Adapter 系列的轻量化思路
- 5.5 SOTA 前沿速览 —— LLaVA-NeXT、MiniGPT-4、Qwen-VL、InternVL 等融合架构对比
子节之间是层层深入的关系:5.1 给出融合的核心算子,5.2 把算子组装成三种架构模式,5.3 用 Flamingo/BLIP-2 这两个最有教学价值的中期融合案例展开,5.4 钻进 Q-Former 这个关键组件的设计哲学,5.5 把视角拉到当代 SOTA。
前置知识与后续衔接
前置知识:
- 第2章的 Self-Attention(Cross-Attention 是它的推广)
- 第3章的 ViT 与视觉 token 概念
- 第4章的 CLIP 对齐空间(很多融合模型用 CLIP 视觉塔)
后续衔接:
- 第6章的预训练任务设计会基于本章的融合架构(不同架构对应不同预训练目标)
- 第7章的 LLaVA 指令微调建立在 5.2-5.4 讲的融合架构之上
- 第8章的 VQA、文生图等应用直接使用本章的融合机制
本章是连接「对齐」(第4章)与「训练」(第6、7章)的关键桥梁——对齐建立了空间,融合建立了交互,训练填充了能力。
章节知识图谱