5.2 融合架构分类:早中晚融合 跨模态融合有三种主流范式——早期融合、中期融合、晚期融合。它们的差异在于「视觉信息在何时、以何种方式进入 LLM」。本节系统对比三种范式。 一、三种范式的总览 下面逐一展开。 二、早期融合:把视觉 token 直接拼进 LLM 核心思想 早期融合是最直接的方式——把视觉编码器输出的 token 序列,与文本 token 直接拼接,送进统一的 Transformer(通常是 LLM): LLM 内部用 Self-Attention 处理这个混合序列——视觉与文本的交互发生在 LLM 的每一层,而不是某几层。 代表模型:LLaVA LLaVA(Large Language and Vision Assistant)是早期融合的标杆: LLaVA-1.
跨模态融合有三种主流范式——早期融合、中期融合、晚期融合。它们的差异在于「视觉信息在何时、以何种方式进入 LLM」。本节系统对比三种范式。
下面逐一展开。
早期融合是最直接的方式——把视觉编码器输出的 token 序列,与文本 token 直接拼接,送进统一的 Transformer(通常是 LLM):
[图像] → 视觉编码器 → 视觉 token [N_v, d] ↓ 投影到 LLM 词表空间 [文本] → 分词 → 文本 token [N_t, d] ↓ 拼接 → [N_v + N_t, d] → LLM → 输出文本
LLM 内部用 Self-Attention 处理这个混合序列——视觉与文本的交互发生在 LLM 的每一层,而不是某几层。
LLaVA(Large Language and Vision Assistant)是早期融合的标杆:
[图像] → CLIP ViT-L/14 → 256 个视觉 token ↓ MLP 投影到 LLM 词表空间 [文本指令] → 分词 → 文本 token ↓ 拼接 [视觉 token; 文本 token] ↓ Vicuna (LLaMA 微调) → 文本输出
LLaVA-1.5 用一个简单的 MLP(2 层线性 + GELU)作为投影器,把视觉 token 映射到 LLM 词表空间。
中期融合不修改 LLM 主干,而是在 LLM 的某些层之间插入新的 Cross-Attention 子层,让 LLM 在生成时查询视觉特征:
[视觉特征] ────────────────────┐ ↓ [文本 token] → LLM 第 1 层 → 新 Cross-Attention → LLM 第 2 层 → ...
LLM 的原始权重保持冻结(或微调),只训练新增的 Cross-Attention 层。
DeepMind 的 Flamingo 是中期融合的代表作:
[图像/视频] → NFNet 视觉编码器 → 视觉特征 ↓ Perceiver Resampler 压缩 → 固定数量视觉 token (64 个) ↓ [文本 token] → 冻结的 LLM (Chinchilla) ↓ 每隔几层插入 Gated Cross-Attention ↓ 文本 token 查询视觉 token ↓ 继续走 LLM
Flamingo 的两个关键组件:
Salesforce 的 BLIP-2 走得更极端——不仅冻结 LLM,还冻结视觉编码器,只训练中间的 Q-Former:
[图像] → 冻结的视觉编码器 (EVA-CLIP-G) → 图像特征 ↓ Q-Former (32 个可学习 query) → 32 个固定视觉 token ↓ 线性投影 → LLM (OPT/FlanT5) 词表空间 ↓ 拼接进 LLM → 输出文本
BLIP-2 训练时视觉编码器与 LLM 全部冻结,只更新 Q-Former 的约 188M 参数。这种「两冻一训」让 BLIP-2 在极小训练成本下达到了惊人的效果。
晚期融合让两个模态完全独立编码,最后用一个简单操作(拼接、相加、点积)融合:
[图像] → 视觉编码器 → 视觉向量 I ∈ R^d [文本] → LLM → 文本向量 T ∈ R^d 融合: I + T 或 [I; T] 或 I · T → 分类头
第4章讲的 CLIP 就是晚期融合——视觉塔与文本塔独立编码,最后比对相似度。但 CLIP 没有生成能力。
在多模态大模型时代,纯晚期融合很少见。原因是:
但晚期融合的思想仍然在用,特别是在:
| 维度 | 早期融合 | 中期融合 | 晚期融合 |
|---|---|---|---|
| 代表 | LLaVA、MiniGPT-4 | Flamingo、BLIP-2 | CLIP(仅检索) |
| 视觉信息进入 LLM 时机 | 入口处拼接 | LLM 层间 Cross-Attn | LLM 之后 |
| LLM 是否冻结 | 通常微调 | 通常冻结 | N/A |
| 视觉编码器是否冻结 | 视情况 | 通常冻结 | N/A |
| 训练参数量 | 中(投影器 + LLM 微调) | 小(仅 Cross-Attn / Q-Former) | 大(两个塔都训) |
| 融合深度 | 深(每层都交互) | 中(仅插入层) | 浅(最后一步) |
| 实现难度 | 低 | 高 | 中 |
| 视觉 token 数 | 受 LLM 上下文限制 | 可压缩(Q-Former) | 固定(一个向量) |
| 生成能力 | 强 | 强 | 弱(仅检索) |
观察 2023-2026 主流多模态大模型,可以发现:
LLaVA 系列的成功让早期融合成为开源生态的事实标准。Qwen-VL、InternVL、MiniCPM-V 等都基于早期融合,理由是:
Flamingo 的门控 Cross-Attention 思想被很多闭源大模型继承。原因:
最新模型往往不严格属于单一范式,而是混合:
如果你在做自己的多模态大模型:
| 你的情况 | 推荐融合方式 |
|---|---|
| 算力有限(单机 8 卡) | 早期融合 + 小 LLM (7B) + CLIP ViT-L |
| 算力中等(集群) | 早期融合 + 中 LLM (13B-30B) + SigLIP-L |
| 算力充足(大集群) | 早期融合 + 大 LLM (70B+) + 大视觉编码器 (InternViT) |
| 需要保护 LLM 能力 | 中期融合(BLIP-2 风格 Q-Former) |
| 视觉 token 太多 | 中期融合 + Q-Former 压缩 |
| 只做检索/分类 | 晚期融合(CLIP 风格) |
融合方式的选择还应考虑训练数据规模:
三种融合范式各有取舍:早期融合简单深效但需更多数据与算力,中期融合参数高效但架构复杂,晚期融合计算快但只适合检索。LLaVA 系列让早期融合成为开源主流,闭源大模型仍大量使用中期融合思想。选型时应根据算力、数据量、任务类型综合判断。
下一节(5.3)我们深入两个最有教学价值的中期融合案例——Flamingo 与 BLIP-2,看它们的 Q-Former、Perceiver Resampler、Gated Cross-Attention 是怎么设计的。