5.2 融合架构分类:早中晚融合


文档摘要

5.2 融合架构分类:早中晚融合 跨模态融合有三种主流范式——早期融合、中期融合、晚期融合。它们的差异在于「视觉信息在何时、以何种方式进入 LLM」。本节系统对比三种范式。 一、三种范式的总览 下面逐一展开。 二、早期融合:把视觉 token 直接拼进 LLM 核心思想 早期融合是最直接的方式——把视觉编码器输出的 token 序列,与文本 token 直接拼接,送进统一的 Transformer(通常是 LLM): LLM 内部用 Self-Attention 处理这个混合序列——视觉与文本的交互发生在 LLM 的每一层,而不是某几层。 代表模型:LLaVA LLaVA(Large Language and Vision Assistant)是早期融合的标杆: LLaVA-1.

5.2 融合架构分类:早中晚融合

跨模态融合有三种主流范式——早期融合、中期融合、晚期融合。它们的差异在于「视觉信息在何时、以何种方式进入 LLM」。本节系统对比三种范式。

一、三种范式的总览

下面逐一展开。

二、早期融合:把视觉 token 直接拼进 LLM

核心思想

早期融合是最直接的方式——把视觉编码器输出的 token 序列,与文本 token 直接拼接,送进统一的 Transformer(通常是 LLM)

[图像] → 视觉编码器 → 视觉 token [N_v, d] ↓ 投影到 LLM 词表空间 [文本] → 分词 → 文本 token [N_t, d] ↓ 拼接 → [N_v + N_t, d] → LLM → 输出文本

LLM 内部用 Self-Attention 处理这个混合序列——视觉与文本的交互发生在 LLM 的每一层,而不是某几层。

代表模型:LLaVA

LLaVA(Large Language and Vision Assistant)是早期融合的标杆:

[图像] → CLIP ViT-L/14 → 256 个视觉 token ↓ MLP 投影到 LLM 词表空间 [文本指令] → 分词 → 文本 token ↓ 拼接 [视觉 token; 文本 token] ↓ Vicuna (LLaMA 微调) → 文本输出

LLaVA-1.5 用一个简单的 MLP(2 层线性 + GELU)作为投影器,把视觉 token 映射到 LLM 词表空间。

早期融合的优点

  1. 实现极简:投影器只是一个线性层或 MLP,几十行代码就能实现
  2. 训练高效:只需要训练投影器 + 微调 LLM,参数效率高
  3. 表达力强:视觉与文本的交互发生在 LLM 每一层,融合深度足够
  4. 可扩展:换更大的 LLM 或更好的视觉编码器,效果直接提升

早期融合的缺点

  1. 视觉 token 数受限:256 个视觉 token 会显著增加 LLM 序列长度,高分辨率图像会让 token 数爆炸
  2. 预训练 LLM 受冲击:直接拼接视觉 token 后微调,LLM 原有的语言能力可能被破坏(需要小学习率 + 适量训练数据)
  3. 位置编码处理:视觉 token 与文本 token 的位置编码如何协调,需要仔细设计

适合场景

  • 中等分辨率图像(224-512)
  • 通用图文对话、VQA、图像描述
  • 算力有限的快速原型与开源生态

三、中期融合:在 LLM 中插入 Cross-Attention

核心思想

中期融合不修改 LLM 主干,而是在 LLM 的某些层之间插入新的 Cross-Attention 子层,让 LLM 在生成时查询视觉特征:

[视觉特征] ────────────────────┐ ↓ [文本 token] → LLM 第 1 层 → 新 Cross-Attention → LLM 第 2 层 → ...

LLM 的原始权重保持冻结(或微调),只训练新增的 Cross-Attention 层。

代表模型一:Flamingo

DeepMind 的 Flamingo 是中期融合的代表作:

[图像/视频] → NFNet 视觉编码器 → 视觉特征 ↓ Perceiver Resampler 压缩 → 固定数量视觉 token (64 个) ↓ [文本 token] → 冻结的 LLM (Chinchilla) ↓ 每隔几层插入 Gated Cross-Attention ↓ 文本 token 查询视觉 token ↓ 继续走 LLM

Flamingo 的两个关键组件:

  1. Perceiver Resampler:把变长视觉特征压成 64 个固定 token
  2. Gated Cross-Attention:带 tanh 门控的 Cross-Attention,训练初期门控为 0,逐步打开,保护 LLM 原有能力

代表模型二:BLIP-2

Salesforce 的 BLIP-2 走得更极端——不仅冻结 LLM,还冻结视觉编码器,只训练中间的 Q-Former:

[图像] → 冻结的视觉编码器 (EVA-CLIP-G) → 图像特征 ↓ Q-Former (32 个可学习 query) → 32 个固定视觉 token ↓ 线性投影 → LLM (OPT/FlanT5) 词表空间 ↓ 拼接进 LLM → 输出文本

BLIP-2 训练时视觉编码器与 LLM 全部冻结,只更新 Q-Former 的约 188M 参数。这种「两冻一训」让 BLIP-2 在极小训练成本下达到了惊人的效果。

中期融合的优点

  1. 保护预训练能力:LLM 权重不动或微调,原有语言能力不被破坏
  2. 参数效率极高:只训练新增的少量参数,适合算力受限场景
  3. 视觉特征压缩:Q-Former / Perceiver Resampler 把变长压成定长,便于扩展
  4. 可插拔:换不同 LLM 或不同视觉编码器,无需大改架构

中期融合的缺点

  1. 架构复杂:需要设计 Cross-Attention 层的插入位置、门控机制、Q-Former 结构
  2. 训练流程复杂:BLIP-2 分两阶段训练,Flamingo 也分多阶段
  3. 融合深度受插入层位置限制:只在某些层做 Cross-Attention,交互不如早期融合彻底
  4. 工程实现门槛高:调试、超参调整都比早期融合难

适合场景

  • 算力受限但要求效果好的场景
  • 需要保护 LLM 原有能力(如代码、数学)的多模态扩展
  • 视觉 token 数量需要严格控制(视频、多图)

四、晚期融合:独立编码后拼接

核心思想

晚期融合让两个模态完全独立编码,最后用一个简单操作(拼接、相加、点积)融合:

[图像] → 视觉编码器 → 视觉向量 I ∈ R^d [文本] → LLM → 文本向量 T ∈ R^d 融合: I + T 或 [I; T] 或 I · T → 分类头

代表:CLIP 本身就是晚期融合

第4章讲的 CLIP 就是晚期融合——视觉塔与文本塔独立编码,最后比对相似度。但 CLIP 没有生成能力。

真正的「晚期融合 + 生成」罕见

在多模态大模型时代,纯晚期融合很少见。原因是:

  • LLM 的核心能力是自回归生成,需要序列化的 token 输入
  • 把视觉向量与文本向量简单相加,无法让 LLM「逐 token」地从视觉信息中获取灵感

但晚期融合的思想仍然在用,特别是在:

  • 多模态检索系统:双塔编码后用向量数据库做相似度匹配
  • 多模态嵌入模型:把图文编码成统一向量,用于下游分类、聚类
  • 某些 Agent 架构:先让 LLM 推理,再用视觉信息修正

晚期融合的优点

  1. 计算高效:两个塔可以独立预计算
  2. 检索友好:天然适合向量数据库
  3. 模态解耦:换一个模态的编码器不影响另一个

晚期融合的缺点

  1. 没有深度融合:两模态的交互只发生在最后一步
  2. 不适合生成:无法做图像描述、VQA 这类需要细粒度交互的任务

五、三种范式的对比

维度 早期融合 中期融合 晚期融合
代表 LLaVA、MiniGPT-4 Flamingo、BLIP-2 CLIP(仅检索)
视觉信息进入 LLM 时机 入口处拼接 LLM 层间 Cross-Attn LLM 之后
LLM 是否冻结 通常微调 通常冻结 N/A
视觉编码器是否冻结 视情况 通常冻结 N/A
训练参数量 中(投影器 + LLM 微调) 小(仅 Cross-Attn / Q-Former) 大(两个塔都训)
融合深度 深(每层都交互) 中(仅插入层) 浅(最后一步)
实现难度
视觉 token 数 受 LLM 上下文限制 可压缩(Q-Former) 固定(一个向量)
生成能力 弱(仅检索)

六、当代模型的实际选择

观察 2023-2026 主流多模态大模型,可以发现:

趋势一:早期融合逐渐占主流

LLaVA 系列的成功让早期融合成为开源生态的事实标准。Qwen-VL、InternVL、MiniCPM-V 等都基于早期融合,理由是:

  • 实现简单,社区易复现
  • 算力足够时效果最好
  • 视觉与文本的深度融合对推理任务很重要

趋势二:中期融合在大厂闭源中仍有市场

Flamingo 的门控 Cross-Attention 思想被很多闭源大模型继承。原因:

  • 大厂有大量昂贵的 LLM 预训练投入,不愿破坏
  • 中期融合参数效率高,可以接入多个视觉/音频编码器

趋势三:融合方式正在「混合化」

最新模型往往不严格属于单一范式,而是混合:

  • InternVL:早期融合为主,但视觉编码器内部有 Cross-Attention
  • Qwen2-VL:早期融合 + 动态分辨率,相当于把视觉 token 重新组织
  • GPT-4o(推测):原生多模态,从底层就统一了 token 空间

七、选型建议

如果你在做自己的多模态大模型:

你的情况 推荐融合方式
算力有限(单机 8 卡) 早期融合 + 小 LLM (7B) + CLIP ViT-L
算力中等(集群) 早期融合 + 中 LLM (13B-30B) + SigLIP-L
算力充足(大集群) 早期融合 + 大 LLM (70B+) + 大视觉编码器 (InternViT)
需要保护 LLM 能力 中期融合(BLIP-2 风格 Q-Former)
视觉 token 太多 中期融合 + Q-Former 压缩
只做检索/分类 晚期融合(CLIP 风格)

八、对算力与数据量的考量

融合方式的选择还应考虑训练数据规模:

  • 数据充足(百万级图文指令对):早期融合能充分发挥
  • 数据有限(万级):中期融合更稳,避免过拟合破坏 LLM
  • 数据极少(千级):考虑完全冻结 LLM + 视觉编码器,只训 Q-Former

小结

三种融合范式各有取舍:早期融合简单深效但需更多数据与算力,中期融合参数高效但架构复杂,晚期融合计算快但只适合检索。LLaVA 系列让早期融合成为开源主流,闭源大模型仍大量使用中期融合思想。选型时应根据算力、数据量、任务类型综合判断。

下一节(5.3)我们深入两个最有教学价值的中期融合案例——Flamingo 与 BLIP-2,看它们的 Q-Former、Perceiver Resampler、Gated Cross-Attention 是怎么设计的。


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U