6.5 SOTA 前沿速览 本节速览多模态预训练范式方向的当代 SOTA 工作,包括 BLIP-2、Flamingo、CoCa、PaLI、PaLM-E 等。这些工作奠定了多模态大模型时代的预训练方法论。 一、预训练范式全景 下面逐一展开。 二、BLIP-2:预训练范式的代表作 第5.3 节已经详细介绍了 BLIP-2 的架构。这里从预训练范式视角再补充几点: BLIP-2 的预训练创新 两阶段解耦:把视觉-语言表示学习与生成学习解耦,每阶段用不同任务 冻结大模型:视觉编码器与 LLM 都冻结,只训 Q-Former(188M 参数) 多任务训练 Q-Former:阶段一同时用 ITC + ITM + ITG,让 Q-Former 学到综合能力 轻量适配 LLM:阶段二只训一个线性投影,把
本节速览多模态预训练范式方向的当代 SOTA 工作,包括 BLIP-2、Flamingo、CoCa、PaLI、PaLM-E 等。这些工作奠定了多模态大模型时代的预训练方法论。
下面逐一展开。
第5.3 节已经详细介绍了 BLIP-2 的架构。这里从预训练范式视角再补充几点:
InstructBLIP 在 BLIP-2 基础上加入指令微调——让 Q-Former 接收指令作为额外输入:
[图像] + 指令:"这张图里有什么有趣的事?" → Q-Former → LLM → 回答
这让 BLIP-2 的能力更好地迁移到开放性任务。InstructBLIP 是 BLIP 系列的当前主流形态。
第5.3 节介绍了 Flamingo 架构。预训练视角的关键点:
Hugging Face 的 Idefics 是 Flamingo 的开源复现:
Idefics 的演化反映了社区从复杂中期融合走向简单早期融合的整体趋势。
第6.4 节介绍了 CoCa 的设计。它的预训练范式特点是:
CoCa 的「对比 + 生成」最小有效集思想影响了后续 PaLI、PaLM-E 等 Google 系模型。它证明了多任务训练不必复杂——两个互补的任务就能学到综合能力。
Google 的 PaLI(Pathways Language and Image)系列把规模推到极致:
PaLI 的核心论点是「视觉编码器是 MLLM 的隐藏瓶颈」——传统认为 LLM 才是关键,但 PaLI 证明视觉编码器做大也能显著提升效果。这一观察后来被 InternViT 等工作进一步验证。
Google 的 PaLM-E 把多模态预训练扩展到具身智能(Embodied AI):
PaLM-E 证明了「LLM 可以作为具身智能的决策中枢」——只要把所有输入输出都 token 化,LLM 的推理能力可以直接迁移到机器人控制。这是第8章「多模态 Agent」的重要前奏。
SimVLM(Simple Visual Language Model)走得更极端——完全放弃 ITC/ITM,只用 LM:
SimVLM 的发现:在大规模数据下,纯 LM 也能学到与多任务训练相当的能力。这呼应了 NLP 领域 GPT 取代 BERT 的趋势。
PaLI-3 在 PaLI 基础上转向效率优先:
PaLI-3 的演化反映了「从堆规模到优化效率」的范式转变——不是无限堆大,而是找最优组合。
| 模型 | 主任务 | 视觉编码器 | LLM | 训练数据 | 特色 |
|---|---|---|---|---|---|
| BLIP-2 | ITC+ITM+ITG+LM | EVA-CLIP-G (冻结) | OPT/FlanT5 (冻结) | LAION+CC+COCO | Q-Former 解耦 |
| Flamingo | LM | NFNet (冻结) | Chinchilla (冻结) | M3W | 少样本 in-context |
| CoCa | ITC+LM | ViT (训练) | mT5 (训练) | WebLI | 极简双任务 |
| PaLI 17B | 多任务 | ViT-22B | mT5/PaLM | WebLI | 视觉侧超大 |
| PaLI-3 | ITC+LM | SigLIP | mT5 | WebLI | 效率优先 |
| PaLM-E | LM | ViT | PaLM | 具身数据 | 具身多模态 |
| LLaVA | LM (指令) | CLIP/SigLIP (微调) | LLaMA (微调) | LAION-COCO+指令 | 复用组件 |
| InternVL | LM (指令) | InternViT-6B | InternLM/Qwen | 多源 | 大视觉塔 |
观察 SOTA 模型,预训练范式的演化方向:
当代预训练模型能力差距,很大程度上是数据差距:
数据质量、规模、多样性三个维度决定上限。数据是当代多模态大模型最大的护城河,也是开源生态最大的挑战。
预训练范式演化给我们的启示:
预训练范式经历了「多任务联合(ALBEF/BLIP)→ 极简生成(CoCa)→ 组件复用(LLaVA)→ 原生多模态(GPT-4o)」的演化。当代主流是「复用预训练视觉编码器 + LLM + 指令微调」,但视觉编码器单独预训练仍用多任务思想。数据质量是当代模型最大的护城河。
第6章到此结束。下一章(第7章)我们进入指令微调与人类对齐——看预训练好的模型如何学会「听话」。