6.5 SOTA 前沿速览


文档摘要

6.5 SOTA 前沿速览 本节速览多模态预训练范式方向的当代 SOTA 工作,包括 BLIP-2、Flamingo、CoCa、PaLI、PaLM-E 等。这些工作奠定了多模态大模型时代的预训练方法论。 一、预训练范式全景 下面逐一展开。 二、BLIP-2:预训练范式的代表作 第5.3 节已经详细介绍了 BLIP-2 的架构。这里从预训练范式视角再补充几点: BLIP-2 的预训练创新 两阶段解耦:把视觉-语言表示学习与生成学习解耦,每阶段用不同任务 冻结大模型:视觉编码器与 LLM 都冻结,只训 Q-Former(188M 参数) 多任务训练 Q-Former:阶段一同时用 ITC + ITM + ITG,让 Q-Former 学到综合能力 轻量适配 LLM:阶段二只训一个线性投影,把

6.5 SOTA 前沿速览

本节速览多模态预训练范式方向的当代 SOTA 工作,包括 BLIP-2、Flamingo、CoCa、PaLI、PaLM-E 等。这些工作奠定了多模态大模型时代的预训练方法论。

一、预训练范式全景

下面逐一展开。

二、BLIP-2:预训练范式的代表作

第5.3 节已经详细介绍了 BLIP-2 的架构。这里从预训练范式视角再补充几点:

BLIP-2 的预训练创新

  1. 两阶段解耦:把视觉-语言表示学习与生成学习解耦,每阶段用不同任务
  2. 冻结大模型:视觉编码器与 LLM 都冻结,只训 Q-Former(188M 参数)
  3. 多任务训练 Q-Former:阶段一同时用 ITC + ITM + ITG,让 Q-Former 学到综合能力
  4. 轻量适配 LLM:阶段二只训一个线性投影,把 Q-Former 输出送进任意 LLM

BLIP-2 的工程价值

  • 训练成本极低(相比从头训 Flamingo 70B 主干)
  • 可插拔 LLM(OPT、FlanT5 等都试过)
  • 在 VQA、图像描述、视觉对话上达到 SOTA

BLIP-2 的局限

  • 视觉编码器冻结可能成为瓶颈(InstructBLIP 后续发现微调能提升)
  • Q-Former 32 个 token 在高分辨率场景信息丢失
  • 训练流程复杂,社区复现门槛高

后续:InstructBLIP

InstructBLIP 在 BLIP-2 基础上加入指令微调——让 Q-Former 接收指令作为额外输入:

[图像] + 指令:"这张图里有什么有趣的事?" → Q-Former → LLM → 回答

这让 BLIP-2 的能力更好地迁移到开放性任务。InstructBLIP 是 BLIP 系列的当前主流形态。

三、Flamingo:少样本预训练范式

第5.3 节介绍了 Flamingo 架构。预训练视角的关键点:

Flamingo 的预训练特点

  1. 交错图文数据:M3W(Multi3Web)数据集,模拟网页中图文交错的格式
  2. 少样本格式训练:训练时输入「示例 + 问题 + 答案」,让模型学会 in-context learning
  3. 冻结 LLM 主干:只训 Perceiver Resampler + Gated Cross-Attention

Flamingo 的工程价值

  • 首次证明少样本视觉任务可以接近人类水平
  • 引入「视觉 in-context learning」范式
  • 训练参数效率高

Flamingo 的局限

  • 完全闭源,社区难以复现
  • 主干 Chinchilla 70B 不公开
  • 工程实现复杂

开源复现:Idefics

Hugging Face 的 Idefics 是 Flamingo 的开源复现:

  • Idefics-1:忠实复现 Flamingo 架构
  • Idefics-2:转向早期融合 + 简化设计
  • Idefics-3:进一步配合 LLaMA 3

Idefics 的演化反映了社区从复杂中期融合走向简单早期融合的整体趋势。

四、CoCa:极简多任务范式

第6.4 节介绍了 CoCa 的设计。它的预训练范式特点是:

CoCa 的极简哲学

  • 只两个任务:ITC + LM
  • 双塔 + 解码器分离:对比部分用双塔,生成部分用 Cross-Attention 解码器
  • 从图像中学习多视角:视觉编码器同时输出全局 CLS(用于 ITC)与 patch token(用于 LM)

CoCa 的影响

CoCa 的「对比 + 生成」最小有效集思想影响了后续 PaLI、PaLM-E 等 Google 系模型。它证明了多任务训练不必复杂——两个互补的任务就能学到综合能力。

五、PaLI:超大规模多任务

Google 的 PaLI(Pathways Language and Image)系列把规模推到极致:

PaLI 17B / 55B

  • 视觉编码器:ViT-22B(参数 22B)
  • LLM:mT5 或 PaLM 540B
  • 训练数据:100 亿对图文(WebLI)
  • 多语言支持:100+ 种语言

PaLI 的设计选择

  • 视觉编码器超大:22B 参数,验证「视觉侧也值得投入」
  • 多任务训练:字幕、VQA、分类、分割等
  • 原生多分辨率:支持高分辨率文档

PaLI 的工程启示

PaLI 的核心论点是「视觉编码器是 MLLM 的隐藏瓶颈」——传统认为 LLM 才是关键,但 PaLI 证明视觉编码器做大也能显著提升效果。这一观察后来被 InternViT 等工作进一步验证。

六、PaLM-E:具身多模态

Google 的 PaLM-E 把多模态预训练扩展到具身智能(Embodied AI)

  • 辺以 PaLM(540B)为 LLM
  • 输入:图像、机器人状态、文本指令
  • 输出:机器人动作序列

PaLM-E 的设计思想

  • 连续状态(如机器人关节角度)也 token 化
  • 让 LLM 直接输出动作 token
  • 训练数据:机器人轨迹 + 文本指令 + 视觉观测

PaLM-E 的工程启示

PaLM-E 证明了「LLM 可以作为具身智能的决策中枢」——只要把所有输入输出都 token 化,LLM 的推理能力可以直接迁移到机器人控制。这是第8章「多模态 Agent」的重要前奏。

七、SimVLM:极简生成范式

SimVLM(Simple Visual Language Model)走得更极端——完全放弃 ITC/ITM,只用 LM:

  • 输入:图像 patch + 文本 token
  • 损失:纯自回归 LM
  • 训练:端到端,从零开始

SimVLM 的发现:在大规模数据下,纯 LM 也能学到与多任务训练相当的能力。这呼应了 NLP 领域 GPT 取代 BERT 的趋势。

八、PaLI-3:效率优先

PaLI-3 在 PaLI 基础上转向效率优先

  • 视觉编码器换为 SigLIP(替代 ViT-22B)
  • 模型规模大幅缩小
  • 引入对比预训练
  • 在多任务上达到接近 PaLI 的效果

PaLI-3 的演化反映了「从堆规模到优化效率」的范式转变——不是无限堆大,而是找最优组合。

九、当代预训练范式对比

模型 主任务 视觉编码器 LLM 训练数据 特色
BLIP-2 ITC+ITM+ITG+LM EVA-CLIP-G (冻结) OPT/FlanT5 (冻结) LAION+CC+COCO Q-Former 解耦
Flamingo LM NFNet (冻结) Chinchilla (冻结) M3W 少样本 in-context
CoCa ITC+LM ViT (训练) mT5 (训练) WebLI 极简双任务
PaLI 17B 多任务 ViT-22B mT5/PaLM WebLI 视觉侧超大
PaLI-3 ITC+LM SigLIP mT5 WebLI 效率优先
PaLM-E LM ViT PaLM 具身数据 具身多模态
LLaVA LM (指令) CLIP/SigLIP (微调) LLaMA (微调) LAION-COCO+指令 复用组件
InternVL LM (指令) InternViT-6B InternLM/Qwen 多源 大视觉塔

十、预训练范式演化趋势

观察 SOTA 模型,预训练范式的演化方向:

  1. 从多任务到简化:早期 ALBEF/BLIP 用 3-4 个任务,当代 LLaVA 等只用 LM
  2. 从端到端到组件复用:复用 CLIP/SigLIP 视觉塔 + LLaMA/Qwen LLM,只训中间桥接
  3. 从单一模态到多模态联合:GPT-4o、Gemini 等原生多模态联合训练
  4. 从纯预训练到指令微调:预训练 + 指令微调 + RLHF 三段式成为标配
  5. 从规模到效率:PaLI-3、MiniCPM-V 等追求效率而非单纯规模

十一、预训练数据的关键性

当代预训练模型能力差距,很大程度上是数据差距

  • GPT-4o:OpenAI 内部高质量多模态数据(未公开)
  • Gemini:Google 内部 WebLI 等高质量数据
  • LLaVA:LAION-COCO + ShareGPT 等开源数据
  • Qwen-VL:阿里内部中文场景数据
  • InternVL:上海 AI Lab 多源融合数据

数据质量、规模、多样性三个维度决定上限。数据是当代多模态大模型最大的护城河,也是开源生态最大的挑战。

十二、对未来研究的启示

预训练范式演化给我们的启示:

  1. 简单范式 + 好数据 + 大算力往往胜过复杂范式——LLaVA、CoCa 都印证了这点
  2. 组件复用降低门槛——复用 CLIP + LLaMA 让小团队也能做 MLLM
  3. 视觉编码器是被低估的瓶颈——PaLI、InternViT 等证明这点
  4. 指令微调 + RLHF 比预训练任务更重要——这是第7章的主题
  5. 原生多模态是未来方向——GPT-4o、Gemini 引领

小结

预训练范式经历了「多任务联合(ALBEF/BLIP)→ 极简生成(CoCa)→ 组件复用(LLaVA)→ 原生多模态(GPT-4o)」的演化。当代主流是「复用预训练视觉编码器 + LLM + 指令微调」,但视觉编码器单独预训练仍用多任务思想。数据质量是当代模型最大的护城河。

第6章到此结束。下一章(第7章)我们进入指令微调与人类对齐——看预训练好的模型如何学会「听话」。


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U