1.3 多模态发展简史与技术演进 理解多模态大模型最好的方式之一,是看它「怎么演化成今天这样」。本节把 2014 年至今的代表性工作划成三个阶段,每个阶段对应一种主导思想。 一、阶段划分总览 下面逐一展开。 二、阶段一:判别式融合(2014–2018) 主导思想:把视觉特征塞进 BERT 这一阶段的标志是 VisualBERT、ViLBERT、LXMERT 等一系列「视觉-语言预训练(VLP)」模型。
理解多模态大模型最好的方式之一,是看它「怎么演化成今天这样」。本节把 2014 年至今的代表性工作划成三个阶段,每个阶段对应一种主导思想。
下面逐一展开。
这一阶段的标志是 VisualBERT、ViLBERT、LXMERT 等一系列「视觉-语言预训练(VLP)」模型。它们的共同做法是:
[图像] → Faster R-CNN → [区域1向量, 区域2向量, ...] ↓ 拼接 ↓ [文本] → 分词 → [token1, token2, ...] ↓ BERT 双向 Transformer ↓ [ITM 头] / [MLM 头] / 下游任务头
这一阶段可以总结为「重感知、轻生成、强依赖外部检测器」。
2021 年 OpenAI 发表 CLIP(Contrastive Language–Image Pre-training)是这一阶段的里程碑。它的革命性在于:
[图像] → 视觉编码器 → 图像向量 I ↓ 余弦相似度矩阵 ↑ [文本] → 文本编码器 → 文本向量 T
训练目标就一行:
其中 \tau 是温度系数。详细的数学推导见第4章。
这一阶段是「对齐为王、不重生成」。
2022 年起,随着 GPT-3、PaLM 等大语言模型成熟,研究界意识到——与其重新设计多模态专用网络,不如把 LLM 当作通用推理引擎,把视觉信号当作输入 token 喂进去。于是出现了三条技术子路线:
代表:Flamingo(DeepMind, 2022)
在冻结的 LLM 中插入新的 Cross-Attention 层,让 LLM 在生成每个 token 时去查询视觉特征。
[图像] → 视觉编码器 → 视觉特征 K, V ↓ [文本] → 冻结的 LLM 层 ─→ 新增 Cross-Attention(Q来自文本) ─→ 输出
优点:训练参数少;缺点:架构修改复杂。
代表:BLIP-2(Salesforce, 2023)
引入一个轻量的 Q-Former 模块,用一组可学习的 query 去「抽取」固定数量的视觉 token,再把它们映射到 LLM 词表空间。
[图像] → 冻结的视觉编码器 → 图像特征 ↓ 可学习 query → [Q-Former] → 固定数量视觉 token ↓ 线性投影 → LLM 输入空间
优点:把任意数量的图像特征压成固定数量 token,计算高效;缺点:Q-Former 训练较复杂。
代表:LLaVA(微软 + 威斯康星大学, 2023)
最简洁的方案——直接用一个线性层或 MLP,把视觉编码器输出的每个 patch token 投影到 LLM 词表空间,与文本 token 拼接后送进 LLM。
[图像] → CLIP ViT → patch 特征序列 [N, D] ↓ MLP 投影 [N, D'] ↓ 拼接到文本 token 前面 → LLM → 文本输出
优点:实现极简、效果惊艳,开源生态主流;缺点:视觉 token 数量受 ViT patch 数限制,长视频场景下开销大。
这三条子路线在工程上的差异,会在第5章详细对比。
| 维度 | 阶段一 判别式融合 | 阶段二 对比对齐 | 阶段三 生成式大模型 |
|---|---|---|---|
| 时间 | 2014–2018 | 2019–2021 | 2022 至今 |
| 视觉前端 | 目标检测器 | ViT / ResNet | 冻结的 CLIP/SigLIP |
| 主干 | 双向 BERT | 双塔独立编码器 | 大语言模型(LLM) |
| 输出 | 类别/短语 | 相似度 | 开放性自然语言 |
| 训练目标 | ITM + MLM | InfoNCE 对比 | 自回归 + 指令微调 |
| 零样本能力 | 弱 | 强(检索/分类) | 极强(开放问答) |
| 代表 | ViLBERT、LXMERT | CLIP、ALIGN | LLaVA、GPT-4V |
每个后续章节都会回扣本章的三阶段框架,告诉你它在解决哪一代的核心问题。
多模态模型经历了「判别式融合 → 对比对齐 → 生成式大模型」三代演进。每一代不是推翻前一代,而是把前一代的成果作为地基——CLIP 复用了 ViT 视觉编码器,LLaVA 又复用了 CLIP 编码器。理解这条「累积式演进」的脉络,能帮你快速判断任何新模型的位置与贡献。
下一节(1.4)我们把镜头拉到当下,看看 2024–2026 这一代前沿模型长什么样。