1.3 多模态发展简史与技术演进


文档摘要

1.3 多模态发展简史与技术演进 理解多模态大模型最好的方式之一,是看它「怎么演化成今天这样」。本节把 2014 年至今的代表性工作划成三个阶段,每个阶段对应一种主导思想。 一、阶段划分总览 下面逐一展开。 二、阶段一:判别式融合(2014–2018) 主导思想:把视觉特征塞进 BERT 这一阶段的标志是 VisualBERT、ViLBERT、LXMERT 等一系列「视觉-语言预训练(VLP)」模型。

1.3 多模态发展简史与技术演进

理解多模态大模型最好的方式之一,是看它「怎么演化成今天这样」。本节把 2014 年至今的代表性工作划成三个阶段,每个阶段对应一种主导思想。

一、阶段划分总览

下面逐一展开。

二、阶段一:判别式融合(2014–2018)

主导思想:把视觉特征塞进 BERT

这一阶段的标志是 VisualBERT、ViLBERT、LXMERT 等一系列「视觉-语言预训练(VLP)」模型。它们的共同做法是:

  1. 用一个目标检测器(如 Faster R-CNN)从图像中抠出若干区域提议(region proposals)
  2. 每个区域用一个向量表示
  3. 把这些视觉向量与文本 token 拼接,喂进一个 BERT 风格的双向 Transformer
  4. 用「图文匹配 + 掩码语言建模」等任务预训练

典型架构示意

[图像] → Faster R-CNN → [区域1向量, 区域2向量, ...] ↓ 拼接 ↓ [文本] → 分词 → [token1, token2, ...] ↓ BERT 双向 Transformer ↓ [ITM 头] / [MLM 头] / 下游任务头

这一阶段的历史贡献

  • 证明了视觉与语言可以共享一个 Transformer 主干
  • 建立了「视觉 token」这一抽象——后续所有多模态模型都继承了它
  • 积累下VQA、RefCOCO、NLVR 等经典下游基准

致命局限

  • 依赖目标检测器作为视觉前端,速度慢、上限被检测器卡死
  • 检测器只能抠出「显著性物体」,丢失了背景、纹理、空间结构等信息
  • 输出是封闭类别或短语,没有真正的语言生成能力

这一阶段可以总结为「重感知、轻生成、强依赖外部检测器」。

三、阶段二:对比对齐(2019–2021)

主导思想:用对比学习让图文同空间

2021 年 OpenAI 发表 CLIP(Contrastive Language–Image Pre-training)是这一阶段的里程碑。它的革命性在于:

  1. 抛弃目标检测器,直接用 ViT 或 ResNet 把整张图编码成一个全局向量
  2. 抛弃多任务头,只学一个目标——把图与对应文本拉近、与不对应文本推远
  3. 学到的对齐空间天然支持零样本检索与分类

CLIP 的极简结构

[图像] → 视觉编码器 → 图像向量 I ↓ 余弦相似度矩阵 ↑ [文本] → 文本编码器 → 文本向量 T

训练目标就一行:

\mathcal{L} = -\frac{1}{2}\left[\log\frac{\exp(I_i \cdot T_i / \tau)}{\sum_j \exp(I_i \cdot T_j / \tau)} + \log\frac{\exp(I_i \cdot T_i / \tau)}{\sum_j \exp(I_j \cdot T_i / \tau)}\right]

其中 \tau 是温度系数。详细的数学推导见第4章。

这一阶段的代表工作

  • CLIP(OpenAI, 2021):奠基性双塔对比模型
  • ALIGN(Google, 2021):用十亿级噪声图文对训练,证明规模化有效
  • Florence(Microsoft, 2021):把对比学习扩展到检测、分割等细粒度任务
  • DINO / DINOv2(Meta, 2021/2023):自监督版本,学到的视觉特征质量极高
  • SigLIP(Google, 2023):把 softmax 对比换成 sigmoid,显著提升 batch 效率

这一阶段的历史贡献

  • 让「视觉向量」与「语言向量」第一次进入同一语义空间
  • 提供了零样本分类这种全新能力:把分类问题转成「图像与 prompt『一张猫的照片』哪个相似度更高」
  • 为后续生成式多模态大模型提供了现成的视觉编码器——几乎所有 MLLM 都用 CLIP/SigLIP 系编码器作为视觉前端

局限

  • 输出仍然是相似度,没有生成能力
  • 对齐是「全局对齐」,缺乏细粒度区域与短语对应
  • 推理能力弱,做不了 VQA 这类需要多步推理的任务

这一阶段是「对齐为王、不重生成」。

四、阶段三:生成式大模型(2022 至今)

主导思想:以 LLM 为中枢,端到端生成

2022 年起,随着 GPT-3、PaLM 等大语言模型成熟,研究界意识到——与其重新设计多模态专用网络,不如把 LLM 当作通用推理引擎,把视觉信号当作输入 token 喂进去。于是出现了三条技术子路线:

子路线 A:Cross-Attention 桥接

代表:Flamingo(DeepMind, 2022)

在冻结的 LLM 中插入新的 Cross-Attention 层,让 LLM 在生成每个 token 时去查询视觉特征。

[图像] → 视觉编码器 → 视觉特征 K, V ↓ [文本] → 冻结的 LLM 层 ─→ 新增 Cross-Attention(Q来自文本) ─→ 输出

优点:训练参数少;缺点:架构修改复杂。

子路线 B:Q-Former 重采样

代表:BLIP-2(Salesforce, 2023)

引入一个轻量的 Q-Former 模块,用一组可学习的 query 去「抽取」固定数量的视觉 token,再把它们映射到 LLM 词表空间。

[图像] → 冻结的视觉编码器 → 图像特征 ↓ 可学习 query → [Q-Former] → 固定数量视觉 token ↓ 线性投影 → LLM 输入空间

优点:把任意数量的图像特征压成固定数量 token,计算高效;缺点:Q-Former 训练较复杂。

子路线 C:线性投影直连

代表:LLaVA(微软 + 威斯康星大学, 2023)

最简洁的方案——直接用一个线性层或 MLP,把视觉编码器输出的每个 patch token 投影到 LLM 词表空间,与文本 token 拼接后送进 LLM。

[图像] → CLIP ViT → patch 特征序列 [N, D] ↓ MLP 投影 [N, D'] ↓ 拼接到文本 token 前面 → LLM → 文本输出

优点:实现极简、效果惊艳,开源生态主流;缺点:视觉 token 数量受 ViT patch 数限制,长视频场景下开销大。

这三条子路线在工程上的差异,会在第5章详细对比。

这一阶段的代表工作

  • Flamingo(2022):少样本视觉对话的破局者
  • BLIP-2(2023):Q-Former 范式确立
  • MiniGPT-4(2023):BLIP-2 + Vicuna 的精简组合
  • LLaVA / LLaVA-1.5 / LLaVA-NeXT(2023–2024):开源视觉指令微调标杆
  • Qwen-VL / Qwen2-VL(2023–2024):阿里达摩院系列,动态分辨率创新
  • InternVL(2024+):上海 AI Lab 系列,大规模视觉编码器
  • GPT-4V / GPT-4o(2023–2024):OpenAI 闭源旗舰
  • Gemini 1.5/2.x(2024–2025):Google 原生多模态路线

这一阶段的核心特征

  1. 以 LLM 为中枢 —— 推理与生成能力继承自大语言模型
  2. 视觉编码器冻结或微调 —— 大多直接复用 CLIP/SigLIP
  3. 指令微调成为标配 —— 让模型学会跟随人类开放性指令
  4. 从「图+文→文」向「任意→任意」演化 —— GPT-4o、Gemini 已支持图像/音频输出

五、三代范式的对照表

维度 阶段一 判别式融合 阶段二 对比对齐 阶段三 生成式大模型
时间 2014–2018 2019–2021 2022 至今
视觉前端 目标检测器 ViT / ResNet 冻结的 CLIP/SigLIP
主干 双向 BERT 双塔独立编码器 大语言模型(LLM)
输出 类别/短语 相似度 开放性自然语言
训练目标 ITM + MLM InfoNCE 对比 自回归 + 指令微调
零样本能力 强(检索/分类) 极强(开放问答)
代表 ViLBERT、LXMERT CLIP、ALIGN LLaVA、GPT-4V

六、本教程后续章节与三阶段的对应

每个后续章节都会回扣本章的三阶段框架,告诉你它在解决哪一代的核心问题。

小结

多模态模型经历了「判别式融合 → 对比对齐 → 生成式大模型」三代演进。每一代不是推翻前一代,而是把前一代的成果作为地基——CLIP 复用了 ViT 视觉编码器,LLaVA 又复用了 CLIP 编码器。理解这条「累积式演进」的脉络,能帮你快速判断任何新模型的位置与贡献。

下一节(1.4)我们把镜头拉到当下,看看 2024–2026 这一代前沿模型长什么样。


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U