6.2 掩码语言与图像建模


文档摘要

6.2 掩码语言与图像建模 掩码建模(Masked Modeling)是另一类重要的预训练任务——它不直接预测匹配,而是通过「遮住一部分,预测被遮住的内容」来学习理解。本节梳理 MLM(掩码语言建模)与 MIM(掩码图像建模)两大任务家族。 一、MLM:掩码语言建模 任务定义 MLM 来自 BERT——随机遮住输入文本中 15% 的 token,让模型根据上下文预测被遮住的内容: 形式化为多分类问题(类别 = 词表大小): $$ \mathcal{L}\text{MLM} = -\sum{i \in M} \log p(xi | x{\setminus M}) $$ 其中 $M$ 是被遮住的位置集合,$x{\setminus M}$ 是未被遮住的部分。

6.2 掩码语言与图像建模

掩码建模(Masked Modeling)是另一类重要的预训练任务——它不直接预测匹配,而是通过「遮住一部分,预测被遮住的内容」来学习理解。本节梳理 MLM(掩码语言建模)与 MIM(掩码图像建模)两大任务家族。

一、MLM:掩码语言建模

任务定义

MLM 来自 BERT——随机遮住输入文本中 15% 的 token,让模型根据上下文预测被遮住的内容:

输入: "The [MASK] sat on the mat" 目标: 预测 [MASK] = "cat"

形式化为多分类问题(类别 = 词表大小):

\mathcal{L}_\text{MLM} = -\sum_{i \in M} \log p(x_i | x_{\setminus M})

其中 M 是被遮住的位置集合,x_{\setminus M} 是未被遮住的部分。

MLM 在多模态中的扩展:视觉条件 MLM

纯文本 MLM 只用文本上下文。多模态版本加入图像作为额外条件

[图像: 猫坐在垫子上] + 文本: "The [MASK] sat on the mat" 模型可以根据图像判断 [MASK] = "cat"

形式化:

p(x_i | x_{\setminus M}, I)

模型需要同时利用文本上下文与图像内容来预测被遮住的词。这种任务强制模型建立视觉与语言的细粒度对应

  • 看到「橘色」+ 图中橘色的猫,预测 [MASK] = 「橘色」
  • 看到图中的猫 + 「[MASK] sat on the mat」,预测 [MASK] = 「cat」

MLM 学到什么

  • 双向理解:模型可以同时看遮住位置的左右上下文(vs GPT 的单向)
  • 跨模态对应:视觉条件 MLM 强制模型把图像区域与文本词对齐
  • 细粒度语义:要预测具体词,必须理解词的具体含义

代表工作

  • VisualBERT、ViLBERT:把图像 region 与文本 token 一起送进 BERT,做 MLM
  • ALBEF:在融合编码器上做视觉条件 MLM
  • BLIP:在 Q-Former 阶段加入 MLM 目标

二、MIM:掩码图像建模

MIM 是 MLM 思想到视觉的延伸——遮住一部分图像 patch,让模型预测被遮住的内容。

任务定义

原图: 完整的 14×14 patch 网格 随机遮住 30%-75% patch 目标: 预测被遮住 patch 的内容

形式化:

\mathcal{L}_\text{MIM} = \sum_{i \in M} \mathcal{D}(f(I_{\setminus M})_i, I_i)

其中 \mathcal{D} 是某种距离/损失(如 L2、交叉熵),f 是模型,I_i 是被遮住 patch 的真实内容。

MIM 的两种实现

实现一:预测像素值(MAE)

MAE(Masked Autoencoder) 是 He Kaiming 等人 2021 年提出的工作。它直接预测被遮住 patch 的原始像素值

遮住 75% patch → encoder 只处理 25% 可见 patch → decoder 重建被遮住的像素

MAE 的核心洞察:视觉信息高度冗余——遮住 75% 仍然能重建。这种高掩码率强制模型学习真正的语义理解,而不是简单插值。

实现二:预测离散 token(BEiT)

BEiT 借鉴 BERT 的思路,把图像 patch 转成离散 token(用 VQ-VAE 风格的 tokenizer),然后预测 token:

原图 → 视觉 tokenizer → 离散 token 序列 遮住部分 patch → 模型预测被遮住 patch 的 token

这种形式更接近 BERT 的 MLM,与文本预训练范式统一。

MIM 学到什么

  • 视觉上下文理解:根据可见 patch 推断被遮住区域
  • 空间结构感知:理解物体的形状、纹理、空间布局
  • 视觉常识:知道「猫的脸通常有两只眼睛、一个鼻子」

MIM 在多模态中的角色

MIM 主要用于纯视觉预训练(DINO、MAE、BEiT),但在多模态里也有应用:

  • 视觉编码器预训练:先用 MIM 在纯图像上训视觉塔,再用对比学习对齐
  • 多模态联合训练:把 MIM 作为多任务之一(如 BLIP-2 的视觉塔用 MIM 预训练)

DINOv2 把 DINO(自蒸馏)+ iBOT(MIM 变体)联合训练,得到质量极高的视觉表征——这是 MIM 在自监督视觉预训练中的成功案例。

三、MLM 与 MIM 的共同特点

特点一:双向编码

MLM 与 MIM 都用双向编码器——模型可以看遮住位置的全局上下文(左 + 右,或四周 patch)。这与 GPT 的「因果单向」相反。

双向编码适合理解任务,但不适合生成任务(生成需要从左到右逐 token 输出,不能看未来)。这是 BERT 类模型不能直接做生成的原因。

特点二:高掩码率

视觉 MIM 可以用极高掩码率(75%),因为视觉信息冗余。文本 MLM 通常用 15%——文本信息密度高,遮太多就猜不出了。

特点三:非生成式

MLM 与 MIM 不直接生成序列,而是预测被遮住的部分。这种「填空」式训练没有顺序生成的概念,因此训练效率比自回归高(一次预测所有遮住位置)。

四、MLM/MIM vs LM:训练范式之争

MLM/MIM 与 LM(Language Modeling,下一 token 预测)是两种根本不同的训练范式:

维度 MLM/MIM LM (NTP)
任务 填空 续写
编码 双向 单向
训练效率 高(一次预测多个) 低(逐 token)
生成能力 弱(不能直接生成) 强(自回归生成)
理解能力 中-强
代表模型 BERT、MAE、BEiT GPT、LLaMA
多模态代表 VisualBERT、ALBEF LLaVA、BLIP-2

历史之争

2018-2020 年,BERT(MLM)与 GPT(LM)路线有过激烈争论。早期 BERT 在理解任务上更强,但 GPT-3 的出现证明:

当模型足够大、数据足够多时,LM(生成式)在理解任务上也不输 MLM,而且还能生成。

这个发现让 LM 逐渐成为主流。当代大语言模型(LLaMA、Qwen、Mistral)几乎都用 LM。多模态大模型(LLaVA、BLIP-2)也跟着用 LM。

MLM/MIM 没有完全消失

虽然 LM 占主流,但 MLM/MIM 仍在以下场景使用:

  1. 视觉编码器预训练:MAE、BEiT、DINOv2 仍是主流
  2. 特殊理解任务:某些需要强双向理解的任务(如 NER、关系抽取)仍用 BERT 风格
  3. 多任务训练的一个组件:BLIP-2 等模型在阶段一仍用 MLM 类目标

五、MLM 在多模态预训练中的具体应用

以 ALBEF 为例,它的多任务训练包含 MLM:

ALBEF 训练目标: 1. ITC (对比学习) 2. ITM (匹配判断) 3. LM (字幕生成) 4. MLM (视觉条件掩码语言建模)

MLM 任务的设计:

输入: [图像] + "[CLS] the [MASK] sat on [MASK] mat [SEP]" 任务: 预测两个 [MASK] 位置的 token

模型必须结合图像与未遮住文本来预测。例如:

  • 图中是橘色的猫 → 第一个 [MASK] = "cat"
  • 图中垫子是蓝色的 → 第二个 [MASK] = "blue" 或 "the"

这种任务强制模型建立视觉区域与文本词的细粒度对应。

六、MIM 在多模态中的挑战

MIM 在纯视觉预训练很成功,但在多模态中面临几个挑战:

挑战一:与文本对齐难

MIM 学到的视觉表征质量高,但不一定与语言空间对齐。DINOv2 比 CLIP 表征更细,但直接用于跨模态检索效果差。

挑战二:计算开销

MIM 需要重建像素或 token,decoder 部分增加计算。在大规模多模态训练中,这部分开销往往被砍掉(如 LLaVA 直接用 CLIP 视觉塔,不做 MIM)。

挑战三:与 LM 兼容性

LM 范式主导的当代多模态大模型不太需要 MIM——视觉编码器只需要给 LLM 提供 token,不需要重建像素。

七、当代模型中 MLM/MIM 的地位

观察 2023-2026 主流多模态大模型:

  • LLaVA 系列:完全不用 MLM/MIM,纯 LM 路线
  • BLIP-2:阶段一用 MLM 风格的 ITG,阶段二用 LM
  • CoCa:用 ITC + LM,不用 MLM
  • PaLI:纯 LM
  • InternViT:视觉塔单独用 MIM + 对比预训练

可以看到,MLM/MIM 的使用正在减少,但视觉编码器单独预训练时仍重要。DINOv2、SigLIP-2 等高质量视觉编码器仍在用 MIM 类目标。

八、混合范式:MLM + LM

有些工作尝试同时用 MLM 与 LM,例如 GLM(智谱):

自回归空白填充:随机遮住一段连续 token,让模型自回归地填回去

这种范式兼具 MLM 的双向理解与 LM 的生成能力,是 BERT 与 GPT 之间的折中。GLM 系列在国内多模态大模型(如 CogVLM)中是重要基础。

九、选哪种任务:经验总结

如果你在做多模态预训练,任务选择的建议:

目标 推荐任务
学全局对齐 ITC(对比学习)
学细粒度判别 ITM
学文本理解 MLM
学视觉理解 MIM
学跨模态生成 LM / ITG
学综合能力 多任务联合(如 ALBEF)
复用 LLM 时代范式 纯 LM(如 LLaVA)

小结

MLM 与 MIM 是「填空式」预训练任务,强调双向理解与细粒度语义。它们在 BERT 时代是主流,但在 GPT-3 之后的 LM 时代逐渐让位于生成式任务。多模态预训练中,MLM/MIM 仍作为视觉编码器单独预训练或多任务训练的一个组件使用,但不再是主导目标。

下一节(6.3)我们看生成式任务——图像描述生成与自回归训练,这是当代多模态大模型的主流路线。


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U