6.2 掩码语言与图像建模 掩码建模(Masked Modeling)是另一类重要的预训练任务——它不直接预测匹配,而是通过「遮住一部分,预测被遮住的内容」来学习理解。本节梳理 MLM(掩码语言建模)与 MIM(掩码图像建模)两大任务家族。 一、MLM:掩码语言建模 任务定义 MLM 来自 BERT——随机遮住输入文本中 15% 的 token,让模型根据上下文预测被遮住的内容: 形式化为多分类问题(类别 = 词表大小): $$ \mathcal{L}\text{MLM} = -\sum{i \in M} \log p(xi | x{\setminus M}) $$ 其中 $M$ 是被遮住的位置集合,$x{\setminus M}$ 是未被遮住的部分。
掩码建模(Masked Modeling)是另一类重要的预训练任务——它不直接预测匹配,而是通过「遮住一部分,预测被遮住的内容」来学习理解。本节梳理 MLM(掩码语言建模)与 MIM(掩码图像建模)两大任务家族。
MLM 来自 BERT——随机遮住输入文本中 15% 的 token,让模型根据上下文预测被遮住的内容:
输入: "The [MASK] sat on the mat" 目标: 预测 [MASK] = "cat"
形式化为多分类问题(类别 = 词表大小):
其中 M 是被遮住的位置集合,x_{\setminus M} 是未被遮住的部分。
纯文本 MLM 只用文本上下文。多模态版本加入图像作为额外条件:
[图像: 猫坐在垫子上] + 文本: "The [MASK] sat on the mat" 模型可以根据图像判断 [MASK] = "cat"
形式化:
模型需要同时利用文本上下文与图像内容来预测被遮住的词。这种任务强制模型建立视觉与语言的细粒度对应:
MIM 是 MLM 思想到视觉的延伸——遮住一部分图像 patch,让模型预测被遮住的内容。
原图: 完整的 14×14 patch 网格 随机遮住 30%-75% patch 目标: 预测被遮住 patch 的内容
形式化:
其中 \mathcal{D} 是某种距离/损失(如 L2、交叉熵),f 是模型,I_i 是被遮住 patch 的真实内容。
MAE(Masked Autoencoder) 是 He Kaiming 等人 2021 年提出的工作。它直接预测被遮住 patch 的原始像素值:
遮住 75% patch → encoder 只处理 25% 可见 patch → decoder 重建被遮住的像素
MAE 的核心洞察:视觉信息高度冗余——遮住 75% 仍然能重建。这种高掩码率强制模型学习真正的语义理解,而不是简单插值。
BEiT 借鉴 BERT 的思路,把图像 patch 转成离散 token(用 VQ-VAE 风格的 tokenizer),然后预测 token:
原图 → 视觉 tokenizer → 离散 token 序列 遮住部分 patch → 模型预测被遮住 patch 的 token
这种形式更接近 BERT 的 MLM,与文本预训练范式统一。
MIM 主要用于纯视觉预训练(DINO、MAE、BEiT),但在多模态里也有应用:
DINOv2 把 DINO(自蒸馏)+ iBOT(MIM 变体)联合训练,得到质量极高的视觉表征——这是 MIM 在自监督视觉预训练中的成功案例。
MLM 与 MIM 都用双向编码器——模型可以看遮住位置的全局上下文(左 + 右,或四周 patch)。这与 GPT 的「因果单向」相反。
双向编码适合理解任务,但不适合生成任务(生成需要从左到右逐 token 输出,不能看未来)。这是 BERT 类模型不能直接做生成的原因。
视觉 MIM 可以用极高掩码率(75%),因为视觉信息冗余。文本 MLM 通常用 15%——文本信息密度高,遮太多就猜不出了。
MLM 与 MIM 不直接生成序列,而是预测被遮住的部分。这种「填空」式训练没有顺序生成的概念,因此训练效率比自回归高(一次预测所有遮住位置)。
MLM/MIM 与 LM(Language Modeling,下一 token 预测)是两种根本不同的训练范式:
| 维度 | MLM/MIM | LM (NTP) |
|---|---|---|
| 任务 | 填空 | 续写 |
| 编码 | 双向 | 单向 |
| 训练效率 | 高(一次预测多个) | 低(逐 token) |
| 生成能力 | 弱(不能直接生成) | 强(自回归生成) |
| 理解能力 | 强 | 中-强 |
| 代表模型 | BERT、MAE、BEiT | GPT、LLaMA |
| 多模态代表 | VisualBERT、ALBEF | LLaVA、BLIP-2 |
2018-2020 年,BERT(MLM)与 GPT(LM)路线有过激烈争论。早期 BERT 在理解任务上更强,但 GPT-3 的出现证明:
当模型足够大、数据足够多时,LM(生成式)在理解任务上也不输 MLM,而且还能生成。
这个发现让 LM 逐渐成为主流。当代大语言模型(LLaMA、Qwen、Mistral)几乎都用 LM。多模态大模型(LLaVA、BLIP-2)也跟着用 LM。
虽然 LM 占主流,但 MLM/MIM 仍在以下场景使用:
以 ALBEF 为例,它的多任务训练包含 MLM:
ALBEF 训练目标: 1. ITC (对比学习) 2. ITM (匹配判断) 3. LM (字幕生成) 4. MLM (视觉条件掩码语言建模)
MLM 任务的设计:
输入: [图像] + "[CLS] the [MASK] sat on [MASK] mat [SEP]" 任务: 预测两个 [MASK] 位置的 token
模型必须结合图像与未遮住文本来预测。例如:
这种任务强制模型建立视觉区域与文本词的细粒度对应。
MIM 在纯视觉预训练很成功,但在多模态中面临几个挑战:
MIM 学到的视觉表征质量高,但不一定与语言空间对齐。DINOv2 比 CLIP 表征更细,但直接用于跨模态检索效果差。
MIM 需要重建像素或 token,decoder 部分增加计算。在大规模多模态训练中,这部分开销往往被砍掉(如 LLaVA 直接用 CLIP 视觉塔,不做 MIM)。
LM 范式主导的当代多模态大模型不太需要 MIM——视觉编码器只需要给 LLM 提供 token,不需要重建像素。
观察 2023-2026 主流多模态大模型:
可以看到,MLM/MIM 的使用正在减少,但视觉编码器单独预训练时仍重要。DINOv2、SigLIP-2 等高质量视觉编码器仍在用 MIM 类目标。
有些工作尝试同时用 MLM 与 LM,例如 GLM(智谱):
自回归空白填充:随机遮住一段连续 token,让模型自回归地填回去
这种范式兼具 MLM 的双向理解与 LM 的生成能力,是 BERT 与 GPT 之间的折中。GLM 系列在国内多模态大模型(如 CogVLM)中是重要基础。
如果你在做多模态预训练,任务选择的建议:
| 目标 | 推荐任务 |
|---|---|
| 学全局对齐 | ITC(对比学习) |
| 学细粒度判别 | ITM |
| 学文本理解 | MLM |
| 学视觉理解 | MIM |
| 学跨模态生成 | LM / ITG |
| 学综合能力 | 多任务联合(如 ALBEF) |
| 复用 LLM 时代范式 | 纯 LM(如 LLaVA) |
MLM 与 MIM 是「填空式」预训练任务,强调双向理解与细粒度语义。它们在 BERT 时代是主流,但在 GPT-3 之后的 LM 时代逐渐让位于生成式任务。多模态预训练中,MLM/MIM 仍作为视觉编码器单独预训练或多任务训练的一个组件使用,但不再是主导目标。
下一节(6.3)我们看生成式任务——图像描述生成与自回归训练,这是当代多模态大模型的主流路线。