6.4 多任务联合预训练策略 单任务训练的模型能力单一——纯 ITC 模型不会生成,纯 LM 模型对齐质量差。当代多模态预训练几乎都是多任务联合训练——同时优化多个目标,让模型获得综合能力。本节梳理多任务联合训练的策略与代表工作。 一、多任务联合的动机 不同任务学到不同能力: 任务 | 学到的能力 ITC | 全局对齐、零样本检索 ITM | 细粒度判别、硬负样本区分 MLM | 双向理解、视觉-语言对应 LM/ITG | 生成能力、开放性回答 MIM | 视觉上下文理解 只训一个任务,模型就只有那种能力。多任务联合让模型同时具备多种能力,且各能力相互促进——例如 MLM 学到的细粒度对应能提升 LM 的生成质量。
单任务训练的模型能力单一——纯 ITC 模型不会生成,纯 LM 模型对齐质量差。当代多模态预训练几乎都是多任务联合训练——同时优化多个目标,让模型获得综合能力。本节梳理多任务联合训练的策略与代表工作。
不同任务学到不同能力:
| 任务 | 学到的能力 |
|---|---|
| ITC | 全局对齐、零样本检索 |
| ITM | 细粒度判别、硬负样本区分 |
| MLM | 双向理解、视觉-语言对应 |
| LM/ITG | 生成能力、开放性回答 |
| MIM | 视觉上下文理解 |
只训一个任务,模型就只有那种能力。多任务联合让模型同时具备多种能力,且各能力相互促进——例如 MLM 学到的细粒度对应能提升 LM 的生成质量。
[图像] →┐ ├→ 共享编码器 → [ITC 头 / ITM 头 / MLM 头 / LM 头] [文本] →┘
各任务共享底层编码器,只在最后接不同的任务头。优点是参数效率高、训练简单;缺点是不同任务可能相互干扰。
代表:ALBEF、BLIP
[图像] → 视觉塔 → 视觉向量 ──┐ ├→ ITC [文本] → 文本塔 → 文本向量 ──┘ ↓ 独立的 LM 头负责生成
视觉塔与文本塔独立训练(双塔),但都参与 ITC 损失;生成部分用独立的多模态解码器。
代表:CoCa、PaLI
ALBEF(Align Before Fuse)2021 年发布,是多任务联合训练的经典之作。它的设计哲学是「先用对比学习对齐,再融合」:
ALBEF 先用 ITC 让视觉与文本对齐到同一空间,再做 ITM 与 MLM 的融合。这种「先对齐后融合」让融合编码器更容易学到细粒度对应。
ALBEF 引入动量编码器——一个慢速更新的教师模型,生成软标签:
软标签来自动量编码器对同一批样本的预测。这种蒸馏让训练更稳定,避免硬标签的噪声。
ALBEF 用动量编码器预先计算图文相似度,故意挑选相似但不匹配的图文对作为硬负样本,提升 ITM 训练效果。
每个 batch 同时计算三个损失:
Loss = α · L_ITC + β · L_ITM + γ · L_MLM
三个权重 α, β, γ 控制不同任务的相对重要性。ALBEF 通过实验找到最优配比。
BLIP(Bootstrapping Language-Image Pre-training)2022 年发布,在 ALBEF 基础上加入了**自举(bootstrapping)**机制:
单个模型同时承担三种角色:
通过共享底层 + 不同任务头实现「一模型多用」。
BLIP 发现网络爬取的图文对质量参差不齐。它的解决方案:
这种自举让 BLIP 从噪声数据中蒸馏出高质量训练集,效果显著优于直接训练。
CoCa(Contrastive Captioners)2022 年发布,结构更简洁:
CoCa 把多模态预训练简化为两个任务:对比 + 字幕:
不做 ITM、不做 MLM。这种极简组合在实验中表现出色——证明了「对比 + 生成」是多任务训练的最小有效集。
| 维度 | ALBEF | BLIP | CoCa |
|---|---|---|---|
| 任务数 | 3 (ITC+ITM+MLM) | 3 (ITC+ITM+LM) | 2 (ITC+LM) |
| 融合方式 | 共享编码器 | MED 多头 | 双塔 + 解码器 |
| 数据增强 | 动量蒸馏 | 自举 | 无 |
CoCa 的简化思路影响了后续 PaLI、PaLM-E 等模型。
不同任务的损失尺度可能差几个数量级。例如 ITC 损失可能稳定在 2-3,而 LM 损失可能在 1-5 之间波动。直接相加会让某个任务主导训练。
解决方案:
某些任务可能要求模型学相反的东西。例如:
这种冲突需要架构设计来缓解(如 CoCa 用分离的双塔 + 解码器)。
不同任务的训练数据量可能不同。COCO 有 12 万对,LAION 有 50 亿对。直接混合训练会让大数据任务主导。
解决方案:
多任务训练容易出现损失发散。常见稳定技巧:
主流数据集:
| 数据集 | 规模 | 类型 | 质量 |
|---|---|---|---|
| COCO Captions | 12 万对 | 人工标注 | 高 |
| Visual Genome | 10 万对 | 人工标注 + region | 高 |
| CC3M | 300 万对 | 自动爬取 | 中 |
| CC12M | 1200 万对 | 自动爬取 | 中 |
| LAION-400M | 4 亿对 | 自动爬取 | 低-中 |
| LAION-5B | 50 亿对 | 自动爬取 | 低-中 |
| LAION-COCO | 6 亿对 | 合成字幕 | 中-高 |
| WebLI | 100 亿对 | Google 内部 | 中-高 |
| DataComp | 多个尺度 | 经过严格过滤 | 中-高 |
DataComp 等基准证明:相同模型与算力下,数据质量能带来 5-15 个点的提升。
多任务训练通常混合多种数据:
按比例混合,例如 LLaVA-1.5 的训练数据包含 558K 字幕数据 + 158K 对话 + 450K Instruct 数据。
ALBEF、BLIP 等模型从头到尾同时优化所有任务。
BLIP-2 把训练分为两阶段——表示学习 + 生成学习。每阶段用不同任务组合。
LLaVA 等模型用三阶段:
这种「预训练→指令微调→对齐」的三段式已成为当代多模态大模型的标准流程,与 LLM 训练范式高度一致。
虽然 ALBEF、BLIP 等模型证明了多任务训练的价值,但当代多模态大模型正在简化训练流程:
简化的原因是:
但视觉编码器单独预训练时仍用多任务(如 SigLIP-2 用对比 + 多分辨率),这部分多任务思想没有消失。
如果你在做自己的多模态预训练:
| 你的目标 | 推荐方案 |
|---|---|
| 从零训视觉编码器 | ITC + ITM + LM(BLIP 风格) |
| 复用 CLIP/SigLIP,只训投影器 + LLM | 纯 LM 指令微调(LLaVA 风格) |
| 想要细粒度对齐 | 加入 ITM(含硬负样本) |
| 想要零样本检索能力 | 强 ITC(大 batch) |
| 想要强生成能力 | 主 LM,辅以高质量字幕数据 |
多任务联合预训练通过同时优化 ITC、ITM、MLM、LM 等多个目标,让模型获得综合能力。ALBEF、BLIP、CoCa 等经典模型展示了不同任务组合的设计哲学。当代多模态大模型倾向于简化训练流程,复用预训练视觉编码器,以 LM 为主导,但多任务思想在视觉编码器预训练中仍占重要位置。
下一节(6.5)我们速览 BLIP-2、Flamingo、CoCa、PaLI 等预训练范式的当代 SOTA。