6.4 多任务联合预训练策略


文档摘要

6.4 多任务联合预训练策略 单任务训练的模型能力单一——纯 ITC 模型不会生成,纯 LM 模型对齐质量差。当代多模态预训练几乎都是多任务联合训练——同时优化多个目标,让模型获得综合能力。本节梳理多任务联合训练的策略与代表工作。 一、多任务联合的动机 不同任务学到不同能力: 任务 | 学到的能力 ITC | 全局对齐、零样本检索 ITM | 细粒度判别、硬负样本区分 MLM | 双向理解、视觉-语言对应 LM/ITG | 生成能力、开放性回答 MIM | 视觉上下文理解 只训一个任务,模型就只有那种能力。多任务联合让模型同时具备多种能力,且各能力相互促进——例如 MLM 学到的细粒度对应能提升 LM 的生成质量。

6.4 多任务联合预训练策略

单任务训练的模型能力单一——纯 ITC 模型不会生成,纯 LM 模型对齐质量差。当代多模态预训练几乎都是多任务联合训练——同时优化多个目标,让模型获得综合能力。本节梳理多任务联合训练的策略与代表工作。

一、多任务联合的动机

不同任务学到不同能力:

任务 学到的能力
ITC 全局对齐、零样本检索
ITM 细粒度判别、硬负样本区分
MLM 双向理解、视觉-语言对应
LM/ITG 生成能力、开放性回答
MIM 视觉上下文理解

只训一个任务,模型就只有那种能力。多任务联合让模型同时具备多种能力,且各能力相互促进——例如 MLM 学到的细粒度对应能提升 LM 的生成质量。

二、多任务联合的两种方式

方式一:共享编码器,多任务头

[图像] →┐ ├→ 共享编码器 → [ITC 头 / ITM 头 / MLM 头 / LM 头] [文本] →┘

各任务共享底层编码器,只在最后接不同的任务头。优点是参数效率高、训练简单;缺点是不同任务可能相互干扰。

代表:ALBEF、BLIP

方式二:分离塔 + 联合训练

[图像] → 视觉塔 → 视觉向量 ──┐ ├→ ITC [文本] → 文本塔 → 文本向量 ──┘ ↓ 独立的 LM 头负责生成

视觉塔与文本塔独立训练(双塔),但都参与 ITC 损失;生成部分用独立的多模态解码器。

代表:CoCa、PaLI

三、ALBEF:多任务的优雅组合

ALBEF(Align Before Fuse)2021 年发布,是多任务联合训练的经典之作。它的设计哲学是「先用对比学习对齐,再融合」:

ALBEF 的关键创新

创新一:对比对齐在前

ALBEF 先用 ITC 让视觉与文本对齐到同一空间,再做 ITM 与 MLM 的融合。这种「先对齐后融合」让融合编码器更容易学到细粒度对应。

创新二:动量蒸馏

ALBEF 引入动量编码器——一个慢速更新的教师模型,生成软标签:

\mathcal{L}_\text{total} = \alpha \mathcal{L}_\text{hard} + (1-\alpha) \mathcal{L}_\text{soft}

软标签来自动量编码器对同一批样本的预测。这种蒸馏让训练更稳定,避免硬标签的噪声。

创新三:硬负样本挖掘

ALBEF 用动量编码器预先计算图文相似度,故意挑选相似但不匹配的图文对作为硬负样本,提升 ITM 训练效果。

ALBEF 的训练流程

每个 batch 同时计算三个损失:

Loss = α · L_ITC + β · L_ITM + γ · L_MLM

三个权重 α, β, γ 控制不同任务的相对重要性。ALBEF 通过实验找到最优配比。

四、BLIP:多任务 + 自举

BLIP(Bootstrapping Language-Image Pre-training)2022 年发布,在 ALBEF 基础上加入了**自举(bootstrapping)**机制:

BLIP 的两个核心组件

组件一:MED(Multi-task Mixture of Encoder-Decoder)

单个模型同时承担三种角色:

  • 单模态编码器:做 ITC(视觉与文本独立编码)
  • 基于图像的编码器:做 ITM 与 MLM(融合图文,二分类 / 填空)
  • 基于图像的解码器:做 LM(生成文本)

通过共享底层 + 不同任务头实现「一模型多用」。

组件二:字幕生成器 + 过滤器(Captioner + Filter)

BLIP 发现网络爬取的图文对质量参差不齐。它的解决方案:

  1. Captioner:用 MED 的 LM 部分,为网图自动生成高质量字幕
  2. Filter:用 MED 的 ITM 部分,过滤掉原始字幕与图像不匹配的样本
  3. 把生成 + 过滤后的高质量数据加入训练集,重新训练

这种自举让 BLIP 从噪声数据中蒸馏出高质量训练集,效果显著优于直接训练。

BLIP 的工程价值

  • 把 ITC + ITM + LM 三个任务统一在一个模型里
  • 自举机制让小团队也能用噪声数据训出好模型
  • 字幕生成器后来被广泛应用于数据增强

五、CoCa:双塔 + 生成解码器

CoCa(Contrastive Captioners)2022 年发布,结构更简洁:

CoCa 的设计哲学

CoCa 把多模态预训练简化为两个任务:对比 + 字幕

  • 对比(ITC):学全局对齐
  • 字幕(LM):学生成能力

不做 ITM、不做 MLM。这种极简组合在实验中表现出色——证明了「对比 + 生成」是多任务训练的最小有效集。

CoCa 与 ALBEF/BLIP 的差异

维度 ALBEF BLIP CoCa
任务数 3 (ITC+ITM+MLM) 3 (ITC+ITM+LM) 2 (ITC+LM)
融合方式 共享编码器 MED 多头 双塔 + 解码器
数据增强 动量蒸馏 自举

CoCa 的简化思路影响了后续 PaLI、PaLM-E 等模型。

六、多任务训练的工程挑战

挑战一:任务权重调节

不同任务的损失尺度可能差几个数量级。例如 ITC 损失可能稳定在 2-3,而 LM 损失可能在 1-5 之间波动。直接相加会让某个任务主导训练。

解决方案

  • 手动调权(实验找最优配比)
  • 自动权重调节(如 Uncertainty Weighting)
  • GradNorm 等梯度平衡算法

挑战二:任务冲突

某些任务可能要求模型学相反的东西。例如:

  • ITC 鼓励「猫的图」与「cat」向量相同
  • LM 可能要求模型区分「cat」与「a photo of a cat」(生成时需要更细的区分)

这种冲突需要架构设计来缓解(如 CoCa 用分离的双塔 + 解码器)。

挑战三:数据比例

不同任务的训练数据量可能不同。COCO 有 12 万对,LAION 有 50 亿对。直接混合训练会让大数据任务主导。

解决方案

  • 数据采样比例控制(如 1:1:1)
  • 课程学习(先训简单任务,再加难任务)
  • 任务轮换(每 epoch 主任务不同)

挑战四:训练稳定性

多任务训练容易出现损失发散。常见稳定技巧:

  • 梯度裁剪
  • 学习率预热
  • Loss scaling
  • 数值精度控制(bf16 vs fp16)

七、多任务联合训练的数据策略

数据来源

主流数据集:

数据集 规模 类型 质量
COCO Captions 12 万对 人工标注
Visual Genome 10 万对 人工标注 + region
CC3M 300 万对 自动爬取
CC12M 1200 万对 自动爬取
LAION-400M 4 亿对 自动爬取 低-中
LAION-5B 50 亿对 自动爬取 低-中
LAION-COCO 6 亿对 合成字幕 中-高
WebLI 100 亿对 Google 内部 中-高
DataComp 多个尺度 经过严格过滤 中-高

数据质量过滤

  • 去重:感知哈希去除近似重复
  • NSFW 过滤:移除成人内容
  • 美学评分:用 CLIP 美学模型过滤低质量图
  • 文本长度过滤:移除过短或无意义 alt text
  • 匹配度过滤:用 CLIP 计算图文相似度,移除不匹配对

DataComp 等基准证明:相同模型与算力下,数据质量能带来 5-15 个点的提升

数据混合策略

多任务训练通常混合多种数据:

  • 大规模噪声数据(LAION):提供覆盖度
  • 中规模半精数据(CC3M):提供平衡
  • 小规模精标数据(COCO):提供质量

按比例混合,例如 LLaVA-1.5 的训练数据包含 558K 字幕数据 + 158K 对话 + 450K Instruct 数据。

八、训练流程的演化

早期:端到端联合训练

ALBEF、BLIP 等模型从头到尾同时优化所有任务。

中期:两阶段训练

BLIP-2 把训练分为两阶段——表示学习 + 生成学习。每阶段用不同任务组合。

当代:多阶段 + 指令微调

LLaVA 等模型用三阶段:

  1. 视觉-语言预训练:大规模图文对,训投影器
  2. 指令微调:高质量指令数据,训投影器 + LLM
  3. (可选)RLHF:人类偏好数据,进一步对齐

这种「预训练→指令微调→对齐」的三段式已成为当代多模态大模型的标准流程,与 LLM 训练范式高度一致。

九、多任务训练在当代的简化

虽然 ALBEF、BLIP 等模型证明了多任务训练的价值,但当代多模态大模型正在简化训练流程

  • LLaVA:纯 LM(指令微调),不做 ITC/ITM/MLM
  • Qwen-VL:以 LM 为主,少量 ITC
  • InternVL:以 LM 为主
  • GPT-4o/Gemini(推测):原生多模态联合训练

简化的原因是:

  1. 复用已有视觉编码器(CLIP、SigLIP)——对齐阶段已经完成
  2. LLM 提供生成能力——不需要从零训
  3. 指令数据质量提升——LM 训练已经能学到综合能力

视觉编码器单独预训练时仍用多任务(如 SigLIP-2 用对比 + 多分辨率),这部分多任务思想没有消失。

十、为多任务训练选型的建议

如果你在做自己的多模态预训练:

你的目标 推荐方案
从零训视觉编码器 ITC + ITM + LM(BLIP 风格)
复用 CLIP/SigLIP,只训投影器 + LLM 纯 LM 指令微调(LLaVA 风格)
想要细粒度对齐 加入 ITM(含硬负样本)
想要零样本检索能力 强 ITC(大 batch)
想要强生成能力 主 LM,辅以高质量字幕数据

小结

多任务联合预训练通过同时优化 ITC、ITM、MLM、LM 等多个目标,让模型获得综合能力。ALBEF、BLIP、CoCa 等经典模型展示了不同任务组合的设计哲学。当代多模态大模型倾向于简化训练流程,复用预训练视觉编码器,以 LM 为主导,但多任务思想在视觉编码器预训练中仍占重要位置。

下一节(6.5)我们速览 BLIP-2、Flamingo、CoCa、PaLI 等预训练范式的当代 SOTA。


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U