第6章 预训练范式:任务设计与优化目标 章节摘要 前几章我们讲清楚了视觉编码器(第3章)、文本编码器(第2章)、对比对齐(第4章)、跨模态融合(第5章)的所有组件。本章聚焦一个核心问题:用什么任务把这些组件训练出来? 多模态大模型(Multimodal Large Language Model, MLLM)的预训练任务设计直接决定了模型的能力上限——图文匹配(ITM)学判别、掩码语言建模(MLM)学理解、图像描述生成学表达、图文对比(ITC)学对齐,每种任务都对应一种特定的能力维度。本章系统梳理多模态预训练的主流任务家族,包括判别式任务(ITM、ITC)、生成式任务(LM、ITG)、掩码建模任务(MLM、MIM),以及它们如何组合成多任务联合预训练(如 BLIP、ALBEF、CoCa)。
前几章我们讲清楚了视觉编码器(第3章)、文本编码器(第2章)、对比对齐(第4章)、跨模态融合(第5章)的所有组件。本章聚焦一个核心问题:用什么任务把这些组件训练出来? 多模态大模型(Multimodal Large Language Model, MLLM)的预训练任务设计直接决定了模型的能力上限——图文匹配(ITM)学判别、掩码语言建模(MLM)学理解、图像描述生成学表达、图文对比(ITC)学对齐,每种任务都对应一种特定的能力维度。本章系统梳理多模态预训练的主流任务家族,包括判别式任务(ITM、ITC)、生成式任务(LM、ITG)、掩码建模任务(MLM、MIM),以及它们如何组合成多任务联合预训练(如 BLIP、ALBEF、CoCa)。我们还会讲解训练数据的关键来源(LAION、CC3M、COCO、WebLI)与质量过滤策略。章末提供 BLIP-2、Flamingo、CoCa 等预训练范式的 SOTA 速览。掌握本章后,你将理解为什么同样的模型结构在不同预训练任务下会产生截然不同的能力。
完成本章后,你应当能够:
本章共 6 个子节,按「判别 → 生成 → 掩码 → 联合 → 数据 → 前沿」的逻辑展开:
子节之间是「单任务 → 多任务 → 工程化」的递进:6.1-6.3 讲单个任务,6.4 把它们组合起来,6.5 看当代 SOTA 是怎么组合的。
前置知识:
后续衔接:
本章是「架构(第2-5章)」与「应用(第7-8章)」之间的能力填充层——架构给了容器,预训练填入能力。