第6章 预训练范式:任务设计与优化目标


文档摘要

第6章 预训练范式:任务设计与优化目标 章节摘要 前几章我们讲清楚了视觉编码器(第3章)、文本编码器(第2章)、对比对齐(第4章)、跨模态融合(第5章)的所有组件。本章聚焦一个核心问题:用什么任务把这些组件训练出来? 多模态大模型(Multimodal Large Language Model, MLLM)的预训练任务设计直接决定了模型的能力上限——图文匹配(ITM)学判别、掩码语言建模(MLM)学理解、图像描述生成学表达、图文对比(ITC)学对齐,每种任务都对应一种特定的能力维度。本章系统梳理多模态预训练的主流任务家族,包括判别式任务(ITM、ITC)、生成式任务(LM、ITG)、掩码建模任务(MLM、MIM),以及它们如何组合成多任务联合预训练(如 BLIP、ALBEF、CoCa)。

第6章 预训练范式:任务设计与优化目标

章节摘要

前几章我们讲清楚了视觉编码器(第3章)、文本编码器(第2章)、对比对齐(第4章)、跨模态融合(第5章)的所有组件。本章聚焦一个核心问题:用什么任务把这些组件训练出来? 多模态大模型(Multimodal Large Language Model, MLLM)的预训练任务设计直接决定了模型的能力上限——图文匹配(ITM)学判别、掩码语言建模(MLM)学理解、图像描述生成学表达、图文对比(ITC)学对齐,每种任务都对应一种特定的能力维度。本章系统梳理多模态预训练的主流任务家族,包括判别式任务(ITM、ITC)、生成式任务(LM、ITG)、掩码建模任务(MLM、MIM),以及它们如何组合成多任务联合预训练(如 BLIP、ALBEF、CoCa)。我们还会讲解训练数据的关键来源(LAION、CC3M、COCO、WebLI)与质量过滤策略。章末提供 BLIP-2、Flamingo、CoCa 等预训练范式的 SOTA 速览。掌握本章后,你将理解为什么同样的模型结构在不同预训练任务下会产生截然不同的能力。

学习目标

完成本章后,你应当能够:

  1. 列举多模态预训练的四大任务家族(判别、生成、掩码、对比)并说出各自学到什么
  2. 写出图文匹配(ITM)与图文对比(ITC)的损失函数,并说明它们的差异
  3. 解释掩码语言建模(MLM)与下一 token 预测(NTP)的训练动态差异
  4. 复述 ALBEF、BLIP、CoCa 三种多任务联合预训练的架构与目标组合
  5. 说出预训练数据的三个关键维度:规模、质量、多样性
  6. 在为自己的多模态任务设计预训练方案时,能根据目标能力选择合适的任务组合

核心概念速览

  • ITM(Image-Text Matching):二分类判断图文是否匹配,学习细粒度判别
  • ITC(Image-Text Contrastive):对比学习拉近正样本、推远负样本,学习全局对齐
  • MLM(Masked Language Modeling):遮住部分 token 让模型预测,学习双向理解
  • MIM(Masked Image Modeling):遮住部分 patch 让模型预测,学习视觉理解
  • LM(Language Modeling):自回归预测下一 token,学习生成
  • ITG(Image-Grounded Text Generation):以图像为条件的文本生成,学习跨模态生成
  • 多任务联合预训练:同时优化多个目标,让模型获得综合能力
  • 硬负样本挖掘:主动找与锚点相似但不匹配的样本,提升判别力

子章节导览

本章共 6 个子节,按「判别 → 生成 → 掩码 → 联合 → 数据 → 前沿」的逻辑展开:

  • 6.1 图文匹配预训练任务 —— ITM 与 ITC 两个判别任务的原理、损失函数与差异
  • 6.2 掩码语言与图像建模 —— MLM 与 MIM 的掩码策略、训练目标与代表工作(BEiT、MAE)
  • 6.3 图像描述生成与自回归训练 —— LM 与 ITG 的生成任务,自回归训练的细节
  • 6.4 多任务联合预训练策略 —— ALBEF、BLIP、CoCa 如何组合多任务,动量蒸馏等技巧
  • 6.5 SOTA 前沿速览 —— BLIP-2、Flamingo、CoCa、PaLI 等预训练范式对比

子节之间是「单任务 → 多任务 → 工程化」的递进:6.1-6.3 讲单个任务,6.4 把它们组合起来,6.5 看当代 SOTA 是怎么组合的。

前置知识与后续衔接

前置知识

  • 第2章的 Transformer 与 BERT/GPT 训练目标
  • 第4章的对比学习与 InfoNCE
  • 第5章的融合架构(不同架构对应不同预训练任务)

后续衔接

  • 第7章的指令微调建立在本章预训练基础之上——预训练给模型「能力」,指令微调给模型「听话」
  • 第8章的 VQA、文生图等应用直接使用本章训练好的模型
  • 理解预训练任务对读懂任何新模型的技术报告都至关重要

本章是「架构(第2-5章)」与「应用(第7-8章)」之间的能力填充层——架构给了容器,预训练填入能力。

章节知识图谱


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U