第4章 模态对齐:对比学习与双塔结构 章节摘要 有了视觉编码器(第3章)与文本编码器(第2章),我们手里有两套独立的特征提取系统——但图像向量与文本向量各自飘在自己的空间里,模型仍然不知道「猫的图」与「猫这个词」对应。本章聚焦模态对齐的核心机制:对比学习(Contrastive Learning)。我们将从对比学习的几何直觉与数学原理出发,深度拆解 OpenAI 在 2021 年提出的 CLIP(Contrastive Language–Image Pre-training)双塔架构——它如何用 4 亿对图文数据、一个 InfoNCE 损失,把视觉塔与语言塔拉到同一向量空间,从而支持零样本分类、跨模态检索等一系列全新能力。
有了视觉编码器(第3章)与文本编码器(第2章),我们手里有两套独立的特征提取系统——但图像向量与文本向量各自飘在自己的空间里,模型仍然不知道「猫的图」与「猫这个词」对应。本章聚焦模态对齐的核心机制:对比学习(Contrastive Learning)。我们将从对比学习的几何直觉与数学原理出发,深度拆解 OpenAI 在 2021 年提出的 CLIP(Contrastive Language–Image Pre-training)双塔架构——它如何用 4 亿对图文数据、一个 InfoNCE 损失,把视觉塔与语言塔拉到同一向量空间,从而支持零样本分类、跨模态检索等一系列全新能力。本章还会讨论向量空间对齐的多种策略(硬负样本挖掘、对称化、温度系数调节),并在章末提供 SigLIP、EVA-CLIP、OpenCLIP 等当代对比学习模型的 SOTA 速览。掌握本章后,你将理解为什么 CLIP 几乎成了所有多模态大模型(LLaVA、BLIP-2、Stable Diffusion)的「视觉-语言桥梁」。
完成本章后,你应当能够:
本章共 6 个子节,按「原理 → 架构 → 策略 → 数学细节 → 前沿」的逻辑展开:
子节之间是「先讲思想 → 再讲实现 → 再讲优化 → 最后钻进数学细节」的关系。4.1 给出对比学习的方法论,4.2 用 CLIP 把方法论落地,4.3 与 4.4 把 CLIP 训练中的关键调参点讲透,4.5 把视角拉到当下。
前置知识:
后续衔接:
CLIP 是整份教程的「中央枢纽」——它前面接视觉/文本编码器,后面接几乎所有多模态应用。理解 CLIP,等于握住了多模态大模型时代的「通用视觉-语言接口」。