第4章 模态对齐:对比学习与双塔结构


文档摘要

第4章 模态对齐:对比学习与双塔结构 章节摘要 有了视觉编码器(第3章)与文本编码器(第2章),我们手里有两套独立的特征提取系统——但图像向量与文本向量各自飘在自己的空间里,模型仍然不知道「猫的图」与「猫这个词」对应。本章聚焦模态对齐的核心机制:对比学习(Contrastive Learning)。我们将从对比学习的几何直觉与数学原理出发,深度拆解 OpenAI 在 2021 年提出的 CLIP(Contrastive Language–Image Pre-training)双塔架构——它如何用 4 亿对图文数据、一个 InfoNCE 损失,把视觉塔与语言塔拉到同一向量空间,从而支持零样本分类、跨模态检索等一系列全新能力。

第4章 模态对齐:对比学习与双塔结构

章节摘要

有了视觉编码器(第3章)与文本编码器(第2章),我们手里有两套独立的特征提取系统——但图像向量与文本向量各自飘在自己的空间里,模型仍然不知道「猫的图」与「猫这个词」对应。本章聚焦模态对齐的核心机制:对比学习(Contrastive Learning)。我们将从对比学习的几何直觉与数学原理出发,深度拆解 OpenAI 在 2021 年提出的 CLIP(Contrastive Language–Image Pre-training)双塔架构——它如何用 4 亿对图文数据、一个 InfoNCE 损失,把视觉塔与语言塔拉到同一向量空间,从而支持零样本分类、跨模态检索等一系列全新能力。本章还会讨论向量空间对齐的多种策略(硬负样本挖掘、对称化、温度系数调节),并在章末提供 SigLIP、EVA-CLIP、OpenCLIP 等当代对比学习模型的 SOTA 速览。掌握本章后,你将理解为什么 CLIP 几乎成了所有多模态大模型(LLaVA、BLIP-2、Stable Diffusion)的「视觉-语言桥梁」。

学习目标

完成本章后,你应当能够:

  1. 用一句话讲清「对比学习」与「分类学习」的本质区别
  2. 写出 InfoNCE 损失的完整公式,并解释温度系数 \tau 的物理意义
  3. 画出 CLIP 双塔架构的完整数据流图,并说明双塔结构为何适合大规模检索
  4. 解释对称损失(symmetric loss)的作用,以及 batch 内负样本的工程价值
  5. 说出 CLIP 零样本分类的工作原理:把分类问题转成「图文相似度排序」
  6. 在面对 SigLIP、EVA-CLIP 等新模型时,能立刻识别它们在 CLIP 基础上改了什么

核心概念速览

  • 对比学习(Contrastive Learning):通过拉近正样本、推远负样本学习表示
  • 双塔结构(Dual Encoder / Two-Tower):图像与文本各自独立编码,只在最后做相似度匹配
  • InfoNCE 损失:把对比目标写成 softmax 形式的交叉熵,是 CLIP 的核心训练目标
  • 温度系数 \tau:控制相似度分布尖锐程度的超参,等价于 InfoNCE 的熵正则
  • 负样本(Negative Sample):与锚点不匹配的样本,提供「推远」信号
  • 零样本分类(Zero-shot Classification):把类别名变成 prompt,比较图像与各 prompt 的相似度
  • 跨模态检索(Cross-modal Retrieval):用一种模态的查询检索另一种模态的内容
  • 硬负样本(Hard Negative):与锚点相似但语义不同的负样本,训练价值高

子章节导览

本章共 6 个子节,按「原理 → 架构 → 策略 → 数学细节 → 前沿」的逻辑展开:

  • 4.1 对比学习的数学原理 —— 从「拉近正样本、推远负样本」的几何直觉推出 InfoNCE 公式
  • 4.2 CLIP 双塔架构深度解析 —— 完整数据流、训练流程、为何选择双塔而非单塔融合
  • 4.3 向量空间对齐策略 —— 对称损失、归一化、温度系数、batch 内负样本的工程意义
  • 4.4 InfoNCE 损失与温度系数 —— 深入温度系数的物理意义与梯度行为,sigmoid 替代方案的演化
  • 4.5 SOTA 前沿速览 —— SigLIP、EVA-CLIP、OpenCLIP、DINO-CLIP 等的演化与对比

子节之间是「先讲思想 → 再讲实现 → 再讲优化 → 最后钻进数学细节」的关系。4.1 给出对比学习的方法论,4.2 用 CLIP 把方法论落地,4.3 与 4.4 把 CLIP 训练中的关键调参点讲透,4.5 把视角拉到当下。

前置知识与后续衔接

前置知识

  • 第2章 Transformer 基础(CLIP 文本塔是 Transformer)
  • 第3章 ViT(CLIP 视觉塔是 ViT)
  • softmax 与交叉熵的基本概念

后续衔接

  • 第5章的跨模态融合建立在 CLIP 对齐的空间之上——很多融合模型(如 LLaVA)直接复用 CLIP 视觉塔
  • 第6章预训练会把对比学习作为多任务之一
  • 第7章的 LLaVA 把 CLIP 视觉编码器作为视觉前端
  • 第8章的 Stable Diffusion 用 CLIP 文本编码器作为 prompt 理解模块

CLIP 是整份教程的「中央枢纽」——它前面接视觉/文本编码器,后面接几乎所有多模态应用。理解 CLIP,等于握住了多模态大模型时代的「通用视觉-语言接口」。

章节知识图谱


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U