4.3 向量空间对齐策略 CLIP 的核心思想看似简单——双塔 + InfoNCE——但要让训练稳定收敛、表征质量高,需要一系列对齐策略。本节梳理 CLIP 及其后续工作中的几个关键工程决策。 一、L2 归一化:相似度的数值基础 CLIP 在计算相似度前,对两个塔的输出都做 L2 归一化: $$ \hat{I} = \frac{I}{\|I\|}, \quad \hat{T} = \frac{T}{\|T\|} $$ 这样相似度变成余弦相似度,落在 $[-1, 1]$ 区间。归一化的两个工程价值: 价值一:数值稳定 如果不归一化,向量范数可能因训练漂移变得很大或很小,相似度数值爆炸或消失,softmax 进入饱和区,梯度消失。归一化把数值控制在固定范围。
CLIP 的核心思想看似简单——双塔 + InfoNCE——但要让训练稳定收敛、表征质量高,需要一系列对齐策略。本节梳理 CLIP 及其后续工作中的几个关键工程决策。
CLIP 在计算相似度前,对两个塔的输出都做 L2 归一化:
这样相似度变成余弦相似度,落在 [-1, 1] 区间。归一化的两个工程价值:
如果不归一化,向量范数可能因训练漂移变得很大或很小,相似度数值爆炸或消失,softmax 进入饱和区,梯度消失。归一化把数值控制在固定范围。
模型可能学到一个捷径:让所有向量范数变大来「假装」相似度高。归一化后只能通过调整方向来提升相似度——这正是我们想要的语义对齐。
工程实现上,归一化通常作为编码器的最后一层,无额外计算成本。
4.2 节已经讲过 CLIP 用对称 InfoNCE:
这里再强调它的两个工程价值:
只算 \mathcal{L}_{I \to T} 时,模型可能学到一个「懒惰」解:把所有文本投影到同一个点,这样所有图都「匹配」这个点,损失为零(softmax 退化)。对称损失强制文本塔也具备判别力,避免这种塌缩。
对称训练后,向量空间对图→文与文→图两个方向都友好,可以直接用于:
不需要为两个方向分别训练。
InfoNCE 中的温度系数 \tau 控制相似度分布的尖锐程度:
CLIP 把 \tau 设为可学习参数(初始化为 0.01),让模型自己调整最佳尺度。训练完后 \tau 通常稳定在 0.01-0.05 之间。
关于温度系数的物理意义,4.4 节会深入展开。
4.1 节提到,CLIP 用 batch 内其他样本作为负样本。这一策略有几个工程优势:
负样本就是同一 batch 内的其他图文对,不需要额外构造负样本集。
batch 内样本通常来自不同语义类别(猫、狗、车、风景...),天然提供语义多样的负样本,比人工构造更有效。
只要显存允许,batch 越大负样本越多,性能越好。这是 CLIP 把 batch 推到 32768 的根本动力。
batch 32768 意味着相似度矩阵是 32768×32768,约 10 亿元素,单卡放不下。CLIP 用了梯度累积 + 跨卡通信:
这就是后续大模型训练中 梯度累加 + 数据并行 范式的雏形。
并非所有负样本都同等有用。「猫的图 + 狗的描述」是难负样本(语义接近,模型容易混淆),「猫的图 + 桌子的描述」是简单负样本(语义远,模型很容易分对)。
简单负样本对训练贡献小(损失已经接近 0,梯度小),难负样本贡献大。硬负样本挖掘(Hard Negative Mining) 的目标就是优先采样难负样本。
CLIP 不显式做硬负样本挖掘,但 batch 内负样本天然包含了一定程度的硬样本——因为 batch 内的图像通常来自不同但相关的语义类别。
一些 CLIP 改进工作引入显式硬负样本:
显式硬负样本通常能带来 1-3 个点的下游任务提升,但增加工程复杂度。
CLIP 训练时大部分图文对来自网络爬取,文本通常是图像的 alt text,质量参差不齐。提升文本质量的一个手段是文本增强:
但对 CLIP 这种规模,最有效的还是用更好的原始数据——LAION-5B 等数据集就专门做了去重与质量过滤。
视觉对比学习对图像增强比文本更敏感。常见增强:
CLIP 在训练时用了较弱的图像增强(避免破坏语义),因为强增强可能让「猫的图」变成「不像猫的图」,与「cat」的文本对齐反而变差。
后续 SimCLR、BYOL 等纯视觉对比学习用了更强的增强,因为它们不依赖文本对齐。
数据是 CLIP 类模型的胜负手。LAION-5B 等开源数据集的做法:
DataComp 等基准进一步证明:在相同模型与算力下,更好的数据能带来 5-15 个点的提升。这是 2023 年后 CLIP 类模型改进的主要方向。
纯对比学习有一个短板——它只学到「整体匹配」,不学细粒度对应。后续工作引入多种训练目标:
| 目标 | 学到什么 | 代表工作 |
|---|---|---|
| 图文对比(ITC) | 全局对齐 | CLIP |
| 图文匹配(ITM) | 二分类是否匹配 | ALBEF、BLIP |
| 图像描述生成(LM) | 文本生成能力 | BLIP、BLIP-2 |
| 掩码语言建模(MLM) | 文本理解 | ALBEF |
| 字幕-区域对齐 | 区域级对齐 | GLIP、RegionCLIP |
多任务联合训练已成为新一代视觉-语言模型的标准做法,第6章会详细展开。
如何评估一个对齐模型好不好?常用指标:
给一张图,让模型从 1000 个候选文本中找出对应描述。Recall@K 表示真实匹配在前 K 名的比例。
反向,给文本找图。
把分类问题转成零样本检索(4.2 节讲过)。
VQA、NLVR、SNLI-VE 等多模态推理任务,评估对齐空间的语义质量。
| 策略 | 作用 | 代价 |
|---|---|---|
| L2 归一化 | 数值稳定,避免捷径 | 无 |
| 对称损失 | 防塌缩,双向检索 | 2 倍计算 |
| 可学习温度 | 自适应尺度 | 一个参数 |
| Batch 内负样本 | 免费负样本 | 大 batch 难训练 |
| 硬负样本挖掘 | 提升难样本学习 | 工程复杂 |
| 多任务联合 | 学到更丰富表征 | 训练流程复杂 |
| 数据质量过滤 | 数据驱动提升 | 数据工程成本 |
CLIP 的成功不仅来自对比学习思想,更来自一系列对齐策略的精心设计:归一化保证数值稳定,对称损失防止单向塌缩,可学习温度自适应尺度,batch 内负样本提供大量信号,数据质量过滤决定上限。这些策略组合起来,才让 CLIP 学出高质量的对齐空间。
下一节(4.4)我们钻进 InfoNCE 损失与温度系数的数学细节,看 sigmoid 形式如何在 SigLIP 中替代 softmax。