4.3 向量空间对齐策略


文档摘要

4.3 向量空间对齐策略 CLIP 的核心思想看似简单——双塔 + InfoNCE——但要让训练稳定收敛、表征质量高,需要一系列对齐策略。本节梳理 CLIP 及其后续工作中的几个关键工程决策。 一、L2 归一化:相似度的数值基础 CLIP 在计算相似度前,对两个塔的输出都做 L2 归一化: $$ \hat{I} = \frac{I}{\|I\|}, \quad \hat{T} = \frac{T}{\|T\|} $$ 这样相似度变成余弦相似度,落在 $[-1, 1]$ 区间。归一化的两个工程价值: 价值一:数值稳定 如果不归一化,向量范数可能因训练漂移变得很大或很小,相似度数值爆炸或消失,softmax 进入饱和区,梯度消失。归一化把数值控制在固定范围。

4.3 向量空间对齐策略

CLIP 的核心思想看似简单——双塔 + InfoNCE——但要让训练稳定收敛、表征质量高,需要一系列对齐策略。本节梳理 CLIP 及其后续工作中的几个关键工程决策。

一、L2 归一化:相似度的数值基础

CLIP 在计算相似度前,对两个塔的输出都做 L2 归一化:

\hat{I} = \frac{I}{\|I\|}, \quad \hat{T} = \frac{T}{\|T\|}

这样相似度变成余弦相似度,落在 [-1, 1] 区间。归一化的两个工程价值:

价值一:数值稳定

如果不归一化,向量范数可能因训练漂移变得很大或很小,相似度数值爆炸或消失,softmax 进入饱和区,梯度消失。归一化把数值控制在固定范围。

价值二:避免「捷径解」

模型可能学到一个捷径:让所有向量范数变大来「假装」相似度高。归一化后只能通过调整方向来提升相似度——这正是我们想要的语义对齐。

工程实现上,归一化通常作为编码器的最后一层,无额外计算成本。

二、对称损失:双向监督

4.2 节已经讲过 CLIP 用对称 InfoNCE:

\mathcal{L} = \frac{\mathcal{L}_{I \to T} + \mathcal{L}_{T \to I}}{2}

这里再强调它的两个工程价值:

价值一:避免单向塌缩

只算 \mathcal{L}_{I \to T} 时,模型可能学到一个「懒惰」解:把所有文本投影到同一个点,这样所有图都「匹配」这个点,损失为零(softmax 退化)。对称损失强制文本塔也具备判别力,避免这种塌缩。

价值二:双向检索能力

对称训练后,向量空间对图→文与文→图两个方向都友好,可以直接用于:

  • 以图搜文:用图像向量查询文本库
  • 以文搜图:用文本向量查询图像库

不需要为两个方向分别训练。

三、温度系数:可学习的相似度尺度

InfoNCE 中的温度系数 \tau 控制相似度分布的尖锐程度:

\text{softmax}\left(\frac{S}{\tau}\right)
  • \tau 小:分布更尖锐,正样本权重更接近 1,负样本权重更接近 0
  • \tau 大:分布更平滑,所有样本权重接近均匀

CLIP 把 \tau 设为可学习参数(初始化为 0.01),让模型自己调整最佳尺度。训练完后 \tau 通常稳定在 0.01-0.05 之间。

关于温度系数的物理意义,4.4 节会深入展开。

四、Batch 内负样本:工程上的免费午餐

4.1 节提到,CLIP 用 batch 内其他样本作为负样本。这一策略有几个工程优势:

优势一:零额外采样成本

负样本就是同一 batch 内的其他图文对,不需要额外构造负样本集。

优势二:自动语义多样性

batch 内样本通常来自不同语义类别(猫、狗、车、风景...),天然提供语义多样的负样本,比人工构造更有效。

优势三:可扩展

只要显存允许,batch 越大负样本越多,性能越好。这是 CLIP 把 batch 推到 32768 的根本动力。

工程挑战:大 batch 的实现

batch 32768 意味着相似度矩阵是 32768×32768,约 10 亿元素,单卡放不下。CLIP 用了梯度累积 + 跨卡通信

  • 每张卡算自己 batch 的相似度
  • 通过 all-gather 收集所有卡的向量
  • 在每张卡上重构完整相似度矩阵
  • 反向传播时只更新本地梯度

这就是后续大模型训练中 梯度累加 + 数据并行 范式的雏形。

五、硬负样本挖掘:让负样本更有信号

并非所有负样本都同等有用。「猫的图 + 狗的描述」是负样本(语义接近,模型容易混淆),「猫的图 + 桌子的描述」是简单负样本(语义远,模型很容易分对)。

简单负样本对训练贡献小(损失已经接近 0,梯度小),难负样本贡献大。硬负样本挖掘(Hard Negative Mining) 的目标就是优先采样难负样本。

在 CLIP 中的隐式挖掘

CLIP 不显式做硬负样本挖掘,但 batch 内负样本天然包含了一定程度的硬样本——因为 batch 内的图像通常来自不同但相关的语义类别。

后续工作的显式挖掘

一些 CLIP 改进工作引入显式硬负样本:

  • ALBEF:用动量编码器计算难样本,加入 batch
  • BLIP:在 batch 内随机替换部分词构造硬负样本
  • CyCLIP:循环一致性约束,确保图→文与文→图结果一致

显式硬负样本通常能带来 1-3 个点的下游任务提升,但增加工程复杂度。

六、文本增强:prompt 工程

CLIP 训练时大部分图文对来自网络爬取,文本通常是图像的 alt text,质量参差不齐。提升文本质量的一个手段是文本增强

  • 同义词替换
  • 句式变换(主动/被动)
  • 多语言翻译(多语言 CLIP)

但对 CLIP 这种规模,最有效的还是用更好的原始数据——LAION-5B 等数据集就专门做了去重与质量过滤。

七、图像增强:略微改动就有大影响

视觉对比学习对图像增强比文本更敏感。常见增强:

  • 随机裁剪
  • 颜色抖动
  • 水平翻转
  • 高斯模糊

CLIP 在训练时用了较弱的图像增强(避免破坏语义),因为强增强可能让「猫的图」变成「不像猫的图」,与「cat」的文本对齐反而变差。

后续 SimCLR、BYOL 等纯视觉对比学习用了更强的增强,因为它们不依赖文本对齐。

八、训练数据的质量过滤

数据是 CLIP 类模型的胜负手。LAION-5B 等开源数据集的做法:

  1. 去重:感知哈希去除近似重复图
  2. 过滤低质量:剔除过短/无意义 alt text
  3. NSFW 过滤:去除成人内容
  4. 美学评分:用 CLIP 美学模型过滤低质量图
  5. 子集分级:LAION-2B-en、LAION-High-Resolution 等不同质量等级

DataComp 等基准进一步证明:在相同模型与算力下,更好的数据能带来 5-15 个点的提升。这是 2023 年后 CLIP 类模型改进的主要方向。

九、训练目标的多样化

纯对比学习有一个短板——它只学到「整体匹配」,不学细粒度对应。后续工作引入多种训练目标:

目标 学到什么 代表工作
图文对比(ITC) 全局对齐 CLIP
图文匹配(ITM) 二分类是否匹配 ALBEF、BLIP
图像描述生成(LM) 文本生成能力 BLIP、BLIP-2
掩码语言建模(MLM) 文本理解 ALBEF
字幕-区域对齐 区域级对齐 GLIP、RegionCLIP

多任务联合训练已成为新一代视觉-语言模型的标准做法,第6章会详细展开。

十、对齐质量评估

如何评估一个对齐模型好不好?常用指标:

Image-to-Text Retrieval(R@1, R@5, R@10)

给一张图,让模型从 1000 个候选文本中找出对应描述。Recall@K 表示真实匹配在前 K 名的比例。

Text-to-Image Retrieval

反向,给文本找图。

ImageNet 零样本分类

把分类问题转成零样本检索(4.2 节讲过)。

视觉-语言基准

VQA、NLVR、SNLI-VE 等多模态推理任务,评估对齐空间的语义质量。

十一、对齐策略对照表

策略 作用 代价
L2 归一化 数值稳定,避免捷径
对称损失 防塌缩,双向检索 2 倍计算
可学习温度 自适应尺度 一个参数
Batch 内负样本 免费负样本 大 batch 难训练
硬负样本挖掘 提升难样本学习 工程复杂
多任务联合 学到更丰富表征 训练流程复杂
数据质量过滤 数据驱动提升 数据工程成本

小结

CLIP 的成功不仅来自对比学习思想,更来自一系列对齐策略的精心设计:归一化保证数值稳定,对称损失防止单向塌缩,可学习温度自适应尺度,batch 内负样本提供大量信号,数据质量过滤决定上限。这些策略组合起来,才让 CLIP 学出高质量的对齐空间。

下一节(4.4)我们钻进 InfoNCE 损失与温度系数的数学细节,看 sigmoid 形式如何在 SigLIP 中替代 softmax。


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U