4.5 SOTA 前沿速览 本节速览 CLIP 之后在多模态对齐方向上有影响力的工作。这些模型大多继承 CLIP 的双塔 + 对比学习范式,但在损失函数、数据规模、训练策略上有重要创新。 一、CLIP 家族的全景 把当代对比学习对齐模型按时间与路线分类: 下面逐一速览。 二、OpenCLIP:开源复现的事实标杆 OpenAI 的 CLIP 没开源训练代码与数据,社区只能用预训练权重。
本节速览 CLIP 之后在多模态对齐方向上有影响力的工作。这些模型大多继承 CLIP 的双塔 + 对比学习范式,但在损失函数、数据规模、训练策略上有重要创新。
把当代对比学习对齐模型按时间与路线分类:
下面逐一速览。
OpenAI 的 CLIP 没开源训练代码与数据,社区只能用预训练权重。OpenCLIP(由 mlfoundations、LAION 等社区维护)做了三件关键事:
OpenCLIP 的 ViT-H/14、ViT-G/14 在很多基准上超过原版 CLIP,是 Stable Diffusion v2、DALL-E 2 等模型使用的视觉-语言模型。
OpenCLIP 的最大意义是让 CLIP 范式民主化——不再只有 OpenAI 能训,任何实验室都能复现与改进。
Google 的 ALIGN(Large-Scale Image and Text Embeddings)在 CLIP 之后不久发布,做了一个激进的实验:
ALIGN 的发现挑战了「数据必须精标」的传统认知——只要数据量足够大,模型能从噪声中自动学到有用模式。这启发了后续 LAION-5B 等超大规模数据集的发布。
智源研究院的 EVA-CLIP 把 CLIP 的视觉塔做到 4.7B 参数,验证了「CLIP 也能从 Scaling 受益」:
EVA-CLIP 的意义是证明了 CLIP 范式没有明显饱和——只要继续投数据与算力,性能持续提升。BLIP-2 等模型就用了 EVA-CLIP-G 作为视觉编码器。
4.4 节已详细介绍 SigLIP 的 sigmoid 损失。这里补充几个工程细节:
SigLIP-2 在原版基础上:
SigLIP-2 已成为 PaliGemma 2、Idefics3、新一代 LLaVA-NeXT 等多模态大模型的默认视觉前端。
Meta 与多个团队探索过把 DINOv2 的自监督表征与 CLIP 的对齐能力融合:
代表工作如 InternVL-C 把 DINOv2 与 CLIP 的视觉特征 concat 后送入下游任务,在细粒度任务上显著优于单一编码器。
这种「多视觉编码器融合」是 2024 年后的新趋势,被认为能同时获得「对齐好」与「表征细」的双重优势。
Apple 等团队推出的 MobileCLIP 探索了「在手机上跑 CLIP」:
MobileCLIP 让 CLIP 能力进入端侧场景——实时图像搜索、隐私敏感的本地识别、离线 AR 应用等。
微软的 Florence-2 不严格属于 CLIP 家族,但值得提及——它把对比学习、目标检测、分割、OCR 等多种视觉任务统一到一个模型:
Florence-2 代表了「视觉基础模型」的方向——一个编码器服务所有视觉任务,而非为每个任务训练一个模型。
| 模型 | 损失 | 数据规模 | 视觉塔 | 主要价值 |
|---|---|---|---|---|
| CLIP | softmax 对比 | 4 亿对 | ViT-L/14 | 奠基 |
| OpenCLIP | softmax 对比 | 2B-5B 对 | ViT-H/G | 开源复现 |
| ALIGN | softmax 对比 | 18 亿噪声 | ViT-L | 噪声数据可行 |
| EVA-CLIP | softmax 对比 | 18 亿对 | ViT-Giant 4.7B | Scaling 极限 |
| SigLIP | sigmoid 对比 | 数亿-数十亿 | ViT-L | batch 友好 |
| SigLIP-2 | sigmoid + 多分辨率 | WebLI | 多尺寸 | 任意分辨率 |
| DINO-CLIP | 自监督+对比 | LVD-142M | ViT-L | 细粒度+对齐 |
| MobileCLIP | 蒸馏对比 | 数亿对 | FastViT | 端侧 |
把 SOTA 摆在一起,对齐模型的演化方向清晰:
观察 CLIP 家族的演化,能得出对多模态大模型设计的几条启示:
后续第5章(融合)、第6章(预训练)、第7章(指令微调)会反复回到这些启示。
CLIP 之后,对比学习对齐模型沿「sigmoid 化、多任务化、多分辨率化、规模化」四条主线演化。SigLIP-2、InternViT、Florence-2 等当代模型已显著超越原版 CLIP,成为新一代多模态大模型的视觉前端。
第4章到此结束。下一章(第5章)我们进入跨模态融合——看视觉与文本在对齐之后,如何通过 Cross-Attention、Q-Former 等机制进行深度交互。