4.5 SOTA 前沿速览


文档摘要

4.5 SOTA 前沿速览 本节速览 CLIP 之后在多模态对齐方向上有影响力的工作。这些模型大多继承 CLIP 的双塔 + 对比学习范式,但在损失函数、数据规模、训练策略上有重要创新。 一、CLIP 家族的全景 把当代对比学习对齐模型按时间与路线分类: 下面逐一速览。 二、OpenCLIP:开源复现的事实标杆 OpenAI 的 CLIP 没开源训练代码与数据,社区只能用预训练权重。

4.5 SOTA 前沿速览

本节速览 CLIP 之后在多模态对齐方向上有影响力的工作。这些模型大多继承 CLIP 的双塔 + 对比学习范式,但在损失函数、数据规模、训练策略上有重要创新。

一、CLIP 家族的全景

把当代对比学习对齐模型按时间与路线分类:

下面逐一速览。

二、OpenCLIP:开源复现的事实标杆

OpenAI 的 CLIP 没开源训练代码与数据,社区只能用预训练权重。OpenCLIP(由 mlfoundations、LAION 等社区维护)做了三件关键事:

  1. 用 LAION-2B、LAION-400M 等开源数据复现了 CLIP 训练流程
  2. 训练了多个规模(ViT-B、ViT-L、ViT-H、ViT-G)的模型,全部开源
  3. 提供完整的训练配置与超参,让任何人都能复现或改进

OpenCLIP 的 ViT-H/14、ViT-G/14 在很多基准上超过原版 CLIP,是 Stable Diffusion v2、DALL-E 2 等模型使用的视觉-语言模型。

OpenCLIP 的最大意义是让 CLIP 范式民主化——不再只有 OpenAI 能训,任何实验室都能复现与改进。

三、ALIGN:噪声数据也能学

Google 的 ALIGN(Large-Scale Image and Text Embeddings)在 CLIP 之后不久发布,做了一个激进的实验:

  • 直接用 17 亿对噪声图文(来自互联网 alt text,几乎不清洗)
  • 训练双塔对比模型
  • 证明「数据越多越好」的原则对噪声数据依然成立

ALIGN 的发现挑战了「数据必须精标」的传统认知——只要数据量足够大,模型能从噪声中自动学到有用模式。这启发了后续 LAION-5B 等超大规模数据集的发布。

四、EVA-CLIP:把 Scaling 推到极限

智源研究院的 EVA-CLIP 把 CLIP 的视觉塔做到 4.7B 参数,验证了「CLIP 也能从 Scaling 受益」:

  • 训练数据:18 亿对高质量图文
  • 视觉塔:ViT-Giant 级别
  • ImageNet 零样本:达到 81.8% top-1

EVA-CLIP 的意义是证明了 CLIP 范式没有明显饱和——只要继续投数据与算力,性能持续提升。BLIP-2 等模型就用了 EVA-CLIP-G 作为视觉编码器。

五、SigLIP / SigLIP-2:sigmoid 革命

4.4 节已详细介绍 SigLIP 的 sigmoid 损失。这里补充几个工程细节:

SigLIP 的训练特性

  • 不依赖大 batch(512 就够用)
  • 训练更稳定,超参不敏感
  • 在零样本分类、检索上比 CLIP 高 2-5 个点
  • 中小算力实验室也能复现

SigLIP-2 的演化

SigLIP-2 在原版基础上:

  • 原生多分辨率训练:不再固定 224 或 384 输入
  • 更好的 tokenizer:适配长描述、多语言
  • WebLI 大数据:Google 内部的高质量多语言图文对
  • 更多模型尺寸:从 0.4B 到 4B 全覆盖

SigLIP-2 已成为 PaliGemma 2、Idefics3、新一代 LLaVA-NeXT 等多模态大模型的默认视觉前端。

六、DINO-CLIP:自监督 + 对比融合

Meta 与多个团队探索过把 DINOv2 的自监督表征与 CLIP 的对齐能力融合

  • DINOv2 提供细粒度视觉特征(适合检测、分割)
  • CLIP 提供与语言对齐的语义(适合检索、对话)

代表工作如 InternVL-C 把 DINOv2 与 CLIP 的视觉特征 concat 后送入下游任务,在细粒度任务上显著优于单一编码器。

这种「多视觉编码器融合」是 2024 年后的新趋势,被认为能同时获得「对齐好」与「表征细」的双重优势。

七、MobileCLIP:端侧多模态

Apple 等团队推出的 MobileCLIP 探索了「在手机上跑 CLIP」:

  • 模型尺寸 < 50M
  • 通过知识蒸馏从大 CLIP 蒸馏
  • 优化 CNN 视觉塔(如 FastViT)而非 ViT
  • 在 iPhone 上推理时间 < 30ms

MobileCLIP 让 CLIP 能力进入端侧场景——实时图像搜索、隐私敏感的本地识别、离线 AR 应用等。

八、Florence-2:统一视觉基础模型

微软的 Florence-2 不严格属于 CLIP 家族,但值得提及——它把对比学习、目标检测、分割、OCR 等多种视觉任务统一到一个模型:

  • 用一个编码器 + 多任务头
  • 训练目标包括对比、检测、region-text 对齐
  • 输出可以是分类、框、掩码、文本

Florence-2 代表了「视觉基础模型」的方向——一个编码器服务所有视觉任务,而非为每个任务训练一个模型。

九、当代对齐模型的对比

模型 损失 数据规模 视觉塔 主要价值
CLIP softmax 对比 4 亿对 ViT-L/14 奠基
OpenCLIP softmax 对比 2B-5B 对 ViT-H/G 开源复现
ALIGN softmax 对比 18 亿噪声 ViT-L 噪声数据可行
EVA-CLIP softmax 对比 18 亿对 ViT-Giant 4.7B Scaling 极限
SigLIP sigmoid 对比 数亿-数十亿 ViT-L batch 友好
SigLIP-2 sigmoid + 多分辨率 WebLI 多尺寸 任意分辨率
DINO-CLIP 自监督+对比 LVD-142M ViT-L 细粒度+对齐
MobileCLIP 蒸馏对比 数亿对 FastViT 端侧

十、对齐模型的演化趋势

把 SOTA 摆在一起,对齐模型的演化方向清晰:

  1. 从 softmax 到 sigmoid:SigLIP 路线胜出,工程友好
  2. 从单一对比到多任务联合:Florence-2、InternViT 引入检测、分割、字幕等
  3. 从固定分辨率到任意分辨率:NaViT、SigLIP-2 普及
  4. 从单一编码器到多编码器融合:DINO + CLIP 组合
  5. 从云端到端侧:MobileCLIP 让对齐能力进入手机
  6. 从英文为主到多语言均衡:SigLIP-2、Chinese-CLIP 等改善中文场景

十一、对未来多模态大模型的启示

观察 CLIP 家族的演化,能得出对多模态大模型设计的几条启示:

  1. 视觉编码器越来越重要——InternViT-6B 等证明「视觉塔也值得大投入」
  2. 对齐空间的质量决定 MLLM 上限——LLaVA 的能力很大程度上继承自其视觉编码器
  3. 多分辨率是必需——真实场景图片尺寸千差万别,固定分辨率模型会丢失信息
  4. 多任务训练成为标配——纯对比学习已不够,需要联合字幕、VQA、region 对齐

后续第5章(融合)、第6章(预训练)、第7章(指令微调)会反复回到这些启示。

小结

CLIP 之后,对比学习对齐模型沿「sigmoid 化、多任务化、多分辨率化、规模化」四条主线演化。SigLIP-2、InternViT、Florence-2 等当代模型已显著超越原版 CLIP,成为新一代多模态大模型的视觉前端。

第4章到此结束。下一章(第5章)我们进入跨模态融合——看视觉与文本在对齐之后,如何通过 Cross-Attention、Q-Former 等机制进行深度交互。


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U