3.5 SOTA 前沿速览


文档摘要

3.5 SOTA 前沿速览 本节速览 2023–2026 在视觉编码器方向上最有影响力的工作。这些编码器是当代多模态大模型(MLLM)的视觉前端——你会在 LLaVA、Qwen-VL、InternVL、BLIP-2 等模型中反复看到它们的名字。 一、视觉编码器的两大流派 当代视觉编码器大致分两条技术路线: 路线 | 训练目标 | 代表 | 主要价值 监督式 / 对比学习式 | 图文对监督 | CLIP、SigLIP、SigLIP-2、EVA-CLIP、OpenCLIP | 语义对齐好,零样本分类强 自监督式 | 不需要文本 | DINO、DINOv2、MAE | 表征质量高,迁移性强 这两条路线在多模态大模型中各有用武之地: 对比学习路线的编码器与语言空间天然对齐,是

3.5 SOTA 前沿速览

本节速览 2023–2026 在视觉编码器方向上最有影响力的工作。这些编码器是当代多模态大模型(MLLM)的视觉前端——你会在 LLaVA、Qwen-VL、InternVL、BLIP-2 等模型中反复看到它们的名字。

一、视觉编码器的两大流派

当代视觉编码器大致分两条技术路线:

路线 训练目标 代表 主要价值
监督式 / 对比学习式 图文对监督 CLIP、SigLIP、SigLIP-2、EVA-CLIP、OpenCLIP 语义对齐好,零样本分类强
自监督式 不需要文本 DINO、DINOv2、MAE 表征质量高,迁移性强

这两条路线在多模态大模型中各有用武之地:

  • 对比学习路线的编码器与语言空间天然对齐,是 LLaVA、Qwen-VL 的首选
  • 自监督路线的编码器表征更细粒度,常用于检测、分割等密集任务

下面逐一速览。

二、CLIP ViT:事实标杆

虽然 CLIP 本身是第4章的主角,但作为视觉编码器,CLIP ViT-L/14 是 MLLM 的事实标杆:

  • LLaVA-1.5、LLaVA-NeXT 用 CLIP ViT-L/14@336 作为视觉前端
  • BLIP-2 用 EVA-CLIP-G(CLIP 的增强版)
  • MiniGPT-4 用 CLIP ViT-L/14

CLIP ViT 之所以被广泛采用,是因为它经过了 4 亿图文对的对比学习预训练,patch token 既保留了细粒度视觉信息,又与文本空间对齐,直接拿来就能用。

三、SigLIP / SigLIP-2:从 softmax 到 sigmoid

Google 在 2023 年提出 SigLIP,2024–2025 进一步升级到 SigLIP-2,是 CLIP 之后最具影响力的对比学习视觉编码器。

SigLIP 的核心创新

CLIP 用 softmax 做对比损失,要求 batch 内所有样本参与归一化,对 batch size 极敏感——batch 越大效果越好,但显存爆炸。

SigLIP 把对比损失换成逐对的 sigmoid 二分类

\mathcal{L} = -\log \sigma(z_{ij} \cdot \text{sim}(I_i, T_j))

其中 z_{ij} 是标签(+1 表示图文匹配,-1 表示不匹配),\sigma 是 sigmoid。这种形式:

  • 不需要全 batch 归一化,对 batch size 不敏感
  • 允许负样本数量独立调整,可以用更大的负样本池
  • 训练更稳定、收敛更快

在相同算力下,SigLIP 显著优于 CLIP。它是 LLaVA-NeXT、PaliGemma、Idefics2 等新一代多模态大模型的首选视觉编码器。

SigLIP-2 的进一步改进

SigLIP-2 在原版基础上加入了:

  • 多分辨率训练:原生支持任意分辨率输入,解决了 CLIP 固定分辨率的痛点
  • 更好的 tokenizer:适配更细粒度的描述
  • 更大规模数据:结合 WebLI 等数据集

SigLIP-2 已成为 2025 年起新一代 MLLM(如 PaliGemma 2、Idefics3)的默认视觉前端。

四、DINOv2:自监督视觉编码器的天花板

Meta 的 DINOv2 是自监督路线的代表作。它完全不用文本标签,只用图像本身做自监督训练,但学到的表征质量极高:

训练目标

DINOv2 结合了两种自监督目标:

  • DINO 损失:学生网络学习教师网络输出的多视角特征
  • iBOT 损失:随机遮住一些 patch,让模型预测被遮住的内容(类似 MAE)

工程亮点

  • 用了 8 亿张图的大规模数据集 LVD-142M
  • 训练 ViT-Large 和 ViT-Giant
  • 学生-教师蒸馏让大模型蒸馏出可部署的中等模型

在多模态里的应用

DINOv2 表征的细粒度与几何感知能力比 CLIP 更强,因此在:

  • 深度估计、分割、光流等密集预测任务上达到 SOTA
  • 3D 重建、神经渲染等需要精确空间信息的任务

但在零样本分类与多模态对话场景,DINOv2 不如 SigLIP——因为它没有与语言对齐。一些工作尝试把 DINOv2 与 CLIP 融合(如 InternVL-C),获得「对齐好 + 表征细」的双重优势。

五、EVA / EVA-02: Scaling ViT 到极限

智源研究院的 EVA 系列把 ViT 推到了空前的规模:

  • EVA-02-CLIP-plus-E/14:参数量约 4.7B 的视觉-语言模型
  • 用了 20 亿级别的图文对
  • 在 ImageNet 零样本分类上达到 81.8% top-1

EVA 系列的价值是验证了「Scaling ViT」的极限——只要数据与算力足够,纯 ViT 编码器可以一直提升,没有明显饱和。EVA-CLIP 是 BLIP-2 的视觉前端之一。

六、InternViT:为多模态大模型而生

上海 AI Lab 的 InternViT 是 InternVL 系列多模态大模型的视觉编码器,专门针对 MLLM 场景优化:

  • 6B 参数量的视觉编码器,远大于 CLIP 的 300M
  • 用了多源数据:CLIP 数据 + LAION + 内部数据
  • 混合多个训练目标:对比学习 + 字幕生成 + VQA

InternViT 的设计哲学是「视觉编码器也要够大」——传统观点认为视觉编码器够用就行,重点投资 LLM。InternVL 团队则证明,把视觉编码器做到 6B 规模,可以显著提升 MLLM 在细粒度任务(OCR、文档理解、图表解析)上的表现。

这一观察被业内广泛验证——2024 年后发布的 MLLM(如 CogVLM、Qwen2-VL)都在视觉编码器侧做了显著增强。

七、NaViT:原生任意分辨率

Google 的 NaViT(Native Resolution ViT)解决了 ViT 一个长期痛点——必须固定输入分辨率

传统 ViT 要把任意尺寸的图像 resize 到固定大小(如 224×224),代价是:

  • 高分辨率信息丢失
  • 长宽比变形

NaViT 借鉴自然语言处理「变长序列」的思路:

  • 直接处理任意分辨率图像
  • 把不同分辨率的 patch 当作变长序列
  • 用类似 Flexible Padding、Mask 的技巧处理 batch 内不同长度

这极大提升了视觉编码器在真实场景(图片尺寸千差万别)的实用性,是 SigLIP-2、PaliGemma 2 等新一代模型支持任意分辨率的基础。

八、对比汇总

编码器 训练目标 参数量 特色 在 MLLM 中的使用
CLIP ViT-L/14 softmax 对比 300M 经典基线 LLaVA-1.5、MiniGPT-4
EVA-CLIP-G softmax 对比 + 更多数据 1B 大规模 + 高精度 BLIP-2
SigLIP sigmoid 对比 400M 训练稳定、batch 友好 LLaVA-NeXT、PaliGemma
SigLIP-2 sigmoid 对比 + 多分辨率 400M 原生任意分辨率 PaliGemma 2、Idefics3
DINOv2 自监督(DINO + iBOT) 300M–1B 细粒度表征、几何感知 密集预测任务、InternVL-C
EVA-02-CLIP 对比 + Scaling 4.7B 验证 ViT 极限 研究、视觉骨干
InternViT-6B 对比 + 字幕 + VQA 6B MLLM 专用大编码器 InternVL 系列
NaViT 任意分辨率对比 300M 变长 patch PaliGemma 2 等

九、选型建议

如果你在做自己的多模态大模型,应该如何选视觉编码器?以下是经验性建议:

场景 推荐编码器
通用图文理解、复现 LLaVA SigLIP-2 或 CLIP ViT-L/14
需要任意分辨率(文档、长图) NaViT / SigLIP-2
OCR、文档、细粒度 InternViT 或大尺寸 SigLIP
需要几何/空间感知(分割、深度) DINOv2 + 语言编码器组合
端侧部署、低算力 SigLIP-Base 或 CLIP ViT-B/16

十、视觉编码器演化的趋势观察

把 SOTA 摆在一起,可以观察到几条清晰趋势:

  1. 从 softmax 到 sigmoid:SigLIP 路线胜出,对 batch 友好、训练稳定
  2. 从固定分辨率到任意分辨率:NaViT 范式普及
  3. 从单纯对比到多目标:InternViT 把对比 + 字幕 + VQA 联合训练
  4. 从「够用就好」到「越大越好」:InternViT-6B 等证明视觉编码器也值得投入
  5. 从「与语言对齐」到「多表征融合」:DINOv2 + CLIP 组合,对齐 + 细粒度双赢

小结

当代视觉编码器以 SigLIP-2 为对比路线代表、DINOv2 为自监督路线代表,InternViT 为 MLLM 专用代表。它们都已超越 CLIP,但在多模态大模型场景中仍以 ViT 系结构为主。视觉编码器的进步从「结构创新」转向了「训练目标 + 数据规模 + 分辨率泛化」。

第3章到此结束。下一章(第4章)我们进入模态对齐的核心机制——对比学习,看 CLIP 如何把视觉编码器与文本编码器拉到同一向量空间。


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U