3.5 SOTA 前沿速览 本节速览 2023–2026 在视觉编码器方向上最有影响力的工作。这些编码器是当代多模态大模型(MLLM)的视觉前端——你会在 LLaVA、Qwen-VL、InternVL、BLIP-2 等模型中反复看到它们的名字。 一、视觉编码器的两大流派 当代视觉编码器大致分两条技术路线: 路线 | 训练目标 | 代表 | 主要价值 监督式 / 对比学习式 | 图文对监督 | CLIP、SigLIP、SigLIP-2、EVA-CLIP、OpenCLIP | 语义对齐好,零样本分类强 自监督式 | 不需要文本 | DINO、DINOv2、MAE | 表征质量高,迁移性强 这两条路线在多模态大模型中各有用武之地: 对比学习路线的编码器与语言空间天然对齐,是
本节速览 2023–2026 在视觉编码器方向上最有影响力的工作。这些编码器是当代多模态大模型(MLLM)的视觉前端——你会在 LLaVA、Qwen-VL、InternVL、BLIP-2 等模型中反复看到它们的名字。
当代视觉编码器大致分两条技术路线:
| 路线 | 训练目标 | 代表 | 主要价值 |
|---|---|---|---|
| 监督式 / 对比学习式 | 图文对监督 | CLIP、SigLIP、SigLIP-2、EVA-CLIP、OpenCLIP | 语义对齐好,零样本分类强 |
| 自监督式 | 不需要文本 | DINO、DINOv2、MAE | 表征质量高,迁移性强 |
这两条路线在多模态大模型中各有用武之地:
下面逐一速览。
虽然 CLIP 本身是第4章的主角,但作为视觉编码器,CLIP ViT-L/14 是 MLLM 的事实标杆:
CLIP ViT 之所以被广泛采用,是因为它经过了 4 亿图文对的对比学习预训练,patch token 既保留了细粒度视觉信息,又与文本空间对齐,直接拿来就能用。
Google 在 2023 年提出 SigLIP,2024–2025 进一步升级到 SigLIP-2,是 CLIP 之后最具影响力的对比学习视觉编码器。
CLIP 用 softmax 做对比损失,要求 batch 内所有样本参与归一化,对 batch size 极敏感——batch 越大效果越好,但显存爆炸。
SigLIP 把对比损失换成逐对的 sigmoid 二分类:
其中 z_{ij} 是标签(+1 表示图文匹配,-1 表示不匹配),\sigma 是 sigmoid。这种形式:
在相同算力下,SigLIP 显著优于 CLIP。它是 LLaVA-NeXT、PaliGemma、Idefics2 等新一代多模态大模型的首选视觉编码器。
SigLIP-2 在原版基础上加入了:
SigLIP-2 已成为 2025 年起新一代 MLLM(如 PaliGemma 2、Idefics3)的默认视觉前端。
Meta 的 DINOv2 是自监督路线的代表作。它完全不用文本标签,只用图像本身做自监督训练,但学到的表征质量极高:
DINOv2 结合了两种自监督目标:
DINOv2 表征的细粒度与几何感知能力比 CLIP 更强,因此在:
但在零样本分类与多模态对话场景,DINOv2 不如 SigLIP——因为它没有与语言对齐。一些工作尝试把 DINOv2 与 CLIP 融合(如 InternVL-C),获得「对齐好 + 表征细」的双重优势。
智源研究院的 EVA 系列把 ViT 推到了空前的规模:
EVA 系列的价值是验证了「Scaling ViT」的极限——只要数据与算力足够,纯 ViT 编码器可以一直提升,没有明显饱和。EVA-CLIP 是 BLIP-2 的视觉前端之一。
上海 AI Lab 的 InternViT 是 InternVL 系列多模态大模型的视觉编码器,专门针对 MLLM 场景优化:
InternViT 的设计哲学是「视觉编码器也要够大」——传统观点认为视觉编码器够用就行,重点投资 LLM。InternVL 团队则证明,把视觉编码器做到 6B 规模,可以显著提升 MLLM 在细粒度任务(OCR、文档理解、图表解析)上的表现。
这一观察被业内广泛验证——2024 年后发布的 MLLM(如 CogVLM、Qwen2-VL)都在视觉编码器侧做了显著增强。
Google 的 NaViT(Native Resolution ViT)解决了 ViT 一个长期痛点——必须固定输入分辨率。
传统 ViT 要把任意尺寸的图像 resize 到固定大小(如 224×224),代价是:
NaViT 借鉴自然语言处理「变长序列」的思路:
这极大提升了视觉编码器在真实场景(图片尺寸千差万别)的实用性,是 SigLIP-2、PaliGemma 2 等新一代模型支持任意分辨率的基础。
| 编码器 | 训练目标 | 参数量 | 特色 | 在 MLLM 中的使用 |
|---|---|---|---|---|
| CLIP ViT-L/14 | softmax 对比 | 300M | 经典基线 | LLaVA-1.5、MiniGPT-4 |
| EVA-CLIP-G | softmax 对比 + 更多数据 | 1B | 大规模 + 高精度 | BLIP-2 |
| SigLIP | sigmoid 对比 | 400M | 训练稳定、batch 友好 | LLaVA-NeXT、PaliGemma |
| SigLIP-2 | sigmoid 对比 + 多分辨率 | 400M | 原生任意分辨率 | PaliGemma 2、Idefics3 |
| DINOv2 | 自监督(DINO + iBOT) | 300M–1B | 细粒度表征、几何感知 | 密集预测任务、InternVL-C |
| EVA-02-CLIP | 对比 + Scaling | 4.7B | 验证 ViT 极限 | 研究、视觉骨干 |
| InternViT-6B | 对比 + 字幕 + VQA | 6B | MLLM 专用大编码器 | InternVL 系列 |
| NaViT | 任意分辨率对比 | 300M | 变长 patch | PaliGemma 2 等 |
如果你在做自己的多模态大模型,应该如何选视觉编码器?以下是经验性建议:
| 场景 | 推荐编码器 |
|---|---|
| 通用图文理解、复现 LLaVA | SigLIP-2 或 CLIP ViT-L/14 |
| 需要任意分辨率(文档、长图) | NaViT / SigLIP-2 |
| OCR、文档、细粒度 | InternViT 或大尺寸 SigLIP |
| 需要几何/空间感知(分割、深度) | DINOv2 + 语言编码器组合 |
| 端侧部署、低算力 | SigLIP-Base 或 CLIP ViT-B/16 |
把 SOTA 摆在一起,可以观察到几条清晰趋势:
当代视觉编码器以 SigLIP-2 为对比路线代表、DINOv2 为自监督路线代表,InternViT 为 MLLM 专用代表。它们都已超越 CLIP,但在多模态大模型场景中仍以 ViT 系结构为主。视觉编码器的进步从「结构创新」转向了「训练目标 + 数据规模 + 分辨率泛化」。
第3章到此结束。下一章(第4章)我们进入模态对齐的核心机制——对比学习,看 CLIP 如何把视觉编码器与文本编码器拉到同一向量空间。