开源 VLM 配方:什么真正起作用


文档摘要

开源 VLM 配方:什么真正起作用 本节摘要:20242026 年的开源 VLM 文献是一片消融表的森林。Apple 的 MM1 测了图像编码器、连接器、数据配比的 13 种组合;Allen AI 的 Molmo 证明详细人工 caption 胜过 GPT-4V 蒸馏;Cambrian-1 跑了 20+ 个编码器对比;Idefics2 把五轴设计空间形式化;Prismatic VLMs 在受控基准上比了 27 套训练配方。从这片噪声里,有一小撮结果跨论文成立:图像编码器比连接器架构更重要,数据配比比两者都重要,详细人工 caption 胜过蒸馏合成数据。本节替你读完这些表。 学习目标 阅读完本节,你应当能够: 说出 VLM 的五轴设计空间:图像编码器、连接器、LLM、数据配比、分辨率方案。

开源 VLM 配方:什么真正起作用

本节摘要:2024~2026 年的开源 VLM 文献是一片消融表的森林。Apple 的 MM1 测了图像编码器、连接器、数据配比的 13 种组合;Allen AI 的 Molmo 证明详细人工 caption 胜过 GPT-4V 蒸馏;Cambrian-1 跑了 20+ 个编码器对比;Idefics2 把五轴设计空间形式化;Prismatic VLMs 在受控基准上比了 27 套训练配方。从这片噪声里,有一小撮结果跨论文成立:图像编码器比连接器架构更重要,数据配比比两者都重要,详细人工 caption 胜过蒸馏合成数据。本节替你读完这些表。

学习目标

阅读完本节,你应当能够:

  1. 说出 VLM 的五轴设计空间:图像编码器、连接器、LLM、数据配比、分辨率方案。
  2. 读懂 MM1/Idefics2/Cambrian-1 的消融表,预测哪个旋钮能搬动某个基准。
  3. 给定算力预算与任务组合,为新 VLM 挑配方(编码器、连接器、数据、分辨率)。
  4. 解释为什么在同等 token 数下,详细人工 caption 胜过 GPT-4V 蒸馏。

一、问题与直觉

开源 VLM 数以百计。「好」与「最优」之间的差距,大部分不是架构,而是数据、分辨率方案与编码器选择。当你的模型表现不佳时,知道先拧哪个旋钮,能帮你省下一个 500 万 GPU 小时的错误。

2023 年那波(LLaVA-1.5、InstructBLIP、MiniGPT-4)在 caption 对预训练 + LLaVA-Instruct-150k 上跑,是不错的基线,顶到 MMMU 约 35%。

2024 年那波(MM1、Idefics2、Molmo、Cambrian-1、Prismatic VLMs)做了穷尽式消融,结果既出乎意料又很实用。

五轴设计空间

Idefics2(Laurençon 等人,2024)命名了这些轴:

  1. 图像编码器:CLIP ViT-L/14、SigLIP SO400m/14、DINOv2 ViT-g/14、InternViT-6B。编码器在 patch 大小、分辨率、预训练目标上各异。
  2. 连接器:MLP(2~4 层)、Q-Former(32 query + 交叉注意力)、Perceiver Resampler(64 query)、C-Abstractor(卷积 + 双线性池化)。
  3. 语言模型:Llama-3 8B/70B、Mistral 7B、Phi-3、Gemma-2、Qwen2.5。LLM 大小是主导的参数成本。
  4. 训练数据:caption 对(CC3M、LAION)、交错(OBELICS、MMC4)、指令(LLaVA-Instruct、ShareGPT4V、PixMo、Cauldron)。
  5. 分辨率方案:固定 224/336/448、AnyRes、原生动态;训练中渐进或恒定。

每个生产 VLM 都在每个轴上做了选择。MMMU 分数的大部分方差由轴 1、4、5 解释——而不是你选了哪个连接器。

轴 1:编码器 > 连接器

MM1 第 3.2 节显示:从 CLIP ViT-L/14 换到 SigLIP SO400m/14 加了 3+ 个 MMMU 点;连接器从 MLP 换到 Perceiver Resampler 加的不到 1 个点。Idefics2 复现:SigLIP > CLIP,在同等 token 数下 Q-Former ≈ MLP ≈ Perceiver。

Cambrian-1 的「视觉编码器大对决」(Tong 等人,2024)在视觉中心基准(CV-Bench)上跑了 20+ 个编码器。榜首是 DINOv2 与 SigLIP 的混合;CLIP 居中;ImageBind 与 ViT-MAE 靠后。CLIP ViT-L 到 DINOv2 ViT-g/14 在 CV-Bench 上差约 5~7 个点。

2026 年开源 VLM 的默认编码器是 SigLIP 2 SO400m/14(语义 + 密集特征),有时与 DINOv2 ViT-g/14 特征拼接(Cambrian 的「空间视觉聚合器」就这么做)。

轴 2:连接器设计是平局

MM1、Idefics2、Prismatic、MM-Interleaved 得出同一结论:在固定视觉 token 数下,连接器架构几乎不重要。两层 MLP 在均值池化 patch 上的表现,与同 token 预算下 32 query 的 Q-Former相差不到 1 个点。

真正重要的是 token 数。视觉 token 越多 = LLM 算力越多 = 性能越好,直到收益递减。每图 64 token 对 OCR 太少;576~1024 token 是大多数开源 VLM 的甜点;2048+ 只在文档与图表上有用。

Q-Former vs MLP 是成本问题,不是质量问题:Q-Former 不管图像分辨率都把 token 钉在 32~64;MLP 吐出全部 patch token。高分辨率输入时 Q-Former 省 LLM 上下文;低分辨率时差异是噪声。

轴 3:LLM 大小定天花板

LLM 从 7B 翻到 13B,在每篇 VLM 论文里都稳定加 2~4 个 MMMU 点。到 70B 时大多数基准饱和。VLM 的多模态推理天花板,就是 LLM 的文本推理天花板——视觉编码器只能喂料,不能替它推理。

这就是为什么 Qwen2.5-VL-72B 与 Claude Opus 4.7 在 MMMU-Pro 与 ScreenSpot-Pro 上碾压:语言大脑够大。7B VLM 无法靠巧妙的连接器设计替代 70B VLM。

轴 4:数据——详细人工 caption 胜过蒸馏

Molmo + PixMo(Deitke 等人,2024)是 2024 年每个人都该读的结果。Allen AI 让人工标注者用 1~3 分钟密集的语音转文字描述图像,得到 71.2 万张密集 caption 图。训练数据里完全不用 GPT-4V 蒸馏

Molmo-72B 在 11 个基准中的 11 个上击败 Llama-3.2-90B-Vision。差距不是架构,而是 caption 质量。详细人工 caption 每图含的信息是简短网页 caption 的 5~10 倍,且在 GPT-4V 蒸馏幻觉的地方保持事实落地。

ShareGPT4V(Chen 等人,2023)与 Cauldron(Idefics2)沿用同一套路,混合人工 + GPT-4V caption。趋势清晰:对 2026 年前沿,caption 密度 > caption 数量 > 蒸馏便利

轴 5:分辨率及其方案

Idefics2 消融:384 → 448 加 12 个点;448 → 980 配图像切分(AnyRes)在 OCR 基准上再加 35 个点。恒定分辨率训练在中等精度上平台化;分辨率渐进(起步 224,收尾 448 或原生)训练更快、终点更高。

Cambrian-1 跑了分辨率 vs token 的权衡:固定算力下,你要么低分辨率更多 token,要么高分辨率更少 token。OCR 上高分辨率胜;通用场景理解上低分辨率多 token 胜。

2026 年生产配方:阶段 1 在 384 固定下训,阶段 2 对 OCR 重任务用最高 1280 的动态分辨率。

Prismatic 的受控对比

Prismatic VLMs(Karamcheti 等人,2024)是控制住所有轴的那篇论文。同样 13B LLM、同样指令数据、同样评估——一次只变一个轴。结果:

  • 每图视觉 token 数解释约 60% 方差。
  • 编码器选择解释约 20%。
  • 连接器架构解释约 5%。
  • 其余(数据配比、调度器、学习率)占剩下约 15%。

这是个粗略分解,但它是文献里对「我该先消融哪个轴」最干净的回答。

2026 年的选型器

基于这些证据,2026 年新项目的默认开源 VLM 配方:

  • 编码器:SigLIP 2 SO400m/14 原生分辨率 + NaFlex;若需分割/定位,再拼上 DINOv2 ViT-g/14 的密集特征。
  • 连接器:patch token 上的两层 MLP。除非 token 受限,否则跳过 Q-Former。
  • LLM:Qwen2.5 / Llama-3.1 / Gemma 2,省钱用 7B,要质量用 70B,按目标延迟挑。
  • 数据:PixMo + ShareGPT4V + Cauldron,再用任务专属指令数据补顶。
  • 分辨率:动态(每长边像素 256~1280)。
  • 方案:阶段 1 对齐(只训投影器)、阶段 2 全量微调、阶段 3 任务专属微调。

这些默认值的每一个,都能追溯到本节末尾引用论文里的一项实测消融。

二、从零实现

code/main.py 是一个消融表解析器与配方选型器。它编码了 MM1 与 Idefics2 的消融表(精简版),让你查询:

  • 「给定预算 X、任务 Y,哪套配方赢?」
  • 「我在 7B Llama 上把 SigLIP 换成 CLIP,预期 MMMU 变化多少?」
  • 「为 80% 置信度的答案,我该先消融哪个轴?」

消融表的数据结构

ABLATIONS = { "encoder": { ("CLIP-ViT-L/14", "MLP", "7B"): {"mmmu": 35.1, "cvbench": 55.0}, ("SigLIP-SO400m/14", "MLP", "7B"): {"mmmu": 38.4, "cvbench": 60.2}, ("SigLIP+DINOv2", "MLP", "7B"): {"mmmu": 38.9, "cvbench": 63.5}, }, "connector": { ("SigLIP", "MLP", "7B"): {"mmmu": 38.4}, ("SigLIP", "Q-Former", "7B"): {"mmmu": 38.1}, # 同 token 数下几乎打平 ("SigLIP", "Perceiver","7B"): {"mmmu": 38.6}, }, "llm_size": { ("SigLIP", "MLP", "7B"): {"mmmu": 38.4}, ("SigLIP", "MLP", "13B"): {"mmmu": 41.2}, # 翻倍 LLM 稳定加 2~4 点 ("SigLIP", "MLP", "70B"): {"mmmu": 47.5}, }, }

配方选型的伪代码

def pick_recipe(task, budget, latency_target): enc = "SigLIP2-SO400m" + ("+DINOv2" if task.needs_dense else "") conn = "MLP-2layer" # 连接器是平局, 选最简单的 llm = choose_llm(budget, latency_target) # 7B 省钱 / 70B 要质量 data = ["PixMo", "ShareGPT4V", "Cauldron"] + task.specific res = "dynamic 256-1280" return {"encoder": enc, "connector": conn, "llm": llm, "data": data, "resolution": res, "ablate_first": "visual_token_count"} # 解释 60% 方差

💡 工程要点:先消融「每图视觉 token 数」(解释 60% 方差),再消融编码器(20%),最后才轮到连接器(5%)。把 80% 的调参预算花在能搬动分数的轴上。

三、框架对比

  • MM1(Apple):工业级消融,覆盖编码器/连接器/数据配比 13 种组合,结论「编码器 > 连接器」的来源。
  • Idefics2(HuggingFace):把五轴设计空间形式化,提供可复现的消融脚本与 OBELICS/Cauldron 数据。
  • Molmo/PixMo(Allen AI):主打人工密集 caption,证明 caption 密度 > 蒸馏,提供 71.2 万张密集标注图。
  • Cambrian-1:20+ 编码器大对决,提出「空间视觉聚合器」拼接 SigLIP + DINOv2。
  • Prismatic VLMs:受控对比的标杆,同 LLM/同数据/同评估,一次只变一个轴,提供方差分解。

工程取舍:复现论文数字用各官方仓库;做新项目选型,直接套用本节的「2026 选型器」默认值,再按任务做局部消融;追求最强视觉感知拼接 SigLIP + DINOv2。

四、可复用产物

本节产出 outputs/skill-vlm-recipe-picker.md。给定目标任务组合、算力预算、延迟目标,它输出一套完整配方(编码器、连接器、LLM、数据配比、分辨率方案),每条选择都附消融引用。能让工程师在每个新 VLM 项目启动时,不必重造 Idefics2 的消融表。

五、练习

  1. 读 MM1:读 MM1 第 3.2 节。固定 2B LLM、预算 5000 万图时,哪个编码器赢?在 13B LLM 下答案会翻转吗?为什么?

  2. 拼接编码器:Cambrian-1 发现 DINOv2 + SigLIP 拼接在视觉中心基准上胜过任一单独,但在 MMMU 上不增益。预测哪些基准会涨、哪些持平。

  3. 移动 UI agent:你的目标是 2B LLM 上的移动 UI agent。挑编码器、连接器、分辨率、数据配比,每条选择用具体消融表论证。

  4. LLM 规模平台:Molmo 出 4B 与 72B。4B 与闭源 7B VLM 竞争力相当;72B 在 11/11 基准上击败 Llama-3.2-90B-Vision。这对「LLM 规模平台化」假说说明了什么?

  5. 设计消融:设计一张消融表,在 7B VLM 上隔离数据配比质量与编码器质量。最少要几次训练?提出四个轴设置。

本节要点回顾

  1. 五轴设计空间:图像编码器、连接器、LLM、数据配比、分辨率方案;MMMU 方差主要由轴 1、4、5 解释。
  2. 编码器 > 连接器:SigLIP 比 CLIP 加 3+ 点,连接器架构差不到 1 点。
  3. 连接器是平局:同 token 数下 MLP ≈ Q-Former ≈ Perceiver;真正重要的是 token 数。
  4. token 甜点:每图 576~1024 token;64 太少(OCR),2048+ 只在文档/图表有用。
  5. LLM 定天花板:7B→13B 加 2~4 点,70B 饱和;视觉编码器只喂料不推理。
  6. 人工 caption 胜蒸馏:Molmo/PixMo 71.2 万密集人工 caption,11/11 击败 Llama-3.2-90B-Vision,差距在 caption 密度。
  7. caption 密度 > 数量 > 蒸馏便利:2026 前沿的排序。
  8. 分辨率渐进:384→448 加 12 点,448→980(AnyRes)OCR 加 35 点;渐进训练更快更高。
  9. Prismatic 方差分解:token 数 60%、编码器 20%、连接器 5%、其余 15%。
  10. 2026 默认配方:SigLIP2 SO400m/14(+DINOv2)、两层 MLP、Qwen2.5/Llama-3.1、PixMo+ShareGPT4V+Cauldron、动态 256~1280、三阶段训练。

下一节,我们将进入 LLaVA-OneVision——它用同一套投影器与课程训练,把单图、多图、视频统一进一个模型,是 LLaVA 路线的集大成之作。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U