开源 VLM 配方:什么真正起作用 本节摘要:20242026 年的开源 VLM 文献是一片消融表的森林。Apple 的 MM1 测了图像编码器、连接器、数据配比的 13 种组合;Allen AI 的 Molmo 证明详细人工 caption 胜过 GPT-4V 蒸馏;Cambrian-1 跑了 20+ 个编码器对比;Idefics2 把五轴设计空间形式化;Prismatic VLMs 在受控基准上比了 27 套训练配方。从这片噪声里,有一小撮结果跨论文成立:图像编码器比连接器架构更重要,数据配比比两者都重要,详细人工 caption 胜过蒸馏合成数据。本节替你读完这些表。 学习目标 阅读完本节,你应当能够: 说出 VLM 的五轴设计空间:图像编码器、连接器、LLM、数据配比、分辨率方案。
本节摘要:2024~2026 年的开源 VLM 文献是一片消融表的森林。Apple 的 MM1 测了图像编码器、连接器、数据配比的 13 种组合;Allen AI 的 Molmo 证明详细人工 caption 胜过 GPT-4V 蒸馏;Cambrian-1 跑了 20+ 个编码器对比;Idefics2 把五轴设计空间形式化;Prismatic VLMs 在受控基准上比了 27 套训练配方。从这片噪声里,有一小撮结果跨论文成立:图像编码器比连接器架构更重要,数据配比比两者都重要,详细人工 caption 胜过蒸馏合成数据。本节替你读完这些表。
阅读完本节,你应当能够:
开源 VLM 数以百计。「好」与「最优」之间的差距,大部分不是架构,而是数据、分辨率方案与编码器选择。当你的模型表现不佳时,知道先拧哪个旋钮,能帮你省下一个 500 万 GPU 小时的错误。
2023 年那波(LLaVA-1.5、InstructBLIP、MiniGPT-4)在 caption 对预训练 + LLaVA-Instruct-150k 上跑,是不错的基线,顶到 MMMU 约 35%。
2024 年那波(MM1、Idefics2、Molmo、Cambrian-1、Prismatic VLMs)做了穷尽式消融,结果既出乎意料又很实用。
Idefics2(Laurençon 等人,2024)命名了这些轴:
每个生产 VLM 都在每个轴上做了选择。MMMU 分数的大部分方差由轴 1、4、5 解释——而不是你选了哪个连接器。
MM1 第 3.2 节显示:从 CLIP ViT-L/14 换到 SigLIP SO400m/14 加了 3+ 个 MMMU 点;连接器从 MLP 换到 Perceiver Resampler 加的不到 1 个点。Idefics2 复现:SigLIP > CLIP,在同等 token 数下 Q-Former ≈ MLP ≈ Perceiver。
Cambrian-1 的「视觉编码器大对决」(Tong 等人,2024)在视觉中心基准(CV-Bench)上跑了 20+ 个编码器。榜首是 DINOv2 与 SigLIP 的混合;CLIP 居中;ImageBind 与 ViT-MAE 靠后。CLIP ViT-L 到 DINOv2 ViT-g/14 在 CV-Bench 上差约 5~7 个点。
2026 年开源 VLM 的默认编码器是 SigLIP 2 SO400m/14(语义 + 密集特征),有时与 DINOv2 ViT-g/14 特征拼接(Cambrian 的「空间视觉聚合器」就这么做)。
MM1、Idefics2、Prismatic、MM-Interleaved 得出同一结论:在固定视觉 token 数下,连接器架构几乎不重要。两层 MLP 在均值池化 patch 上的表现,与同 token 预算下 32 query 的 Q-Former相差不到 1 个点。
真正重要的是 token 数。视觉 token 越多 = LLM 算力越多 = 性能越好,直到收益递减。每图 64 token 对 OCR 太少;576~1024 token 是大多数开源 VLM 的甜点;2048+ 只在文档与图表上有用。
Q-Former vs MLP 是成本问题,不是质量问题:Q-Former 不管图像分辨率都把 token 钉在 32~64;MLP 吐出全部 patch token。高分辨率输入时 Q-Former 省 LLM 上下文;低分辨率时差异是噪声。
LLM 从 7B 翻到 13B,在每篇 VLM 论文里都稳定加 2~4 个 MMMU 点。到 70B 时大多数基准饱和。VLM 的多模态推理天花板,就是 LLM 的文本推理天花板——视觉编码器只能喂料,不能替它推理。
这就是为什么 Qwen2.5-VL-72B 与 Claude Opus 4.7 在 MMMU-Pro 与 ScreenSpot-Pro 上碾压:语言大脑够大。7B VLM 无法靠巧妙的连接器设计替代 70B VLM。
Molmo + PixMo(Deitke 等人,2024)是 2024 年每个人都该读的结果。Allen AI 让人工标注者用 1~3 分钟密集的语音转文字描述图像,得到 71.2 万张密集 caption 图。训练数据里完全不用 GPT-4V 蒸馏。
Molmo-72B 在 11 个基准中的 11 个上击败 Llama-3.2-90B-Vision。差距不是架构,而是 caption 质量。详细人工 caption 每图含的信息是简短网页 caption 的 5~10 倍,且在 GPT-4V 蒸馏幻觉的地方保持事实落地。
ShareGPT4V(Chen 等人,2023)与 Cauldron(Idefics2)沿用同一套路,混合人工 + GPT-4V caption。趋势清晰:对 2026 年前沿,caption 密度 > caption 数量 > 蒸馏便利。
Idefics2 消融:384 → 448 加 12 个点;448 → 980 配图像切分(AnyRes)在 OCR 基准上再加 35 个点。恒定分辨率训练在中等精度上平台化;分辨率渐进(起步 224,收尾 448 或原生)训练更快、终点更高。
Cambrian-1 跑了分辨率 vs token 的权衡:固定算力下,你要么低分辨率更多 token,要么高分辨率更少 token。OCR 上高分辨率胜;通用场景理解上低分辨率多 token 胜。
2026 年生产配方:阶段 1 在 384 固定下训,阶段 2 对 OCR 重任务用最高 1280 的动态分辨率。
Prismatic VLMs(Karamcheti 等人,2024)是控制住所有轴的那篇论文。同样 13B LLM、同样指令数据、同样评估——一次只变一个轴。结果:
这是个粗略分解,但它是文献里对「我该先消融哪个轴」最干净的回答。
基于这些证据,2026 年新项目的默认开源 VLM 配方:
这些默认值的每一个,都能追溯到本节末尾引用论文里的一项实测消融。
code/main.py 是一个消融表解析器与配方选型器。它编码了 MM1 与 Idefics2 的消融表(精简版),让你查询:
ABLATIONS = { "encoder": { ("CLIP-ViT-L/14", "MLP", "7B"): {"mmmu": 35.1, "cvbench": 55.0}, ("SigLIP-SO400m/14", "MLP", "7B"): {"mmmu": 38.4, "cvbench": 60.2}, ("SigLIP+DINOv2", "MLP", "7B"): {"mmmu": 38.9, "cvbench": 63.5}, }, "connector": { ("SigLIP", "MLP", "7B"): {"mmmu": 38.4}, ("SigLIP", "Q-Former", "7B"): {"mmmu": 38.1}, # 同 token 数下几乎打平 ("SigLIP", "Perceiver","7B"): {"mmmu": 38.6}, }, "llm_size": { ("SigLIP", "MLP", "7B"): {"mmmu": 38.4}, ("SigLIP", "MLP", "13B"): {"mmmu": 41.2}, # 翻倍 LLM 稳定加 2~4 点 ("SigLIP", "MLP", "70B"): {"mmmu": 47.5}, }, }
def pick_recipe(task, budget, latency_target): enc = "SigLIP2-SO400m" + ("+DINOv2" if task.needs_dense else "") conn = "MLP-2layer" # 连接器是平局, 选最简单的 llm = choose_llm(budget, latency_target) # 7B 省钱 / 70B 要质量 data = ["PixMo", "ShareGPT4V", "Cauldron"] + task.specific res = "dynamic 256-1280" return {"encoder": enc, "connector": conn, "llm": llm, "data": data, "resolution": res, "ablate_first": "visual_token_count"} # 解释 60% 方差
💡 工程要点:先消融「每图视觉 token 数」(解释 60% 方差),再消融编码器(20%),最后才轮到连接器(5%)。把 80% 的调参预算花在能搬动分数的轴上。
工程取舍:复现论文数字用各官方仓库;做新项目选型,直接套用本节的「2026 选型器」默认值,再按任务做局部消融;追求最强视觉感知拼接 SigLIP + DINOv2。
本节产出 outputs/skill-vlm-recipe-picker.md。给定目标任务组合、算力预算、延迟目标,它输出一套完整配方(编码器、连接器、LLM、数据配比、分辨率方案),每条选择都附消融引用。能让工程师在每个新 VLM 项目启动时,不必重造 Idefics2 的消融表。
读 MM1:读 MM1 第 3.2 节。固定 2B LLM、预算 5000 万图时,哪个编码器赢?在 13B LLM 下答案会翻转吗?为什么?
拼接编码器:Cambrian-1 发现 DINOv2 + SigLIP 拼接在视觉中心基准上胜过任一单独,但在 MMMU 上不增益。预测哪些基准会涨、哪些持平。
移动 UI agent:你的目标是 2B LLM 上的移动 UI agent。挑编码器、连接器、分辨率、数据配比,每条选择用具体消融表论证。
LLM 规模平台:Molmo 出 4B 与 72B。4B 与闭源 7B VLM 竞争力相当;72B 在 11/11 基准上击败 Llama-3.2-90B-Vision。这对「LLM 规模平台化」假说说明了什么?
设计消融:设计一张消融表,在 7B VLM 上隔离数据配比质量与编码器质量。最少要几次训练?提出四个轴设置。
下一节,我们将进入 LLaVA-OneVision——它用同一套投影器与课程训练,把单图、多图、视频统一进一个模型,是 LLaVA 路线的集大成之作。