7.2 LLaVA 系列架构演进 LLaVA 是当代开源多模态大模型的事实标杆。本节梳理它从 1.0 到 1.5、NeXT、OneVision 的演化轨迹,看每一代做了什么改进。 一、LLaVA 系列全景 下面逐一展开。 二、LLaVA 1.0:范式的诞生 LLaVA 1.0 是微软 + 威斯康星大学 2023 年 4 月发布的工作,开创了视觉指令微调范式。 架构 数据 阶段一:595K 图像字幕对(CC3M 子集) 阶段二:158K 视觉指令数据(LLaVA-Instruct-150K),其中: 58K 对话 77K 详细描述 23K 复杂推理 关键贡献 首次大规模视觉指令微调:把 NLP 指令微调思想扩展到多模态 GPT-4 辅助数据生成:用 GPT-4 + COCO
LLaVA 是当代开源多模态大模型的事实标杆。本节梳理它从 1.0 到 1.5、NeXT、OneVision 的演化轨迹,看每一代做了什么改进。
下面逐一展开。
LLaVA 1.0 是微软 + 威斯康星大学 2023 年 4 月发布的工作,开创了视觉指令微调范式。
[图像 224×224] → CLIP ViT-L/14 → 256 个视觉 token ↓ 单层线性投影 [文本指令] → 分词 → 文本 token ↓ 拼接 [视觉; 文本] ↓ Vicuna-13B → 回答
LLaVA 1.5(2023 年 10 月)通过多项工程改进,达到接近 GPT-4V 的水平,确立了「经典配方」。
从单层线性升级为两层 MLP(带 GELU 激活):
原 LLaVA 1.0: visual_token → Linear → text_space LLaVA 1.5: visual_token → Linear → GELU → Linear → text_space
MLP 投影器有更强的表达能力,能让视觉特征更好地映射到语言空间。
从 224×224 提升到 336×336:
总数据量约 76 万:
数据多样性显著提升。
支持 7B 和 13B 两种规模,后续扩展到更大。
LLaVA 1.5 的「CLIP ViT + MLP 投影 + LLM 全量微调」配方成为后续大量工作的默认起点。
LLaVA-NeXT(2024 年 2 月)针对 LLaVA 1.5 在高分辨率场景的不足,引入了几项关键创新。
针对文档、图表等需要高分辨率的场景,LLaVA-NeXT 引入「切子图」策略:
原图 1024×1024 ↓ 切成 2×2 = 4 个 336×336 子图(每个子图独立编码) ↓ 加上一个全局低分辨率子图(context view) ↓ 共 5 个子图,每个 576 个视觉 token,共 2880 个视觉 token ↓ 拼接进 LLM
支持多种分辨率:672×672、1024×1024、1280×1280 等。这种动态分辨率让 LLaVA-NeXT 在 OCR、文档理解、密集场景上效果大幅提升。
从 CLIP ViT-L/14 切换到 SigLIP-L/14:
总数据量约 100 万+:
支持 7B、13B、34B、甚至 72B、110B 多种 LLM 规模,覆盖从端侧到云端的全场景。
LLaVA-OneVision(2024 年 6 月)把 LLaVA 扩展到所有视觉场景:
用同一套架构处理三种任务:
[视频] → 均匀采样 8 帧 → 8 张图 → 各自编码 → 拼接 8 组视觉 token
总数据量约 300 万+:
适配 Qwen2、LLaMA 3 等最新 LLM,充分利用它们的长上下文能力。
观察 LLaVA 系列的迭代,可以总结几条规律:
每一代 LLaVA 的进步,最大驱动是数据:
模型架构变化不大,但数据规模与质量持续提升。这印证了「数据是新算法」的判断。
从 1.0 到 1.5,投影器从单层线性 → MLP——稍变复杂。
但后续 NeXT、OneVision 没有再增加架构复杂度——保持「视觉编码器 + MLP 投影 + LLM」的简洁结构。
这种「简单架构 + 大数据」是 LLaVA 系列成功的核心。
分辨率提升让模型从「玩具」走向「真实场景可用」。
场景扩展让 LLaVA 从「单图对话」走向「通用视觉助手」。
LLaVA 系列对开源多模态大模型生态的影响是决定性的:
「视觉编码器 + MLP 投影 + LLM + 视觉指令微调」成为开源事实标准。Qwen-VL、InternVL、MiniCPM-V、CogVLM 等都基于这一范式。
LLaVA 的开源(权重、代码、数据)让小团队也能复现与改进。后续大量工作(LLaVA-Plus、LLaVA-Interactive、Shikra 等)都建立在 LLaVA 基础上。
LLaVA-Bench、MMBench、MMMU、MM-Vet 等评估基准的普及,让多模态大模型的评估有统一标准。
基于 LLaVA 架构的商业模型大量出现(国内多家创业公司、阿里通义千问 VL 等),推动了多模态大模型的产业化。
| 版本 | 视觉编码器 | 投影器 | LLM | 数据量 | 分辨率 | 强项 |
|---|---|---|---|---|---|---|
| LLaVA 1.0 | CLIP ViT-L/14 | 单层线性 | Vicuna 13B | 15 万 | 224 | 范式确立 |
| LLaVA 1.5 | CLIP ViT-L/14@336 | 两层 MLP | Vicuna 7B/13B | 76 万 | 336 | 综合性能 |
| LLaVA-NeXT | SigLIP-L/14 | 两层 MLP | LLaMA 3 8B/70B 等 | 100 万+ | 动态 | 文档、OCR |
| LLaVA-OneVision | SigLIP-L | 两层 MLP | Qwen2 7B/72B | 300 万+ | 任意 | 视频、多图 |
LLaVA 系列虽是开源标杆,仍有几个公认局限:
LLaVA-NeXT 在 POPE 等幻觉基准上仍落后于 GPT-4V。这是 LLaVA 路线的固有挑战。
LLaVA 在视觉数学推理、复杂图表分析等任务上不如 GPT-4V。
LLaVA 主要靠指令微调,没有像 GPT-4 那样大规模 RLHF。这是它「不像 GPT-4 听话」的原因之一。
虽然 LLaVA-OneVision 支持视频,但只能处理 8-16 帧,长视频(如整部电影)仍挑战大。
这些局限指明了 LLaVA 后续演化的方向:更强的对齐、更细的视觉编码、更长的上下文。
LLaVA 系列从 1.0 到 OneVision 的演化,是「简单架构 + 数据驱动」哲学的胜利。每一代都通过数据扩展、分辨率提升、场景扩展带来显著进步,但架构始终保持简洁。LLaVA 确立了开源多模态大模型的标准范式,影响了 Qwen-VL、InternVL 等大量后续工作。它的局限(幻觉、推理、对齐)也指明了未来研究方向。
下一节(7.3)我们看如何用 RLHF 进一步对齐 LLaVA 等模型——这是 GPT-4 系列区别于开源模型的关键能力。