7.2 LLaVA 系列架构演进


文档摘要

7.2 LLaVA 系列架构演进 LLaVA 是当代开源多模态大模型的事实标杆。本节梳理它从 1.0 到 1.5、NeXT、OneVision 的演化轨迹,看每一代做了什么改进。 一、LLaVA 系列全景 下面逐一展开。 二、LLaVA 1.0:范式的诞生 LLaVA 1.0 是微软 + 威斯康星大学 2023 年 4 月发布的工作,开创了视觉指令微调范式。 架构 数据 阶段一:595K 图像字幕对(CC3M 子集) 阶段二:158K 视觉指令数据(LLaVA-Instruct-150K),其中: 58K 对话 77K 详细描述 23K 复杂推理 关键贡献 首次大规模视觉指令微调:把 NLP 指令微调思想扩展到多模态 GPT-4 辅助数据生成:用 GPT-4 + COCO

7.2 LLaVA 系列架构演进

LLaVA 是当代开源多模态大模型的事实标杆。本节梳理它从 1.0 到 1.5、NeXT、OneVision 的演化轨迹,看每一代做了什么改进。

一、LLaVA 系列全景

下面逐一展开。

二、LLaVA 1.0:范式的诞生

LLaVA 1.0 是微软 + 威斯康星大学 2023 年 4 月发布的工作,开创了视觉指令微调范式。

架构

[图像 224×224] → CLIP ViT-L/14 → 256 个视觉 token ↓ 单层线性投影 [文本指令] → 分词 → 文本 token ↓ 拼接 [视觉; 文本] ↓ Vicuna-13B → 回答

数据

  • 阶段一:595K 图像字幕对(CC3M 子集)
  • 阶段二:158K 视觉指令数据(LLaVA-Instruct-150K),其中:
    • 58K 对话
    • 77K 详细描述
    • 23K 复杂推理

关键贡献

  1. 首次大规模视觉指令微调:把 NLP 指令微调思想扩展到多模态
  2. GPT-4 辅助数据生成:用 GPT-4 + COCO 字幕生成多样化指令
  3. 简单架构惊艳效果:在 LLaVA-Bench 上达到 GPT-4V 的 70%+
  4. 完全开源:模型权重、训练代码、数据全部开源

LLaVA 1.0 的局限

  • 投影器是单层线性,表达能力有限
  • 分辨率固定 224,文档场景效果差
  • 视觉编码器与 LLM 都微调,训练成本较高
  • 数据规模相对较小

三、LLaVA 1.5:经典配方的确立

LLaVA 1.5(2023 年 10 月)通过多项工程改进,达到接近 GPT-4V 的水平,确立了「经典配方」。

关键改进

改进一:MLP 投影器

从单层线性升级为两层 MLP(带 GELU 激活):

原 LLaVA 1.0: visual_token → Linear → text_space LLaVA 1.5: visual_token → Linear → GELU → Linear → text_space

MLP 投影器有更强的表达能力,能让视觉特征更好地映射到语言空间。

改进二:高分辨率(336)

从 224×224 提升到 336×336:

  • 视觉 token 数从 256 增加到 576
  • 分辨率提升 50%,细粒度任务(OCR、文档)效果显著改善

改进三:数据大幅扩展

总数据量约 76 万:

  • 558K 字幕数据(阶段一)
  • 158K 对话
  • 50K GQA 风格问答
  • 件数张推理任务数据

数据多样性显著提升。

改进四:Vicuna-13B → 多种 LLM

支持 7B 和 13B 两种规模,后续扩展到更大。

LLaVA 1.5 的成就

  • 在 VQA、GQA、ScienceQA、TextVQA、POPE 等多个基准上达到 SOTA
  • 在 13B 规模下接近 GPT-4V(部分任务超过)
  • 完全开源,社区大量复现与扩展

LLaVA 1.5 的「CLIP ViT + MLP 投影 + LLM 全量微调」配方成为后续大量工作的默认起点。

四、LLaVA-NeXT(1.6):动态分辨率

LLaVA-NeXT(2024 年 2 月)针对 LLaVA 1.5 在高分辨率场景的不足,引入了几项关键创新。

创新一:动态分辨率

针对文档、图表等需要高分辨率的场景,LLaVA-NeXT 引入「切子图」策略:

原图 1024×1024 ↓ 切成 2×2 = 4 个 336×336 子图(每个子图独立编码) ↓ 加上一个全局低分辨率子图(context view) ↓ 共 5 个子图,每个 576 个视觉 token,共 2880 个视觉 token ↓ 拼接进 LLM

支持多种分辨率:672×672、1024×1024、1280×1280 等。这种动态分辨率让 LLaVA-NeXT 在 OCR、文档理解、密集场景上效果大幅提升。

创新二:SigLIP 视觉编码器

从 CLIP ViT-L/14 切换到 SigLIP-L/14

  • SigLIP 用 sigmoid 对比损失(第4章已介绍)
  • 训练更稳定,表征质量更高
  • 在零样本分类、检索等任务上优于 CLIP

创新三:数据规模与多样性

总数据量约 100 万+:

  • 大量 OCR、文档、图表数据
  • 多语言数据(中文、日文等)
  • 推理任务数据(数学、科学)
  • 代码截图数据

创新四:多 LLM 规模

支持 7B、13B、34B、甚至 72B、110B 多种 LLM 规模,覆盖从端侧到云端的全场景。

LLaVA-NeXT 的成就

  • 在 TextVQA、DocVQA、ChartQA 等文档任务上达到 SOTA
  • 支持任意分辨率输入
  • 多规模支持让社区可以根据算力选择

五、LLaVA-OneVision:统一图、多图、视频

LLaVA-OneVision(2024 年 6 月)把 LLaVA 扩展到所有视觉场景

统一架构

用同一套架构处理三种任务:

  • 单图:标准 LLaVA 流程
  • 多图:每张图独立编码后拼接
  • 视频:均匀采样关键帧(如 8 帧),每帧当一张图处理
[视频] → 均匀采样 8 帧 → 8 张图 → 各自编码 → 拼接 8 组视觉 token

数据扩展

总数据量约 300 万+:

  • 单图数据(继承 LLaVA-NeXT)
  • 多图数据(图像对比、变化检测)
  • 视频数据(动作识别、事件描述、时序推理)

LLM 适配

适配 Qwen2、LLaMA 3 等最新 LLM,充分利用它们的长上下文能力。

LLaVA-OneVision 的意义

  • 首次用统一架构在单图、多图、视频三类任务上同时达到 SOTA
  • 验证了「OneVision」设计哲学——一个模型处理所有视觉任务
  • 引领了多模态大模型向「统一视觉」方向的演化

六、LLaVA 系列的演化规律

观察 LLaVA 系列的迭代,可以总结几条规律:

规律一:数据驱动

每一代 LLaVA 的进步,最大驱动是数据

  • 1.0:15 万条 GPT-4 生成指令
  • 1.5:76 万条混合数据
  • NeXT:100 万+ 含文档/OCR
  • OneVision:300 万+ 含视频/多图

模型架构变化不大,但数据规模与质量持续提升。这印证了「数据是新算法」的判断。

规律二:架构趋简

从 1.0 到 1.5,投影器从单层线性 → MLP——稍变复杂。

但后续 NeXT、OneVision 没有再增加架构复杂度——保持「视觉编码器 + MLP 投影 + LLM」的简洁结构。

这种「简单架构 + 大数据」是 LLaVA 系列成功的核心。

规律三:分辨率持续提升

  • 1.0:224
  • 1.5:336
  • NeXT:动态分辨率,最大 1280+
  • OneVision:原生任意分辨率

分辨率提升让模型从「玩具」走向「真实场景可用」。

规律四:场景持续扩展

  • 1.0-1.5:自然图像
  • NeXT:加入文档、图表、OCR
  • OneVision:加入视频、多图

场景扩展让 LLaVA 从「单图对话」走向「通用视觉助手」。

七、LLaVA 系列的影响力

LLaVA 系列对开源多模态大模型生态的影响是决定性的:

影响一:确立标准范式

「视觉编码器 + MLP 投影 + LLM + 视觉指令微调」成为开源事实标准。Qwen-VL、InternVL、MiniCPM-V、CogVLM 等都基于这一范式。

影响二:开源生态繁荣

LLaVA 的开源(权重、代码、数据)让小团队也能复现与改进。后续大量工作(LLaVA-Plus、LLaVA-Interactive、Shikra 等)都建立在 LLaVA 基础上。

影响三:评估基准标准化

LLaVA-Bench、MMBench、MMMU、MM-Vet 等评估基准的普及,让多模态大模型的评估有统一标准。

影响四:商业化落地

基于 LLaVA 架构的商业模型大量出现(国内多家创业公司、阿里通义千问 VL 等),推动了多模态大模型的产业化。

八、LLaVA 系列的对照表

版本 视觉编码器 投影器 LLM 数据量 分辨率 强项
LLaVA 1.0 CLIP ViT-L/14 单层线性 Vicuna 13B 15 万 224 范式确立
LLaVA 1.5 CLIP ViT-L/14@336 两层 MLP Vicuna 7B/13B 76 万 336 综合性能
LLaVA-NeXT SigLIP-L/14 两层 MLP LLaMA 3 8B/70B 等 100 万+ 动态 文档、OCR
LLaVA-OneVision SigLIP-L 两层 MLP Qwen2 7B/72B 300 万+ 任意 视频、多图

九、LLaVA 系列的局限与未来

LLaVA 系列虽是开源标杆,仍有几个公认局限:

局限一:幻觉

LLaVA-NeXT 在 POPE 等幻觉基准上仍落后于 GPT-4V。这是 LLaVA 路线的固有挑战。

局限二:复杂推理弱

LLaVA 在视觉数学推理、复杂图表分析等任务上不如 GPT-4V。

局限三:缺乏对齐

LLaVA 主要靠指令微调,没有像 GPT-4 那样大规模 RLHF。这是它「不像 GPT-4 听话」的原因之一。

局限四:长视频处理能力有限

虽然 LLaVA-OneVision 支持视频,但只能处理 8-16 帧,长视频(如整部电影)仍挑战大。

这些局限指明了 LLaVA 后续演化的方向:更强的对齐、更细的视觉编码、更长的上下文。

小结

LLaVA 系列从 1.0 到 OneVision 的演化,是「简单架构 + 数据驱动」哲学的胜利。每一代都通过数据扩展、分辨率提升、场景扩展带来显著进步,但架构始终保持简洁。LLaVA 确立了开源多模态大模型的标准范式,影响了 Qwen-VL、InternVL 等大量后续工作。它的局限(幻觉、推理、对齐)也指明了未来研究方向。

下一节(7.3)我们看如何用 RLHF 进一步对齐 LLaVA 等模型——这是 GPT-4 系列区别于开源模型的关键能力。


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U