5.5 SOTA 前沿速览


文档摘要

5.5 SOTA 前沿速览 本节速览 2023–2026 主流多模态大模型的融合架构。这些模型大多属于第5.2 节讲的早期融合范式,但在工程细节上各有创新。 一、当代融合架构的全景 二、LLaVA 系列:早期融合的事实标杆 LLaVA 是 2023 年微软 + 威斯康星大学发布的视觉指令微调模型,凭借极简架构 + 高质量数据成为开源生态主流。 LLaVA 1.5:确立经典配方 LLaVA-1.5 的架构非常简洁: 关键设计选择: 视觉编码器:CLIP ViT-L/14@336(参数约 300M) 投影器:2 层 MLP(参数约 20M),不是单层线性也不是 Q-Former LLM:Vicuna-7B 或 13B 训练:两阶段——投影器预训练(冻结 LLM)+ 全量指令微调 LLaVA-1.

5.5 SOTA 前沿速览

本节速览 2023–2026 主流多模态大模型的融合架构。这些模型大多属于第5.2 节讲的早期融合范式,但在工程细节上各有创新。

一、当代融合架构的全景

二、LLaVA 系列:早期融合的事实标杆

LLaVA 是 2023 年微软 + 威斯康星大学发布的视觉指令微调模型,凭借极简架构 + 高质量数据成为开源生态主流。

LLaVA 1.5:确立经典配方

LLaVA-1.5 的架构非常简洁:

[图像 336×336] → CLIP ViT-L/14@336 → 576 个视觉 token ↓ MLP 投影 (2 层 + GELU) ↓ 拼接在文本 token 之前 ↓ Vicuna-7B/13B (LLaMA 微调) → 输出文本

关键设计选择

  • 视觉编码器:CLIP ViT-L/14@336(参数约 300M)
  • 投影器:2 层 MLP(参数约 20M),不是单层线性也不是 Q-Former
  • LLM:Vicuna-7B 或 13B
  • 训练:两阶段——投影器预训练(冻结 LLM)+ 全量指令微调

LLaVA-1.5 的贡献是证明了「简单的 MLP 投影 + 全量指令微调」就足以达到 SOTA,不需要 Q-Former 这种复杂组件。这一发现深刻影响了后续设计。

LLaVA-NeXT(1.6):动态分辨率 + 强数据

LLaVA-NeXT 在 1.5 基础上引入几个关键改进:

  • 动态分辨率:把高分辨率图像切成多个 336×336 子图,分别编码后拼接,支持 672×672、1024×1024 等多种分辨率
  • 更强视觉编码器:切换到 SigLIP
  • 更多数据:加入 GQA、OCR、文档、代码等高质量数据
  • 更强 LLM:支持 34B、110B 等更大规模

动态分辨率的工程价值:处理文档、图表、密集场景时,普通 336 分辨率信息丢失严重。LLaVA-NeXT 把图像切成 2×2 或 4×4 子图分别编码,相当于在不爆炸 token 数的前提下提升有效分辨率。

LLaVA-OneVision:统一图、多图、视频

LLaVA-OneVision 进一步把 LLaVA 扩展到单图、多图、视频三种场景,用同一套架构处理:

  • 单图:标准 LLaVA 流程
  • 多图:每张图独立编码后拼接
  • 视频:均匀采样关键帧,每帧当一张图处理

这种「Any-resolution, Any-modality」的设计让 LLaVA 系列覆盖了几乎所有视觉场景。

三、MiniGPT-4:BLIP-2 与 Vicuna 的精简组合

MiniGPT-4 是 2023 年发布的轻量级多模态大模型,思路非常直接:

[图像] → BLIP-2 的 Q-Former(直接复用预训练权重) ↓ 32 个视觉 token ↓ 线性投影 → Vicuna 词表 ↓ 拼接进 Vicuna-13B → 输出

MiniGPT-4 的核心创新是复用 BLIP-2 的 Q-Former 权重,避免重新训练这一昂贵组件。只需训练一个小投影层,就能让 Q-Former 输出与 Vicuna 兼容。

它的贡献是证明了「组件复用 + 轻量适配」也能得到不错效果,为算力受限的实验室提供了可行路径。

四、Qwen-VL 系列:动态分辨率 + 视觉 Tokenizer

阿里 Qwen-VL 在早期融合基础上有几个独特设计:

Qwen-VL(初代)

  • 视觉 Tokenizer:在 ViT 之后加一个特殊的 tokenizer 模块,把 patch 压缩成更少的语义 token
  • 动态分辨率:原生支持任意分辨率输入
  • 中英文优化:训练数据大量中文场景

Qwen2-VL(2024)

进一步引入 Naive Dynamic ResolutionMulti-modal Rotary Position Embedding (M-RoPE)

  • Naive Dynamic Resolution:不再 resize 到固定大小,直接保留原始长宽比
  • M-RoPE:把 RoPE 扩展到多模态——同时编码时间、高度、宽度三个维度,让位置信息在视频、多图场景下保持一致

Qwen2-VL 在文档理解、视频分析、多语言场景上都达到 SOTA,是国内多模态大模型的代表。

五、InternVL 系列:大视觉编码器路线

上海 AI Lab 的 InternVL 走「视觉编码器也做大」路线:

InternVL 1.5

  • 视觉编码器:InternViT-6B(参数 6B,远大于 CLIP 的 300M)
  • 动态分辨率:类似 LLaVA-NeXT,切子图分别编码
  • LLM:InternLM2 或 Qwen

InternVL 2(2024)

进一步扩展:

  • 多个尺寸:1B、2B、4B、8B、26B、40B、76B,覆盖端侧到云端
  • 高质量数据:精细标注的中文场景
  • 多任务能力:OCR、文档、图表、视频

InternVL 的核心论点是「视觉编码器是 MLLM 的瓶颈」——传统观点认为 LLM 是瓶颈,但 InternVL 团队发现,把视觉编码器做到 6B 规模,能显著提升细粒度任务(OCR、文档理解)。

这一观察被后续工作广泛验证,CogVLM、DeepSeek-VL 等都开始重视视觉编码器规模。

六、MiniCPM-V:端侧多模态

面壁智能的 MiniCPM-V 系列把多模态大模型做到了手机能跑的规模:

  • 参数量:2B-8B
  • 视觉编码器:SigLIP
  • LLM:MiniCPM 或 Qwen
  • 强项:在 2-8B 规模下达到甚至超过早期 GPT-4V

MiniCPM-V 的工程价值:

  • 高效量化:支持 4bit、2bit 量化,手机内存占用 < 4GB
  • 高效推理:流式输出,token/s 在手机端可达 10+
  • 视觉 token 压缩:用 PatchMerger 等技巧压缩视觉 token 数

它代表了「多模态大模型从云端走向终端」的趋势。

七、CogVLM:视觉专家模块

智谱的 CogVLM 引入了「视觉专家模块」设计:

  • 在 LLM 的每层 FFN 与 Attention 中插入视觉专家分支
  • 文本 token 走原始分支
  • 视觉 token 走视觉专家分支
  • 两套参数独立,但共享底层结构

这种设计让 LLM 的每一层都能「深度视觉化」,而不会破坏文本处理能力。CogVLM 在视觉定位、grounding 等任务上表现突出。

八、DeepSeek-VL:MoE 多模态

DeepSeek-VL 把 MoE(混合专家)引入多模态:

  • LLM 用 MoE 结构(参数总量大但激活小)
  • 视觉编码器:SigLIP
  • 强调工程效率:相同效果下推理成本更低

MoE 多模态是 2024 年后的重要方向,因为它能解耦「参数容量」与「推理成本」——可以堆超大模型容量,但每次推理只激活小部分。

九、Idefics 系列:Flamingo 的开源复现与演化

Hugging Face 的 Idefics 是 Flamingo 的开源复现:

  • Idefics-1:忠实复现 Flamingo 架构(Perceiver Resampler + Gated Cross-Attention)
  • Idefics-2:转向早期融合 + SigLIP + 简化架构
  • Idefics-3:进一步优化,配合 LLaMA 3

Idefics 的演化轨迹很有代表性——从复杂中期融合走向简单早期融合,这与整个社区的趋势一致。

十、当代融合架构对比

模型 融合方式 视觉编码器 LLM 强项
LLaVA-NeXT 早期 + 动态分辨率 SigLIP-L LLaMA 3 通用、多分辨率
Qwen2-VL 早期 + M-RoPE ViT + Tokenizer Qwen2 中文、视频、文档
InternVL 2 早期 + 大视觉塔 InternViT-6B InternLM2/Qwen 细粒度、OCR
MiniGPT-4 中期 (复用 Q-Former) EVA-CLIP-G Vicuna 轻量、组件复用
MiniCPM-V 早期 + 视觉压缩 SigLIP MiniCPM/Qwen 端侧、低算力
CogVLM 早期 + 视觉专家 EVA-CLIP GLM 视觉 grounding
DeepSeek-VL 早期 + MoE SigLIP DeepSeek MoE 推理效率
Idefics-3 早期 + 简化 SigLIP-2 LLaMA 3 开源生态

十一、融合架构的演化趋势

观察 SOTA 模型,融合架构的演化方向:

  1. 从复杂到简单:早期 LLaVA/BLIP-2 的 Q-Former、Gated X-Attn 逐渐让位于简单 MLP 投影
  2. 从静态到动态分辨率:LLaVA-NeXT、Qwen2-VL、InternVL 全部支持任意分辨率
  3. 从单图到多模态序列:视频、多图、文档统一处理
  4. 从纯早期/中期到混合:CogVLM 的视觉专家、InternVL 的大视觉塔都是混合思路
  5. 从云端到端侧:MiniCPM-V 等让 MLLM 跑在手机上
  6. 从单一 LLM 到 MoE:DeepSeek-VL 等用 MoE 降低推理成本

十二、对未来多模态大模型的启示

融合架构的演化给我们的启示:

  1. 简单架构 + 好数据 + 大算力往往胜过复杂架构——LLaVA 的成功印证了这一点
  2. 视觉编码器是被低估的瓶颈——InternVL 6B 视觉塔证明了这点
  3. 动态分辨率是必需——固定分辨率模型在真实场景效果差
  4. 端侧部署是新战场——MiniCPM-V 引领了多模态大模型的端侧化
  5. 统一架构是未来——LLaVA-OneVision、GPT-4o 都在走向「一个模型处理所有视觉任务」

小结

LLaVA 系列让早期融合 + MLP 投影成为开源主流,Qwen2-VL、InternVL、MiniCPM-V 等在动态分辨率、视觉编码器规模、端侧部署上各有创新。复杂的中期融合(Flamingo、BLIP-2)逐渐让位于简单的早期融合,但 Q-Former 等思想仍在视频压缩等场景使用。融合架构正在向「简单 + 动态 + 统一 + 端侧」方向演化。

第5章到此结束。下一章(第6章)我们进入预训练范式——看这些融合架构背后用了哪些训练任务与优化目标。


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U