5.5 SOTA 前沿速览 本节速览 2023–2026 主流多模态大模型的融合架构。这些模型大多属于第5.2 节讲的早期融合范式,但在工程细节上各有创新。 一、当代融合架构的全景 二、LLaVA 系列:早期融合的事实标杆 LLaVA 是 2023 年微软 + 威斯康星大学发布的视觉指令微调模型,凭借极简架构 + 高质量数据成为开源生态主流。 LLaVA 1.5:确立经典配方 LLaVA-1.5 的架构非常简洁: 关键设计选择: 视觉编码器:CLIP ViT-L/14@336(参数约 300M) 投影器:2 层 MLP(参数约 20M),不是单层线性也不是 Q-Former LLM:Vicuna-7B 或 13B 训练:两阶段——投影器预训练(冻结 LLM)+ 全量指令微调 LLaVA-1.
本节速览 2023–2026 主流多模态大模型的融合架构。这些模型大多属于第5.2 节讲的早期融合范式,但在工程细节上各有创新。
LLaVA 是 2023 年微软 + 威斯康星大学发布的视觉指令微调模型,凭借极简架构 + 高质量数据成为开源生态主流。
LLaVA-1.5 的架构非常简洁:
[图像 336×336] → CLIP ViT-L/14@336 → 576 个视觉 token ↓ MLP 投影 (2 层 + GELU) ↓ 拼接在文本 token 之前 ↓ Vicuna-7B/13B (LLaMA 微调) → 输出文本
关键设计选择:
LLaVA-1.5 的贡献是证明了「简单的 MLP 投影 + 全量指令微调」就足以达到 SOTA,不需要 Q-Former 这种复杂组件。这一发现深刻影响了后续设计。
LLaVA-NeXT 在 1.5 基础上引入几个关键改进:
动态分辨率的工程价值:处理文档、图表、密集场景时,普通 336 分辨率信息丢失严重。LLaVA-NeXT 把图像切成 2×2 或 4×4 子图分别编码,相当于在不爆炸 token 数的前提下提升有效分辨率。
LLaVA-OneVision 进一步把 LLaVA 扩展到单图、多图、视频三种场景,用同一套架构处理:
这种「Any-resolution, Any-modality」的设计让 LLaVA 系列覆盖了几乎所有视觉场景。
MiniGPT-4 是 2023 年发布的轻量级多模态大模型,思路非常直接:
[图像] → BLIP-2 的 Q-Former(直接复用预训练权重) ↓ 32 个视觉 token ↓ 线性投影 → Vicuna 词表 ↓ 拼接进 Vicuna-13B → 输出
MiniGPT-4 的核心创新是复用 BLIP-2 的 Q-Former 权重,避免重新训练这一昂贵组件。只需训练一个小投影层,就能让 Q-Former 输出与 Vicuna 兼容。
它的贡献是证明了「组件复用 + 轻量适配」也能得到不错效果,为算力受限的实验室提供了可行路径。
阿里 Qwen-VL 在早期融合基础上有几个独特设计:
进一步引入 Naive Dynamic Resolution 与 Multi-modal Rotary Position Embedding (M-RoPE):
Qwen2-VL 在文档理解、视频分析、多语言场景上都达到 SOTA,是国内多模态大模型的代表。
上海 AI Lab 的 InternVL 走「视觉编码器也做大」路线:
进一步扩展:
InternVL 的核心论点是「视觉编码器是 MLLM 的瓶颈」——传统观点认为 LLM 是瓶颈,但 InternVL 团队发现,把视觉编码器做到 6B 规模,能显著提升细粒度任务(OCR、文档理解)。
这一观察被后续工作广泛验证,CogVLM、DeepSeek-VL 等都开始重视视觉编码器规模。
面壁智能的 MiniCPM-V 系列把多模态大模型做到了手机能跑的规模:
MiniCPM-V 的工程价值:
它代表了「多模态大模型从云端走向终端」的趋势。
智谱的 CogVLM 引入了「视觉专家模块」设计:
这种设计让 LLM 的每一层都能「深度视觉化」,而不会破坏文本处理能力。CogVLM 在视觉定位、grounding 等任务上表现突出。
DeepSeek-VL 把 MoE(混合专家)引入多模态:
MoE 多模态是 2024 年后的重要方向,因为它能解耦「参数容量」与「推理成本」——可以堆超大模型容量,但每次推理只激活小部分。
Hugging Face 的 Idefics 是 Flamingo 的开源复现:
Idefics 的演化轨迹很有代表性——从复杂中期融合走向简单早期融合,这与整个社区的趋势一致。
| 模型 | 融合方式 | 视觉编码器 | LLM | 强项 |
|---|---|---|---|---|
| LLaVA-NeXT | 早期 + 动态分辨率 | SigLIP-L | LLaMA 3 | 通用、多分辨率 |
| Qwen2-VL | 早期 + M-RoPE | ViT + Tokenizer | Qwen2 | 中文、视频、文档 |
| InternVL 2 | 早期 + 大视觉塔 | InternViT-6B | InternLM2/Qwen | 细粒度、OCR |
| MiniGPT-4 | 中期 (复用 Q-Former) | EVA-CLIP-G | Vicuna | 轻量、组件复用 |
| MiniCPM-V | 早期 + 视觉压缩 | SigLIP | MiniCPM/Qwen | 端侧、低算力 |
| CogVLM | 早期 + 视觉专家 | EVA-CLIP | GLM | 视觉 grounding |
| DeepSeek-VL | 早期 + MoE | SigLIP | DeepSeek MoE | 推理效率 |
| Idefics-3 | 早期 + 简化 | SigLIP-2 | LLaMA 3 | 开源生态 |
观察 SOTA 模型,融合架构的演化方向:
融合架构的演化给我们的启示:
LLaVA 系列让早期融合 + MLP 投影成为开源主流,Qwen2-VL、InternVL、MiniCPM-V 等在动态分辨率、视觉编码器规模、端侧部署上各有创新。复杂的中期融合(Flamingo、BLIP-2)逐渐让位于简单的早期融合,但 Q-Former 等思想仍在视频压缩等场景使用。融合架构正在向「简单 + 动态 + 统一 + 端侧」方向演化。
第5章到此结束。下一章(第6章)我们进入预训练范式——看这些融合架构背后用了哪些训练任务与优化目标。