1.4 SOTA 前沿速览 本节把镜头拉到 2024–2026 的当下,对三大闭源旗舰与若干开源代表作一次全景速览。本章是导论,速览偏宏观对比;后续每章末都会有更聚焦的 SOTA 速览页(如第3章末会专讲视觉编码器 SOTA)。 说明:闭源模型的具体架构细节通常不公开,本节描述基于各厂商发布的官方技术报告与公开材料,对未公开部分会明确标注「推测」,避免误导。 一、闭源三大旗舰对比 维度 | GPT-4o | Gemini 2.x | Claude 3.
本节把镜头拉到 2024–2026 的当下,对三大闭源旗舰与若干开源代表作一次全景速览。本章是导论,速览偏宏观对比;后续每章末都会有更聚焦的 SOTA 速览页(如第3章末会专讲视觉编码器 SOTA)。
说明:闭源模型的具体架构细节通常不公开,本节描述基于各厂商发布的官方技术报告与公开材料,对未公开部分会明确标注「推测」,避免误导。
| 维度 | GPT-4o | Gemini 2.x | Claude 3.5 Sonnet(视觉) |
|---|---|---|---|
| 厂商 | OpenAI | Anthropic | |
| 原生多模态 | 是(端到端) | 是(端到端) | 否(图+文→文为主) |
| 支持输入模态 | 图、文、音、视频 | 图、文、音、视频 | 图、文(含 PDF) |
| 支持输出模态 | 文、音 | 图、文、音 | 文 |
| 强项 | 综合推理 + 实时语音对话 | 长上下文 + 多模态生成 | 文档理解 + 图表推理 |
| 训练范式(公开信息) | 联合多模态预训练 + RLHF | 联合多模态预训练 + RLHF | 文本预训练 + 视觉指令微调 |
下面分别简评。
GPT-4o 中「o」代表 omni(全能)。其最大突破是不再先用 ASR 把语音转文字、再用 LLM 处理、最后用 TTS 转回语音这种级联架构,而是用一个统一模型直接处理所有模态。这带来三个工程价值:
架构层面 OpenAI 未公开细节,但根据其技术报告可推测:模型内部存在统一的 token 化机制,把图像、音频、文本都压成同一空间中的离散 token,再由一个统一的 Transformer 处理。这与本教程第8章会讲的「Any-to-Any」路线一致。
Google 的 Gemini 系列从一开始就按原生多模态设计,不沿用「视觉编码器 + LLM」的拼装范式。Gemini 2.x 的几个公开亮点:
从工程视角看,Gemini 路线的最大意义是证明了「从头联合训练」在大算力 + 大数据下可以跑通,且效果不输拼装路线。但其训练数据、模型结构、对齐流程的细节均未公开。
Anthropic 的 Claude 系列在多模态上偏保守——主攻「图+文→文」路线。其特色是:
从公开行为看,Claude 大概率走的是「视觉编码器 + 强 LLM + 高质量视觉指令微调数据」的经典 LLaVA 路线,但用了远超开源的标注质量与对齐策略。
闭源模型虽然能力强,但无法私有部署、不可微调、不透明。开源生态在 2023 年后蓬勃发展,形成了几个代表性系列:
| 系列 | 出品方 | 主要特色 |
|---|---|---|
| LLaVA-NeXT | 微软 + 威斯康星大学 | 视觉指令微调范式确立者,迭代迅速 |
| Qwen-VL / Qwen2-VL | 阿里达摩院 | 动态分辨率,中英文场景强 |
| InternVL / InternVL 2 | 上海 AI Lab | 大规模视觉编码器,多任务表现均衡 |
| MiniCPM-V | 面壁智能 | 端侧小模型,2B–8B 参数即达到早期 GPT-4V 水平 |
| mPLUG-Owl3 | 阿里达摩院 | 高效注意力,长视频友好 |
| CogVLM / Yi-VL | 智谱 / 零一万物 | 中文场景优化 |
每个系列的具体架构差异,会在对应章节展开。例如 LLaVA 的细节在第7章,Qwen-VL 的动态分辨率在第3章末,InternVL 的大规模视觉编码器在第3章末。
把 SOTA 模型摆在一起,可以观察到几个趋势:
面对层出不穷的新模型,建议建立三种判断视角:
带着这三个视角去读任何新模型的技术报告,你都能很快定位它的贡献与局限。
2024–2026 的多模态大模型已经进入「原生多模态 + 长上下文 + Agent 化」的成熟期。闭源旗舰在能力上仍领先,但开源生态的迭代速度极快,差距正在以季度为单位缩小。
第1章到此结束。下一章(第2章)我们回到地基,把贯穿所有这些模型的「通用算子」—— Transformer——拆解清楚,为后续讨论视觉编码器、对比学习、跨模态融合奠定基础。