2.4 SOTA 前沿速览 本节速览 2024–2026 主流开源大语言模型(LLM)骨干。这些骨干既是 NLP 的主角,也是多模态大模型(MLLM)的中枢底座——后续章节讲 LLaVA、Qwen-VL、InternVL 时会反复回到这里。 说明:闭源模型(GPT-4、Claude、Gemini)的架构细节未公开,本节聚焦开源生态可查证的设计。 一、整体格局:三足鼎立 + 多语言新势力 当代开源 LLM 已形成「LLaMA 系 / Qwen 系 / Mistral 系」三足鼎立,加上 GLM、Yi、DeepSeek 等多语言新势力。下表是几个有代表性的型号: 系列 | 代表型号 | 参数量 | 词表 | 上下文 | 主要技术亮点 Meta LLaMA | LLaMA-3.
本节速览 2024–2026 主流开源大语言模型(LLM)骨干。这些骨干既是 NLP 的主角,也是多模态大模型(MLLM)的中枢底座——后续章节讲 LLaVA、Qwen-VL、InternVL 时会反复回到这里。
说明:闭源模型(GPT-4、Claude、Gemini)的架构细节未公开,本节聚焦开源生态可查证的设计。
当代开源 LLM 已形成「LLaMA 系 / Qwen 系 / Mistral 系」三足鼎立,加上 GLM、Yi、DeepSeek 等多语言新势力。下表是几个有代表性的型号:
| 系列 | 代表型号 | 参数量 | 词表 | 上下文 | 主要技术亮点 |
|---|---|---|---|---|---|
| Meta LLaMA | LLaMA-3.1-405B | 8B/70B/405B | 128K | 128K | 大规模训练 + 高质量后训练 |
| 阿里 Qwen | Qwen2.5-72B | 0.5B–72B 稠密 + MoE | 152K | 128K | 中文 token 效率高 + MoE |
| Mistral | Mixtral 8x22B | 7B/8x7B/8x22B | 32K–64K | 64K | Sliding Window + MoE |
| 智谱 GLM | GLM-4-9B | 9B | 150K | 128K | 自回归空白填充 + 长文档 |
| 零一万物 Yi | Yi-1.5-34B | 9B/34B | 64K | 32K | 中英文均衡 |
| DeepSeek | DeepSeek-V3 | 671B(37B 激活) | 100K+ | 128K | MLA 注意力 + 细粒度 MoE |
下面挑几个有代表性的设计点深入。
LLaMA 3 系列在工程上的最大贡献不是新结构,而是把「预训练 + 后训练」整套流程做到了工业化水准:
它的结构本身仍是 LLaMA 2 的延续:RMSNorm + SwiGLU + RoPE + GQA,没有颠覆性创新,但通过极致的数据与训练工程,把同样的结构推向了新的能力上限。这印证了一个判断:在 Decoder-Only + RoPE 路线确立后,数据与训练流程取代结构创新,成为 LLM 进步的主驱动。
阿里 Qwen 系列在国内场景的几大工程价值:
Qwen2.5 也是后续 Qwen2-VL、Qwen2.5-VL 等多模态大模型的底座。
Mistral 系列是「用更小参数达到更大模型效果」的代表:
MoE 的本质是解耦参数量与计算量——可以堆超大参数让模型容量大,但每次推理只激活一小部分,控制延迟与显存。这是 GPT-4 等超大模型普遍采用的技术(虽未公开,但泄露信息显示 GPT-4 是 8×220B 量级的 MoE)。
DeepSeek-V3 提出了 MLA(Multi-head Latent Attention):
MLA 是少数在注意力机制本身上做出实质性创新的工作,对长上下文推理成本影响很大。
把上面各家放在一起,可以看到 2024–2026 的 LLM 几乎形成了统一技术栈:
| 组件 | 主流选择 |
|---|---|
| 整体结构 | Decoder-Only + 自回归 NTP |
| 注意力 | Grouped Query Attention(GQA)或 MLA |
| 位置编码 | RoPE + 长上下文扩展(YaRN / LongRoPE / NTK-aware) |
| 归一化 | RMSNorm + Pre-Norm |
| FFN | SwiGLU |
| 大模型稀疏化 | MoE(细粒度专家 + Top-K 路由) |
| 训练目标 | NTP + SFT + DPO/RLHF |
| 上下文长度 | 128K–1M(依赖 RoPE 外推) |
这意味着多模态大模型可以直接「拿来主义」——把上面任意一个 LLM 当作中枢,前面接视觉编码器 + 投影器,就能搭出一个可用的 MLLM。
观察当代 LLM 的演化,能得出三条对 MLLM 设计的指导:
后续章节会反复回到这三点。
2024–2026 的开源 LLM 形成了「LLaMA / Qwen / Mistral / DeepSeek」四大主力,统一在 Decoder-Only + RoPE + SwiGLU + RMSNorm + MoE 的技术栈下。它们既是 NLP 任务的主力,也是多模态大模型的中枢底座。理解这些骨干的设计取舍,对后续读懂 LLaVA、Qwen-VL、InternVL 至关重要。
第2章到此结束。下一章(第3章)我们正式进入视觉——讲清楚如何把 Transformer 用到图像上,得到 Vision Transformer(ViT)以及它的一系列变体。