2.4 SOTA 前沿速览


文档摘要

2.4 SOTA 前沿速览 本节速览 2024–2026 主流开源大语言模型(LLM)骨干。这些骨干既是 NLP 的主角,也是多模态大模型(MLLM)的中枢底座——后续章节讲 LLaVA、Qwen-VL、InternVL 时会反复回到这里。 说明:闭源模型(GPT-4、Claude、Gemini)的架构细节未公开,本节聚焦开源生态可查证的设计。 一、整体格局:三足鼎立 + 多语言新势力 当代开源 LLM 已形成「LLaMA 系 / Qwen 系 / Mistral 系」三足鼎立,加上 GLM、Yi、DeepSeek 等多语言新势力。下表是几个有代表性的型号: 系列 | 代表型号 | 参数量 | 词表 | 上下文 | 主要技术亮点 Meta LLaMA | LLaMA-3.

2.4 SOTA 前沿速览

本节速览 2024–2026 主流开源大语言模型(LLM)骨干。这些骨干既是 NLP 的主角,也是多模态大模型(MLLM)的中枢底座——后续章节讲 LLaVA、Qwen-VL、InternVL 时会反复回到这里。

说明:闭源模型(GPT-4、Claude、Gemini)的架构细节未公开,本节聚焦开源生态可查证的设计。

一、整体格局:三足鼎立 + 多语言新势力

当代开源 LLM 已形成「LLaMA 系 / Qwen 系 / Mistral 系」三足鼎立,加上 GLM、Yi、DeepSeek 等多语言新势力。下表是几个有代表性的型号:

系列 代表型号 参数量 词表 上下文 主要技术亮点
Meta LLaMA LLaMA-3.1-405B 8B/70B/405B 128K 128K 大规模训练 + 高质量后训练
阿里 Qwen Qwen2.5-72B 0.5B–72B 稠密 + MoE 152K 128K 中文 token 效率高 + MoE
Mistral Mixtral 8x22B 7B/8x7B/8x22B 32K–64K 64K Sliding Window + MoE
智谱 GLM GLM-4-9B 9B 150K 128K 自回归空白填充 + 长文档
零一万物 Yi Yi-1.5-34B 9B/34B 64K 32K 中英文均衡
DeepSeek DeepSeek-V3 671B(37B 激活) 100K+ 128K MLA 注意力 + 细粒度 MoE

下面挑几个有代表性的设计点深入。

二、LLaMA 3:规模化与后训练的范式

LLaMA 3 系列在工程上的最大贡献不是新结构,而是把「预训练 + 后训练」整套流程做到了工业化水准:

  • 预训练:15T token、50K GPU、训练数十天
  • 词表扩到 128K(兼容多语言与代码)
  • 后训练:SFT + 多轮 DPO + 拒绝采样 + 在线强化学习

它的结构本身仍是 LLaMA 2 的延续:RMSNorm + SwiGLU + RoPE + GQA,没有颠覆性创新,但通过极致的数据与训练工程,把同样的结构推向了新的能力上限。这印证了一个判断:在 Decoder-Only + RoPE 路线确立后,数据与训练流程取代结构创新,成为 LLM 进步的主驱动。

三、Qwen2.5:中文场景的事实标杆

阿里 Qwen 系列在国内场景的几大工程价值:

  • 152K 大词表:中文 token 效率显著高于 LLaMA 3,相同上下文窗口能塞下更多中文内容
  • 同系列稠密 + MoE 双形态:从 0.5B 到 72B 全覆盖,配合 Qwen2-MoE(57B 激活 14B)
  • 多任务强化:代码(Qwen2.5-Coder)、数学(Qwen2.5-Math)单独优化
  • 多模态联动:Qwen-VL、Qwen-Audio、Qwen2-VL 共享词表与骨干,便于联合训练

Qwen2.5 也是后续 Qwen2-VL、Qwen2.5-VL 等多模态大模型的底座。

四、Mistral:效率优先的典范

Mistral 系列是「用更小参数达到更大模型效果」的代表:

  • Sliding Window Attention(SWA):每层只关注局部窗口(如 4096),通过堆叠让信息跨窗口传递,把注意力复杂度从 O(N^2) 降到 O(N \cdot w)
  • Mixtral MoE:8 个专家中每次激活 2 个,参数总量 47B 但推理时计算量仅相当于 14B
  • 细粒度路由:把每个专家再拆分,使专家选择更灵活

MoE 的本质是解耦参数量与计算量——可以堆超大参数让模型容量大,但每次推理只激活一小部分,控制延迟与显存。这是 GPT-4 等超大模型普遍采用的技术(虽未公开,但泄露信息显示 GPT-4 是 8×220B 量级的 MoE)。

五、DeepSeek-V3:注意力机制的革新

DeepSeek-V3 提出了 MLA(Multi-head Latent Attention)

  • 把 K、V 压缩到一个低维潜在向量,再展开回多头
  • 大幅减少 KV cache 内存(这是长上下文推理的瓶颈)
  • 配合细粒度 MoE(256 个专家路由 8 个),671B 总参数只激活 37B

MLA 是少数在注意力机制本身上做出实质性创新的工作,对长上下文推理成本影响很大。

六、共性技术栈

把上面各家放在一起,可以看到 2024–2026 的 LLM 几乎形成了统一技术栈

组件 主流选择
整体结构 Decoder-Only + 自回归 NTP
注意力 Grouped Query Attention(GQA)或 MLA
位置编码 RoPE + 长上下文扩展(YaRN / LongRoPE / NTK-aware)
归一化 RMSNorm + Pre-Norm
FFN SwiGLU
大模型稀疏化 MoE(细粒度专家 + Top-K 路由)
训练目标 NTP + SFT + DPO/RLHF
上下文长度 128K–1M(依赖 RoPE 外推)

这意味着多模态大模型可以直接「拿来主义」——把上面任意一个 LLM 当作中枢,前面接视觉编码器 + 投影器,就能搭出一个可用的 MLLM。

七、对多模态大模型的启示

观察当代 LLM 的演化,能得出三条对 MLLM 设计的指导:

  1. Decoder-Only 是事实标准——所有主流 MLLM 的中枢都是 Decoder-Only
  2. 长上下文能力是关键——能处理长上下文的 LLM(128K+)才能支持高分辨率图像、长视频
  3. MoE 让大模型可承担——多模态训练数据稀缺,用 MoE 中枢可以在不爆炸参数的情况下扩展容量

后续章节会反复回到这三点。

小结

2024–2026 的开源 LLM 形成了「LLaMA / Qwen / Mistral / DeepSeek」四大主力,统一在 Decoder-Only + RoPE + SwiGLU + RMSNorm + MoE 的技术栈下。它们既是 NLP 任务的主力,也是多模态大模型的中枢底座。理解这些骨干的设计取舍,对后续读懂 LLaVA、Qwen-VL、InternVL 至关重要。

第2章到此结束。下一章(第3章)我们正式进入视觉——讲清楚如何把 Transformer 用到图像上,得到 Vision Transformer(ViT)以及它的一系列变体。


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U