AI基础设施与推理优化 · 第 8 期 · 第一季收官

0.5B起草7B验证,推理快2倍

投机解码 · draft + verify · 推理杠杆

投机解码的杠杆:小模型(draft)先猜k个token,大模型(target)一次前向验证这k个——对的接受、错的从错位重生成。小模型猜对率高时,一次前向出多个token,推理快2~3倍;猜错了也只多花一次小模型成本。本质是用「便宜的猜测」换「昂贵的串行」。
⏱ 约 10 分钟 🎯 想让大模型推理再快一截的人 📦 源:推理优化

01为什么能快:把串行变批量

大模型自回归生成是串行的:一个一个出token,每步一次前向。瓶颈不在算力,在串行——GPU每步只算1个token,大量算力闲置。

投机解码的洞见:大模型验证k个token的成本 ≈ 生成1个token的成本(因为attention可以并行算k个位置,KV缓存复用)。所以让小模型先猜k个候选,大模型一次前向验证:第i个和target的分布匹配就接受,不匹配就拒绝并从第i个用target的分布重生成。接受率高的部分等于「白捡」了多个token。

朴素:每步1次大模型前向 → 1 token/步
投机:1次小模型猜k个 + 1次大模型验证k个 → a·k token/步
加速 ≈ a·k / 1(a=接受率,k=草稿长度)

关键变量是接受率a:小模型和大模型越像,a越高。极端情况a→1(小模型≈大模型),加速→k倍;a低(小模型太弱),加速→1(没省还多花小模型成本)。所以draft模型要「小而像」——同家族小号、或专门蒸馏训练的draft(如EAGLE/Medusa)。

推理的瓶颈是串行,
不是算力。
灏天文库 · AI基础设施与推理优化 P.22

02投机解码演示:草稿+验证

选草稿长度k和接受率a,点「跑一轮」,看小模型猜k个、大模型验证、接受几个拒绝几个。最后看加速比。

⚡ 投机解码演示
小模型起草k个token,大模型一次验证,接受匹配的、拒绝不匹配的。
① 小模型起草(draft)
② 大模型验证(target)
0
接受token
0
拒绝token
1.0×
本轮加速
点「跑一轮」开始
草稿接受拒绝+重生成

03draft模型怎么选

实战权衡:k别太大(4~8够,太大后面接受率断崖式下降,浪费小模型算力);a低于0.5就别用(小模型太弱,投机不如直接跑target);draft要小(draft成本要远低于target,否则省的token不够补draft开销)。EAGLE在Llama上实测2~3倍加速,几乎无损质量——这是当前最值得上线的推理加速技术之一。

同家族小号

最简单

Llama-70B+Llama-1.3B,同架构接受率高,起步首选。

EAGLE

SOTA

用target hidden state,接受率最高,2~3×加速。

Medusa

多头并行

多个draft头并行猜,训练简单,加速中等。

自蒸馏

定制最强

蒸馏draft针对性提升,训练贵但接受率最高。

用便宜的猜测,
换昂贵的串行。
灏天文库 · AI基础设施与推理优化 P.23

04带走这套清单

✅ 投机解码 6 条可执行规则

  1. 推理串行是瓶颈就上投机:GPU算力闲置、延迟敏感的场景,投机解码2~3×无损加速。
  2. draft用同家族小号起步:Llama-70B配Llama-1.3B,同tokenizer接受率最高,零训练成本。
  3. 追极致用EAGLE:用target hidden state的draft头,接受率最高,当前SOTA。
  4. k从4起步:太大后面接受率断崖,4~8是甜点,按接受率调。
  5. 接受率低于0.5就别用:小模型太弱投机亏本,直接跑target更快。
  6. draft要够小:draft成本要远低于target,否则省的token不够补draft开销。
小模型带大模型跑,
是杠杆不是替代。
灏天文库 · AI基础设施与推理优化 P.24