AI 与大模型 · 第 14 期 · 第二季第 6 期

投机解码 EAGLE,让小模型带大模型跑

草稿-验证 · 接受率决定加速

一句话结论:投机解码用小模型猜几个 token,大模型一次验证。猜对的直接采纳,猜错的从错处重算。大模型还是只跑一次但产出多个 token,吞吐翻倍。EAGLE 让草稿模型复用大模型的隐藏特征,接受率从 60% 提到 80%+,加速更猛。
⏱ 约 9 分钟 🎯 想让大模型推理吞吐翻倍的人 📦 源:ai-engineering-from-scratch §11

01反共识:不是并行生成,是并行验证

投机解码不是让两个模型同时生成,而是让小模型先猜、大模型批量验证——大模型一次前向本来就要算所有位置,验证几乎免费。

流程:小模型(draft)自回归猜 k 个 token(如 4 个)。把这 k 个候选连同前文一起喂给大模型(target),大模型一次前向算出每个位置的真实分布,逐个比对:候选和大模型分布一致就接受,不一致就拒绝并从该位置用大模型分布采样。猜对 k 个就一次产出 k+1 个 token;猜错第 1 个就退化成普通生成。

加速比 ≈ 1 + α·k / (1 + c)  (α=接受率, k=草稿长度, c=小模型开销)

关键:大模型验证这 k 个 token 的成本和生成 1 个 token 几乎一样(因为注意力本就是并行的)。所以接受率越高、草稿越长,加速越大。EAGLE 的创新是让草稿模型复用大模型上一层的隐藏特征,而不是只看 token——草稿更准,接受率更高。

大模型验证免费,
所以猜对了就赚。
灏天文库 · AI 与大模型 P.41

02解码加速演示:调接受率看加速比

调草稿长度和接受率,看投机解码相对普通解码的加速比。

🚀 投机解码加速演示
调草稿长度 k 和接受率 α,看加速比。
4
70%
普通解码1.0×
投机解码2.0×

03投机解码的适用边界

一个常见坑:用太小的草稿模型省成本,结果接受率只有 40%,加速不到 1.3×,还多了开销——不如不开。草稿模型要"小而准",EAGLE 用大模型自己的特征蒸馏草稿头,是当前最优解。

接受率低于一半,
投机就亏了。
灏天文库 · AI 与大模型 P.42

04带走这套加速清单

✅ 投机解码 6 条可执行规则

  1. 本质是并行验证不是并行生成:大模型一次前向验证多个候选。
  2. 接受率是命门:α 低于 50% 不如不开,要小而准的草稿模型。
  3. EAGLE 复用大模型特征:草稿更准,接受率 80%+。
  4. 草稿长度 k=4 起步:别盲目加长,连乘下降拉低接受率。
  5. 适合吞吐瓶颈:批处理服务受益,单次延迟未必降。
  6. 草稿模型要够准:太小省成本反而亏,平衡准度与开销。
小模型猜,大模型验,
验证免费就赚。
灏天文库 · AI 与大模型 P.43