投机解码推理服务:EAGLE 草稿头与吞吐 本节摘要:投机解码——一个廉价草稿提议 token,目标模型一遍验证——在 2026 年已是生产级优化,不是研究花招。vLLM 0.7 里的 EAGLE-3 在真实流量上给 2.53 倍吞吐;P-EAGLE(AWS 2026)把并行投机推得更远;SGLang 的 SpecForge 在规模上训练草稿头;Red Hat 的 Speculators 发布了对齐草稿;TensorRT-LLM 让投机解码在 NVIDIA 上一等公民。本节要求你用 vLLM 或 SGLang 配 EAGLE 家族草稿、FP8 或 INT4 量化、HPA on queue-wait,把两个开源模型服务到 2.5 倍以上基线吞吐,并出一份完整的尾延迟报告。
本节摘要:投机解码——一个廉价草稿提议 token,目标模型一遍验证——在 2026 年已是生产级优化,不是研究花招。vLLM 0.7 里的 EAGLE-3 在真实流量上给 2.5~3 倍吞吐;P-EAGLE(AWS 2026)把并行投机推得更远;SGLang 的 SpecForge 在规模上训练草稿头;Red Hat 的 Speculators 发布了对齐草稿;TensorRT-LLM 让投机解码在 NVIDIA 上一等公民。本节要求你用 vLLM 或 SGLang 配 EAGLE 家族草稿、FP8 或 INT4 量化、HPA on queue-wait,把两个开源模型服务到 2.5 倍以上基线吞吐,并出一份完整的尾延迟报告。
对应原课程:Phase 19 · Lesson 14 ·
speculative-decoding-server(原英文phases/19-capstone-projects/14-speculative-decoding-server/docs/en.md)。
阅读完本节,你应当能够:
queue_wait_ms 自动扩缩,并出美元/百万 token 对比 Anthropic/OpenAI。投机解码在 2026 年成了日用品。EAGLE-3 草稿头在目标模型的隐藏状态上训练,预测 N 个 token 之前;目标模型一遍验证。6080% 的接受率换算成 23 倍端到端吞吐。vLLM 0.7 原生集成。SGLang + SpecForge 给你训练流水线。Red Hat Speculators 发布了 Llama 3.3 70B、Qwen3-Coder-30B MoE、GPT-OSS-120B 的对齐草稿。
功夫在服务运维,不在模型。接受率会随流量分布漂移(ShareGPT vs 代码 vs 领域数据)。拒绝下的尾延迟比不开投机时更差——你必须报多个 batch size 下的 p99,而不只是稳态 token/s。相对 Anthropic/OpenAI API 的美元/百万 token 是可信度杠杆。
投机解码两层。一个草稿模型(EAGLE-3 头、ngram、或更小的目标对齐模型)每步提 k 个候选 token。目标模型一遍验证所有 k 个;任何被接受的前缀替换贪心路径。接受率取决于草稿与目标的对齐度与输入分布。
EAGLE-3 在多数流量上胜过 ngram 草稿。P-EAGLE 跑并行投机做更深的草稿树。权衡:拒绝时的 p99 更高,因为验证遍更大。服务配置必须报按 batch size 分桶的延迟来暴露这点。
接受率换吞吐(核心数):
speedup ≈ 1.0 / (1.0 - acceptance_rate * draft_tokens_per_step / (draft_tokens_per_step + 1)) # 接受率 0.76、每步 4 草稿 token 时,约 2.5~3x 端到端吞吐 # 但拒绝遍让 p99 变差,必须按 batch 分桶报
部署是 Kubernetes。vLLM 0.7 每 GPU 或张量并行分片一个副本。HPA 按 queue-wait 而非 CPU 自动扩缩。FP8(Marlin)与 INT4(AWQ)量化把 GPU 显存压进 H100/H200。端到端报告是吞吐、接受率、batch 1/8/32 的 p50/p99、美元/百万 token。
outputs/skill-inference-server.md 描述交付物:一个带投机解码的、有完整基准报告与 K8s 部署的服务栈。评分量表:
| 权重 | 标准 | 度量方式 |
|---|---|---|
| 25 | 相对基线的实测加速 | 质量匹配下两模型 2.5 倍以上吞吐 |
| 20 | 真实流量接受率 | 按分布的接受率报告 |
| 20 | p99 尾延迟纪律 | batch 1/8/32 开关投机的 p99 |
| 20 | 运维 | K8s 部署、HPA on queue-wait、滚动平滑 |
| 15 | 写作与方法论 | 清楚解释改了什么、为什么 |
| 100 |
一次典型服务:
$ curl https://infer.example.com/v1/chat/completions -d '{"messages":[...]}' [serve] vLLM 0.7, Llama 3.3 70B FP8, EAGLE-3 active [decode] bs=8, accepted_tokens_per_step=3.2, acceptance_rate=0.76 [latency] first-token 42ms, full-response 980ms (620 tokens) [cost] $0.34 per 1M output tokens at sustained throughput
vLLM 0.7 是服务栈标杆,EAGLE/P-EAGLE 集成最成熟;SGLang 0.4 + SpecForge 给草稿头训练流水线,适合自训;TensorRT-LLM 是 NVIDIA 厂商方案,在 H100 上有时更快但锁定硬件。草稿侧,EAGLE-3 在多数流量上最优,ngram 是零成本兜底,P-EAGLE 在深草稿树上有额外收益但 p99 更差。本节建议主路径用 vLLM + EAGLE-3,把 P-EAGLE 作为「何时帮、何时害」的拐点实验,并保留 ngram 兜底——接受率掉阈值时自动切 ngram,练习会让你实现这个降级。
queue_wait_ms 自动扩缩,不按 CPU。下一节,我们转向「安全」——构建一道用 Constitutional AI 守护的、可审计的安全防线。