投机解码:起草、验证、重复


文档摘要

投机解码:起草、验证、重复 本节摘要:自回归解码是串行的,每个 token 等前一个。投机解码打破这条链:便宜模型起草 N 个 token,昂贵模型一次前向验证全部 N 个——起草对了,你为 N 个生成只付一次大模型前向。70B LLM 在 H100 上采一个 token 约 30 ms,3B 草稿模型约 3 ms;让 3B 草稿前看 5 个 token、再跑一次 70B 验证全部 5 个,总耗时 可换最多 5 个被接受的 token,而直推生成要 。这就是投机解码的全部卖点:用一点额外显存(草稿模型)换 24 倍更低的解码延迟。关键在于必须保持分布——Leviathan 等(2023)和 Chen 等同时引入的投机采样,保证输出序列与「大模型自己从头采」同分布,零质量损失,只是更快。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U