灏天文库

投机解码·小模型带大模型跑

作者: 灏天 · 收录于 AI基础设施与推理优化

内容摘要

 投机解码·小模型带大模型跑 灏 灏天文库 · AI基础设施与推理优化 第 8 期 · 第一季收官 AI基础设施与推理优化 · 第 8 期 · 第一季收官 0.5B起草7B验证, 推理快2倍 投机解码 · draft + verify · 推理杠杆 投机解码的杠杆:小模型(draft)先猜k个token,大模型(target)一次前向验证这k个—— 对的接受、错的从错位重生成 。小模型猜对率高时,一次前向出多个token,推理快2~3倍;猜错了也只多花一次小模型成本。本质是用「便宜的猜测」换「昂贵的串行」。 ⏱ 约 10 分钟 🎯 想让大模型推理再快一截的人 📦 源:推理优化 01 为什么能快:把串行变批量 大模型自回归生成是串行的:一个一个出token,每步一次前向。瓶颈不在算力,在串行——GPU每步只算1个token,大量算力闲置。 投机解码的洞见: 大模型验证k个token的成本 ≈ 生成1个token的成本 (因为attention可以并行算k个位置,KV缓存复用)。

打开完整知识页 返回工坊集