灏天文库

推理为什么慢·KV缓存才是关键

作者: 灏天 · 收录于 AI基础设施与推理优化

内容摘要

 推理为什么慢·KV缓存才是关键 灏 灏天文库 · AI基础设施与推理优化 第 1 期 AI基础设施与推理优化 · 第 1 期 生成第100个token, 要重算前99个 ? KV缓存 · 连续批处理 · 推理加速 自回归生成的致命伤:每出一个token,attention要把 所有历史token 重算一遍。KV缓存把每层的K、V存下来复用,把每步从O(n²)降到O(n);连续批处理再让多请求拼车填满GPU。这是vLLM比HF快24倍的底层逻辑。 ⏱ 约 10 分钟 🎯 想搞懂推理为什么慢的人 📦 源:airllm + 推理优化 01 慢在哪:每步都在重算历史 大模型生成是「自回归」:一个token一个token往外蹦。每蹦一个,要把整段序列再过一遍attention。 attention的公式是 Q × Kᵀ / √d → softmax → × V 。生成第t个token时,Q只有1个(当前位),但K、V要包含 前面所有token 。

打开完整知识页 返回工坊集