灏天文库

KV缓存与FlashAttention·推理为什么能快3倍

作者: 灏天 · 收录于 AI与大模型

内容摘要

 KV缓存与FlashAttention·推理为什么能快3倍 灏 灏天文库 · AI 与大模型 第 13 期 · 第二季连载 AI 与大模型 · 第 13 期 · 第二季第 5 期 KV 缓存与 Flash-Attention, 推理为什么能快 3 倍 避免重复算 · 减少显存读写 一句话结论: 推理慢,慢在两处 :每生成一个 token 都要把历史 token 的 K、V 重算一遍(KV 缓存解决);注意力要把 N² 注意力矩阵写进显存再读回(Flash-Attention 解决)。两个杠杆叠加,长序列推理能快 3 倍、显存砍一半。 ⏱ 约 10 分钟 🎯 想让大模型推理更快的人 📦 源:ai-engineering-from-scratch §11 01 反共识:慢不在算力,在重复和读写 很多人以为推理慢是 GPU 算力不够。其实算力往往没用满——瓶颈是重复计算和显存读写。 自回归生成时,每生成第 t 个 token,注意力要算它和前 t-1 个 token 的关系,需要前 t-1 个 token 的 K、V。

打开完整知识页 返回工坊集