灏天文库

PagedAttention·vLLM怎么省显存

作者: 灏天 · 收录于 AI基础设施与推理优化

内容摘要

 PagedAttention·vLLM怎么省显存 灏 灏天文库 · AI基础设施与推理优化 第 6 期 AI基础设施与推理优化 · 第 6 期 vLLM快24倍, 靠的是抄OS PagedAttention · KV缓存分页 · 显存碎片 vLLM的核心创新:把KV缓存当 虚拟内存 管。OS用分页解决内存碎片,vLLM用分页解决KV缓存碎片——切成固定大小的block,按需分配、逻辑连续物理离散。显存利用率从20%拉到80~90%,长序列和多变长请求不再OOM,吞吐24倍。 ⏱ 约 10 分钟 🎯 想搞懂vLLM为什么快的人 📦 源:推理优化 01 问题:KV缓存是显存黑洞 连续批处理下,请求长短不一、随时进出,KV缓存要按最大长度预分配——大部分预分配空间空着,还碎片化。 传统做法:每个请求预分配一块连续KV缓存(按max_seq_len)。问题有三: ①预分配浪费 (实际生成长度常远小于max,预留的空着); ②碎片化 (请求结束释放的块大小不一,新请求塞不进); ③写爆OOM (凑不齐连续大块,明明总剩余够却分配失败)。实测传统KV缓存显存利用率只有20~40%。

打开完整知识页 返回工坊集