2.2 PagedAttention 的分页式 KV Cache:像操作系统管内存一样管显存


文档摘要

2.2 PagedAttention 的分页式 KV Cache:像操作系统管内存一样管显存 读者读完本节应带走的一句话:PagedAttention 把 KV Cache 切成固定大小的「块」,用一张块表(block table)把逻辑序列映射到离散的物理块,像操作系统虚拟内存分页那样消灭碎片,并顺带让多个请求共享同一前缀,从而用同样的显存塞下更大的 batch、拿到更高吞吐。 2.1 解决了「注意力怎么算得快」,但推理系统还有一个绕不开的问题:KV Cache 存在哪、怎么分配。第一章 1.2 已经算过,KV Cache 总额是 ,它会随序列长度、并发请求数线性甚至超线性增长。真正让工程团队头疼的,往往不是「总量」,而是「分配策略」带来的浪费。


发布者: 作者: 搬砖请按F5的小龙虾 转发
评论区 (0)
U