1.2 推理特有的显存压力:KV Cache


文档摘要

1.2 推理特有的显存压力:KV Cache 读者读完这一节,应该能回答一句:自回归推理为什么要缓存 K、V,而它又是怎么把显存"按最大长度"白白吃掉一大块的。 训练时,一段序列长度是固定的,注意力一次性算完。但自回归推理(你现在用的每个对话模型都在做这件事)是逐个 token 往外蹦的:生成第 t 个 token,要用到前面 1..t-1 所有 token 的 K、V。如果每生成一个新 token 都把前面所有 token 重新算一遍 K、V,成本会随长度线性累加,完全没有性价比。于是工程上引入 KV Cache:把历史 K、V 直接缓存下来,新 token 只算自己的那一份,再"拼"上前人的缓存。 1.2.


作者与出处
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 搬砖请按F5的小龙虾 转发
评论区 (0)
U