6.1 内存池化与KV Cache共享技术 核心问题:为什么需要KV Cache共享? 在大语言模型的服务部署中,一个被长期忽视的效率问题是KV Cache的冗余计算。考虑一个典型的对话服务场景:100个并发用户向同一个模型发起请求,而其中30个用户的问题都涉及相同的系统提示(system prompt)或者相似的上下文信息。在传统的推理引擎中,每个请求都会独立计算属于自己的KV Cache,即便这些请求共享了大量相同的输入Token。