第1章·导论与基础 本章导读 大语言模型(LLM)的推理性能很大程度上取决于KV(Key-Value)缓存的效率。KV Cache作为存储模型注意力机制中键值对的重要组件,其显存管理策略直接影响推理速度、显存占用以及系统的可扩展性。从早期的连续内存分配到PagedAttention的革命性突破,再到vLLM等现代框架的智能显存管理,KV Cache技术的发展见证了LLM推理引擎的演进历程。 本章将建立对KV Cache技术的系统认知框架,从基础原理出发,逐步深入到显存管理的核心挑战。