如果说第2章是一出"技术困境的悲剧",那么本章就是一出"范式革命的史诗"。PagedAttention的诞生不是某个算法的渐进式改进,而是一次认知层面的根本性突破——它将操作系统领域积累了半个世纪的虚拟内存管理智慧,成功地移植到了GPU显存管理的全新领域。
PagedAttention是KV Cache技术发展史上的分水岭。在此之前,所有优化努力都局限在"如何在连续内存的框架内做得更好";在此之后,显存管理跳出了连续性的束缚,进入了"非连续但高效"的新范式。理解PagedAttention,就是理解现代LLM推理引擎的核心竞争力。
3.1 PagedAttention的核心原理(→文档68054)
这是理解整个PagedAttention体系的理论基石。本节从操作系统的虚拟内存分页机制出发,阐述PagedAttention如何将"逻辑页-物理页"的映射思想引入KV Cache管理。我们将深入分析页面(Page)的概念、Block Size的选择逻辑、页表映射的工作机制,以及非连续分配如何同时消除内部碎片和外部碎片。
3.2 动态页表设计(→文档68055)
页表是PagedAttention的"神经中枢"——它维护着逻辑页到物理页的映射关系,是所有内存管理操作的基础。本节深入分析页表的数据结构设计(Hash Map实现与O(1)查找)、页表项的字段设计(block_id、ref_count等)、vLLM中BlockTable的源码级实现,以及页表与GPU Kernel的协同工作方式。
3.3 页面级显存管理(→文档68056)
从理论到工程实现的关键一步。本节详细分析GPU显存池化机制、Block的分配与回收算法(FreeList管理、Copy-on-Write机制)、Prefix Caching的实现原理、Swapping机制(GPU显存不足时的CPU内存交换),以及这些技术如何协同工作实现接近100%的显存利用率。
PagedAttention的三大核心创新可以用一句话概括:
承接第2章:第2章详细分析了传统架构在连续内存分配上的三大矛盾(预分配浪费、碎片化、并发受限)。PagedAttention的核心创新正是逐一回应这三大矛盾:
启下第4章:PagedAttention提供了理论框架和基础算法,而vLLM则在此基础上构建了完整的工程系统。第4章将展示如何将PagedAttention的"分页思想"与连续批处理、Prefix Caching等高级技术融合,形成现代推理引擎的核心竞争力。
本章的技术内容密集且深入。建议读者准备好纸笔,在阅读过程中动手推演页表映射过程和Block分配流程,这样能获得最深刻的技术理解。