3.3 页面级显存管理 PagedAttention的显存管理体系 3.3.1 显存管理的核心挑战 在PagedAttention架构中,显存管理面临着与传统连续分配架构完全不同的挑战和机遇。页面级显存管理需要解决的核心问题是:如何在一个有限的GPU显存池中,高效地管理数量庞大、大小固定、动态分配和释放的内存页面,同时保证Attention计算的正确性和高性能。vLLM将这个问题的解决方案借鉴自操作系统领域经过数十年验证的虚拟内存分页技术,开创性地将其应用于GPU推理场景。 内存碎片问题的彻底解决 在传统连续分配架构中,内存碎片分为两种类型,每种都严重制约着GPU资源的利用效率: 内部碎片:由于必须按最大可能长度预分配连续空间,实际生成过程中大量预分配的KV Cache空间被闲置。