6.2 分布式KV Cache与多GPU推理 分布式推理的必然性 当模型规模突破数百亿参数的门槛,单张GPU的显存容量已经无法容纳完整的模型权重和推理所需的KV Cache。以Llama-3-70B为例,其FP16权重大约需要140GB显存,而KV Cache在长序列场景下还需要额外的数十GB。即便是当前最大的A100 80GB或H100 80GB,单卡也无法满足需求。 解决方案是将模型和计算分布到多张GPU甚至多台服务器上,这就是分布式推理。在这一场景中,KV Cache的管理呈现出全新的复杂性:每一层Transformer的KV Cache自然地归属于计算该层的GPU,跨层的注意力计算需要跨设备的数据传输。