第 7 章 · 高性能推理服务(二):批处理、量化与 Speculative Decoding 第 6 章的 PagedAttention 解决了显存碎片,但 LLM 推理仍有大量优化空间——Chunked Prefill 让两阶段更协调、量化让显存占用与算力成本减半、Speculative Decoding 让生成不损失精度却快 2-3 倍、PD 分离把推理架构重新解耦。本章是 LLM 推理优化的「进阶包」。 章节摘要 第 6 章建立了 LLM 推理的基础(服务化架构、PagedAttention)。本章在此基础上讲更高级的推理优化技术,把性能与成本推向新高度。
第 6 章的 PagedAttention 解决了显存碎片,但 LLM 推理仍有大量优化空间——Chunked Prefill 让两阶段更协调、量化让显存占用与算力成本减半、Speculative Decoding 让生成不损失精度却快 2-3 倍、PD 分离把推理架构重新解耦。本章是 LLM 推理优化的「进阶包」。
第 6 章建立了 LLM 推理的基础(服务化架构、PagedAttention)。本章在此基础上讲更高级的推理优化技术,把性能与成本推向新高度。
本章首先讲 Chunked Prefill(分块预填充)——Prefill 是计算密集型、Decode 是内存密集型,长 Prefill 会打断 Decode,把 Prefill 切分成块与 Decode 交错执行,可让 GPU 始终满载且不牺牲延迟。然后讲 模型量化——INT8/INT4、AWQ/GPTQ 把权重与 KV Cache 压缩到 1/2-1/4,是降本的关键武器,但要权衡精度损失。接着讲 Speculative Decoding(投机解码)——用小模型生成草稿、大模型校验,做到「无损加速」,是延迟优化的重要创新。最后讲 PD 分离(Prefill/Decode Disaggregation) 与多模态/Agent 推理——把 Prefill 与 Decode 解耦到不同节点、跨节点 KV 传输、长上下文与多轮 Agent 推理的 KV 复用,是 2024 年以来的前沿方向。
读完本章,你将掌握把 LLM 推理成本与延迟进一步压缩 50% 以上的全部进阶手段。
读完本章,你应当能够:
| 编号 | 子章节 | 核心问题 | 关联后续 |
|---|---|---|---|
| 01 | 连续批处理与 Chunked Prefill | Prefill 与 Decode 怎么协调?长 prompt 怎么不打断? | 8.2 扩缩容 |
| 02 | 模型量化:INT8/INT4、AWQ 与 GPTQ | 模型怎么压缩到 1/2-1/4?精度掉多少? | 7.4 多模态 |
| 03 | Speculative Decoding:投机采样 | 怎么无损加速生成 2-3 倍? | 7.4 Agent |
| 04 | 分离式推理与多模态/Agent 推理 | PD 怎么分离?多模态与 Agent 怎么优化? | 第 8 章综合案例 |
四个子章节构成「调度 → 压缩 → 加速 → 架构」的递进:先讲调度层优化(01),再讲模型压缩(02),然后讲采样加速(03),最后讲架构级创新(04)。读完这四节,你将拥有 LLM 推理优化的前沿全貌。
Chunked Prefill、分块预填充、模型量化、INT8、INT4、INT2、AWQ、GPTQ、SmoothQuant、KV Cache 量化、FP8、Speculative Decoding、投机采样、投机解码、Medusa、EAGLE、草稿模型、无损加速、PD 分离、Prefill/Decode Disaggregation、多模态推理、Agent 推理、长上下文。