第 7 章 · 高性能推理服务(二):批处理、量化与 Speculative Decoding


文档摘要

第 7 章 · 高性能推理服务(二):批处理、量化与 Speculative Decoding 第 6 章的 PagedAttention 解决了显存碎片,但 LLM 推理仍有大量优化空间——Chunked Prefill 让两阶段更协调、量化让显存占用与算力成本减半、Speculative Decoding 让生成不损失精度却快 2-3 倍、PD 分离把推理架构重新解耦。本章是 LLM 推理优化的「进阶包」。 章节摘要 第 6 章建立了 LLM 推理的基础(服务化架构、PagedAttention)。本章在此基础上讲更高级的推理优化技术,把性能与成本推向新高度。

第 7 章 · 高性能推理服务(二):批处理、量化与 Speculative Decoding

第 6 章的 PagedAttention 解决了显存碎片,但 LLM 推理仍有大量优化空间——Chunked Prefill 让两阶段更协调、量化让显存占用与算力成本减半、Speculative Decoding 让生成不损失精度却快 2-3 倍、PD 分离把推理架构重新解耦。本章是 LLM 推理优化的「进阶包」。

章节摘要

第 6 章建立了 LLM 推理的基础(服务化架构、PagedAttention)。本章在此基础上讲更高级的推理优化技术,把性能与成本推向新高度。

本章首先讲 Chunked Prefill(分块预填充)——Prefill 是计算密集型、Decode 是内存密集型,长 Prefill 会打断 Decode,把 Prefill 切分成块与 Decode 交错执行,可让 GPU 始终满载且不牺牲延迟。然后讲 模型量化——INT8/INT4、AWQ/GPTQ 把权重与 KV Cache 压缩到 1/2-1/4,是降本的关键武器,但要权衡精度损失。接着讲 Speculative Decoding(投机解码)——用小模型生成草稿、大模型校验,做到「无损加速」,是延迟优化的重要创新。最后讲 PD 分离(Prefill/Decode Disaggregation) 与多模态/Agent 推理——把 Prefill 与 Decode 解耦到不同节点、跨节点 KV 传输、长上下文与多轮 Agent 推理的 KV 复用,是 2024 年以来的前沿方向。

读完本章,你将掌握把 LLM 推理成本与延迟进一步压缩 50% 以上的全部进阶手段。

学习目标

读完本章,你应当能够:

  1. 理解 Chunked Prefill 的工程意义,讲清它如何解决长 Prefill 打断 Decode 的问题。
  2. 辨析 INT8/INT4、AWQ、GPTQ、KV Cache 量化 的粒度与精度损失,给出选型建议。
  3. 讲清 Speculative Decoding(投机采样) 的草稿-校验原理与「无损保证」机制,辨析 Medusa、EAGLE 等变体。
  4. 理解 PD 分离(Prefill/Decode Disaggregation) 架构的动机与挑战,了解多模态与 Agent 推理的优化方向。

子章节安排与导引

编号 子章节 核心问题 关联后续
01 连续批处理与 Chunked Prefill Prefill 与 Decode 怎么协调?长 prompt 怎么不打断? 8.2 扩缩容
02 模型量化:INT8/INT4、AWQ 与 GPTQ 模型怎么压缩到 1/2-1/4?精度掉多少? 7.4 多模态
03 Speculative Decoding:投机采样 怎么无损加速生成 2-3 倍? 7.4 Agent
04 分离式推理与多模态/Agent 推理 PD 怎么分离?多模态与 Agent 怎么优化? 第 8 章综合案例

四个子章节构成「调度 → 压缩 → 加速 → 架构」的递进:先讲调度层优化(01),再讲模型压缩(02),然后讲采样加速(03),最后讲架构级创新(04)。读完这四节,你将拥有 LLM 推理优化的前沿全貌。

配图说明

  • Mermaid「Chunked Prefill 切分与混合调度时序」:在第 01 节给出,展示长 Prefill 切块后与 Decode 交错。
  • 表格「量化方案精度-性能对比」:在第 02 节给出,对比 INT8/AWQ/GPTQ/KV Cache 量化。
  • Mermaid「Speculative Decoding 草稿-校验流程」:在第 03 节给出,展示草稿模型与目标模型的协作。
  • SVG「Prefill/Decode 分离架构」:在第 04 节给出,展示 PD 节点解耦与跨节点 KV 传输。

SEO 关键词

Chunked Prefill、分块预填充、模型量化、INT8、INT4、INT2、AWQ、GPTQ、SmoothQuant、KV Cache 量化、FP8、Speculative Decoding、投机采样、投机解码、Medusa、EAGLE、草稿模型、无损加速、PD 分离、Prefill/Decode Disaggregation、多模态推理、Agent 推理、长上下文。

章节关联

  • 前置:第 6 章的服务化架构(6.1)、KV Cache 困境(6.2)、PagedAttention(6.3)是本章的基础。特别是 6.2 节讲的「Prefill 计算密集、Decode 内存密集」的两阶段不对称性,是本章 Chunked Prefill 与 PD 分离的直接动机。
  • 后续:本章的量化与 PD 分离是 2024 年以来的活跃研究方向,会在第 8 章综合案例与未来展望中再次提及。本章优化的产物(更便宜、更快的推理)是第 8 章可观测性与弹性扩缩容的对象。

发布者: 作者: 灏天文库 转发
评论区 (0)
U