第 6 章 · 高性能推理服务(一):服务化架构与 vLLM PagedAttention 训练一个模型要数周,但用户等一次回复的耐心只有几秒。推理服务是 AI 系统直接面对用户的「最后一公里」——它决定了模型能不能高效、稳定、低成本地交付价值。本章讲清模型服务化架构与 vLLM PagedAttention 这一推理优化的革命性突破。 章节摘要 第 5 章讲清了「模型怎么训出来」,本章进入下一层「高效交付层」,回答「模型怎么高效服务」。 本章首先讲模型服务化架构——KServe、Triton、Ray Serve 三大推理框架的定位与选型,以及推理协议(KServe v2)与模型仓库等核心概念。
训练一个模型要数周,但用户等一次回复的耐心只有几秒。推理服务是 AI 系统直接面对用户的「最后一公里」——它决定了模型能不能高效、稳定、低成本地交付价值。本章讲清模型服务化架构与 vLLM PagedAttention 这一推理优化的革命性突破。
第 5 章讲清了「模型怎么训出来」,本章进入下一层「高效交付层」,回答「模型怎么高效服务」。
本章首先讲模型服务化架构——KServe、Triton、Ray Serve 三大推理框架的定位与选型,以及推理协议(KServe v2)与模型仓库等核心概念。随后深入自回归 LLM 推理的根本瓶颈——KV Cache 内存困境:为什么 KV Cache 随序列长度线性增长、为什么传统连续批处理(static batching)吞吐低、为什么显存碎片严重。
接着是本章的高潮——vLLM 与 PagedAttention 原理:把操作系统的虚拟内存分页思想引入 KV Cache 管理,用 Block Table 把逻辑块映射到物理块,实现按需分配、零碎片、可共享。这一突破让 vLLM 的吞吐比 HuggingFace Transformers 高 10-20 倍,是 LLM 推理优化的里程碑。最后对比 vLLM 与 TGI(HuggingFace 的 Text Generation Inference)的实现差异与工程取舍。
读完本章,你将理解 LLM 推理为什么慢、PagedAttention 为什么快、主流推理框架怎么选。
读完本章,你应当能够:
| 编号 | 子章节 | 核心问题 | 关联后续 |
|---|---|---|---|
| 01 | 模型服务化架构:KServe、Triton 与 Ray Serve | 模型怎么变成服务?三大框架怎么选? | 第 8 章扩缩容 |
| 02 | 自回归推理的 KV Cache 困境 | LLM 推理为什么慢?瓶颈在哪? | 7.1 Chunked Prefill |
| 03 | PagedAttention 分页显存原理 | vLLM 怎么把吞吐提升 10-20 倍? | 7.3-7.4 |
| 04 | vLLM 与 TGI 对比与工程取舍 | 两大引擎怎么选?差异在哪? | 第 7 章 |
四个子章节构成「服务 → 瓶颈 → 突破 → 选型」的递进:先讲服务化框架(01),再诊断 LLM 推理瓶颈(02),然后剖析 PagedAttention 突破(03),最后对比主流引擎选型(04)。读完这四节,你将拥有完整的 LLM 推理工程认知。
模型推理服务、KServe、Triton、Ray Serve、InferenceService、推理协议、模型仓库、vLLM、TGI、Text Generation Inference、PagedAttention、KV Cache、Continuous Batching、连续批处理、Prefill、Decode、LLM 推理加速、分页注意力、Block Table。