第 6 章 · 高性能推理服务(一):服务化架构与 vLLM PagedAttention


文档摘要

第 6 章 · 高性能推理服务(一):服务化架构与 vLLM PagedAttention 训练一个模型要数周,但用户等一次回复的耐心只有几秒。推理服务是 AI 系统直接面对用户的「最后一公里」——它决定了模型能不能高效、稳定、低成本地交付价值。本章讲清模型服务化架构与 vLLM PagedAttention 这一推理优化的革命性突破。 章节摘要 第 5 章讲清了「模型怎么训出来」,本章进入下一层「高效交付层」,回答「模型怎么高效服务」。 本章首先讲模型服务化架构——KServe、Triton、Ray Serve 三大推理框架的定位与选型,以及推理协议(KServe v2)与模型仓库等核心概念。

第 6 章 · 高性能推理服务(一):服务化架构与 vLLM PagedAttention

训练一个模型要数周,但用户等一次回复的耐心只有几秒。推理服务是 AI 系统直接面对用户的「最后一公里」——它决定了模型能不能高效、稳定、低成本地交付价值。本章讲清模型服务化架构与 vLLM PagedAttention 这一推理优化的革命性突破。

章节摘要

第 5 章讲清了「模型怎么训出来」,本章进入下一层「高效交付层」,回答「模型怎么高效服务」。

本章首先讲模型服务化架构——KServe、Triton、Ray Serve 三大推理框架的定位与选型,以及推理协议(KServe v2)与模型仓库等核心概念。随后深入自回归 LLM 推理的根本瓶颈——KV Cache 内存困境:为什么 KV Cache 随序列长度线性增长、为什么传统连续批处理(static batching)吞吐低、为什么显存碎片严重。

接着是本章的高潮——vLLM 与 PagedAttention 原理:把操作系统的虚拟内存分页思想引入 KV Cache 管理,用 Block Table 把逻辑块映射到物理块,实现按需分配、零碎片、可共享。这一突破让 vLLM 的吞吐比 HuggingFace Transformers 高 10-20 倍,是 LLM 推理优化的里程碑。最后对比 vLLM 与 TGI(HuggingFace 的 Text Generation Inference)的实现差异与工程取舍。

读完本章,你将理解 LLM 推理为什么慢、PagedAttention 为什么快、主流推理框架怎么选。

学习目标

读完本章,你应当能够:

  1. 辨析 KServe、Triton、Ray Serve 三大推理框架的定位与适用场景,理解「服务框架 vs 推理引擎」的分层关系。
  2. 讲清 KServe v2 推理协议模型仓库(Model Repository) 的概念。
  3. 诊断自回归 LLM 推理的 KV Cache 固境:序列长度增长、显存碎片、最大批大小受限、Prefill/Decode 两阶段吞吐瓶颈。
  4. 讲清 PagedAttention 的分页映射原理:Block Table、虚拟/物理块、按需分配、Continuous Batching。
  5. 辨析 vLLM 与 TGI 的实现差异、工程取舍与社区生态。

子章节安排与导引

编号 子章节 核心问题 关联后续
01 模型服务化架构:KServe、Triton 与 Ray Serve 模型怎么变成服务?三大框架怎么选? 第 8 章扩缩容
02 自回归推理的 KV Cache 困境 LLM 推理为什么慢?瓶颈在哪? 7.1 Chunked Prefill
03 PagedAttention 分页显存原理 vLLM 怎么把吞吐提升 10-20 倍? 7.3-7.4
04 vLLM 与 TGI 对比与工程取舍 两大引擎怎么选?差异在哪? 第 7 章

四个子章节构成「服务 → 瓶颈 → 突破 → 选型」的递进:先讲服务化框架(01),再诊断 LLM 推理瓶颈(02),然后剖析 PagedAttention 突破(03),最后对比主流引擎选型(04)。读完这四节,你将拥有完整的 LLM 推理工程认知。

配图说明

  • Mermaid「KServe InferenceService 架构」:在第 01 节给出,展示 InferenceService CRD 如何驱动推理 Pod 与网络入口。
  • SVG「KV Cache 随序列长度增长」:在第 02 节给出,直观展示 KV Cache 为何是大头。
  • SVG「PagedAttention Block Table 虚拟/物理块映射」:在第 03 节给出,本章核心图。
  • Mermaid「Continuous Batching 时序」:在第 03 节给出,展示请求动态进出批次。
  • 表格「vLLM vs TGI 对比」:在第 04 节给出。

SEO 关键词

模型推理服务、KServe、Triton、Ray Serve、InferenceService、推理协议、模型仓库、vLLM、TGI、Text Generation Inference、PagedAttention、KV Cache、Continuous Batching、连续批处理、Prefill、Decode、LLM 推理加速、分页注意力、Block Table。

章节关联

  • 前置:第 5 章训出的模型进入本章的推理服务。第 5 章的张量并行(5.1 节)在本章推理时复用(推理也需要张量并行装下大模型)。第 4 章模型注册中心(4.4 节)的产物是本章推理的输入。
  • 后续:本章建立了推理服务与 PagedAttention 的基础。第 7 章将在此基础上讲 Chunked Prefill、量化、Speculative Decoding、PD 分离等更高级的推理优化。第 8 章会用本章的推理服务做扩缩容与稳定性保障。

发布者: 作者: 灏天文库 转发
评论区 (0)
U