第 8 章 · 可观测性、弹性扩缩容与大流量稳定性保障 模型上线只是开始,稳定才是关键。一个 LLM 服务上线后,要面对流量突增、模型漂移、GPU 故障、超时雪崩等真实生产挑战。本章讲清 AI 系统的可观测性、弹性扩缩容、限流降级,并用综合案例把全书四层架构串联成端到端平台。 章节摘要 前 7 章建立了云原生 AI 的「调度底座、生产流水线、高效交付」三层。本章进入最后一层——「稳定运行层」,回答「上线后怎么稳定运行」。 本章首先讲 AI 系统的可观测性——传统的 Prometheus + Grafana 之外,AI 负载还需要 DCGM Exporter(GPU 指标)、TTFT/TPOT(LLM 专属延迟指标)、请求队列深度等。
模型上线只是开始,稳定才是关键。一个 LLM 服务上线后,要面对流量突增、模型漂移、GPU 故障、超时雪崩等真实生产挑战。本章讲清 AI 系统的可观测性、弹性扩缩容、限流降级,并用综合案例把全书四层架构串联成端到端平台。
前 7 章建立了云原生 AI 的「调度底座、生产流水线、高效交付」三层。本章进入最后一层——「稳定运行层」,回答「上线后怎么稳定运行」。
本章首先讲 AI 系统的可观测性——传统的 Prometheus + Grafana 之外,AI 负载还需要 DCGM Exporter(GPU 指标)、TTFT/TPOT(LLM 专属延迟指标)、请求队列深度等。然后讲自动扩缩容——HPA、VPA 的局限,KEDA 的自定义指标与事件驱动扩缩容如何应对 AI 负载,以及 GPU 弹性的冷启动挑战。接着讲大流量冲击下的稳定性保障——令牌桶限流、请求排队、推理降级(小模型路由)、熔断与过载保护、混沌工程压测。最后用综合案例把全书四层架构串联成一个端到端的云原生 AI 平台,并展望 Serverless GPU、绿色 AI、FinOps 等未来趋势。
读完本章,你将掌握把 AI 服务从「上线」带到「稳定生产」的全部工程能力,并拥有把全书知识串联成完整平台的全景视角。
读完本章,你应当能够:
| 编号 | 子章节 | 核心问题 | 关联后续 |
|---|---|---|---|
| 01 | AI 系统可观测性:Prometheus 与 GPU 指标 | 监控什么?关键指标有哪些? | 8.2-8.3 |
| 02 | 自动扩缩容:HPA、VPA 与 KEDA | 怎么自动扩缩?GPU 弹性怎么做? | 8.3 大流量 |
| 03 | 大流量稳定性:限流、降级与过载保护 | 大流量来了怎么扛?怎么降级保命? | 全书实践 |
| 04 | 综合案例与未来展望:从 0 到 1 构建云原生 AI 平台 | 全书怎么串?未来往哪走? | 全书收束 |
四个子章节构成「监控 → 扩缩 → 保护 → 综合」的递进:先讲监控(01),再讲扩缩(02),然后讲保护(03),最后用综合案例把全书串联(04)。读完这四节,你将拥有从监控到保护到平台的全栈稳定性能力。
AI 可观测性、Prometheus、Grafana、DCGM Exporter、TTFT、TPOT、首 Token 延迟、每 Token 延迟、请求队列、RED 方法、USE 方法、HPA、VPA、KEDA、ScaledObject、自动扩缩容、GPU 弹性、scale-to-zero、冷启动、令牌桶、漏桶、限流、降级、熔断、过载保护、Circuit Breaker、混沌工程、Serverless GPU、绿色 AI、FinOps、云原生 AI 平台。