- 文集信息
- 目录大纲
- 最新文档
- 知识宇宙
文集详情
文集导读
教程概述
这不是又一份"Prometheus 安装教程"。它专为生产环境里已经或准备跑大模型推理(vLLM、TGI、TensorRT-LLM 等)的团队而写,直击一个被通用监控模板反复忽略的事实:用 QPS、P99、错误率那套黄金信号去盯 LLM,会系统性失灵。从显存、算力、排队这三大物理约束出发,手把手教你把推理链路拆成"资源 / 生成 / 请求 / 成本"四层,重建一套真正盯得住、看得懂、能告警的监控体系,并落到可复用的 Grafana 看板与 Prometheus 抓取配置上。
你能带走什么
- 看清 LLM 监控为何不同:QPS 失灵、P99 失真、HTTP 200 也可能是"软失败"的真实案例与底层原理
- 一套四层监控需求清单:动手前先勾选要盯什么,告别无脑堆指标
- 指标体系与抓取实战:从需求到具体 metric 名、抓取路径、标签设计,含可直接抄的配置模板
- 性能与架构权衡:KV Cache、continuous batching、compute/memory-bound 如何影响你的监控与容量
- 真实看板与告警案例:哪些是"纸面好看、实战翻车"的坑,以及如何避
五章大纲
- 第一章 基础:监控大模型推理为何不同寻常(1.1 三板斧失灵 / 1.2 关键成本面 / 1.3 监控需求清单)
- 第二章 核心模块:指标体系与抓取(2.1 指标命名与标签 / 2.2 抓取与 exporter / 2.3 分位数与聚合陷阱)
- 第三章 进阶原理:性能与架构权衡(3.1 KV Cache 与批处理 / 3.2 容量规划与饱和度)
- 第四章 实战案例:看板与告警(4.1 Grafana 看板 / 4.2 告警规则与值班)
- 第五章 总结展望:从监控到自治(5.1 收口与自愈展望)
目录大纲
最新文档
知识宇宙
正在加载知识图谱...