第二章 核心模块:指标体系与抓取 如果说第一章解决的是"盯什么",第二章解决的就是"怎么把数据采到"。Prometheus 的拉模型(pull model)和传统的推模型(push)在 LLM 推理场景下各有取舍;而推理框架(vLLM、TGI、TensorRT-LLM)暴露的指标格式、命名、粒度又各不相同。 本章带你把"指标从哪来、怎么被抓取、怎么被存储和查询"这条链路彻底打通,并给出一套可以直接复用的 exporter 对接模板。读完你会明白:监控体系的脆弱点往往不在 Grafana 面板美不美,而在指标设计和抓取配置这一层就已经埋了雷。
如果说第一章解决的是"盯什么",第二章解决的就是"怎么把数据采到"。Prometheus 的拉模型(pull model)和传统的推模型(push)在 LLM 推理场景下各有取舍;而推理框架(vLLM、TGI、TensorRT-LLM)暴露的指标格式、命名、粒度又各不相同。
本章带你把"指标从哪来、怎么被抓取、怎么被存储和查询"这条链路彻底打通,并给出一套可以直接复用的 exporter 对接模板。读完你会明白:监控体系的脆弱点往往不在 Grafana 面板美不美,而在指标设计和抓取配置这一层就已经埋了雷。
第二章是"核心模块",是后面实战案例能跑起来的前提。建议配合你的真实推理服务边读边配。