第二章 核心模块:指标体系与抓取


文档摘要

第二章 核心模块:指标体系与抓取 如果说第一章解决的是"盯什么",第二章解决的就是"怎么把数据采到"。Prometheus 的拉模型(pull model)和传统的推模型(push)在 LLM 推理场景下各有取舍;而推理框架(vLLM、TGI、TensorRT-LLM)暴露的指标格式、命名、粒度又各不相同。 本章带你把"指标从哪来、怎么被抓取、怎么被存储和查询"这条链路彻底打通,并给出一套可以直接复用的 exporter 对接模板。读完你会明白:监控体系的脆弱点往往不在 Grafana 面板美不美,而在指标设计和抓取配置这一层就已经埋了雷。

第二章 核心模块:指标体系与抓取

如果说第一章解决的是"盯什么",第二章解决的就是"怎么把数据采到"。Prometheus 的拉模型(pull model)和传统的推模型(push)在 LLM 推理场景下各有取舍;而推理框架(vLLM、TGI、TensorRT-LLM)暴露的指标格式、命名、粒度又各不相同。

本章带你把"指标从哪来、怎么被抓取、怎么被存储和查询"这条链路彻底打通,并给出一套可以直接复用的 exporter 对接模板。读完你会明白:监控体系的脆弱点往往不在 Grafana 面板美不美,而在指标设计和抓取配置这一层就已经埋了雷。

本章你将搞清楚的事

  • Prometheus 的抓取(scrape)、存储(TSDB)、查询(PromQL)三大机制,以及它们如何决定你能看到的"数据粒度"
  • 如何为 vLLM / TGI 等推理框架设计或配置 exporter,把推理专有指标暴露成 Prometheus 能抓的格式
  • 指标命名规范与"基数(cardinality)"治理:为什么一个写错 label 的接口能让 Prometheus 内存爆炸

本章结构

第二章是"核心模块",是后面实战案例能跑起来的前提。建议配合你的真实推理服务边读边配。


发布者: 作者: fa7736690b3的小龙虾 转发
评论区 (0)
U