第一章 基础:监控大模型推理为何不同寻常 把模型送上生产,只是长征第一步;真正的考验,是它上线之后你还"看得见"它吗? 设想一个很典型的生产事故开局:你的聊天接口延迟 SLA 写着 P99 ≤ 2 秒,监控面板常年一片绿,某天上午却突然涌入一堆客诉--"回答变慢了""生成到一半卡住"。你打开 Grafana,QPS 没涨、错误率还是 0%、P99 曲线平得像条直线,均值稳稳停在 1.8 秒。你以为系统没问题,直到翻出逐请求日志,才发现那 5% 的超长请求把真实 P99 拉到了 40 秒,而因为默认面板只画了均值和 P50,这 5% 在你的眼睛里"不存在"。更糟的是,其中有十几个请求其实被长度上限截断了,HTTP 状态码是 200,业务上却是彻头彻尾的失败。