第三章 进阶原理:性能与架构权衡 当你的推理流量从"能跑"走向"扛得住",监控体系自己也会成为性能瓶颈。一个显存里跑着大模型的服务节点,旁边再挂一个被高基数指标拖垮的 Prometheus,是生产里真实发生过的荒唐事。 本章不教你"照着配",而是讲清楚工程权衡:哪些指标值得高成本采集,哪些该果断丢弃;以及当单机 Prometheus 顶不住时,VictoriaMetrics 等替代方案到底值不值得换。我的观点会很明确——很多团队过早上了重型架构,结果复杂度反噬了可观测性本身。
当你的推理流量从"能跑"走向"扛得住",监控体系自己也会成为性能瓶颈。一个显存里跑着大模型的服务节点,旁边再挂一个被高基数指标拖垮的 Prometheus,是生产里真实发生过的荒唐事。
本章不教你"照着配",而是讲清楚工程权衡:哪些指标值得高成本采集,哪些该果断丢弃;以及当单机 Prometheus 顶不住时,VictoriaMetrics 等替代方案到底值不值得换。我的观点会很明确——很多团队过早上了重型架构,结果复杂度反噬了可观测性本身。
第三章是"进阶原理",也是区分"会用监控"和"懂监控"的分水岭。