4.2 基于 SLO 的告警:让告警从噪音变成 actionable 我接手过一个团队的告警治理,第一周打开他们的告警历史,过去一个月收到了 3000 多条告警,平均每天 100 条。结果呢?值班工程师把告警群静音了——因为 99% 是误报或无关紧要的,真故障来时反而错过了。这是典型的"告警疲劳",根因是告警策略设计得糟糕。这一节讲如何用"错误预算告警"替代传统的"阈值告警",让每一条告警都是可行动的、值得叫醒人的。 为什么传统阈值告警会变成噪音 传统告警长这样:TTFT 大于 1 秒就告警。看起来合理,但实际跑起来全是问题。 阈值难定是第一个难题。定低了频繁误报(正常高峰也会短暂超 1 秒),定高了真故障漏报。