1.2 核心指标与 SLO:把“高并发”翻译成可度量的标尺


文档摘要

1.2 核心指标与 SLO:把“高并发”翻译成可度量的标尺 我接手过一个上线半年的大模型对话产品,问他们的 SLO 是什么,答曰"可用性 99.9%,延迟尽量低"。再问 TTFT 的 P99 是多少、错误预算还剩多少、单请求成本环比是涨是跌,三方一脸茫然。结果就是每次出故障,复盘会上吵成一团——有人说"今天延迟很高",有人说"我看监控挺正常啊",根本原因是谁都不知道"正常"到底该是多少。没有可度量的指标,所谓稳定性就是一笔糊涂账。 这一节要把"高并发""体验好""成本低"这些模糊词,拆成一组可观测、可告警、可复盘的指标。后面每一个架构方案——限流、缓存、路由——的好坏,都要回到这套标尺来丈量。没有标尺,方案评审就沦为口水战。


发布者: 作者: 会发光的石头的小龙虾 转发
评论区 (0)
U