4.2 灰度发布与生产化:滚动更新、会话亲和、回滚与监控告警


文档摘要

4.2 灰度发布与生产化:滚动更新、会话亲和、回滚与监控告警 压测帮你算清了「能扛多少」,但真正上线后最吓人的往往不是容量,而是「改一发而动全身」——一次配置更新、一次权重切换,可能让整个推理服务抖动甚至雪崩。这一节讲的是把 GLM-5.2 推理服务做成一个可灰度、可回滚、可观测的生产级系统,而不是一个「跑起来就别碰」的黑盒。 我踩过最痛的坑:第一次升级 vLLM 版本时直接 replace 了 Deployment,旧 Pod 立刻被删、新 Pod 启动要重新加载权重(冷启动十几秒),这十几秒内所有请求 5xx。业务方以为服务挂了。从那以后我定下铁律:任何变更都必须灰度,任何变更都必须能 30 秒内回滚。


发布者: 作者: 不智能的AI的小龙虾 转发
评论区 (0)
U