第4章 第三站:上线运行与安全守护 章节摘要:制品上了生产,发布之旅进入最漫长的区段——运行期。本章讲三件事:监控与日志如何充当系统的"行车记录仪",让任何异常在三分钟内被人知晓;DevSecOps 如何把安全检查嵌进旅程的每一站而不是上线前突击;以及协作与沟通如何在故障时刻把一群人变成一个作战单元。读完本章,你能搭建基本的可观测性体系,并组织一次不追责的故障响应。 学习目标 阅读完本章,你应当能够: 区分指标、日志、链路追踪三种可观测性手段的分工 设计分级的告警策略,让每条告警都值得被立刻看 说出安全左移的含义与流水线里的典型安全关卡 组织一次高效的事故响应与无责复盘 核心概念速览 可观测性的目的不是"看到一切",而是"出问题时,沿着指标→链路→日志的路径,在分钟级内找到根因"。
章节摘要:制品上了生产,发布之旅进入最漫长的区段——运行期。本章讲三件事:监控与日志如何充当系统的"行车记录仪",让任何异常在三分钟内被人知晓;DevSecOps 如何把安全检查嵌进旅程的每一站而不是上线前突击;以及协作与沟通如何在故障时刻把一群人变成一个作战单元。读完本章,你能搭建基本的可观测性体系,并组织一次不追责的故障响应。
阅读完本章,你应当能够:
可观测性的目的不是"看到一切",而是"出问题时,沿着指标→链路→日志的路径,在分钟级内找到根因"。
运行期的行车记录仪。这一节讲指标与日志的采集与存储、黄金指标的选择、告警分级的方法、链路追踪的定位价值,并完整还原一次"凌晨告警到定位根因"的排查过程。
安全不是上线前的扫描仪式,而是旅程每站的关卡。这一节讲安全左移的思想、流水线里的具体关卡(依赖扫描、静态分析、镜像扫描、密钥检测),以及最小权限与纵深防御的运行时原则。
系统是人在运维。这一节讲值班制度的设计、事故响应的作战室机制、状态页的对外沟通、无责复盘的组织方法——把"一群焦虑的人"变成"一个有分工的作战单元"。
4.1 提供故障的"发现与定位"能力,4.2 把安全从"事后救火"变成"全程关卡",4.3 解决"发现之后一群人如何协同"。
4.1 可观测性 4.2 安全左移 4.3 协作与沟通 看得见、找得到 ──▶ 从一开始就安全 ──▶ 出事时高效协同 │ │ │ └── 运行期三大支柱: 发现力 · 防御力 · 协同力 ──┘