第 10 章 · 可观测性与数据


文档摘要

第 10 章 · 可观测性与数据 系统上线之后,我们靠什么知道它"还好"?靠什么定位"哪里坏了"?又靠什么回答"它为什么坏"?本章围绕软件交付的最后一道防线——可观测性,以及它背后的两大数据基础设施:数据库与消息队列,建立从监控到数据的完整认知。读完本章,你将理解三大支柱如何协同回答"正常与否、发生了什么、慢在哪里",也能说清 SQL 与 NoSQL、ACID 与 CAP、Kafka 分区与消费组背后的设计取舍。

第 10 章 · 可观测性与数据

系统上线之后,我们靠什么知道它"还好"?靠什么定位"哪里坏了"?又靠什么回答"它为什么坏"?本章围绕软件交付的最后一道防线——可观测性,以及它背后的两大数据基础设施:数据库与消息队列,建立从监控到数据的完整认知。读完本章,你将理解三大支柱如何协同回答"正常与否、发生了什么、慢在哪里",也能说清 SQL 与 NoSQL、ACID 与 CAP、Kafka 分区与消费组背后的设计取舍。

解剖坐标

第 10 章沿"看得到 → 存得下 → 传得动"的主线展开:先建立可观测性三大支柱与 SLI/SLO/错误预算的量化框架(含 Prometheus 与 Grafana 实战),再回到数据侧理解 SQL 与 NoSQL、ACID 与 CAP 的取舍逻辑,最后打通事件流:Kafka 如何以分区与消费组实现高吞吐的可靠消息传递。

学习目标

完成本章后,你将能够:

  • 区分监控与可观测性,说出三大支柱各自回答的问题,以及它们如何协同定位故障
  • 用 SLI/SLO/错误预算量化系统可靠性,并判断"服务是否处于发布冻结期"
  • 描述 Prometheus 拉取模型与四种指标类型的语义差异,知道 Grafana 的角色边界
  • 对比 SQL 与 NoSQL 的适用场景,解释 ACID 与 CAP 定理,能指出常见认知混淆点
  • 描述 Kafka 的 Topic/Partition/Broker/Consumer Group/Offset 五要素与消息传递语义,理解分区内有序而全局无序的原因

子章节导航

01 可观测性与监控

从"监控"到"可观测性"的认知升级:三大支柱(指标、日志、链路追踪)各回答什么问题;SLI/SLO/错误预算如何把可靠性变成可计算的工程指标;Prometheus 的拉取模型、四种指标类型与告警体系;Grafana 的定位与局限;ELK 日志栈与 APM 的组成。

02 数据库核心概念

SQL 与 NoSQL 的适用边界与选型逻辑;ACID 四性质逐一解读;索引为什么能加速查询又有代价;范式设计与反范式;分片与复制的区别;CAP 定理中 CP/AP 的真实分布;慢查询排查的标准三步;主流数据库的端口与典型场景速查。

03 消息队列与Kafka

消息队列解决了什么问题(削峰、解耦、异步、顺序);Kafka 的核心抽象——Topic/Partition/Broker/Offset;Consumer Group 的负载均衡与"一个分区同一时刻只有一个消费者"的约束;消息丢失与重复消费的来源与对策;ZooKeeper 的历史角色与 KRaft 的演进。

前置知识

  • 第 3 章《Linux 系统》中的进程、日志文件(/var/log)与服务管理基础
  • 第 5 章《容器化与Docker》与第 6 章《Kubernetes编排》中的部署形态与 Pod 生命周期——可观测性手段与部署形态强相关
  • 第 9 章《云平台与网络》中的云服务与网络概念,理解分布式系统的运行环境

后续延伸

可观测性是 SRE 工作方法的核心输入,配合第 1 章的 SLA 承诺与 SRE 职责理解更佳;数据库与消息队列是系统架构的两大基石,与第 7 章 IaC、第 8 章 CI/CD 共同构成生产级系统的闭环。深入学习可继续钻研:Prometheus 告警规则与联邦、OpenTelemetry 统一标准、分布式事务与一致性协议(Paxos/Raft)、Kafka 事务与 Exactly-Once 语义。


发布者: 作者: 灏天文库 转发
评论区 (0)
U