第 7 章 · 运维与实战:让落点长期保持健康 章节摘要:前六章讲的是一行数据"怎么落下去",本章讲的是它"落下去之后的漫长余生"。集群每天都会发生 Compaction 抖动、Region 迁移、磁盘老化、误操作,运维的价值就是让数据的落点分布长期健康。本章先建监控指标体系与调优抓手,再讲扩缩容和备份恢复,然后给一张故障排查决策树,最后用时序数据与用户画像两个综合案例把全册知识收拢成可复用的方案。 学习目标 阅读完本章,你应当能够: 说出 HBase 监控的四层指标(系统、JVM、HBase、表设计)与每层的代表指标,并搭起 Prometheus 采集; 按瓶颈位置(CPU、GC、IO、网络、热点 Region)选择对应的调优参数,而不是盲调;
章节摘要:前六章讲的是一行数据"怎么落下去",本章讲的是它"落下去之后的漫长余生"。集群每天都会发生 Compaction 抖动、Region 迁移、磁盘老化、误操作,运维的价值就是让数据的落点分布长期健康。本章先建监控指标体系与调优抓手,再讲扩缩容和备份恢复,然后给一张故障排查决策树,最后用时序数据与用户画像两个综合案例把全册知识收拢成可复用的方案。
阅读完本章,你应当能够:
运维的本质是回答三个问题:落点现在健康吗(监控)、落点要变了怎么办(变更与恢复)、落点已经出事了怎么救(排查)。

指标四层体系(系统、JVM、HBase、表设计)、Prometheus 采集链路、JMX 与 Web UI 的现场观测,以及按瓶颈位置选参数的调优方法论。
扩容的本地性代价与均衡器、缩容的 draining 流程,快照的秒级备份原理,Export 与复制组成的多层备份体系。
从写入变慢、读取抖动、RegionServer 宕机到 ZooKeeper 异常,一张决策树把模糊症状收敛到根因,附真实日志片段对照。
两个完整方案:时序表的加盐与宽窄表取舍、画像表的标签版本与读写路径,均含可运行的代码与落点分析。
观测是前提(7.1 没有指标 一切调优都是猜) 变更与恢复是日常(7.2 扩缩容改落点 备份保底线) 应急靠前两者积累(7.3 决策树的每一步都要看指标) 实战是总装(7.4 两个案例同时用到 1 至 6 章全部机制)
四节是递进关系:先有观测,才谈得上变更与应急;前五节的机制理解到位,实战案例里的每个设计决策才不是死记硬背。