第 6 章 · 高级特性:协处理器、布隆过滤器与生态集成 章节摘要:本章是对前五章机制的三次"再加工":协处理器把计算下推到 RegionServer,省掉搬运数据的网络;布隆过滤器与读缓存是读路径的两大减免项;生态集成让 HBase 与 Kafka、Spark、搜索引擎各司其职。另附带说明复制与行级事务的边界。 学习目标 阅读完本章,你应当能够: 说清 Observer 与 Endpoint 两类协处理器的原理与适用场景,写出并加载一个 Observer; 理解布隆过滤器的误判率代价与 ROW/ROWCOL 选择; 配置 BucketCache 与堆外缓存,解释 L1/L2 两层结构; 描述 Kafka→HBase→Spark→搜索引擎的典型数据链路;
章节摘要:本章是对前五章机制的三次"再加工":协处理器把计算下推到 RegionServer,省掉搬运数据的网络;布隆过滤器与读缓存是读路径的两大减免项;生态集成让 HBase 与 Kafka、Spark、搜索引擎各司其职。另附带说明复制与行级事务的边界。
阅读完本章,你应当能够:
协处理器是"把算力搬到数据旁",布隆与缓存是"让读少走弯路",生态是"让每类引擎只干最擅长的事"。

Observer 触发器与 Endpoint 存储过程的类比、加载方式、一个次级索引 Observer 的实现骨架与风险清单。
布隆的位图原理与误判率、ROW 与 ROWCOL 的选择、LruBlockCache 与 BucketCache 的双层结构及配置。
Kafka 接流、Spark 批算、搜索引擎检索的分工链路;Replication 的异步本质与单行事务的边界。
写侧扩展(协处理器 把逻辑搬进服务端) 读侧扩展(布隆 + 缓存 第 3 章读路径的加强版) 系统扩展(生态集成 让 HBase 回到存储本职)
三节互相独立,可按需选读;但都建立在前五章机制上,跳章阅读请先补第 3 章。