第 6 章 · 高级特性:协处理器、布隆过滤器与生态集成


文档摘要

第 6 章 · 高级特性:协处理器、布隆过滤器与生态集成 章节摘要:本章是对前五章机制的三次"再加工":协处理器把计算下推到 RegionServer,省掉搬运数据的网络;布隆过滤器与读缓存是读路径的两大减免项;生态集成让 HBase 与 Kafka、Spark、搜索引擎各司其职。另附带说明复制与行级事务的边界。 学习目标 阅读完本章,你应当能够: 说清 Observer 与 Endpoint 两类协处理器的原理与适用场景,写出并加载一个 Observer; 理解布隆过滤器的误判率代价与 ROW/ROWCOL 选择; 配置 BucketCache 与堆外缓存,解释 L1/L2 两层结构; 描述 Kafka→HBase→Spark→搜索引擎的典型数据链路;

第 6 章 · 高级特性:协处理器、布隆过滤器与生态集成

章节摘要:本章是对前五章机制的三次"再加工":协处理器把计算下推到 RegionServer,省掉搬运数据的网络;布隆过滤器与读缓存是读路径的两大减免项;生态集成让 HBase 与 Kafka、Spark、搜索引擎各司其职。另附带说明复制与行级事务的边界。

学习目标

阅读完本章,你应当能够:

  1. 说清 Observer 与 Endpoint 两类协处理器的原理与适用场景,写出并加载一个 Observer;
  2. 理解布隆过滤器的误判率代价与 ROW/ROWCOL 选择;
  3. 配置 BucketCache 与堆外缓存,解释 L1/L2 两层结构;
  4. 描述 Kafka→HBase→Spark→搜索引擎的典型数据链路;
  5. 知道 Replication 与单行事务能提供什么、不能提供什么。

核心概念速览

协处理器是"把算力搬到数据旁",布隆与缓存是"让读少走弯路",生态是"让每类引擎只干最擅长的事"。

图 6-1 读请求在布隆过滤器与双层缓存下的减免漏斗

图 6-1 读请求在布隆过滤器与双层缓存下的减免漏斗

子章节导航

6.1 协处理器

Observer 触发器与 Endpoint 存储过程的类比、加载方式、一个次级索引 Observer 的实现骨架与风险清单。

6.2 布隆过滤器与读缓存

布隆的位图原理与误判率、ROW 与 ROWCOL 的选择、LruBlockCache 与 BucketCache 的双层结构及配置。

6.3 生态集成与复制

Kafka 接流、Spark 批算、搜索引擎检索的分工链路;Replication 的异步本质与单行事务的边界。

子章节之间的逻辑关系

写侧扩展(协处理器 把逻辑搬进服务端) 读侧扩展(布隆 + 缓存 第 3 章读路径的加强版) 系统扩展(生态集成 让 HBase 回到存储本职)

三节互相独立,可按需选读;但都建立在前五章机制上,跳章阅读请先补第 3 章。

前置知识与后续延伸

  • 前置:第 3 章读路径与第 2 章 HFile(布隆、缓存的理论地基);第 5 章二级索引(协处理器案例的直接背景)。
  • 为后续铺垫:6.2 的缓存配置是第 7 章监控调优的读侧抓手;6.3 的链路是第 7 章实战案例的架构底座。

作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U