第5章 高级特性与扩展:内核、集群与图算法


文档摘要

第 5 章 · 高级特性与扩展 章节摘要:前三章回答"怎么用",本章回答"凭什么"。存储引擎一节解释免索引邻接在磁盘上的样子——为什么遍历快、为什么写放大值得关心;集群一节拆解因果一致性的读写路由,把 4.1 的书签机制接到底层数据流上;图算法一节引入图数据科学库,把"裸 Cypher 走不动的遍历"交给几十种成熟算法。读完本章,你从"会用图"升级到"懂图的来龙去脉"。 学习目标 读完本章,你应当能够: 描述 Neo4j 记录式存储的分区布局,解释遍历为什么不需要索引; 用"记录开销 + 属性块"的口径估算一张图的存储体积; 解释因果集群的角色分工与读写路由规则,说出书签机制的底层含义; 判断什么规模的业务需要集群,以及单副本读的取舍; 区分图数据库与图数据科学库的职责边界;

第 5 章 · 高级特性与扩展

章节摘要:前三章回答"怎么用",本章回答"凭什么"。存储引擎一节解释免索引邻接在磁盘上的样子——为什么遍历快、为什么写放大值得关心;集群一节拆解因果一致性的读写路由,把 4.1 的书签机制接到底层数据流上;图算法一节引入图数据科学库,把"裸 Cypher 走不动的遍历"交给几十种成熟算法。读完本章,你从"会用图"升级到"懂图的来龙去脉"。

学习目标

读完本章,你应当能够:

  1. 描述 Neo4j 记录式存储的分区布局,解释遍历为什么不需要索引;
  2. 用"记录开销 + 属性块"的口径估算一张图的存储体积;
  3. 解释因果集群的角色分工与读写路由规则,说出书签机制的底层含义;
  4. 判断什么规模的业务需要集群,以及单副本读的取舍;
  5. 区分图数据库与图数据科学库的职责边界;
  6. 用 GDS 投影 + 算法调用的标准流程跑一次 PageRank 或社区检测。

核心概念速览

本章三个主题看似分散,实则共享一条主线:性能与规模的可预期性。存储引擎让单机遍历成本可预期,集群让扩展后的读写行为可预期,图算法让深度分析的成本可预期。

一句话概括本章:磁盘上省掉的是索引跳转,集群里保住的是因果顺序,算法层替代的是失控遍历。

子章节导航

5.1 存储引擎内幕——把第 1 章的"免索引邻接"从概念落到磁盘:节点记录、关系记录的双向链表、属性记录的条块分配;由此推演遍历快、写有开销、内存按存储文件配的三个工程结论。

5.2 集群与高可用——因果集群的角色分工:主库负责写、从库扩展读;路由协议怎么选、书签怎么保证"读到自己的写入"、故障转移发生时应用侧看到什么。

5.3 图算法与图数据科学——GDS 的投影模型与算法分类:中心性、社区检测、路径、相似度四族;PageRank 与标签传播的完整调用流程;什么场景该让算法上场、什么场景裸 Cypher 足够。

子章节之间的逻辑关系

三节由内而外:5.1 是单机的物理层,5.2 把多台机器组织成逻辑单机,5.3 在数据之上叠加分析层。前两节解释"为什么快与稳",第三节回答"然后呢"——图数据攒起来之后高价值的用法。

5.1 单机物理层(遍历为何快) ▼ 5.2 集群逻辑层(扩展与因果一致) ◄── 4.1 书签机制的底层答案 ▼ 5.3 分析层(图算法与 GDS) ▼ 第6章 生态工具(在内核之上选型)

本章动手清单

  1. 在 Movie 图上写一条三程漫游,PROFILE 里数一数 Expand 的行数,体会"指针跳转";
  2. 按 5.1 的口径估算你手头业务数据的存储体积,写成一页纸;
  3. 用 EXPLAIN(不真跑)看一条查询的计划形状,找出扫描算子;
  4. 若有 GDS 环境:建一个投影、跑一次度中心性、写回结果属性。

本章的三个认知出口

读内核容易陷入细节,三个出口帮你把知识挂回主干:

  1. 性能出口:所有慢查询问题的尽头是"这一步在磁盘上做了什么";
  2. 架构出口:书签、路由、最终一致——4.1 的每个细节都有 5.2 的解释;
  3. 能力出口:GDS 把 Cypher 的遍历边界补成了完整能力圈。

前置知识与后续延伸

前置:第 1 章的免索引邻接概念、第 2 章 PROFILE 的 db hits 口径、第 4 章书签与连接路由;不需要 C 语言或文件系统级知识,本章在概念层面讲透即可。

后续:5.2 的集群形态在第 6 章 AuraDB 一节变成托管的云端选项;5.3 的算法在第 7 章推荐与欺诈场景里直接上阵——那两节的查询会大量调用 GDS 过程。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U