第 5 章 · 高级特性与扩展 章节摘要:前三章回答"怎么用",本章回答"凭什么"。存储引擎一节解释免索引邻接在磁盘上的样子——为什么遍历快、为什么写放大值得关心;集群一节拆解因果一致性的读写路由,把 4.1 的书签机制接到底层数据流上;图算法一节引入图数据科学库,把"裸 Cypher 走不动的遍历"交给几十种成熟算法。读完本章,你从"会用图"升级到"懂图的来龙去脉"。 学习目标 读完本章,你应当能够: 描述 Neo4j 记录式存储的分区布局,解释遍历为什么不需要索引; 用"记录开销 + 属性块"的口径估算一张图的存储体积; 解释因果集群的角色分工与读写路由规则,说出书签机制的底层含义; 判断什么规模的业务需要集群,以及单副本读的取舍; 区分图数据库与图数据科学库的职责边界;
章节摘要:前三章回答"怎么用",本章回答"凭什么"。存储引擎一节解释免索引邻接在磁盘上的样子——为什么遍历快、为什么写放大值得关心;集群一节拆解因果一致性的读写路由,把 4.1 的书签机制接到底层数据流上;图算法一节引入图数据科学库,把"裸 Cypher 走不动的遍历"交给几十种成熟算法。读完本章,你从"会用图"升级到"懂图的来龙去脉"。
读完本章,你应当能够:
本章三个主题看似分散,实则共享一条主线:性能与规模的可预期性。存储引擎让单机遍历成本可预期,集群让扩展后的读写行为可预期,图算法让深度分析的成本可预期。
一句话概括本章:磁盘上省掉的是索引跳转,集群里保住的是因果顺序,算法层替代的是失控遍历。
5.1 存储引擎内幕——把第 1 章的"免索引邻接"从概念落到磁盘:节点记录、关系记录的双向链表、属性记录的条块分配;由此推演遍历快、写有开销、内存按存储文件配的三个工程结论。
5.2 集群与高可用——因果集群的角色分工:主库负责写、从库扩展读;路由协议怎么选、书签怎么保证"读到自己的写入"、故障转移发生时应用侧看到什么。
5.3 图算法与图数据科学——GDS 的投影模型与算法分类:中心性、社区检测、路径、相似度四族;PageRank 与标签传播的完整调用流程;什么场景该让算法上场、什么场景裸 Cypher 足够。
三节由内而外:5.1 是单机的物理层,5.2 把多台机器组织成逻辑单机,5.3 在数据之上叠加分析层。前两节解释"为什么快与稳",第三节回答"然后呢"——图数据攒起来之后高价值的用法。
5.1 单机物理层(遍历为何快) ▼ 5.2 集群逻辑层(扩展与因果一致) ◄── 4.1 书签机制的底层答案 ▼ 5.3 分析层(图算法与 GDS) ▼ 第6章 生态工具(在内核之上选型)
读内核容易陷入细节,三个出口帮你把知识挂回主干:
前置:第 1 章的免索引邻接概念、第 2 章 PROFILE 的 db hits 口径、第 4 章书签与连接路由;不需要 C 语言或文件系统级知识,本章在概念层面讲透即可。
后续:5.2 的集群形态在第 6 章 AuraDB 一节变成托管的云端选项;5.3 的算法在第 7 章推荐与欺诈场景里直接上阵——那两节的查询会大量调用 GDS 过程。