本节摘要:全书最后一节。先把十章装配成果沿八段管线串讲一遍——①ingest 25+ 源→②parse+normalize→③split 13 种分块→④conflict+dedup 治理→⑤extract+GraphBuilder★→⑥polyglot 存储(8 向量+4 图库+RDF)→⑦reasoning Rete/Datalog★→⑧context 决策智能★压轴,两根贯穿线是 PROV-O 溯源与双时态;再复盘 Semantica 核心哲学四点(确定性/溯源/可插拔/决策智能);最后交出下一步清单。不设过渡段,以此为全书收束。
内容来源:全书十章内容总回顾;关键源码坐标
semantica/context/context_graph.py(4260 行)、semantica/reasoning/rete_engine.py、semantica/provenance/、cookbook/。
⚠️ 注意:回顾不是终点——Semantica 约 28.6 万行代码,本教程精读的只是主线。读完本节你获得的是地图与骨架:任何一个未成章的子模块,都应当能被你用"它在八段管线的哪一环、依赖谁、被谁依赖"三问自行拆解。
阅读完本节,你应当能够:
第 1 章(全貌)给了地图:Semantica——"开源版 Palantir",位于 LLM 之下的确定性基础设施层;八段管线 Mermaid 图是全书装配图纸;Semantica 编排器与 5 个入口(CLI/server/worker/explorer/mcp)在第 10 章逐一兑现。
① ingest(第 2 章):25+ 种数据源接入器——文件、网页、数据库、Snowflake、Databricks、Kafka、邮件、Git、HuggingFace、MCP,ingest/ 每源一文件,registry 按名分发,PROV-O 从入口就开始记。② parse+normalize(第 2 章):文档/结构化/代码/网页/邮件五类解析器;normalize 做文本清洗、实体归一、日期/数字标准化——脏数据不治理,后面全是垃圾进垃圾出。
③ split+extract(第 2、3 章,高点之一):split 提供 13 种分块,含 GraphRAG 原生的 entity_aware/relation_aware/graph_based/ontology_aware——按语义边界而非字数切;semantic_extract 以 NER/关系/事件/三元组四类抽取器加共指消解,ml/pattern/llm 三方法按名切换(第 8 章 03 节拆的注册表在此显影)。kg 模块的 GraphBuilder 把抽取结果装配成知识图谱,EntityResolver 消解实体,graph_analyzer 补中心性/社区/链接预测。
④ conflict+dedup(第 4 章):多源必冲突——冲突检测器(1423 行)按来源追踪争议,消解策略可配;deduplication 用阻塞 + 语义相似去重、实体合并。治理的意义在第 9 章显影:SHACL 约束与本体评估的健康分,源头都在这段的干净程度。
⑤ polyglot 存储(第 8 章):8 种向量库、4 种图库(Neo4j/FalkorDB/Apache AGE/Amazon Neptune)、RDF 三元组库(Oxigraph 内嵌/Blazegraph/Jena/RDF4J),统一门面 + 注册表分发,换后端=换一行参数;MethodRegistry/PluginRegistry 是可插拔的总机关。
⑦ reasoning(第 5 章,高点之二):Rete 引擎前向链推理、Datalog(支持自然语言图查询)、SPARQL reasoning、溯因/演绎双推理器,ExplanationGenerator 给出推理路径——全程不调 LLM,同输入必得同结论。第 9 章 query_with_reasoning 的 reasoning_path 正是这条确定性路径在检索端的延伸。
⑧ context 决策智能(第 6 章,全书压轴):context 模块(1.9 万行)以 ContextGraph(context_graph.py 4260 行) 为核心——record_decision 把 AI 决策连同上下文、置信度、因果链存成图节点;因果追踪、先例语义搜索(第 9 章 HybridSimilarity 支撑)、影响面分析、PolicyEngine 策略门禁、AgentContext/AgentMemory 给 agent 用。贷款审批合规是它的招牌场景:AI 拒了贷款,监管问为什么,证据链拿得出。
两根贯穿线:PROV-O 溯源(第 7 章)——provenance 管理器(1486 行)让每个事实知道来处,审计轨迹可导出监管格式,0.6.5 的 retraction/purge 支撑 GDPR 删除权;双时态——valid time 与 recorded time 独立建模,temporal_query(1765 行)与 Allen 区间代数让"当时法律怎么说"与"我们当时知道什么"成为两种可查询的状态。第 10 章 01 节的 explorer/MCP/CLI/deploy 则是这条管线面向人、agent、编辑器、产线的四个出口。
因果链至此闭合:③的抽取质量决定⑤的图质量,⑤的图质量决定⑦的推理与⑧的先例检索,⑦的确定性让⑧的决策可复现,而⑦⑧的每一步都被贯穿线记档。没有一段是孤岛。
record_decision 把 AI 的每次决断连同上下文存为图节点,可查询(先例)、可追踪(因果链)、可门禁(PolicyEngine)、可审计(PROV-O)。AI 决策从一次性对话变成组织的可复用资产——这是"决策智能"四个字的分量。四点互为因果:确定性使决策可复现,溯源使决策可审计,可插拔使体系可迁移,决策智能使前三者产生业务价值。
按投入产出排序的四条路:
OntologyGenerator.generate_from_graph 从你的数据归纳 schema,to_shacl 写三条最痛的质量规则进 CI,add_skos_concept 归并你的同义词——本体是最能沉淀领域理解的一件事。decision_tracking=True 打开后,agent 的每个决断自动成为可查先例——这是给 LLM 应用装上"不会失忆且有据可查"的记忆层。知识基础设施的范式还会演化——GraphRAG 会改名,向量库会换代,agent 框架会轮替——但 Semantica 演示的判断力不会过时:把可信做成数据模型的性质,而不是提示词里的祈求。确定性可复现、事实知来处、后端可替换、决策成资产。愿你装配的每条管线,都经得起监管的那一问:"它为什么这么判断?"全书完,后会有期。