第 10 章 · 02 全书回顾:装配一条可信知识管线


第 10 章 · 02 全书回顾:装配一条可信知识管线

本节摘要:全书最后一节。先把十章装配成果沿八段管线串讲一遍——①ingest 25+ 源→②parse+normalize→③split 13 种分块→④conflict+dedup 治理→⑤extract+GraphBuilder★→⑥polyglot 存储(8 向量+4 图库+RDF)→⑦reasoning Rete/Datalog★→⑧context 决策智能★压轴,两根贯穿线是 PROV-O 溯源与双时态;再复盘 Semantica 核心哲学四点(确定性/溯源/可插拔/决策智能);最后交出下一步清单。不设过渡段,以此为全书收束。

内容来源:全书十章内容总回顾;关键源码坐标 semantica/context/context_graph.py(4260 行)、semantica/reasoning/rete_engine.pysemantica/provenance/cookbook/

⚠️ 注意:回顾不是终点——Semantica 约 28.6 万行代码,本教程精读的只是主线。读完本节你获得的是地图与骨架:任何一个未成章的子模块,都应当能被你用"它在八段管线的哪一环、依赖谁、被谁依赖"三问自行拆解。

学习目标

阅读完本节,你应当能够:

  1. 不看笔记复述八段管线的输入输出、代表模块与三个高点(③⑤段合并后的图谱构建、⑦推理、⑧决策)。
  2. 说出两根贯穿线(PROV-O 溯源、双时态)分别落在哪些模块。
  3. 用自己的话讲清 Semantica 四点哲学及每点的源码依据。
  4. 给自己的业务定一条装配路线:先跑通什么、再本体化什么、最后接什么。

一、八段管线装配串讲

第 1 章(全貌)给了地图:Semantica——"开源版 Palantir",位于 LLM 之下的确定性基础设施层;八段管线 Mermaid 图是全书装配图纸;Semantica 编排器与 5 个入口(CLI/server/worker/explorer/mcp)在第 10 章逐一兑现。

① ingest(第 2 章):25+ 种数据源接入器——文件、网页、数据库、Snowflake、Databricks、Kafka、邮件、Git、HuggingFace、MCP,ingest/ 每源一文件,registry 按名分发,PROV-O 从入口就开始记。② parse+normalize(第 2 章):文档/结构化/代码/网页/邮件五类解析器;normalize 做文本清洗、实体归一、日期/数字标准化——脏数据不治理,后面全是垃圾进垃圾出。

③ split+extract(第 2、3 章,高点之一):split 提供 13 种分块,含 GraphRAG 原生的 entity_aware/relation_aware/graph_based/ontology_aware——按语义边界而非字数切;semantic_extract 以 NER/关系/事件/三元组四类抽取器加共指消解,ml/pattern/llm 三方法按名切换(第 8 章 03 节拆的注册表在此显影)。kg 模块的 GraphBuilder 把抽取结果装配成知识图谱,EntityResolver 消解实体,graph_analyzer 补中心性/社区/链接预测。

④ conflict+dedup(第 4 章):多源必冲突——冲突检测器(1423 行)按来源追踪争议,消解策略可配;deduplication 用阻塞 + 语义相似去重、实体合并。治理的意义在第 9 章显影:SHACL 约束与本体评估的健康分,源头都在这段的干净程度。

⑤ polyglot 存储(第 8 章):8 种向量库、4 种图库(Neo4j/FalkorDB/Apache AGE/Amazon Neptune)、RDF 三元组库(Oxigraph 内嵌/Blazegraph/Jena/RDF4J),统一门面 + 注册表分发,换后端=换一行参数;MethodRegistry/PluginRegistry 是可插拔的总机关。

⑦ reasoning(第 5 章,高点之二)Rete 引擎前向链推理、Datalog(支持自然语言图查询)、SPARQL reasoning、溯因/演绎双推理器,ExplanationGenerator 给出推理路径——全程不调 LLM,同输入必得同结论。第 9 章 query_with_reasoning 的 reasoning_path 正是这条确定性路径在检索端的延伸。

⑧ context 决策智能(第 6 章,全书压轴):context 模块(1.9 万行)以 ContextGraph(context_graph.py 4260 行) 为核心——record_decision 把 AI 决策连同上下文、置信度、因果链存成图节点;因果追踪、先例语义搜索(第 9 章 HybridSimilarity 支撑)、影响面分析、PolicyEngine 策略门禁、AgentContext/AgentMemory 给 agent 用。贷款审批合规是它的招牌场景:AI 拒了贷款,监管问为什么,证据链拿得出。

两根贯穿线PROV-O 溯源(第 7 章)——provenance 管理器(1486 行)让每个事实知道来处,审计轨迹可导出监管格式,0.6.5 的 retraction/purge 支撑 GDPR 删除权;双时态——valid time 与 recorded time 独立建模,temporal_query(1765 行)与 Allen 区间代数让"当时法律怎么说"与"我们当时知道什么"成为两种可查询的状态。第 10 章 01 节的 explorer/MCP/CLI/deploy 则是这条管线面向人、agent、编辑器、产线的四个出口。

因果链至此闭合:③的抽取质量决定⑤的图质量,⑤的图质量决定⑦的推理与⑧的先例检索,⑦的确定性让⑧的决策可复现,而⑦⑧的每一步都被贯穿线记档。没有一段是孤岛

二、Semantica 核心哲学四点

  1. 确定性:图谱构建、推理、决策的因果链全部不依赖 LLM——抽取可用 pattern 方法,推理走 Rete/Datalog,同输入必得同输出。在 LLM 动辄幻觉的时代,这是监管级场景(金融合规、司法、医疗)的入场券,也是它与"LangChain 式 LLM 编排"的本质分野。
  2. 溯源:PROV-O 全链路——每个事实知道从哪个源的哪一句来,每个推理结论能展示规则链,每个决策能追出因果链;配上双时态,连"知识随时间的变化"本身也是一等公民。可信不是口号,是数据模型
  3. 可插拔:统一抽象接口 × 注册表分发=不被任何数据库绑架——8 向量库、4 图库、RDF 库一行参数切换,13 种分块、3 种抽取方法、11 种导出同理。Portability 是对抗供应商锁定的工程答案。
  4. 决策智能record_decision 把 AI 的每次决断连同上下文存为图节点,可查询(先例)、可追踪(因果链)、可门禁(PolicyEngine)、可审计(PROV-O)。AI 决策从一次性对话变成组织的可复用资产——这是"决策智能"四个字的分量。

四点互为因果:确定性使决策可复现,溯源使决策可审计,可插拔使体系可迁移,决策智能使前三者产生业务价值。

三、本节要点回顾

  1. 八段管线:①ingest 25+ 源→②parse+normalize→③split 13 种分块+extract 三方法→④conflict+dedup→⑤GraphBuilder 装图谱→⑥polyglot 存储(8+4+RDF)→⑦Rete/Datalog 确定性推理→⑧ContextGraph 决策智能压轴。
  2. 三个高点:③⑤段的图谱构建(抽取×治理×落库的合力)、⑦的确定性推理(不靠 LLM 的可复现结论)、⑧的决策智能(record_decision 可审计资产)。
  3. 两根贯穿线:PROV-O 让每个事实知来处;双时态让"事实何时有效"与"何时被记录"各自可查询。
  4. 四点哲学:确定性、溯源、可插拔、决策智能——分别回答可信、审计、迁移、价值四个问题。
  5. 生态四出口:explorer 给人、MCP/integrations 给 agent、plugins 给编辑器、CLI/deploy 给产线,全部复用同一套核心 API。

四、下一步学习建议

按投入产出排序的四条路:

  1. 无 key 跑通 cookbook 37 册:内存图谱 + FAISS/inmemory 向量库零依赖可跑,intro 21 册按管线序号过一遍,再挑与你业务同段的 advanced(做检索跑 14_Datalog_Style_Reasoning,做决策跑 11_Advanced_Context_Engineering)。动手一次胜过重读十章
  2. 建自己领域的本体:用 OntologyGenerator.generate_from_graph 从你的数据归纳 schema,to_shacl 写三条最痛的质量规则进 CI,add_skos_concept 归并你的同义词——本体是最能沉淀领域理解的一件事。
  3. 接 Agent 做记忆:把 AgentContext + ContextGraph 配给你的 agent(原生 API 或经 MCP server/Agno toolkit),decision_tracking=True 打开后,agent 的每个决断自动成为可查先例——这是给 LLM 应用装上"不会失忆且有据可查"的记忆层。
  4. 精读 context_graph.py(4260 行):全书唯一未逐段拆的最大单体,决策图、因果链、影响面分析全在其中;它衔接第 3 章(图结构)、第 5 章(路径)、第 7 章(时态)所有概念,是检验你是否真读懂全书的试金石,也是毕业后自读的最佳第一份材料。

知识基础设施的范式还会演化——GraphRAG 会改名,向量库会换代,agent 框架会轮替——但 Semantica 演示的判断力不会过时:把可信做成数据模型的性质,而不是提示词里的祈求。确定性可复现、事实知来处、后端可替换、决策成资产。愿你装配的每条管线,都经得起监管的那一问:"它为什么这么判断?"全书完,后会有期。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U