Wiki ingest:结构化页面与链接图谱 本节摘要:本节进入知识引擎的第一条线——Wiki。Wiki 把产品文档、设计方案、运维手册变成「结构化页面 + 链接图谱」,让 Agent 不必先读完所有文件目录再开工。本节讲清 Wiki 的 ingest 过程(LLM 增量维护、抽结构、建链接)、它借鉴的「文档作为可持续复利知识产物」思路、以及它区别于普通 RAG「切片检索」的根本差异。理解 Wiki,你就理解了「文档如何成为可下钻的知识地图」。
本节摘要:本节进入知识引擎的第一条线——Wiki。Wiki 把产品文档、设计方案、运维手册变成「结构化页面 + 链接图谱」,让 Agent 不必先读完所有文件目录再开工。本节讲清 Wiki 的 ingest 过程(LLM 增量维护、抽结构、建链接)、它借鉴的「文档作为可持续复利知识产物」思路、以及它区别于普通 RAG「切片检索」的根本差异。理解 Wiki,你就理解了「文档如何成为可下钻的知识地图」。
Wiki 的 ingest 不是「把文档切片存索引」,而是用 LLM 把文档重组成结构化页面:
Wiki ingest 过程 原始文档(可能凌乱、格式不一) │ ├─ LLM 解析与结构化 │ - 识别主题、章节、实体 │ - 生成结构化页面(标题/正文/属性) │ ├─ 链接图谱构建 │ - 识别页面间引用关系 │ - 建立可下钻的链接 │ └─ 产出:结构化页面 + 链接图谱 (可搜索、可沿链接下钻)
| ingest 做的事 | 普通文档处理做的事 |
|---|---|
| 识别主题、生成结构化页面 | 按固定大小切片 |
| 建页面间链接图谱 | 片段独立、无结构关系 |
| 增量维护、持续复利 | 一次性导入、不演进 |
关键概念:Wiki 与普通 RAG 的根本差异在「结构化」。普通 RAG 把文档切成扁平片段,片段之间没有结构关系;Wiki 把文档重组成「有结构的页面 + 有链接的图谱」,Agent 可以沿链接下钻,理解页面之间的关系。这是「结构化知识」对「扁平切片」的代差。
Wiki 的设计灵感来自把文档视为「由 LLM 增量维护、可持续复利的知识产物」这一思路:
传统文档 vs 可复利文档 传统文档: 人写一次 → 固定不变 → 逐渐过时 可复利文档(Wiki 思路): LLM 增量维护 → 随源文档演进 → 越用越丰富 每次更新都让知识库「增值」(复利)
这个思路的影响在两方面:① Wiki 不是「一次性导入」,而是「随文档变化持续更新」(Auto-Sync,第 4 节讲);② Wiki 的价值随时间增长——页面越积越多、链接越织越密,就像一个越用越丰富的知识网。
💡 技巧:理解 Wiki 的「复利」特性,你就明白为什么值得花精力把文档喂给它——一次投入,持续产出。而且 LLM 帮你把凌乱文档重组成结构化页面,这本身就是在「整理知识」,不只是「存知识」。
链接图谱是 Wiki 区别于普通检索的关键。它让 Agent 不只能「搜到页面」,还能「沿链接深入」:
链接图谱的价值 Agent 搜「鉴权」→ 命中「鉴权设计」页面 该页面链接到: ├─ 「JWT 规范」(技术细节) ├─ 「密钥管理」(运维) └─ 「鉴权故障案例」(历史) → Agent 按需沿链接下钻,构建完整理解 → 而不是只拿到一个孤立片段
这种「可下钻」的能力,让 Agent 像人读文档一样「顺藤摸瓜」——从一个入口出发,沿链接理解整个主题。普通 RAG 给的是「一个片段」,Wiki 给的是「一张可下钻的网」。
| 能力 | 普通 RAG | Wiki |
|---|---|---|
| 搜到内容 | 扁平片段 | 结构化页面 |
| 理解关系 | 片段独立 | 链接图谱可下钻 |
| 深入主题 | 要重新搜 | 沿链接顺藤摸瓜 |
Wiki 处理「文档」,CodeGraph 处理「代码」——两者是知识引擎的两条线,分工明确:
| 维度 | Wiki | CodeGraph |
|---|---|---|
| 源材料 | 文档(产品/设计/运维) | 代码库 |
| 结构化对象 | 页面 + 文字链接 | 符号 + 调用关系 |
| 典型查询 | 「鉴权怎么设计的?」 | 「这个函数被谁调用?」 |
| 下钻方式 | 沿文档链接 | 沿调用关系 |
它们合起来,让 Agent 既能看懂「文档说了什么」(Wiki),又能看懂「代码怎么写」(CodeGraph)——覆盖一个项目的两类核心知识。下一节专门讲 CodeGraph。
Wiki 构建是异步的(第 5 章工坊讲过),这里从引擎视角补充:
Wiki 构建的异步性 喂文档 → 触发 ingest 任务进队列 → worker 取任务,LLM 逐文档处理 → 生成页面 + 建链接 → 状态:ready 为什么异步:文档可能很多,每篇要 LLM 处理,耗时
构建期间 Wiki 不可用(状态非 ready),完成后才能被 Agent 检索与配装。这个异步性与第 6 章 L1 抽取的异步性同理——都是「LLM 处理耗时,放后台跑」。
⚠️ 注意:Wiki 构建质量与源文档质量强相关。结构清晰、有标题层级的文档,LLM 能抽出好结构;混乱的文档(全是流水账、无层次)产出质量差。这就是第 5 章强调「源材料要干净」的原因——垃圾进、垃圾出在 Wiki 构建里特别明显。
下一节看知识引擎的第二条线——CodeGraph,它如何把代码索引成「符号/文件/调用关系/影响路径」的图谱。