Semantica · 第 2 章 管线前段:摄入与解析


Semantica · 第 2 章 管线前段:摄入与解析

章节摘要:本章装配管线第①②段(ingest 摄入、parse+normalize 解析归一),并预装第③段的分块半段(split):让 25+ 种异构数据源变成统一、干净、按策略切好的文本块——管线前段的使命是“喂对料”,为第 3 章的语义抽取备好原料。

装配坐标

装配坐标

学习目标

  • 用 ingest 把文件/网页/数据库/Snowflake/Databricks/Kafka/邮件/Git/MCP 等数据源接进统一入口
  • 区分 parse 的五类解析器(文档/结构化/代码/网页/邮件)各自的适用场景
  • 说清 normalize 对文本/实体/日期/数字的归一化策略及其对下游抽取质量的影响
  • 掌握 split 的 13 种 GraphRAG 原生分块策略,理解 entity_aware/graph_based 为何“图原生”
  • 动手跑一条 ingest→parse→split 微管线,观察每一步中间产物的形态变化

子章节导航

01 ingest:25+ 数据源接入

统一摄入接口如何屏蔽文件、网页、数据库、Snowflake/Databricks、Kafka、邮件、Git、MCP 的差异。

02 parse 与 normalize:五类解析器与归一

文档/结构化/代码/网页/邮件五类解析器;文本、实体、日期、数字四类归一化。

03 split:13 种 GraphRAG 原生分块

entity_aware/relation_aware/graph_based/ontology_aware 等 13 种策略——分块即注入图结构先验。

前置知识与后续延伸

前置:第 1 章(编排器与八段管线总览),知道如何用 Semantica 编排器起一条管线即可。
后续:第 3 章把分好的块送进 semantic_extract 做语义抽取;关心多源数据打架的可先跳第 4 章。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U