章节摘要:本章装配管线第①②段(ingest 摄入、parse+normalize 解析归一),并预装第③段的分块半段(split):让 25+ 种异构数据源变成统一、干净、按策略切好的文本块——管线前段的使命是“喂对料”,为第 3 章的语义抽取备好原料。

统一摄入接口如何屏蔽文件、网页、数据库、Snowflake/Databricks、Kafka、邮件、Git、MCP 的差异。
文档/结构化/代码/网页/邮件五类解析器;文本、实体、日期、数字四类归一化。
entity_aware/relation_aware/graph_based/ontology_aware 等 13 种策略——分块即注入图结构先验。
前置:第 1 章(编排器与八段管线总览),知道如何用 Semantica 编排器起一条管线即可。
后续:第 3 章把分好的块送进 semantic_extract 做语义抽取;关心多源数据打架的可先跳第 4 章。