第 3 章 · 分词台:映射与分析器如何拆解文档 章节摘要:文档进入引擎的第一站是分词台——映射(mapping)先给每个字段定规则,分析器(analyzer)再把文本拆成词条、写进倒排索引。这一章决定 doc-1001 "能不能被搜到、以什么形态被搜到":text 与 keyword 的分野、标准分析器对中文的短处、自定义分析器的组装方法、索引的设置与别名机制。分词台是全旅程中回报率最高的一站,投入一小时,省掉后面无数次"为什么搜不到"。 学习目标 阅读完本章,你应当能够: 写出带 text、keyword、date、integer 字段的显式映射,并解释每个选择的检索与聚合后果。 用分析接口亲眼看到一段文本被拆成的词条,指出标准分析器处理中文时的行为。
章节摘要:文档进入引擎的第一站是分词台——映射(mapping)先给每个字段定规则,分析器(analyzer)再把文本拆成词条、写进倒排索引。这一章决定 doc-1001 "能不能被搜到、以什么形态被搜到":text 与 keyword 的分野、标准分析器对中文的短处、自定义分析器的组装方法、索引的设置与别名机制。分词台是全旅程中回报率最高的一站,投入一小时,省掉后面无数次"为什么搜不到"。
阅读完本章,你应当能够:
金句:映射是文档的户籍,分析器是文本的剪刀——户籍定错了要搬家重来,剪刀钝了则永远搜不全。
从动态映射的便利与风险讲起,过渡到显式映射的完整写法:字段类型清单、text 加 keyword 子字段的双形态套路、参数调档。最后回答那个经典问题——映射错了为什么只能重建。
用分析接口当显微镜,逐个观察标准分析器对中英文的处理;再按三段流水线组装自定义分析器,处理繁简、全半角、停用词这些真实脏数据。搜索质量的根子在这一节。
索引不止"建了就用":设置分静态与动态、别名让重建与切换零停机、删除与关闭各有场景。读完你会掌握一套完整的索引生命周期操作,为第 9 章的容量规划打底。
三节沿着"登记、拆解、容器"递进:映射先声明规则,分析器在规则之下执行拆解,索引设置则管理承载两者的容器。3.2 的分析器必须挂在映射的字段上才生效,3.3 的别名切换正是 3.1 所说"改映射要重建索引"的标准解法——三节互为工具与出口。
3.1 映射定规则 ──► 3.2 分析器执行拆解 ──► 3.3 索引容器管理 │ │ │ └─► 第5章 term与match │ └─► 第8章 分片与容量 └─► 第9章 案例里的中文检索调优
| 考核点 | 达标标准 | 对应小节 |
|---|---|---|
| 写显式映射 | 给定工单字段清单,写出含 text、keyword、date、integer 的完整映射 | 3.1 |
| 双形态套路 | 解释 text 挂 keyword 子字段解决什么问题,写出使用两种形态的请求 | 3.1 |
| 预测分析结果 | 给定一段中英混排文本,说出标准分析器切出的词条序列 | 3.2 |
| 组装分析器 | 按字符过滤、分词、词条过滤三段组装自定义分析器并验证 | 3.2 |
| 零停机重建 | 独立演练建新、搬运、切别名、删旧四步,并说明切换为何原子 | 3.3 |