章节摘要:一套 RAG 系统由三段流水线组成——知识库构建与管理、检索模块、生成模块。本章按数据流动的顺序逐段拆解:知识从原始文档变成可检索单元要经过哪几道工序,检索模块内部有哪四个部件,生成模块如何在提示词工程与解码参数之间做平衡。读完本章,你应当能独立设计一条最小可用的 RAG 管线,并为每个环节做出有依据的技术选择。
阅读完本章,你应当能够:
一张图看清本章的地形。数据从左到右流过三段管线,每段都有一个"质量决定下游上限"的关键工序:
金句:管线里没有"最重要的环节",只有"最早出错的环节"——上游的脏,下游洗不干净。
RAG 的地基工程。数据从哪里来、怎么清洗、怎么切块、怎么变成向量、存进什么数据库、怎么维护更新——这一节按工序顺序讲透,重点在分块策略与存储选型。
把"找资料"这个动作拆开看:数据索引、查询编码、相似度搜索、结果排序与过滤四个部件各司其职。嵌入模型、索引结构、相似度度量三大选型决策都在这里。
资料到手之后,怎么让模型用好它。提示词的四要素、解码参数的调节直觉、上下文长度限制的应对,以及答案精炼、事实核查、引用添加这些增强手段。
三节就是一条流水线的三站,顺序即因果:
2.1 知识库 2.2 检索 2.3 生成 ───────── ───────── ───────── 决定"有什么可找" → 决定"找到的是什么" → 决定"找到的用成什么样" │ │ │ └── 分块质量 ──────┘ │ └── 向量质量 ────────────────────────────┘
2.1 的分块粒度直接约束 2.2 的检索上限(块太碎检索命中但信息不全,块太大信息全但相似度被稀释),2.2 返回的文本块质量又决定 2.3 的提示词能塞进什么。三节连读时请保持这个"数据流"视角,任何一节的优化手段都要放在上下游约束里评估。
三节的组件与产出速查如下,读完各节后可以回到这张表自查掌握程度:
| 小节 | 核心组件 | 关键产出 | 最常翻车的点 |
|---|---|---|---|
| 2.1 知识库 | 获取、清洗、分块、向量化、存储 | 可检索的文本块库 | 分块参数拍脑袋 |
| 2.2 检索 | 索引、查询编码、相似度搜索、排序过滤 | Top-K 相关文本块 | 两侧嵌入模型不一致 |
| 2.3 生成 | 提示词、解码参数、后处理 | 带引用的最终答案 | 提示词缺护栏语句 |
关于学习节奏再补一句:本章内容偏工程,光读容易产生"都懂了"的错觉,动手时才发现处处是坑。建议的节奏是读一节、动手做一节——读完 2.1 就真的去切一份文档,读完 2.2 就真的跑几次检索看看返回什么,读完 2.3 再把答案生成出来。三节做完,你手里就有一个能跑的系统,第 3 章的每项优化技术也都有了用武之地。
动手素材不必刻意准备:自己积累的笔记、团队共享的文档、一份公开的技术规格书,任何真实文本都比教程附带的示例数据更有教学价值——因为真实文本自带脏数据与结构怪癖,恰好是练习清洗与分块的活教材。
💡 学完本章强烈建议动手:找一份自己领域的文档,走完"切块、向量化、入库、检索、生成"全流程。哪怕效果粗糙,亲手踩一遍坑,第 3 章的每个优化技术你都会知道它在救什么火。
⚠️ 别在工具选型上耗太久。向量数据库、嵌入模型的差异在多数业务里是加分项而非生死线,分块策略和知识库卫生才是。先用默认组合跑通,再谈替换。
准备好了就开始打地基——详见第 2 章第 1 节。