附录 · 术语表与速查手册 本附录摘要:这套教程涉及大量术语和选型决策,分散在各章里。本附录把它们汇总成一张速查表,按"检索、微调、提示、多模态、对话"五大主题归类,每个术语给一句话定义加关键取舍。遇到记不清的概念或要做选型决策时,先来这里扫一眼。 怎么用这个附录 这份附录不是用来从头读到尾的,而是用来回查的。它的组织逻辑是:先按主题分块(对应教程的五章),每块里把该主题的核心术语和选型要点列成表。你可以按主题定位,也可以用下面的总览图先建立全局印象,再钻进具体分块。 全书知识地图 先用一张图把四条主线放在一起做多维对比——它们各自的成本、效果持久性、适用场景,以及彼此之间的关系。这张矩阵图比单纯的流程图更能帮你建立全局视角。
本附录摘要:这套教程涉及大量术语和选型决策,分散在各章里。本附录把它们汇总成一张速查表,按"检索、微调、提示、多模态、对话"五大主题归类,每个术语给一句话定义加关键取舍。遇到记不清的概念或要做选型决策时,先来这里扫一眼。
这份附录不是用来从头读到尾的,而是用来回查的。它的组织逻辑是:先按主题分块(对应教程的五章),每块里把该主题的核心术语和选型要点列成表。你可以按主题定位,也可以用下面的总览图先建立全局印象,再钻进具体分块。
先用一张图把四条主线放在一起做多维对比——它们各自的成本、效果持久性、适用场景,以及彼此之间的关系。这张矩阵图比单纯的流程图更能帮你建立全局视角。

四条主线不是孤立的:RAG 常和提示工程配合(检索来的内容要靠提示引导模型用),微调和提示工程是"改模型 vs 不改模型"的两条路(常对比选型),而多模态和对话系统是前三章能力的综合应用场景。理解这些关联,比记住单个术语更重要。
第一章的核心是"怎么把私有知识喂给模型"。下面这些术语围绕检索质量展开。
| 术语 | 一句话定义 | 关键取舍/备注 |
|---|---|---|
| RAG | 检索增强生成,生成前先检索相关文档塞进上下文 | 检索质量是天花板,检索不行模型再强也白搭 |
| embedding | 把文本编码成高维向量的过程/模型 | 语言要匹配,盲目追高维度往往得不偿失 |
| chunk | 文档切分成的小块,检索的基本单位 | 粒度在检索精度和上下文完整性间取舍 |
| 向量检索 | 算查询向量和文档向量的相似度召回 | 擅长语义匹配,弱在精确串匹配和多跳推理 |
| BM25 | 基于词频和文档频率的稀疏关键词检索 | 擅长精确匹配,弱在语义理解 |
| 混合检索 | 稠密向量检索加稀疏 BM25 的两路融合 | 两路盲区互补,是生产级 RAG 标配 |
| RRF | 倒数排名融合,按排名而非分数融合多路结果 | 免调参,默认首选的融合方式 |
| cross-encoder | 查询和文档同送模型的相关性打分器 | 比双塔准但慢,用于重排序精排 |
| 重排序 | 对召回候选用更重模型重新打分排序 | 两阶段检索的精排环节,延迟瓶颈在此 |
| HNSW | 分层可导航小世界图,主流向量索引算法 | 查询极快召回高,但吃内存、构建慢 |
| IVF | 倒排文件索引,基于聚类的向量索引 | 均衡,构建快,精度依赖簇数 |
| 乘积量化 PQ | 把高维向量切片量化压缩省内存 | 省内存但有损,常和 IVF 组合成 IVF-PQ |
| GraphRAG | 用知识图谱增强的 RAG | 强在多跳推理和实体关系,代价是建图成本高 |
| 多跳推理 | 答案需要跨多个文档/实体串联的推理 | 向量检索的硬伤,需图检索或查询改写缓解 |
检索类选型的核心判断:简单事实问答用向量 RAG 加重排就够;多跳和关系查询考虑 GraphRAG;精确关键词多的场景上混合检索。这三条路不是互斥的,生产系统常组合使用。
第二章的核心是"怎么用最小代价把通用模型变成专用模型"。
| 术语 | 一句话定义 | 关键取舍/备注 |
|---|---|---|
| 全量微调 | 更新模型全部参数的微调 | 效果上限最高,但显存和算力代价最大 |
| LoRA | 冻结基座,只训两个低秩小矩阵的微调 | 参数降到千分之一,单卡可跑,主流选择 |
| QLoRA | LoRA 加 4 比特 NF4 量化的基座 | 省基座显存,单卡能跑更大模型,训练慢两到四成 |
| NF4 | 按正态分位点划分的 4 比特量化 | 比均匀 INT4 更贴合权重分布,精度损失极小 |
| 双重量化 | 把量化常数再量化一次省显存 | 每参数再省约 0.37 比特,大模型上能省几 GB |
| 分页优化器 | 显存不够时优化器状态换出到 CPU 内存 | 防 OOM,代价是变慢 |
| PEFT | 参数高效微调的统称 | LoRA、Adapter、Prefix/Prompt Tuning 都属此类 |
| Adapter | 每层后串瓶颈网络的 PEFT 方法 | 效果好但推理有额外开销 |
| Prefix/Prompt Tuning | 输入端加可学习软提示的 PEFT 方法 | 最轻量,但只在百亿级以上模型稳定 |
| 多适配器 | 一份基座挂多个任务适配器按需切换 | 加任务只加几十 MB,前提是基座冻结不变 |
| 灾难性遗忘 | 微调后丢失原有通用能力 | 混入通用数据、降学习率、用 LoRA 缓解 |
| AdapterFusion | 组合多个 Adapter 实现多任务知识共享 | Adapter 独有的 niche 优势 |
微调类选型的核心判断:默认用 LoRA(生态最成熟);显存不够上 QLoRA;要极简且模型够大考虑 Prompt Tuning;多任务知识共享用 AdapterFusion;学全新复杂能力才上全量微调。数据质量永远比方法选择更重要——垃圾数据进,垃圾模型出。
第三章的核心是"不动模型也能提升效果"。
| 术语 | 一句话定义 | 关键取舍/备注 |
|---|---|---|
| 零样本 | 直接给指令要答案,不给示范 | 依赖模型通用能力,适合简单任务 |
| 少样本 | 给几个输入输出示范再问 | 示范要和目标任务同构、多样、顺序合理 |
| 上下文学习 | 少样本背后的机理:激活已有能力 | 不是教学而是定位模式,模型够大才稳定 |
| 思维链 CoT | 让模型一步步思考再给答案 | 用文本扩展工作内存,多步推理提升显著 |
| 零样本 CoT | 加一句"一步步思考"触发推理 | 零成本,推理风格不可控 |
| 少样本 CoT | 给带推理过程的示范 | 控推理风格,要准备高质量示范 |
| 自洽采样 | 多次 CoT 推理加多数表决 | 用算力换准确,压住推理随机性 |
| 思维树 ToT | 探索多条推理路径并评估剪枝 | 极复杂任务才用,成本极高 |
| ReAct | 推理与工具调用交替 | 解决模型缺外部信息的问题,Agent 基础范式 |
| 幻觉 | 模型编造不实信息 | 提示约束"找不到就说不知道"可部分缓解 |
提示类选型的核心判断:从最简单的开始试,逐级升级。直接问 → 少样本 → CoT → 自洽采样 → ReAct/思维树。每升一级量化评估"提升多少、代价多少",别跳跃式升级。CoT 是性价比甜点,多数业务停在这里就够。
💡 关键直觉:这三章(RAG、微调、提示)是提升大模型效果的三条路,成本递增(提示 < RAG < 微调),效果持久性递增(提示是一次性的,RAG 每次检索,微调烙进权重)。工程上永远先试成本最低的提示工程,不够再上 RAG,还不够才考虑微调。把三者配合使用(如 RAG 加 CoT)往往比单独用任一种都强。
第四章上半部分讲视觉语言模型。
| 术语 | 一句话定义 | 关键取舍/备注 |
|---|---|---|
| 多模态 | 同时处理多种模态(图文音视频) | 核心是让不同模态对齐到同一语义空间 |
| CLIP | 对比学习对齐图文空间的双塔模型 | 开创跨模态检索,快但浅 |
| BLIP | 引入图文融合理解的多模态模型 | 细粒度理解强,能生成描述 |
| LLaVA | 视觉编码器接入 LLM 的多模态大模型 | 复用 LLM 全部能力,当前主流,但有幻觉 |
| 双塔架构 | 图文各自编码最后比相似度 | 快可预计算,适合大规模检索 |
| 融合架构 | 图文在交叉注意力层深度交互 | 准但慢,适合细粒度理解和精排 |
| 生成式架构 | 图像变 token 接入 LLM 生成 | 全能但重,适合多模态对话 |
| VQA | 视觉问答,给图问问题 | 融合架构擅长 |
| 多模态幻觉 | 编造图中没有的内容 | 比纯文本幻觉更难识别,高风险场景慎用 |
多模态选型核心判断:大规模检索用双塔(CLIP);细粒度理解用融合(BLIP);多模态对话用生成式(LLaVA)。生产系统常组合:双塔召回 + 融合精排 + 生成式交互,各取所长。
第四章下半部分讲 RAG 增强的多轮对话。
| 术语 | 一句话定义 | 关键取舍/备注 |
|---|---|---|
| 上下文管理 | 多轮对话历史的组织和压缩策略 | 全量拼接/摘要压缩/向量记忆,按对话长度选 |
| 全量拼接 | 所有历史原样拼进提示 | 简单但易超窗和中间遗忘,适合短对话 |
| 摘要压缩 | 定期把早期历史压缩成摘要 | 省token但可能丢细节 |
| 向量记忆 | 把历史存向量库按相关性检索 | 适合长程对话回查,实现复杂 |
| 查询改写 | 结合历史把带代词输入改写成明确查询 | RAG 对话的关键环节,不做则检索准确率暴跌 |
| 对话状态追踪 DST | 维护结构化的对话当前状态 | 让系统主动追问缺的信息,任务型对话必需 |
| 槽位 | DST 里要填的结构化信息项(如时间/人数) | 槽位填齐才能完成任务 |
| 记忆冲突 | 长程对话里用户前后信息矛盾 | 简单覆盖会误伤,需主动澄清 |
对话系统选型核心判断:短对话全量拼接;中等长度摘要压缩;长程或需回查用向量记忆;任务型对话上 DST。对话系统的难点在多轮管理而非单轮问答,优化是持续的——先搭最小可用系统,再根据真实 bad case 逐步加组件。
最后,把贯穿全书几条反复出现的工程原则汇总,它们比单个术语更值得记住。
第一,先低成本再高成本。提示工程 < RAG < 微调,永远先试成本低的,不够再升级。同样在提示内部,直接问 < 少样本 < CoT < 自洽采样,逐级升级。这条升级路径画出来是这样:
每往右一步成本更高、效果更持久,但边际收益递减。多数业务停在 CoT 或 RAG 就够,不必一路走到微调或换模型。
第二,质量在数据不在方法。无论 RAG 的文档切分、微调的训练数据、对话的检索内容,数据质量决定上限,方法只是逼近上限。垃圾数据配再好的方法也是垃圾输出。
第三,两阶段是普适模式。检索的"粗排加精排"、多模态的"双塔召回加融合精排"、提示的"先召回再重排",本质都是"先快后准"的两阶段思路,用便宜方法保覆盖、用贵方法保精度。
第四,靠 bad case 驱动优化。无论调 RAG、调提示、调对话系统,都要建立固定评估集和 bad case 收集机制,靠分析 bad case 共性来针对性改进,而不是凭感觉盲调。
第五,没有银弹只有取舍。LoRA vs 全量、向量 vs 图、双塔 vs 融合、CoT vs 自洽采样,每个选择都是在效果、延迟、成本、复杂度之间做权衡。不存在处处最优的方案,只存在最匹配你业务约束的方案。
最后列一些常用参数的典型取值范围,供调参时参考(具体取值视模型和任务而定,这里只给经验范围)。
| 参数 | 典型范围 | 说明 |
|---|---|---|
| chunk 大小 | 128-512 token | 事实型问答偏小,理解型偏大 |
| chunk 重叠 | 10%-20% | 减少边界信息丢失 |
| 检索 top-k | 5-20 | 召回候选数,视上下文窗口定 |
| LoRA 秩 r | 4-64 | 多数任务 8 够用,盲目调大过拟合 |
| LoRA 学习率 | 1e-4 到 3e-4 | 比全量微调高一个数量级 |
| LoRA 目标模块 | q_proj/v_proj 或全模块 | 全模块效果更好但参数更多 |
| QLoRA 量化 | nf4 | 比普通 int4 损失小 |
| 自洽采样次数 | 5-20 | 10 次左右是性价比甜点 |
| 采样温度 | 0.5-0.8 | 自洽采样要一定随机性 |
| 图遍历跳数 | 2 | GraphRAG 的稳妥起点 |
| HNSW efSearch | 中高 | 越高越准越慢 |
⚠️ 常见坑:照搬别人的参数。上表的值是经验范围,不是最优值。你的模型、数据、硬件不同,最优参数也不同。永远拿自己的真实数据跑一组对比,别迷信任何"推荐参数"。
这份附录会随着你实践深入不断被回查。建议把它加到收藏,遇到术语记不清或要做选型决策时回来扫一眼。更重要的是,把这些术语背后的取舍思维内化——技术选型的本质是在约束下找最优解,理解每个选择的代价,比记住每个术语的定义更有价值。
整套教程到这里完整收尾。从第 1 章的知识检索,到第 2 章的模型微调,到第 3 章的提示工程,到第 4 章的多模态对话,四条主线构成了当前大模型应用的核心工程能力。把它们组合起来,你就能搭建出真正能用的、面向真实业务的自然语言理解系统。