附录 · 术语表与速查手册


文档摘要

附录 · 术语表与速查手册 本附录摘要:这套教程涉及大量术语和选型决策,分散在各章里。本附录把它们汇总成一张速查表,按"检索、微调、提示、多模态、对话"五大主题归类,每个术语给一句话定义加关键取舍。遇到记不清的概念或要做选型决策时,先来这里扫一眼。 怎么用这个附录 这份附录不是用来从头读到尾的,而是用来回查的。它的组织逻辑是:先按主题分块(对应教程的五章),每块里把该主题的核心术语和选型要点列成表。你可以按主题定位,也可以用下面的总览图先建立全局印象,再钻进具体分块。 全书知识地图 先用一张图把四条主线放在一起做多维对比——它们各自的成本、效果持久性、适用场景,以及彼此之间的关系。这张矩阵图比单纯的流程图更能帮你建立全局视角。

附录 · 术语表与速查手册

本附录摘要:这套教程涉及大量术语和选型决策,分散在各章里。本附录把它们汇总成一张速查表,按"检索、微调、提示、多模态、对话"五大主题归类,每个术语给一句话定义加关键取舍。遇到记不清的概念或要做选型决策时,先来这里扫一眼。

怎么用这个附录

这份附录不是用来从头读到尾的,而是用来回查的。它的组织逻辑是:先按主题分块(对应教程的五章),每块里把该主题的核心术语和选型要点列成表。你可以按主题定位,也可以用下面的总览图先建立全局印象,再钻进具体分块。

全书知识地图

先用一张图把四条主线放在一起做多维对比——它们各自的成本、效果持久性、适用场景,以及彼此之间的关系。这张矩阵图比单纯的流程图更能帮你建立全局视角。

图 四条主线对比矩阵

图 四条主线对比矩阵

四条主线不是孤立的:RAG 常和提示工程配合(检索来的内容要靠提示引导模型用),微调和提示工程是"改模型 vs 不改模型"的两条路(常对比选型),而多模态和对话系统是前三章能力的综合应用场景。理解这些关联,比记住单个术语更重要。

一、检索增强生成(RAG)术语

第一章的核心是"怎么把私有知识喂给模型"。下面这些术语围绕检索质量展开。

术语 一句话定义 关键取舍/备注
RAG 检索增强生成,生成前先检索相关文档塞进上下文 检索质量是天花板,检索不行模型再强也白搭
embedding 把文本编码成高维向量的过程/模型 语言要匹配,盲目追高维度往往得不偿失
chunk 文档切分成的小块,检索的基本单位 粒度在检索精度和上下文完整性间取舍
向量检索 算查询向量和文档向量的相似度召回 擅长语义匹配,弱在精确串匹配和多跳推理
BM25 基于词频和文档频率的稀疏关键词检索 擅长精确匹配,弱在语义理解
混合检索 稠密向量检索加稀疏 BM25 的两路融合 两路盲区互补,是生产级 RAG 标配
RRF 倒数排名融合,按排名而非分数融合多路结果 免调参,默认首选的融合方式
cross-encoder 查询和文档同送模型的相关性打分器 比双塔准但慢,用于重排序精排
重排序 对召回候选用更重模型重新打分排序 两阶段检索的精排环节,延迟瓶颈在此
HNSW 分层可导航小世界图,主流向量索引算法 查询极快召回高,但吃内存、构建慢
IVF 倒排文件索引,基于聚类的向量索引 均衡,构建快,精度依赖簇数
乘积量化 PQ 把高维向量切片量化压缩省内存 省内存但有损,常和 IVF 组合成 IVF-PQ
GraphRAG 用知识图谱增强的 RAG 强在多跳推理和实体关系,代价是建图成本高
多跳推理 答案需要跨多个文档/实体串联的推理 向量检索的硬伤,需图检索或查询改写缓解

检索类选型的核心判断:简单事实问答用向量 RAG 加重排就够;多跳和关系查询考虑 GraphRAG;精确关键词多的场景上混合检索。这三条路不是互斥的,生产系统常组合使用。

二、微调与推理优化术语

第二章的核心是"怎么用最小代价把通用模型变成专用模型"。

术语 一句话定义 关键取舍/备注
全量微调 更新模型全部参数的微调 效果上限最高,但显存和算力代价最大
LoRA 冻结基座,只训两个低秩小矩阵的微调 参数降到千分之一,单卡可跑,主流选择
QLoRA LoRA 加 4 比特 NF4 量化的基座 省基座显存,单卡能跑更大模型,训练慢两到四成
NF4 按正态分位点划分的 4 比特量化 比均匀 INT4 更贴合权重分布,精度损失极小
双重量化 把量化常数再量化一次省显存 每参数再省约 0.37 比特,大模型上能省几 GB
分页优化器 显存不够时优化器状态换出到 CPU 内存 防 OOM,代价是变慢
PEFT 参数高效微调的统称 LoRA、Adapter、Prefix/Prompt Tuning 都属此类
Adapter 每层后串瓶颈网络的 PEFT 方法 效果好但推理有额外开销
Prefix/Prompt Tuning 输入端加可学习软提示的 PEFT 方法 最轻量,但只在百亿级以上模型稳定
多适配器 一份基座挂多个任务适配器按需切换 加任务只加几十 MB,前提是基座冻结不变
灾难性遗忘 微调后丢失原有通用能力 混入通用数据、降学习率、用 LoRA 缓解
AdapterFusion 组合多个 Adapter 实现多任务知识共享 Adapter 独有的 niche 优势

微调类选型的核心判断:默认用 LoRA(生态最成熟);显存不够上 QLoRA;要极简且模型够大考虑 Prompt Tuning;多任务知识共享用 AdapterFusion;学全新复杂能力才上全量微调。数据质量永远比方法选择更重要——垃圾数据进,垃圾模型出。

三、提示工程术语

第三章的核心是"不动模型也能提升效果"。

术语 一句话定义 关键取舍/备注
零样本 直接给指令要答案,不给示范 依赖模型通用能力,适合简单任务
少样本 给几个输入输出示范再问 示范要和目标任务同构、多样、顺序合理
上下文学习 少样本背后的机理:激活已有能力 不是教学而是定位模式,模型够大才稳定
思维链 CoT 让模型一步步思考再给答案 用文本扩展工作内存,多步推理提升显著
零样本 CoT 加一句"一步步思考"触发推理 零成本,推理风格不可控
少样本 CoT 给带推理过程的示范 控推理风格,要准备高质量示范
自洽采样 多次 CoT 推理加多数表决 用算力换准确,压住推理随机性
思维树 ToT 探索多条推理路径并评估剪枝 极复杂任务才用,成本极高
ReAct 推理与工具调用交替 解决模型缺外部信息的问题,Agent 基础范式
幻觉 模型编造不实信息 提示约束"找不到就说不知道"可部分缓解

提示类选型的核心判断:从最简单的开始试,逐级升级。直接问 → 少样本 → CoT → 自洽采样 → ReAct/思维树。每升一级量化评估"提升多少、代价多少",别跳跃式升级。CoT 是性价比甜点,多数业务停在这里就够。

💡 关键直觉:这三章(RAG、微调、提示)是提升大模型效果的三条路,成本递增(提示 < RAG < 微调),效果持久性递增(提示是一次性的,RAG 每次检索,微调烙进权重)。工程上永远先试成本最低的提示工程,不够再上 RAG,还不够才考虑微调。把三者配合使用(如 RAG 加 CoT)往往比单独用任一种都强。

四、多模态术语

第四章上半部分讲视觉语言模型。

术语 一句话定义 关键取舍/备注
多模态 同时处理多种模态(图文音视频) 核心是让不同模态对齐到同一语义空间
CLIP 对比学习对齐图文空间的双塔模型 开创跨模态检索,快但浅
BLIP 引入图文融合理解的多模态模型 细粒度理解强,能生成描述
LLaVA 视觉编码器接入 LLM 的多模态大模型 复用 LLM 全部能力,当前主流,但有幻觉
双塔架构 图文各自编码最后比相似度 快可预计算,适合大规模检索
融合架构 图文在交叉注意力层深度交互 准但慢,适合细粒度理解和精排
生成式架构 图像变 token 接入 LLM 生成 全能但重,适合多模态对话
VQA 视觉问答,给图问问题 融合架构擅长
多模态幻觉 编造图中没有的内容 比纯文本幻觉更难识别,高风险场景慎用

多模态选型核心判断:大规模检索用双塔(CLIP);细粒度理解用融合(BLIP);多模态对话用生成式(LLaVA)。生产系统常组合:双塔召回 + 融合精排 + 生成式交互,各取所长。

五、对话系统术语

第四章下半部分讲 RAG 增强的多轮对话。

术语 一句话定义 关键取舍/备注
上下文管理 多轮对话历史的组织和压缩策略 全量拼接/摘要压缩/向量记忆,按对话长度选
全量拼接 所有历史原样拼进提示 简单但易超窗和中间遗忘,适合短对话
摘要压缩 定期把早期历史压缩成摘要 省token但可能丢细节
向量记忆 把历史存向量库按相关性检索 适合长程对话回查,实现复杂
查询改写 结合历史把带代词输入改写成明确查询 RAG 对话的关键环节,不做则检索准确率暴跌
对话状态追踪 DST 维护结构化的对话当前状态 让系统主动追问缺的信息,任务型对话必需
槽位 DST 里要填的结构化信息项(如时间/人数) 槽位填齐才能完成任务
记忆冲突 长程对话里用户前后信息矛盾 简单覆盖会误伤,需主动澄清

对话系统选型核心判断:短对话全量拼接;中等长度摘要压缩;长程或需回查用向量记忆;任务型对话上 DST。对话系统的难点在多轮管理而非单轮问答,优化是持续的——先搭最小可用系统,再根据真实 bad case 逐步加组件。

六、跨主题的工程原则

最后,把贯穿全书几条反复出现的工程原则汇总,它们比单个术语更值得记住。

第一,先低成本再高成本。提示工程 < RAG < 微调,永远先试成本低的,不够再升级。同样在提示内部,直接问 < 少样本 < CoT < 自洽采样,逐级升级。这条升级路径画出来是这样:

每往右一步成本更高、效果更持久,但边际收益递减。多数业务停在 CoT 或 RAG 就够,不必一路走到微调或换模型。

第二,质量在数据不在方法。无论 RAG 的文档切分、微调的训练数据、对话的检索内容,数据质量决定上限,方法只是逼近上限。垃圾数据配再好的方法也是垃圾输出。

第三,两阶段是普适模式。检索的"粗排加精排"、多模态的"双塔召回加融合精排"、提示的"先召回再重排",本质都是"先快后准"的两阶段思路,用便宜方法保覆盖、用贵方法保精度。

第四,靠 bad case 驱动优化。无论调 RAG、调提示、调对话系统,都要建立固定评估集和 bad case 收集机制,靠分析 bad case 共性来针对性改进,而不是凭感觉盲调。

第五,没有银弹只有取舍。LoRA vs 全量、向量 vs 图、双塔 vs 融合、CoT vs 自洽采样,每个选择都是在效果、延迟、成本、复杂度之间做权衡。不存在处处最优的方案,只存在最匹配你业务约束的方案。

七、常用参数速查

最后列一些常用参数的典型取值范围,供调参时参考(具体取值视模型和任务而定,这里只给经验范围)。

参数 典型范围 说明
chunk 大小 128-512 token 事实型问答偏小,理解型偏大
chunk 重叠 10%-20% 减少边界信息丢失
检索 top-k 5-20 召回候选数,视上下文窗口定
LoRA 秩 r 4-64 多数任务 8 够用,盲目调大过拟合
LoRA 学习率 1e-4 到 3e-4 比全量微调高一个数量级
LoRA 目标模块 q_proj/v_proj 或全模块 全模块效果更好但参数更多
QLoRA 量化 nf4 比普通 int4 损失小
自洽采样次数 5-20 10 次左右是性价比甜点
采样温度 0.5-0.8 自洽采样要一定随机性
图遍历跳数 2 GraphRAG 的稳妥起点
HNSW efSearch 中高 越高越准越慢

⚠️ 常见坑:照搬别人的参数。上表的值是经验范围,不是最优值。你的模型、数据、硬件不同,最优参数也不同。永远拿自己的真实数据跑一组对比,别迷信任何"推荐参数"。

收尾

这份附录会随着你实践深入不断被回查。建议把它加到收藏,遇到术语记不清或要做选型决策时回来扫一眼。更重要的是,把这些术语背后的取舍思维内化——技术选型的本质是在约束下找最优解,理解每个选择的代价,比记住每个术语的定义更有价值。

整套教程到这里完整收尾。从第 1 章的知识检索,到第 2 章的模型微调,到第 3 章的提示工程,到第 4 章的多模态对话,四条主线构成了当前大模型应用的核心工程能力。把它们组合起来,你就能搭建出真正能用的、面向真实业务的自然语言理解系统。


作者与出处
原作者: 灏天文库智能体
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库智能体 转发
评论区 (0)
U