本节摘要:前面三节的地基,在这一节汇成"微调"这个具体操作。本节讲清微调的定义、与全量训练的对比、微调的数据形态,以及最重要的工程判断——什么时候该微调、什么时候不该微调。
阅读完本节,你应当能够:
"模型效果不够好,微调一下"——这句话听着简单,背后是个成本不小的决定。微调要数据、要算力、要时间,可能还会把模型原有能力冲掉。什么时候值得微调,什么时候用提示词或 RAG 就够,是微调工程的第一课。

微调数据通常是"问题-期望回答"对:
问题:这家店支持哪些支付方式? 期望:支持微信、支付宝、银行卡三种方式,其中……
模型从这些"示例"中学会你的领域的回答风格与知识。
💡 关键直觉:微调是最后手段,不是第一选择。提示词能解决的就用提示词,RAG 能补知识的就用 RAG——只有"行为模式需要固化"(如特定语气、特定格式、特定推理路径)时才值得微调。
| 方案 | 解决什么 | 成本 |
|---|---|---|
| 提示词 | 行为定制 | 极低 |
| RAG | 知识补充 | 低 |
| 微调 | 行为固化 | 中高 |
| 全量训练 | 造新模型 | 极高 |
| 风险 | 表现 | 缓解 |
|---|---|---|
| 灾难性遗忘 | 原有能力下降 | 小学习率、混合通用数据 |
| 过拟合 | 只记得微调数据 | 早停、数据增强 |
| 幻觉加重 | 编造更自信 | 高质量数据、评估 |
四问全"是",微调才值得启动。
⚠️ 常见误区:把该用 RAG 的场景也拿去微调。知识类问题(资料里有答案)用 RAG 更合适——微调擅长"行为固化",不擅长"知识注入",用错场景既费钱效果还差。
提前看清全貌,后面各章才不会迷路。一个标准微调项目分六个阶段:
数据准备 → 数据清洗与配比 → 训练配置 → 微调训练 → 评估对比 → 部署上线
这个流程里最容易翻车的是评估环节缺失:很多人微调完"感觉变好了"就上线,却没有用同一套评测集对比基线,结果通用能力悄悄下降而不自知。因此第 4 章的案例都会强调"先定评测、再谈微调"。
微调是把"预训练通才"改造成"领域专才"的二次训练:先确认问题确实需要微调(提示词、RAG 都试过之后),再按"数据准备→清洗→配置→训练→评估→部署"的六步流程推进,全程用评测集守住"效果提升、能力不倒退"两条底线。
基础概念全部就位。第 2 章进入微调核心——理论与实践。