本节摘要:SFT 让模型学会"像助手那样说话",但"哪句话更好"它自己并不知道——好坏判断是 SFT 之外的一整块训练,统称对齐(alignment)。本节是路标不是教程:先说清 SFT 的两个缺口(没有偏好信号、安全只靠数据覆盖),再一眼看三条主路线——RLHF(训奖励模型再用强化学习优化)、DPO(跳过奖励模型,用偏好对直接改 loss)、GRPO(组内相对比较的强化学习变体)——每条一句话白话加一张对照表,细节全部指向 《深入理解 AI Agent:设计原理与工程实践》第 7 章。随后给一份进门前的自查清单(基线分数、回环校验、偏好产线、显存预算、人工抽检五项),最后盘点本书资产的平移:messages 契约长出偏好对格式、模板纪律平移到 policy 模型、rubric 评测是奖励模型的雏形、第 6 章部署原样复用。读完你知道门在哪里、手里的钥匙是哪几把。
阅读完本节,你应当能够:
SFT 的机制是模仿:数据里有什么,模型学什么。两个由此而生的缺口:
| 缺口 | SFT 的极限 | 对齐的补法 |
|---|---|---|
| 偏好 | 只会模仿见过的答案 | 用"好坏"信号抬好答案、抑差答案 |
| 安全 | 靠数据覆盖到的角落 | 把拒答与无害当作一种偏好来优化 |
对齐训练补的就是这两块:把"好坏"变成可优化的信号。它在本书地图上的位置:四阶段(1.1)之后、尚无官方 nanochat 流程覆盖的深水区——按 0.1 的分工声明,本书只留路标。
💡 一个常见误解先拆掉:对齐不是让模型"更聪明"。它不补知识、不涨推理上限(那些回预训练),它改的是"在多个可行回答里挑更好的那个"的倾向——所以对齐的收益要在 5.2 那样的偏好对比里看,而不是在事实问答的分数里看。
| 路线 | 一句话白话 | 关键部件 | 特点 |
|---|---|---|---|
| RLHF | 请人或模型标好坏,训一个"打分器"(奖励模型),再用强化学习让模型追高分 | SFT 模型 + 奖励模型 + 策略优化(PPO 一类) | 经典完整;链路长、工程重 |
| DPO | 跳过打分器和强化学习:把"好答案/坏答案"对直接变成 loss,好答案加权、坏答案降权 | SFT 模型 + 偏好对数据 | 简单稳定,社区主流入门 |
| GRPO | 不训打分器也不构造偏好对:一组回答内部比出相对好坏,用组内相对优势更新 | SFT 模型 + 可判分任务 | 数学/代码等可验证任务上被开源训练报告验证(口径见 ai-agent-book) |
┌─ DPO:偏好对直接进 loss ─────────┐ SFT 模型(本书产出)──┼─ RLHF:奖励模型 → PPO 优化 ───────┼──► 对齐模型 ──► 第 5 章评测 / 第 6 章部署 (8.1 中文版可选) └─ GRPO:组内相对比较更新 ──────────┘ ▲ 偏好数据:人工标注 / 强模型合成(2.3 蒸馏回环的又一用武之地)
三条路线共用的燃料是偏好数据(哪个回答更好),而这正是 2.3 蒸馏回环的延伸场景:种子问题 → 采样多个回答 → 强模型裁判排序。偏好数据的量级(示意参考,社区实践口径):入门实验数千对,正式对齐数万对起步——比 SFT 数据便宜在"回答可以由自己的模型采样",贵在"排序必须可信"。
⚠️ 偏好标注继承 5.2 裁判的三偏:位置偏差(交换顺序重标一轮)、长度偏差("长的多半更好")、自恋偏差(裁判偏爱同门回答)。偏好数据脏,对齐就是把偏差训进模型——5.2 的人工抽检通道在对齐阶段不是可选项。
展开细节——奖励建模、PPO 的实现、DPO 的 loss 推导、GRPO 的组构造——全部详见 《深入理解 AI Agent:设计原理与工程实践》第 7 章后训练。
进对齐训练之前,对照打勾(每一项都来自本书某章;打不出勾,先回那章):
| 序 | 自查项 | 来自 | 打不勾怎么办 |
|---|---|---|---|
| 1 | SFT 模型在冻结题库上有基线分数(不是"感觉不错") | 5.2 | 先补一轮回归评测 |
| 2 | 模板三处消费的回环校验通过(训练/推理/部署) | 4.3/6.1 | 先修一致性地基 |
| 3 | 能稳定产出偏好数据:同题多答 + 可信排序 | 2.3/5.2 | 先跑通蒸馏回环的领域版 |
| 4 | 显存预算:对齐训练通常比 SFT 多一份参考模型的权重与优化器状态(示意估算:静态部分约乘 1.5~2) | 0.2/附录 B | 换大卡,或压参考模型精度 |
| 5 | 人工抽检通道常备——防奖励黑客(reward hacking):模型学会讨好打分器而不是真的变好 | 5.2 | 把抽检表搬进对齐循环 |
| 本书资产 | 对齐训练里的角色 |
|---|---|
| 2.1 messages 契约 | 偏好对格式的底座:同一 prompt + chosen/rejected 两条回答 |
| 2.3 蒸馏回环 | 偏好数据的生产线:多采样 + 裁判排序 |
| 4.3 模板纪律 | policy 模型与参考模型必须同模板——错位纪律原样生效 |
| 5.2 rubric 评测 | 奖励模型本质是"自动评裁判"的特训版——你已经在用它的雏形 |
| 第 3 章 SFT 脚本 | RLHF/DPO 的起点就是那个 SFT checkpoint |
| 第 6~7 章部署 | 对齐后的模型照常导出 GGUF、接语音——交付链路不变 |
| 7.2 语音闭环 | 语音偏好的现成实验场(哪个回答"说起来更好听") |
六件资产没有一件会作废——这是"后半程"投资的结构性回报。
回到 1.1 的四阶段地图,本书走过的段落:拿到基座 → 造数据(第 2 章)→ 训练(第 3 章)→ 定协议(第 4 章)→ 打分数(第 5 章)→ 变服务(第 6 章)→ 接语音(第 7 章)→ 做改造(第 8 章)。一台单 GPU、百美元量级的"小 ChatGPT",从权重到语音闭环全在你手里。往后有三条岔路:对齐训练(《深入理解 AI Agent:设计原理与工程实践》第 7 章)、更大规模的预训练与分词器(《ht-gpt:从零搭建 GPT 训练与推理实战》《Happy-LLM:从零训练大语言模型》)、以及把 8.1/8.2 的实验方法用到你自己的数据与场景上——第三条不用等任何人,今天就能走。
毕业典礼建议用 0.1 的行为复验收尾:同一个问题,分别问基座与你的 chat 模型——打字问一次,再对着 7.2 的语音闭环问一次。一个还在自顾自续写,一个答完即停、还会听你说话:那道差异,是你在后半程亲手制造的。
后半程到此走完:模型会续写,也会对话、会交付、会听你说——下一程的门牌已经立好,推门即可。