8.3 下一步:RLHF 与 DPO 门前的路标


8.3 下一步:RLHF 与 DPO 门前的路标

本节摘要:SFT 让模型学会"像助手那样说话",但"哪句话更好"它自己并不知道——好坏判断是 SFT 之外的一整块训练,统称对齐(alignment)。本节是路标不是教程:先说清 SFT 的两个缺口(没有偏好信号、安全只靠数据覆盖),再一眼看三条主路线——RLHF(训奖励模型再用强化学习优化)、DPO(跳过奖励模型,用偏好对直接改 loss)、GRPO(组内相对比较的强化学习变体)——每条一句话白话加一张对照表,细节全部指向 《深入理解 AI Agent:设计原理与工程实践》第 7 章。随后给一份进门前的自查清单(基线分数、回环校验、偏好产线、显存预算、人工抽检五项),最后盘点本书资产的平移:messages 契约长出偏好对格式、模板纪律平移到 policy 模型、rubric 评测是奖励模型的雏形、第 6 章部署原样复用。读完你知道门在哪里、手里的钥匙是哪几把。

学习目标

阅读完本节,你应当能够:

  1. 说出 SFT 的两个缺口及其对应对齐要解决的问题。
  2. 用一句话白话分别解释 RLHF、DPO、GRPO。
  3. 盘点本书哪些资产可直接平移进对齐训练。
  4. 按门前的自查清单确认自己是否具备进入对齐训练的条件。

一、SFT 的两个缺口

SFT 的机制是模仿:数据里有什么,模型学什么。两个由此而生的缺口:

  1. 没有偏好信号:同一个问题可以有好坏参差的多个回答,SFT 的交叉熵只认"数据里的那个答案",不知道"它比另一个好在哪里"——好答案与平庸答案被同等对待。
  2. 安全靠覆盖:拒答、无害、不越界,SFT 只能靠数据里"预演"过的场景覆盖;没覆盖到的角落没有护栏。
缺口 SFT 的极限 对齐的补法
偏好 只会模仿见过的答案 用"好坏"信号抬好答案、抑差答案
安全 靠数据覆盖到的角落 把拒答与无害当作一种偏好来优化

对齐训练补的就是这两块:把"好坏"变成可优化的信号。它在本书地图上的位置:四阶段(1.1)之后、尚无官方 nanochat 流程覆盖的深水区——按 0.1 的分工声明,本书只留路标。

💡 一个常见误解先拆掉:对齐不是让模型"更聪明"。它不补知识、不涨推理上限(那些回预训练),它改的是"在多个可行回答里挑更好的那个"的倾向——所以对齐的收益要在 5.2 那样的偏好对比里看,而不是在事实问答的分数里看。

二、三条路线一眼看

路线 一句话白话 关键部件 特点
RLHF 请人或模型标好坏,训一个"打分器"(奖励模型),再用强化学习让模型追高分 SFT 模型 + 奖励模型 + 策略优化(PPO 一类) 经典完整;链路长、工程重
DPO 跳过打分器和强化学习:把"好答案/坏答案"对直接变成 loss,好答案加权、坏答案降权 SFT 模型 + 偏好对数据 简单稳定,社区主流入门
GRPO 不训打分器也不构造偏好对:一组回答内部比出相对好坏,用组内相对优势更新 SFT 模型 + 可判分任务 数学/代码等可验证任务上被开源训练报告验证(口径见 ai-agent-book)
┌─ DPO:偏好对直接进 loss ─────────┐ SFT 模型(本书产出)──┼─ RLHF:奖励模型 → PPO 优化 ───────┼──► 对齐模型 ──► 第 5 章评测 / 第 6 章部署 (8.1 中文版可选) └─ GRPO:组内相对比较更新 ──────────┘ ▲ 偏好数据:人工标注 / 强模型合成(2.3 蒸馏回环的又一用武之地)

三条路线共用的燃料是偏好数据(哪个回答更好),而这正是 2.3 蒸馏回环的延伸场景:种子问题 → 采样多个回答 → 强模型裁判排序。偏好数据的量级(示意参考,社区实践口径):入门实验数千对,正式对齐数万对起步——比 SFT 数据便宜在"回答可以由自己的模型采样",贵在"排序必须可信"。

⚠️ 偏好标注继承 5.2 裁判的三偏:位置偏差(交换顺序重标一轮)、长度偏差("长的多半更好")、自恋偏差(裁判偏爱同门回答)。偏好数据脏,对齐就是把偏差训进模型——5.2 的人工抽检通道在对齐阶段不是可选项。

展开细节——奖励建模、PPO 的实现、DPO 的 loss 推导、GRPO 的组构造——全部详见 《深入理解 AI Agent:设计原理与工程实践》第 7 章后训练。

三、门前的自查清单

进对齐训练之前,对照打勾(每一项都来自本书某章;打不出勾,先回那章):

自查项 来自 打不勾怎么办
1 SFT 模型在冻结题库上有基线分数(不是"感觉不错") 5.2 先补一轮回归评测
2 模板三处消费的回环校验通过(训练/推理/部署) 4.3/6.1 先修一致性地基
3 能稳定产出偏好数据:同题多答 + 可信排序 2.3/5.2 先跑通蒸馏回环的领域版
4 显存预算:对齐训练通常比 SFT 多一份参考模型的权重与优化器状态(示意估算:静态部分约乘 1.5~2) 0.2/附录 B 换大卡,或压参考模型精度
5 人工抽检通道常备——防奖励黑客(reward hacking):模型学会讨好打分器而不是真的变好 5.2 把抽检表搬进对齐循环

四、本书资产的平移表

本书资产 对齐训练里的角色
2.1 messages 契约 偏好对格式的底座:同一 prompt + chosen/rejected 两条回答
2.3 蒸馏回环 偏好数据的生产线:多采样 + 裁判排序
4.3 模板纪律 policy 模型与参考模型必须同模板——错位纪律原样生效
5.2 rubric 评测 奖励模型本质是"自动评裁判"的特训版——你已经在用它的雏形
第 3 章 SFT 脚本 RLHF/DPO 的起点就是那个 SFT checkpoint
第 6~7 章部署 对齐后的模型照常导出 GGUF、接语音——交付链路不变
7.2 语音闭环 语音偏好的现成实验场(哪个回答"说起来更好听")

六件资产没有一件会作废——这是"后半程"投资的结构性回报。

五、全书收束

回到 1.1 的四阶段地图,本书走过的段落:拿到基座 → 造数据(第 2 章)→ 训练(第 3 章)→ 定协议(第 4 章)→ 打分数(第 5 章)→ 变服务(第 6 章)→ 接语音(第 7 章)→ 做改造(第 8 章)。一台单 GPU、百美元量级的"小 ChatGPT",从权重到语音闭环全在你手里。往后有三条岔路:对齐训练(《深入理解 AI Agent:设计原理与工程实践》第 7 章)、更大规模的预训练与分词器(《ht-gpt:从零搭建 GPT 训练与推理实战》《Happy-LLM:从零训练大语言模型》)、以及把 8.1/8.2 的实验方法用到你自己的数据与场景上——第三条不用等任何人,今天就能走。

毕业典礼建议用 0.1 的行为复验收尾:同一个问题,分别问基座与你的 chat 模型——打字问一次,再对着 7.2 的语音闭环问一次。一个还在自顾自续写,一个答完即停、还会听你说话:那道差异,是你在后半程亲手制造的。

本节要点回顾

  1. SFT 两缺口:无偏好信号、安全靠覆盖——对齐训练把"好坏"变成可优化的信号。
  2. 三路线一句话:RLHF 是打分器加强化学习、DPO 是偏好对直改 loss、GRPO 是组内相对比较;细节详见 《深入理解 AI Agent:设计原理与工程实践》第 7 章。
  3. 资产平移七件套:契约、蒸馏、模板、评测、脚本、部署、语音闭环——后半程的积累全部带得走。
  4. 进门先过自查清单:基线分数、回环校验、偏好产线、显存预算、人工抽检——五项全勾再出发。

后半程到此走完:模型会续写,也会对话、会交付、会听你说——下一程的门牌已经立好,推门即可。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U