AI 与大模型 · 第 7 期

会接话的模型,怎么变听话?

RLHF/DPO 对齐三步 · alignment

base 模型会接话但不听话——你问"怎么做菜",它可能续写"杀人方法"。RLHF/DPO 就是教它对齐人类偏好:SFT 教格式、奖励模型打分、PPO/DPO 优化偏好。三步下来,会接话的模型变成"按你想要的接话"。
⏱ 约 11 分钟 🎯 想懂大模型怎么变"好用"的人 📦 源:ai-engineering-from-scratch §11

01一个反共识:base 模型不是"成品"

很多人以为预训练完的 base 模型就是 ChatGPT 那样的助手。不是——base 模型只会"续写",不会"对话"。

你问 base 模型"中国的首都是哪",它可能续写成"中国的首都是哪?这是一个常见问题……"而不是回答"北京"。它学会了语言的统计规律,但没学会"问答"这个格式,更没学会"什么回答更好"。对齐就是教它这两件事。

base 模型会续写,
对齐后才对话。
灏天文库 · AI 与大模型 P.20

02对齐三步:点每步看它做什么

RLHF 经典三步,DPO 把后两步合成一步。点下面每步看详情。

🎯 对齐流程图
点每步看它教模型什么。

03RLHF vs DPO:后者更简单更稳

RLHF 是经典方法(InstructGPT/ChatGPT 用的),DPO 是 2023 年的简化版,现在很多模型(Llama 3 等)转向 DPO:

RLHF(三步)

SFT → 训奖励模型 → PPO 优化

要训一个独立的奖励模型,PPO 训练不稳、超参多、显存大。

复杂、易炸、贵

DPO(两步)

SFT → 直接用偏好对优化

不用训奖励模型,直接用"好回答 vs 坏回答"的偏好对做对比损失,一步到位。

简单、稳定、便宜

DPO 的洞见:奖励模型的最优解可以直接从偏好对推出,不用显式训奖励模型。所以 DPO 砍掉了 RLHF 里最不稳的一步(PPO),效果还不差。对齐不是越复杂越好,是越简单越稳。

对齐不是越复杂越好,
是越简单越稳。
灏天文库 · AI 与大模型 P.21

04带走这套清单

✅ 对齐 6 条可执行规则

  1. base 模型不是成品:会续写不会对话,必须经过对齐。
  2. SFT 先教格式:用指令-回答对微调,让模型学会"问答"格式。
  3. 偏好数据是关键:好回答 vs 坏回答的对比,质量比对齐算法更重要。
  4. DPO 优先于 RLHF:更简单更稳,砍掉了最不稳的 PPO 步。
  5. 对齐别过度:对齐太狠模型变"复读机",留点多样性。
  6. 评测要对齐目标:对齐后用偏好评测(人评/LLM 评),不是只看 benchmark。
会接话靠预训练,
听话靠对齐。
灏天文库 · AI 与大模型 P.22