RLHF/DPO 对齐三步 · alignment
很多人以为预训练完的 base 模型就是 ChatGPT 那样的助手。不是——base 模型只会"续写",不会"对话"。
你问 base 模型"中国的首都是哪",它可能续写成"中国的首都是哪?这是一个常见问题……"而不是回答"北京"。它学会了语言的统计规律,但没学会"问答"这个格式,更没学会"什么回答更好"。对齐就是教它这两件事。
RLHF 经典三步,DPO 把后两步合成一步。点下面每步看详情。
RLHF 是经典方法(InstructGPT/ChatGPT 用的),DPO 是 2023 年的简化版,现在很多模型(Llama 3 等)转向 DPO:
SFT → 训奖励模型 → PPO 优化
要训一个独立的奖励模型,PPO 训练不稳、超参多、显存大。
复杂、易炸、贵
SFT → 直接用偏好对优化
不用训奖励模型,直接用"好回答 vs 坏回答"的偏好对做对比损失,一步到位。
简单、稳定、便宜
DPO 的洞见:奖励模型的最优解可以直接从偏好对推出,不用显式训奖励模型。所以 DPO 砍掉了 RLHF 里最不稳的一步(PPO),效果还不差。对齐不是越复杂越好,是越简单越稳。