内容摘要
RLHF/DPO · 怎么把一个会接话的模型变成听话的 灏 灏天文库 · AI 与大模型 第 7 期 AI 与大模型 · 第 7 期 会接话的模型, 怎么变听话 ? RLHF/DPO 对齐三步 · alignment base 模型会接话但不听话——你问"怎么做菜",它可能续写"杀人方法"。 RLHF/DPO 就是教它对齐人类偏好 :SFT 教格式、奖励模型打分、PPO/DPO 优化偏好。三步下来,会接话的模型变成"按你想要的接话"。 ⏱ 约 11 分钟 🎯 想懂大模型怎么变"好用"的人 📦 源:ai-engineering-from-scratch §11 01 一个反共识:base 模型不是"成品" 很多人以为预训练完的 base 模型就是 ChatGPT 那样的助手。不是——base 模型只会"续写",不会"对话"。 你问 base 模型"中国的首都是哪",它可能续写成"中国的首都是哪?这是一个常见问题……"而不是回答"北京"。它学会了语言的统计规律,但没学会"问答"这个格式,更没学会"什么回答更好"。 对齐就是教它这两件事 。