7.3 RLHF 在多模态中的应用 指令微调(SFT)让模型学会「回答什么」,但模型仍可能给出虽然相关但不符合人类偏好的回答——例如啰嗦、有幻觉、不礼貌、有偏见。RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)的目标是进一步让模型「回答得好」——按人类偏好优化。 本节梳理 RLHF 的三步流程,及其在多模态场景中的适配。 一、为什么需要 RLHF:SFT 的局限 经过 SFT 的模型虽然能回答问题,但仍有几个问题: 问题一:回答质量参差 SFT 数据中「回答」质量不均,模型会学到平均水平的回答,而非最佳回答。
指令微调(SFT)让模型学会「回答什么」,但模型仍可能给出虽然相关但不符合人类偏好的回答——例如啰嗦、有幻觉、不礼貌、有偏见。RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)的目标是进一步让模型「回答得好」——按人类偏好优化。
本节梳理 RLHF 的三步流程,及其在多模态场景中的适配。
经过 SFT 的模型虽然能回答问题,但仍有几个问题:
SFT 数据中「回答」质量不均,模型会学到平均水平的回答,而非最佳回答。
同一问题可能有多种合理回答,SFT 没有告诉模型「哪个更好」:
不同场景下偏好不同,SFT 无法表达这种偏好。
模型可能学到 SFT 数据中的负面行为:
SFT 主要学「做什么」,RLHF 学「不做什么」与「怎么做更好」。
RLHF 最早由 OpenAI 在 InstructGPT 论文中提出,分三步:
用「指令-回答」对训练模型,让它学会基本回答能力。这就是第7.1、7.2 节讲的内容。
SFT 后的模型记为 \pi_\text{SFT},作为后续 RLHF 的起点。
让 SFT 模型对同一指令生成多个回答(如 K=4 个),然后让人类标注员对这些回答排序:
指令: "描述这张图" 回答 A: "图中是一只猫" ← 标注员认为一般 回答 B: "图中是一只橘色的猫坐在窗台上" ← 标注员认为好 回答 C: "这张图很有趣,..." ← 标注员认为最好 回答 D: "猫" ← 标注员认为最差 排序: C > B > A > D
用这些排序数据训练一个奖励模型(Reward Model, RM):
形式化为偏好损失(Bradley-Terry 模型):
其中 y_w 是偏好排序中更好的回答,y_l 是较差的回答,\sigma 是 sigmoid。
RM 训练好后,能自动给任意「指令-回答」对打分,模拟人类偏好。
用 RM 作为奖励信号,通过强化学习算法(通常 PPO)微调 SFT 模型,让它生成更高奖励的回答。
每一步:
同时加一个KL 散度约束,防止 \pi_\text{RL} 偏离 \pi_\text{SFT} 太远(避免模型为了刷分而输出乱码):
\beta 是平衡系数,控制「优化奖励」与「保持 SFT 行为」的权衡。
把 RLHF 应用到多模态大模型,需要几个适配:
多模态偏好数据是「图像 + 指令 + 回答 A vs 回答 B」:
图像: <一张猫的图> 指令: "图里有几只猫?" 回答 A: "图中有两只猫" ← 标注员认为对 回答 B: "图中有三只猫" ← 标注员认为错(幻觉) 排序: A > B
数据采集成本比纯文本更高(需要看图判断),所以多模态偏好数据规模通常更小。
多模态 RM 接收图像 + 文本作为输入:
[图像] + [指令] + [回答] → 多模态 RM → 标量奖励分数
RM 本身也是一个多模态大模型(可以是 SFT 模型加一个标量输出头)。
多模态场景的偏好类型更多样:
不同偏好类型需要不同的标注指南。
多模态模型最严重的问题是幻觉——生成图像中不存在的内容。RLHF 在这里有关键价值:
RLHF-VR、POPE 等基准专门评估多模态幻觉,RLHF 是改善这些指标的关键方法。
PPO(Proximal Policy Optimization)是 RLHF 中最常用的强化学习算法。它的核心思想:
其中 r_t(\theta) = \pi_\text{RL}(y_t|x) / \pi_\text{old}(y_t|x) 是新旧策略的概率比,\hat{A}_t 是优势函数估计。
PPO 阶段需要同时维护:
总共 4 个大模型,显存压力极大。当代 RLHF 训练通常需要数十张 GPU。
人类偏好数据采集昂贵:
OpenAI、Anthropic 等公司投入大量资源采集偏好数据,这是它们的重要护城河。开源社区只能用相对小规模的数据(如 Anthropic 的 hh-rlhf 数据集)。
LLaVA 团队的 RLHF 工作,用 RLHF 减少幻觉:
用 RLHF 改进医学多模态大模型,减少医疗场景的幻觉。
用 AI 反馈(而非人类反馈)做 RLHF——让 GPT-4 当「裁判」生成偏好数据:
阿里 mPLUG-Owl 系列在多模态 RLHF 上有持续投入,特别在中文场景的对齐上有独到之处。
PPO 训练容易发散,需要仔细调参:
模型可能学到「钻 RM 空子」——生成长度更长、用更多专业词汇、但实际内容差的回答来骗取高分。这是 RLHF 的固有挑战。
缓解方法:
不同标注员的偏好可能冲突:
这种冲突让 RM 学到的偏好是「平均」,可能不符合具体用户的偏好。
RLHF 的全流程成本极高:
只有大公司才能完整跑通 RLHF。开源社区通常用 DPO 等简化方法。
经过 RLHF 的模型相比纯 SFT 有几个明显差异:
| 维度 | SFT 模型 | RLHF 模型 |
|---|---|---|
| 听话程度 | 中 | 高 |
| 回答质量 | 中 | 高 |
| 幻觉率 | 较高 | 较低 |
| 安全性 | 中 | 高 |
| 推理能力 | 中 | 高 |
| 多样性 | 高 | 中(RLHF 让回答更标准化) |
| 训练成本 | 中 | 极高 |
RLHF 的核心价值是对齐——让模型更符合人类偏好与价值观。
OpenAI 大概率对 GPT-4V/4o 做了大规模 RLHF,但具体细节未公开。从行为看,它:
Anthropic 在 RLHF 上有 Constitution AI 等独特方法——用 AI 自我批评代替部分人类标注。Claude 的对齐质量在闭源模型中数一数二。
Google 用 RLHF + 多模态偏好数据训练 Gemini,对齐质量也不错。
LLaVA 系列、Qwen-VL、InternVL 等开源模型大多只做了 SFT,RLHF 较少。这是开源与闭源能力差距的重要原因之一。MiniCPM-V 等少数开源模型尝试了轻量 RLHF,效果有提升。
RLHF 自身也在演化:
用强大的 LLM(如 GPT-4)当裁判,替代部分人类标注。降低成本,规模化好。
不只奖励最终回答,还奖励推理过程的每一步。适合数学、推理类任务。
同时优化多个奖励(准确性 + 流畅性 + 安全性),用多目标优化平衡。
部署后继续收集用户反馈,持续优化。这是 ChatGPT 等产品持续进步的机制。
RLHF 通过「SFT → RM → RL」三步流程,让模型按人类偏好进一步对齐。在多模态场景,RLHF 对减少幻觉、提升回答质量有关键价值,但其训练成本极高、工程复杂。闭源大模型(GPT-4o、Claude、Gemini)大量使用 RLHF,开源模型相对落后——这是当前能力差距的重要原因。
下一节(7.4)我们看 DPO——一种绕过 RM 直接优化偏好的简化方法,让小团队也能做对齐。