7.3 RLHF 在多模态中的应用


文档摘要

7.3 RLHF 在多模态中的应用 指令微调(SFT)让模型学会「回答什么」,但模型仍可能给出虽然相关但不符合人类偏好的回答——例如啰嗦、有幻觉、不礼貌、有偏见。RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)的目标是进一步让模型「回答得好」——按人类偏好优化。 本节梳理 RLHF 的三步流程,及其在多模态场景中的适配。 一、为什么需要 RLHF:SFT 的局限 经过 SFT 的模型虽然能回答问题,但仍有几个问题: 问题一:回答质量参差 SFT 数据中「回答」质量不均,模型会学到平均水平的回答,而非最佳回答。

7.3 RLHF 在多模态中的应用

指令微调(SFT)让模型学会「回答什么」,但模型仍可能给出虽然相关但不符合人类偏好的回答——例如啰嗦、有幻觉、不礼貌、有偏见。RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)的目标是进一步让模型「回答得好」——按人类偏好优化。

本节梳理 RLHF 的三步流程,及其在多模态场景中的适配。

一、为什么需要 RLHF:SFT 的局限

经过 SFT 的模型虽然能回答问题,但仍有几个问题:

问题一:回答质量参差

SFT 数据中「回答」质量不均,模型会学到平均水平的回答,而非最佳回答。

问题二:偏好不明

同一问题可能有多种合理回答,SFT 没有告诉模型「哪个更好」:

  • 简洁 vs 详细
  • 客观 vs 主观
  • 直接给答案 vs 先解释再给答案

不同场景下偏好不同,SFT 无法表达这种偏好。

问题三:负面行为

模型可能学到 SFT 数据中的负面行为:

  • 编造内容(幻觉)
  • 不安全回答
  • 偏见与歧视
  • 拒绝过于频繁(过拒)或过少(欠拒)

SFT 主要学「做什么」,RLHF 学「不做什么」与「怎么做更好」。

二、RLHF 的三步流程

RLHF 最早由 OpenAI 在 InstructGPT 论文中提出,分三步:

第一步:SFT(监督微调)

用「指令-回答」对训练模型,让它学会基本回答能力。这就是第7.1、7.2 节讲的内容。

SFT 后的模型记为 \pi_\text{SFT},作为后续 RLHF 的起点。

第二步:RM(训练奖励模型)

让 SFT 模型对同一指令生成多个回答(如 K=4 个),然后让人类标注员对这些回答排序:

指令: "描述这张图" 回答 A: "图中是一只猫" ← 标注员认为一般 回答 B: "图中是一只橘色的猫坐在窗台上" ← 标注员认为好 回答 C: "这张图很有趣,..." ← 标注员认为最好 回答 D: "猫" ← 标注员认为最差 排序: C > B > A > D

用这些排序数据训练一个奖励模型(Reward Model, RM)

  • 输入:指令 + 回答
  • 输出:一个标量奖励分数 r(\text{instruction}, \text{answer})
  • 训练目标:让好回答的分数高于差回答

形式化为偏好损失(Bradley-Terry 模型):

\mathcal{L}_\text{RM} = -\log \sigma(r(x, y_w) - r(x, y_l))

其中 y_w 是偏好排序中更好的回答,y_l 是较差的回答,\sigma 是 sigmoid。

RM 训练好后,能自动给任意「指令-回答」对打分,模拟人类偏好。

第三步:RL(强化学习优化)

用 RM 作为奖励信号,通过强化学习算法(通常 PPO)微调 SFT 模型,让它生成更高奖励的回答。

每一步:

  1. SFT 模型(称为 policy \pi_\text{RL})生成回答 y
  2. RM 给 y 打分 r(x, y)
  3. 用 PPO 更新 \pi_\text{RL},让它下次生成更高分的回答

同时加一个KL 散度约束,防止 \pi_\text{RL} 偏离 \pi_\text{SFT} 太远(避免模型为了刷分而输出乱码):

\mathcal{L}_\text{RL} = -r(x, y) + \beta \cdot \text{KL}(\pi_\text{RL}(\cdot|x) \| \pi_\text{SFT}(\cdot|x))

\beta 是平衡系数,控制「优化奖励」与「保持 SFT 行为」的权衡。

三、RLHF 在多模态中的适配

把 RLHF 应用到多模态大模型,需要几个适配:

适配一:偏好数据扩展到含图

多模态偏好数据是「图像 + 指令 + 回答 A vs 回答 B」:

图像: <一张猫的图> 指令: "图里有几只猫?" 回答 A: "图中有两只猫" ← 标注员认为对 回答 B: "图中有三只猫" ← 标注员认为错(幻觉) 排序: A > B

数据采集成本比纯文本更高(需要看图判断),所以多模态偏好数据规模通常更小。

适配二:奖励模型是多模态的

多模态 RM 接收图像 + 文本作为输入:

[图像] + [指令] + [回答] → 多模态 RM → 标量奖励分数

RM 本身也是一个多模态大模型(可以是 SFT 模型加一个标量输出头)。

适配三:偏好类型扩展

多模态场景的偏好类型更多样:

  • 准确性:回答是否与图像内容一致(关键,防幻觉)
  • 详细度:回答是否覆盖了图像的关键信息
  • 细粒度:是否描述了具体细节(颜色、数量、位置)
  • 推理质量:推理是否合理(针对 VQA)
  • 安全性:是否避免不安全内容

不同偏好类型需要不同的标注指南。

适配四:RLHF 防幻觉的特殊价值

多模态模型最严重的问题是幻觉——生成图像中不存在的内容。RLHF 在这里有关键价值:

  • 用大量「正确回答 vs 幻觉回答」偏好数据训练 RM
  • RL 阶段奖励模型惩罚幻觉,鼓励准确
  • 显著降低幻觉率

RLHF-VR、POPE 等基准专门评估多模态幻觉,RLHF 是改善这些指标的关键方法。

四、RLHF 的工程细节

PPO 算法简介

PPO(Proximal Policy Optimization)是 RLHF 中最常用的强化学习算法。它的核心思想:

  • 用当前策略 \pi_\text{RL} 采样回答
  • 用 RM 估计回答的价值(reward)
  • 更新策略让高 reward 回答的概率上升
  • 用截断比率(clip ratio)防止更新过大
\mathcal{L}_\text{PPO} = \mathbb{E}\left[\min\left(r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1-\epsilon, 1+\epsilon) \hat{A}_t\right)\right]

其中 r_t(\theta) = \pi_\text{RL}(y_t|x) / \pi_\text{old}(y_t|x) 是新旧策略的概率比,\hat{A}_t 是优势函数估计。

多 GPU 训练的复杂

PPO 阶段需要同时维护:

  • \pi_\text{RL}(正在训练的策略)
  • \pi_\text{SFT}(参考策略,用于 KL 约束)
  • RM(奖励模型)
  • 价值函数 critic(用于估计优势)

总共 4 个大模型,显存压力极大。当代 RLHF 训练通常需要数十张 GPU。

数据采集成本

人类偏好数据采集昂贵:

  • 每个标注需要专业判断(不能瞎标)
  • 多模态标注还需要看图,时间更长
  • 高质量标注员成本高(每小时 20-50 美元)

OpenAI、Anthropic 等公司投入大量资源采集偏好数据,这是它们的重要护城河。开源社区只能用相对小规模的数据(如 Anthropic 的 hh-rlhf 数据集)。

五、多模态 RLHF 的代表工作

LLaVA-RLHF

LLaVA 团队的 RLHF 工作,用 RLHF 减少幻觉:

  • 用事实性偏好数据训练 RM
  • PPO 优化 LLaVA 减少幻觉生成
  • 在 POPE 等基准上幻觉率显著下降

SILKIE

用 RLHF 改进医学多模态大模型,减少医疗场景的幻觉。

RLAIF-V

用 AI 反馈(而非人类反馈)做 RLHF——让 GPT-4 当「裁判」生成偏好数据:

  • 减少 human 标注成本
  • 可大规模生成
  • 缺点是继承 GPT-4 自身的偏见

mPLUG-Owl3

阿里 mPLUG-Owl 系列在多模态 RLHF 上有持续投入,特别在中文场景的对齐上有独到之处。

六、RLHF 的挑战与局限

挑战一:训练不稳定

PPO 训练容易发散,需要仔细调参:

  • 学习率必须很小
  • KL 系数 \beta 要精心调
  • 价值函数 critic 难训
  • reward hacking(模型钻 RM 空子)

挑战二:奖励黑客(Reward Hacking)

模型可能学到「钻 RM 空子」——生成长度更长、用更多专业词汇、但实际内容差的回答来骗取高分。这是 RLHF 的固有挑战。

缓解方法:

  • 长度惩罚
  • 多 RM 集成
  • 定期更新 RM

挑战三:偏好冲突

不同标注员的偏好可能冲突:

  • 标注员 A 喜欢详细回答
  • 标注员 B 喜欢简洁回答

这种冲突让 RM 学到的偏好是「平均」,可能不符合具体用户的偏好。

挑战四:成本极高

RLHF 的全流程成本极高:

  • 数据采集:数百万美元
  • 训练计算:数百 GPU·天
  • 工程实现:极复杂

只有大公司才能完整跑通 RLHF。开源社区通常用 DPO 等简化方法。

七、RLHF vs SFT:能力差异

经过 RLHF 的模型相比纯 SFT 有几个明显差异:

维度 SFT 模型 RLHF 模型
听话程度
回答质量
幻觉率 较高 较低
安全性
推理能力
多样性 中(RLHF 让回答更标准化)
训练成本 极高

RLHF 的核心价值是对齐——让模型更符合人类偏好与价值观。

八、当代多模态模型的 RLHF 实践

GPT-4V / GPT-4o(推测)

OpenAI 大概率对 GPT-4V/4o 做了大规模 RLHF,但具体细节未公开。从行为看,它:

  • 极少幻觉(RLHF 减少幻觉的效果)
  • 拒绝合理(既不过拒也不欠拒)
  • 回答风格统一(RLHF 让风格标准化)

Claude 3.5(推测)

Anthropic 在 RLHF 上有 Constitution AI 等独特方法——用 AI 自我批评代替部分人类标注。Claude 的对齐质量在闭源模型中数一数二。

Gemini(推测)

Google 用 RLHF + 多模态偏好数据训练 Gemini,对齐质量也不错。

开源模型

LLaVA 系列、Qwen-VL、InternVL 等开源模型大多只做了 SFT,RLHF 较少。这是开源与闭源能力差距的重要原因之一。MiniCPM-V 等少数开源模型尝试了轻量 RLHF,效果有提升。

九、RLHF 的未来方向

RLHF 自身也在演化:

方向一:RLAIF(AI 反馈)

用强大的 LLM(如 GPT-4)当裁判,替代部分人类标注。降低成本,规模化好。

方向二:过程奖励(PRM)

不只奖励最终回答,还奖励推理过程的每一步。适合数学、推理类任务。

方向三:多目标 RLHF

同时优化多个奖励(准确性 + 流畅性 + 安全性),用多目标优化平衡。

方向四:在线 RLHF

部署后继续收集用户反馈,持续优化。这是 ChatGPT 等产品持续进步的机制。

小结

RLHF 通过「SFT → RM → RL」三步流程,让模型按人类偏好进一步对齐。在多模态场景,RLHF 对减少幻觉、提升回答质量有关键价值,但其训练成本极高、工程复杂。闭源大模型(GPT-4o、Claude、Gemini)大量使用 RLHF,开源模型相对落后——这是当前能力差距的重要原因。

下一节(7.4)我们看 DPO——一种绕过 RM 直接优化偏好的简化方法,让小团队也能做对齐。


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U