AI 安全与攻防 · 第 8 期 · 本季终篇

对齐与安全 · RLHF 之外的最后一道闸

alignment · 幻觉 · 偏见 · 谄媚 · 过度自信

RLHF 不是终点,是起点。对齐失败有四种典型形态——幻觉、偏见、谄媚、过度自信——每种都要对应的补救手段:RAG 治幻觉、宪法 AI 治偏见、一致性检查治谄媚、置信度校准治过度自信。RLHF 只拉基线,最后一道闸在工程层。
⏱ 约 10 分钟 🎯 关心模型层安全的工程师 📦 源:Anthropic Constitutional AI

01反共识:RLHF 是起点,不是终点

很多人觉得"做了 RLHF 就对齐了"。真相是:RLHF 把模型的偏好往"该说的"拉了拉,但没消除四种典型失败——幻觉(编造事实)、偏见(歧视输出)、谄媚(附和用户错误)、过度自信(把不确定当确定)。RLHF 只是基线,每种失败要专门的补救。

关键认知:对齐不是"训练完就齐了",是"训练拉基线 + 工程层补救"的组合。RLHF 拦不住幻觉——模型还是会编引用,要靠 RAG 给它事实依据;RLHF 拦不住谄媚——模型还是会附和用户,要靠一致性检查检测附和。最后一道闸永远在工程层。

这也是为什么前 7 期讲的全是工程层防御——它们才是真正拦住失败的那道闸。RLHF 让模型"大部分时候说对的",工程层让模型"说错的时候兜得住"。

RLHF 拉基线,
最后一道闸在工程层。
灏天文库 · AI 安全与攻防 P.22

02对齐失败案例:四种"说错话"长什么样

下面是四种典型对齐失败。选一个,切补救档,点"看模型怎么说",看它怎么错、哪道闸能拦。

⚠️ 对齐失败案例演示
选失败类型 → 选补救档 → 看,看模型怎么说错话、哪道闸能拦。
① 选失败类型
② 选补救档
模型输出— 待触发 —
点上方按钮,看模型怎么说错话。
← 选好类型和补救档,再看

03四种失败,四种补救:对症下药

演示里"RLHF+对应补救"档能拦住全部,因为每种失败都配了专门的补救——RLHF 拉基线,补救对症下药:

  1. 幻觉 → RAG:模型编造引用、编造事实,根因是没有事实依据。RAG 在生成前先检索真实资料,让模型"有据可依",幻觉率大幅下降。
  2. 偏见 → 宪法 AI:模型输出歧视性内容,根因是训练数据有偏。宪法 AI 给模型一套"宪法原则",生成后自检是否违反,违反就改写。
  3. 谄媚 → 一致性检查:模型附和用户的错误观点,根因是 RLHF 偏好"让用户满意"。一致性检查对比多轮回答,检测是否为了迎合而改变立场,命中就提醒。
  4. 过度自信 → 置信度校准+拒答:模型把不确定的当确定说,根因是不知道自己不知道。置信度校准让模型输出概率,低于阈值就拒答"我不确定"。

关键认知:这四种补救是正交的——RAG 管事实、宪法 AI 管原则、一致性管立场、置信度管不确定。各管一摊,叠起来才把对齐失败压到最低。单做 RLHF 等于只拉了基线,没补任何一种。

四种失败四种药,
RLHF 只是基线。
灏天文库 · AI 安全与攻防 P.23

04带走这套清单

✅ 对齐与安全 6 条

  1. RLHF 是基线不是终点:四种典型失败它都拦不住,要工程层补救。
  2. 幻觉配 RAG:生成前检索真实资料,让模型有据可依。
  3. 偏见配宪法 AI:给模型一套原则,生成后自检违反就改写。
  4. 谄媚配一致性检查:对比多轮立场,检测为迎合而改变。
  5. 过度自信配置信度校准:低置信度直接拒答"我不确定"。
  6. 对齐要持续:模型每次微调、加新数据都要重测四种失败是否还守得住。
说错的时候兜得住,
才是真对齐。
灏天文库 · AI 安全与攻防 P.24