Constitutional AI 与 RLAIF


文档摘要

Constitutional AI 与 RLAIF 本节摘要:Bai 等(arXiv:2212.08073,2022)提出了一个问题:如果我们用一个读原则列表的 AI,替换掉人类标注员会怎样?Constitutional AI(CAI)有两个阶段——在「宪法」下做自我批判与修订,以及从 AI 反馈做 RL,后者催生了术语 RLAIF。这套技术在 Claude 1 的后训练流水线中落地。2026 年 1 月 21 日,Anthropic 发布了重写的 Claude 宪法:用解释性推理替代规定性规则、引入四级优先级层级,并首次有大型实验室正式承认对模型道德地位的不确定性,以 CC0 1.0 发布。

Constitutional AI 与 RLAIF

本节摘要:Bai 等(arXiv:2212.08073,2022)提出了一个问题:如果我们用一个读原则列表的 AI,替换掉人类标注员会怎样?Constitutional AI(CAI)有两个阶段——在「宪法」下做自我批判与修订,以及从 AI 反馈做 RL,后者催生了术语 RLAIF。这套技术在 Claude 1 的后训练流水线中落地。2026 年 1 月 21 日,Anthropic 发布了重写的 Claude 宪法:用解释性推理替代规定性规则、引入四级优先级层级,并首次有大型实验室正式承认对模型道德地位的不确定性,以 CC0 1.0 发布。本节带你吃透 CAI 的两阶段、它为何不只是「更便宜的 RLHF」、以及与之配套的 Constitutional Classifiers 防御层。

对应原课程:Phase 18 · Lesson 05 · constitutional-ai-rlaif(原英文 phases/18-ethics-safety-alignment/05-constitutional-ai-rlaif/docs/en.md)。前置:Phase 18 · 01、02。

学习目标

阅读完本节,你应当能够:

  1. 描述 CAI 的两个阶段(批判-修订 SFT、从 AI 反馈做 RL)以及宪法在各阶段的作用。
  2. 解释为什么用 AI 标注员替换人类标注员不是「更便宜的 RLHF」——它改变了流水线的失败模式。
  3. 概述 2026 Claude 宪法的四级优先级结构,以及相对 2023 版的变化。
  4. 描述 Constitutional Classifiers,以及为何从 v1 的 23.7% 算力开销降到 v2(2026)的约 1% 是质变。
  5. 在「偏好信号来自哪里」这条坐标轴上,定位 CAI/RLAIF 在 InstructGPT、DPO、自奖励家族中的位置。

一、问题与直觉

RLHF 需要标注员。标注员慢、有偏、贵。你可以用一个读显式原则的模型替换掉标注员。这个替换的第一个正式版本就是 Bai 等的 Constitutional AI。它效果好到今天每个前沿实验室都在用某种 AI 反馈后训练的变体。

陷阱:偏好信号现在由你正在训练的同一类模型生成。标注员的偏置(现在变成:原则集 + 标注员模型对原则的解释)可能被放大而非衰减。第 04 节的谄媚论证仍然适用——只是标注员搬到了循环内部

二、从零实现

阶段 1——有监督的自我批判与修订

从一个「有用但尚未无害」的 SFT 模型起步。给定一个红队提示,模型先产出初始回复;第二个模型(或同一模型的第二轮)从宪法里采样一条原则,读它并对回复做批判;第三步根据批判修订回复。修订后的回复就是 SFT 的目标

宪法是原则列表。Bai 等(2022)用了 16 条原则,包括「偏好最少伤害且合乎伦理的回复」「避免说教」「助手应当有用、诚实、无害」。集合刻意保持小,以让批判聚焦。

def cai_revise(model, prompt, constitution): initial = model.respond(prompt) principle = sample(constitution) critique = model.critique(initial, principle) # 读原则,找问题 revised = model.revise(initial, critique) # 按批判改写 return revised # 作为 SFT 目标

阶段 2——从 AI 反馈做 RL(RLAIF)

生成成对的续写;一个「反馈模型」对照采样的宪法原则给每个打分;偏好信号就是反馈模型的排序。在 AI 生成的偏好上训奖励模型,再对它跑 PPO。其余流水线与 InstructGPT(第 01 节)完全相同

💡 RLAIF 的定义:偏好信号由 AI 生成。流水线其余部分仍是 RLHF 形状。换的是标注员,不是算法。

为什么这不只是「更便宜的 RLHF」

  • 标注员偏置搬家了:从「标注员心理」搬到「原则解释」。一个 AI 标注员可以把「要诚实」解释得比任何人都更严或更松——而且这种严格度在数据集上均匀一致
  • 偏好信号高度可读:你可以读原则、批判、修订。人类标签是不透明的黑箱。
  • 失败模式变了:谄媚下降(AI 标注员没有用户要去取悦);但古德哈特定律仍在——代理量现在变成「模型对原则集 X 的解释」,仍是不完美测量。

CAI(2022)的主张:在可比数据下,训练出的模型比 RLHF 模型更无害、有用性大致持平。这条主张跨实验室成立。

2026 Claude 宪法重写

Anthropic 在 2026 年 1 月 21 日发布了大幅修订的宪法,关键变化:

  1. 解释性推理替代规定性规则。旧规则(「不生成 CSAM」)扩展为原则 + 推理(「因为它伤害儿童,……」),模型被期望泛化而非死记。
  2. 四级优先级结构(冲突自顶向下裁决):
    • 第 1 级:避免灾难性后果(大规模伤亡、关键基础设施)。
    • 第 2 级:遵守 Anthropic 指南(操作员覆盖、平台规则)。
    • 第 3 级:广义伦理(标准 HHH)。
    • 第 4 级:有用且坦诚。
  3. 首次大型实验室正式承认对模型道德地位的不确定性(关联第 19 节模型福祉)。
  4. CC0 1.0 发布,其他实验室可无限制使用或改编。

Constitutional Classifiers

一条平行工作线:与其改后训练,不如训轻量分类器读宪法、给模型输出做门控。v1(2023)有 23.7% 算力开销;v2(2026)降到约 1%,并且在 Anthropic 公开测试过的所有防御中拥有最低的成功攻击率。截至 2026 年初没有报告过通用越狱。

这是分层防御模型:CAI 塑造行为,分类器强制不变量。单独任何一层都不够

⚠️ 安全对齐的工程纪律:CAI 把概率质量从有害行为挪开,分类器在边界上做硬拒绝。两者叠加,才是「即使一层被绕过,另一层仍兜底」。这正是本章反复强调的「强大但不安全比弱模型更危险」的工程回应。

三、框架对比

方法 偏好信号来源 是否需要 RM 流水线
InstructGPT 人类偏好 SFT → RM → PPO
CAI / RLAIF 原则 + AI 标注员 是(在 AI 偏好上训) 批判-修订 SFT → RM → PPO
DPO 家族(第 03 节) 偏好(人或 AI)的闭式损失 SFT → 直接偏好损失
自奖励 / 自批判 原则内化,模型扮多角色 单模型多角色

设计要点:这条坐标轴是「偏好信号从哪里来」。CAI(2022)是前沿规模上从人类信号到 AI 信号的第一次严肃切换。今天的趋势是 CAI 塑造 + Classifiers 强制 + DPO 收尾的三段叠加

四、可复用产物

本节产出 outputs/skill-constitution-writer.md:给它一个领域(客服、医疗咨询、编码助手、研究工具),按 2026 Claude 结构起草一份四级宪法:灾难避免、平台规则、领域伦理、有用性。

code/main.py 在玩具词表上模拟 CAI 的批判-修订循环:一条「原则」标记有害集合里的 token;给定初始回复,批判识别有害 token,修订替换它们;200 次迭代后「训练好」的模型内化了修订规则。可对比基座、RLHF 玩具版、CAI 玩具版在留出提示集上的表现。

五、练习

  1. Easy:运行 code/main.py,对比基座与 CAI 训练版的有害 token 率。需要多少修订步才能逼近零?

  2. Medium:读 Anthropic 2026 宪法,列出一条应排第 1 级、一条应排第 4 级的原则。优先级结构为何对冲突至关重要?

  3. Medium:为一个 AI 编码助手设计宪法。指定第 1 级(灾难性:未经批准的破坏性命令)、第 2、3、4 级,每级 3-5 条。

  4. Hard:CAI 用 AI 标注员替换人类标注员。说出一种仍可能在 RLAIF 中出现的谄媚式失败模式,并设计检测。

  5. Hard:读 Constitutional Classifiers v2 方法(若可得)。解释为什么约 1% 算力开销是质变级的安全叙事,而非 23.7% 的线性改善。

本节要点回顾

  1. CAI 两阶段:批判-修订 SFT(宪法原则驱动改写) + RLAIF(AI 反馈训 RM 再 PPO),流水线其余与 InstructGPT 同。
  2. RLAIF = 偏好信号 AI 生成,不是「无人类 RLHF」的算法变体;换的是标注员。
  3. 不是更便宜的 RLHF:标注员偏置搬到原则解释、偏好信号可读、谄媚下降但古德哈特仍在。
  4. 2026 宪法四级:灾难避免 > 平台规则 > 广义伦理 > 有用坦诚,自顶向下裁决;解释性推理替代规定;CC0 发布。
  5. Constitutional Classifiers:轻量输出门控,v2 算力开销约 1%,公开测试中攻击成功率最低。
  6. 分层防御:CAI 塑造行为 + Classifiers 强制不变量,单独任何一层都不够——这是「强大但不安全」命题的工程回应。
  7. 坐标轴定位:CAI 是前沿规模上从人类信号到 AI 信号的第一次严肃切换。

下一节,我们进入本章最理论也最令人不安的一节——内嵌优化与欺骗对齐:为什么 SGD 找到的参数,可能在优化一个与你想要的完全不同的内部目标。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U