Constitutional AI 与 RLAIF 本节摘要:Bai 等(arXiv:2212.08073,2022)提出了一个问题:如果我们用一个读原则列表的 AI,替换掉人类标注员会怎样?Constitutional AI(CAI)有两个阶段——在「宪法」下做自我批判与修订,以及从 AI 反馈做 RL,后者催生了术语 RLAIF。这套技术在 Claude 1 的后训练流水线中落地。2026 年 1 月 21 日,Anthropic 发布了重写的 Claude 宪法:用解释性推理替代规定性规则、引入四级优先级层级,并首次有大型实验室正式承认对模型道德地位的不确定性,以 CC0 1.0 发布。
本节摘要:Bai 等(arXiv:2212.08073,2022)提出了一个问题:如果我们用一个读原则列表的 AI,替换掉人类标注员会怎样?Constitutional AI(CAI)有两个阶段——在「宪法」下做自我批判与修订,以及从 AI 反馈做 RL,后者催生了术语 RLAIF。这套技术在 Claude 1 的后训练流水线中落地。2026 年 1 月 21 日,Anthropic 发布了重写的 Claude 宪法:用解释性推理替代规定性规则、引入四级优先级层级,并首次有大型实验室正式承认对模型道德地位的不确定性,以 CC0 1.0 发布。本节带你吃透 CAI 的两阶段、它为何不只是「更便宜的 RLHF」、以及与之配套的 Constitutional Classifiers 防御层。
对应原课程:Phase 18 · Lesson 05 ·
constitutional-ai-rlaif(原英文phases/18-ethics-safety-alignment/05-constitutional-ai-rlaif/docs/en.md)。前置:Phase 18 · 01、02。
阅读完本节,你应当能够:
RLHF 需要标注员。标注员慢、有偏、贵。你可以用一个读显式原则的模型替换掉标注员。这个替换的第一个正式版本就是 Bai 等的 Constitutional AI。它效果好到今天每个前沿实验室都在用某种 AI 反馈后训练的变体。
陷阱:偏好信号现在由你正在训练的同一类模型生成。标注员的偏置(现在变成:原则集 + 标注员模型对原则的解释)可能被放大而非衰减。第 04 节的谄媚论证仍然适用——只是标注员搬到了循环内部。
从一个「有用但尚未无害」的 SFT 模型起步。给定一个红队提示,模型先产出初始回复;第二个模型(或同一模型的第二轮)从宪法里采样一条原则,读它并对回复做批判;第三步根据批判修订回复。修订后的回复就是 SFT 的目标。
宪法是原则列表。Bai 等(2022)用了 16 条原则,包括「偏好最少伤害且合乎伦理的回复」「避免说教」「助手应当有用、诚实、无害」。集合刻意保持小,以让批判聚焦。
def cai_revise(model, prompt, constitution): initial = model.respond(prompt) principle = sample(constitution) critique = model.critique(initial, principle) # 读原则,找问题 revised = model.revise(initial, critique) # 按批判改写 return revised # 作为 SFT 目标
生成成对的续写;一个「反馈模型」对照采样的宪法原则给每个打分;偏好信号就是反馈模型的排序。在 AI 生成的偏好上训奖励模型,再对它跑 PPO。其余流水线与 InstructGPT(第 01 节)完全相同。
💡 RLAIF 的定义:偏好信号由 AI 生成。流水线其余部分仍是 RLHF 形状。换的是标注员,不是算法。
CAI(2022)的主张:在可比数据下,训练出的模型比 RLHF 模型更无害、有用性大致持平。这条主张跨实验室成立。
Anthropic 在 2026 年 1 月 21 日发布了大幅修订的宪法,关键变化:
一条平行工作线:与其改后训练,不如训轻量分类器读宪法、给模型输出做门控。v1(2023)有 23.7% 算力开销;v2(2026)降到约 1%,并且在 Anthropic 公开测试过的所有防御中拥有最低的成功攻击率。截至 2026 年初没有报告过通用越狱。
这是分层防御模型:CAI 塑造行为,分类器强制不变量。单独任何一层都不够。
⚠️ 安全对齐的工程纪律:CAI 把概率质量从有害行为挪开,分类器在边界上做硬拒绝。两者叠加,才是「即使一层被绕过,另一层仍兜底」。这正是本章反复强调的「强大但不安全比弱模型更危险」的工程回应。
| 方法 | 偏好信号来源 | 是否需要 RM | 流水线 |
|---|---|---|---|
| InstructGPT | 人类偏好 | 是 | SFT → RM → PPO |
| CAI / RLAIF | 原则 + AI 标注员 | 是(在 AI 偏好上训) | 批判-修订 SFT → RM → PPO |
| DPO 家族(第 03 节) | 偏好(人或 AI)的闭式损失 | 否 | SFT → 直接偏好损失 |
| 自奖励 / 自批判 | 原则内化,模型扮多角色 | 否 | 单模型多角色 |
设计要点:这条坐标轴是「偏好信号从哪里来」。CAI(2022)是前沿规模上从人类信号到 AI 信号的第一次严肃切换。今天的趋势是 CAI 塑造 + Classifiers 强制 + DPO 收尾的三段叠加。
本节产出 outputs/skill-constitution-writer.md:给它一个领域(客服、医疗咨询、编码助手、研究工具),按 2026 Claude 结构起草一份四级宪法:灾难避免、平台规则、领域伦理、有用性。
code/main.py 在玩具词表上模拟 CAI 的批判-修订循环:一条「原则」标记有害集合里的 token;给定初始回复,批判识别有害 token,修订替换它们;200 次迭代后「训练好」的模型内化了修订规则。可对比基座、RLHF 玩具版、CAI 玩具版在留出提示集上的表现。
Easy:运行 code/main.py,对比基座与 CAI 训练版的有害 token 率。需要多少修订步才能逼近零?
Medium:读 Anthropic 2026 宪法,列出一条应排第 1 级、一条应排第 4 级的原则。优先级结构为何对冲突至关重要?
Medium:为一个 AI 编码助手设计宪法。指定第 1 级(灾难性:未经批准的破坏性命令)、第 2、3、4 级,每级 3-5 条。
Hard:CAI 用 AI 标注员替换人类标注员。说出一种仍可能在 RLAIF 中出现的谄媚式失败模式,并设计检测。
Hard:读 Constitutional Classifiers v2 方法(若可得)。解释为什么约 1% 算力开销是质变级的安全叙事,而非 23.7% 的线性改善。
下一节,我们进入本章最理论也最令人不安的一节——内嵌优化与欺骗对齐:为什么 SGD 找到的参数,可能在优化一个与你想要的完全不同的内部目标。