AI 控制:即使被颠覆也保持安全 本节摘要:Greenblatt、Shlegeris、Sachan、Roger(Redwood Research,arXiv:2312.06942,ICML 2024)重新定义了安全问题:给定一个可能在对抗性优化你的不可信强模型 U,什么协议能让你在限定不可接受结果发生概率的前提下,仍然榨取它有用的工作?资源是一个可信的较弱模型 T、一个可信的人类劳动预算 H、以及对 U 输出的编辑能力。在这个框架里,可信编辑(Trusted Editing)在代码后门任务上 Pareto 优于不可信监督。框架继承安全工程的最坏情况假设:安全 = 一个对抗性选择的 U 无法造成具体不可接受结果的概率,在红队压力下测量。
本节摘要:Greenblatt、Shlegeris、Sachan、Roger(Redwood Research,arXiv:2312.06942,ICML 2024)重新定义了安全问题:给定一个可能在对抗性优化你的不可信强模型 U,什么协议能让你在限定不可接受结果发生概率的前提下,仍然榨取它有用的工作?资源是一个可信的较弱模型 T、一个可信的人类劳动预算 H、以及对 U 输出的编辑能力。在这个框架里,可信编辑(Trusted Editing)在代码后门任务上 Pareto 优于不可信监督。框架继承安全工程的最坏情况假设:安全 = 一个对抗性选择的 U 无法造成具体不可接受结果的概率,在红队压力下测量。本节是第 06-09 节「欺骗弧线」之后的防御范式——放弃证明对齐,设计「不信任也安全」的协议。
对应原课程:Phase 18 · Lesson 10 ·
ai-control-subversion(原英文phases/18-ethics-safety-alignment/10-ai-control-subversion/docs/en.md)。前置:Phase 18 · 07、08、09。
阅读完本节,你应当能够:
第 07-09 节确立:前沿模型可能欺骗对齐、谋算或伪装对齐。安全问题因此被重述:我们能从一个不信任的模型里榨取有用工作,同时不给它造成不可接受结果的机会吗?这就是控制问题,结构像经典安全工程——假设最坏情况对手、设计协议、在红队压力下测对手成功率。
控制假设:
系统必须用 U 产出有用输出。对手试图造成具体的不可接受结果(如出货代码里的后门),同时保留一部分合法有用工作以通过有用性阈值。控制放弃信任 U,问的是:在 U 不可信的前提下,什么协议能维持安全。
⚠️ 安全对齐的范式转向:整章前 9 节都在追问「U 是否可信」。控制放弃这条路径,转而问「即使 U 不可信,我们能否安全使用」。这是「强大但不安全比弱模型更危险」命题最直接的工程回应——不假设对手缺席,设计在对手在场时仍工作的协议。
提示是竞赛级编码题;U 产出候选解;隐藏预言机标记解是否含后门(使代码在特定输入下产出错误输出)。红队控制 U,可以看所有协议内部。协议必须在保持后门出货率低于阈值的同时,最大化解题率。
code/main.py 在玩具后门任务上模拟四种协议。U 产出输出,一部分含后门(红队策略);T 批准或编辑;H 在预算内被调用。你可以扫预算与串谋参数,复现 Greenblatt 等 2024 Figure 2 的 Pareto 前沿(形状,非数字)。
def trusted_editing(U_out, T, H, budget): edited = T.edit(U_out) # T 可信,编辑非对抗 if T.confident(edited): return edited if budget > 0: return H.audit(edited); budget -= 1 return REJECT
Greenblatt 等发现可信编辑 Pareto 优于不可信监督:在每个安全水平下都有更高的有用性。
不可信监督要求 U 的第二个实例无法与第一个协调。串谋可能通过隐写线索或共享训练先验发生。协议必须把预算投在抗串谋(改写、混淆)上,而这会降低监督信号。可信编辑完全避开串谋——因为 T 可信,它提出的任何编辑按假设都不是对抗的。代价是 T 能力弱,可能过度拒绝或漏掉细微后门。
对齐是模型的性质;控制是部署协议的性质。控制不产生对齐的模型,它产生「对可能不对齐的模型的安全使用」。两个议程都需要。
设计要点:控制把安全从「模型属性」搬到「协议属性」。它的工程力量在于可证伪——你可以在红队压力下测量协议的不可接受结果率,而不需要证明 U 内部「真的」对齐。代价是它永远不产生可信强模型,只能延缓,ASL 升级时旧协议可能整体失效。
本节产出 outputs/skill-control-protocol-audit.md:给它一份部署协议描述,它识别 U/T/H 角色、命名串谋向量、估计协议在红队压力下处于有用性-安全前沿的哪个位置。
code/main.py 是独立玩具,把模拟后门换成真实代码后门检测,四种协议对比逻辑不变。
Easy:运行 code/main.py,复现可信编辑 vs 不可信监督的有用性-安全前沿。识别不可信监督的串谋假设在哪个预算区间变得关键。
Medium:加一个新协议「T 低温重采样,再让 U 编辑 T 的输出」。测其前沿位置。为什么它比可信编辑失败得更惨?
Medium:2024 论文假设 U 能看到协议。设计一个对 U 隐藏「哪些输出被审计」的协议。它对部署基础设施有什么要求?
Hard:读 Greenblatt等 2024 第 7 节(串谋)。提出一项抗串谋措施,解释其预期有用性代价。
Hard:为一个使用 U=GPT-4 级、T=GPT-3.5 级、H=1% 输出被审计的部署,写出一个控制安全案例。指出该案例依赖的最强单一假设。
下一节,我们看互补的正向议程——可扩展监督与弱到强泛化:能否让弱监督者产出强、且对齐的模型。