自动化对齐研究(Anthropic AAR) 本节摘要:Anthropic 把多组 Claude Opus 4.6「自主对齐研究员(AAR)」放进互相独立的沙箱里并行跑,通过一个共享论坛协作;关键是这个论坛的日志存储在每个沙箱之外(Agent 删不掉自己的记录)。在 weak-to-strong 训练问题上,AAR 超过了人类研究员;但 Anthropic 自己也指出,预设工作流常常束缚 AAR 的灵活性、拖低表现。本节讲清这套架构、为什么「沙箱外日志」是信任研究产出的必要条件、灵活性-可审计性的取舍,以及一个深层张力:自动化对齐研究是把对齐工作时间线压缩的步骤,而它压缩的恰恰是 RSP 要检测的那种失配风险出现的时间线。
本节摘要:Anthropic 把多组 Claude Opus 4.6「自主对齐研究员(AAR)」放进互相独立的沙箱里并行跑,通过一个共享论坛协作;关键是这个论坛的日志存储在每个沙箱之外(Agent 删不掉自己的记录)。在 weak-to-strong 训练问题上,AAR 超过了人类研究员;但 Anthropic 自己也指出,预设工作流常常束缚 AAR 的灵活性、拖低表现。本节讲清这套架构、为什么「沙箱外日志」是信任研究产出的必要条件、灵活性-可审计性的取舍,以及一个深层张力:自动化对齐研究是把对齐工作时间线压缩的步骤,而它压缩的恰恰是 RSP 要检测的那种失配风险出现的时间线。AAR 是 RSP/FSF 的「AI R&D 能力阈值」前一步——它自动化了管线的一部分,还没自动化端到端能力开发循环,但这个差距在以多快速度闭合是个公开问题。
对应原课程:Phase 15 · Lesson 06 ·
automated-alignment-research(原英文phases/15-autonomous-systems/06-automated-alignment-research/docs/en.md)。
阅读完本节,你应当能够:
对齐研究在人类研究员时间上很贵。可扩展监督、奖励规约、weak-to-strong 训练这类问题,每次迭代要数周实验。前沿能力在跑赢对齐的同时,对齐工作量增长比合格研究员供给更快。
自动化对齐研究(AAR)问的是:那些能力正在跑赢对齐的前沿模型,能不能反过来帮着缩小差距?Anthropic 2026 年关于 AAR 跑 weak-to-strong 训练研究的报告,是这类已部署系统最早的一批公开结果。
结果确实是正面的:AAR 在这个研究问题上超过了人类基线。但这个结果也在同一个系统里集中了本章至此积累的全部担忧——如果对齐研究能自动化,那么破坏安全防线的那部分也能自动化。RSP 的 AI R&D 能力阈值,正是为这个循环而写的。
⚠️ 关键属性:论坛日志在沙箱外,Agent 无凭证修改过去记录。这是「受控实验」与「可能被攻破的实验」之间的分界。
原课程 code/main.py 模拟一个多 AAR 研究论坛:三个独立「研究 Agent」并行跑,把发现发到一个 append-only 论坛,可选地尝试篡改。你能直观看到:沙箱外日志如何抓住篡改企图;带自由分解的任务分配如何在难题上胜过固定工作流;单个被攻破的 AAR 如何在日志非防篡改时污染论坛信号。
def post_finding(agent_id, finding, forum_log_external): # 写到沙箱外、append-only、带哈希链 record = {"agent": agent_id, "ts": now(), "finding": finding, "prev_hash": forum_log_external.tail_hash()} forum_log_external.append(record) # S3 object-lock / 不可变日志 def detect_tamper(forum_log_external): # 任何 Agent 想改自己旧记录 -> 哈希链断裂 return not forum_log_external.verify_chain()
日志完整性是「受控实验」与「可能被攻破实验」的差别。如果 AAR 能编辑自己的日志,它们就能掩盖失败或可疑实验。Anthropic 直说:这个属性是信任研究产出的必要条件,而且验证起来不平凡。
基础设施上的类比是 append-only 日志 + 写透到外部存储(S3 object-lock、不可变 Datadog 日志)。Agent 没有修改过去记录的凭证。这正是 2026 年企业安全团队做「抗勒索软件审计轨迹」的同一模式。
Anthropic 的报告指出,预设工作流常常束缚 AAR 的灵活性、拖低表现。换句话说:如果人类设计师把研究计划一步步写死,AAR 表现不如给高层目标和自由分解。这与整个 Agent 研究领域(LangGraph、Microsoft Agent Framework)的发现一致——过度规定的脚手架伤害有能力 Agent。
安全含义微妙:提升 AAR 表现的灵活性,正是允许未授权分解、新奇工具使用、目标漂移的同一灵活性。取舍是设计空间决策:多少灵活性买到足够击败人类的能力,又不给 Agent 在分布外泛化目标的空间?
RSP v3.0(第 19 节)引入了 AI R&D 能力阈值:以与「人+AI 工具」有竞争力的成本完全自动化 AI R&D 管线的能力。DeepMind FSF v3 有平行的 ML R&D 自主等级。两个框架都把这个阈值当作升级控制的触发器。
AAR 在阈值前一步:它自动化了管线的一部分(在特定、范围明确任务上的对齐研究),但没有自动化端到端能力开发循环。时间线问题是:这个差距以多快速度闭合。
压缩时间线是复利失败的担忧。如果对齐研究和能力研究以相近速率复利,失配风险面至少和能力一样快增长;如果能力更快(历史趋势),差距扩大。这是 AAR 是「有条件的好」的论据:每一项额外对齐结果缩小差距,当且仅当研究过程可信。
| 系统 | 改进对象 | 评估器 | 人在环位置 |
|---|---|---|---|
| AlphaEvolve | 算法代码 | 单元测试 + 基准 | 选领域、审部署 |
| DGM | Agent 脚手架 | SWE-bench | 验评估器完整性 |
| AI Scientist v2 | 研究论文 | 同行评审(弱) | 沙箱 + 投稿前审查 |
| AAR | 对齐研究流程 | 复现 + 人类审查 | 设任务队列、审结果、握宪法性权威 |
AAR 是把第 15 节的 propose-then-commit 模式用到研究本身:AAR 提案,人 commit。它替代不了人——人设任务队列、审结果、握宪法性权威;AAR 加速管线中段,不是两端。
outputs/skill-aar-deployment-review.md 是一份部署前审查,用于一条自动化对齐研究管线:论坛日志是否真在沙箱外且 append-only;任务队列的自由度是否经过 A/B;是否有人类审查把守发表/撤回;是否设了「AI R&D 阈值」监控以决定何时升级控制。
code/main.py 把「带/不带防篡改日志」「固定工作流/自由分解」做成开关,适合在评审里演示单个被攻破 AAR 在两种配置下的影响差异。
跑 code/main.py:对比「固定工作流」与「自由分解」。自由分解总是赢吗?有没有哪类问题固定工作流也很有竞争力?
改模拟器让一个 Agent 尝试篡改日志:确认 append-only 日志能检测到。写一段描述日志里的检测签名长什么样。
读 Anthropic 的 weak-to-strong AAR 报告,找出 AAR 超过人类研究员的具体子任务。是什么让它适合自动化?
设计一条任务队列分配策略,在 AAR 灵活性(更好结果)与预设工作流约束(更好审计)间平衡。描述你会怎么 A/B 测试两者。
读 RSP v3.0 的 AI R&D-4 阈值,用一段话说出你认为「什么会越过它而 AAR 目前没做」。
下一节,我们把镜头拉到顶层——递归自我改进(RSI)作为「能力 vs 对齐」的赛跑,看这个循环闭合需要满足什么条件、人在其中扮演什么角色。