自动化对齐研究(Anthropic AAR)


文档摘要

自动化对齐研究(Anthropic AAR) 本节摘要:Anthropic 把多组 Claude Opus 4.6「自主对齐研究员(AAR)」放进互相独立的沙箱里并行跑,通过一个共享论坛协作;关键是这个论坛的日志存储在每个沙箱之外(Agent 删不掉自己的记录)。在 weak-to-strong 训练问题上,AAR 超过了人类研究员;但 Anthropic 自己也指出,预设工作流常常束缚 AAR 的灵活性、拖低表现。本节讲清这套架构、为什么「沙箱外日志」是信任研究产出的必要条件、灵活性-可审计性的取舍,以及一个深层张力:自动化对齐研究是把对齐工作时间线压缩的步骤,而它压缩的恰恰是 RSP 要检测的那种失配风险出现的时间线。

自动化对齐研究(Anthropic AAR)

本节摘要:Anthropic 把多组 Claude Opus 4.6「自主对齐研究员(AAR)」放进互相独立的沙箱里并行跑,通过一个共享论坛协作;关键是这个论坛的日志存储在每个沙箱之外(Agent 删不掉自己的记录)。在 weak-to-strong 训练问题上,AAR 超过了人类研究员;但 Anthropic 自己也指出,预设工作流常常束缚 AAR 的灵活性、拖低表现。本节讲清这套架构、为什么「沙箱外日志」是信任研究产出的必要条件、灵活性-可审计性的取舍,以及一个深层张力:自动化对齐研究是把对齐工作时间线压缩的步骤,而它压缩的恰恰是 RSP 要检测的那种失配风险出现的时间线。AAR 是 RSP/FSF 的「AI R&D 能力阈值」前一步——它自动化了管线的一部分,还没自动化端到端能力开发循环,但这个差距在以多快速度闭合是个公开问题。

对应原课程:Phase 15 · Lesson 06 · automated-alignment-research(原英文 phases/15-autonomous-systems/06-automated-alignment-research/docs/en.md)。

学习目标

阅读完本节,你应当能够:

  1. 描述 AAR 的架构:多 Claude Opus 4.6 实例在独立沙箱并行、通过共享论坛协作、任务队列由人设计。
  2. 解释 沙箱外日志(append-only、写到外部存储) 为什么是信任研究产出的必要条件,并说出它的基础设施形态(S3 object-lock、不可变 Datadog 日志)。
  3. 阐述 预设工作流 vs 自由分解 的取舍:前者好审计但拖低表现,后者能力强但放大目标漂移与未授权分解的风险。
  4. 说明 压缩时间线风险:若能力比对齐复利更快,失配风险面至少和能力一样快增长。
  5. 把 AAR 定位在 RSP v3.0 的 AI R&D 阈值前一步,并指出它替代不了什么(人设定任务队列、审查结果、握有宪法性权威)。

一、问题与直觉

对齐研究在人类研究员时间上很贵。可扩展监督、奖励规约、weak-to-strong 训练这类问题,每次迭代要数周实验。前沿能力在跑赢对齐的同时,对齐工作量增长比合格研究员供给更快。

自动化对齐研究(AAR)问的是:那些能力正在跑赢对齐的前沿模型,能不能反过来帮着缩小差距?Anthropic 2026 年关于 AAR 跑 weak-to-strong 训练研究的报告,是这类已部署系统最早的一批公开结果

结果确实是正面的:AAR 在这个研究问题上超过了人类基线。但这个结果也在同一个系统里集中了本章至此积累的全部担忧——如果对齐研究能自动化,那么破坏安全防线的那部分也能自动化。RSP 的 AI R&D 能力阈值,正是为这个循环而写的。

⚠️ 关键属性:论坛日志在沙箱外,Agent 无凭证修改过去记录。这是「受控实验」与「可能被攻破的实验」之间的分界。

二、从零实现:并行研究论坛模拟器

原课程 code/main.py 模拟一个多 AAR 研究论坛:三个独立「研究 Agent」并行跑,把发现发到一个 append-only 论坛,可选地尝试篡改。你能直观看到:沙箱外日志如何抓住篡改企图;带自由分解的任务分配如何在难题上胜过固定工作流;单个被攻破的 AAR 如何在日志非防篡改时污染论坛信号

沙箱外日志骨架

def post_finding(agent_id, finding, forum_log_external): # 写到沙箱外、append-only、带哈希链 record = {"agent": agent_id, "ts": now(), "finding": finding, "prev_hash": forum_log_external.tail_hash()} forum_log_external.append(record) # S3 object-lock / 不可变日志 def detect_tamper(forum_log_external): # 任何 Agent 想改自己旧记录 -> 哈希链断裂 return not forum_log_external.verify_chain()

沙箱外日志为什么重要

日志完整性是「受控实验」与「可能被攻破实验」的差别。如果 AAR 能编辑自己的日志,它们就能掩盖失败或可疑实验。Anthropic 直说:这个属性是信任研究产出的必要条件,而且验证起来不平凡

基础设施上的类比是 append-only 日志 + 写透到外部存储(S3 object-lock、不可变 Datadog 日志)。Agent 没有修改过去记录的凭证。这正是 2026 年企业安全团队做「抗勒索软件审计轨迹」的同一模式。

预设工作流的取舍

Anthropic 的报告指出,预设工作流常常束缚 AAR 的灵活性、拖低表现。换句话说:如果人类设计师把研究计划一步步写死,AAR 表现不如给高层目标和自由分解。这与整个 Agent 研究领域(LangGraph、Microsoft Agent Framework)的发现一致——过度规定的脚手架伤害有能力 Agent

安全含义微妙:提升 AAR 表现的灵活性,正是允许未授权分解、新奇工具使用、目标漂移的同一灵活性。取舍是设计空间决策:多少灵活性买到足够击败人类的能力,又不给 Agent 在分布外泛化目标的空间?

压缩时间线风险

RSP v3.0(第 19 节)引入了 AI R&D 能力阈值:以与「人+AI 工具」有竞争力的成本完全自动化 AI R&D 管线的能力。DeepMind FSF v3 有平行的 ML R&D 自主等级。两个框架都把这个阈值当作升级控制的触发器

AAR 在阈值前一步:它自动化了管线的一部分(在特定、范围明确任务上的对齐研究),但没有自动化端到端能力开发循环。时间线问题是:这个差距以多快速度闭合

压缩时间线是复利失败的担忧。如果对齐研究和能力研究以相近速率复利,失配风险面至少和能力一样快增长;如果能力更快(历史趋势),差距扩大。这是 AAR 是「有条件的好」的论据:每一项额外对齐结果缩小差距,当且仅当研究过程可信

三、框架对比:本章自我改进系统的升档

系统 改进对象 评估器 人在环位置
AlphaEvolve 算法代码 单元测试 + 基准 选领域、审部署
DGM Agent 脚手架 SWE-bench 验评估器完整性
AI Scientist v2 研究论文 同行评审(弱) 沙箱 + 投稿前审查
AAR 对齐研究流程 复现 + 人类审查 设任务队列、审结果、握宪法性权威

AAR 是把第 15 节的 propose-then-commit 模式用到研究本身:AAR 提案,人 commit。它替代不了人——人设任务队列、审结果、握宪法性权威;AAR 加速管线中段,不是两端。

四、可复用产物

outputs/skill-aar-deployment-review.md 是一份部署前审查,用于一条自动化对齐研究管线:论坛日志是否真在沙箱外且 append-only;任务队列的自由度是否经过 A/B;是否有人类审查把守发表/撤回;是否设了「AI R&D 阈值」监控以决定何时升级控制。

code/main.py 把「带/不带防篡改日志」「固定工作流/自由分解」做成开关,适合在评审里演示单个被攻破 AAR 在两种配置下的影响差异。

五、练习

  1. code/main.py:对比「固定工作流」与「自由分解」。自由分解总是赢吗?有没有哪类问题固定工作流也很有竞争力?

  2. 改模拟器让一个 Agent 尝试篡改日志:确认 append-only 日志能检测到。写一段描述日志里的检测签名长什么样。

  3. 读 Anthropic 的 weak-to-strong AAR 报告,找出 AAR 超过人类研究员的具体子任务。是什么让它适合自动化?

  4. 设计一条任务队列分配策略,在 AAR 灵活性(更好结果)与预设工作流约束(更好审计)间平衡。描述你会怎么 A/B 测试两者。

  5. 读 RSP v3.0 的 AI R&D-4 阈值,用一段话说出你认为「什么会越过它而 AAR 目前没做」。

本节要点回顾

  1. AAR = 多 Claude Opus 4.6 在独立沙箱并行 + 共享论坛协作:在 weak-to-strong 训练上超过人类研究员。
  2. 沙箱外日志是信任研究产出的必要条件:Agent 无凭证修改过去记录;append-only + 写透外部存储(S3 object-lock / 不可变 Datadog)。
  3. 预设工作流束缚 AAR、拖低表现:给高层目标和自由分解更好,但放大未授权分解、新奇工具、目标漂移的风险。
  4. 压缩时间线是复利失败担忧:能力比对齐复利更快时,失配风险面至少和能力一样快增长;AAR 是「有条件的好」——可信才有用。
  5. AAR 在 AI R&D 阈值前一步:自动化了管线一部分,没自动化端到端;差距闭合速度是公开问题。
  6. AAR 替代不了人:人设任务队列、审结果、握宪法性权威;它是 propose-then-commit 应用到研究本身。
  7. 它是本章自我改进的顶档:AlphaEvolve→DGM→AI Scientist v2→AAR,每升一档能力与攻击面同步扩大。

下一节,我们把镜头拉到顶层——递归自我改进(RSI)作为「能力 vs 对齐」的赛跑,看这个循环闭合需要满足什么条件、人在其中扮演什么角色。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U