Anthropic 负责任扩展策略 v3.0


文档摘要

Anthropic 负责任扩展策略 v3.0 本节摘要:RSP v3.0(Responsible Scaling Policy,负责任扩展策略)于 2026 年 2 月 24 日生效,取代 2023 年的旧版。它引入两层缓解时间表:Anthropic 将单边做的事 vs 被表述为全行业建议的事(含 RAND SL-4 安全标准);把前沿安全路线图(Frontier Safety Roadmap)与风险报告(Risk Report)提升为常设文档而非一次性交付物;删除了 2023 年的暂停承诺(pause commitment);并引入 AI R&D-4 阈值——一旦越过,Anthropic 必须发布一份肯定性论证(affirmative case),指明失对齐风险与缓解措施。

Anthropic 负责任扩展策略 v3.0

本节摘要:RSP v3.0(Responsible Scaling Policy,负责任扩展策略)于 2026 年 2 月 24 日生效,取代 2023 年的旧版。它引入两层缓解时间表:Anthropic 将单边做的事 vs 被表述为全行业建议的事(含 RAND SL-4 安全标准);把前沿安全路线图(Frontier Safety Roadmap)风险报告(Risk Report)提升为常设文档而非一次性交付物;删除了 2023 年的暂停承诺(pause commitment);并引入 AI R&D-4 阈值——一旦越过,Anthropic 必须发布一份肯定性论证(affirmative case),指明失对齐风险与缓解措施。Claude Opus 4.6 越过该阈值,但 v3.0 公告明言「自信地排除这一点正变得困难」。独立评级机构 SaferAI 给 2023 版打 2.2 分,却把 v3.0 下调到 1.9,使 Anthropic 与 OpenAI、DeepMind 一同落入「弱」RSP 类别。下调主因是定性阈值取代了定量承诺,而删除暂停条款是「最尖锐的倒退」。本节不是合规课(RSP 并无强制力),而是阅读课——以应有的具体性与怀疑精神读这份文件,因为扩展策略是前沿实验室向公众发出的、关于灾难性风险姿态的首要信号

对应原课程:Phase 15 · Lesson 19 · anthropic-rsp(原英文 phases/15-autonomous-systems/19-anthropic-rsp/docs/en.md)。前置:第 06 节(自动化对齐研究 AAR)、第 07 节(递归自我改进 RSI)。

学习目标

阅读完本节,你应当能够:

  1. 区分 RSP v3.0 的两层缓解时间表:Anthropic 单边承诺 vs 全行业建议,并指出读者必须按列核对每条承诺住在哪一栏。
  2. 解释 AI R&D-4 阈值的含义(以有竞争力的成本自动化相当一部分 AI 研究),以及为何它与第 06/07 节直接相关。
  3. 说清 Frontier Safety Roadmap(前瞻)与 Risk Report(回顾)作为常设文档的用途,以及公众如何对照两者。
  4. 复述 2023 暂停承诺被删除的来龙去脉:支持方(2023 定量阈值被 2026 基准重新定标后变得不可达)与反对方(暂停条款是承诺装置,删了就丢了可信度)。
  5. 用 SaferAI 的评分维度复现 v3.0 的 1.9 分,指出哪一行驱动了下调。
  6. 把本节定位为阅读课而非合规课:RSP 无强制力,但它是前沿实验室灾难性风险姿态的首要公开信号。

一、问题与直觉

前沿实验室发布的扩展策略,部分是技术文档,部分是治理文档,部分是给监管者的信号。RSP v3.0 是 Anthropic 的当前文档。细读它重要的不是「合规具有约束力」(并没有),而是它的框架塑造了实验室如何构想灾难性风险、如何向公众传达权衡取舍。

v3.0 vs v2.0 的 diff 是有用的分析单位。新增了:前沿安全路线图、风险报告、AI R&D-4 阈值。删除了:2023 暂停承诺。重构了:Anthropic 单边 vs 行业建议的两层缓解时间表。外部评审 SaferAI 把分数从 2.2(v2)下调到 1.9(v3.0)。这就是一份扩展策略如何在看起来更精致的同时变得更不严谨

⚠️ 核心张力:一份看起来更精致的文件,评分却更低。这提醒我们读扩展策略不能只看格式与词汇,而要按列核对承诺住在哪一栏、阈值是定量还是定性、暂停条款还在不在

两层缓解时间表

  • Anthropic 单边行动:无论其他实验室做什么,Anthropic 都会做的事。阈值之上停训、特定安全措施、特定部署闸门。
  • 全行业建议:Anthropic 认为整个行业应该集体做的事,含 RAND SL-4 安全标准。这些不是 Anthropic 的承诺,而是政策倡导

两层结构在 v2 里没有。这意味着读者必须按列核对每条承诺住在哪栏。「全行业建议」栏里的安全措施不是 Anthropic 的承诺,而是 Anthropic 的希望

AI R&D-4 阈值

这是 RSP v3.0 命名的下一个重要阈值:一个能以有竞争力的成本自动化相当一部分 AI 研究的模型。一旦 Anthropic 认为某个模型越过了它,就必须在继续扩展前发布一份肯定性论证,指明失对齐风险与缓解措施。

按 v3.0 公告,Claude Opus 4.6 越过它。但文件补充:「自信地排除这一点正变得困难。」这个措辞要紧——它承认阈值近到是个活的关切,而非推测性的极限

第 06 节(自动化对齐研究)与第 07 节(递归自我改进)直接喂给这个阈值。自动化对齐研究者跨过研究质量门槛,正是 AI R&D-4 阈值正在逼近的证据。

前沿安全路线图与风险报告

v3.0 把两类产物提升为常设文档:

  • 前沿安全路线图:前瞻文档,描述计划中的安全工作、能力预期与缓解研究。
  • 风险报告:回顾文档,针对特定模型发布后,描述观测到的能力与残余风险。

两者都公开,都按声明的节奏更新。用处是:读者可以追踪——Anthropic 在路线图里说要做的,与在风险报告里报告的,二者如何对照。

删除暂停条款

2023 RSP 含一条显式暂停承诺:若模型越过特定能力阈值,训练暂停,直到缓解措施就位。v3.0 把显式暂停替换成较软的表述(发布肯定性论证,若缓解充分则继续)。SaferAI 等分析者直接指出这是新文件里最强的倒退

变更的政策论据:2023 的定量阈值到 2026 年代的能力基准下变得不可达,因为基准本身被重新定标了。反论:扩展策略里的暂停条款是承诺装置(commitment device);删掉它就丢了策略的可信度。

SaferAI 的下调

SaferAI 是给 RSP 类文件打分的独立机构。其公开评级:2023 Anthropic RSP 得 2.2(量表里 4.0 是当前最佳 RSP,1.0 是名义级);v3.0 得 1.9。这把 Anthropic 从「中等」挪到「弱」,与 OpenAI、DeepMind 一同落入弱类。

下调因素(按 SaferAI):

  • 定性阈值取代了定量阈值。
  • 暂停承诺被删除。
  • AI R&D-4 阈值的缓解被描述为「肯定性论证」而非具体措施。
  • 评审机制依赖 Anthropic 的安全咨询组(Safety Advisory Group),独立监督有限。

本节不是什么

这不是合规课。RSP v3.0 不是法规;没有什么强制 Anthropic 遵守它。本节是以应有的具体性与怀疑精神读这份文档的课。扩展策略是前沿实验室发出的、关于灾难性风险姿态的首要公开信号。读好它们,对任何工作依赖前沿能力的人,都是一项实用技能。

二、从零实现:RSP 阈值决策引擎

原课程 code/main.py 实现一个小决策引擎,镜像 RSP 的阈值评估形状:给定候选模型与一组能力测量,返回是否越过 AI R&D-4 阈值、所需的肯定性论证章节、部署能否继续。它故意简单——目的是把文档的逻辑显式化。下面给出关键骨架。

阈值评估:把文档逻辑变成可执行规则

def evaluate_rd_d4(model, measurements): """AI R&D-4: 能否以有竞争力的成本自动化相当一部分 AI 研究。""" # measurements: 自动化 AI 研究任务的成本/质量/覆盖率 competitive = measurements["cost_vs_human"] <= 1.0 # 成本不高于人类 substantial = measurements["research_fraction"] >= 0.5 # 覆盖相当一部分 quality = measurements["output_quality"] >= "peer_review_pass" if competitive and substantial and quality: return { "crosses_AI_RD_4": True, "required": affirmative_case_template(), # 必须先发布肯定性论证 "may_deploy": False, # 缓解充分前不得继续扩展 } return {"crosses_AI_RD_4": False, "may_deploy": True, "note": "未越过, 但 'confidently ruling this out is becoming difficult'"}

肯定性论证模板

def affirmative_case_template(): """越过阈值后, 继续扩展前必须公开发布的论证。""" return { "misalignment_risks_identified": [...], # 指明的失对齐风险 "mitigations_evaluated": [...], # 评估过的缓解 "residual_risk": ..., # 残余风险 "safety_advisory_group_review": ..., # SAG 评审(独立监督有限) }

两层承诺核对:按列归类

COMMITMENTS = [ ("阈值之上停训", "unilateral"), # Anthropic 单边 ("RAND SL-4 安全标准", "industry"), # 全行业建议(希望, 非承诺) ("特定部署闸门", "unilateral"), ("特定安全措施", "unilateral"), ] def what_anthropic_promises(commitment): """读者必须按列核对: 'industry' 栏不是承诺。""" return commitment[1] == "unilateral"

设计要点:这台引擎的价值不在「预测 Anthropic 会怎么做」,而在把文档的逻辑摊开——让读者看清哪些是真承诺(unilateral)、哪些是希望(industry)、哪些阈值被定性化了、暂停条款删了之后还剩什么承诺装置。

三、框架对比:RSP v3.0 的内部张力

维度 2023 版(v2) 2026 版(v3.0) 方向
阈值类型 定量承诺 定性阈值 ↓ 更难审计
暂停条款 显式「越过即停训」 删除, 改「肯定性论证+缓解充分则继续」 ↓ 最尖锐倒退
缓解时间表 单层 两层(单边 vs 行业) ↕ 需按列核对
常设文档 一次性交付 路线图+风险报告常设 ↑ 更可追踪
新阈值 (无 AI R&D-4) AI R&D-4(研究自动化) ↑ 命名下一道闸
SaferAI 评分 2.2(中等) 1.9(弱) ↓ 与 OpenAI/DeepMind 同类

关键观察:v3.0 在文档治理(常设文档、两层透明度)上进步,却在承诺强度(定性化、删暂停)上退步。净效果是 SaferAI 下调。这正说明:评估一份扩展策略不能数它的章节数,而要数它还剩多少「硬承诺」

⚠️ 两层时间表是双刃剑。它让 Anthropic 能区分「我会做的」与「我希望行业做的」,客观上更诚实;但也让读者容易把「行业建议」误读成「Anthropic 承诺」。按列核对是唯一的防御。

四、可复用产物

原课程 outputs/skill-scaling-policy-review.md 对照 v3.0 参考样审阅一份扩展策略(Anthropic、OpenAI、DeepMind 或内部策略),检查:两层结构、阈值(定量/定性)、暂停承诺(在/不在)、独立评审(强制/可选)。它把「定位关心的能力 → 分类(触发缓解/仅监控)→ 查更新节奏 → 查独立监督」串成可重复清单。

code/main.py 是零依赖决策引擎,改 measurements 阈值即可贴不同策略;阈值评估、肯定性论证模板、两层归类逻辑均无需改动。

五、练习

  1. code/main.py:喂入三个不同能力水平的合成模型,确认阈值评估器行为正确、产出正确的肯定性论证模板。

  2. 通读 RSP v3.0 全文(32 页):找出每一条住在「全行业建议」层的承诺。其中哪些在 v2 里本会是「Anthropic 单边」?

  3. 读 SaferAI 的 RSP 评分方法学:用它的评分表套到文档上,复现 v3.0 的 1.9 分。哪一行评分驱动了下调最多?

  4. 设计替代暂停条款:2023 暂停承诺被删了。提出一个既保住策略可信度、又承认 2026 基准重新定标问题的替代承诺。

  5. 跨策略对比:把 RSP v3.0 与 OpenAI Preparedness Framework v2(第 20 节)对比。挑一个 v3.0 更强的地方,挑一个 Preparedness Framework 更强的地方。

本节要点回顾

  1. RSP v3.0 于 2026-02-24 生效:部分技术、部分治理、部分给监管者的信号——细读重要,因为它是灾难性风险姿态的首要公开信号。
  2. 两层缓解时间表:Anthropic 单边(承诺)vs 全行业建议(希望/倡导)——读者必须按列核对, 别把希望读成承诺。
  3. AI R&D-4 阈值:以有竞争力的成本自动化相当一部分 AI 研究;越过即须先发肯定性论证;Opus 4.6 未越过, 但「自信排除正变困难」。
  4. 常设文档:前沿安全路线图(前瞻)+ 风险报告(回顾), 公开、按节奏更新, 公众可对照「说的 vs 报的」。
  5. 暂停条款被删是「最尖锐倒退」:2023 显式停训 → v3.0 肯定性论证+缓解充分则继续;承诺装置被移除。
  6. SaferAI 从 2.2 下调到 1.9:定性取代定量、暂停删除、缓解是「论证」非措施、独立监督有限——Anthropic 落入「弱」类。
  7. 本节是阅读课不是合规课:RSP 无强制力, 但读好它(具体性+怀疑精神)是依赖前沿能力者的实用技能。
  8. 评估策略要数「硬承诺」而非章节数:v3.0 文档治理进步、承诺强度退步, 净效果下调。

下一节,我们读另外两家前沿实验室的同类文件——OpenAI Preparedness Framework v2 与 DeepMind Frontier Safety Framework v3,看三家如何在「该不该给模型设闸」上收敛(都追踪长程自主性、都承认欺骗行为)又分歧(OpenAI 的 Tracked vs Research 之分、DeepMind 把自主性折进 ML R&D/Cyber 域)。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U