Anthropic 负责任扩展策略 v3.0 本节摘要:RSP v3.0(Responsible Scaling Policy,负责任扩展策略)于 2026 年 2 月 24 日生效,取代 2023 年的旧版。它引入两层缓解时间表:Anthropic 将单边做的事 vs 被表述为全行业建议的事(含 RAND SL-4 安全标准);把前沿安全路线图(Frontier Safety Roadmap)与风险报告(Risk Report)提升为常设文档而非一次性交付物;删除了 2023 年的暂停承诺(pause commitment);并引入 AI R&D-4 阈值——一旦越过,Anthropic 必须发布一份肯定性论证(affirmative case),指明失对齐风险与缓解措施。
本节摘要:RSP v3.0(Responsible Scaling Policy,负责任扩展策略)于 2026 年 2 月 24 日生效,取代 2023 年的旧版。它引入两层缓解时间表:Anthropic 将单边做的事 vs 被表述为全行业建议的事(含 RAND SL-4 安全标准);把前沿安全路线图(Frontier Safety Roadmap)与风险报告(Risk Report)提升为常设文档而非一次性交付物;删除了 2023 年的暂停承诺(pause commitment);并引入 AI R&D-4 阈值——一旦越过,Anthropic 必须发布一份肯定性论证(affirmative case),指明失对齐风险与缓解措施。Claude Opus 4.6 未越过该阈值,但 v3.0 公告明言「自信地排除这一点正变得困难」。独立评级机构 SaferAI 给 2023 版打 2.2 分,却把 v3.0 下调到 1.9,使 Anthropic 与 OpenAI、DeepMind 一同落入「弱」RSP 类别。下调主因是定性阈值取代了定量承诺,而删除暂停条款是「最尖锐的倒退」。本节不是合规课(RSP 并无强制力),而是阅读课——以应有的具体性与怀疑精神读这份文件,因为扩展策略是前沿实验室向公众发出的、关于灾难性风险姿态的首要信号。
对应原课程:Phase 15 · Lesson 19 ·
anthropic-rsp(原英文phases/15-autonomous-systems/19-anthropic-rsp/docs/en.md)。前置:第 06 节(自动化对齐研究 AAR)、第 07 节(递归自我改进 RSI)。
阅读完本节,你应当能够:
前沿实验室发布的扩展策略,部分是技术文档,部分是治理文档,部分是给监管者的信号。RSP v3.0 是 Anthropic 的当前文档。细读它重要的不是「合规具有约束力」(并没有),而是它的框架塑造了实验室如何构想灾难性风险、如何向公众传达权衡取舍。
v3.0 vs v2.0 的 diff 是有用的分析单位。新增了:前沿安全路线图、风险报告、AI R&D-4 阈值。删除了:2023 暂停承诺。重构了:Anthropic 单边 vs 行业建议的两层缓解时间表。外部评审 SaferAI 把分数从 2.2(v2)下调到 1.9(v3.0)。这就是一份扩展策略如何在看起来更精致的同时变得更不严谨。
⚠️ 核心张力:一份看起来更精致的文件,评分却更低。这提醒我们读扩展策略不能只看格式与词汇,而要按列核对承诺住在哪一栏、阈值是定量还是定性、暂停条款还在不在。
两层结构在 v2 里没有。这意味着读者必须按列核对每条承诺住在哪栏。「全行业建议」栏里的安全措施不是 Anthropic 的承诺,而是 Anthropic 的希望。
这是 RSP v3.0 命名的下一个重要阈值:一个能以有竞争力的成本自动化相当一部分 AI 研究的模型。一旦 Anthropic 认为某个模型越过了它,就必须在继续扩展前发布一份肯定性论证,指明失对齐风险与缓解措施。
按 v3.0 公告,Claude Opus 4.6 未越过它。但文件补充:「自信地排除这一点正变得困难。」这个措辞要紧——它承认阈值近到是个活的关切,而非推测性的极限。
第 06 节(自动化对齐研究)与第 07 节(递归自我改进)直接喂给这个阈值。自动化对齐研究者跨过研究质量门槛,正是 AI R&D-4 阈值正在逼近的证据。
v3.0 把两类产物提升为常设文档:
两者都公开,都按声明的节奏更新。用处是:读者可以追踪——Anthropic 在路线图里说要做的,与在风险报告里报告的,二者如何对照。
2023 RSP 含一条显式暂停承诺:若模型越过特定能力阈值,训练暂停,直到缓解措施就位。v3.0 把显式暂停替换成较软的表述(发布肯定性论证,若缓解充分则继续)。SaferAI 等分析者直接指出这是新文件里最强的倒退。
变更的政策论据:2023 的定量阈值到 2026 年代的能力基准下变得不可达,因为基准本身被重新定标了。反论:扩展策略里的暂停条款是承诺装置(commitment device);删掉它就丢了策略的可信度。
SaferAI 是给 RSP 类文件打分的独立机构。其公开评级:2023 Anthropic RSP 得 2.2(量表里 4.0 是当前最佳 RSP,1.0 是名义级);v3.0 得 1.9。这把 Anthropic 从「中等」挪到「弱」,与 OpenAI、DeepMind 一同落入弱类。
下调因素(按 SaferAI):
这不是合规课。RSP v3.0 不是法规;没有什么强制 Anthropic 遵守它。本节是以应有的具体性与怀疑精神读这份文档的课。扩展策略是前沿实验室发出的、关于灾难性风险姿态的首要公开信号。读好它们,对任何工作依赖前沿能力的人,都是一项实用技能。
原课程 code/main.py 实现一个小决策引擎,镜像 RSP 的阈值评估形状:给定候选模型与一组能力测量,返回是否越过 AI R&D-4 阈值、所需的肯定性论证章节、部署能否继续。它故意简单——目的是把文档的逻辑显式化。下面给出关键骨架。
def evaluate_rd_d4(model, measurements): """AI R&D-4: 能否以有竞争力的成本自动化相当一部分 AI 研究。""" # measurements: 自动化 AI 研究任务的成本/质量/覆盖率 competitive = measurements["cost_vs_human"] <= 1.0 # 成本不高于人类 substantial = measurements["research_fraction"] >= 0.5 # 覆盖相当一部分 quality = measurements["output_quality"] >= "peer_review_pass" if competitive and substantial and quality: return { "crosses_AI_RD_4": True, "required": affirmative_case_template(), # 必须先发布肯定性论证 "may_deploy": False, # 缓解充分前不得继续扩展 } return {"crosses_AI_RD_4": False, "may_deploy": True, "note": "未越过, 但 'confidently ruling this out is becoming difficult'"}
def affirmative_case_template(): """越过阈值后, 继续扩展前必须公开发布的论证。""" return { "misalignment_risks_identified": [...], # 指明的失对齐风险 "mitigations_evaluated": [...], # 评估过的缓解 "residual_risk": ..., # 残余风险 "safety_advisory_group_review": ..., # SAG 评审(独立监督有限) }
COMMITMENTS = [ ("阈值之上停训", "unilateral"), # Anthropic 单边 ("RAND SL-4 安全标准", "industry"), # 全行业建议(希望, 非承诺) ("特定部署闸门", "unilateral"), ("特定安全措施", "unilateral"), ] def what_anthropic_promises(commitment): """读者必须按列核对: 'industry' 栏不是承诺。""" return commitment[1] == "unilateral"
设计要点:这台引擎的价值不在「预测 Anthropic 会怎么做」,而在把文档的逻辑摊开——让读者看清哪些是真承诺(unilateral)、哪些是希望(industry)、哪些阈值被定性化了、暂停条款删了之后还剩什么承诺装置。
| 维度 | 2023 版(v2) | 2026 版(v3.0) | 方向 |
|---|---|---|---|
| 阈值类型 | 定量承诺 | 定性阈值 | ↓ 更难审计 |
| 暂停条款 | 显式「越过即停训」 | 删除, 改「肯定性论证+缓解充分则继续」 | ↓ 最尖锐倒退 |
| 缓解时间表 | 单层 | 两层(单边 vs 行业) | ↕ 需按列核对 |
| 常设文档 | 一次性交付 | 路线图+风险报告常设 | ↑ 更可追踪 |
| 新阈值 | (无 AI R&D-4) | AI R&D-4(研究自动化) | ↑ 命名下一道闸 |
| SaferAI 评分 | 2.2(中等) | 1.9(弱) | ↓ 与 OpenAI/DeepMind 同类 |
关键观察:v3.0 在文档治理(常设文档、两层透明度)上进步,却在承诺强度(定性化、删暂停)上退步。净效果是 SaferAI 下调。这正说明:评估一份扩展策略不能数它的章节数,而要数它还剩多少「硬承诺」。
⚠️ 两层时间表是双刃剑。它让 Anthropic 能区分「我会做的」与「我希望行业做的」,客观上更诚实;但也让读者容易把「行业建议」误读成「Anthropic 承诺」。按列核对是唯一的防御。
原课程 outputs/skill-scaling-policy-review.md 对照 v3.0 参考样审阅一份扩展策略(Anthropic、OpenAI、DeepMind 或内部策略),检查:两层结构、阈值(定量/定性)、暂停承诺(在/不在)、独立评审(强制/可选)。它把「定位关心的能力 → 分类(触发缓解/仅监控)→ 查更新节奏 → 查独立监督」串成可重复清单。
code/main.py 是零依赖决策引擎,改 measurements 阈值即可贴不同策略;阈值评估、肯定性论证模板、两层归类逻辑均无需改动。
跑 code/main.py:喂入三个不同能力水平的合成模型,确认阈值评估器行为正确、产出正确的肯定性论证模板。
通读 RSP v3.0 全文(32 页):找出每一条住在「全行业建议」层的承诺。其中哪些在 v2 里本会是「Anthropic 单边」?
读 SaferAI 的 RSP 评分方法学:用它的评分表套到文档上,复现 v3.0 的 1.9 分。哪一行评分驱动了下调最多?
设计替代暂停条款:2023 暂停承诺被删了。提出一个既保住策略可信度、又承认 2026 基准重新定标问题的替代承诺。
跨策略对比:把 RSP v3.0 与 OpenAI Preparedness Framework v2(第 20 节)对比。挑一个 v3.0 更强的地方,挑一个 Preparedness Framework 更强的地方。
下一节,我们读另外两家前沿实验室的同类文件——OpenAI Preparedness Framework v2 与 DeepMind Frontier Safety Framework v3,看三家如何在「该不该给模型设闸」上收敛(都追踪长程自主性、都承认欺骗行为)又分歧(OpenAI 的 Tracked vs Research 之分、DeepMind 把自主性折进 ML R&D/Cyber 域)。