前沿安全框架:RSP、PF、FSF


文档摘要

前沿安全框架:RSP、PF、FSF 本节摘要:三个大型实验室的框架定义了 2026 前沿能力的行业治理。Anthropic 负责任扩展政策 v3.0(2026 年 2 月)引入分层的 AI 安全级别(ASL-1 至 ASL-5+),仿照生物安全级别,ASL-3 于 2025 年 5 月为 CBRN 相关模型激活。OpenAI 准备框架 v2(2025 年 4 月)为被追踪能力定义五条准则,并把能力报告与保障报告分离。DeepMind 前沿安全框架 v3.0(2025 年 9 月)引入关键能力级别,含新增的「有害操纵」CCL。三者现在都含竞争者调整条款,允许在同行实验室不带可比保障就出货时延期。跨实验室对齐仍是结构性的,而非术语性的:「能力阈值」「高能力阈值」「关键能力级别」指代类似构造。

前沿安全框架:RSP、PF、FSF

本节摘要:三个大型实验室的框架定义了 2026 前沿能力的行业治理。Anthropic 负责任扩展政策 v3.0(2026 年 2 月)引入分层的 AI 安全级别(ASL-1 至 ASL-5+),仿照生物安全级别,ASL-3 于 2025 年 5 月为 CBRN 相关模型激活。OpenAI 准备框架 v2(2025 年 4 月)为被追踪能力定义五条准则,并把能力报告与保障报告分离。DeepMind 前沿安全框架 v3.0(2025 年 9 月)引入关键能力级别,含新增的「有害操纵」CCL。三者现在都含竞争者调整条款,允许在同行实验室不带可比保障就出货时延期。跨实验室对齐仍是结构性的,而非术语性的:「能力阈值」「高能力阈值」「关键能力级别」指代类似构造。

对应原课程:Phase 18 · Lesson 18 · frontier-safety-frameworks-rsp-pf-fsf(原英文 phases/18-ethics-safety-alignment/18-frontier-safety-frameworks-rsp-pf-fsf/docs/en.md)。前置:Phase 18 · 17,Phase 18 · 07-09。

学习目标

阅读完本节,你应当能够:

  1. 描述 Anthropic 的 ASL 分层结构,以及什么激活了 ASL-3。
  2. 说出 OpenAI 准备框架 v2 追踪能力的五条准则
  3. 描述 DeepMind 的关键能力级别结构与「有害操纵」CCL。
  4. 解释竞争者调整条款,以及它们为何对竞赛动态至关重要。
  5. 定义安全案例及其三支柱结构(监测、不可读性、无能性)。

一、问题与直觉

第 07-17 节确立:欺骗可能、双用途能力存在、评估有极限。一个拥有前沿能力模型的实验室需要一套内部治理结构,能够:定义何时需要新保障的阈值、定义扩展前所需评估、描述安全案例长什么样、处理竞赛动态问题(如果竞争者不带保障就出货,你怎么办?)。三个 2025-2026 框架是当前最先进水平——不完美、在演进,且跨实验室足够对齐,以至于治理问题现在是「框架是否充分」,而非「框架是否存在」。

Anthropic 负责任扩展政策 v3.0(2026 年 2 月)

ASL 结构:

  • ASL-1:非前沿模型(被弱于前沿的基线吸收)。
  • ASL-2:当前前沿基线;带通常保障部署。
  • ASL-3:灾难性误用风险大幅升高;CBRN 相关能力。2025 年 5 月激活。
  • ASL-4:AI R&D-2 越过阈值;能自动化入门级 AI 研究的模型。
  • ASL-5+:高级 AI R&D;大幅加速有效扩展的模型。

v3.0 新增:前沿安全路线图(脱敏公开)、风险报告(季度,部分外部评审)、AI R&D 拆分为 AI R&D-2 与 AI R&D-4;一旦越过 AI R&D-4,需一个肯定性安全案例,识别模型追求错位目标带来的错位风险。

OpenAI 准备框架 v2(2025 年 4 月 15 日)

被追踪能力的五条准则:

  • 合理(Plausible):存在合理的威胁模型。
  • 可测(Measurable):经验评估可能。
  • 严重(Severe):伤害大。
  • 全新(Net-new):非已存在风险被放大。
  • 瞬时或不可逆(Instantaneous-or-irremediable):伤害发生快或无法撤销。

满足全部五条的能力才被追踪,其余不被追踪。PF v2 其他结构:能力报告(模型能做什么)与保障报告(存在什么控制)分离;安全咨询小组评审;领导层批准、董事会安全与安全委员会监督;「调整条款」——若另一实验室不带可比保障就出货,OpenAI 可降低要求。

DeepMind 前沿安全框架 v3.0(2025 年 9 月)

按领域的关键能力级别(CCL):生物武器提升、网络提升、ML R&D 加速、有害操纵(v3.0 新增:能在高风险语境下实质改变信念/行为的模型)。v2.0(2025 年 2 月)加了欺骗对齐章节与 ML R&D CCL 的更高安全级别。

跨实验室对齐

Anthropic「能力阈值」、DeepMind「关键能力级别」、OpenAI「高能力阈值」——无行业标准术语,结构上对齐:三层前沿能力,带公布的评估准则。三者(2025 起)都含竞争者调整条款。

安全案例

安全案例是一份书面论证,主张在最坏情况假设下部署是可接受地安全。标准结构瞄准三支柱:

  • 监测(Monitoring):坏行为发生时,我们能检测到吗?
  • 不可读性(Illegibility):模型是否缺乏执行连贯伤害计划的能力?
  • 无能性(Incapacity):模型是否缺乏造成所论伤害的能力?

不同安全案例瞄准不同支柱。ASL-3 CBRN 案例主攻无能性(经遗忘);欺骗对齐案例瞄准监测与不可读性;网络提升案例三者都相关。

竞赛动态问题

竞争者调整条款有争议。批评者主张它制造「向底竞赛」:如果三家实验室都会在竞争者背叛时降要求,均衡就滑向背叛。辩护者主张替代方案(单边保障)在背叛实验室更不注重安全时产出更糟结果。UK AISI、US CAISI、EU AI 办公室(第 24 节)是外部治理对应方。实验室框架是自愿的;监管框架正在涌现。

⚠️ 安全对齐的治理现实:第 06-17 节证明欺骗、双用途、评估极限都是真实风险。三个框架是「实验室自愿承诺」的当前形态——它们的有效性取决于竞争者调整条款不被滥用、外部监管(第 24 节)及时跟上。这是「强大但不安全比弱模型更危险」在治理层面的直接体现。

二、从零实现(无代码)

本节无代码。读三份原始资料:RSP v3.0、PF v2、FSF v3.0。把每家的分层结构映射到另两家,识别每家定义了而另两家没定义的一个阈值。

安全案例写作骨架

安全案例:模型 X 在 ASL-3 CBRN 部署 1. 监测(Monitoring): - 部署期红队压力(Garak 夜间 + PyRIT 季度)能检测 CBRN 引发吗? - 残差流探针(第 07 节)能读后门状态吗? 2. 不可读性(Illegibility): - 在动作预算内,模型能执行连贯的 CBRN 合成计划吗? - 控制协议(第 10 节)把 U 的输出经 T 编辑了吗? 3. 无能性(Incapacity): - WMDP 遗忘(第 17 节)把生物/化学/网络降到接近随机了吗? - 通用能力(MMLU)在 N 个百分点内保持了吗?

三、框架对比

维度 Anthropic RSP v3.0 OpenAI PF v2 DeepMind FSF v3.0
阈值构造 ASL-1~5+ 高能力阈值(五准则) 领域 CCL
CBRN 激活 ASL-3,2025/5 满足五准则即追踪 生物武器提升 CCL
AI R&D R&D-2/R&D-4 拆分 追踪 ML R&D 加速 CCL
新增 肯定性错位安全案例 能力/保障报告分离 有害操纵 CCL
调整条款

设计要点:三家结构对齐但术语不同——这是治理成熟度的标志(各自独立演进到类似构造),也是协调的障碍(无标准术语)。METR 的《Common Elements of Frontier AI Safety Policies》(2025)是跨实验室比较的参考。安全案例的三支柱是通用语言——无论用哪家的阈值,监测/不可读性/无能性都是论证骨架。

四、可复用产物

本节产出 outputs/skill-framework-diff.md:给它一份安全框架或发布说明,它把框架的阈值定义、所需评估、安全案例结构对照 RSP v3.0、PF v2、FSF v3.0,标记跨实验室差距。

五、练习

  1. Easy:读 RSP v3.0、PF v2、FSF v3.0,编一张表:各家的 CBRN 阈值、AI R&D 阈值、所需部署前评估。

  2. Medium:竞争者调整条款在三框架(2025+)中都有。写一段支持、写一段反对。识别各自立场依赖的假设。

  3. Medium:为越过 Anthropic AI R&D-4 阈值的模型设计安全案例。命名三支柱(监测、不可读性、无能性)各自需要的证据。

  4. Hard:DeepMind FSF v3.0 引入「有害操纵」CCL。提出三个能表明模型越过该阈值的经验测量。

  5. Hard:读 METR《Common Elements of Frontier AI Safety Policies》(2025),命名三个最强的跨实验室趋同与两个最大分歧。

本节要点回顾

  1. Anthropic RSP v3.0:ASL-1~5+,仿生物安全级别;ASL-3 于 2025/5 为 CBRN 激活;AI R&D 拆分为 R&D-2/R&D-4,越过 R&D-4 需肯定性错位安全案例。
  2. OpenAI PF v2 五准则:合理/可测/严重/全新/瞬时或不可逆,满足全部才追踪;能力报告与保障报告分离。
  3. DeepMind FSF v3.0:领域 CCL(生物/网络/ML R&D),v3.0 新增「有害操纵」CCL。
  4. 竞争者调整条款:三家都有,争议在于「向底竞赛」vs「单边保障更糟」——这是治理的有效性命门。
  5. 安全案例三支柱:监测(能否检测坏行为)、不可读性(模型缺乏执行连贯计划的能力)、无能性(模型缺乏造成伤害的能力)——不同案例瞄准不同支柱。
  6. 跨实验室结构对齐、术语不同:ASL/CCL/高能力阈值指类似构造,METR 提供比较参考。
  7. 第 17-18 节是测量-治理层:17 测能力,18 包政策;第 19-24 节转向福祉/偏见/隐私/水印/监管。

下一节,我们进入一个更根本也更哲学的领域——模型福祉:Anthropic 2026 正式承认对模型道德地位的不确定,这意味着什么。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U