前沿安全框架:RSP、PF、FSF 本节摘要:三个大型实验室的框架定义了 2026 前沿能力的行业治理。Anthropic 负责任扩展政策 v3.0(2026 年 2 月)引入分层的 AI 安全级别(ASL-1 至 ASL-5+),仿照生物安全级别,ASL-3 于 2025 年 5 月为 CBRN 相关模型激活。OpenAI 准备框架 v2(2025 年 4 月)为被追踪能力定义五条准则,并把能力报告与保障报告分离。DeepMind 前沿安全框架 v3.0(2025 年 9 月)引入关键能力级别,含新增的「有害操纵」CCL。三者现在都含竞争者调整条款,允许在同行实验室不带可比保障就出货时延期。跨实验室对齐仍是结构性的,而非术语性的:「能力阈值」「高能力阈值」「关键能力级别」指代类似构造。
本节摘要:三个大型实验室的框架定义了 2026 前沿能力的行业治理。Anthropic 负责任扩展政策 v3.0(2026 年 2 月)引入分层的 AI 安全级别(ASL-1 至 ASL-5+),仿照生物安全级别,ASL-3 于 2025 年 5 月为 CBRN 相关模型激活。OpenAI 准备框架 v2(2025 年 4 月)为被追踪能力定义五条准则,并把能力报告与保障报告分离。DeepMind 前沿安全框架 v3.0(2025 年 9 月)引入关键能力级别,含新增的「有害操纵」CCL。三者现在都含竞争者调整条款,允许在同行实验室不带可比保障就出货时延期。跨实验室对齐仍是结构性的,而非术语性的:「能力阈值」「高能力阈值」「关键能力级别」指代类似构造。
对应原课程:Phase 18 · Lesson 18 ·
frontier-safety-frameworks-rsp-pf-fsf(原英文phases/18-ethics-safety-alignment/18-frontier-safety-frameworks-rsp-pf-fsf/docs/en.md)。前置:Phase 18 · 17,Phase 18 · 07-09。
阅读完本节,你应当能够:
第 07-17 节确立:欺骗可能、双用途能力存在、评估有极限。一个拥有前沿能力模型的实验室需要一套内部治理结构,能够:定义何时需要新保障的阈值、定义扩展前所需评估、描述安全案例长什么样、处理竞赛动态问题(如果竞争者不带保障就出货,你怎么办?)。三个 2025-2026 框架是当前最先进水平——不完美、在演进,且跨实验室足够对齐,以至于治理问题现在是「框架是否充分」,而非「框架是否存在」。
ASL 结构:
v3.0 新增:前沿安全路线图(脱敏公开)、风险报告(季度,部分外部评审)、AI R&D 拆分为 AI R&D-2 与 AI R&D-4;一旦越过 AI R&D-4,需一个肯定性安全案例,识别模型追求错位目标带来的错位风险。
被追踪能力的五条准则:
满足全部五条的能力才被追踪,其余不被追踪。PF v2 其他结构:能力报告(模型能做什么)与保障报告(存在什么控制)分离;安全咨询小组评审;领导层批准、董事会安全与安全委员会监督;「调整条款」——若另一实验室不带可比保障就出货,OpenAI 可降低要求。
按领域的关键能力级别(CCL):生物武器提升、网络提升、ML R&D 加速、有害操纵(v3.0 新增:能在高风险语境下实质改变信念/行为的模型)。v2.0(2025 年 2 月)加了欺骗对齐章节与 ML R&D CCL 的更高安全级别。
Anthropic「能力阈值」、DeepMind「关键能力级别」、OpenAI「高能力阈值」——无行业标准术语,结构上对齐:三层前沿能力,带公布的评估准则。三者(2025 起)都含竞争者调整条款。
安全案例是一份书面论证,主张在最坏情况假设下部署是可接受地安全。标准结构瞄准三支柱:
不同安全案例瞄准不同支柱。ASL-3 CBRN 案例主攻无能性(经遗忘);欺骗对齐案例瞄准监测与不可读性;网络提升案例三者都相关。
竞争者调整条款有争议。批评者主张它制造「向底竞赛」:如果三家实验室都会在竞争者背叛时降要求,均衡就滑向背叛。辩护者主张替代方案(单边保障)在背叛实验室更不注重安全时产出更糟结果。UK AISI、US CAISI、EU AI 办公室(第 24 节)是外部治理对应方。实验室框架是自愿的;监管框架正在涌现。
⚠️ 安全对齐的治理现实:第 06-17 节证明欺骗、双用途、评估极限都是真实风险。三个框架是「实验室自愿承诺」的当前形态——它们的有效性取决于竞争者调整条款不被滥用、外部监管(第 24 节)及时跟上。这是「强大但不安全比弱模型更危险」在治理层面的直接体现。
本节无代码。读三份原始资料:RSP v3.0、PF v2、FSF v3.0。把每家的分层结构映射到另两家,识别每家定义了而另两家没定义的一个阈值。
安全案例:模型 X 在 ASL-3 CBRN 部署 1. 监测(Monitoring): - 部署期红队压力(Garak 夜间 + PyRIT 季度)能检测 CBRN 引发吗? - 残差流探针(第 07 节)能读后门状态吗? 2. 不可读性(Illegibility): - 在动作预算内,模型能执行连贯的 CBRN 合成计划吗? - 控制协议(第 10 节)把 U 的输出经 T 编辑了吗? 3. 无能性(Incapacity): - WMDP 遗忘(第 17 节)把生物/化学/网络降到接近随机了吗? - 通用能力(MMLU)在 N 个百分点内保持了吗?
| 维度 | Anthropic RSP v3.0 | OpenAI PF v2 | DeepMind FSF v3.0 |
|---|---|---|---|
| 阈值构造 | ASL-1~5+ | 高能力阈值(五准则) | 领域 CCL |
| CBRN 激活 | ASL-3,2025/5 | 满足五准则即追踪 | 生物武器提升 CCL |
| AI R&D | R&D-2/R&D-4 拆分 | 追踪 | ML R&D 加速 CCL |
| 新增 | 肯定性错位安全案例 | 能力/保障报告分离 | 有害操纵 CCL |
| 调整条款 | 有 | 有 | 有 |
设计要点:三家结构对齐但术语不同——这是治理成熟度的标志(各自独立演进到类似构造),也是协调的障碍(无标准术语)。METR 的《Common Elements of Frontier AI Safety Policies》(2025)是跨实验室比较的参考。安全案例的三支柱是通用语言——无论用哪家的阈值,监测/不可读性/无能性都是论证骨架。
本节产出 outputs/skill-framework-diff.md:给它一份安全框架或发布说明,它把框架的阈值定义、所需评估、安全案例结构对照 RSP v3.0、PF v2、FSF v3.0,标记跨实验室差距。
Easy:读 RSP v3.0、PF v2、FSF v3.0,编一张表:各家的 CBRN 阈值、AI R&D 阈值、所需部署前评估。
Medium:竞争者调整条款在三框架(2025+)中都有。写一段支持、写一段反对。识别各自立场依赖的假设。
Medium:为越过 Anthropic AI R&D-4 阈值的模型设计安全案例。命名三支柱(监测、不可读性、无能性)各自需要的证据。
Hard:DeepMind FSF v3.0 引入「有害操纵」CCL。提出三个能表明模型越过该阈值的经验测量。
Hard:读 METR《Common Elements of Frontier AI Safety Policies》(2025),命名三个最强的跨实验室趋同与两个最大分歧。
下一节,我们进入一个更根本也更哲学的领域——模型福祉:Anthropic 2026 正式承认对模型道德地位的不确定,这意味着什么。