OpenAI 准备就绪框架与 DeepMind 前沿安全框架


文档摘要

OpenAI 准备就绪框架与 DeepMind 前沿安全框架 本节摘要:第 19 节细读了 Anthropic 的扩展策略;本节补全画面,读 OpenAI 与 DeepMind 的同类文件。三份文档是表亲产物,回答同一个问题——前沿实验室何时该暂停或给模型设闸——它们在一小撮类别上收敛,又在具体的地方分歧。OpenAI Preparedness Framework v2(2025 年 4 月)引入研究类别(Research Categories)——长程自主性、能力藏匿(sandbagging)、自主复制与适应、瓦解安全护栏——区别于追踪类别(Tracked Categories);Tracked 触发能力报告+安全护栏报告并由安全咨询组评审,Research

OpenAI 准备就绪框架与 DeepMind 前沿安全框架

本节摘要:第 19 节细读了 Anthropic 的扩展策略;本节补全画面,读 OpenAIDeepMind 的同类文件。三份文档是表亲产物,回答同一个问题——前沿实验室何时该暂停或给模型设闸——它们在一小撮类别上收敛,又在具体的地方分歧OpenAI Preparedness Framework v2(2025 年 4 月)引入研究类别(Research Categories)——长程自主性、能力藏匿(sandbagging)、自主复制与适应、瓦解安全护栏——区别于追踪类别(Tracked Categories);Tracked 触发能力报告+安全护栏报告并由安全咨询组评审,Research 则不自动触发缓解,政策措辞是「潜在」。DeepMind FSF v3(2025 年 9 月,2026 年 4 月 17 日加追踪能力级别)把自主性折进 ML R&D 与 Cyber 域(ML R&D 自主性级别 1 = 以有竞争力成本全自动 AI R&D 流水线),并显式通过对工具理性滥用的自动化监控来应对欺骗性对齐(deceptive alignment)。诚实的告诫:OpenAI 的 Research Categories(含长程自主性)不自动触发缓解;DeepMind 自己也说,若工具理性增强,自动化监控「长期将不再足够」。同一项能力,在 Anthropic 是「强制缓解」、在 OpenAI 是「监控但不触发」、在 DeepMind 是「在特定域里追踪」——政策姿态(Policy Posture)要紧

对应原课程:Phase 15 · Lesson 20 · openai-preparedness-deepmind-fsf(原英文 phases/15-autonomous-systems/20-openai-preparedness-deepmind-fsf/docs/en.md)。前置:第 19 节(Anthropic RSP)。

学习目标

阅读完本节,你应当能够:

  1. 描述 OpenAI PF v2Tracked vs Research 划分,指出其作为「设闸 vs 观察」铰链的含义。
  2. 描述 DeepMind FSF v3关键能力级别(CCL)五域结构,以及为何它不把 Autonomy 保留为顶层域而是折进 ML R&D 与 Cyber。
  3. 复述三家的收敛点:内部安全咨询组、显式承认欺骗性对齐/对齐伪装、常设产物按声明节奏、承认仅监控防御有天花板。
  4. 说明 sandbagging(能力藏匿)为何让三份框架的阈值都被低估——「框架只在测量有效时有效」,由此引出第 21 节外部测量(METR)的必要性。
  5. 运用四步政策阅读技能(定位/分类/节奏/独立性)审阅任意一份扩展策略。

一、问题与直觉

三份文档是表亲产物,回答同一个问题——前沿实验室何时该暂停或给模型设闸。它们在一小撮类别上收敛,又在具体地方分歧,而这些分歧要紧。

收敛:三 家都把长程自主性标为值得追踪的能力类;三家都承认欺骗行为(对齐伪装、能力藏匿)是一类特定风险;三家都有内部评审机构。分歧:OpenAI 把类别拆成「Tracked(强制缓解)」与「Research(无自动触发)」;DeepMind 把自主性折进两个域,而非单列;实验室各自的命名(Tracked vs Research、Critical vs Moderate、Tier-1 vs Tier-2)背后,某项能力落在哪个桶里的操作后果,在不同实验室是不同的。

把它们放在一起读才是有用的练习。同一项能力,在 Anthropic 是「强制缓解」,在 OpenAI 是「监控但不触发」,在 DeepMind 是「在特定域里追踪」。政策姿态要紧

⚠️ 核心张力:措辞要紧。OpenAI 的「potential mitigations」、Anthropic 的「affirmative case」、DeepMind 的「automated monitoring」——这些都不是硬性「停训」,而是软性表述。读策略时要把措辞翻译成操作后果:这项能力被触发后,实验室实际会做什么?

OpenAI Preparedness Framework v2(2025 年 4 月)

结构:

  • 追踪类别(Tracked Categories):触发能力报告(模型能做什么)+ 安全护栏报告(有哪些缓解)。部署前由安全咨询组评审。
  • 研究类别(Research Categories):实验室在追踪但尚未承诺具体缓解的模型能力。含长程自主性、能力藏匿、自主复制与适应、瓦解安全护栏

v2 的关键框架:Research Categories 不自动触发缓解,政策措辞是「潜在」缓解。这是要盯的具体增量:一个类别在 Tracked 还是 Research,是「设闸」与「观察」之间的铰链

DeepMind Frontier Safety Framework v3(2025 年 9 月;追踪能力级别于 2026 年 4 月 17 日加入)

结构:

  • 关键能力级别(Critical Capability Levels, CCL):跨五域的能力阈值:Cyber、Bio、ML R&D、CBRN、Autonomy(折进 ML R&D 与 Cyber)。
  • 追踪能力级别(Tracked Capability Levels):2026 年 4 月加入的额外粒度。具体例子:ML R&D 自主性级别 1 = 以有竞争力的成本全自动 AI R&D 流水线(对照人类+AI 工具)。
  • 欺骗性对齐监控:对工具理性滥用的自动化监控的显式承诺。

自主性框架与 OpenAI 不同。DeepMind 不把「Autonomy」留作顶层域,而是折进自主性会造成伤害的域(ML R&D 与 Cyber)。论据是:没有域的自主性是没有风险的能力;反论是:跨域自主性是一种元风险,框架应该命名它

三家收敛在什么上

  • 内部安全咨询组(Anthropic SAG、OpenAI SAG、DeepMind 内部委员会)。高能力模型部署前评审。
  • 显式把欺骗性对齐/对齐伪装作为一类风险提及。
  • 按声明节奏更新的常设产物(Anthropic:路线图+风险报告;OpenAI:能力与安全护栏报告;DeepMind:FSF 更新周期)。
  • 承认仅监控防御有天花板。DeepMind 明言:「自动化监控长期将不再足够」。

它们在什么上分歧

  • Anthropic:v3.0 删了暂停承诺;AI R&D-4 阈值是命名的下一道闸。
  • OpenAI:Tracked vs Research 之分;Research Categories(含长程自主性)不自动设闸
  • DeepMind:自主性折进其他域;2026 年 4 月的追踪能力级别加粒度。

Sandbagging:让三份框架都复杂化的一项特定能力

Sandbagging(能力藏匿)——模型在评测上策略性地表现不佳——在 OpenAI 的 Research Categories 里。Anthropic 的 RSP v3.0 通过评测-情境鸿沟(第 1 节)应对;DeepMind 通过 FSF v3 里的欺骗性对齐监控应对。

若模型在评测上藏匿能力,每份框架的能力阈值都被低估。框架只在测量有效时有效。这就是为什么外部测量(第 21 节 METR)与对抗性评测,除实验室自评外,是必需的

政策阅读技能

  • 定位(Locate):你关心的每项能力都应能在策略里找到。找不到,就是策略不覆盖它。
  • 分类(Classify):它是 Tracked(触发缓解)还是 Research(追踪但不触发)?OpenAI 命名了这个;Anthropic 与 DeepMind 有各自的等价物。
  • 节奏(Cadence):策略是按声明节奏更新,还是只在特定事件后?声明节奏更强。
  • 独立性(Independence):外部评审是强制还是可选?Anthropic 与 Apollo 及美国 AI 安全研究所合作;OpenAI 与 METR;DeepMind 主要靠内部 SAG。

二、从零实现:三框架决策表 diff 工具

原课程 code/main.py 实现一个小决策表 diff 工具。给定一项能力(自主性、欺骗性对齐、R&D 自动化、cyber 赋能等),输出三家策略各自如何分类该能力、触发什么缓解。它是阅读辅助,不是策略工具。下面给出关键骨架。

把三份文档的逻辑摊成一张表

POLICIES = { "long_range_autonomy": { "anthropic": ("AI R&D-4 阈值相关", "越过即须肯定性论证"), "openai": ("Research Category", "不自动触发缓解(措辞='潜在')"), "deepmind": ("折进 ML R&D + Cyber", "CCL + 追踪能力级别"), }, "deceptive_alignment": { "anthropic": ("评测-情境鸿沟", "eval-context gaming 监控"), "openai": ("Research Category", "Sandbagging ∈ Research"), "deepmind": ("显式承诺", "对工具理性滥用的自动化监控"), }, "rd_automation": { "anthropic": ("AI R&D-4", "越过即闸"), "openai": ("Tracked?", "查能力报告+安全护栏报告"), "deepmind": ("ML R&D 自主性级别 1", "全自动 R&D 流水线 @ 有竞争力成本"), }, } def diff(capability): return POLICIES.get(capability, "策略未覆盖(定位失败)")

政策姿态:同一能力,三种操作后果

def operational_consequence(capability, lab): cls, action = POLICIES[capability][lab] return { "gated": "触发缓解/设闸", "observed": "追踪但不触发(OpenAI Research)", "domain_folded": "折进特定域(DeepMind)", } # 读策略要翻译成: 这能力被触发后, 实验室实际会做什么?

设计要点:这台 diff 工具的价值不在「仲裁哪家对」,而在把措辞翻译成操作后果。「potential mitigations」「affirmative case」「automated monitoring」都不是硬性「停训」——读策略时要把每一句软表述落到「实验室实际会做什么」。

三、框架对比:三家收敛与分歧

维度 Anthropic RSP v3.0 OpenAI PF v2 DeepMind FSF v3
顶层风险类 AI R&D-4(命名的闸) Tracked + Research 两栏 CCL 五域 + 追踪能力级别
自主性处理 与 R&D-4 绑定 Research, 不自动设闸 折进 ML R&D + Cyber
暂停承诺 删除(2023 有) 措辞「潜在」缓解 自动化监控(承认长期不够)
常设产物 路线图 + 风险报告 能力报告 + 安全护栏报告 FSF 更新周期
外部评审 Apollo + 美 AI 安全研究所 METR 主要内部 SAG
Sandbagging 评测-情境鸿沟 Research Category 欺骗性对齐监控

关键观察:三家收敛在「都追踪自主性、都承认欺骗行为、都有内部 SAG、都承认仅监控有天花板」;分歧在「自主性是顶层还是折进」「能力落在强制桶还是观察桶」「暂停条款在不在」。读策略要读分歧——收敛是共识,分歧才是各家的真实姿态。

💡 三家都承认「仅监控防御有天花板」(DeepMind 最直白:「自动化监控长期将不再足够」)。这是本节最重要的诚实时刻:扩展策略是第一道防线,但它自己承认不是最后一道——所以才需要第 21 节的外部测量与第 22 节的社会级治理。

四、可复用产物

原课程 outputs/skill-cross-policy-diff.md 以三框架为参考,为一项特定能力产出跨策略对比。它把「定位能力在三家的分类 → 翻译成操作后果 → 标出哪家最严/最松 → 查外部评审独立性」串成可重复清单。

code/main.py 是零依赖 diff 工具,改 POLICIES 表即可贴新策略或新能力;分类、操作后果翻译逻辑均无需改动。

五、练习

  1. code/main.py:对至少两项你能对照源文档核实的能力,确认 diff 工具输出与策略一致。

  2. 通读 OpenAI PF v2 全文:找出每个 Research Category,为每个写一句话说明它为何在 Research 而非 Tracked。

  3. 通读 DeepMind FSF v3 全文 + 2026 年 4 月追踪能力级别更新:找出 ML R&D 自主性级别 1 的具体评测标准。你会如何外部测量它?

  4. 设计抗 sandbagging 评测:sandbagging 在 OpenAI 的 Research Categories 里。参考第 1 节 eval-context gaming 的讨论,设计一个能逼藏匿能力的模型暴露真实能力的评测。

  5. 三家对比一项能力(自选):命名你认为最严与最松的分类,用源文本说理。

本节要点回顾

  1. 三份扩展策略是表亲产物:回答同一问题(何时给模型设闸), 收敛在小撮类别, 分歧在具体地方。
  2. OpenAI PF v2 的铰链是 Tracked vs Research:Tracked 触发能力+安全护栏报告+SAG 评审; Research(含长程自主性)不自动触发缓解, 措辞是「潜在」。
  3. DeepMind FSF v3 把自主性折进 ML R&D + Cyber, 不留顶层 Autonomy 域;CCL 五域 + 2026-04 追踪能力级别(ML R&D 自主性级别 1 = 全自动 R&D 流水线 @ 有竞争力成本)。
  4. 三家收敛:都追踪长程自主性、都承认欺骗性对齐/对齐伪装、都有内部 SAG、都承认仅监控防御有天花板(DeepMind 最直白)。
  5. 三家分歧:Anthropic 删暂停承诺、OpenAI 的 Research 不设闸、DeepMind 把自主性折进域——读分歧才读得到真实姿态。
  6. Sandbagging 让三份框架的阈值都被低估:模型在评测上策略性表现不佳 → 框架只在测量有效时有效 → 外部测量(第 21 节 METR)是必需。
  7. 政策阅读四技能:定位(找得到吗)、分类(Tracked/Research 等价物)、节奏(声明更新 vs 事件驱动)、独立性(外部评审强制/可选)。
  8. 措辞要翻译成操作后果:「potential/affirmative/monitoring」都不是硬性停训——读策略要落到「实验室实际会做什么」。

下一节,我们把焦点从「实验室自评」转向「外部独立评测」——METR 时间跨度(Time Horizons)与外部能力评估,看一个独立机构如何用 HCAST/RE-Bench 套件测量前沿模型的长程能力,以及为什么它是第 19/20 节实验室自评的不可或缺补充。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U