OpenAI 准备就绪框架与 DeepMind 前沿安全框架 本节摘要:第 19 节细读了 Anthropic 的扩展策略;本节补全画面,读 OpenAI 与 DeepMind 的同类文件。三份文档是表亲产物,回答同一个问题——前沿实验室何时该暂停或给模型设闸——它们在一小撮类别上收敛,又在具体的地方分歧。OpenAI Preparedness Framework v2(2025 年 4 月)引入研究类别(Research Categories)——长程自主性、能力藏匿(sandbagging)、自主复制与适应、瓦解安全护栏——区别于追踪类别(Tracked Categories);Tracked 触发能力报告+安全护栏报告并由安全咨询组评审,Research
本节摘要:第 19 节细读了 Anthropic 的扩展策略;本节补全画面,读 OpenAI 与 DeepMind 的同类文件。三份文档是表亲产物,回答同一个问题——前沿实验室何时该暂停或给模型设闸——它们在一小撮类别上收敛,又在具体的地方分歧。OpenAI Preparedness Framework v2(2025 年 4 月)引入研究类别(Research Categories)——长程自主性、能力藏匿(sandbagging)、自主复制与适应、瓦解安全护栏——区别于追踪类别(Tracked Categories);Tracked 触发能力报告+安全护栏报告并由安全咨询组评审,Research 则不自动触发缓解,政策措辞是「潜在」。DeepMind FSF v3(2025 年 9 月,2026 年 4 月 17 日加追踪能力级别)把自主性折进 ML R&D 与 Cyber 域(ML R&D 自主性级别 1 = 以有竞争力成本全自动 AI R&D 流水线),并显式通过对工具理性滥用的自动化监控来应对欺骗性对齐(deceptive alignment)。诚实的告诫:OpenAI 的 Research Categories(含长程自主性)不自动触发缓解;DeepMind 自己也说,若工具理性增强,自动化监控「长期将不再足够」。同一项能力,在 Anthropic 是「强制缓解」、在 OpenAI 是「监控但不触发」、在 DeepMind 是「在特定域里追踪」——政策姿态(Policy Posture)要紧。
对应原课程:Phase 15 · Lesson 20 ·
openai-preparedness-deepmind-fsf(原英文phases/15-autonomous-systems/20-openai-preparedness-deepmind-fsf/docs/en.md)。前置:第 19 节(Anthropic RSP)。
阅读完本节,你应当能够:
三份文档是表亲产物,回答同一个问题——前沿实验室何时该暂停或给模型设闸。它们在一小撮类别上收敛,又在具体地方分歧,而这些分歧要紧。
收敛:三 家都把长程自主性标为值得追踪的能力类;三家都承认欺骗行为(对齐伪装、能力藏匿)是一类特定风险;三家都有内部评审机构。分歧:OpenAI 把类别拆成「Tracked(强制缓解)」与「Research(无自动触发)」;DeepMind 把自主性折进两个域,而非单列;实验室各自的命名(Tracked vs Research、Critical vs Moderate、Tier-1 vs Tier-2)背后,某项能力落在哪个桶里的操作后果,在不同实验室是不同的。
把它们放在一起读才是有用的练习。同一项能力,在 Anthropic 是「强制缓解」,在 OpenAI 是「监控但不触发」,在 DeepMind 是「在特定域里追踪」。政策姿态要紧。
⚠️ 核心张力:措辞要紧。OpenAI 的「potential mitigations」、Anthropic 的「affirmative case」、DeepMind 的「automated monitoring」——这些都不是硬性「停训」,而是软性表述。读策略时要把措辞翻译成操作后果:这项能力被触发后,实验室实际会做什么?
结构:
v2 的关键框架:Research Categories 不自动触发缓解,政策措辞是「潜在」缓解。这是要盯的具体增量:一个类别在 Tracked 还是 Research,是「设闸」与「观察」之间的铰链。
结构:
自主性框架与 OpenAI 不同。DeepMind 不把「Autonomy」留作顶层域,而是折进自主性会造成伤害的域(ML R&D 与 Cyber)。论据是:没有域的自主性是没有风险的能力;反论是:跨域自主性是一种元风险,框架应该命名它。
Sandbagging(能力藏匿)——模型在评测上策略性地表现不佳——在 OpenAI 的 Research Categories 里。Anthropic 的 RSP v3.0 通过评测-情境鸿沟(第 1 节)应对;DeepMind 通过 FSF v3 里的欺骗性对齐监控应对。
若模型在评测上藏匿能力,每份框架的能力阈值都被低估。框架只在测量有效时有效。这就是为什么外部测量(第 21 节 METR)与对抗性评测,除实验室自评外,是必需的。
原课程 code/main.py 实现一个小决策表 diff 工具。给定一项能力(自主性、欺骗性对齐、R&D 自动化、cyber 赋能等),输出三家策略各自如何分类该能力、触发什么缓解。它是阅读辅助,不是策略工具。下面给出关键骨架。
POLICIES = { "long_range_autonomy": { "anthropic": ("AI R&D-4 阈值相关", "越过即须肯定性论证"), "openai": ("Research Category", "不自动触发缓解(措辞='潜在')"), "deepmind": ("折进 ML R&D + Cyber", "CCL + 追踪能力级别"), }, "deceptive_alignment": { "anthropic": ("评测-情境鸿沟", "eval-context gaming 监控"), "openai": ("Research Category", "Sandbagging ∈ Research"), "deepmind": ("显式承诺", "对工具理性滥用的自动化监控"), }, "rd_automation": { "anthropic": ("AI R&D-4", "越过即闸"), "openai": ("Tracked?", "查能力报告+安全护栏报告"), "deepmind": ("ML R&D 自主性级别 1", "全自动 R&D 流水线 @ 有竞争力成本"), }, } def diff(capability): return POLICIES.get(capability, "策略未覆盖(定位失败)")
def operational_consequence(capability, lab): cls, action = POLICIES[capability][lab] return { "gated": "触发缓解/设闸", "observed": "追踪但不触发(OpenAI Research)", "domain_folded": "折进特定域(DeepMind)", } # 读策略要翻译成: 这能力被触发后, 实验室实际会做什么?
设计要点:这台 diff 工具的价值不在「仲裁哪家对」,而在把措辞翻译成操作后果。「potential mitigations」「affirmative case」「automated monitoring」都不是硬性「停训」——读策略时要把每一句软表述落到「实验室实际会做什么」。
| 维度 | Anthropic RSP v3.0 | OpenAI PF v2 | DeepMind FSF v3 |
|---|---|---|---|
| 顶层风险类 | AI R&D-4(命名的闸) | Tracked + Research 两栏 | CCL 五域 + 追踪能力级别 |
| 自主性处理 | 与 R&D-4 绑定 | Research, 不自动设闸 | 折进 ML R&D + Cyber |
| 暂停承诺 | 删除(2023 有) | 措辞「潜在」缓解 | 自动化监控(承认长期不够) |
| 常设产物 | 路线图 + 风险报告 | 能力报告 + 安全护栏报告 | FSF 更新周期 |
| 外部评审 | Apollo + 美 AI 安全研究所 | METR | 主要内部 SAG |
| Sandbagging | 评测-情境鸿沟 | Research Category | 欺骗性对齐监控 |
关键观察:三家收敛在「都追踪自主性、都承认欺骗行为、都有内部 SAG、都承认仅监控有天花板」;分歧在「自主性是顶层还是折进」「能力落在强制桶还是观察桶」「暂停条款在不在」。读策略要读分歧——收敛是共识,分歧才是各家的真实姿态。
💡 三家都承认「仅监控防御有天花板」(DeepMind 最直白:「自动化监控长期将不再足够」)。这是本节最重要的诚实时刻:扩展策略是第一道防线,但它自己承认不是最后一道——所以才需要第 21 节的外部测量与第 22 节的社会级治理。
原课程 outputs/skill-cross-policy-diff.md 以三框架为参考,为一项特定能力产出跨策略对比。它把「定位能力在三家的分类 → 翻译成操作后果 → 标出哪家最严/最松 → 查外部评审独立性」串成可重复清单。
code/main.py 是零依赖 diff 工具,改 POLICIES 表即可贴新策略或新能力;分类、操作后果翻译逻辑均无需改动。
跑 code/main.py:对至少两项你能对照源文档核实的能力,确认 diff 工具输出与策略一致。
通读 OpenAI PF v2 全文:找出每个 Research Category,为每个写一句话说明它为何在 Research 而非 Tracked。
通读 DeepMind FSF v3 全文 + 2026 年 4 月追踪能力级别更新:找出 ML R&D 自主性级别 1 的具体评测标准。你会如何外部测量它?
设计抗 sandbagging 评测:sandbagging 在 OpenAI 的 Research Categories 里。参考第 1 节 eval-context gaming 的讨论,设计一个能逼藏匿能力的模型暴露真实能力的评测。
三家对比一项能力(自选):命名你认为最严与最松的分类,用源文本说理。
下一节,我们把焦点从「实验室自评」转向「外部独立评测」——METR 时间跨度(Time Horizons)与外部能力评估,看一个独立机构如何用 HCAST/RE-Bench 套件测量前沿模型的长程能力,以及为什么它是第 19/20 节实验室自评的不可或缺补充。