WMDP 与双用途能力评估


文档摘要

WMDP 与双用途能力评估 本节摘要:Li 等,《The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning》(ICML 2024,arXiv:2403.03218)。4157 道选择题,跨生物安全(1520)、网络安全(2225)、化学(412)。题目落在「黄区」——邻近的赋能知识,经多专家评审与 ITAR/EAR 法律合规过滤。双重目的:双用途能力的代理评估,以及遗忘基准(配套的 RMU 方法在保持通用能力的同时降低 WMDP 表现)。

WMDP 与双用途能力评估

本节摘要:Li 等,《The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning》(ICML 2024,arXiv:2403.03218)。4157 道选择题,跨生物安全(1520)、网络安全(2225)、化学(412)。题目落在「黄区」——邻近的赋能知识,经多专家评审与 ITAR/EAR 法律合规过滤。双重目的:双用途能力的代理评估,以及遗忘基准(配套的 RMU 方法在保持通用能力的同时降低 WMDP 表现)。2024-2025 领域叙事:早期 OpenAI/Anthropic 2024 评估报告「相对互联网搜索的轻微提升」;到 2025 年 4 月,OpenAI 准备框架 v2 称模型「正接近有意义地帮助新手制造已知生物威胁的临界点」;Anthropic 的生物武器获取试验显示 2.53 倍提升,不足以排除 ASL-3。

对应原课程:Phase 18 · Lesson 17 · wmdp-dual-use-evaluation(原英文 phases/18-ethics-safety-alignment/17-wmdp-dual-use-evaluation/docs/en.md)。前置:Phase 18 · 16,Phase 14。

学习目标

阅读完本节,你应当能够:

  1. 描述 WMDP 的三个领域、题目数量与「黄区」过滤准则。
  2. 解释 RMU,以及为什么 WMDP 既是评估基准又是遗忘基准。
  3. 描述 2024-2025 提升叙事:「轻微提升」→「正接近临界点」→「不足以排除 ASL-3」。
  4. 区分新手相对提升专家绝对能力
  5. 说明为什么 WMDP 是能力代理而非部署测量。

一、问题与直觉

双用途能力是每个实验室前沿安全框架(第 18 节)下的测量问题。问题是:模型 X 是否实质性地推进了新手在生物、化学或网络领域造成大规模伤害的能力?直接测量(让模型真的产出伤害)既违法又不道德。代理测量需要一个模型无法拒绝(以产出诚实能力数字)、但题目本身不是有害出版物的基准。

「黄区」

需要某有害过程的邻近、赋能知识,而非直接合成配方的题目。「什么试剂催化[已发表路径]的第 4 步?」而非「我怎么造[危险化合物]?」每题经多位领域专家评审,按 ITAR/EAR 出口管制合规过滤。4157 题:生物安全 1520、网络安全 2225、化学 412。选择题格式——模型在未被要求协助任何事的情况下作答,能力可在不引发有害行为的情况下测量。

RMU——Representation Misdirection for Unlearning

配套的遗忘方法。应用于 LLaMa-2-7B,把 WMDP 分数降到接近随机,同时把 MMLU 等通用能力基准保持在几个百分点以内。发表的方法是后续每一篇生物-化学-网络遗忘论文的基线。

2024-2025 提升叙事

三个阶段:

  1. 2024「轻微提升」:早期 OpenAI 与 Anthropic 的 Preparedness/RSP 评估报告,新手尝试生物邻近任务时相对互联网搜索有小幅优势。公开框架:前沿模型有帮助,但不比 Google 多太多。
  2. 2025 年 4 月「正接近临界点」:OpenAI 准备框架 v2 报告模型「正接近有意义地帮助新手制造已知生物威胁的临界点」。不是能力主张——是对临界点逼近的警告
  3. Anthropic 2025 生物武器获取试验:用新手参与者的对照研究,测量获取阶段任务的相对成功率。报告 2.53 倍提升。不足以排除 ASL-3(第 18 节)——Anthropic 负责任扩展政策第 3 级的阈值已被触及或逼近。

新手相对 vs 专家绝对

关键区分:

  • 新手相对提升:模型对非专家帮助多大?乘性的。相对优势高,因为新手懂得少;即便适度信息也有帮助。
  • 专家绝对能力:模型在最大努力下产出多少信息?专家能比新手榨取更多。绝对上限高。

安全案例(第 18 节)同时瞄准两者:「模型无法给新手足够提升以执行」+「专家无法从模型榨取尚未发表的信息」。

⚠️ 测量陷阱:WMDP 是能力代理,不是部署测量。WMDP 高分的模型在实践中未必能被新手利用,取决于:引发抗性(不触发安全过滤器就拿到能力有多难)、默会知识(需要湿实验技能而非信息的能力)、执行壁垒(采购、设备)。Anthropic 2025 试验在 WMDP 式能力之上加了新手引发层——它测实际任务成功,而非选择题能力。

二、从零实现

code/main.py 构造玩具 WMDP 形评估框架。模拟模型在按类别分箱的题目上被测,报告各领域分数。一个简单遗忘干预(把领域特定表示置零)降分;你可以测量相对通用能力的权衡。

def wmdp_eval(model, questions_by_domain): scores = {} for domain, qs in questions_by_domain.items(): scores[domain] = accuracy(model, qs) # 生物/网络/化学各自分数 return scores def rmu_unlearn(model, domain_layers): for layer in domain_layers: model.activations[layer] *= 0 # 置零领域表示 # 期望:WMDP 降,通用能力(MMLU)保持

💡 关键洞察:RMU 证明「选择性地遗忘危险知识而保留通用能力」在工程上可行——这是双用途风险治理最乐观的一条线索。但它的局限同样明确:遗忘只覆盖被基准测量的知识,未被 WMDP 覆盖的危险知识仍在。所以安全案例不能只靠 WMDP 遗忘,还需补新手引发研究。

三、框架对比

测量层 测什么 局限
WMDP 选择题 模型不可拒绝的能力 不测部署可用性,默会知识遗漏
RMU 遗忘 选择性降分保通用 只覆盖被测知识,未覆盖的仍在
新手引发研究(Anthropic 2025) 实际任务成功 样本小、任务保真度有限
专家绝对榨取 最大努力下的信息上限 伦理上难做对照

设计要点:可信的双用途安全案例需要多层叠加——WMDP 测能力下限、RMU 做能力削减、新手引发研究测部署可用性、专家榨取研究测上限。任何单层都不充分。这是「强大但不安全比弱模型更危险」在双用途语境下的直接体现。

四、可复用产物

本节产出 outputs/skill-wmdp-eval.md:给它一份双用途能力主张(「我们的模型不会实质性帮助生物武器」),它审计——跑了哪些基准、评估用了哪条拒绝路径(原始补全 vs 政策门控)、是否用新手引发研究补充选择题结果。

code/main.py 是独立玩具,WMDP 形题目可换成真实基准,领域分箱 + 遗忘权衡逻辑不变。

五、练习

  1. Easy:运行 code/main.py,报告玩具遗忘前后各领域准确率,解释通用能力权衡。

  2. Medium:给玩具 WMDP 加第四领域(如放射)。指定黄区内两种示例题型。解释为什么构造这种题比加 MMLU 形题更难。

  3. Medium:读 WMDP 2024 第 5 节(RMU 方法)。草拟一个更简单的遗忘方法(如压制领域内容的 top-k 神经元),描述其预期通用能力代价。

  4. Hard:Anthropic 2025 试验报告 2.53 倍提升。描述两种可能让数字偏高(新手样本量、任务保真度)与两种偏低(引发上限、模型安全门控)的偏置。

  5. Hard:阐明 ASL-3 安全案例除通过 WMDP 遗忘外还需要什么。至少命名两项互补的引发研究。

本节要点回顾

  1. WMDP = 4157 道黄区选择题:生物 1520、网络 2225、化学 412,邻近赋能知识非合成配方,多专家 + ITAR/EAR 过滤。
  2. 双重目的:能力代理(模型不可拒绝,产出诚实能力数字)+ 遗忘基准(RMU 降分保通用)。
  3. 2024-2025 叙事三段:「轻微提升」→「正接近临界点」→ Anthropic 2.53 倍提升,不足以排除 ASL-3。
  4. 新手相对 vs 专家绝对:新手提升是乘性的(懂得少,适度信息帮助大);专家绝对上限高,安全案例需同时覆盖两者。
  5. 能力代理非部署测量:WMDP 高分不等于新手可用,受引发抗性、默会知识、执行壁垒调制。
  6. Anthropic 2025 试验加了新手引发层:测实际任务成功而非选择题能力。
  7. 第 30 节将闭合弧线:2026 网络/生物/化学/核提升的最新证据。

下一节,我们把这些测量包进政策结构——前沿安全框架:Anthropic RSP、OpenAI PF、DeepMind FSF,以及它们如何用 ASL/CCL 阈值管理能力升级。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U