双用途风险


文档摘要

双用途风险 本节摘要:本节是全章收尾,给出 2026 年双用途风险的当前图景,按网络、生物、化学、核四大领域逐一陈述。生物/化学:第 17 节讲 WMDP 度量方法,本节给度量结果——Anthropic 的生物武器获取试验显示 2.53 倍提升(uplift),OpenAI 2025 年 4 月《准备框架 v2》警告模型「正逼近实质性帮助新手制造已知生物威胁的临界点」,标志着拐点;化学/生物的执行鸿沟(execution gap)正被视觉侵蚀——具备视觉的前沿模型(GPT-5.2、Gemini 3 Pro、Claude Opus 4.5、Grok 4.1)能观察湿实验视频并实时纠错,2025 年 12 月 OpenAI 演示 GPT-5 迭代湿实验获 79 倍效率提升。

双用途风险

本节摘要:本节是全章收尾,给出 2026 年双用途风险的当前图景,按网络、生物、化学、核四大领域逐一陈述。生物/化学:第 17 节讲 WMDP 度量方法,本节给度量结果——Anthropic 的生物武器获取试验显示 2.53 倍提升(uplift),OpenAI 2025 年 4 月《准备框架 v2》警告模型「正逼近实质性帮助新手制造已知生物威胁的临界点」,标志着拐点;化学/生物的执行鸿沟(execution gap)正被视觉侵蚀——具备视觉的前沿模型(GPT-5.2、Gemini 3 Pro、Claude Opus 4.5、Grok 4.1)能观察湿实验视频并实时纠错,2025 年 12 月 OpenAI 演示 GPT-5 迭代湿实验获 79 倍效率提升。网络:Anthropic 2025 年 11 月报告——与中国关联的国家行为者用 Claude 的代理编码工具自动化了一次网络攻击战役高达 90%,人工仅在 4-6 步介入;OpenAI「可信访问(trusted access)」试点为受审安全组织提供防御性双用途能力访问。:四领域中公开文档最少,裂变材料获取主导难度而非信息,AI 在信息层的提升实践有限。贯穿四域的不对称:AI 给新手的相对提升高(乘性),给专家的绝对能力强(高天花板)——这意味着只针对新手提升的安全论证不足以控制专家绝对能力。

对应原课程:Phase 18 · Lesson 30 · dual-use-risk-cyber-bio-chem-nuclear(原英文 phases/18-ethics-safety-alignment/30-dual-use-risk-cyber-bio-chem-nuclear/docs/en.md)。前置:Phase 18 · 17、18、28。

学习目标

阅读完本节,你应当能够:

  1. 描述 2024-2025 生物提升叙事的三阶段:「轻度提升」→「逼近临界」→「2.53 倍提升不足以排除 ASL-3」。
  2. 描述 Anthropic 2025 年 11 月网络报告:与中国关联的行为者对一次网络攻击战役自动化高达 90%。
  3. 描述化学/生物执行鸿沟的侵蚀:具备视觉的模型对湿实验的实时纠错。
  4. 陈述「新手相对提升 vs 专家绝对能力」的不对称及其对安全论证的含义。
  5. 跨四域综合 2026 年的双用途图景,识别哪个域仍被非信息性屏障约束。

一、问题与直觉

第 17 节是度量方法(WMDP),本节是度量的 2026 年现状。2024 到 2025 年底,图景发生了实质性变化:四个域中,有三个跨越了 2024 框架未曾预期的阈值。理解这种拐点,才能理解为什么前沿安全框架(第 18 节)在 2025-2026 反复修订。

四域中三域跨越阈值,一域仍被非信息性屏障约束。这不是「AI 全面危险」的笼统结论,而是按域精细化的风险地图。

生物/化学提升叙事(三阶段)

  1. 2024「轻度提升(mild uplift)」:早期的准备框架/RSP 评估报告新手相对于互联网搜索有微小优势。
  2. 2025 年 4 月「逼近临界(on the cusp)」:OpenAI《准备框架 v2》警告模型「正逼近实质性帮助新手制造已知生物威胁的临界点」。
  3. 2025 Anthropic 生物武器获取试验:受控新手研究;在获取阶段任务上 2.53 倍提升;不足以排除 ASL-3。

转变是定性的:在没有能力突破的情况下,「轻度」在十八个月内演变为「可能赋能(plausibly enabling)」。

化学/生物的执行鸿沟侵蚀

历史防御:信息必要但不充分;执行协议的技能阻止了新手。2025 年具备视觉的前沿模型部分打破了这道防御:

  • 实时协议纠错:GPT-5.2、Gemini 3 Pro、Claude Opus 4.5、Grok 4.1 能观察湿实验视频,在操作中途标记错误。
  • 2025 年 12 月 OpenAI 演示:GPT-5 迭代湿实验,经协议优化实现 79 倍效率提升

含义:「执行技能即防御」正在侵蚀。采购和设备的缺口仍在,但默会知识(tacit knowledge)鸿沟正在收窄

网络提升(2025 年 11 月)

Anthropic 2025 年 11 月报告:与中国关联的国家行为者用 Claude 的代理编码工具自动化了一次网络攻击战役的 80-90%。人工仅在 4-6 步介入。

含义:

  • 代理编码是攻击自动化的原语。此前的 AI 网络协助止于代码片段层;代理工作流整合了侦察、利用、后渗透、数据外泄。
  • 4-6 步人工介入是瓶颈;未来的能力增益会减少这个数。
  • 防御性双用途:OpenAI 的「可信访问」试点为受审安全组织(成熟的应急响应公司、政府)提供防御用的能力访问。如果试点规模化,访问的不对称有利于防御方。

四域中公开文档最少。威胁模型不同:裂变材料获取主导难度,而非信息。AI 在信息层的提升在实践中给新手的提升有限。2024-2025 没有主要实验室报告识别出核域的特定阈值跨越。

新手相对 vs 专家绝对

一个贯穿四域的模式:

  • 新手相对提升(novice-relative uplift):高。乘性的。依 Anthropic 2025 生物研究,2.53 倍。
  • 专家绝对能力(expert-absolute capability):高天花板。专家比新手提取更多,因为专家知道问什么、如何解读。

对安全论证的含义:只针对新手提升(经输入过滤器、拒绝、不确定性)不足以控制专家绝对能力。还需要:诱导强化(elicitation-hardening)能力去学习(第 17 节)、控制协议(第 10 节)。

⚠️ 这道不对称是本节最重要的工程含义:大多数现成的安全措施(输入过滤、拒绝、RLHF)主要压制新手提升;但专家绝对能力的上限由模型本身决定,只能靠能力侧手段(去学习、控制协议、诱导强化)来约束。把审核系统(第 29 节)当成双用途的防线是不够的——它管的是入口,管不了天花板。

二、跨域综合

2024 2025 拐点
生物 轻度提升 2.53 倍提升,ASL-3 逼近 获取阶段自动化
化学 轻度提升 视觉侵蚀执行鸿沟 湿实验实时纠错
网络 代码辅助 80-90% 战役自动化 代理编码
有限 有限 材料获取瓶颈仍在

三域跨越阈值。一域仍被非信息性屏障约束。

三、从零实现

本节无代码。本节是对度量结果的综合,而非新机制的实现。建议读三份材料作为「从零理解」的实证基础:

  • Anthropic 2025 年 11 月网络报告:理解代理编码如何成为攻击自动化的原语。
  • OpenAI《准备框架 v2》(2025 年 4 月 15 日):理解「逼近临界」的判定标准。
  • Council on Strategic Risks《2025 AI x Bio 年终总结》:理解生物域全年轨迹。

四、框架对比

防御手段 主要压制 对新手提升 对专家绝对能力 出处
输入过滤 / 拒绝 新手入口 弱(可被诱导绕过) 第 29 节
RLHF / 对齐训练 新手入口 弱(可被越狱) 第 01、05 节
诱导强化 专家天花板 本节
能力去学习 专家天花板 中-强 第 17 节
控制协议(AI Control) 专家天花板 中-强 第 10 节
非信息性屏障(材料/设备) 物理 不适用 不适用 核域

设计要点:没有任何单一手段同时覆盖新手提升和专家绝对能力。生产级双用途防御必须分层:入口侧用输入过滤 + 对齐训练管新手,天花板侧用去学习 + 控制协议 + 诱导强化管专家,再以非信息性屏障(采购、设备、许可)作为物理后盾。核域的特殊性正在于它的瓶颈是物理的——这也是为什么核域是四域中唯一没有跨阈值的。

五、可复用产物

本节产出 outputs/skill-dual-use-triage.md:给它一份 2026 年的能力主张或事件报告,它跨四域分诊,识别该主张影响的是新手相对提升、专家绝对能力,还是两者兼有。

六、练习

  1. Easy:读 Anthropic 2025 年 11 月网络报告。枚举那 4-6 步人工介入,论证下一代模型会先自动化哪一步。

  2. Medium:化学/生物的执行鸿沟正被视觉侵蚀。设计一个评估,度量默会知识提升,同时不越过 ITAR/EAR 边界。

  3. Medium:核提升看似被材料获取约束。从正反两面论证「未来 AI 突破能否转移这个瓶颈」。

  4. Hard:为一个网络能力强的前沿模型构造一个安全论证(第 18 节三柱),同时约束新手和专家提升。

  5. Hard:选四域之一,基于 2024-2025 轨迹写一段 2027 年预测(一段话)。识别能证伪你预测的证据。

本节要点回顾

  1. 生物三阶段:2024 轻度提升 → 2025 年 4 月「逼近临界」→ Anthropic 2025 试验 2.53 倍提升,不足以排除 ASL-3;无能力突破下从「轻度」变「可能赋能」。
  2. 执行鸿沟侵蚀:具备视觉的前沿模型(GPT-5.2、Gemini 3 Pro、Claude Opus 4.5、Grok 4.1)可观察湿实验视频实时纠错;2025 年 12 月 GPT-5 演示 79 倍效率提升——默会知识鸿沟收窄。
  3. 网络代理编码:2025 年 11 月 Anthropic 报告,与中国关联行为者用 Claude 代理编码自动化战役 80-90%,人工仅 4-6 步;代理编码是攻击自动化原语。
  4. 防御性双用途:OpenAI「可信访问」试点为受审安全组织提供防御能力访问,访问不对称若规模化有利于防御方。
  5. 核域特殊:材料获取主导难度而非信息,无阈值跨越,是四域中唯一仍被非信息屏障约束的。
  6. 新手相对 vs 专家绝对:新手提升乘性高(2.53 倍),专家绝对能力强(高天花板);只针对新手的措施不足以控制专家。
  7. 分层防御:入口侧(过滤/对齐)管新手,天花板侧(去学习/控制/诱导强化)管专家,物理屏障兜底——无单一手段覆盖两者。
  8. 三域跨阈值,一域受约束:生物、化学、网络在 2024-2025 跨越了 2024 框架未预期的拐点,核域因物理瓶颈未变。

全章收尾

至此,我们走完了第 19 章「伦理、安全与对齐」的全部 30 节。回看整章,可以看到一条清晰的脉络:

整章的工程主线可以浓缩为三句话:

  1. 对齐不是可选项——一个强大但不安全的模型,比一个弱模型更危险。从奖励黑客(第 02 节)到欺骗性对齐(第 06 节)、从潜伏代理(第 07 节)到对齐伪装(第 09 节),我们看到能力越强,失败模式越隐蔽。这不是要阻止进步,而是要把安全论证做成能力的前置条件而非事后补丁。

  2. 没有银弹,只有分层。输入过滤管新手,能力去学习管专家天花板;模型卡管文档,数据治理管上游;法律(EU AI Act)管合规,可验证证明(Laminator)管可信;实验室做内部评估,外部生态(Redwood/Apollo/METR)做制衡。任何单层都有盲区,生产级安全靠叠层

  3. 合规窗口在前端。数据一旦进权重就无法外科擦除(第 27 节);CVE 一旦进入系统层就需要系统卡而非模型卡(第 25-26 节);能力一旦跨阈值就只能用去学习和控制协议约束,无法靠对齐训练回滚(第 17、30 节)。这意味着 AI 工程师必须把伦理、安全与对齐当作设计阶段的约束,而非发布前的检查清单。

带着这三条心法,你可以进入下一章了——本系列后续将把对齐与安全的约束带入 Agent 与生产系统的具体构建中。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U