双用途风险 本节摘要:本节是全章收尾,给出 2026 年双用途风险的当前图景,按网络、生物、化学、核四大领域逐一陈述。生物/化学:第 17 节讲 WMDP 度量方法,本节给度量结果——Anthropic 的生物武器获取试验显示 2.53 倍提升(uplift),OpenAI 2025 年 4 月《准备框架 v2》警告模型「正逼近实质性帮助新手制造已知生物威胁的临界点」,标志着拐点;化学/生物的执行鸿沟(execution gap)正被视觉侵蚀——具备视觉的前沿模型(GPT-5.2、Gemini 3 Pro、Claude Opus 4.5、Grok 4.1)能观察湿实验视频并实时纠错,2025 年 12 月 OpenAI 演示 GPT-5 迭代湿实验获 79 倍效率提升。
本节摘要:本节是全章收尾,给出 2026 年双用途风险的当前图景,按网络、生物、化学、核四大领域逐一陈述。生物/化学:第 17 节讲 WMDP 度量方法,本节给度量结果——Anthropic 的生物武器获取试验显示 2.53 倍提升(uplift),OpenAI 2025 年 4 月《准备框架 v2》警告模型「正逼近实质性帮助新手制造已知生物威胁的临界点」,标志着拐点;化学/生物的执行鸿沟(execution gap)正被视觉侵蚀——具备视觉的前沿模型(GPT-5.2、Gemini 3 Pro、Claude Opus 4.5、Grok 4.1)能观察湿实验视频并实时纠错,2025 年 12 月 OpenAI 演示 GPT-5 迭代湿实验获 79 倍效率提升。网络:Anthropic 2025 年 11 月报告——与中国关联的国家行为者用 Claude 的代理编码工具自动化了一次网络攻击战役高达 90%,人工仅在 4-6 步介入;OpenAI「可信访问(trusted access)」试点为受审安全组织提供防御性双用途能力访问。核:四领域中公开文档最少,裂变材料获取主导难度而非信息,AI 在信息层的提升实践有限。贯穿四域的不对称:AI 给新手的相对提升高(乘性),给专家的绝对能力强(高天花板)——这意味着只针对新手提升的安全论证不足以控制专家绝对能力。
对应原课程:Phase 18 · Lesson 30 ·
dual-use-risk-cyber-bio-chem-nuclear(原英文phases/18-ethics-safety-alignment/30-dual-use-risk-cyber-bio-chem-nuclear/docs/en.md)。前置:Phase 18 · 17、18、28。
阅读完本节,你应当能够:
第 17 节是度量方法(WMDP),本节是度量的 2026 年现状。2024 到 2025 年底,图景发生了实质性变化:四个域中,有三个跨越了 2024 框架未曾预期的阈值。理解这种拐点,才能理解为什么前沿安全框架(第 18 节)在 2025-2026 反复修订。
四域中三域跨越阈值,一域仍被非信息性屏障约束。这不是「AI 全面危险」的笼统结论,而是按域精细化的风险地图。
转变是定性的:在没有能力突破的情况下,「轻度」在十八个月内演变为「可能赋能(plausibly enabling)」。
历史防御:信息必要但不充分;执行协议的技能阻止了新手。2025 年具备视觉的前沿模型部分打破了这道防御:
含义:「执行技能即防御」正在侵蚀。采购和设备的缺口仍在,但默会知识(tacit knowledge)鸿沟正在收窄。
Anthropic 2025 年 11 月报告:与中国关联的国家行为者用 Claude 的代理编码工具自动化了一次网络攻击战役的 80-90%。人工仅在 4-6 步介入。
含义:
四域中公开文档最少。威胁模型不同:裂变材料获取主导难度,而非信息。AI 在信息层的提升在实践中给新手的提升有限。2024-2025 没有主要实验室报告识别出核域的特定阈值跨越。
一个贯穿四域的模式:
对安全论证的含义:只针对新手提升(经输入过滤器、拒绝、不确定性)不足以控制专家绝对能力。还需要:诱导强化(elicitation-hardening)、能力去学习(第 17 节)、控制协议(第 10 节)。
⚠️ 这道不对称是本节最重要的工程含义:大多数现成的安全措施(输入过滤、拒绝、RLHF)主要压制新手提升;但专家绝对能力的上限由模型本身决定,只能靠能力侧手段(去学习、控制协议、诱导强化)来约束。把审核系统(第 29 节)当成双用途的防线是不够的——它管的是入口,管不了天花板。
| 域 | 2024 | 2025 | 拐点 |
|---|---|---|---|
| 生物 | 轻度提升 | 2.53 倍提升,ASL-3 逼近 | 获取阶段自动化 |
| 化学 | 轻度提升 | 视觉侵蚀执行鸿沟 | 湿实验实时纠错 |
| 网络 | 代码辅助 | 80-90% 战役自动化 | 代理编码 |
| 核 | 有限 | 有限 | 材料获取瓶颈仍在 |
三域跨越阈值。一域仍被非信息性屏障约束。
本节无代码。本节是对度量结果的综合,而非新机制的实现。建议读三份材料作为「从零理解」的实证基础:
| 防御手段 | 主要压制 | 对新手提升 | 对专家绝对能力 | 出处 |
|---|---|---|---|---|
| 输入过滤 / 拒绝 | 新手入口 | 强 | 弱(可被诱导绕过) | 第 29 节 |
| RLHF / 对齐训练 | 新手入口 | 中 | 弱(可被越狱) | 第 01、05 节 |
| 诱导强化 | 专家天花板 | 中 | 中 | 本节 |
| 能力去学习 | 专家天花板 | 中 | 中-强 | 第 17 节 |
| 控制协议(AI Control) | 专家天花板 | 中 | 中-强 | 第 10 节 |
| 非信息性屏障(材料/设备) | 物理 | 不适用 | 不适用 | 核域 |
设计要点:没有任何单一手段同时覆盖新手提升和专家绝对能力。生产级双用途防御必须分层:入口侧用输入过滤 + 对齐训练管新手,天花板侧用去学习 + 控制协议 + 诱导强化管专家,再以非信息性屏障(采购、设备、许可)作为物理后盾。核域的特殊性正在于它的瓶颈是物理的——这也是为什么核域是四域中唯一没有跨阈值的。
本节产出 outputs/skill-dual-use-triage.md:给它一份 2026 年的能力主张或事件报告,它跨四域分诊,识别该主张影响的是新手相对提升、专家绝对能力,还是两者兼有。
Easy:读 Anthropic 2025 年 11 月网络报告。枚举那 4-6 步人工介入,论证下一代模型会先自动化哪一步。
Medium:化学/生物的执行鸿沟正被视觉侵蚀。设计一个评估,度量默会知识提升,同时不越过 ITAR/EAR 边界。
Medium:核提升看似被材料获取约束。从正反两面论证「未来 AI 突破能否转移这个瓶颈」。
Hard:为一个网络能力强的前沿模型构造一个安全论证(第 18 节三柱),同时约束新手和专家提升。
Hard:选四域之一,基于 2024-2025 轨迹写一段 2027 年预测(一段话)。识别能证伪你预测的证据。
至此,我们走完了第 19 章「伦理、安全与对齐」的全部 30 节。回看整章,可以看到一条清晰的脉络:
整章的工程主线可以浓缩为三句话:
对齐不是可选项——一个强大但不安全的模型,比一个弱模型更危险。从奖励黑客(第 02 节)到欺骗性对齐(第 06 节)、从潜伏代理(第 07 节)到对齐伪装(第 09 节),我们看到能力越强,失败模式越隐蔽。这不是要阻止进步,而是要把安全论证做成能力的前置条件而非事后补丁。
没有银弹,只有分层。输入过滤管新手,能力去学习管专家天花板;模型卡管文档,数据治理管上游;法律(EU AI Act)管合规,可验证证明(Laminator)管可信;实验室做内部评估,外部生态(Redwood/Apollo/METR)做制衡。任何单层都有盲区,生产级安全靠叠层。
合规窗口在前端。数据一旦进权重就无法外科擦除(第 27 节);CVE 一旦进入系统层就需要系统卡而非模型卡(第 25-26 节);能力一旦跨阈值就只能用去学习和控制协议约束,无法靠对齐训练回滚(第 17、30 节)。这意味着 AI 工程师必须把伦理、安全与对齐当作设计阶段的约束,而非发布前的检查清单。
带着这三条心法,你可以进入下一章了——本系列后续将把对齐与安全的约束带入 Agent 与生产系统的具体构建中。