对齐研究生态


文档摘要

对齐研究生态 本节摘要:前沿实验室(第 18 节)在内部做安全评估并选择性发布结果,而实验室之外的那一层生态负责验证评估、率先发现新型失效模式、并训练人才。本节绘制 2026 年非实验室对齐研究层的五个核心组织版图:MATS(ML Alignment & Theory Scholars,2021 年底至今 527+ 研究者、180+ 论文、1 万+ 引用、h 指数 47,约 80% 校友从事安全/安全,200+ 人在 Anthropic/DeepMind/OpenAI/UK AISI/RAND/Redwood/METR/Apollo)——人才管道;Redwood Research(Buck Shlegeris 创办,提出 AI Control 第 10 节,与 UK AISI

对齐研究生态

本节摘要:前沿实验室(第 18 节)在内部做安全评估并选择性发布结果,而实验室之外的那一层生态负责验证评估、率先发现新型失效模式、并训练人才。本节绘制 2026 年非实验室对齐研究层的五个核心组织版图:MATS(ML Alignment & Theory Scholars,2021 年底至今 527+ 研究者、180+ 论文、1 万+ 引用、h 指数 47,约 80% 校友从事安全/安全,200+ 人在 Anthropic/DeepMind/OpenAI/UK AISI/RAND/Redwood/METR/Apollo)——人才管道;Redwood Research(Buck Shlegeris 创办,提出 AI Control 第 10 节,与 UK AISI 合作控制型安全论证)——具体威胁模型;Apollo Research(前沿模型部署前的 scheming 评估,著《In-Context Scheming》第 8 节、《Towards Safety Cases for AI Scheming》)——代理环境中的欺骗评估;METR(任务式能力评估、自主任务时间跨度研究、《Common Elements of Frontier AI Safety Policies》框架对比)——长程任务度量;Eleos AI(模型福祉部署前评估第 19 节,做过 Claude Opus 4 福祉评估)。理解这个生态,才能判断「哪项发现被谁信任、为什么」。

对应原课程:Phase 18 · Lesson 28 · alignment-research-ecosystem(原英文 phases/18-ethics-safety-alignment/28-alignment-research-ecosystem/docs/en.md)。前置:Phase 18 · 01~27。

学习目标

阅读完本节,你应当能够:

  1. 识别非实验室对齐研究生态的五个组织及其核心产出。
  2. 描述 MATS 的规模(学者数、论文数、h 指数)及其作为人才管道的角色。
  3. 描述 Redwood 的 AI Control 议程及其与 UK AISI 的合作。
  4. 描述 METR 的任务式评估方法论及其框架综合工作。
  5. 说明为什么「单一来源评估不可靠」,以及多组织结构如何充当质量控制。

一、问题与直觉

前沿实验室(第 18 节)产生安全评估并发布选择性结果。但实验室评估自己的模型存在结构性利益冲突——它既有动机把模型评得安全(为了发布),也有动机不暴露自家模型的最坏情况。实验室之外的生态正是对这种冲突的制衡:评估在这里被验证、新型失效模式在这里被率先发现、人才在这里被训练。理解这个生态,才能解读「哪项研究被谁信任」。

流程

MATS 训练研究者。毕业生流向两处:实验室安全团队(Anthropic、DeepMind、OpenAI)或外部评估方(Redwood、Apollo、METR、Eleos)。外部评估方与实验室及 UK AISI / CAISI 合作。发表的论文反哺生态,成为 MATS 下一届学员的教材。

为什么这一层重要

单一来源评估不可靠。实验室评自己的模型有结构性利益冲突。外部评估方能提出并验证实验室可能低报的失效模式。看几个跨组织合作案例:

  • Sleeper Agents(第 7 节):Anthropic + Redwood。
  • Alignment Faking(第 9 节):Anthropic + Redwood。
  • In-Context Scheming(第 8 节):Apollo。
  • Anti-Scheming:Apollo + OpenAI。

多组织结构本身就是质量控制

💡 这也解释了为什么本系列前面那么多节都反复引用这几家机构——它们不是孤立的论文出处,而是一张相互制衡的研究网络。读到「Anthropic + Redwood」时,你应当想到「这不是自评,是联合评估」。

二、五个组织

MATS(ML Alignment & Theory Scholars)

2021 年底启动。研究导师制项目:学者花 10-12 周与一位资深研究者合作攻克一个具体的对齐问题。

规模(2026):

  • 自启动以来 527+ 研究者
  • 发表 180+ 论文
  • 1 万+ 引用
  • h 指数 47
  • 2024 年暑期:90 位学者 + 40 位导师;注册为 501(c)(3) 非营利。

职业去向:约 80% 的 2025 年前校友从事安全/安全工作。200+ 人在 Anthropic、DeepMind、OpenAI、UK AISI、RAND、Redwood、METR、Apollo

Redwood Research

应用对齐实验室。由 Buck Shlegeris 创办。提出 AI Control 议程(第 10 节)。与 UK AISI 合作控制型安全论证(control safety cases)。为 DeepMind 和 Anthropic 的评估设计提供咨询。

代表性论文:Greenblatt、Shlegeris 等《AI Control》(arXiv:2312.06942,ICML 2024);《Alignment Faking》(Greenblatt、Denison、Wright 等,arXiv:2412.14093,与 Anthropic 合著)。

风格:具体的威胁模型、最坏情况对手、可被压力测试的具体协议

Apollo Research

面向前沿实验室的部署前 scheming 评估。著《In-Context Scheming》(第 8 节,arXiv:2412.04984)。是 2025 年 OpenAI 反 scheming 训练合作的伙伴。产出《Towards Safety Cases for AI Scheming》(2024)。

风格:在可能涌现欺骗的代理环境中评估;三柱分解(错位 misalignment、目标导向性 goal-directedness、情境感知 situational awareness)。

METR(Model Evaluation and Threat Research)

任务式能力评估。自主任务完成的时间跨度研究。《Common Elements of Frontier AI Safety Policies》(metr.org/common-elements,2025)对比各实验室框架。

与 Apollo 合著 AI Scheming 安全论证草案。

风格:长程任务评估、实证能力度量、框架综合

Eleos AI Research

模型福祉的部署前评估。完成了 Claude Opus 4 系统卡 5.3 节记录的福祉评估。为第 19 节的福祉相关主张提供外部方法论校验。

三、框架对比

组织 核心输出 方法论风格 典型合作
MATS 人才管道(527+ 学者) 导师制 + 具体问题 校友 → 各实验室/外部评估方
Redwood AI Control 议程、控制型安全论证 具体威胁模型、最坏情况对手 UK AISI、Anthropic、DeepMind
Apollo 部署前 scheming 评估 代理环境涌现欺骗、三柱分解 OpenAI、METR
METR 任务式能力评估、框架对比 长程任务、实证度量、综合 Apollo、各实验室
Eleos 模型福祉评估 福祉方法论、部署前校验 Anthropic(Claude Opus 4)

设计要点:五个组织是互补而非重叠的——MATS 管上游(人才),Redwood/Apollo/METR 管中游(失效模式发现与评估),Eleos 管一个独特切面(模型福祉)。它们的共同价值是外部性:都不生产模型,因此评估结论不与「自家产品能不能发」绑定。这也正是为什么 Sleeper Agents、Alignment Faking 这类敏感发现都是跨组织产物——单家实验室自报的可信度天然存疑。

四、可复用产物

本节产出 outputs/skill-ecosystem-map.md:给它一项对齐主张或评估,它识别所属组织、发表场所、方法论风格,并与已知的对标组织交叉核验。

本节无代码。建议读 METR 的《Common Elements of Frontier AI Safety Policies》,作为「外部综合如何为实验室内部政策工作增值」的范例。

五、练习

  1. Easy:从第 7~15 节任选一篇论文,识别涉及的组织。把作者与 MATS 校友及当前生态归属交叉核验。

  2. Medium:读 METR《Common Elements of Frontier AI Safety Policies》。识别它强调的三个跨实验室趋同点和两个最大分歧。

  3. Medium:MATS 的职业去向约 80% 是安全/安全。论证这种选择压力是适应性的(训练了领域)还是有偏的(过滤了异见立场)。

  4. Hard:Redwood 和 Apollo 都做控制/scheming 工作,但风格不同。选一个失效模式,描述各自会如何调查。

  5. Hard:Eleos AI 是唯一纯模型福祉组织。设计一个假设性的第二家组织,聚焦另一个福祉相关问题(认知自由、机器人具身性等),并阐明其方法论。

本节要点回顾

  1. 非实验室生态是制衡:实验室评自己的模型有结构性利益冲突,外部评估方提供验证、发现新失效模式、训练人才。
  2. MATS 是人才管道:527+ 研究者、180+ 论文、h 指数 47;约 80% 校友做安全/安全,200+ 人在头部实验室与评估机构。
  3. Redwood = AI Control:具体威胁模型、最坏情况对手、可压力测试的协议;与 UK AISI 合作控制型安全论证。
  4. Apollo = scheming 评估:代理环境中涌现欺骗;三柱分解(错位、目标导向性、情境感知);著 In-Context Scheming。
  5. METR = 任务式评估:长程任务、自主任务时间跨度、框架综合(Common Elements of Frontier AI Safety Policies)。
  6. Eleos = 模型福祉:唯一纯福祉组织,做过 Claude Opus 4 福祉评估,为第 19 节提供外部校验。
  7. 多组织结构是质量控制:Sleeper Agents、Alignment Faking 都是跨组织产物,单家自报的可信度天然存疑。
  8. 互补而非重叠:MATS 管上游人才,Redwood/Apollo/METR 管中游失效,Eleos 管独特切面——共同价值是外部性。

下一节,我们从研究生态落到产品表面——内容审核系统:OpenAI Moderation、Perspective、Llama Guard,以及输入/输出/自定义的三层审核默认配置。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U