对齐研究生态 本节摘要:前沿实验室(第 18 节)在内部做安全评估并选择性发布结果,而实验室之外的那一层生态负责验证评估、率先发现新型失效模式、并训练人才。本节绘制 2026 年非实验室对齐研究层的五个核心组织版图:MATS(ML Alignment & Theory Scholars,2021 年底至今 527+ 研究者、180+ 论文、1 万+ 引用、h 指数 47,约 80% 校友从事安全/安全,200+ 人在 Anthropic/DeepMind/OpenAI/UK AISI/RAND/Redwood/METR/Apollo)——人才管道;Redwood Research(Buck Shlegeris 创办,提出 AI Control 第 10 节,与 UK AISI
本节摘要:前沿实验室(第 18 节)在内部做安全评估并选择性发布结果,而实验室之外的那一层生态负责验证评估、率先发现新型失效模式、并训练人才。本节绘制 2026 年非实验室对齐研究层的五个核心组织版图:MATS(ML Alignment & Theory Scholars,2021 年底至今 527+ 研究者、180+ 论文、1 万+ 引用、h 指数 47,约 80% 校友从事安全/安全,200+ 人在 Anthropic/DeepMind/OpenAI/UK AISI/RAND/Redwood/METR/Apollo)——人才管道;Redwood Research(Buck Shlegeris 创办,提出 AI Control 第 10 节,与 UK AISI 合作控制型安全论证)——具体威胁模型;Apollo Research(前沿模型部署前的 scheming 评估,著《In-Context Scheming》第 8 节、《Towards Safety Cases for AI Scheming》)——代理环境中的欺骗评估;METR(任务式能力评估、自主任务时间跨度研究、《Common Elements of Frontier AI Safety Policies》框架对比)——长程任务度量;Eleos AI(模型福祉部署前评估第 19 节,做过 Claude Opus 4 福祉评估)。理解这个生态,才能判断「哪项发现被谁信任、为什么」。
对应原课程:Phase 18 · Lesson 28 ·
alignment-research-ecosystem(原英文phases/18-ethics-safety-alignment/28-alignment-research-ecosystem/docs/en.md)。前置:Phase 18 · 01~27。
阅读完本节,你应当能够:
前沿实验室(第 18 节)产生安全评估并发布选择性结果。但实验室评估自己的模型存在结构性利益冲突——它既有动机把模型评得安全(为了发布),也有动机不暴露自家模型的最坏情况。实验室之外的生态正是对这种冲突的制衡:评估在这里被验证、新型失效模式在这里被率先发现、人才在这里被训练。理解这个生态,才能解读「哪项研究被谁信任」。
MATS 训练研究者。毕业生流向两处:实验室安全团队(Anthropic、DeepMind、OpenAI)或外部评估方(Redwood、Apollo、METR、Eleos)。外部评估方与实验室及 UK AISI / CAISI 合作。发表的论文反哺生态,成为 MATS 下一届学员的教材。
单一来源评估不可靠。实验室评自己的模型有结构性利益冲突。外部评估方能提出并验证实验室可能低报的失效模式。看几个跨组织合作案例:
多组织结构本身就是质量控制。
💡 这也解释了为什么本系列前面那么多节都反复引用这几家机构——它们不是孤立的论文出处,而是一张相互制衡的研究网络。读到「Anthropic + Redwood」时,你应当想到「这不是自评,是联合评估」。
2021 年底启动。研究导师制项目:学者花 10-12 周与一位资深研究者合作攻克一个具体的对齐问题。
规模(2026):
职业去向:约 80% 的 2025 年前校友从事安全/安全工作。200+ 人在 Anthropic、DeepMind、OpenAI、UK AISI、RAND、Redwood、METR、Apollo。
应用对齐实验室。由 Buck Shlegeris 创办。提出 AI Control 议程(第 10 节)。与 UK AISI 合作控制型安全论证(control safety cases)。为 DeepMind 和 Anthropic 的评估设计提供咨询。
代表性论文:Greenblatt、Shlegeris 等《AI Control》(arXiv:2312.06942,ICML 2024);《Alignment Faking》(Greenblatt、Denison、Wright 等,arXiv:2412.14093,与 Anthropic 合著)。
风格:具体的威胁模型、最坏情况对手、可被压力测试的具体协议。
面向前沿实验室的部署前 scheming 评估。著《In-Context Scheming》(第 8 节,arXiv:2412.04984)。是 2025 年 OpenAI 反 scheming 训练合作的伙伴。产出《Towards Safety Cases for AI Scheming》(2024)。
风格:在可能涌现欺骗的代理环境中评估;三柱分解(错位 misalignment、目标导向性 goal-directedness、情境感知 situational awareness)。
任务式能力评估。自主任务完成的时间跨度研究。《Common Elements of Frontier AI Safety Policies》(metr.org/common-elements,2025)对比各实验室框架。
与 Apollo 合著 AI Scheming 安全论证草案。
风格:长程任务评估、实证能力度量、框架综合。
模型福祉的部署前评估。完成了 Claude Opus 4 系统卡 5.3 节记录的福祉评估。为第 19 节的福祉相关主张提供外部方法论校验。
| 组织 | 核心输出 | 方法论风格 | 典型合作 |
|---|---|---|---|
| MATS | 人才管道(527+ 学者) | 导师制 + 具体问题 | 校友 → 各实验室/外部评估方 |
| Redwood | AI Control 议程、控制型安全论证 | 具体威胁模型、最坏情况对手 | UK AISI、Anthropic、DeepMind |
| Apollo | 部署前 scheming 评估 | 代理环境涌现欺骗、三柱分解 | OpenAI、METR |
| METR | 任务式能力评估、框架对比 | 长程任务、实证度量、综合 | Apollo、各实验室 |
| Eleos | 模型福祉评估 | 福祉方法论、部署前校验 | Anthropic(Claude Opus 4) |
设计要点:五个组织是互补而非重叠的——MATS 管上游(人才),Redwood/Apollo/METR 管中游(失效模式发现与评估),Eleos 管一个独特切面(模型福祉)。它们的共同价值是外部性:都不生产模型,因此评估结论不与「自家产品能不能发」绑定。这也正是为什么 Sleeper Agents、Alignment Faking 这类敏感发现都是跨组织产物——单家实验室自报的可信度天然存疑。
本节产出 outputs/skill-ecosystem-map.md:给它一项对齐主张或评估,它识别所属组织、发表场所、方法论风格,并与已知的对标组织交叉核验。
本节无代码。建议读 METR 的《Common Elements of Frontier AI Safety Policies》,作为「外部综合如何为实验室内部政策工作增值」的范例。
Easy:从第 7~15 节任选一篇论文,识别涉及的组织。把作者与 MATS 校友及当前生态归属交叉核验。
Medium:读 METR《Common Elements of Frontier AI Safety Policies》。识别它强调的三个跨实验室趋同点和两个最大分歧。
Medium:MATS 的职业去向约 80% 是安全/安全。论证这种选择压力是适应性的(训练了领域)还是有偏的(过滤了异见立场)。
Hard:Redwood 和 Apollo 都做控制/scheming 工作,但风格不同。选一个失效模式,描述各自会如何调查。
Hard:Eleos AI 是唯一纯模型福祉组织。设计一个假设性的第二家组织,聚焦另一个福祉相关问题(认知自由、机器人具身性等),并阐明其方法论。
下一节,我们从研究生态落到产品表面——内容审核系统:OpenAI Moderation、Perspective、Llama Guard,以及输入/输出/自定义的三层审核默认配置。