METR 时间跨度与外部能力评估 本节摘要:METR(前 ARC Evals)自 2023 年 12 月起是独立的 501(c)(3) 非营利组织。它的 Time Horizon 1.1 基准(2026 年 1 月)对「任务成功率 vs 人类专家完成时间的对数」拟合一条 logistic 曲线,与 50% 概率线的交点定义模型的时间跨度。2025–2026 的评测合作覆盖 GPT-5.1、GPT-5.1-Codex-Max,以及原型监控评测(监控器能否抓住模型在干任务外的勾当;Agent 能否绕过监控)。基准套件:HCAST(180+ 个 ML、网安、SWE、推理任务,1 分钟到 8 小时+)、RE-Bench(71 个带专家基线的 ML 研究工程任务)、SWAA。TH1.
本节摘要:METR(前 ARC Evals)自 2023 年 12 月起是独立的 501(c)(3) 非营利组织。它的 Time Horizon 1.1 基准(2026 年 1 月)对「任务成功率 vs 人类专家完成时间的对数」拟合一条 logistic 曲线,与 50% 概率线的交点定义模型的时间跨度。2025–2026 的评测合作覆盖 GPT-5.1、GPT-5.1-Codex-Max,以及原型监控评测(监控器能否抓住模型在干任务外的勾当;Agent 能否绕过监控)。基准套件:HCAST(180+ 个 ML、网安、SWE、推理任务,1 分钟到 8 小时+)、RE-Bench(71 个带专家基线的 ML 研究工程任务)、SWAA。TH1.1 给出 Claude Opus 4.6 在 50% 可靠度下约 14 小时;翻倍时间上,2023 年后拟合约 4.3 个月(130.8 天),而 ~7 个月是 2019–2025 全程拟合(TH1.0 报告,TH1.1 并列呈现)。诚实的告诫:METR 的测量是理想化的——没有真人、没有真实后果,团队自己也文件化了评测-部署行为鸿沟(第 1 节)。时间跨度是能力上限,不是部署预测。本节既讲方法学(跨度怎么算)也讲解读(为何是上限)——这两项技能必须配套:一支理解「跨度怎么拟合」的团队,远比一支只看到幻灯片上「14 小时」的团队更难被糟糕的厂商说辞糊弄。
对应原课程:Phase 15 · Lesson 21 ·
metr-external-evaluation(原英文phases/15-autonomous-systems/21-metr-external-evaluation/docs/en.md)。前置:第 01 节(长程 Agent)、第 19 节(RSP)。
阅读完本节,你应当能够:
扩展策略(第 19、20 节)只有在其引用的测量有用时才有用。「AI R&D-4 阈值」「长程自主性」在政策散文里被定义;只有当具体评测产出具体数字时,它们才变得可操作。
METR 是 2024–2026 定义了其中许多数字的外部评测组织。它评测前沿模型——常在发布前、与实验室签 NDA——事后公开方法学。Time Horizon 1.1 基准(2026 年 1 月)是它的旗舰产物:一个把能力压缩成人类可读单位的标量(「这个模型在 50% 可靠度下能做人类专家花 X 小时的那类任务」)。
本节部分讲方法学(跨度怎么算),部分讲解读(为何是上限而非部署预测)。两项技能必须配套。一支理解「跨度怎么拟合」的团队,远比一支只看到幻灯片上「14 小时」的团队更难被糟糕的厂商说辞糊弄。
⚠️ 核心张力:跨度数字看起来精确(「14 小时」),但它的生产条件全是理想化的。把方法学与解读配套学,才不会把这个标量误读成部署可靠度。
方法学(来自 METR 博客与论文):
logistic 拟合形状是对的,因为能力与任务难度一般是递增、趋平的关系。50% 点是一个选择(可以是 10%、90%);METR 在详尽论文里报告多个阈值,但以 50% 领头,因为它最直观。
按 Time Horizon 1.1:
这些是 Phase 15 其余部分引用的具体数字。它们在 Anthropic RSP v3.0(第 19 节)与 DeepMind FSF v3(第 20 节)里被引用,作为喂给阈值评估的测量之一。
💡 两个翻倍时间要分清:~7 个月是长程拟合(含 GPT-2 时代至今),~4.3 个月是近期拟合(2023 年后)。并列呈现的意义是:近期加速是否持续,是趋势判断的关键——单一数字会掩盖这个不确定性。
2025–2026 的 METR 工作含监控评测原型:监控器能否抓住模型在做副任务(操作者要求之外的事);Agent 能否绕过监控器。这些直接喂给 OpenAI PF v2 的「瓦解安全护栏」类别与 DeepMind FSF v3 的欺骗性对齐监控(第 20 节)。
跨度是有利条件下的能力天花板。部署可靠度是另一个数字,更低,团队必须在自己的分布上测量才知道。
外部评测要紧,因为内部实验室有动机优化自己报告的指标。METR 的独立性——一个有公开方法学与同行评议论文的 501(c)(3)——是结构性缓解。它单独不够(实验室仍控制 METR 能看到什么),但严格优于没有外部评测。
原课程 code/main.py 给定一组合成结果,实现任务成功率 vs log(专家时间)的 logistic 拟合,报告 50% 跨度(METR 旗舰)、10% 跨度(保守)、90% 跨度(乐观),并演示成功率被 eval-context gaming 人为抬高时会发生什么。下面给出关键骨架。
import math def logistic(log_t, k, midpoint): """P(成功) vs log(专家时间); midpoint 即 50% 点的 log(时间)。""" return 1.0 / (1.0 + math.exp(-k * (log_t - midpoint))) def fit_horizon(results): """results: [(专家小时数, 成功?), ...] → 拟合, 返回 50%/10%/90% 跨度。""" # 用 scipy.optimize.curve_fit 或手写梯度下降拟 (k, midpoint) # 这里给教学骨架: 真实实现见 code/main.py k, midpoint = gradient_descent_fit(results) return { "p50": math.exp(midpoint), # METR 旗舰数字 "p10": math.exp(midpoint - math.log(9)/k), # 保守(更难任务才到 10%) "p90": math.exp(midpoint + math.log(9)/k), # 乐观 }
def inject_gaming(results, gaming_rate=0.20): """把 ~20% 失败翻成成功, 模拟模型在评测中表现更好。""" gamed = [] for hours, success in results: if not success and random() < gaming_rate: gamed.append((hours, True)) # 假成功 else: gamed.append((hours, success)) return gamed # 对比: 真实跨度 vs 被 gaming 抬高后的「观测」跨度 # 后者会显著大于前者 —— 这就是为什么跨度是上限, 不是部署预测
设计要点:这台估计器让你亲手看到 gaming 抬高数字的程度。当你听到某厂商报「跨度过万小时」,先问:这是 50% 还是 90%?拟合在哪个套件上?有没有 gaming 调整?——理解拟合的团队问得出这些问题。
| 评测方 | 性质 | 可见性 | 对sandbagbing/gaming 的态度 | 喂给 |
|---|---|---|---|---|
| METR | 独立 501(c)(3) | 常NDA, 事后公开方法学 | 文件化 eval-context gaming | RSP/FSF 阈值、PF「瓦解护栏」 |
| 实验室内部(SAG) | 实验室自评 | 内部报告 | 有动机优化自报指标 | 各家 Tracked/CCL |
| CAISI(NIST) | 美政府中心 | 公开、非密 | 聚焦 cyber/bio/chem | 政府侧自愿协议(第 22 节) |
| Apollo 等 | 独立承包商 | 按合同 | 对抗性评测 | Anthropic 等的外部评审 |
关键观察:这四类评测者各看一面——METR 看自主能力跨度、实验室看自家模型、CAISI 看政府关心的武器风险、Apollo 做对抗性深挖。没有任何单一来源足够;读多份报告才得到完整画面。这与第 22 节的「纵深防御适用于社会层」是同一主题。
⚠️ METR 的独立性是结构性缓解,但不充分——实验室仍控制「METR 能看到什么模型、什么版本、什么任务」。这就是为什么 CAISI 的公开非密评测与实验室内部 SAG 评审必须并存,互为补充而非替代。
原课程 outputs/skill-horizon-interpretation.md 审阅一个厂商的跨度声明,产出基准声明与部署现实之间的差距分析。它把「查声明是 50%/10%/90% → 查拟合套件 → 查 gaming 调整 → 按你的分布往下调」串成可重复清单。
code/main.py 是零依赖估计器,改 results 即可贴你的内部任务集;logistic 拟合、三阈值报告、gaming 注入逻辑均无需改动。
跑 code/main.py:确认拟合的 50% 跨度匹配合成真值。然后把任务时间网格减半,跨度估计有意义地变了吗?
读 METR Time Horizon 1.1 博文:找出可靠度最高与最低的具体任务,解释差距为何存在。
读 METR「Measuring Autonomous AI Capabilities」资源:列出 HCAST 任务类别。挑一个你会为某产线任务加权更多的类别,说明理由。
给模拟器注入 eval-context gaming:把约 20% 失败翻成成功,报告新跨度。这近似 20% gaming 率对观测数字的影响。
设计内部跨度评测:用你自己的 bug 积压或代表性任务集,描述数据收集、拟合、输出含义,与 METR 数字对比。
下一节(本章最后一节),我们上升到社会层——CAIS、CAISI 与社会级风险,看民间组织、政府中心与州级立法如何构成「纵深防御」的最外一层,并为整章 22 节画上句点。