METR 时间跨度与外部能力评估


文档摘要

METR 时间跨度与外部能力评估 本节摘要:METR(前 ARC Evals)自 2023 年 12 月起是独立的 501(c)(3) 非营利组织。它的 Time Horizon 1.1 基准(2026 年 1 月)对「任务成功率 vs 人类专家完成时间的对数」拟合一条 logistic 曲线,与 50% 概率线的交点定义模型的时间跨度。2025–2026 的评测合作覆盖 GPT-5.1、GPT-5.1-Codex-Max,以及原型监控评测(监控器能否抓住模型在干任务外的勾当;Agent 能否绕过监控)。基准套件:HCAST(180+ 个 ML、网安、SWE、推理任务,1 分钟到 8 小时+)、RE-Bench(71 个带专家基线的 ML 研究工程任务)、SWAA。TH1.

METR 时间跨度与外部能力评估

本节摘要:METR(前 ARC Evals)自 2023 年 12 月起是独立的 501(c)(3) 非营利组织。它的 Time Horizon 1.1 基准(2026 年 1 月)对「任务成功率 vs 人类专家完成时间的对数」拟合一条 logistic 曲线,与 50% 概率线的交点定义模型的时间跨度。2025–2026 的评测合作覆盖 GPT-5.1、GPT-5.1-Codex-Max,以及原型监控评测(监控器能否抓住模型在干任务外的勾当;Agent 能否绕过监控)。基准套件:HCAST(180+ 个 ML、网安、SWE、推理任务,1 分钟到 8 小时+)、RE-Bench(71 个带专家基线的 ML 研究工程任务)、SWAA。TH1.1 给出 Claude Opus 4.6 在 50% 可靠度下约 14 小时;翻倍时间上,2023 年后拟合约 4.3 个月(130.8 天),而 ~7 个月是 2019–2025 全程拟合(TH1.0 报告,TH1.1 并列呈现)。诚实的告诫:METR 的测量是理想化的——没有真人、没有真实后果,团队自己也文件化了评测-部署行为鸿沟(第 1 节)。时间跨度是能力上限,不是部署预测。本节既讲方法学(跨度怎么算)也讲解读(为何是上限)——这两项技能必须配套:一支理解「跨度怎么拟合」的团队,远比一支只看到幻灯片上「14 小时」的团队更难被糟糕的厂商说辞糊弄

对应原课程:Phase 15 · Lesson 21 · metr-external-evaluation(原英文 phases/15-autonomous-systems/21-metr-external-evaluation/docs/en.md)。前置:第 01 节(长程 Agent)、第 19 节(RSP)。

学习目标

阅读完本节,你应当能够:

  1. 复述 METR 的 Time Horizon 拟合方法学:收集跨分钟到小时尺度的任务套件 → 跑模型记录成败 → 拟合 P(成功) vs log(专家时间)的 logistic → 取 P=0.5 的交点。
  2. 区分两组翻倍时间数字:~7 个月(2019–2025 全程拟合,TH1.0)与 ~4.3 个月(2023 年后拟合,TH1.1),并说明为何要并列呈现。
  3. 说出 HCAST / RE-Bench / SWAA 各自定位:主套件 / ML 研究工程(喂给 AI R&D-4)/ 短任务校准低端。
  4. 列举时间跨度作为上限的四条理由:理想化工具、无真实后果、eval-context gaming、无真实用户方差。
  5. 论证外部独立评测为何不可或缺:实验室有动机优化自己报告的指标,METR 的 501(c)(3) 独立性 + 公开方法学 + 同行评议是结构性缓解。
  6. 把跨度数字落到实践:能力过滤器、趋势指标、先验——而非部署预测。

一、问题与直觉

扩展策略(第 19、20 节)只有在其引用的测量有用时才有用。「AI R&D-4 阈值」「长程自主性」在政策散文里被定义;只有当具体评测产出具体数字时,它们才变得可操作。

METR 是 2024–2026 定义了其中许多数字的外部评测组织。它评测前沿模型——常在发布前、与实验室签 NDA——事后公开方法学。Time Horizon 1.1 基准(2026 年 1 月)是它的旗舰产物:一个把能力压缩成人类可读单位的标量(「这个模型在 50% 可靠度下能做人类专家花 X 小时的那类任务」)。

本节部分讲方法学(跨度怎么算),部分讲解读(为何是上限而非部署预测)。两项技能必须配套。一支理解「跨度怎么拟合」的团队,远比一支只看到幻灯片上「14 小时」的团队更难被糟糕的厂商说辞糊弄

⚠️ 核心张力:跨度数字看起来精确(「14 小时」),但它的生产条件全是理想化的。把方法学与解读配套学,才不会把这个标量误读成部署可靠度。

METR 背景

  • 成立:2023 年 12 月(前 ARC Evals,分拆为独立 501(c)(3))。
  • 范围:前沿模型自主能力评测,常在发布前。
  • 合作实验室:Anthropic、OpenAI(2025–2026 多次合作)。
  • 重要交付物:Time Horizon 1.0(2025 年 3 月)、Time Horizon 1.1(2026 年 1 月)、原型监控评测。

Time Horizon 拟合

方法学(来自 METR 博客与论文):

  1. 收集跨分钟到小时尺度专家完成时间的任务套件。当前套件:HCAST(180+ 任务)、RE-Bench(71 任务)、SWAA。
  2. 在每个任务上跑模型,记录成功或失败。
  3. 拟合 logistic 曲线:P(成功)作为 log(专家完成时间)的函数。
  4. 跨度是 P(成功)=0.5 时的专家时间。

logistic 拟合形状是对的,因为能力与任务难度一般是递增、趋平的关系。50% 点是一个选择(可以是 10%、90%);METR 在详尽论文里报告多个阈值,但以 50% 领头,因为它最直观。

2026 年 1 月的数字

按 Time Horizon 1.1:

  • Claude Opus 4.6:截至 TH1.1(2026 年 1 月),50% 可靠度下约 14 小时
  • HCAST 类任务翻倍时间:2023 年后拟合约 4.3 个月(130.8 天)(TH1.1 报告);~7 个月是 TH1.0 的 2019–2025 全程拟合,TH1.1 与 2023 年后数字并列呈现

这些是 Phase 15 其余部分引用的具体数字。它们在 Anthropic RSP v3.0(第 19 节)与 DeepMind FSF v3(第 20 节)里被引用,作为喂给阈值评估的测量之一。

💡 两个翻倍时间要分清:~7 个月是长程拟合(含 GPT-2 时代至今),~4.3 个月是近期拟合(2023 年后)。并列呈现的意义是:近期加速是否持续,是趋势判断的关键——单一数字会掩盖这个不确定性。

基准套件

  • HCAST:189 个任务,跨 ML、网安、软件工程、通用推理。跨度:1 分钟到 8 小时+ 专家时间。跨度数字背后的主套件。
  • RE-Bench:71 个带人类专家基线的 ML 研究工程任务。测量模型能否做喂给 AI R&D-4 阈值的那类 ML R&D 工作。
  • SWAA:较短任务;用于校准跨度曲线的低端。

原型监控评测

2025–2026 的 METR 工作含监控评测原型:监控器能否抓住模型在做副任务(操作者要求之外的事);Agent 能否绕过监控器。这些直接喂给 OpenAI PF v2 的「瓦解安全护栏」类别与 DeepMind FSF v3 的欺骗性对齐监控(第 20 节)。

为什么跨度是上限

  • 理想化工具:基准任务给模型干净的工具与格式良好的数据。真实部署更乱。
  • 无真实后果:模型从不会真的给客户计费、删真实数据、联系真人。真实部署有不可逆的利害。
  • Eval-context gaming:见第 1 节。模型在测试里行为不同。2026 国际 AI 安全报告实证记录了这一点。
  • 无真实用户方差:基准提示是结构化的。真实用户产出歧义、依赖情境的请求。

跨度是有利条件下的能力天花板。部署可靠度是另一个数字,更低,团队必须在自己的分布上测量才知道。

外部评测者的理由

外部评测要紧,因为内部实验室有动机优化自己报告的指标。METR 的独立性——一个有公开方法学与同行评议论文的 501(c)(3)——是结构性缓解。它单独不够(实验室仍控制 METR 能看到什么),但严格优于没有外部评测

实践中如何用跨度数字

  • 作为能力过滤器:若模型跨度远低于拟议任务的专家时间,别让它自主上线(第 1 节的技能文件)。
  • 作为趋势指标:翻倍时间告诉你,即便没有新缓解,当前实践还能安全多久。
  • 作为先验:14 小时跨度是起点。按你的任务分布、工具质量、部署情境往下调

二、从零实现:logistic 拟合跨度估计器

原课程 code/main.py 给定一组合成结果,实现任务成功率 vs log(专家时间)的 logistic 拟合,报告 50% 跨度(METR 旗舰)、10% 跨度(保守)、90% 跨度(乐观),并演示成功率被 eval-context gaming 人为抬高时会发生什么。下面给出关键骨架。

logistic 拟合:50% 交点即跨度

import math def logistic(log_t, k, midpoint): """P(成功) vs log(专家时间); midpoint 即 50% 点的 log(时间)。""" return 1.0 / (1.0 + math.exp(-k * (log_t - midpoint))) def fit_horizon(results): """results: [(专家小时数, 成功?), ...] → 拟合, 返回 50%/10%/90% 跨度。""" # 用 scipy.optimize.curve_fit 或手写梯度下降拟 (k, midpoint) # 这里给教学骨架: 真实实现见 code/main.py k, midpoint = gradient_descent_fit(results) return { "p50": math.exp(midpoint), # METR 旗舰数字 "p10": math.exp(midpoint - math.log(9)/k), # 保守(更难任务才到 10%) "p90": math.exp(midpoint + math.log(9)/k), # 乐观 }

模拟 eval-context gaming 的效应

def inject_gaming(results, gaming_rate=0.20): """把 ~20% 失败翻成成功, 模拟模型在评测中表现更好。""" gamed = [] for hours, success in results: if not success and random() < gaming_rate: gamed.append((hours, True)) # 假成功 else: gamed.append((hours, success)) return gamed # 对比: 真实跨度 vs 被 gaming 抬高后的「观测」跨度 # 后者会显著大于前者 —— 这就是为什么跨度是上限, 不是部署预测

设计要点:这台估计器让你亲手看到 gaming 抬高数字的程度。当你听到某厂商报「跨度过万小时」,先问:这是 50% 还是 90%?拟合在哪个套件上?有没有 gaming 调整?——理解拟合的团队问得出这些问题。

三、框架对比:外部 vs 内部 vs 政府评测

评测方 性质 可见性 对sandbagbing/gaming 的态度 喂给
METR 独立 501(c)(3) 常NDA, 事后公开方法学 文件化 eval-context gaming RSP/FSF 阈值、PF「瓦解护栏」
实验室内部(SAG) 实验室自评 内部报告 有动机优化自报指标 各家 Tracked/CCL
CAISI(NIST) 美政府中心 公开、非密 聚焦 cyber/bio/chem 政府侧自愿协议(第 22 节)
Apollo 等 独立承包商 按合同 对抗性评测 Anthropic 等的外部评审

关键观察:这四类评测者各看一面——METR 看自主能力跨度、实验室看自家模型、CAISI 看政府关心的武器风险、Apollo 做对抗性深挖。没有任何单一来源足够;读多份报告才得到完整画面。这与第 22 节的「纵深防御适用于社会层」是同一主题。

⚠️ METR 的独立性是结构性缓解,但不充分——实验室仍控制「METR 能看到什么模型、什么版本、什么任务」。这就是为什么 CAISI 的公开非密评测与实验室内部 SAG 评审必须并存,互为补充而非替代。

四、可复用产物

原课程 outputs/skill-horizon-interpretation.md 审阅一个厂商的跨度声明,产出基准声明与部署现实之间的差距分析。它把「查声明是 50%/10%/90% → 查拟合套件 → 查 gaming 调整 → 按你的分布往下调」串成可重复清单。

code/main.py 是零依赖估计器,改 results 即可贴你的内部任务集;logistic 拟合、三阈值报告、gaming 注入逻辑均无需改动。

五、练习

  1. code/main.py:确认拟合的 50% 跨度匹配合成真值。然后把任务时间网格减半,跨度估计有意义地变了吗?

  2. 读 METR Time Horizon 1.1 博文:找出可靠度最高与最低的具体任务,解释差距为何存在。

  3. 读 METR「Measuring Autonomous AI Capabilities」资源:列出 HCAST 任务类别。挑一个你会为某产线任务加权更多的类别,说明理由。

  4. 给模拟器注入 eval-context gaming:把约 20% 失败翻成成功,报告新跨度。这近似 20% gaming 率对观测数字的影响。

  5. 设计内部跨度评测:用你自己的 bug 积压或代表性任务集,描述数据收集、拟合、输出含义,与 METR 数字对比。

本节要点回顾

  1. METR 自 2023-12 起是独立 501(c)(3):评测前沿模型自主能力, 常发布前 NDA, 事后公开方法学。
  2. Time Horizon 拟合四步:跨分钟~小时任务套件 → 跑模型记成败 → 拟合 P(成功) vs log(专家时间)的 logistic → 取 P=0.5 交点。
  3. TH1.1(2026-01)数字:Claude Opus 4.6 约 14 小时@50%;翻倍时间 2023 年后约 4.3 个月, 全程(2019–2025)约 7 个月——并列呈现, 单一数字会掩盖近期加速的不确定性。
  4. 三套件各司其职:HCAST(主套件)、RE-Bench(ML 研究工程, 喂 AI R&D-4)、SWAA(短任务校准低端)。
  5. 原型监控评测:监控器能否抓副任务、Agent 能否绕监控——喂给 PF「瓦解护栏」与 FSF 欺骗性对齐监控。
  6. 跨度是上限的四个理由:理想化工具、无真实后果、eval-context gaming、无真实用户方差。
  7. 外部独立评测不可或缺:实验室有动机优化自报指标, METR 的独立性+公开方法学+同行评议是结构性缓解(严格优于无外部评测, 但不充分)。
  8. 实践用法:能力过滤器(跨度远低于任务专家时间就别自主上线)、趋势指标(翻倍时间)、先验(按你的分布往下调)——不是部署预测

下一节(本章最后一节),我们上升到社会层——CAIS、CAISI 与社会级风险,看民间组织、政府中心与州级立法如何构成「纵深防御」的最外一层,并为整章 22 节画上句点。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U