章节摘要:前七章的方法默认评测对象是"模型答一道题";当你要选的是 Agent(会调工具、会多步执行的模型系统)时,评测口径整体换轴。8.1 讲任务完成率与轨迹评测:任务级三态口径(成功/部分成功/失败——部分成功必须存在,因为"做了一半"与"完全没做"天差地别)+ 失败归因四分(模型、工具、环境、题目歧义——环境与工具的锅不算在模型头上,但也必须在报告里记账);证据从"答案"变成"轨迹":最小五项轨迹审查(目标可达、步骤支撑、工具调用正确、上下文使用、终止合理);环境纪律——工具版本、沙箱数据、重跑次数钉死,单轮完成率当运气看。8.2 讲虚报判定(Overclaim):Agent 的最终自述会声称"已读取、已修改、已验证",而轨迹记录可能不支持——OverclaimBench(arXiv 2026-09-18)把这现象标准化为可测对象;本书交付左中右三栏对照卡(自述原文、判定、记录证据)与三值判定(Supported / Unsupported / Contradicted)及判定纪律。Agent 评测的专论(环境工程、技能分层、多轮基准)见 《深入理解 AI Agent:设计原理与工程实践》第 6 章,本章只做选择者视角的判定方法。
阅读完本章,你应当能够:
(文字流程图) A ──▶ "过程层:轨迹支撑吗·(8.1 五项审查)" A ──▶ "自述层:汇报可信吗·(8.2 虚报判定)" B ──▶ "失败归因四分:模型 / 工具 / 环境 / 题目" "过程层:轨迹支撑吗·(8.1 五项审查)" ──▶ "失败归因四分:模型 / 工具 / 环境 / 题目" "自述层:汇报可信吗·(8.2 虚报判定)" ──▶ "三栏对照卡:·自述 | 判定 | 记录证据" "三栏对照卡:·自述 | 判定 | 记录证据" ──▶ "选择者的 Agent 证据链·(进 7.3 报告的 ④⑥ 区块)"
一句话金句:Agent 的最终汇报不是证据,轨迹才是——判定永远回到记录。
Agent 评测的三个不同;任务集与三态口径(含加权完成率脚本);失败归因四分与"先修基建再评模型";最小五项轨迹审查与抽样策略;环境纪律(快照、版本、重跑)。
Overclaim 的定义与危险(自述是默认界面);OverclaimBench 的标准化做法(2026-09-18 arXiv);左中右三栏对照卡与三值判定;判定纪律(原子化、区分"没做"与"没记"、证据定位);对内治理与对外选型两个用法。
8.1 任务完成率与轨迹评测(基本面:活干完没有 + 过程可信吗 + 失败算谁的) │ 完成率再高,汇报不可信也白搭 ↓ 8.2 虚报判定(可信面:自述 vs 记录逐条对账) │ ▼ 第 9 章:Agent 上线后的漂移监测同样回到轨迹(自述漂移是漂移的最早信号) (专论分工:环境工程与 Agent 基准建设 → 《深入理解 AI Agent:设计原理与工程实践》第 6 章)
章内读法提示:只做"选哪个 Agent/模型"的读者以 8.1 为主、8.2 学判定卡即可;要给自己的 Agent 产品建验收例程的读者,8.2 的对照卡与判定纪律是重点。
前置知识:
为后续奠定基础:8.1 的归因四分是第 9 章漂移归因的模板(漂了之后同样先问"是模型、工具、环境还是自己的 prompt 变了");8.2 的对照卡是 9.2 自动化告警里"自述一致性"检查的雏形。建设者侧,《Evals 实战》第 3 章的回归集同样适用于 Agent 场景,《深入理解 AI Agent:设计原理与工程实践》第 6 章是 Agent 评测的专论(本书只引用不重写)。