Evals 实战 · 第 9 章 评测工程化


Evals 实战 · 第 9 章 评测工程化

章节摘要:最后一章解决"评测怎么活下来"——个人脚本会随人离职而失传,评测要成为团队资产,必须进仓库、进门禁、且自身被体检。9.1 评测即代码:回归集数据、rubric、跑分脚本、阈值配置全部进 git;目录有约定(datasets / rubrics / scripts / reports),变更走 PR、diff 有报告(增删改几条一目了然),数据卡(3.4 节)与数据同存放;配一个 lint 脚本把关入库质量——id 唯一、必填字段齐、分层标签合法、种子与版本已声明,lint 不过 CI 不收。9.2 CI 门禁与团队协作:GitHub Actions 在每次 PR 上自动跑评测,阻塞线(主集通过率、hard 子集、安全子集)红了挡合并,观察线(成本、延迟波动)只评论不挡;失败要分流——真回归修代码、评测集过期走重标流程、环境抖动有重试上限,杜绝"红了就重跑到绿";配套团队机制:评测 owner、badcase 入库流程、门禁豁免须记录在案。9.3 评测的评测:三个反模式——过拟合评测集(向考卷刷分,回归集分涨线上不涨)、指标 gaming(Goodhart 定律在 LLM 的重演,分数与业务脱钩)、回归集腐化(样本过期、全绿无信息、分布失配)——各自的症状与解药;元评测清单四项:线上 badcase 覆盖率、裁判-人工 kappa、离线-在线秩相关、门禁拦截有效率。评测体系自身也需要年检,这是工程闭环的最后一块砖。

学习目标

阅读完本章,你应当能够:

  1. 设计评测资产的仓库目录结构,并落地"变更走 PR + diff 报告"的纪律。
  2. 运行评测集 lint 脚本把关入库质量。
  3. 写出 GitHub Actions 评测门禁(阻塞线 + 观察线 + 失败分流)。
  4. 识别三大反模式的症状并执行对应解药。
  5. 用四项元评测指标给评测体系做年检。
  6. 把第 3~8 章的全部产出(考卷、指标、裁判、参数、面板)接进同一套仓库与流水线。

核心概念速览

(文字流程图) B ──▶ "9.3 评测的评测·过拟合 / gaming / 腐化 三反模式 + 元评测清单" "9.3 评测的评测·过拟合 / gaming / 腐化 三反模式 + 元评测清单" ──▶ "评测体系成为团队资产·(可交接、可审计、可持续)"

一句话金句:评测不进仓库就只是脚本,进门禁才成为资产;而资产也要年检——考卷本身会过期。

子章节导航

9.1 评测即代码:评测集进仓库

目录约定与数据卡同存放;lint 脚本五项检查;变更 PR 化与 diff 报告;大二进制数据的例外处理。

9.2 CI门禁与团队协作

GitHub Actions 示例(跑评测 + 阈值退出码 + 报告 artifact);阻塞线与观察线的划分;失败三分流;评测 owner 与豁免流程。

9.3 评测的评测:元问题与反模式

过拟合评测集(留出集隔离);指标 gaming(对抗性审计);回归集腐化(季度体检);元评测四指标。

子章节之间的逻辑关系

9.1 评测即代码(资产化:进仓库、有 lint、走 PR) │ 资产就位,才能挂到研发流程上 ↓ 9.2 CI 门禁与团队协作(流程化:PR 自动跑、红线挡合并) │ 门禁用久了会出现系统性病变 ↓ 9.3 评测的评测(体检:三大反模式的症状与解药) │ ▼ 闭环:元体检的结论回写考卷与指标 → 回到 9.1 的下一轮变更 (全书终点:评测体系自身也服从工程迭代律)

前置知识与后续延伸

前置知识:第 3.4 节(数据卡与版本化——9.1 的直接前置);第 6.1 节(Promptfoo 阈值退出码——9.2 门禁的执行原语);第 4.1 节(Goodhart 与单一指标谬误——9.3 gaming 反模式的理论根);第 8 章(线上监控——9.3 元评测的线上数据来源)。

为后续奠定基础:本章是全书工程化的收口:9.1 的目录与 9.2 的流水线即读者自己项目的起点清单;9.3 的元评测应纳入季度节奏,与 7.3 PSI 体检、8.3 演练同排一张日历。延伸阅读:Agent 评测与 Elo 见 《深入理解 AI Agent:设计原理与工程实践》第 6 章;评测工程实践见 Hamel Husain 与 Eugene Yan 的系列文章。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U