章节摘要:全书枢纽。前五章都在处理"别人的分数"——怎么读、怎么疑、怎么折价;本章开始造自己的分数。4.2 的结论是:任务距离 ≥7 的场景,公开分数只能当线索,唯一出路是自测;本章把这条出路铺成两小时可以走完的路。6.1 交付五十条盲测:从自己的场景造 50 题(真实样本脱敏、边界案例、失败重放三来源配比),双模型匿名作答,0/1/2 口径判分,分项汇总,配对 bootstrap 检验差异是否超出噪声带——完整脚本纯标准库可直接运行,模型调用留了清晰的挂载点。6.2 交付成对比较与内部竞技场:当任务开放到"没有对错只有偏好"时,0/1/2 失效,改用 2.1 讲过的成对机制——评审在两个匿名回答里二选一,战果交给简易 Elo 排名,直接复用前半的分差换算(2.1)与区间思维(2.2);裁判(LLM-as-judge)选项的深入做法,指向《Evals 实战》第 5 章。本章跑完,你手里就有了一段可写进选型报告、可复跑、可交接的第一手证据。
阅读完本章,你应当能够:
(文字流程图) B ──▶ C C ──"有(可 0/1/2 判)"──▶ "6.1 五十条盲测·双模型匿名 · 0/1/2 · 分项 + bootstrap" C ──"没有(偏好型任务)"──▶ "6.2 内部竞技场·成对投票 · 简易 Elo · 对战矩阵" "6.1 五十条盲测·双模型匿名 · 0/1/2 · 分项 + bootstrap" ──▶ "分差 + 置信区间·(复用 2.2 抽样思维)" "6.2 内部竞技场·成对投票 · 简易 Elo · 对战矩阵" ──▶ "分差换算胜率·(复用 2.1 公式)" "分差换算胜率·(复用 2.1 公式)" ──▶ "第一手证据 -> 第 7 章选型报告·顺手留档 -> 5.2 身份基线 / 第 9 章锚点题集"
一句话金句:五十条自己的题,胜过五千条别人的题。
为什么是五十条;出题三来源与配比;完整可运行脚本(出题 → 盲答 → 判分 → 分项汇总 → 配对 bootstrap 差异检验);判分纪律与读结果;从五十条到回归集的升级路径。
0/1/2 失效的开放任务;内部竞技场的组织(匿名、乱序、评审投票);简易 Elo 脚本与对战矩阵;复用前半的换算与区间检查;模型裁判选项的三条纪律(深入做法详见《Evals 实战》第 5 章)。
6.1 五十条盲测(主流路径:可判分任务 -> 分数 + 区间) │ 开放任务判不了分 ↓ 6.2 成对比较与内部竞技场(偏好路径:投票 -> Elo -> 换算) │ ▼ 第 7 章:证据进入决策(需求矩阵 · 成本延迟质量三角 · 选型报告) (前半锚点在此兑现:4.2"距离 ≥7 必须自测"、0.2 分工表"两书在第 6 章交汇")
前置知识:
为后续奠定基础:6.1 的题集与基线留档,就是 5.2 身份探针与第 9 章锚点题集的来源——一次造题,三处复用;7.3 选型报告的"自测证据"区块直接消费本章输出。规模化边界也在此画线:五十条够选型用,要建回归集、模型裁判流水线与线上监控,转《Evals 实战》第 3/5 章(建设者篇)——那是 0.2 分工表里两书交汇的岔路口。
章内读法提示:时间紧的读者直接进 6.1——脚本跑通即拿到第一手证据;评审口味重或任务偏开放的读者加读 6.2。