大模型评测与选型 · 第 6 章 自建轻量实测


大模型评测与选型 · 第 6 章 自建轻量实测

章节摘要:全书枢纽。前五章都在处理"别人的分数"——怎么读、怎么疑、怎么折价;本章开始造自己的分数。4.2 的结论是:任务距离 ≥7 的场景,公开分数只能当线索,唯一出路是自测;本章把这条出路铺成两小时可以走完的路。6.1 交付五十条盲测:从自己的场景造 50 题(真实样本脱敏、边界案例、失败重放三来源配比),双模型匿名作答,0/1/2 口径判分,分项汇总,配对 bootstrap 检验差异是否超出噪声带——完整脚本纯标准库可直接运行,模型调用留了清晰的挂载点。6.2 交付成对比较与内部竞技场:当任务开放到"没有对错只有偏好"时,0/1/2 失效,改用 2.1 讲过的成对机制——评审在两个匿名回答里二选一,战果交给简易 Elo 排名,直接复用前半的分差换算(2.1)与区间思维(2.2);裁判(LLM-as-judge)选项的深入做法,指向《Evals 实战》第 5 章。本章跑完,你手里就有了一段可写进选型报告、可复跑、可交接的第一手证据。

学习目标

阅读完本章,你应当能够:

  1. 说明为什么是五十条、什么时候必须加码。
  2. 按三来源配比从自己的场景出题,并执行"盲"的三重纪律。
  3. 跑通完整盲测脚本:出题、盲答、0/1/2 判分、分项汇总、差异检验。
  4. 判断什么任务该用成对比较,并搭起三模型的内部竞技场。
  5. 用 2.1 换算与 2.2 区间读内部竞技场的 Elo 结果。
  6. 说清何时从"选择者脚本"升级到《Evals 实战》的回归集工程。

核心概念速览

(文字流程图) B ──▶ C C ──"有(可 0/1/2 判)"──▶ "6.1 五十条盲测·双模型匿名 · 0/1/2 · 分项 + bootstrap" C ──"没有(偏好型任务)"──▶ "6.2 内部竞技场·成对投票 · 简易 Elo · 对战矩阵" "6.1 五十条盲测·双模型匿名 · 0/1/2 · 分项 + bootstrap" ──▶ "分差 + 置信区间·(复用 2.2 抽样思维)" "6.2 内部竞技场·成对投票 · 简易 Elo · 对战矩阵" ──▶ "分差换算胜率·(复用 2.1 公式)" "分差换算胜率·(复用 2.1 公式)" ──▶ "第一手证据 -> 第 7 章选型报告·顺手留档 -> 5.2 身份基线 / 第 9 章锚点题集"

一句话金句:五十条自己的题,胜过五千条别人的题。

子章节导航

6.1 五十条盲测:最小可行实测

为什么是五十条;出题三来源与配比;完整可运行脚本(出题 → 盲答 → 判分 → 分项汇总 → 配对 bootstrap 差异检验);判分纪律与读结果;从五十条到回归集的升级路径。

6.2 成对比较与内部竞技场

0/1/2 失效的开放任务;内部竞技场的组织(匿名、乱序、评审投票);简易 Elo 脚本与对战矩阵;复用前半的换算与区间检查;模型裁判选项的三条纪律(深入做法详见《Evals 实战》第 5 章)。

子章节之间的逻辑关系

6.1 五十条盲测(主流路径:可判分任务 -> 分数 + 区间) │ 开放任务判不了分 ↓ 6.2 成对比较与内部竞技场(偏好路径:投票 -> Elo -> 换算) │ ▼ 第 7 章:证据进入决策(需求矩阵 · 成本延迟质量三角 · 选型报告) (前半锚点在此兑现:4.2"距离 ≥7 必须自测"、0.2 分工表"两书在第 6 章交汇")

前置知识与后续延伸

前置知识

  • 2.2 的抽样思维(bootstrap、噪声带)与 2.1 的胜率换算(6.2 直接复用两脚本思想);
  • 4.2 的任务距离矩阵(出题维度优先覆盖距离最远的维度);
  • 4.3 第 6 项"人工抽检一致率"(判分纪律的同源要求)。

为后续奠定基础:6.1 的题集与基线留档,就是 5.2 身份探针与第 9 章锚点题集的来源——一次造题,三处复用;7.3 选型报告的"自测证据"区块直接消费本章输出。规模化边界也在此画线:五十条够选型用,要建回归集、模型裁判流水线与线上监控,转《Evals 实战》第 3/5 章(建设者篇)——那是 0.2 分工表里两书交汇的岔路口。

章内读法提示:时间紧的读者直接进 6.1——脚本跑通即拿到第一手证据;评审口味重或任务偏开放的读者加读 6.2。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U