八道判定练习,覆盖前半(第 2、4 章)与后半(第 5~8 章)的核心交付物。建议先不看折叠内容独立作答,再展开提示与参考要点核对。所有数据为教学构造(示意),不涉及真实模型名次。
某竞技场上,模型 P 分数 1385(95% CI [1360, 1410]),模型 Q 分数 1372(95% CI [1348, 1396])。宣传语称"P 稳居第一,领先 Q"。
(1)按分差换算,P 对 Q 的预期胜率约多少?(2)"领先"这句话该怎么读?
提示:用 2.1 的换算:预期胜率 = 1 / (1 + 10^(分差/400))。再看两个 CI 是否重叠(2.2)。
参考要点:(1)分差 13 分 → 胜率 ≈ 1/(1+10^(13/400)) ≈ 52%——几乎五五开。(2)CI [1360,1410] 与 [1348,1396] 大幅重叠 → 统计并列,正确读法是"前几名一档"而非"P 稳居第一";13 分的分差远小于头部常见的区间宽度,宣传语在利用点分数制造名次感。
供应商发来的报告:自报基准分数领先对手 8%;基准题库未公开("商业机密");判分方式未说明;无置信区间;报告末尾附了三页"全部优势"。请按 4.3 核对表打分并定档,说明哪几项直接触发折价。
提示:四区十五项逐项过:出题区(题库公开?版本日期?污染声明?)、阅卷区(判分透明?抽检?)、统计区(CI?样本量?)、动机区(利益冲突?失败案例?)。查无信息记 0。
参考要点:典型打分:题库公开 0、版本日期 0~1、污染声明 0、判分透明 0、抽检 0、CI 0、失败案例 0、利益冲突(厂商自报)0……总分远低于 50% → 低可信:仅当线索,选型以自测为准。直接触发折价的三处:题库不可审计(出题区崩)、判分口径未知(阅卷区崩)、厂商自报无失败案例(动机区崩)。
你的月度探针:20 题、探针自检通过、锚点分 +1.2pt(噪声带 ±2pt)、指纹相似度 0.95、无元数据变化;但财务侧抱怨"回答变啰嗦了,token 成本涨了两成"。
(1)判定卡出什么卡?(2)成本上涨要不要并入判定卡?
提示:六个字段都在噪声带内吗?质量、指纹、元数据三信号同向吗?成本维度属于 7.2 的三角还是 5.1 的身份判定?
参考要点:(1)Match——题数够、探针正常、锚点分与指纹都在带内、元数据未变;"感觉啰嗦"没有超过任何证据阈值。(2)成本上涨不进身份判定卡(它不证明模型换了),但应进 7.2 的三角数据重测——很可能是你自己的 prompt 或场景分布变了(9.1 的"先查自己")。若怀疑风格漂移,把长度分布加进指纹指标再观测一轮。
你要从 50 题盲测集里挑 15 题做月度锚点。下列候选该怎么取舍:A(当初两模型分差 12 分、重跑三轮得分一致);B(分差 2 分,但题目最贴近核心业务);C(分差 10 分,重跑三轮得分 2/1/2 波动);D(分差 8 分,重跑稳定)。
提示:9.1 的锚点三标准:分差大、跨轮稳、维度代表。三条都满足的优先进,冲突时怎么权衡?
参考要点:取 A、D。C 分差大但跨轮不稳(噪声大的锚点 = 烟雾报警器装灶台上),剔除;B 分差小意味着区分度低,作锚点测不出漂移,但可保留在全量季度题集里守业务代表性(维度代表由 A/D 的分布补齐——挑锚点时按维度配额,别让一维独大)。
同事的盲测方案:50 题里 45 题来自同一类简单退款查询;他自己跑模型、自己判分、判分时知道每条回答来自哪个模型("反正我客观");结果 A 模型 96 分、B 模型 92 分,他在报告里写"A 显著优于 B"。
提示:四处问题分别对应 6.1 的哪些纪律?出题配比、盲的三重纪律、差异检验(96 vs 92 在 50 题 0/1/2 口径下超噪声吗)。
参考要点:(1)题目分布塌缩:45/50 同类,分项维度缺失(应按真实样本 60% + 边界 20% + 失败重放 20% 配比);(2)判分人知晓模型归属——盲测破功,破一次全废;(3)跑模型与判分未分离;(4)96 vs 92 差 4 分(0~100 制即 0.08/2 制),50 题下大概率落在 bootstrap CI 内——正确写法是"差异未超噪声带",不能写"显著优于"。修法:补齐维度、换判分人、揭盲表最后打开、报区间。
匿名甲、乙、丙三模型,评审投出 12 场:甲胜乙 5 负 1、甲胜丙 4 负 2、乙胜丙 3 负 3。Elo 更新后甲 1560、乙 1470、丙 1410。
(1)乙丙的排名可信吗?(2)甲对丙领先 150 分,业务上怎么理解?
提示:对战矩阵先于 Elo(6.2):乙丙 3-3 说明什么?150 分用 2.1 公式换算。
参考要点:(1)乙丙 3-3 平手 → 两者在噪声内,Elo 的 60 分差距没有含义,应读作"并列"(2.2 内化);(2)150 分 ≈ 1/(1+10^(150/400)) ≈ 66% 预期胜率——即评审约三分之二的场次偏好甲;且 12 场是小样本,结论只当候选排序。若出现"甲胜乙、乙胜丙、丙胜甲"的环,同样视为噪声内。
五个候选(质量分/元每千任务/P95 毫秒):甲 88/10/2000;乙 90/25/2600;丙 84/9/1900;丁 86/9/1700;戊 80/5/900。你的门槛:P95 ≤ 2000ms 且预算 ≤ 12 元。
(1)谁被支配、由谁支配?(2)过门槛的前沿成员里选谁,还需要什么信息?
提示:被支配 = 存在另一候选三维都不差且至少一维严格更好。把丁和丙放一起逐维比。门槛切完剩下的成员之间是什么关系?
参考要点:(1)丙被丁支配:丁质量 86>84、成本 9=9、P95 1700<1900——三维不差、两维严格更好,丙出局无需论证;甲(质量最高于同价位)、乙(全场质量第一)、戊(最便宜最快)互不支配,均在前沿。(2)门槛切完剩甲、丁、戊:乙超延迟线出局。三者之间是质量换成本延迟的取舍(甲 88 分 2000ms ↔ 戊 80 分 900ms),不是优劣关系——要定夺还需要:需求矩阵里质量与价格的权重(7.1),以及质量分的置信区间(88 对 86 可能是抽样噪声,7.2 的区间关;区间重叠时"严格更好"不成立,支配判定本身也要回炉)。
某 Agent 汇报:"我已读取 a.py、b.py、c.py 三个文件,修复了 a.py 中的空指针 bug,并跑通了全部测试。"轨迹记录:read_file a.py(步骤 2)、read_file b.py(步骤 3)、edit_file a.py "null check added"(步骤 5)、run_tests "2 passed, 1 skipped"(步骤 7),无其他步骤。
(1)逐条判定 Supported / Unsupported / Contradicted。(2)"1 skipped"算矛盾吗?
提示:先把自述拆成原子声明(三条)。"跑通全部测试"与"2 passed, 1 skipped"的关系是记录反证,还是记录不全?
参考要点:(1)"读取三个文件"→ Unsupported(仅 2 次 read_file,c.py 无记录);"修复 a.py 空指针"→ Supported(步骤 5 edit_file 与声明对应);"跑通全部测试"→ Contradicted(1 个 skipped 意味着"全部通过"不成立——skipped 的测试没有被验证)。(2)skipped 不是 failed,但"全部跑通"的自述与"有测试被跳过"的记录矛盾: skipped 恰是没有跑。判定纪律(8.2):出现 Contradicted,该次汇报整体降级,其余声明回炉重查;"读取三个文件"的 Unsupported 还要区分"没读"与"没记"——若 read_file 的日志级别不覆盖某些读取路径,先修记录再定性。
做完八题的检验标准:每道题你都不需要翻书就能说出用哪张表、哪个卡、哪条纪律——判定方法内化成反射,这本书就算读成了。