八道题覆盖全书主线:数据集、指标、裁判、工具、概率参数、线上防线与工程化。每题给出考察点与小节出处;每题先给提示、再给参考要点——先自己动手,卡住再看。体例仿《Jev 决策编程》附录 C。
你的客服助手回归集现有 80 条,全部来自影子日志随机抽样。安全类 query 在线上只占 0.5%,当前一条都没抽到。请:(a) 说明这个考卷的两个缺陷;(b) 按 3.1 节配方给出扩充到 200 条的来源预算表(影子/分歧/hard/构造各多少条);(c) 写出分层采样时防"安全类永远抽不到"的具体做法。
提示:缺陷:只覆盖真实分布(长尾高危场景欠采样)+ 无 hard case 防复发。预算按 60/25/10/5:120/50/20/10。做法:把"场景×难度"写成配额 dict,安全类显式给非零配额(哪怕线上占比 0.5%),并对高危层加码——参考 stratified_sampler.py 的 quota 结构与固定种子。
两个裁判对 20 条样本打 0/1/2 三档,结果原始一致率 80%。边际分布:裁判甲 2 分占 75%,裁判乙 2 分占 70%。(a) 手算近似 p_e 与 Cohen's kappa;(b) 若这是"裁判 vs 人工金标准",按 5.3 门禁判读该裁判能否上岗;(c) 一句话说明为什么不能用 80% 这个原始一致率下结论。
提示:p_e = Σ 各类别两人边际之积。用二档近似算:p_e ≈ 0.75×0.70 + 0.25×0.30 = 0.60,κ ≈ (0.80−0.60)/(1−0.60) = 0.5——"中等",落在 0.4~0.6 观察档,不够 0.6 上岗线。原始一致率里混着"盲猜基线也能对"的水分(见 3.2 的极端例子:永远标"正确"也能 95%)。
某团队的裁判量表是:5 分=优秀,4 分=良好,3 分=中等,2 分=较差,1 分=差。换算成 LLM 客服场景后,裁判-人工 kappa 只有 0.3。请指出至少三个问题并给出改写后的 3 档量表(含每档判据与一条边界规则)。
提示:问题:形容词式判据(解释权散落)、档位太多(5 档边界模糊)、无正反例、无边界规则。改写方向:0/1/2 三档,每档写触发情形("2=直接回答且正确,无多余反问,无编造"式),加"拿不准归低档"。参照 5.1 的好/坏写法对照表与六件套模板。
你怀疑自家裁判有位置偏见和长度偏见。请设计一周内能完成的识别实验:(a) 换序实验的样本构成与判定指标(含阈值);(b) 长度相关分析的数据与统计量;(c) 若确认位置偏见翻转率 8%,写出两条必做的缓解动作。
提示:(a) 取 100~200 对候选输出,每对 (A,B)(B,A) 各判一次,翻转率 = 结论矛盾对数占比;>5% 必须治理。(b) 收集 ≥100 条 (log 长度, 分数),算皮尔逊相关,|r|>0.3 治理。(c) 所有成对结论换序判两次、冲突记 tie;prompt 位置随机化。参考 bias_probe.py。
一组自报置信度的 (conf, hit) 数据在训练分片上 ECE=0.21,用线性缩放(slope=0.9, intercept=−0.13)修复后训练分片 ECE=0.02、留出分片 ECE=0.04。(a) 判断修复前后的判档;(b) 该不该上线这组修复参数?为什么必须看留出分片?(c) 说出置信度修复后可上岗的两个"岗位"。
提示:(a) 0.21 > 0.15 慎用档 → 修复后 0.04 < 0.05 优档。(b) 该上线:验收看留出分片(训练分片上的提升可能包含对采样噪声的拟合);本例留出 0.04 仍达优。(c) 门控(低置信转人工)与分级路由(难例升级大模型),或漂移告警——见 4.2 三岗位。
法务合同审查场景:错放单价 c_miss=100(示意),转人工单价 c_human=2。回归集跑分显示置信度在 0.90~0.97 区间仍散布着错误。(a) 解释为什么 F1 最优阈值在这里大概率"太胆大";(b) 描述 sweep_threshold 的输出怎么帮你选定 t* 与做敏感性检查;(c) 上线后每季度要检查哪三件事防阈值过期?
提示:(a) F1 只认"自动回答的整体质量",不含错放/误拦的不对称代价;c_miss/c_human=50 时代价最优阈值显著高于 F1 最优。(b) 看 c_miss ∈ {50,100,200} 三档的 t* 与代价曲线平缓度:平缓则稳健,尖峰则先修代价估计。(c) 代价变、模型变(重测校准 7.1)、分布漂(PSI 报警 7.3)——三个重算触发器。
某周一的体检报告:置信度 PSI=0.31,输入长度 PSI=0.05,场景占比 PSI=0.18。(a) 逐项判读;(b) 写出当天的动作清单(至少四步);(c) 两个月后置信度 PSI 连续八周在 0.12~0.18 徘徊——这暴露了 PSI 的什么盲区,怎么补救?
提示:(a) 置信度 ★漂移★、长度稳定、场景观察。(b) ①分桶下钻置信度哪个桶在迁;②抽样 100 条人工看质量是否受损;③回归集在新分布上复跑;④受损走 8.3 回退/重训,未受损重立基线并记录。(c) 慢漂移:单周对固定基线永远只挪一点。补救:滚动基线对比(近 4 周均值 vs 再前 4 周均值)。参考 psi_monitor.py 的 classify 与周度节奏图。
你为团队设计 CI 评测门禁。上线三个月后发现:开发者常"红了就重跑",回归集通过率从 87% 涨到 99%,但线上负反馈率没变好。(a) 指出这里的两个反模式;(b) 分别给出解药;(c) 设计两条阻塞线和一条观察线,并说明每条线守住什么。
提示:(a) 过拟合评测集(离线涨线上不涨)+ "重跑到绿"摧毁门禁信用(属 9.2 失败分流缺失)。(b) 留出集隔离 + 滚动换题(9.3);区分断言失败与环境失败的退出码、重试上限 2 次。(c) 示例:阻塞线 = 主集通过率 ≥ 基线 −2pp(守住整体回归)、hard 子集零新增失败(守住已知失败模式);观察线 = 单请求成本 +10% 提示(4.4 三角,不足以否决)。参照 holdout_gap.py 与 gates.yaml。
做完八道题,建议的收官动作:挑你手头真实的 LLM 应用,按 0.2 节速成路线搭第一个 100 条回归集,跑通 4.1 的成绩单,再把本书的脚本一件件搬上去——评测工程的最后一课永远在自己的一线。