附录 C 练习题


附录 C 练习题

八道题覆盖全书主线:数据集、指标、裁判、工具、概率参数、线上防线与工程化。每题给出考察点与小节出处;每题先给提示、再给参考要点——先自己动手,卡住再看。体例仿《Jev 决策编程》附录 C。

第 1 题:配比与分层(考察 3.1)

你的客服助手回归集现有 80 条,全部来自影子日志随机抽样。安全类 query 在线上只占 0.5%,当前一条都没抽到。请:(a) 说明这个考卷的两个缺陷;(b) 按 3.1 节配方给出扩充到 200 条的来源预算表(影子/分歧/hard/构造各多少条);(c) 写出分层采样时防"安全类永远抽不到"的具体做法。

提示:缺陷:只覆盖真实分布(长尾高危场景欠采样)+ 无 hard case 防复发。预算按 60/25/10/5:120/50/20/10。做法:把"场景×难度"写成配额 dict,安全类显式给非零配额(哪怕线上占比 0.5%),并对高危层加码——参考 stratified_sampler.py 的 quota 结构与固定种子。

第 2 题:kappa 手算(考察 3.2 / 5.3)

两个裁判对 20 条样本打 0/1/2 三档,结果原始一致率 80%。边际分布:裁判甲 2 分占 75%,裁判乙 2 分占 70%。(a) 手算近似 p_e 与 Cohen's kappa;(b) 若这是"裁判 vs 人工金标准",按 5.3 门禁判读该裁判能否上岗;(c) 一句话说明为什么不能用 80% 这个原始一致率下结论。

提示:p_e = Σ 各类别两人边际之积。用二档近似算:p_e ≈ 0.75×0.70 + 0.25×0.30 = 0.60,κ ≈ (0.80−0.60)/(1−0.60) = 0.5——"中等",落在 0.4~0.6 观察档,不够 0.6 上岗线。原始一致率里混着"盲猜基线也能对"的水分(见 3.2 的极端例子:永远标"正确"也能 95%)。

第 3 题:rubric 改写(考察 5.1)

某团队的裁判量表是:5 分=优秀,4 分=良好,3 分=中等,2 分=较差,1 分=差。换算成 LLM 客服场景后,裁判-人工 kappa 只有 0.3。请指出至少三个问题并给出改写后的 3 档量表(含每档判据与一条边界规则)。

提示:问题:形容词式判据(解释权散落)、档位太多(5 档边界模糊)、无正反例、无边界规则。改写方向:0/1/2 三档,每档写触发情形("2=直接回答且正确,无多余反问,无编造"式),加"拿不准归低档"。参照 5.1 的好/坏写法对照表与六件套模板。

第 4 题:偏见实验设计(考察 5.2)

你怀疑自家裁判有位置偏见和长度偏见。请设计一周内能完成的识别实验:(a) 换序实验的样本构成与判定指标(含阈值);(b) 长度相关分析的数据与统计量;(c) 若确认位置偏见翻转率 8%,写出两条必做的缓解动作。

提示:(a) 取 100~200 对候选输出,每对 (A,B)(B,A) 各判一次,翻转率 = 结论矛盾对数占比;>5% 必须治理。(b) 收集 ≥100 条 (log 长度, 分数),算皮尔逊相关,|r|>0.3 治理。(c) 所有成对结论换序判两次、冲突记 tie;prompt 位置随机化。参考 bias_probe.py。

第 5 题:ECE 与修复验收(考察 4.2 / 7.1)

一组自报置信度的 (conf, hit) 数据在训练分片上 ECE=0.21,用线性缩放(slope=0.9, intercept=−0.13)修复后训练分片 ECE=0.02、留出分片 ECE=0.04。(a) 判断修复前后的判档;(b) 该不该上线这组修复参数?为什么必须看留出分片?(c) 说出置信度修复后可上岗的两个"岗位"。

提示:(a) 0.21 > 0.15 慎用档 → 修复后 0.04 < 0.05 优档。(b) 该上线:验收看留出分片(训练分片上的提升可能包含对采样噪声的拟合);本例留出 0.04 仍达优。(c) 门控(低置信转人工)与分级路由(难例升级大模型),或漂移告警——见 4.2 三岗位。

第 6 题:代价化阈值(考察 7.2)

法务合同审查场景:错放单价 c_miss=100(示意),转人工单价 c_human=2。回归集跑分显示置信度在 0.90~0.97 区间仍散布着错误。(a) 解释为什么 F1 最优阈值在这里大概率"太胆大";(b) 描述 sweep_threshold 的输出怎么帮你选定 t* 与做敏感性检查;(c) 上线后每季度要检查哪三件事防阈值过期?

提示:(a) F1 只认"自动回答的整体质量",不含错放/误拦的不对称代价;c_miss/c_human=50 时代价最优阈值显著高于 F1 最优。(b) 看 c_miss ∈ {50,100,200} 三档的 t* 与代价曲线平缓度:平缓则稳健,尖峰则先修代价估计。(c) 代价变、模型变(重测校准 7.1)、分布漂(PSI 报警 7.3)——三个重算触发器。

第 7 题:PSI 与周度体检(考察 7.3)

某周一的体检报告:置信度 PSI=0.31,输入长度 PSI=0.05,场景占比 PSI=0.18。(a) 逐项判读;(b) 写出当天的动作清单(至少四步);(c) 两个月后置信度 PSI 连续八周在 0.12~0.18 徘徊——这暴露了 PSI 的什么盲区,怎么补救?

提示:(a) 置信度 ★漂移★、长度稳定、场景观察。(b) ①分桶下钻置信度哪个桶在迁;②抽样 100 条人工看质量是否受损;③回归集在新分布上复跑;④受损走 8.3 回退/重训,未受损重立基线并记录。(c) 慢漂移:单周对固定基线永远只挪一点。补救:滚动基线对比(近 4 周均值 vs 再前 4 周均值)。参考 psi_monitor.py 的 classify 与周度节奏图。

第 8 题:门禁设计与反模式(考察 9.2 / 9.3)

你为团队设计 CI 评测门禁。上线三个月后发现:开发者常"红了就重跑",回归集通过率从 87% 涨到 99%,但线上负反馈率没变好。(a) 指出这里的两个反模式;(b) 分别给出解药;(c) 设计两条阻塞线和一条观察线,并说明每条线守住什么。

提示:(a) 过拟合评测集(离线涨线上不涨)+ "重跑到绿"摧毁门禁信用(属 9.2 失败分流缺失)。(b) 留出集隔离 + 滚动换题(9.3);区分断言失败与环境失败的退出码、重试上限 2 次。(c) 示例:阻塞线 = 主集通过率 ≥ 基线 −2pp(守住整体回归)、hard 子集零新增失败(守住已知失败模式);观察线 = 单请求成本 +10% 提示(4.4 三角,不足以否决)。参照 holdout_gap.py 与 gates.yaml。

做完八道题,建议的收官动作:挑你手头真实的 LLM 应用,按 0.2 节速成路线搭第一个 100 条回归集,跑通 4.1 的成绩单,再把本书的脚本一件件搬上去——评测工程的最后一课永远在自己的一线。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U