十四道题分基础、进阶、思考三档,覆盖第 06~11 章与两个附录。每题只给提示不给答案——答案都在对应章节里,练习的目的是逼你回去再用一次。
三档的定位与用法:
| 档位 | 定位 | 建议投入 | 完成标准 |
|---|---|---|---|
| 基础(第 1~5 题) | 跑通工具链,建立手感 | 每题半小时内 | 能演示结果并说出对应章节的结论 |
| 进阶(第 6~10 题) | 组合两个以上章节的方法 | 每题一到两小时 | 产出可复用的脚本或清单 |
| 思考(第 11~14 题) | 没有标准答案的判断题 | 想清楚比写完重要 | 能写出一页可辩护的论述 |
题目与章节的对应关系:第 13 题对应第 0607 章,第 45 题对应第 09 章,第 67 题横跨 6.1、7.1 与 10.2,第 89 题对应第 9 章,第 10 题对应第 11.2 节,第 1114 题对应第 7、10、11 章的综合判断。
建议节奏:基础档随读随做(读完对应章就做);进阶档攒到周末成批做,工具链热着的时候效率最高;思考题适合放在团队讨论里——它们的真实用途是把本书的纪律变成团队的语言。
做题约定:涉及运行环境的题默认你已按第 03 章完成 uv sync 并能启动 kev.serve;涉及数字口径的题,凡未标注官方口径的数值一律按示意值处理。
第 1 题(Playground)。在 Playground 里对同一道 Choice 题分别用 packed 与 separate 各跑一次,比较输出。请说明你看到了什么,以及这个现象对应官方的哪条承诺。
提示:第 06 章支柱页与第 6.2 节;"逐位一致"四个字是关键。
第 2 题(permute 初体验)。挑一道你业务里的三选一题,用第 6.1 节的 permute_stability.py 跑十次打乱,记录 top-1 与概率,手算翻转率与摆幅。
提示:先跑通一次原始顺序确认服务在线;基准答案取多数票。
第 3 题(数据 schema)。把你手头任意一个判断场景写成一条合法的四字段 JSONL 记录,然后对着第 7.1 节的"外行测试"自检:不懂业务的人读完 context 能做出同样判断吗?
提示:context 写多了会把答案暗示进去,写少了只剩选项先验。
第 4 题(显存纸面账)。用第 9.2 节的对照表(示意值)回答:预算一张 24 GB 级的卡,哪些尺寸可以跑?若业务平均上下文数千 token,你的答案要怎么修正?
提示:别忘了 KV 缓存那笔账随上下文长度与并发数涨。
第 5 题(读性能表)。打开官方服务性能表,找到 9B 一行,抄下延迟三列(p50/p95/p99,以官方数值为准),并回答:给下游承诺 SLA 时你能用哪一列、绝不能用哪一列?
提示:平均值会撒谎,用户感受到的是长尾。
第 6 题(对称化实现)。把第 6.1 节的 symmetrize.py 扩展为"三选项全排列、四选项及以上采样六次"的混合策略,并在输出里附带一个"原始顺序答案与对称化答案不一致"的告警标记。
提示:itertools.permutations 与 random.sample 各管一段;告警标记本身就是一个可监控指标。
第 7 题(留出集流水线)。为你的业务数据写一个 split_holdout.py:固定随机种子、九一切分、holdout 写入独立目录并输出哈希。然后用第 10.2 节的 seal_locked_test.py 把它升级成可封存可校验的 locked 册。
提示:固定种子是可复现的关键;台账里 status 字段的迁移就是你从自觉版升到机制版的过程。
第 8 题(冷启动实测)。对第 9.1 节部署的 Modal 端点做一次冷启动测量:空闲超过归零时限后掐表发请求,重复三次取分布。再估算:若你的业务是"每天几十次突发请求",保温与不保温的年度成本差多少(数量级估算即可)?
提示:第 9.1 节的算账框架是"保温成本对比冷启动代价乘频次";探活脚本 keep_warm.py 可以直接改造。
第 9 题(压测拐点)。用第 9.3 节的 bench_endpoint.py 对本地 kev.serve 做逐级加压(并发从 1 扫到 16),画出 p95 延迟随并发的曲线,标出你找到的拐点。
提示:拐点之后吞吐还在涨但长尾开始恶化;每轮记录环境,否则曲线无法事后比较。
第 10 题(日期预检落地)。给第 11.2 节的 preflight 函数补上"检测 context 里是否残留未预计算的日期对"的告警逻辑:出现"创建于 X 天前""距今 Y 天"这类原始日期关系而非结论字段时打印警告。
提示:宁可误报不可漏报;真正彻底的做法是在组装层只允许结论字段通过。
第 11 题(起点哲学)。第 7.3 节说"决策能力在 checkpoint 不在底座",第 9.2 节又说"底座决定天花板"。请把这两句话放进同一个框架:对四尺寸家族(0.8B 到 27B),各自的天花板与起点纪律分别意味着什么?
提示:想想"能力铸造"与"业务特化"两阶段的分工,以及为什么小数据的使命只是后者。
第 12 题(污染的思想实验)。假设你的团队每周发一版模型,每次发版前都跑同一个冻结套件并根据结果决定是否发布。三个月后,这个流程还算"冻结"吗?它和 locked test 的差距具体在哪一步兑现?
提示:发布决策也是一种"据结果回调";数一数信息渗入决策的通道有几条。
第 13 题(对比的伦理)。老板要求你在汇报里写一句话:"Kev 已经全面达到 Jev 水平。"结合第 10.3 节的两对官方数字(0.851 对 0.857、52.3 对 54.0)与 confident error(2.4% 对 3.7%),你会怎么改写这句话,使它在未来任何一次事故复盘中都站得住?
提示:结论写窄三件套——数字带条件、结论带范围、留复测门。
第 14 题(边界的价值)。官方把 MMLU-Pro 落后、日期弱、顺序敏感、长文衰减四条边界写进 README。从使用者、贡献者、竞争者三种视角,分别评估这种"诚实声明"的价值与代价;再回答:你的团队自训模型后,愿意公开哪些边界?
提示:对照第 11 章开头那句金句,以及第 10.3 节对"写窄结论"的论证。
做题之外的最后一问留给你自己:这本书里哪条纪律是你现在的工作流里最缺的?把它写成这周的第一条待办——练习题的终点不是做完,而是用上。