章节摘要:模型训完了(或训到一半),"感觉变好了"不算数——本章把感觉变成分数。5.1 节讲中期评测:训练进行中就用固定探针去"问"模型——社区 walkthrough 在 nanochat 预训练途中反复用同一个"直升机故事"提示,看着语言能力从乱码、成词、成句到情节一段段涌现;探针的纪律是"三固定"(提示、解码、长度),它与 loss 曲线互为印证:loss 是全局平均数,探针是局部切片,两者对在一起才读得出"哪段 loss 换来了哪种能力"。5.2 节讲对话质量评测:把 3.2 的"固定问题抽检"升级为正式评测台——分层题库、六维 rubric、LLM 裁判加人工抽检校准。本章只搭对话小模型够用的最小评测台,评测方法学的系统展开详见《Evals 实战》第 5 章。
阅读完本章,你应当能够:
(文字流程图) B ──与 3.2 loss 三阶段对照──▶ 继续 / 回退 / 收手决策 D ──分数台账──▶ 版本对比与部署前验收
一句话金句:loss 告诉你模型学得快不快,探针与 rubric 告诉你它学会了什么。
💡 阅读策略:5.1 在训练中读——配合 3.3 的存档习惯边训边看;5.2 在训练后读——配合 6.1 的部署验收入账。两节共用同一条纪律:量尺必须冻结——探针题组与回归题库都是写死的,改一个字就等于换了一把尺子,历史对比全部作废。
直升机故事探针的由来(社区 walkthrough 口径);探针三固定纪律;基座与 SFT 两条涌现观察清单;能力台阶与 loss 曲线三阶段的对照裁决。
分层回归题库的搭建;六维 rubric 与锚点描述;LLM 裁判与三种偏差;人工抽检表与分数台账;评测方法的系统展开指向《Evals 实战》第 5 章。
训练进行中 ──► 5.1 中期评测(探针:能力长出来了没有) │ 与 3.2 的 loss 三阶段对照,决定继续/回退/收手 ▼ 训练完成 ──► 5.2 质量评测(rubric:对话到底好不好) │ 分数台账跨版本对比,作为第 6 章部署前的验收 ▼ 第 6 章 llama.cpp 部署(验收通过的模型才进入导出)
前置知识:第 3 章的 checkpoint 习惯与 loss 三阶段(快降区/平台区/过拟合区)——探针对照的横轴来自 3.2;4.2 的采样参数(评测为什么用贪心或固定种子);0.1 的行为差异三表现(SFT 探针的观察项直接取自那里)。
为后续奠定基础:5.2 的回归题库与分数台账是第 6 章部署验收(量化前后各评一次)与第 8 章中文改造前后对比的统一量尺;5.1 的探针方法在 8.2 的模型规模实验里复用为标准因变量测量工具;本章的六维 rubric 也是看对齐训练"奖励视角"(详见 《深入理解 AI Agent:设计原理与工程实践》第 7 章)的入门形状。