nanochat 后半程 · 第 5 章 评测:它到底会不会聊天


nanochat 后半程 · 第 5 章 评测:它到底会不会聊天

章节摘要:模型训完了(或训到一半),"感觉变好了"不算数——本章把感觉变成分数。5.1 节讲中期评测:训练进行中就用固定探针去"问"模型——社区 walkthrough 在 nanochat 预训练途中反复用同一个"直升机故事"提示,看着语言能力从乱码、成词、成句到情节一段段涌现;探针的纪律是"三固定"(提示、解码、长度),它与 loss 曲线互为印证:loss 是全局平均数,探针是局部切片,两者对在一起才读得出"哪段 loss 换来了哪种能力"。5.2 节讲对话质量评测:把 3.2 的"固定问题抽检"升级为正式评测台——分层题库、六维 rubric、LLM 裁判加人工抽检校准。本章只搭对话小模型够用的最小评测台,评测方法学的系统展开详见《Evals 实战》第 5 章。

学习目标

阅读完本章,你应当能够:

  1. 设计一组"三固定"的探针任务,并说出它与 loss 曲线各自能回答什么、不能回答什么。
  2. 按观察清单识别基座与 SFT 各阶段的能力涌现信号。
  3. 从零搭一张六维 rubric,并为每个分数档写清锚点描述。
  4. 跑通"LLM 裁判 + 人工抽检"的打分流程,知道裁判的三种偏差怎么防。
  5. 建立一份可跨版本对比的回归评测集与分数台账。
  6. 说出评测与 loss 曲线、部署验收、改造对比三章的接口关系。

核心概念速览

(文字流程图) B ──与 3.2 loss 三阶段对照──▶ 继续 / 回退 / 收手决策 D ──分数台账──▶ 版本对比与部署前验收

一句话金句:loss 告诉你模型学得快不快,探针与 rubric 告诉你它学会了什么。

💡 阅读策略:5.1 在训练中读——配合 3.3 的存档习惯边训边看;5.2 在训练后读——配合 6.1 的部署验收入账。两节共用同一条纪律:量尺必须冻结——探针题组与回归题库都是写死的,改一个字就等于换了一把尺子,历史对比全部作废。

子章节导航

5.1 中期评测:故事生成与能力涌现

直升机故事探针的由来(社区 walkthrough 口径);探针三固定纪律;基座与 SFT 两条涌现观察清单;能力台阶与 loss 曲线三阶段的对照裁决。

5.2 对话质量评测:rubric 裁判与人工抽检

分层回归题库的搭建;六维 rubric 与锚点描述;LLM 裁判与三种偏差;人工抽检表与分数台账;评测方法的系统展开指向《Evals 实战》第 5 章。

子章节之间的逻辑关系

训练进行中 ──► 5.1 中期评测(探针:能力长出来了没有) │ 与 3.2 的 loss 三阶段对照,决定继续/回退/收手 ▼ 训练完成 ──► 5.2 质量评测(rubric:对话到底好不好) │ 分数台账跨版本对比,作为第 6 章部署前的验收 ▼ 第 6 章 llama.cpp 部署(验收通过的模型才进入导出)

前置知识与后续延伸

前置知识:第 3 章的 checkpoint 习惯与 loss 三阶段(快降区/平台区/过拟合区)——探针对照的横轴来自 3.2;4.2 的采样参数(评测为什么用贪心或固定种子);0.1 的行为差异三表现(SFT 探针的观察项直接取自那里)。

为后续奠定基础:5.2 的回归题库与分数台账是第 6 章部署验收(量化前后各评一次)与第 8 章中文改造前后对比的统一量尺;5.1 的探针方法在 8.2 的模型规模实验里复用为标准因变量测量工具;本章的六维 rubric 也是看对齐训练"奖励视角"(详见 《深入理解 AI Agent:设计原理与工程实践》第 7 章)的入门形状。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U