nanochat 后半程 · 第 8 章 改造实验


nanochat 后半程 · 第 8 章 改造实验

章节摘要:主干跑通之后,最有营养的学习是动手改。8.1 节做中文语料 SFT:把第 2~3 章的产线整体迁到中文——开源中文指令集的挑选维度(2.2 四把尺子加简繁/标点/翻译腔等中文特查)、分词器对中文的覆盖问题(nanochat 约 2000 的英文词表下,中文落到字节级 BPE 兜底,一个汉字多个 token,能用但贵,本节的测量代码把这笔账量化出来)、70/30 中英配比与模板一致性(模板与语言无关,special tokens 一个不动——4.3 错位一的改造版在此预警)。8.2 节做模型规模实验:以 TinyStories(合成儿童故事语料)为镜,观察小模型的能力边界——任务匹配则很小也行,不匹配则多大都难。8.3 节是路标:SFT 之后的对齐训练(RLHF/DPO/GRPO)只指门牌不下水,详见 《深入理解 AI Agent:设计原理与工程实践》第 7 章。本章把全书资产当作实验台,而不是终点。

学习目标

阅读完本章,你应当能够:

  1. 为中文 SFT 重新过一遍数据挑选维度,并量化分词器的中文效率代价。
  2. 沿用第 3 章脚本完成中文 SFT,按观察清单验收中英能力。
  3. 设计一个控制变量的模型规模实验,并预读小模型能力边界。
  4. 说出 SFT 的两个缺口与对齐三路线(RLHF/DPO/GRPO)的一句话白话。
  5. 盘点本书哪些资产可直接平移进对齐训练。
  6. 说出两个改造实验各自复用了第 5 章的哪个量尺。

核心概念速览

(文字流程图) A ──换数据:换规模──▶ 8.2 规模实验·TinyStories 对照 B ──▶ 8.3 路标·RLHF / DPO / GRPO·详见 ai-agent-book 第 7 章 8.2 规模实验·TinyStories 对照 ──▶ 8.3 路标·RLHF / DPO / GRPO·详见 ai-agent-book 第 7 章

一句话金句:主干流水线是实验台——换数据、换语言、换规模,它都照单全收。

💡 阅读策略:8.1 与 8.2 相互独立,按兴趣任选先做(8.1 偏工程迁移,8.2 偏实验方法);8.3 是全书收束,篇幅最短但建议最后读——它回答"读完这本书之后去哪里"。

子章节导航

8.1 中文语料 SFT 实战

开源中文指令集挑选维度(四把尺子 + 四项中文特查);分词器的字节级兜底与效率测量代码;70/30 配比与模板一致性(4.3 回指);中文训练的观察清单与故障处置。

8.2 TinyStories 与模型规模实验

TinyStories 口径(合成儿童故事,超小模型也能连贯叙事);控制变量实验设计;小模型能力边界清单;不重训基座的最小对照实验路径。

8.3 下一步:RLHF 与 DPO 门前的路标

SFT 的两个缺口(无偏好信号、安全靠覆盖);RLHF/DPO/GRPO 三路线一览(只看地图不下水);本书资产的对齐平移表;全书收束。

子章节之间的逻辑关系

8.1 中文 SFT(换语言:产线迁移 + 分词器代价 + 配比与模板纪律) │ 8.2 规模实验(换数据换规模:能力边界 + 实验设计方法论) │ └── 两者共用 5.1 探针与 5.2 题库做统一测量 ▼ 8.3 对齐路标(SFT 之后的深水区:详见 《深入理解 AI Agent:设计原理与工程实践》第 7 章)

前置知识与后续延伸

前置知识:第 2 章全章(数据契约、清洗管线、蒸馏回环——8.1 直接复用);第 3 章训练脚本与排查表(中文重训原样复用);4.3 的模板纪律(中文改造的高危区);第 5 章探针与题库(改造前后对比的统一量尺)。

为后续奠定基础:8.1 产出的中文对话模型,交付路径复用第 6~7 章(导出、量化、语音回路不变);8.2 的实验方法论适用于你此后的一切自训模型;8.3 把读者送至 《深入理解 AI Agent:设计原理与工程实践》第 7 章门口——对齐训练从那里继续。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U