第 7 章 · 实验教程:模型后训练 本章对应正文:第 7 章 · 模型后训练 核心命题:预训练 / SFT / RL 三阶段——何时选 SFT、何时选 RL,如何把工具调用、推理能力内化进模型参数。 前几章都在"不改模型"的前提下提升 Agent,这一章终于动到模型本身。后训练回答的是:拿一个预训练好的基座,怎么让它更会推理、更会多语言、更会工具调用、更符合人类偏好?核心是 SFT(用示范数据模仿)与 RL(用奖励信号探索)两条路径的取舍——SFT 学得快但上限受示范质量限制, RL 上限高但样本效率低、训练不稳。 本章 13 个实验覆盖预训练、继续预训练、SFT、RL、蒸馏、多模态训练等全谱系。
本章对应正文:第 7 章 · 模型后训练
核心命题:预训练 / SFT / RL 三阶段——何时选 SFT、何时选 RL,如何把工具调用、推理能力内化进模型参数。
前几章都在"不改模型"的前提下提升 Agent,这一章终于动到模型本身。后训练回答的是:拿一个预训练好的基座,怎么让它更会推理、更会多语言、更会工具调用、更符合人类偏好?核心是 SFT(用示范数据模仿)与 RL(用奖励信号探索)两条路径的取舍——SFT 学得快但上限受示范质量限制, RL 上限高但样本效率低、训练不稳。
本章 13 个实验覆盖预训练、继续预训练、SFT、RL、蒸馏、多模态训练等全谱系。多数训练实验依赖 GPU 与外部训练框架(verl、VERL、Unsloth 等),归为 📖 复现指南;少数纯数据采集或可独立运行的归为 ✅。建议先读正文理清三阶段定位,再按兴趣挑——想理解流程可从 cot-distillation(采集 SFT 数据)入门,想深入 RL 可挑战 AdaptThink、retool、RLVP。
| 实验 | 类型 | 难度 | 说明 |
|---|---|---|---|
| MiniMind-pretrain | 📖 | ★★★ | 从零预训练小型 LLM/VLM(fork 自 minimind),理解完整预训练流程与 QK-Norm + Muon 等改进 |
| continued-pretraining | ✅ | ★★ | 以韩语 Mistral 为例,用韩语维基继续预训练注入新语言能力,再用 SFT 学会遵循指令 |
| AdaptThink | ✅ | ★★★ | 让推理模型按问题难度自适应选 Thinking/NoThinking,约束优化 + 重要性采样降成本 45–69% 同时提准确率 |
| retool | 📖 | ★★★ | 多轮对话 + 代码沙箱提升数学推理,SFT→RL 两阶段;Qwen2.5-32B + AIME 2024 + DAPO + SandboxFusion |
| cot-distillation | ✅ | ★★ | 经 OpenRouter 调用 Claude 等前沿模型蒸馏 CoT 轨迹,规则验证器过滤后生成 SFT 数据 |
| Intuitor | 📖 | ★★★ | 无需外部奖励的推理学习:用模型自身确定性(self-certainty)作为唯一奖励信号微调 LLM |
| MultilingualReasoning | ✅ | ★★ | 用 TRL 微调 gpt-oss-20b,让推理模型在英语之外的多种语言中也能有效推理 |
| orpheus | ✅ | ★★ | 用 Unsloth 高效 LoRA 微调 Orpheus 3B 文本转语音模型,显存占用减少 30% |
| sesame | ✅ | ★★ | 用 Unsloth 微调 Sesame CSM 1B TTS 模型,含训练、单条与批量推理脚本 |
| AWorld-train | 📖 | ★★★ | 基于 AWorld 框架训练具身 Agent,在虚拟环境中执行任务并从经验中学习 |
| SpatialReasoning | 📖 | ★★★ | 基于 V-IRL 平台的视觉-语言导航强化学习,用真实地理空间数据与街景图像训练空间推理 |
| SimpleVLA-RL | 📖 | ★★★ | 视觉-语言-动作 RL 框架,数据稀缺条件下改进长时序规划,在模拟与真实任务超越 SFT |
| RLVP | 📖 | ★★★ | 「奖励结果、惩罚路径」后训练研究:奖励正确结果的同时惩罚违规路径,提升推理可靠性 |
| 标记 | 含义 |
|---|---|
| ✅ | 可独立运行:自带完整代码,配好 API Key 即可跑 |
| 📖 | 复现指南:依赖需自行 git clone 的外部仓库 |
| 🚧 | 设计文档:仅含架构方案,可运行代码仍在完善 |
| ★ ~ ★★★ | 从易到难,★ 为入门级、★★★ 为进阶挑战 |
← 返回总目录 · 📖 读本章正文 · 📑 本章索引