第 7 章 · 实验教程:模型后训练


文档摘要

第 7 章 · 实验教程:模型后训练 本章对应正文:第 7 章 · 模型后训练 核心命题:预训练 / SFT / RL 三阶段——何时选 SFT、何时选 RL,如何把工具调用、推理能力内化进模型参数。 前几章都在"不改模型"的前提下提升 Agent,这一章终于动到模型本身。后训练回答的是:拿一个预训练好的基座,怎么让它更会推理、更会多语言、更会工具调用、更符合人类偏好?核心是 SFT(用示范数据模仿)与 RL(用奖励信号探索)两条路径的取舍——SFT 学得快但上限受示范质量限制, RL 上限高但样本效率低、训练不稳。 本章 13 个实验覆盖预训练、继续预训练、SFT、RL、蒸馏、多模态训练等全谱系。

第 7 章 · 实验教程:模型后训练

本章对应正文:第 7 章 · 模型后训练

核心命题:预训练 / SFT / RL 三阶段——何时选 SFT、何时选 RL,如何把工具调用、推理能力内化进模型参数。

前几章都在"不改模型"的前提下提升 Agent,这一章终于动到模型本身。后训练回答的是:拿一个预训练好的基座,怎么让它更会推理、更会多语言、更会工具调用、更符合人类偏好?核心是 SFT(用示范数据模仿)与 RL(用奖励信号探索)两条路径的取舍——SFT 学得快但上限受示范质量限制, RL 上限高但样本效率低、训练不稳。

本章 13 个实验覆盖预训练、继续预训练、SFT、RL、蒸馏、多模态训练等全谱系。多数训练实验依赖 GPU 与外部训练框架(verl、VERL、Unsloth 等),归为 📖 复现指南;少数纯数据采集或可独立运行的归为 ✅。建议先读正文理清三阶段定位,再按兴趣挑——想理解流程可从 cot-distillation(采集 SFT 数据)入门,想深入 RL 可挑战 AdaptThink、retool、RLVP。

实验列表

实验 类型 难度 说明
MiniMind-pretrain 📖 ★★★ 从零预训练小型 LLM/VLM(fork 自 minimind),理解完整预训练流程与 QK-Norm + Muon 等改进
continued-pretraining ★★ 以韩语 Mistral 为例,用韩语维基继续预训练注入新语言能力,再用 SFT 学会遵循指令
AdaptThink ★★★ 让推理模型按问题难度自适应选 Thinking/NoThinking,约束优化 + 重要性采样降成本 45–69% 同时提准确率
retool 📖 ★★★ 多轮对话 + 代码沙箱提升数学推理,SFT→RL 两阶段;Qwen2.5-32B + AIME 2024 + DAPO + SandboxFusion
cot-distillation ★★ 经 OpenRouter 调用 Claude 等前沿模型蒸馏 CoT 轨迹,规则验证器过滤后生成 SFT 数据
Intuitor 📖 ★★★ 无需外部奖励的推理学习:用模型自身确定性(self-certainty)作为唯一奖励信号微调 LLM
MultilingualReasoning ★★ 用 TRL 微调 gpt-oss-20b,让推理模型在英语之外的多种语言中也能有效推理
orpheus ★★ 用 Unsloth 高效 LoRA 微调 Orpheus 3B 文本转语音模型,显存占用减少 30%
sesame ★★ 用 Unsloth 微调 Sesame CSM 1B TTS 模型,含训练、单条与批量推理脚本
AWorld-train 📖 ★★★ 基于 AWorld 框架训练具身 Agent,在虚拟环境中执行任务并从经验中学习
SpatialReasoning 📖 ★★★ 基于 V-IRL 平台的视觉-语言导航强化学习,用真实地理空间数据与街景图像训练空间推理
SimpleVLA-RL 📖 ★★★ 视觉-语言-动作 RL 框架,数据稀缺条件下改进长时序规划,在模拟与真实任务超越 SFT
RLVP 📖 ★★★ 「奖励结果、惩罚路径」后训练研究:奖励正确结果的同时惩罚违规路径,提升推理可靠性

类型与难度说明

标记 含义
可独立运行:自带完整代码,配好 API Key 即可跑
📖 复现指南:依赖需自行 git clone 的外部仓库
🚧 设计文档:仅含架构方案,可运行代码仍在完善
★ ~ ★★★ 从易到难,★ 为入门级、★★★ 为进阶挑战

阅读建议

  • 入门读者:从 continued-pretraining(★ ★,SFT + 继续预训练)和 cot-distillation(采集 SFT 数据)入手,理解后训练的数据与流程基础,无需 GPU 集群也能跑通部分环节。
  • 关注 SFT 与微调:MultilingualReasoning、orpheus、sesame 三个实验展示了用 TRL/Unsloth 对推理、TTS 模型做高效微调的实战。
  • 关注 RL 与推理:AdaptThink、retool、Intuitor、RLVP 是本章深水区,覆盖自适应思考、工具增强 RL、无外部奖励 RL、路径惩罚等前沿方向;想理解预训练全流程则看 MiniMind-pretrain。

← 返回总目录 · 📖 读本章正文 · 📑 本章索引


发布者: 作者: bojieli 转发
评论区 (0)
U