- 文集信息
- 目录大纲
- 最新文档
- 知识宇宙
文集详情
文集导读
大模型知识蒸馏体系化教程
从原理到代码,系统掌握用 HuggingFace Transformers 做大模型知识蒸馏(Knowledge Distillation)的完整流程:温度软化、软硬标签损失、师生分布对齐、训练加速、评估对比与推理部署。
这套教程讲什么
知识蒸馏是当前大模型时代最核心的模型压缩与加速技术之一:用一个能力强、体积大的「教师模型」来指导一个体积小、速度快的「学生模型」训练,让学生在参数量大幅缩减的同时,尽量逼近教师的性能。
本教程围绕一个真实可运行的 GPT2 蒸馏项目展开——教师是预训练的标准 GPT2(约 1.24 亿参数),学生是从零初始化的小型 GPT2(约 1000 万参数,压缩比约 12:1)。教程既讲清楚「为什么这么做」的数学原理,也给出「具体怎么写」的工业级代码。
阅读顺序
| 序号 | 章节 | 主题 | 关键词 |
|---|---|---|---|
| 00 | 项目导览与学习路线 | 建立全局心智模型 | 数据流、学习路径 |
| 01 | 知识蒸馏原理详解 | 奠基论文核心思想 | Hinton、温度软化、暗知识 |
| 02 | 环境准备与首次运行 | 五分钟跑通全流程 | 依赖安装、冒烟测试 |
| 03 | 配置体系 | dataclass 管理实验 | 超参分组、命令行覆盖 |
| 04 | 数据处理流水线 | 自回归样本构造 | 分词、切窗、缓存索引 |
| 05 | 教师与学生模型 | 双模型构建策略 | 预训练加载、权重冻结 |
| 06 | 蒸馏损失函数 | 数学核心实现 | KL 散度、交叉熵、shift 对齐 |
| 07 | 训练主循环 | 完整训练流程 | 损失分解、余弦退火、断点续训 |
| 08 | 评估与对比 | 师生性能衡量 | 困惑度、Top-1、分布 KL |
| 09 | 推理与采样生成 | 学生部署落地 | 温度采样、top-k、交互式 |
| 10 | 进阶实战技巧 | 调参与工程优化 | 教师缓存、中间层蒸馏 |
| A | 术语表 | 概念速查 | 30+ 蒸馏术语 |
| B | 命令速查表 | 常用命令一览 | 训练、评估、推理 |
| C | 常见问题排查 | 报错对照表 | OOM、下载失败、对齐 |
适合谁读
- 有 Python 与 PyTorch 基础,想系统理解知识蒸馏原理与工程实现的同学。
- 需要把大模型压缩到端侧、边缘设备部署的工程师。
- 想要一份「能直接照着搭自己蒸馏项目」的工程模板的开发者。
学习心法
先建全局,再钻细节。建议先读《00 项目导览》和《01 原理详解》建立整体认知,再按章节顺序深入实现细节。每章末尾都配有「动手实验」,跑一遍、改一改参数,胜过读十遍。
快速开始
# 安装依赖 pip install torch transformers tiktoken datasets tqdm numpy # 启动一次蒸馏训练(默认配置) python train.py # 评估学生与教师的对比 python eval.py # 用学生模型生成文本 python inference.py --prompt "ROMEO:"
关于环境配置的细节,请参考后续《02 环境准备》章节。
祝学习愉快!
目录大纲
最新文档
知识宇宙
正在加载知识图谱...