第一章 · 拜师之前:为什么要蒸馏 章节摘要:本章回答一个动身之前必须想清楚的问题:明明有性能很强的大模型,为什么还要费劲教一个小模型?我们把大模型落不了地的现实压力摆到桌面上,给出知识蒸馏的定义与核心思想,说清这门手艺在压缩工具箱里值在哪一环,最后把师傅、徒弟、传承课三要素一次讲透。读完本章,你应当能判断自己的业务场景适不适合上蒸馏,并且能对别人把"蒸馏"和"剪枝""量化"混为一谈的说法做出纠正。 学习目标 读完本章,你应当能够: 说出大模型从训练到部署之间卡脖子的三个环节:算力成本、内存占用、响应延迟,并能结合自己业务估算每个环节的压力大小。 用一句话向没接触过的人解释知识蒸馏:老师傅输出概率分布,徒弟模仿概率分布,而不是只背标准答案。
章节摘要:本章回答一个动身之前必须想清楚的问题:明明有性能很强的大模型,为什么还要费劲教一个小模型?我们把大模型落不了地的现实压力摆到桌面上,给出知识蒸馏的定义与核心思想,说清这门手艺在压缩工具箱里值在哪一环,最后把师傅、徒弟、传承课三要素一次讲透。读完本章,你应当能判断自己的业务场景适不适合上蒸馏,并且能对别人把"蒸馏"和"剪枝""量化"混为一谈的说法做出纠正。
读完本章,你应当能够:
知识蒸馏是一类迁移学习方法:先训练好一个大而准的教师模型,再让小而快的学生模型以教师模型的输出(而不只是数据标签)为学习对象。教师模型在千百万样本上磨出来的判断分寸——哪些类别容易混淆、混淆到什么程度——以软目标的形式传给了学生。一句话概括:蒸馏学的不是答案,是老师傅打量每个答案的眼神。
下面这张全景图给出本章四个小节的传艺链起点位置:
金句:剪枝是给老师傅瘦身,量化是让老师傅少说话,蒸馏是让一个本来就轻捷的徒弟把活学到手。

四节走的是"压力 → 定义 → 价值 → 拆件"的顺序:先有问题(1.1),才有针对问题的解法定义(1.2),定义立住了才好评估它的价值边界(1.3),最后把解法拆成可操作的部件(1.4)。
现实压力(1.1) ──催生──> 核心思想(1.2) ──兑现为──> 价值与场景(1.3) │ └──落成──> 三要素清单(1.4) ──通向──> 第二章
前置:只需要会训练一个基础的图像分类或文本分类模型,理解交叉熵损失与 softmax,就够读完本章;不需要任何压缩技术的先修。
后续:第二章顺着"老师傅到底知道什么"往下钻,把本章埋下的"软目标只是答案吗"这个问题展开成响应、特征、关系三种知识形态。若你此刻只关心"要不要用蒸馏",读完 1.3 即可先跳去第五章对照场景案例。