AI基础设施与推理优化 · 第 3 期

GPT-4级别的表现,7B也能有

知识蒸馏 · 软标签 · teacher-student

蒸馏的洞见:大模型输出的不只是「对错」,还有每个词的概率分布(软标签)——里面藏着「次优答案也合理」的暗知识。让小模型去拟合这个软分布,比硬学标准答案效果好得多。GPT-4蒸馏出的7B,能保留老师80%的能力,体积砍10倍。
⏱ 约 10 分钟 🎯 想要小模型有大本事的人 📦 源:ht-distillation 教程

01蒸馏在搬什么:暗知识

硬标签是「猫」。软标签是「猫0.7、狗0.2、汽车0.001」——后两个数字也是知识。

训练分类模型时,标准答案是one-hot:猫是1,其余全是0。但大模型最后一层输出的是softmax后的概率分布,非零项里藏着类间关系(猫和狗比猫和汽车更像)。Hinton把这种「比正确答案多出来的信息」叫暗知识(dark knowledge)。蒸馏就是逼小模型去拟合老师的整个概率分布,而不只是argmax。

L = α · KL(软标签‖学⽣) + (1−α) · CE(硬标签‖学⽣)
软标签 = softmax(z老师 / T)  T 越大分布越软

温度T的作用:T=1是正常softmax,分布尖锐;T大(如4~10)把分布「摊平」,让小概率类也露出来,小模型才有东西可学。蒸馏损失 = 软标签的KL散度 + 硬标签的交叉熵,用α调比例。软标签是主菜,硬标签是调味。

老师教的不是「答案」,
是每个选项的合理性。
灏天文库 · AI基础设施与推理优化 P.7

02蒸馏流程演示:硬标签 vs 软标签

看一个3类分类的logits分布。硬标签只有猫=1,软标签把猫0.7/狗0.2/汽车0.01都给出来。点「蒸馏一步」,看学生模型分别学硬/软标签的损失下降速度。

🎓 蒸馏流程演示
同一个老师,学生学软标签比学硬标签收敛快、泛化好。
🐱 老师
GPT-4 / 70B
→ 软标签 →
🐭 学生
7B / 1B
→ 拟合分布
0
老师logits分布(输入:一张猫的图)
点「蒸馏一步」开始
硬标签学生(只学猫=1)软标签学生(学整个分布)

03三种蒸馏姿势怎么选

LLM蒸馏的实战路径:拿GPT-4/Claude当老师,对几万个高质量prompt生成回答(带CoT推理过程),用这些数据SFT一个7B学生。关键不是数据量,是数据里有没有老师的推理链。Alpaca/Vicuna/DeepSeek早期都是这个套路——花几千美元API,蒸馏出一个能打的7B。

logits

对齐输出

拟合老师softmax,简单有效,要求同词表。

中间层

对齐表示

学隐藏层,信息密,需投影层对齐维度。

序列

造数据

老师生成回答,学生SFT,LLM最常用。

on-policy

在线蒸馏

学生采样老师打分,强化学习式,效果上限高。

蒸馏的瓶颈不是模型,
是数据里有没有推理链。
灏天文库 · AI基础设施与推理优化 P.8

04带走这套清单

✅ 蒸馏 6 条可执行规则

  1. LLM蒸馏首选序列蒸馏:老师造带CoT的数据集,学生SFT,几千美元API出个能打的7B。
  2. 数据要带推理过程:只存答案不存推理链,学生学不到「怎么想」,效果打折。
  3. 温度T从4起步:太尖学不到暗知识,太平信号被稀释,4~10是常用区间。
  4. α给软标签大头:0.7软+0.3硬是经典配比,软标签是主菜硬标签调味。
  5. 师生词表要对齐:logits蒸馏要求同输出空间,不同词表只能走序列蒸馏。
  6. 别只看loss看泛化:蒸馏loss可能比硬标签高,但泛化更好,跑评测集判断。
小模型有大本事,
靠的是站在老师肩上。
灏天文库 · AI基础设施与推理优化 P.9