内容摘要
蒸馏·用大模型教小模型 灏 灏天文库 · AI基础设施与推理优化 第 3 期 AI基础设施与推理优化 · 第 3 期 GPT-4级别的表现, 7B也能有 知识蒸馏 · 软标签 · teacher-student 蒸馏的洞见:大模型输出的不只是「对错」,还有 每个词的概率分布 (软标签)——里面藏着「次优答案也合理」的暗知识。让小模型去拟合这个软分布,比硬学标准答案效果好得多。GPT-4蒸馏出的7B,能保留老师80%的能力,体积砍10倍。 ⏱ 约 10 分钟 🎯 想要小模型有大本事的人 📦 源:ht-distillation 教程 01 蒸馏在搬什么:暗知识 硬标签是「猫」。软标签是「猫0.7、狗0.2、汽车0.001」——后两个数字也是知识。 训练分类模型时,标准答案是one-hot:猫是1,其余全是0。但大模型最后一层输出的是softmax后的概率分布, 非零项里藏着类间关系 (猫和狗比猫和汽车更像)。Hinton把这种「比正确答案多出来的信息」叫 暗知识 (dark knowledge)。蒸馏就是逼小模型去拟合老师的整个概率分布,而不只是argmax。