第三章 火候与讲法:温度与损失的设计


文档摘要

第三章 · 火候与讲法:温度与损失的设计 章节摘要:同样的师傅、同样的徒弟,教出来的水平可能差一截,差别往往就在火候与讲法。本章钻进蒸馏损失函数的内部:温度系数怎么把老师傅含糊其辞的暗知识调到徒弟看得见,软硬两种损失按什么比例配才不串味,以及更深一层的追问——软目标凭什么让徒弟比同体量的"自学成才者"更强。读完本章,你调起温度和权重来不再靠玄学,而是知道每个旋钮拧向哪边、代价是什么。 学习目标 读完本章,你应当能够: 手写带温度的 softmax 与蒸馏 KL 损失,解释温度从 1 调到 4、8、16 时教师概率分布发生的变化。 说出"梯度按温度平方缩放"这回事对损失权重设置的连锁影响,避免温度调大后学习率失衡的经典错误。

第三章 · 火候与讲法:温度与损失的设计

章节摘要:同样的师傅、同样的徒弟,教出来的水平可能差一截,差别往往就在火候与讲法。本章钻进蒸馏损失函数的内部:温度系数怎么把老师傅含糊其辞的暗知识调到徒弟看得见,软硬两种损失按什么比例配才不串味,以及更深一层的追问——软目标凭什么让徒弟比同体量的"自学成才者"更强。读完本章,你调起温度和权重来不再靠玄学,而是知道每个旋钮拧向哪边、代价是什么。

学习目标

读完本章,你应当能够:

  1. 手写带温度的 softmax 与蒸馏 KL 损失,解释温度从 1 调到 4、8、16 时教师概率分布发生的变化。
  2. 说出"梯度按温度平方缩放"这回事对损失权重设置的连锁影响,避免温度调大后学习率失衡的经典错误。
  3. 为一组师生配置选择软硬损失权重:教师远强于学生时往哪边偏,任务标签噪声大时往哪边偏。
  4. 用信息论的语言解释软目标比硬标签多出的那部分监督信息是什么。
  5. 解释蒸馏学生超过同规模从头训练模型的三个机制:暗知识正则、优化景观更平滑、有效标签密度更高。
  6. 面对一次"蒸馏后学生反而变差"的事故,能按温度、权重、容量三个方向排查原因。

核心概念速览

温度 T 是这门手艺的看火功夫:T 越大,概率分布越平缓,那些只有千分之一置信度的类别也被抬到台面上,类间相似性信息随之显形。损失配比是下料功夫:硬损失教徒弟"对错",软损失教徒弟"分寸",两者的权重就是在对错与分寸之间下注。温度决定教材里能看见多少暗知识,配比决定徒弟把多少心思花在暗知识上。

金句:温度拧大了,老师傅口中的"大概也许"才变成徒弟听得清的"三七开"。

图 3-1 同一组 Logits 在不同温度下的分布变化

图 3-1 同一组 Logits 在不同温度下的分布变化

子章节导航

  • 3.1 温度系数:把暗知识调到看得见:从带温度的 softmax 讲到梯度缩放效应,给出常见任务的经验温度带与调试方法(含信息论视角的旁注)。
  • 3.2 软硬损失怎么配比:目标函数设计:KL 项与交叉熵项的加权公式、常见配比起点,以及教师任务与学生任务不一致时的处理。
  • 3.3 徒弟为何能青出于蓝:泛化与压缩的权衡:拆解蒸馏学生反超从头训练学生的三个机制,并划出"蒸馏会输"的边界条件。

子章节之间的逻辑关系

三节从"一个旋钮"到"两个旋钮"再到"为什么有效":先掌握温度这一个最核心的旋钮(3.1),再把温度放进软硬合成的总损失里谈配比(3.2),最后退后一步用理论解释这套讲法为什么能教出更强的徒弟(3.3)。3.3 的结论又是第四章一切进阶教法的前提——知道蒸馏赢在哪,才知道变体该往哪改。

温度机理(3.1) ──放进──> 损失配比(3.2) ──追问──> 泛化机理(3.3) 温度平方梯度效应 ─┐ └─为第四章变体提供改刀依据 └─决定权重怎么设

本章知识点清单

  • 带温度 softmax 的公式与代码实现,温度对熵的影响方向。
  • 蒸馏 KL 损失需乘温度平方补偿的推导结论。
  • 软硬损失加权中 alpha 的典型取值区间与三类特殊场景的偏置方向。
  • 软目标的互信息增量视角:软目标在标签之外多提供了什么。
  • 蒸馏收益的三个来源与两种失效场景(容量鸿沟过大、任务失配)。
  • 蒸馏事故排查的三方向清单:温度、配比、容量。

前置知识与后续延伸

前置:第一章三要素概念,第二章响应蒸馏的基本损失形式;一点信息论基础(熵、KL 散度的直观含义)会让 3.3 读起来更顺。

后续:第四章的进阶教法全部建立在本章的损失函数之上——多师会诊是配比的加权扩展,量化感知蒸馏是在软硬损失之外再叠加一层量化误差。第六章的调参手记则把本章的机理翻译成一张可执行的参数表。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U