第二章 老师傅知道什么:知识的三种形态


文档摘要

第二章 · 老师傅知道什么:知识的三种形态 章节摘要:想跟师傅学艺,先得知道师傅身上哪些东西值得学。本章把教师模型里的知识分成三种形态——最终答案里的分寸感(响应层 Logits)、思考的过程(中间层特征)、见过世面的见识(样本与层之间的关系),逐一讲清每种知识怎么取、怎么教、徒弟学到后表现有何不同;最后回答一个工程上躲不开的刁钻问题:连训练数据都拿不到时,师傅还能不能收徒。读完本章,你能按自己能拿到的资源,选对用哪一种知识当教材。 学习目标 读完本章,你应当能够: 说清基于 Logits 的响应蒸馏教的是什么知识,为什么它是最容易上手、也最常被低估的教法。 解释基于特征的蒸馏为什么要加适配层对齐师生特征维度,并说出 hint 层与引导层在 FitNets 方案里的分工。

第二章 · 老师傅知道什么:知识的三种形态

章节摘要:想跟师傅学艺,先得知道师傅身上哪些东西值得学。本章把教师模型里的知识分成三种形态——最终答案里的分寸感(响应层 Logits)、思考的过程(中间层特征)、见过世面的见识(样本与层之间的关系),逐一讲清每种知识怎么取、怎么教、徒弟学到后表现有何不同;最后回答一个工程上躲不开的刁钻问题:连训练数据都拿不到时,师傅还能不能收徒。读完本章,你能按自己能拿到的资源,选对用哪一种知识当教材。

学习目标

读完本章,你应当能够:

  1. 说清基于 Logits 的响应蒸馏教的是什么知识,为什么它是最容易上手、也最常被低估的教法。
  2. 解释基于特征的蒸馏为什么要加适配层对齐师生特征维度,并说出 hint 层与引导层在 FitNets 方案里的分工。
  3. 区分基于关系的蒸馏里两类关系:样本与样本之间的相似性结构、层与层之间的相关性结构,并理解它们比逐点模仿多教了什么。
  4. 描述数据无关蒸馏的闭环:从随机噪声出发伪造"教材",让教师批改、学生练习,直到徒弟出师。
  5. 按手头资源(有无教师权重、有无训练数据、算力预算)为一次蒸馏任务勾选合适的教学方案。

核心概念速览

教师模型的知识不只在最后的概率分布里。前向传播的每一层都在"说话":输出层说结论,中间层说思路,注意力与样本间距说它眼中万物的关系。响应蒸馏学结论,特征蒸馏学思路,关系蒸馏学见识;三种形态不互相取代,工程里常常搭配使用。

金句:答案人人都有,分寸感只此一家——但思路和见识,往往比答案更值得学。

图 2-1 一条前向传播里藏着三种教材

图 2-1 一条前向传播里藏着三种教材

子章节导航

  • 2.1 答案里的分寸感:基于 Logits 的响应蒸馏:最经典的教法,软化概率分布当教材,配最小可运行实现。
  • 2.2 思考的过程:基于特征的蒸馏:让徒弟对齐老师傅的中间层特征,讲清维度适配与对齐位置的选择。
  • 2.3 万物之间的联系:基于关系的蒸馏:不逐点抄答案,改学样本间距离结构与层间相关性。
  • 2.4 师傅不在场:数据无关蒸馏:原始数据拿不到时的替代方案——自己造教材,闭环训练。

子章节之间的逻辑关系

本章四节按"教材离答案由近到远"排列:响应蒸馏只用最终输出,最简单;特征蒸馏深入一层,取材中间表示;关系蒸馏再抽象一层,取材结构而非点位;数据无关蒸馏则是资源受限下的兜底方案,与前三种正交,可以任选一种知识形态搭配使用。

响应(2.1) ─取材更深─> 特征(2.2) ─取材更抽象─> 关系(2.3) │ 资源受限兜底:数据无关(2.4) ────────┘ 可与前三种任意组合

本章知识点清单

  • 温度软化后的 Logits 匹配损失(KL 散度形式)的构成与手写实现。
  • 特征对齐中适配层(1x1 卷积或线性投影)的作用,hint 层与引导层的配对方式。
  • 逐点损失与关系损失的差别:样本对距离保持、注意力图迁移、Gram 矩阵匹配各教什么。
  • 数据无关蒸馏的伪样本生成闭环与模态崩塌风险。
  • 按资源约束(教师权重、原始数据、算力)选择知识形态的决策方法。

前置知识与后续延伸

前置:读完第一章即可;能看懂 PyTorch 的 Module 与 loss.backward() 基本用法更好。

后续:第三章会把本章反复出现的"温度"和"损失配比"掰开揉碎讲透;第四章讲教法的组织形式(离线、在线、自蒸馏)与进阶变体。三种知识形态在第四章各教法里都会复用,建议先在本章把三种教材的取法练熟。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U