第一章 拜师之前:为什么要蒸馏


文档摘要

第一章 · 拜师之前:为什么要蒸馏 章节摘要:本章回答一个动身之前必须想清楚的问题:明明有性能很强的大模型,为什么还要费劲教一个小模型?我们把大模型落不了地的现实压力摆到桌面上,给出知识蒸馏的定义与核心思想,说清这门手艺在压缩工具箱里值在哪一环,最后把师傅、徒弟、传承课三要素一次讲透。读完本章,你应当能判断自己的业务场景适不适合上蒸馏,并且能对别人把"蒸馏"和"剪枝""量化"混为一谈的说法做出纠正。 学习目标 读完本章,你应当能够: 说出大模型从训练到部署之间卡脖子的三个环节:算力成本、内存占用、响应延迟,并能结合自己业务估算每个环节的压力大小。 用一句话向没接触过的人解释知识蒸馏:老师傅输出概率分布,徒弟模仿概率分布,而不是只背标准答案。

第一章 · 拜师之前:为什么要蒸馏

章节摘要:本章回答一个动身之前必须想清楚的问题:明明有性能很强的大模型,为什么还要费劲教一个小模型?我们把大模型落不了地的现实压力摆到桌面上,给出知识蒸馏的定义与核心思想,说清这门手艺在压缩工具箱里值在哪一环,最后把师傅、徒弟、传承课三要素一次讲透。读完本章,你应当能判断自己的业务场景适不适合上蒸馏,并且能对别人把"蒸馏"和"剪枝""量化"混为一谈的说法做出纠正。

学习目标

读完本章,你应当能够:

  1. 说出大模型从训练到部署之间卡脖子的三个环节:算力成本、内存占用、响应延迟,并能结合自己业务估算每个环节的压力大小。
  2. 用一句话向没接触过的人解释知识蒸馏:老师傅输出概率分布,徒弟模仿概率分布,而不是只背标准答案。
  3. 辨析硬目标与软目标的差别,解释软目标里"类别之间的分寸感"为什么是传统训练拿不到的信息。
  4. 把蒸馏、剪枝、量化、参数共享放进同一张工具表里,按"改结构、改精度、改学习方式"三条线分清各自的作用位置。
  5. 指出一次蒸馏的三要素——教师模型、学生模型、软目标,并能据此列出开工前的检查清单。
  6. 判断自己手头的任务属于"适合蒸馏"还是"先考虑别的方法"。

核心概念速览

知识蒸馏是一类迁移学习方法:先训练好一个大而准的教师模型,再让小而快的学生模型以教师模型的输出(而不只是数据标签)为学习对象。教师模型在千百万样本上磨出来的判断分寸——哪些类别容易混淆、混淆到什么程度——以软目标的形式传给了学生。一句话概括:蒸馏学的不是答案,是老师傅打量每个答案的眼神。

下面这张全景图给出本章四个小节的传艺链起点位置:

金句:剪枝是给老师傅瘦身,量化是让老师傅少说话,蒸馏是让一个本来就轻捷的徒弟把活学到手。

图 1-1 师徒传艺链全景

图 1-1 师徒传艺链全景

子章节导航

  • 1.1 模型太大带不上生产现场:把算力、显存、延迟三笔账算给你看,说明"大模型好"和"大模型能用"之间的鸿沟,这是蒸馏存在的根本理由。
  • 1.2 知识蒸馏的定义与核心思想:从 Hinton 2015 年那篇奠基工作讲起,说清软目标与温度直觉的由来,给出本册沿用的定义。
  • 1.3 蒸馏这门手艺值在哪:优势与场景:除了压体积,蒸馏还能提精度、省数据、护隐私;哪些场景该上、哪些场景别硬上。
  • 1.4 师傅、徒弟与传承课:三要素:把蒸馏拆成教师、学生、软目标三件事,给出开工前的检查清单。

子章节之间的逻辑关系

四节走的是"压力 → 定义 → 价值 → 拆件"的顺序:先有问题(1.1),才有针对问题的解法定义(1.2),定义立住了才好评估它的价值边界(1.3),最后把解法拆成可操作的部件(1.4)。

现实压力(1.1) ──催生──> 核心思想(1.2) ──兑现为──> 价值与场景(1.3) │ └──落成──> 三要素清单(1.4) ──通向──> 第二章

本章知识点清单

  • 大模型部署的三大瓶颈:训练推理算力成本、权重与激活的内存占用、线上服务的响应延迟。
  • 软目标与硬目标的定义差异,以及软目标携带的类间相似性信息。
  • 知识蒸馏、剪枝、量化、参数共享在模型压缩体系中的位置与先后配合关系。
  • 教师模型、学生模型、软目标三要素的选型检查项。
  • 蒸馏适用的四类典型场景与两类不适合硬上的场景。

前置知识与后续延伸

前置:只需要会训练一个基础的图像分类或文本分类模型,理解交叉熵损失与 softmax,就够读完本章;不需要任何压缩技术的先修。

后续:第二章顺着"老师傅到底知道什么"往下钻,把本章埋下的"软目标只是答案吗"这个问题展开成响应、特征、关系三种知识形态。若你此刻只关心"要不要用蒸馏",读完 1.3 即可先跳去第五章对照场景案例。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U