能量基模型把数据分布写成玻尔兹曼式的归一化指型,训练前后相矛盾;扩散的方向性可以看作执意学"分数"(分布的对数梯度)来规避归一化,从而把两套看起来无关的框架接上了血脉。本节定义分数,指出它与去噪扩散的同源关系。
读者看到"能量基模型"多半条件反射地想逃——这名字像物理学又像裁判学。我先帮它降维:它不外乎把图像出现的"可能性"画成一座山的形状,山越高代表越像真的图,模型学习的就是这座山长什么样。而"分数建模"听上去更玄,其实只指一件事——不去画整座山,只去学山上每一点"往山顶爬的方向和坡度"(对数密度梯度)。这一节的真正目的不是给你上物理课,而是打通一条认知:为什么我们能用一个去噪网络,去隐式地建模"这座概率山"。打通它,你对扩散的掌握就从"会跑代码"升级到"懂来龙去脉"。
能量基模型用能量函数定义分布:能量越低的状态越可能(意味着真实图的能量低、噪声图的能量高),图像出现的概率与它对能量的负指数成正比。训练的理论是让模型山尽可能靠近真实数据山,但实际操作卡在一个死结——要算概率必须求一个只与"全体可能图像"有关的归一化常数,这在图像这种超高维空间里压根算不动。这是能量基模型长期难落地的根。
转折点在于:我们其实可以绕开"概率值"本身不去算它,只去学"分布的对数梯度",也就是往山上爬的那条坡向。因为归一化常数在对数里只是一项与样本无关的加和,求梯度时正好相互抵消,直接被消掉。于是"学密度"这个难活,被降维成"学每一点的爬坡方向"——这就是"分数"(score)的定义。采样也不必反转复杂积分,只需顺着坡往上走(朗之万采样之类的迭代),就会在山顶附近找到更像真的图。
下面这点可能让很多人一激灵:噪声-预测扩散,求的正是这条"坡"的某个尺度形式。你可以体会一下,去噪网络在"预测这一步噪声"时,其实是在指出"当前状态相对干净图偏离了多少、该往哪个方向收敛"——这正是"往山顶爬"的方向的另一种表述。文献里那句"score = 噪声梯度"说的就是这个等价关系。因此,分数模型与去噪扩散不是两个割裂的流派,而是一条理论谱系的两端:扩散以离散的逐步加噪/去噪出现在你眼前,分数模型以连续的能量坡面藏在其后。
这个同一性有多实用?它让一大批为分数设计的数学工具(连续时间 SDE、精确率估计、加速求解)能无缝套到扩散上,也让"求解逆向随机方程"这一整套更快的算法成为可能。你觉察到这是为什么我们在 2.4 能请出 DPM-Solver 这类十步内起飞的主因之一。
把"整座山 vs 只学坡向"的差异可视化一下:
对工程人来说,这道理论课的价值不在于让你去重写其实践公式,而在于让你在面对"为什么这个加速器那样设计""为什么一致性模型要配那条调度曲线"时不至于盲从。当你有天拿起一篇关于分数与 SDE 的论文,你能一眼看出它想表达的是一张连到扩散的连续地图,而不是一本独立的外星教材。这就是本节能给你最大的一贯性收益。
要把这条收益说得再白一点:学会这套语言之后,你再读任何"基于 Tweedie / 概率流 ODE / 随机微分方程"的采样器介绍,会发现自己能反向跳过那些吓人的积分式,直接抓住它真正在动的手脚——"它是在爬得更稳,还是抄了近道"。这套"看穿外壳找内核"的能力,比记住任何单个公式都要值钱,也是本章之所以排在架构第三章、专门补理论底的原因。
把这套视觉化语言固定下来,后面所有高级采样都能用三件套来念叨:山是真实数据的分布,坡是分数也就是往山顶的方向,向导是那个去噪网络。多数采样器可以粗分成"顺着坡一直走"和"时不时也跳两步换座山"两种性格:
| 采样性格 | 对应直觉 | 举例 | 代价 |
|---|---|---|---|
| 老实爬山 | 每一步都顺着分数方向走 | 确定性采样、DPM-Solver | 快但要稳 |
| 走走停停 | 偶尔注入噪声再爬,探索更多峰 | 高随机性采样 | 慢但更多样 |
| 一步到位 | 信任向导直接推终点 | 一致性模型 | 快但放弃中间推敲 |
这套口语的价值在于跨域打通:当别人说"这里要降低噪声系数避免在山谷打转"时,你脑子里浮现的是同一张山与坡的画面,而不是一串无从下手的符号。数学上的一行公式,落到直觉上常常就是这样一句能执行的话。
把这条理论谱系再往外引一步,你会发现"能量 / 分数 / 扩散"并不是某个学科角落里孤零零的三个名词,而是"用概率山去描述生成"这一个母题之下的三种递进姿势。能量基把分布写成一整座山的负指数,因归一化难算而搁浅;分数模型绕开概率值、只学爬坡方向;扩散则把它一步步离散成"加噪-去噪"的可执行操作。三步走下来,从"这张图画不画得出来"的数学难题,一路降维到"一个去噪网络每步该吐多少噪声"的工程动作。你以后再看到任何"基于分数 / 能量 / 连续性"的生成模型名字,都能立刻把它塞回这条谱系线上对号入座:它多半只是把这三个姿势之一,换了个新的采样或架构外壳。
⚠️ 常见坑:把分数当成"艺术家风格分数"或"评价体系里的分数"。此分数是严格数学定义的对数梯度,跟评分无关。不要在推理里混淆。
💡 关键直觉:归一化常数在求梯度时被消掉,是整个能量域思路逃出生天的钥匙;懂了这条,能量基、分数、扩散一家门。
二、三章把扩散的里子讲了个透,接下来第四章把它接到真实世界——从"文字出图"到"换脸换风格"等一堆生成应用。