5.2 损失与优化器对照


5.2 损失与优化器对照

本节摘要:点预测常用 MSE、MAE、Huber;区间预测用分位数损失或高斯负对数似然。SOURCE 把 Adam 列为最常用优化器,并把 Dropout、L1/L2、早停列为正则。对照规则是:损失必须对齐输出形态——用 MSE 训出来的点,不能事后画成正经的预测区间。

本节地图

阅读完本节,你应当能够:

  1. 说明 MSE 为何放大异常、MAE 为何对尖峰更稳
  2. 在两者之间用 Huber 做折中时如何理解阈值
  3. 写出分位数损失对高估和低估的不对称惩罚
  4. 把学习率、批次、早停当成与模型族同等重要的对照旋钮

一、点预测三件套:平方、绝对、折中

SOURCE 列 MSE 最常用、适合点预测;MAE 对异常不敏感;Huber 结合两者优点。平方把大误差放得更大,变电站一次漏开机组的尖峰会主导梯度,模型会为了那几个点牺牲普通日子。若尖峰是故障,这是坏事;若尖峰是真正高峰,平方可能正是你要的,因为高峰估错代价最大。所以 MSE vs MAE 不是谁更先进,是业务代价是否二次。

MAE 梯度幅度恒定,异常日不会绑架训练,但零点不可导,框架里用次梯度即可。Huber 在小误差用平方、大误差用线性,阈值 δ 是对照项:太小接近 MAE,太大接近 MSE。我常把 δ 设在验证残差的某个稳健尺度上,而不是拍脑袋。

冷库温度考核若按绝对度数,MAE 与考核一致。负荷若按电量平方考核(少见)或你特别怕大错,MSE。不要用 MSE 训练、用 MAE 报告还不说明,评审会以为你在挑好看的指标。

MSE: 大错主导,适合真的怕尖峰漏估 MAE: 稳健,适合尖峰多为故障 Huber: δ 内当平方,δ 外当线性

二、区间两条路:分位数与高斯

SOURCE 把分位数损失列为区间预测用。Pinball 对低估和过估不对称:要第 90 分位时,估低了罚得更重,逼着输出往上走。同时训几个分位,得到带子。分位交叉(90 分位跑到 50 下面)是常见坑,需要约束或事后整理,第 6 章再展开。

高斯负对数似然让模型同时吐均值和方差:误差大的地方允许更大 σ,否则损失里的平方项除以方差会爆炸,反过来又用 log σ 防止方差无限大。这量化的是 SOURCE 后文说的偶然不确定性。σ 必须保证为正,常用 softplus 或预测对数方差。不要用 MSE 训均值、再拿训练残差当全局 σ——那是同方差假设,波动随时间变时带子会骗人。

优化器方面,SOURCE 点名 Adam 常用、收敛快;也列 RMSprop、Adagrad、SGD。门控网络对学习率敏感,Adam 的自适应比较省心。SGD 加动量在精心调学习率时有时泛化更好,但时间序列项目很少有预算去把这一条调到极致。批次不能太大:序列样本之间时间相关,超大批次让梯度过于平滑,像没看见近期漂移。批次也不能小到 1 导致门控训练抖到 NaN。对照几个数量级即可。

损失 输出 对异常 与考核对齐
MSE 点、偏均值 敏感 RMSE 考核
MAE 点、偏中位 稳健 绝对误差考核
Huber 可调 折中
分位数 分位点 由分位决定 备货上限
高斯 NLL 均值+方差 方差可吸收 要分布时

正则:Dropout 防过拟合;L1/L2 限制复杂度;早停在验证不再提升时停。早停的耐心值太短,会停在验证的偶然谷;太长等于没用。我把耐心设成若干个完整季节步,而不是固定 10 个 epoch——epoch 里含多少季节因数据而异。

三、损失与模型族不是绑死的

LSTM 可以用分位数损失,MLP 也可以。把“深度模型=MSE”写进模板,是把任务形态和模型族焊死了。对照实验允许:同一 GRU,一行 MSE,一行分位数。往往发现区间任务上,换损失比换族更有效。

⚠️ 常见坑:多步输出仍用逐步 MSE 平均,却在业务上只关心最后一拍或只关心峰值。加权损失应对齐决策时刻,不要平均得“每一步都差不多错”。
💡 关键直觉:损失是业务代价的可微版本。代价是二次、一次、还是不对称,先写下来再选公式。

港口若缺货贵、积压便宜,高分位损失比 MSE 更贴。反过来促销清仓,低估更贵,低分位。同一条吞吐量曲线,两种业务会选出两种损失,模型族可以不变。

四、同一骨干换损失,往往比换族更便宜

锁定 GRU 窗口和划分,一行 MSE,一行 MAE,一行 Huber,一行三个分位的 Pinball。点考核若是绝对误差,MAE 行应是部署候选,即使 MSE 行训练曲线更好看。区间考核看覆盖率,Pinball 行才进决赛。很多人换了三族网络,损失却始终 MSE,等于在错误的形态轴上做结构搜索。

多步加权:若业务只决策前 16 步,损失里后 80 步的等权平均会逼模型去讨好难以预报的远步,近步变差。权重可以按业务代价设,也可以按 horizon 衰减。这是损失设计,不是“模型不会多步”。高斯 NLL 的 σ 若塌缩到很小,训练会不稳定,常见原因是先用 MSE 预训练均值再开 NLL,或给 log-σ 加下限。这些是优化细节,对照时要写进日志,否则别人无法复现你的区间。

Adam 默认够用。出现门饱和或卷积训练僵死,先查缩放和学习率数量级,再换优化器。换优化器当第一手段,常常掩盖了数据没缩放。批次与序列相关:一个批次若全是相邻窗口,梯度估计偏。按时间隔开抽样,或混多站点,比把批次加到很大更有用。早停监控验证主指标,不是训练损失。主指标是 MAE 就监控 MAE,不要监控与部署无关的 MSE。

五、损失交叉表锁骨干

同一 GRU 窗口划分,MSE、MAE、Huber、Pinball 各一行。考核绝对误差则 MAE 是部署候选,即使 MSE 曲线更好看。区间看覆盖率。换三族却始终 MSE,是在错误形态轴上搜结构。多步按业务代价加权,远步等权会牺牲近步。NLL 的 σ 塌缩要写清是否 MSE 预训练、log-σ 下限。Adam 够用,僵死先查缩放。批次全是相邻窗则梯度偏,隔开抽样比盲目加大批次有用。早停监控部署主指标,不是无关的训练 MSE。

六、业务代价写成可微公式

二次代价用 MSE,一次用 MAE,不对称用分位,要分布用 NLL。冷库按绝对度数考核就 MAE。港口缺货贵积压便宜就高分位。同一条曲线两种业务选出两种损失,族可以不变。事后残差标准差画带不是 UQ。多步损失对齐真正贵的 horizon。Huber 的阈值放在验证残差稳健尺度上。σ 用 softplus 保证为正。正则 Dropout、权重衰减、早停至少开两样。早停耐心按季节尺度。Adam 常用默认,先查缩放再换优化器。损失与族交叉对照,换损失常常比换族更有效。

问题:为什么换族不如先换损失?

因为形态轴与族轴正交。区间任务上 Pinball 比把 MSE 冠军换成 Transformer 更对症。同一骨干四行损失交叉,部署跟考核对齐的那一行,不是训练曲线最好看的那一行。多步远近等权会牺牲决策真正用的近步。NLL 的 σ 塌缩要记录是否预训练。Adam 僵死先查缩放。批次相邻窗梯度偏。早停看部署指标。业务代价二次一次还是不对称,先写下来再选公式。港口缺货贵就高分位,与网络名字无关。事后标准差带不是不确定性量化。

损失对照把业务代价写成可微公式,再与骨干交叉,而不是与族名绑定。怕大错用平方,日常绝对偏差用绝对,折中用带阈值的混合,备货上尾用分位,要分布用均值方差的负对数似然。同一循环骨干四行损失,部署选与考核对齐的一行。区间任务上换损失常常比换族更有效。多步按真正贵的步加权,远近等权会牺牲近步。方差头必须保证为正。优化器常用自适应默认,僵死先查输入有没有缩放到门能工作的量级。批次若全是相邻窗口,梯度偏平滑,隔开抽样。早停监控部署主指标并回滚最佳权重,耐心按季节尺度。事后用训练残差标准差画带,不是不确定性量化,那是同方差装饰。

把损失选择写成代价备忘录:大错更贵、日常偏差、不对称备货、需要分布,四选一先圈定,再挑公式。圈定之后才允许同一骨干交叉四行。部署行必须与考核一致,训练曲线更好看的行只能当探索。远步等权会伤害近步决策,权重表跟切分卡版本走。方差为正的约束写进实现检查。优化器僵死先查缩放。相邻窗批次要隔开。早停监控部署指标,耐心按季节。装饰带禁止写入对外材料。备忘录一页纸,贴在损失函数配置旁。换族不自动换备忘录,除非决策代价变了。代价变了要升切分卡。把损失当模型族的附属品,是把正交轴焊死,本章不允许。

代价备忘录圈定之后,配置里的损失名字必须与圈定项一致。发现均方误差配置对着区间决策,视为形态轴焊死,立即停。交叉四行的部署行写进切分卡。装饰带从材料删除。换族不改备忘录,除非代价变了。代价变了升版本。备忘录一页纸够用,多了没人读。贴在配置旁是为了让值班能指出今天用的是哪一种代价。

配置里的损失名字必须对着代价备忘录的圈定项。均方对着区间决策立即停。部署行写进切分卡。装饰带删除。换族不改备忘录,代价变了才升版本。一页纸贴配置旁,值班能指出今天的代价是大错、日常、不对称还是分布。正交轴不允许焊死。自适应优化器僵死先查缩放。早停看部署指标。备忘录比优化器名字更决定上线对不对题。

值班指出今天代价类型时,应能不看代码只看备忘录页眉。页眉与配置不一致立即停。这是把正交轴写进值班语言,避免夜班把区间任务又改回均方误差图个好看的训练曲线。缩放未做导致的僵死,记数据契约问题,不记优化器问题。

早停监控的必须是部署指标,不是训练损失。训练损失还在降、部署指标已抬头时,继续等更低损失会把过拟合写成耐心。季节尺度的耐心以完整周为单位,不要用十个小批次冒充已看见星期结构。

一节小结

  • MSE 放大尖峰,MAE 稳健,Huber 用阈值折中
  • 分位数损失服务区间;高斯 NLL 服务均值+方差
  • Adam 是常用默认,批次与学习率仍要对照
  • 早停看验证,耐心按季节尺度而不是随便 10 步
  • 损失对齐任务,可与模型族交叉对照
  • 多步损失应对齐真正贵的那些 horizon

下一节把评估指标从损失里拆出来:训练用的可微公式,和报表用的业务数字,经常不是同一个。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U