1.2 经典统计为何不够用


1.2 经典统计为何不够用

本节摘要:深度学习相对 ARIMA、指数平滑的优势不是“更新所以更好”,而是六条可核对的能力:自动特征、非线性、长距离依赖、多变量与多模态、不规则与缺失、可扩展与迁移。每条都有反例。短、稳、线性的序列上,统计模型仍然是更省的对照基线。

本节目标

阅读完本节,你应当能够:

  1. 背出 SOURCE 列出的六条深度优势,并能各举一个反例
  2. 说明 RNN/LSTM/GRU 与 Transformer 分别补的是哪一类“统计做不到”
  3. 写出从统计切到深度的切换条件,而不是按团队偏好切换
  4. 在对照表上标出自己项目当前落在哪一格

一、统计模型到底赢在哪

变电站负荷若主要是“工作日双峰 + 缓慢年增长”,差分后近似平稳,ARIMA 或季节指数平滑就能把明天的形状描出来。SOURCE 承认:传统模型在线性关系、较短时间依赖上表现良好。这不是客套。线性短依赖意味着:滞后几阶的自相关已经把可预报部分抽干,残差接近白噪声。这时再堆 LSTM,网络会把残差里的噪声也拟合进去,验证集好看、换一个月份就垮。

统计模型还有三样深度短期内替代不了的东西。第一,参数少,冷库这种一年只有几千个点的序列,ARIMA 不会过拟合到离谱。第二,诊断工具成熟:ACF、PACF、Ljung-Box,残差不合格能直接指出阶数或差分没做够。第三,可解释:系数对应滞后,调度员问“为什么今晚估高了”,你可以指到季节项。深度模型要同等程度的解释,得另上注意力可视化或事后归因(第 6 章)。

所以“为何不够用”的主语不是统计,而是你的序列已经越出统计舒服区。越出之前,深度是可选项,不是必选项。

二、六条优势,一条一条对照

SOURCE 写的六条,我改写成对照句,方便贴进评审材料。

自动特征提取。 统计侧要人设计滞后、滚动均值、节日哑变量。CNN 与 RNN 能从原始序列里学层次化特征:局部波峰、日周期、异常尖刺。反例:样本只有几个月、节日规则清晰时,手搓日历特征往往比让网络自己“发现春节”更稳。

非线性。 多层非线性变换能捕捉负荷对温度的 U 形响应:太冷太热都升负荷,中间低。ARIMA 是线性的,外生回归也多半是线性项。反例:若非线性很弱,线性模型的偏差小于深度模型的方差。

长距离依赖。 基本 RNN 会梯度消失;LSTM、GRU 用门把较早信息留下来;Transformer 用自注意力直接对齐远距离时间步。统计侧的长依赖通常靠提高阶数或季节阶,阶一高,参数和识别就变难受。反例:真正的长依赖很少,很多“长依赖”其实是没把季节项写进模型。

多变量和多模态。 深度可以把天气、促销、甚至文本描述、图像拼进同一张量。统计的多变量 VAR 参数随变量数平方涨。反例:协变量比样本还吵时,多变量深度会先学会噪声通道。

不规则和缺失。 注意力和图网络能在不规则采样上工作。统计通常先插值到规则网格,插值本身会制造假自相关。反例:缺失是成段的设备掉线,插值和掩码都救不了,该标成不可预报区间。

可扩展与迁移。 训完之后推理快;预训练、迁移能把一个变电站的表示挪到另一个。统计模型几乎每个序列单独定阶。反例:分布漂移很大时,迁移比从头训一个小统计模型更危险。

图 六条优势与反例对照

图 六条优势与反例对照

能力 统计侧典型做法 深度侧典型做法 我何时切到深度
特征 滞后、差分、哑变量 卷积/循环自动抽 手搓特征已经穷尽
非线性 变换、分段回归 多层激活 温度-负荷呈 U 形等
长依赖 高阶/季节阶 门控或注意力 季节阶仍解释不了跨周事件
多变量 VAR、外生回归 多通道张量 变量数涨、交互多
缺失 插值后当完整 掩码、注意力 插值制造假相关
迁移 几乎没有 预训练微调 多站点共享形态

三、切换条件写成可检验的句子

我用三条硬条件,满足两条才启动深度对照实验(不是直接替换上线)。

第一,统计基线的残差在验证段仍有可预测结构:按小时或按星期分组的残差均值不为零,或某类事件日后残差系统性偏。第二,业务已经提供了统计模型吃不进去的信号:例如文本公告、图像、强非线性外生。第三,样本量足以撑起深度的方差:经验上,至少要覆盖若干完整季节周期,而不是三周数据训 Transformer。

不满足时,把预算花在数据质量和日历特征上,收益通常更大。SOURCE 后文也强调:数据准备、模型选择、训练策略、评估方法,仍然是成功应用的关键——深度不是把这些步骤删掉。

核心架构的对照放到第 4 章:RNN 及其门控、一维卷积与 TCN、Seq2Seq 与注意力、Transformer、MLP 与混合。本章只需要记住分工:RNN 族补“逐步记忆”,卷积补“局部模式且可并行”,注意力补“远距离对齐且可并行”。统计模型三项都不擅长,这才是“不够用”的技术含义。

⚠️ 常见坑:用深度模型的训练误差去对比 ARIMA 的测试误差。对照必须在同一段按时间切开的测试集上,用同一套指标。
💡 关键直觉:六条优势是能力菜单。点菜之前先看盘子里有没有对应的食材——非线性、长依赖、多通道,缺哪条就别为那条去上深度。

港口吞吐量若同时受航线班期(规则季节)、台风(稀疏外生)、全球景气(慢周期)影响,统计模型要把三件事都写成项,项一多就难识别。深度可以把班期做成已知协变量、台风做成事件掩码、景气做成慢趋势通道,这是优势真正落地的样子,而不是“换一个更潮的缩写”。

四、切换条件的反面:深度先上会怎样

满足两条硬条件再对照深度,是为了挡住另一种常见浪费:团队会训网络,于是所有曲线默认进 GPU。冷库一年几千点、形态就是设定值附近的控制抖动,统计残差已经接近无结构。上 LSTM 会把抖动背下来,换一个控制器参数就垮。这不是深度弱,是题目没有非线性可学。

即便高温负荷呈 U 形,也可以先在统计侧加温度的分段或样条外生,再决定要不要网络。深度的非线性优势,对照对象应是“已经尽力的非线性统计”,不是最朴素的 ARIMA。否则你证明的只是“非线性存在”,不是“必须多层感知”。

长依赖也要先拆季节。滞后 96 的日周期,用季节项或日历就能写进统计模型。真正的长依赖是:上周一次线路跳闸,影响这周的用电行为,且不能被星期哑变量吸收。这类事件稀疏,深度也未必学得好,事件掩码可能比加深网络更对症。六条优势里,“长依赖”被误用得最多,因为它听起来像购买 Transformer 的许可证。

可扩展与迁移同理。把 A 站模型搬到 B 站,若两站峰形差很多,迁移比各站一个小统计模型更危险。SOURCE 写迁移是优势,前提是形态可共享。优势清单要连着前提读,删掉前提就变成广告。

对照实验预算有限时,顺序是:统计基线 → 统计加合法外生 → MLP 加同一外生 → 一种序列族。跳过前三步直接上混合深度,日志无法回答“深度到底赢在哪一条优势”。赢在外生而不是赢在网络,却采购了显卡,是切错轴的典型账单。

五、六条优势的验收句

每条优势写成可打勾的验收,而不是形容词。自动特征:手搓日历和滞后之后,网络是否还能稳定降误差。非线性:分段外生已经上了,网络是否再降。长依赖:季节项写全后,跨周事件残差是否还在。多变量:同一外生给统计之后,深度是否仍赢。不规则:网格化统计对照事件模型,谁在决策网格上更好。迁移:换站后是否仍优于该站自己的小统计模型。六句有两句为否,就不要用“深度学习全面更好”收束。SOURCE 的优势清单连着前提;删掉前提会变成采购口号。验收句是把前提留在现场。

六、对照实验的最小公平包

公平包四件:同一时间划分、同一原单位主指标、统计基线、统计加合法外生。缺任何一件,深度优势说不清。很多人用训练损失打 ARIMA 测试误差,或用标准化空间打原单位,SOURCE 后文评估章节默认你不会这样比。六条优势的验收句要在公平包上打勾。非线性验收若对照的是最朴素 ARIMA 而不是已加温度样条的回归,你只证明了非线性存在,没有证明必须多层。

长依赖验收前先写全季节项。滞后 96 的日周期不是购买注意力的许可证。真正跨周且不能被星期哑变量吸收的事件,才进入长依赖讨论,且事件掩码可能比加深网络更对症。迁移验收必须换站或换年,不能在同站同季节上宣称可扩展。把公平包写成项目开工检查,第 4 章才有资格开张。不满足两条切换条件时,预算应留在数据质量和日历,而不是显卡。

七、基线不是羞辱深度

统计基线是给深度一张准考证,不是证明深度过时。指数平滑把清晰日形状吃掉之后,深度才被允许回答残差里还有没有温度弯折。没有这张准考证,显卡上的胜利无法翻译:你不知道赢的是非线性、是外生通道、还是仅仅记住了训练年的均值。港口班期清晰时,准考证往往很难及格,这是正常停点,不是没学完网络。

一节小结

  • 统计赢在:线性短依赖、小样本、诊断工具、系数可解释
  • 六条深度优势:自动特征、非线性、长依赖、多变量多模态、不规则缺失、可扩展迁移
  • 每条都有反例,节日清晰、非线性弱、假长依赖、吵通道、成段掉线、分布漂移
  • 切换条件:残差仍有结构,或出现统计吃不进的信号,且样本覆盖足够季节
  • 对照必须同一测试段、同一指标,禁止训练误差对测试误差
  • 架构分工预告:门控记逐步记忆,卷积抓局部并行,注意力做远距离对齐

下一章把数据特性和预处理放到对照表上:同样的缺失、同样的非平稳,统计路线和深度路线处理方式并不相同。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U