3.2 序列建模硬伤对照


3.2 序列建模硬伤对照

本节摘要:基本 RNN 有梯度消失或爆炸,难以捕捉长距离依赖,且逐步计算无法并行。卷积的感受野受核大小和层数限制。Seq2Seq 把整段历史压成固定向量,形成信息瓶颈。四条硬伤不是四个模型名字,是四类失败模式。LSTM/GRU、扩张卷积、注意力,分别是补丁,不是升级档次。

本节导读

阅读完本节,你应当能够:

  1. 用“连乘很多小于 1 的因子”解释梯度消失为何伤长依赖
  2. 对照 RNN 串行与卷积/注意力并行在训练时间上的差异
  3. 说明固定上下文向量为何成为编解码器瓶颈
  4. 把后文三个家族对上各自要补的硬伤,避免全家一起上

一、梯度路径太长,记忆先死

SOURCE 写得很干脆:基本 RNN 结构简单,存在梯度消失或梯度爆炸,难以捕捉长距离依赖。沿着时间反传时,同一套循环权重反复相乘。若谱半径小于 1,梯度指数衰减,前面的时间步更新几乎为零——网络“看见”了月初,梯度却到不了月初。谱半径大于 1,梯度爆炸,训练直接 NaN。

这不是调学习率能根治的。学习率再小,消失的路径还是消失。LSTM 的补丁是加一条近似线性的记忆细胞通路,并用遗忘门、输入门、输出门控制写和读,让梯度有一条比较好走的公路。GRU 把遗忘和输入合成更新门,参数更少。它们补的是硬伤一,不是“RNN 的豪华版”这么简单。即便有门,逐步展开仍然深,极长序列上门控也会忘,这才把注意力请上来。

变电站若用 96 点窗口预报下一点,基本 RNN 往往够,因为路径只有 96 步且日模式强。若窗口拉到四周的 96×28 步,基本 RNN 先死,LSTM 其次,注意力更合适。硬伤随 有效路径长度 出现,不随年份出现。

梯度沿时间 ≈ 连乘 W 的导数 因子 < 1 重复很多次 → 消失 因子 > 1 重复很多次 → 爆炸 门控:给细胞一条接近 1 的通路 注意力:不沿时间连乘,改为一步对齐

二、串行、感受野、瓶颈:另外三条

硬伤二:并行。RNN 第 t 步依赖 t-1 的状态,训练无法在时间维上并行。GPU 吃的是大矩阵,时间维串行时利用率差。SOURCE 写 LSTM 训练相对慢、并行化能力有限,GRU 类似。卷积和自注意力在时间维可并行,这是它们在长序列训练时间上赢的原因,不一定是精度上赢。

硬伤三:局部感受野。一维卷积一次只看核那么长的局部。SOURCE 写 CNN 难以直接捕捉长距离依赖,需要堆叠多层、扩张卷积、残差连接。扩张卷积让核之间插入空洞,感受野指数涨,参数几乎不涨。这就是 TCN 相对朴素 CNN 的对照点。感受野仍是有限的,只是可以设计得很大;注意力在窗口内是全连接的,不靠堆层去够远。

硬伤四:Seq2Seq 的固定上下文。编码器把输入压成一个向量再交给解码器。SOURCE 称这是信息瓶颈,长序列上更严重。注意力让解码器每一步回头看所有编码状态,瓶颈被拆掉。Transformer 走得更远:连循环都去掉,只靠自注意力。代价是计算随长度平方涨,极长序列又变成新硬伤——后面 Informer 一类要稀疏化,那是同一条轴上的下一刀,不是新故事。

图 四条硬伤与三族补丁

图 四条硬伤与三族补丁

硬伤 典型症状 优先补丁 补丁的新代价
梯度消失 早段特征等于没学 LSTM/GRU 仍串行,极长仍忘
无法并行 GPU 利用率低、墙钟时间长 TCN/Transformer 实现与显存
感受野短 跨周事件看不见 扩张卷积+残差 要设计扩张谱
瓶颈 长输入编解码质量掉 注意力 二次复杂度

三、不要四贴全上

工程上的对照策略:先量有效依赖长度。用偏自相关或简单滞后 MLP 看增益停在哪一阶。依赖很短,硬伤一三都不急,MLP 或浅 CNN 即可。依赖中等、数据不多,LSTM/GRU 仍是稳的默认,因为参数量相对注意力小。训练时间墙钟不可接受、序列又长,才把并行结构拉上来。多步生成还在用编解码器,再加注意力拆瓶颈。

SOURCE 后文会提到 Informer、Autoformer、FEDformer 针对长序列效率,TFT 还加变量选择和可解释。那些是硬伤在更长、更杂的数据上长出的新分枝。读它们之前,先承认:没有一种结构同时零梯度问题、全并行、无限感受野、线性复杂度。对照是选代价,不是选神话。

⚠️ 常见坑:窗口已经很短,仍上 Transformer“预防长依赖”。参数浪费在位置编码和多头上,小样本更容易过拟合。
💡 关键直觉:硬伤随有效路径长度出现。先量长度,再贴补丁。

港口跨洋班期以周为尺度,日序列上看起来“很长”,其实有效季节阶是 7 的倍数。用季节特征或周期卷积可能比上大注意力更对症。把日历能解释的周期误判成长依赖,是最常见的过度补丁。

四、量路径长度的土办法,比先上大补丁便宜

有效路径长度不是窗口长度本身。窗口 672 但真正有用的是滞后 96 的日周期和滞后 1 的惯性,有效路径可能很短,日历一加更短。土办法:滞后 MLP 扫一组滞后集合,看验证增益停在哪;或看 PACF 截尾。停得早,基本 RNN 或浅 CNN 的硬伤还没出现,预防性上 Transformer 是给平方复杂度交学费。

停得晚,再看墙钟。逐步 672 步 LSTM 在 CPU 上可能不可接受,这时硬伤二(并行)比硬伤一更急,TCN 优先于把 LSTM 加厚。若还要逐步生成任意长未来,并行编码加循环解码是混合,应等单族失败再上。瓶颈只在你真的用了固定向量编解码器时才急;直接多输出 MLP 没有这条瓶颈,不要把翻译模型的病当成所有多步的病。

扩张谱的覆盖空洞是硬伤三的隐藏形式:看起来层很多,某些滞后永远落在洞里。把感受野画成“能看见的滞后集合”,和 PACF 高峰对齐。对不上,加层没有意义。注意力没有洞,但有泄漏洞:解码未遮蔽。硬伤表应加一行“泄漏面”,它不是容量问题,是合法问题。

四条硬伤不会同时以同样强度出现。量完长度、墙钟、是否编解码、是否定窗,再开一到两张补丁。四贴全上,验证集先过拟合,诊断会指向“还要更新的变体”,那是读错硬伤表。

五、硬伤不会同样强度同时出现

量有效路径、墙钟、是否固定向量编解码、是否定窗,再开一到两张补丁。路径短,预防性 Transformer 是交平方学费。路径长且墙钟紧,并行比加厚 LSTM 更急。没在用固定向量编解码器,就不要把翻译模型的瓶颈当所有多步的病。扩张谱要画成能看见的滞后集合,和 PACF 高峰对齐,对不上加层无意义。注意力无洞但有解码未遮蔽的泄漏面,那是合法问题不是容量问题。四贴全上,验证先过拟合,诊断会错误指向还要更新的变体。

六、补丁账单要写在选族之前

门控买梯度公路,付串行和极长仍忘。TCN 买并行与可设计感受野,付定窗、覆盖空洞、无细胞精确取远事件。注意力买一步对齐和可画权重,付数据、显存、解码泄漏面。没有一种结构同时零梯度问题、全并行、无限感受野、线性复杂度。SOURCE 后面的 Informer 一类是平方账单的下一刀,不是新世界观。

量路径用滞后 MLP 或 PACF,不要用窗口长度本身。窗口 672 但日历吃掉星期后有效路径可能很短。短路径上预防性大模型是小样本过拟合。编解码瓶颈只在你真用固定向量时存在;直接多输出没有这条伤。硬伤表加一行泄漏面:双向、右填充、未遮蔽,都不是容量,是合法。先量再贴,贴一到两张。

问题:有效路径长度能不能用窗口长度代替?

不能。窗口是你喂进去的最大长度,有效路径是增益真正停止的滞后。日历吃掉星期后,672 的窗口里有效路径可能只剩日惯性。用窗口长度去买 Transformer,是把喂料长度当成了依赖长度。土办法便宜:滞后集合扫验证增益;PACF 截尾。停得早,硬伤一三都不急。停得晚再看墙钟决定并行是否急。编解码器才有固定向量瓶颈,直接多输出 MLP 没有,不要把翻译文献的病套到所有多步头上。扩张覆盖图对不上 PACF 高峰,加层没有意义。泄漏面单列,和容量分开治。

把硬伤表变成开工时的四问。第一问有效路径:滞后增益停在哪,不要用窗口长度冒充。第二问墙钟:逐步六百多步是否可接受,不可接受则并行优先于加厚循环。第三问有没有固定向量编解码器,没有则不要把翻译瓶颈套到直接多输出头上。第四问解码或填充会不会看见未来,会则先修合法再谈容量。四问之后最多开两张补丁。路径短时预防性上大注意力,是给平方复杂度交学费,小样本更容易过拟合。扩张谱画成能看见的滞后集合,对不齐偏自相关高峰就改扩张,不要加层。门控买梯度公路仍串行;卷积买并行仍可能有覆盖空洞;注意力买对齐仍有数据与泄漏账单。没有免费结构。量完再贴,贴完用同一测试段说话,不要用结构年份说话。

走查时把四问写在实验单页眉:路径停在哪一阶、墙钟是否可接受、有没有固定向量、会不会看见未来。页眉四问都空的对照,后面换族没有资格。短路径上大模型伤害小样本,这不是保守,是硬伤表的用法。补丁最多两张。覆盖图、遮蔽单测、因果填充审查,分别对应感受野、注意力泄漏、卷积非法,三件都比加层便宜。用结构年份代替四问,视为没读本章。

有效路径若停在日季节以内,预防性上大对齐结构是在给平方复杂度交学费。先画扩张谱或门控窗口能否看见主季节,看不见再谈换族。量完再贴补丁,贴完用同一测试段说话。

要点速记

  • 基本 RNN:梯度消失或爆炸 + 难以长依赖,SOURCE 原文就这两句,后面所有门控都为此
  • 逐步计算无法在时间维并行,墙钟时间是硬约束
  • CNN 感受野有限,扩张与残差是补丁
  • Seq2Seq 固定上下文是信息瓶颈,注意力逐步对齐来拆
  • 补丁都有新代价:串行、显存、扩张设计、平方复杂度
  • 先量有效依赖长度,再决定贴哪一张,短窗口不要预防性上大模型

下一章按家族对照:RNN 门控、CNN/TCN、注意力与 Transformer、MLP 分解、混合集成,全部对上本章硬伤表。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U