本节摘要:批量预测在固定周期用静止权重打未来一段;在线或实时要求新点到达后很快给出预测,并可能更新模型。SOURCE 把实时与在线单列,挑战里包含漂移与稀疏不规则。对照点是延迟、吞吐、漂移跟踪、灾难性遗忘。不是所有深度族都适合逐步更新;很多场景定期重训的批量模型已经够。
阅读完本节,你应当能够:
推理时钟:新观测到达后多久必须吐出预测。电网秒级、港口日前、冷库分钟级,预算差几个数量级。训练时钟:多久允许改权重。可以每步更新,可以每晚重训,可以每月。SOURCE 的实时在线,常常被听成必须每步反向传播。其实多数业务是:推理要快,训练仍批量。
批量静止模型在分布稳定时最省事。漂移出现,误差会在第 5.5 节那种“后半测试垮”里显形。补丁是滚动重训:每天用最近若干季节的数据重训或微调,权重在夜间更新,白天推理仍用冻结图。这仍是批量,只是批次更勤。真正的在线学习每步更新,延迟和稳定性都更难。
变电站日前预测:推理时钟是小时级,训练时钟可以每日。上线一个大 Transformer 只要推理时延合格,不必在线学习。公交到站若要在到站事件后一秒内更新下一班估计,注意力大窗口可能超预算,GRU 一步前向更合适。族的选择此时被延迟轴约束,不是被精度轴单独约束。
推理时钟: 新点 → 预测 必须 < 预算 训练时钟: 新点 → 改权重 可以慢很多 先满足推理,再决定训练是否在线
概念漂移:负荷因新能源接入变形状,港口因新航线变周结构。静止模型会偏。在线大力更新会遗忘:最近一周的学习率把一年的春节形态冲掉。对照手法是经验回放:更新时混入旧季节样本;或弹性权重巩固;或只用很小学习率微调最后一层。全模型大学习率在线跑,季节任务上几乎必伤。
不规则实时流:事件到达间隔不等。要先决定输出网格:仍按整点报,还是按事件报。与第 2 章重采样对照同一句话:决策时刻决定网格。在线系统里补点、迟到数据(先到一个错的负荷,五分钟后修订)必须写入信息集规则:用当时能拿到的值,修订只影响下一轮,不要偷偷改已经发出的预测日志,否则无法回放评估。
| 模式 | 推理 | 权重 | 跟漂移 | 伤季节 | 适用 |
|---|---|---|---|---|---|
| 静止批量 | 快 | 不变 | 差 | 无 | 稳定分布 |
| 定期重训 | 快 | 周期换 | 好 | 可控 | 大多数预报 |
| 增量微调 | 快 | 小步改 | 更好 | 有风险 | 缓慢漂移 |
| 逐步在线 | 受更新拖累 | 每步改 | 最快 | 高 | 真要逐步、且有回放 |
| 大模型每步反传 | 难 | 每步 | 理论美 | 很高 | 通常不选 |
回测必须用当时信息集:当时的天气预报、当时未修订的测量。用事后干净数据回测在线策略,会高估。这和协变量泄漏是同一类错误,只是发生在部署章。延迟预算应做成硬门槛:超预算的族直接淘汰,哪怕离线 RMSE 更好。对照表增加一列:P95 推理时延。
集成在线更贵,模型数乘时延。第 4.5 的简单平均在实时可能不合格。此时回到单模型 + 定期重训,往往是工程最优,不是学术最优。
⚠️ 常见坑:把每晚重训叫成在线学习。名词错了会让人以为必须上增量算法。定期重训已经能追多数季节性业务的慢漂移。
💡 关键直觉:先切两个时钟。推理预算选族,训练频率追漂移。两者解耦,系统才简单。
冷库若压缩机效率按月变,每月重训足够。把每分钟温度都拿去更新 LSTM,只会让模型追传感器抖动,季节日周期被冲淡。在线不是更勤就更好。
预测一旦发出,记录所用的测量版本、天气预报版本、模型权重版本。五分钟后测量修订,只进下一轮输入,不改已发出记录。回测若用修订后的干净数据,会高估在线策略。这和训练用事后气温是同一类泄漏,只是发生在部署。
两个时钟分开写进运行手册:推理必须在预算内结束;训练在夜间或空闲窗。手册禁止把两者写成“实时学习”一句。定期重训的数据窗口要含完整季节,避免用最近两周覆盖全年。学习率在增量微调时要比批量小一个数量级,并混入回放样本。全量大学习率在线跑季节任务,春节形态会被最近一周冲掉。
延迟门槛写成 P95。超阈值的族离线再准也不部署。集成倍数时延,实时场景常退回单模型。迟到数据、乱序事件要有队列策略:等待一小段还是按当时可见集合立即报。等待改善信息集、伤害延迟,对照由业务选,模型组不擅自等。
冷库分钟级抖动不该每分钟更新权重。压缩机慢漂移用月频重训。更勤不等于更在线、更准。名词用准:静止、定期重训、增量微调、逐步在线,四格不要混。SOURCE 的实时在线是这一对照轴的名字,不是必须逐步反传的命令。
推理预算内结束,训练在空闲窗。禁止写成实时学习一句。发出记录锁测量版本、预报版本、权重版本,修订只进下一轮。回测用当时信息集。定期重训窗口含完整季节。增量学习率小一个数量级并回放。P95 延迟超阈淘汰离线冠军。更勤更新不等于更准,分钟抖动不该每分钟改权重。四格:静止、定期重训、增量微调、逐步在线。SOURCE 的实时在线是轴名,不是逐步反传命令。
推理选族,训练频率追漂移。多数预报是快推理加夜间重训。把每晚重训叫成在线学习,会让人以为必须增量算法。逐步大力更新会遗忘春节形态,要回放或极小学习率。迟到修订不改已发出日志。回测用当时预报和未修订测量。延迟硬门槛可淘汰离线更准的大模型。集成倍数时延常退回单模型。分钟抖动每分钟更新会追传感器噪声。四格名词写进手册。SOURCE 实时在线是对照轴,不是每步反传。
跟两个时钟和季节尺度,不跟勤快。压缩机月漂月训够,分钟更新会追抖动。新能源接入改变峰形,才考虑更勤的定期重训或小步微调。大学习率逐步更新会冲掉春节。回放旧季节样本。发出日志锁版本,修订不改历史。回测当时信息集。P95 超阈淘汰。四格名词写手册。把定期重训叫在线会误导算法选型。SOURCE 实时在线是轴名。解耦推理与训练,系统才简单。更勤不等于更准。
在线对照先切两个时钟。推理必须在预算内给出预测,训练可以夜间或空闲窗更新。多数业务是快推理加定期重训,把每晚重训叫成在线学习会误导算法选型。逐步大力更新会遗忘季节,需要回放旧样本或把学习率降一个数量级。发出记录锁住测量版本、预报版本、权重版本,修订只进下一轮。回测必须用当时信息集,用事后干净数据会高估。延迟分位门槛是硬约束,超阈的离线冠军不部署。分钟级抖动不该每分钟改权重,慢漂移用月频重训。四格名词写进运行手册:静止、定期重训、增量微调、逐步在线。更勤不等于更准。解耦之后系统才简单。
把运行手册两页写完才许部署。第一页两个时钟和延迟分位门槛。第二页四格更新模式、回放规则、发出日志字段、当时信息集回测法。分钟抖动禁止逐步改权重。季节任务禁止大学习率在线。修订不得改历史发出。超阈模型不部署。手册名词不得写成实时学习一句。两页与切分卡版本一致。值班按手册,不按论文。更勤更新要在手册里写预期收益和遗忘风险,写不出则维持定期重训。解耦是简单性来源。SOURCE 的实时在线只为这两页提供轴名,不提供必须逐步反传的命令。
手册两页不齐不许部署。门槛用上线硬件测。四格更新模式圈定一格,圈定逐步则必须写回放与小学习率,写不出改圈定期重训。发出字段缺一视为日志非法,回测作废。值班只执行手册。更勤更新无预期收益不得改圈。轴名不是命令。两页与切分卡同号。解耦写在页眉:推理时钟、训练时钟。页眉看不清的手册重写。
两页手册不齐不部署。门槛用上线硬件。四格只圈一格,圈逐步必须写回放与小学习率,写不出改定期。发出字段缺一则回测作废。值班只执行手册。无预期收益不得更勤。页眉写清两个时钟。看不清重写。轴名不是逐步反传命令。同号切分卡。分钟抖动禁止逐步改权重。季节任务禁止大学习率。解耦写在页眉是为了值班一眼看见该快的是推理不是训练。
四条对照轴到此收束:统计对深度、三族结构、单步对多步、点对区间。把切分卡填完,再决定要不要打开训练环。