本节摘要:点预测给一个数;区间或概率预测给范围或分布。SOURCE 把不确定性分成偶然(数据固有噪声)和认知(模型知识不足),并列了高斯负对数似然、分位数/Pinball 损失。风险管理要带宽,RMSE 考核要点。用残差标准差事后画带,不是正经的不确定性量化。
阅读完本节,你应当能够:
备用机组开不开,问的是负荷上尾。安全库存问的是需求高分位。SOURCE 写:仅点预测往往不够,数据有随机性、测量误差、模型局限。不确定性量化要表达这些,而不是把点画得更精。
偶然不确定性:即使模型完美、数据无限,噪声还在。传感器抖动、交通微观混沌。它随输入区域变:高峰更吵,深夜更静。认知不确定性:参数没估准、结构选错、样本没覆盖该区域。多给数据、改进结构,认知可降,偶然降不掉。决策含义不同:偶然宽说明世界本身吵,该留缓冲;认知宽说明模型没见过这类日子,该派人看数据或保守决策,而不是假装带宽是物理噪声。
深度默认是确定性映射,同输入同输出。要区间,得改头和损失,或改推理(如 Dropout 在测试时仍打开做近似贝叶斯)。只改绘图,不改训练,是装饰。
点: 一个 y_hat 分位: 一组 y_hat_tau 例如 10/50/90 高斯: mu 与 sigma,再由分布出区间 集成: 多个模型点的散布 ≈ 偏认知

Pinball:要 τ 分位,估低了罚 τ 倍,估高了罚 1-τ 倍。不假设误差正态,负荷高峰偏态时更老实。多个 τ 一起训,得到带子。交叉问题:网络没被要求 0.9 > 0.5,可能交叉。补丁是单调约束、或事后按分位排序(粗糙)、或用单一高斯再取分位(回到正态假设)。
高斯 NLL:SOURCE 写出均值平方误差除以方差再加对数方差项。高峰若偏态、有硬上限,正态会在一侧估出无物理意义的负负荷。此时分位或截断分布更合适。σ 用 softplus。不要用全局残差标准差画带——那假设同方差,深夜和晚高峰共用一条带宽,调度会在深夜过于紧张或在高峰过于放松。
覆盖率应接近名义:90% 带子大约盖住九成真实点。长期系统性低覆盖,带子窄了或校准差。带宽过大则没有决策价值。多步区间应随 horizon 变宽,不变宽反而不诚实。
| 方法 | 假设 | 得到 | 认知成分 | 注意 |
|---|---|---|---|---|
| 事后残差标准差 | 同方差 | 装饰带 | 几乎无 | 不要当 UQ |
| 分位数 | 弱 | 分位点 | 弱 | 交叉 |
| 高斯 NLL | 正态 | μ、σ | 弱 | 偏态、负值 |
| 深度集成 | 少 | 点的散布 | 较强 | 贵 |
| 测试期 Dropout | 近似 | 散布 | 部分认知 | 需校准 |
骨干仍可以是 GRU 或 TCN,只换头和损失。这再次说明形态轴与族轴正交。业务若同时要一个考核点和一个备货上分位,可以双头:一个 MAE 点,一组 Pinball。不要用 50 分位硬当点考核,除非考核就是中位。
贝叶斯深度学习被 SOURCE 列为研究方向。工程上集成几个不同种子或不同族,用点的散布当认知粗指标,比完整贝叶斯先能落地。散布大的日子,触发人工复核,比把散布平均掉更有用。
⚠️ 常见坑:把点预测的置信带和预测区间混名。参数置信区间不是未来观测的覆盖带。
💡 关键直觉:区间是改损失和头,不是改线型图的透明度。
冷库若考核绝对误差,点用 MAE;若报警要“超过阈值的概率”,再加一个上分位头。两个头的对照比换 Transformer 更能回答报警是否误报。
名义 90% 的带子长期只盖住 60%,先校准再谈模型。校准差时换族很少能修好,因为头和损失没对齐不确定性。分位交叉用验证段计数:交叉次数高,加单调约束或改回高斯再取分位。事后把分位排序会破坏与损失的一致性,只可当临时补丁。
高峰偏态、可能出现负的物理量,高斯危险。负荷、吞吐量、温度若有硬边界,分位或截断更合适。深夜与晚高峰带宽应不同,同方差装饰带会在深夜过紧、高峰过松。把分小时覆盖率画出来,比一个总体覆盖率更有用。
双头:MAE 点给考核,上分位给报警。两头骨干共享、损失加权。权重按误报与漏报代价设。不要用 50 分位冒充考核点,除非考核就是中位。集成散布当认知粗指标:散布大的日子触发人工,而不是把散布平均掉当更准的点。
点冠军与区间冠军可以不是同一个族。日志允许两行部署:报表用点头,决策用分位头。硬要一个模型包打,会在某一轴上吃亏。形态正交再一次起作用。
允许两行部署:报表点头,决策分位头。硬要一个包打会在一轴吃亏。校准先于换族。分小时覆盖率比总体覆盖率有用。偏态有硬边界时分位优于高斯。装饰性全局标准差带禁止进材料。双头共享骨干、损失按误报漏报加权。集成散布大触发人工,不要平均掉当更准的点。50 分位冒充考核点,除非考核就是中位。形态与族正交,换头比换族便宜,本章再强调一次。
偶然宽说明世界吵,留缓冲。认知宽说明没见过这类日,派人看数据或保守决策。深度默认确定性映射,要区间改头和损失。装饰带禁止。Pinball 弱假设防交叉。高斯要正态且 σ 为正,负负荷无物理意义时不要。覆盖率与带宽一起看,多步应变宽。骨干可共用。点冠军区间冠军可不同族。双头按误报漏报加权。贝叶斯工程上先用集成散布当认知粗指标,散布大触发复核。置信区间不是预测区间,名字不要混。
不能当正经 UQ。同方差假设让深夜过紧高峰过松。要改头和损失。名义覆盖对实际覆盖,带宽过大没有决策价值。分位交叉要计数。偏态硬边界不要高斯出负值。偶然宽留缓冲,认知宽派人看。点与区间冠军可不同族。双头按代价加权。50 分位不是默认考核点。多步带子应变宽。骨干共用证明形态与族正交。置信区间不是预测区间。装饰透明度改不了训练。报警要上尾概率就加分位头,不必先换 Transformer。
区间对照先校准再谈带宽故事。名义百分之九十的带子长期只盖六成,换族很少能修好,因为头和损失没对齐不确定性。分小时覆盖率比总体更有用。高峰偏态、可能出现无物理意义的负值时,分位优于正态假设。全局残差标准差画带是同方差装饰,深夜过紧高峰过松。偶然宽留缓冲,认知宽派人看或保守决策。点冠军与区间冠军可以不是同一族,允许报表一个头、决策一个头。双头共享骨干,损失按误报漏报加权。多步带子随步数变宽才诚实。骨干可共用,证明形态轴与族轴正交。改线图透明度改不了训练。报警要上尾就加分位头,不必先换更大的对齐模型。
把区间验收写成校准先于带宽。验收项:名义对实际覆盖、分小时覆盖、平均带宽、是否随步数变宽、有无交叉、有无非法负值。装饰带直接不合格。点头与分位头可以两行部署。误报漏报代价写入双头权重。偶然与认知对应缓冲还是人工。骨干共用合法。验收项不合格时换损失和头,不换更大对齐模型。置信与预测两种区间名字不许混用。把验收项做成上线检查,领导要带子必须先过检查。透明度改图过不了检查。上尾报警加分位头即可启动验收,不必等待新族。
验收项做成上线检查清单。覆盖、分小时、带宽、变宽、交叉、负值,六项全过才给领导带子。装饰带直接打回。双头权重来自误报漏报代价表。不合格先改头和损失。名字混用打回。检查清单与切分卡同号。点行与区间行可以同时存在于部署,不必合并成一个神话模型。启动验收不需要新族,只需要分位头和合法验证。
六项验收全过才给带子:覆盖、分小时、带宽、变宽、交叉、负值。装饰带打回。双头权重来自代价表。不合格改头和损失。名字混用打回。点行与区间行可并存。启动验收只需分位头和合法验证,不需要新族。清单与卡同号。领导要带子先过清单。改透明度过不了清单。偶然宽留缓冲,认知宽派人,验收项里要能看出带子变宽是否随步数发生。
六项里任一项未测,带子不得外发。分小时覆盖若只在深夜合格、高峰不合格,总体覆盖合格也算失败。变宽未随步数发生,记不诚实。负值出在负荷或吞吐量上,记分布假设错误。双头代价表空白则权重无效。检查清单签字后才能进调度材料。
签字后的清单才是带子的身份证。无证带子不得进调度材料,也不得进领导页。
报表要中心点,库存要上分位,备用机组要超限概率。三个用户共用一个平方损失冠军,会让库存同事继续拍脑袋。区间节的产品动作是给用户分头,而不是给领导一张更宽的半透明带。分头之后允许骨干共用,这已经证明形态与族正交:换头比换族便宜这句话,在这里变成两行部署配置,而不是口号。
下一节问黑箱能不能上线:注意力、变量选择、分解分量能回答到哪一层,以及何时必须退回统计系数。