6.3 点预测对区间


6.3 点预测对区间

本节摘要:点预测给一个数;区间或概率预测给范围或分布。SOURCE 把不确定性分成偶然(数据固有噪声)和认知(模型知识不足),并列了高斯负对数似然、分位数/Pinball 损失。风险管理要带宽,RMSE 考核要点。用残差标准差事后画带,不是正经的不确定性量化。

你能学到什么

阅读完本节,你应当能够:

  1. 用自己的业务例子区分偶然不确定性和认知不确定性
  2. 对照分位数带子与高斯均值方差带子的假设
  3. 用覆盖率和平均带宽评估区间,而不是只看点 RMSE
  4. 处理分位交叉,避免 90 分位落到中位下面

一、一个点回答不了“会不会超过上限”

备用机组开不开,问的是负荷上尾。安全库存问的是需求高分位。SOURCE 写:仅点预测往往不够,数据有随机性、测量误差、模型局限。不确定性量化要表达这些,而不是把点画得更精。

偶然不确定性:即使模型完美、数据无限,噪声还在。传感器抖动、交通微观混沌。它随输入区域变:高峰更吵,深夜更静。认知不确定性:参数没估准、结构选错、样本没覆盖该区域。多给数据、改进结构,认知可降,偶然降不掉。决策含义不同:偶然宽说明世界本身吵,该留缓冲;认知宽说明模型没见过这类日子,该派人看数据或保守决策,而不是假装带宽是物理噪声。

深度默认是确定性映射,同输入同输出。要区间,得改头和损失,或改推理(如 Dropout 在测试时仍打开做近似贝叶斯)。只改绘图,不改训练,是装饰。

点: 一个 y_hat 分位: 一组 y_hat_tau 例如 10/50/90 高斯: mu 与 sigma,再由分布出区间 集成: 多个模型点的散布 ≈ 偏认知

图 点、分位带子、分布:三种输出

图 点、分位带子、分布:三种输出

二、分位对高斯:假设不同

Pinball:要 τ 分位,估低了罚 τ 倍,估高了罚 1-τ 倍。不假设误差正态,负荷高峰偏态时更老实。多个 τ 一起训,得到带子。交叉问题:网络没被要求 0.9 > 0.5,可能交叉。补丁是单调约束、或事后按分位排序(粗糙)、或用单一高斯再取分位(回到正态假设)。

高斯 NLL:SOURCE 写出均值平方误差除以方差再加对数方差项。高峰若偏态、有硬上限,正态会在一侧估出无物理意义的负负荷。此时分位或截断分布更合适。σ 用 softplus。不要用全局残差标准差画带——那假设同方差,深夜和晚高峰共用一条带宽,调度会在深夜过于紧张或在高峰过于放松。

覆盖率应接近名义:90% 带子大约盖住九成真实点。长期系统性低覆盖,带子窄了或校准差。带宽过大则没有决策价值。多步区间应随 horizon 变宽,不变宽反而不诚实。

方法 假设 得到 认知成分 注意
事后残差标准差 同方差 装饰带 几乎无 不要当 UQ
分位数 分位点 交叉
高斯 NLL 正态 μ、σ 偏态、负值
深度集成 点的散布 较强
测试期 Dropout 近似 散布 部分认知 需校准

三、点与区间可以共用骨干

骨干仍可以是 GRU 或 TCN,只换头和损失。这再次说明形态轴与族轴正交。业务若同时要一个考核点和一个备货上分位,可以双头:一个 MAE 点,一组 Pinball。不要用 50 分位硬当点考核,除非考核就是中位。

贝叶斯深度学习被 SOURCE 列为研究方向。工程上集成几个不同种子或不同族,用点的散布当认知粗指标,比完整贝叶斯先能落地。散布大的日子,触发人工复核,比把散布平均掉更有用。

⚠️ 常见坑:把点预测的置信带和预测区间混名。参数置信区间不是未来观测的覆盖带。
💡 关键直觉:区间是改损失和头,不是改线型图的透明度。

冷库若考核绝对误差,点用 MAE;若报警要“超过阈值的概率”,再加一个上分位头。两个头的对照比换 Transformer 更能回答报警是否误报。

四、校准要比带宽故事更先

名义 90% 的带子长期只盖住 60%,先校准再谈模型。校准差时换族很少能修好,因为头和损失没对齐不确定性。分位交叉用验证段计数:交叉次数高,加单调约束或改回高斯再取分位。事后把分位排序会破坏与损失的一致性,只可当临时补丁。

高峰偏态、可能出现负的物理量,高斯危险。负荷、吞吐量、温度若有硬边界,分位或截断更合适。深夜与晚高峰带宽应不同,同方差装饰带会在深夜过紧、高峰过松。把分小时覆盖率画出来,比一个总体覆盖率更有用。

双头:MAE 点给考核,上分位给报警。两头骨干共享、损失加权。权重按误报与漏报代价设。不要用 50 分位冒充考核点,除非考核就是中位。集成散布当认知粗指标:散布大的日子触发人工,而不是把散布平均掉当更准的点。

点冠军与区间冠军可以不是同一个族。日志允许两行部署:报表用点头,决策用分位头。硬要一个模型包打,会在某一轴上吃亏。形态正交再一次起作用。

五、点冠军与区间冠军可以不是一族

允许两行部署:报表点头,决策分位头。硬要一个包打会在一轴吃亏。校准先于换族。分小时覆盖率比总体覆盖率有用。偏态有硬边界时分位优于高斯。装饰性全局标准差带禁止进材料。双头共享骨干、损失按误报漏报加权。集成散布大触发人工,不要平均掉当更准的点。50 分位冒充考核点,除非考核就是中位。形态与族正交,换头比换族便宜,本章再强调一次。

六、偶然与认知对应不同动作

偶然宽说明世界吵,留缓冲。认知宽说明没见过这类日,派人看数据或保守决策。深度默认确定性映射,要区间改头和损失。装饰带禁止。Pinball 弱假设防交叉。高斯要正态且 σ 为正,负负荷无物理意义时不要。覆盖率与带宽一起看,多步应变宽。骨干可共用。点冠军区间冠军可不同族。双头按误报漏报加权。贝叶斯工程上先用集成散布当认知粗指标,散布大触发复核。置信区间不是预测区间,名字不要混。

问题:用残差标准差画带能不能应付领导?

不能当正经 UQ。同方差假设让深夜过紧高峰过松。要改头和损失。名义覆盖对实际覆盖,带宽过大没有决策价值。分位交叉要计数。偏态硬边界不要高斯出负值。偶然宽留缓冲,认知宽派人看。点与区间冠军可不同族。双头按代价加权。50 分位不是默认考核点。多步带子应变宽。骨干共用证明形态与族正交。置信区间不是预测区间。装饰透明度改不了训练。报警要上尾概率就加分位头,不必先换 Transformer。

区间对照先校准再谈带宽故事。名义百分之九十的带子长期只盖六成,换族很少能修好,因为头和损失没对齐不确定性。分小时覆盖率比总体更有用。高峰偏态、可能出现无物理意义的负值时,分位优于正态假设。全局残差标准差画带是同方差装饰,深夜过紧高峰过松。偶然宽留缓冲,认知宽派人看或保守决策。点冠军与区间冠军可以不是同一族,允许报表一个头、决策一个头。双头共享骨干,损失按误报漏报加权。多步带子随步数变宽才诚实。骨干可共用,证明形态轴与族轴正交。改线图透明度改不了训练。报警要上尾就加分位头,不必先换更大的对齐模型。

把区间验收写成校准先于带宽。验收项:名义对实际覆盖、分小时覆盖、平均带宽、是否随步数变宽、有无交叉、有无非法负值。装饰带直接不合格。点头与分位头可以两行部署。误报漏报代价写入双头权重。偶然与认知对应缓冲还是人工。骨干共用合法。验收项不合格时换损失和头,不换更大对齐模型。置信与预测两种区间名字不许混用。把验收项做成上线检查,领导要带子必须先过检查。透明度改图过不了检查。上尾报警加分位头即可启动验收,不必等待新族。

验收项做成上线检查清单。覆盖、分小时、带宽、变宽、交叉、负值,六项全过才给领导带子。装饰带直接打回。双头权重来自误报漏报代价表。不合格先改头和损失。名字混用打回。检查清单与切分卡同号。点行与区间行可以同时存在于部署,不必合并成一个神话模型。启动验收不需要新族,只需要分位头和合法验证。

六项验收全过才给带子:覆盖、分小时、带宽、变宽、交叉、负值。装饰带打回。双头权重来自代价表。不合格改头和损失。名字混用打回。点行与区间行可并存。启动验收只需分位头和合法验证,不需要新族。清单与卡同号。领导要带子先过清单。改透明度过不了清单。偶然宽留缓冲,认知宽派人,验收项里要能看出带子变宽是否随步数发生。

六项里任一项未测,带子不得外发。分小时覆盖若只在深夜合格、高峰不合格,总体覆盖合格也算失败。变宽未随步数发生,记不诚实。负值出在负荷或吞吐量上,记分布假设错误。双头代价表空白则权重无效。检查清单签字后才能进调度材料。

签字后的清单才是带子的身份证。无证带子不得进调度材料,也不得进领导页。

七、带子的用户不是报表

报表要中心点,库存要上分位,备用机组要超限概率。三个用户共用一个平方损失冠军,会让库存同事继续拍脑袋。区间节的产品动作是给用户分头,而不是给领导一张更宽的半透明带。分头之后允许骨干共用,这已经证明形态与族正交:换头比换族便宜这句话,在这里变成两行部署配置,而不是口号。

要点速记

  • 点对齐考核,区间对齐风险与备货
  • 偶然降不掉,认知可随数据与结构降
  • Pinball 弱假设;高斯 NLL 要正态且 σ 为正
  • 禁止用全局残差标准差冒充 UQ
  • 覆盖率与带宽一起看;多步带子应变宽
  • 骨干可共用,换头比换族便宜

下一节问黑箱能不能上线:注意力、变量选择、分解分量能回答到哪一层,以及何时必须退回统计系数。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U