本节摘要:深度学习常被当作黑箱,关键业务决策需要解释。SOURCE 把可解释与可信赖单列,并指出 TFT 的变量选择能提供抓手。对照层次是:统计系数、分解分量、注意力权重、事后归因。能回答的问题不同。要求“像 ARIMA 那样每个滞后一个系数”时,深度给不出同等答案,该承认,而不是用热力图冒充。
阅读完本节,你应当能够:
调度问“今晚为什么估高了”,库存问“模型是不是只盯着上周促销”。这些是不同问题。SOURCE 强调关键业务决策需要解释。把问题分成三层:
看了什么:哪些输入通道、哪些历史步权重大。变量选择、注意力适合。
为什么偏:相对可解释基线,残差来自哪类日。分组诊断适合,热力图不一定适合。
下次如何改:缺节日特征就加特征,漂移就重训。这是行动,解释工具只提供线索。
注意力权重大,不表示因果。模型可以盯着一个巧合通道。第 6.1 的消融仍然更硬。TFT 的变量选择把“看了什么”收成通道级权重,比逐步注意力更好对业务讲。分解网络把趋势季节画出来,对“是不是把春节当趋势”很有用。LSTM 细胞状态几乎没法对调度讲。
可解释强度大致: 线性系数 > 分解分量 > 变量选择 > 注意力图 > 细胞状态 越往右,越要搭配消融和分组残差
可信还包括:校准的区间、分布外拒绝、不泄漏。一个很会讲故事的注意力模型,若覆盖率只有 50%,仍不可信。SOURCE 把鲁棒性、泛化、不确定性与可解释并列在挑战里,不是让你只做 XAI 幻灯片。
把深度叠在统计基线上:ARIMA 或季节朴素给出可解释主预测,网络只学残差。主预测可以对人讲,网络增益可以单独关停。当解释要求高于精度要求时,这是我更倾向的结构。增益不稳定就关停网络,系统退回基线,而不是黑箱整体瘫痪。
事后置换重要性、局部线性近似,都能给出“这个输入一动输出怎么动”。它们对相关通道不稳定:气温和湿度一起动,重要性会乱分。报告时要声明。不要在论文式热力图上写因果动词。
| 工具 | 能答 | 不能答 | 搭配 |
|---|---|---|---|
| 线性/ARIMA 系数 | 滞后怎么进预测 | 强非线性 | 残差检验 |
| 分解分量 | 趋势季节是否串味 | 通道交互 | 业务对质图 |
| 变量选择 | 哪些通道被压低 | 步级理由 | 消融 |
| 注意力 | 哪些历史步被看重 | 因果 | 事件日案例 |
| 事后归因 | 局部敏感 | 稳定因果 | 相关声明 |
| 残差叠模型 | 可关停、可讲主预测 | 残差仍黑 | 增益监控 |
用测试段案例挑最好看的注意力图进汇报,是另一种过拟合。预先规定案例类型:普通工作日、高温日、节日、故障日各一张,无论好看与否都展示。这才是对照,不是广告。
⚠️ 常见坑:用注意力图证明模型“理解了春节”。权重落在春节附近,可能只是那里数值大。消融掉节日通道若误差不变,理解就是假的。
💡 关键直觉:解释工具回答的是预先写好的句子。句子是系数级因果时,深度常常应该让位或只做残差。
港口董事会若必须看到“班期系数”,深度主模型不合适,班期应留在可解释层,网络处理天气残差。产品结构服从解释约束,不是服从最新模型族。
可解释基线给出主预测,网络只学残差,增益单独监控。增益为负或漂移,关停网络,系统退回基线。关停开关是可信赖的工程定义,比任何热力图硬。董事会要班期系数,班期留在基线层,网络不准吃班期通道去“重新发现”它,否则解释权被抢走且可能学歪。
预注册案例:普通日、高温日、节日、故障日各一张注意力或变量权重,不管好看。额外再允许一张探索图,标为探索。用测试段海选最好看的图,与用测试段调参同类。置换重要性对相关通道不稳,报告加声明:气温湿度相关,重要性可能乱分,消融以组为单位。
解释要求高于精度时,深度可以不进主路径。这不是失败。SOURCE 把可解释列为挑战,等于承认有些场景黑箱不可上。对照结论允许“采用统计主模型”。可信还要求区间校准和拒绝分布外:不能解释、也不能说“我不确定”的系统,比能画图但不能校准的系统更危险。
把三句问题贴在模型卡上。每次汇报对三句作答,答不上来就不要展示架构图。架构图不是解释。
看了什么、为何偏、如何改。答不上来不要展示架构图。残差叠加可关停是可信赖的工程定义。班期系数若必须给人看,班期留基线层,网络不准重新发现它。预注册四类日的图,额外探索图要标明。相关通道的重要性声明乱分风险,消融以组为单位。解释要求高于精度时采用统计主模型,对照允许这个结论。不能校准也不能说不确定的系统,比能画图但不能校准的更危险。
线性系数、分解分量、变量选择、注意力图、细胞状态,能答的句子不同。要求像 ARIMA 每个滞后一个系数时,深度给不出同等答案,该承认或只做残差。注意力权重大不是因果。TFT 通道级权重更好对业务讲。可信还包括校准、分布外拒绝、不泄漏。很会讲故事但覆盖率 50% 仍不可信。残差叠基线可关停。预注册案例禁止海选好看图。置换重要性对相关通道不稳。产品结构服从解释约束,不是服从最新族名。
不能。模型卡贴三句:看什么、为何偏、如何改。答不上来收起架构图。残差叠加可关停比热力图硬。班期必须给人看就留基线层。注意力不是因果,消融更硬。预注册四类日。相关通道重要性声明乱分。覆盖率差则不可信,不管故事多好。解释要求高于精度时采用统计,对照允许。不能说不确定的系统更危险。产品服从解释约束。SOURCE 把可解释与鲁棒校准并列,不是只做幻灯片。
可解释对照先写三句问题再选工具。看了什么用变量选择或注意力线索,为何偏用分组残差对基线,如何改指向加特征或重训。架构图不是解释。要求每个滞后一个系数时,深度给不出同等答案,应让位或只做残差。注意力权重大不是因果,消融更硬。预注册四类日的图,禁止在测试段海选最好看的一张。可信还包括校准和拒绝分布外,覆盖率很差的故事模型仍不可信。残差叠加在可解释基线上可以关停,这是工程上的可信赖。相关通道的重要性会乱分,消融以组为单位。解释要求高于精度时采用统计主模型,对照允许这个结论,不是没学完深度。
把解释验收写成三句必答加关停开关。三句答不出,架构图撤下。关停开关测一次:关掉网络是否退回可讲的基线。测不过则深度不得进主路径。班期系数需求把班期锁在基线层。四类日预注册。消融组为单位。覆盖率差则解释验收失败。要求系数级因果时深度让位。验收通过才允许对外讲故事。故事不能替代校准。把验收表与模型卡钉在一起,评审只收表,不收热力图相册。对照允许结论是采用统计主模型。那是解释轴的合法落点,不是教程失败。
关停开关要在演练日真实关掉一次,看系统是否退回可讲基线。演练失败深度不得进主路径。三句必答写在模型卡正面。热力图相册不进评审包。组消融记录进卡背面。覆盖率差则故事禁用。系数级需求走统计主模型。演练、三句、覆盖,三关全过才对外讲。对照结论采用统计是合法落点。撤下架构图不是羞辱,是验收。
演练日真实关掉网络,确认退回可讲基线。失败则深度不进主路径。三句写在卡正面。相册不进评审。组消融在背面。覆盖差禁用故事。系数级需求走统计。三关全过才对外讲。采用统计是合法落点。撤架构图是验收。关停开关不演练等于没有开关。评审只收表不收热力相册。解释轴可以否决更大的对齐模型。
演练关掉网络后,基线必须仍能用班期或季节项对人讲。讲不出则关停开关是假的。三句空白的模型卡不得进评审。覆盖率未达名义,故事禁用即使图很好看。组消融没做,注意力图视为装饰。合法落点包括统计主模型。评审包不收相册。
评审包目录只列模型卡、三句答卷、关停演练记录、组消融表、覆盖率。出现热力相册则整包退回。退回后只许补目录内文件,不许补更大的结构图来顶替验收。
整包退回只补目录内五件。用更大结构图顶替验收,第二次退回并暂停深度主路径,直到关停演练通过。暂停期间统计基线继续服务。
暂停期间统计基线继续服务,深度主路径不得用结构图申请解禁。
关停开关演练要在真实班次上做一次:关掉网络后,调度仍能用季节项讲清今晚高峰从哪来。讲不清说明可解释性从未接到基线,热力图再好看也不许解禁。
下一节把对照轴收到部署:批量定期重训和在线更新,谁更稳、谁更及时。