本节摘要:可解释AI 的方法版图分两族:事前可解释(模型本身结构透明,如线性模型、浅树)与事后解释(对黑盒模型归因或代理,如 SHAP、LIME、梯度类方法)。本节把版图讲清,衔接 6.3 的度量细节,并回答「解释给谁看」这个被低估的问题。
6.3 节解决的是「怎么算重要性」,本节往上抽一层:解释方法的全景、它们的信任等级、以及「解释」这件事的受众差异。可解释AI 在面试里近年升温,驱动因素非常现实——监管合规(信贷、医疗、招聘)与模型故障排查的共同需求。面试官在这里测的是你能不能把「热点名词」讲成「有边界的方法论」。
主问题:「可解释AI 有哪些方法?怎么分类理解?」
按解释的来源分两族。事前可解释:模型本身就是解释——线性回归的系数、决策树的路径、评分卡的分段打分,结构与解释同体,代价是表达力受限;「自解释模型优先」是高风险场景的第一原则,能用透明的模型达到合格效果,就别先上黑盒。事后解释:对已训练的黑盒模型做归因或近似——全局代理(用可解释模型拟合黑盒的输入输出)、局部归因(SHAP、LIME 给单样本的分量解释)、梯度类方法(积分梯度、Grad-CAM 给深度模型的空间热力图)。两族的信任等级不同:事前可解释是「模型即证据」,事后解释是「关于模型的证词」,后者可能被骗、可能相互矛盾,用于合规时要先验证解释本身的忠实度。
「证词与证据」的区分是这节的关键抽象:它能解释为什么监管机构偏爱评分卡这类自解释模型,也能解释为什么 SHAP 图不能作为唯一合规依据。
追问:「LIME 和 SHAP 都是局部解释,工程上怎么选?」
参考答法从机制差异切入。LIME 在目标样本附近做扰动采样、用可解释模型(通常是岭回归)拟合黑盒的局部行为:实现模型无关、直观便宜,但扰动分布要人工设定、结果随机性大、同一样本多次解释可能不稳定。SHAP 有公理化保证(6.3 节的效率性与一致性),解释稳定可复现,树模型有加速实现;代价是计算成本与「忠实度依赖于背景数据集的选择」。工程结论:要稳定的单样本归因与合规留痕,SHAP;要快速 sanity check 或模型是纯黑盒服务,LIME;两者结果矛盾时,先怀疑背景分布或扰动方案的设定,再怀疑模型。
追问:「模型解释的受众是谁?同一套 SHAP 值能同时给工程师和用户看吗?」
这是本节的思想题,参考答法把受众分三层。工程师看归因,用于 debug 与特征迭代——可以看 SHAP、梯度图,语言是「模型层面」的;业务方看驱动因素与风险信号——需要把归因翻译成业务变量(「负债比例高推高了风险分」),并区分相关与因果(6.3 的边界声明在此生效);用户与监管看理由与申诉通道——信贷拒贷要给「可行动的理由」(改善什么能通过),而不是「SHAP 值排第一」这种模型内部语言。同一套底层归因,三层不同翻译——「解释是一种翻译工作」是这题的题眼,能说出这句话的候选人,通常真的向业务方讲过模型。
合规场景的解释留痕清单(可直接背的检查项): 1. 建模前:是否评估过自解释模型(评分卡、浅树)的合格基线? 2. 模型后:事后解释的忠实度是否验证(删除 top 特征后模型行为是否如期变化)? 3. 单次决策:是否记录了该样本的解释快照(特征值 + 归因 + 模型版本)? 4. 申诉通道:用户能否获得可行动的理由,且理由与模型决策逻辑一致? 5. 版本管理:解释方法本身升级后,历史决策的解释是否可复现?
这份清单把「可解释AI」从名词拉回了工程:每一条都是可以在面试里展开三十秒的具体动作。
及格:说出两族分类与各一两个代表方法;良好:LIME 与 SHAP 的机制差异与稳定性能对比,「证词与证据」的信任等级讲得出;优秀:三层受众的翻译框架完整,能主动提到解释的忠实度验证与对抗面。可解释AI 题的高分标志是克制——不吹「完全可解释」,不回避「解释的局限」,用边界感证明成熟度。
下一节处理最后两个热词:联邦学习与 AutoML。它们的共同点是——面试里最值钱的答案,都是「它没解决什么」。
问:自解释模型和事后解释,监管更认哪个?
趋势是前者。评分卡、规则引擎这类「模型即证据」的形态可直接审计,事后解释只是关于模型的证词且可能不稳定,多数监管框架把它降级为辅助材料。高风险场景的标准姿势是「自解释打底,事后解释辅助排障」。
问:怎么验证一个解释方法的忠实度?
删除检验:按解释给出的重要性排序删特征,若模型效果如期衰减则解释忠实;扰动检验:对被解释为「关键」的特征做微小扰动,预测应显著变化;稳定性检验:同样本重复解释的方差。解释方法自己也要过质检——这个意识是本节的最高频考点。
问:深度学习的注意力热力图算解释吗?
算「线索」不算「解释」:它显示模型的计算资源分配,与输出的因果关联并不保证(与 8.2 的注意力可解释性争议同源)。可用于排障定位,用于合规陈述需谨慎。
表达纪律:可解释AI 题的每个方法都配上「受众、成本、忠实度」三个标签,版图感立刻成型。
问:反事实解释的「可行性」怎么保证?
约束生成:动作特征(可改变的,如收入)与不可动特征(如年龄)分开,相关特征联动约束(收入与职业共同变化),再限定在训练分布的支撑域内。没有可行性约束的反事实是数学游戏,业务方无法执行。
问:怎么向团队推广解释性实践?
从低成本高收益处切入:先给现有模型补上全局重要性与样本归因的例行产出,接入排障流程让人先受益;合规场景再做审计级留痕。推广失败的常见原因是上来就要求全量合规级解释,成本吓退所有干系人。