本节摘要:可解释 AI 要回答「为什么是这个输出」,服务信任、公平调试、合规与知识发现。内在可解释模型结构透明;后验方法在黑箱外拟合局部故事,LIME 用邻域代理,SHAP 用贡献分摊。高风险场景优先能被领域专家走完的模型或混合架构。解释必须测稳定性,必须翻译成当事人语言,且不能用来给歧视性模型背书。GDPR 等框架中的解释相关权利,要求的是有意义信息,不是权重文件本身。
阅读完本节,你应当能够:
原文把 XAI 的动机写成:信任、发现偏见、调试、满足解释权、科学发现。工程落地时这五类听众要的东西不同,第 2.4 节已强调。技术分类是:内在可解释 vs 后验。线性模型、规则列表、浅决策树属于前者;深度网络加归因属于后者。表格数据上,我更倾向先强迫团队证明「树或线性不够用」,再上黑箱。非结构化感知可以用深度模型,但高风险决策应在感知结果之上加可写清的规则与人。
LIME:在要解释的样本附近扰动输入,用简单模型拟合黑箱输出,读简单模型的权重当局部原因。它对邻域定义敏感,文本与图像上扰动方式会改变故事。SHAP:把预测与基线的差,按合作博弈的贡献分到特征,有较好的理论性质,计算可贵,特征相关时解释会难懂。还有显著性图、反事实、样例原型、注意力可视化——注意力不等于因果。
| 方法 | 擅长 | 不擅长 |
|---|---|---|
| 内在模型 | 全局透明、易审计 | 复杂感知任务 |
| LIME | 单点直观 | 不稳定、邻域人为 |
| SHAP | 贡献可加、可比较 | 相关特征、计算 |
| 反事实 | 对当事人可行动 | 不可变特征会伤人 |
| 全局规则蒸馏 | 给监管看概貌 | 蒸馏损失导致撒谎 |
⚠️ 常见坑:只解释「通过」的案例。拒绝案例更需要解释。若解释器在拒贷上集体失语,等于没有解释权。
💡 关键直觉:解释器也是模型,会错。要对解释做扰动测试:微小平移输入,理由不应翻盘;换种子,关键因素应重叠。

概念代码只表达门禁,不是完整库调用教程。
def release_allowed(doc): if doc.risk == "high" and not doc.human_reason: return False if doc.post_hoc and doc.stability < floor: return False if doc.uses_sensitive_proxy: return False return True
生成模型的解释更弱:可追溯检索片段、显示安全过滤器命中、限制工具调用。不能逐步证明「这句话为何生成」时,就不要让它自动执行不可逆操作。这是 XAI 与第 3.3 节控制闸的接头。
不够。全局爱用的特征可能不是这个被拒的人被拒的原因。高风险必须能出局部理由。全局用来发现系统性依赖(例如整体都在用邮编当代理)。
原文把工具功能写成:多种解释实现、可视化、交互探索、解释质量评估。质量评估常被漏掉。应测:对同一输入多次解释的关键因素重叠率;输入微扰后理由是否翻盘;删除解释指出的特征后预测是否真的变。重叠率低说明解释器在编故事。全局重要性用来发现系统性代理依赖,局部理由服务当事人,两套都要,且拒绝案例必须能出局部理由。
高风险表格决策应先证明树或线性不够用,再上黑箱。感知用深度模型时,在感知结果之上加可写清的规则与人。注意力可视化不等于因果。规则蒸馏给监管看概貌时必须报告蒸馏损失,否则是撒谎的透明。生成式至少追溯检索片段与过滤器命中。解释查询会花隐私预算,要限速。把 SHAP 原样发给用户等于未完成产品工作:需要最大长度、禁用内部变量名、给出反事实与申诉入口。
合规上,「有意义信息」不是公开全部权重,也不是「本决定由人工智能作出」。至少列出主要因素类别、是否人工介入、如何投诉。若解释权与商业秘密冲突,用分层:当事人得可行动原因,审计得更深特征。这与第 4.5 节披露分层一致。
上线前用决策树,不要用「先上 SHAP 再看感觉」。表格数据、单次决定影响信贷就业医疗司法:默认内在可解释;只有当树或正则化线性在同一评估集上主任务与公平切片都明显不够,才允许黑箱加后验,并在模型卡写明「为何不用可解释模型」。图像语音感知:深度模型可做感知,高风险动作必须落在可写清的规则、阈值与人身上。内容审核:全局规则蒸馏给审计看概貌,单条封禁给当事人可行动原因(哪类政策、可否申诉),禁止把显著性热图当封禁通知。生成式助手:能追溯检索与过滤器就解释到这一层;追溯不到就禁止自动执行转账、删号、报警、永久封禁。
| 事故档 | 现场 | 解释义务 | 反例 |
|---|---|---|---|
| 档A 不可逆高风险 | 拒贷、停发福利、逮捕提示 | 局部理由+反事实+人工入口,稳定性测试过线 | 只给「综合评分不足」 |
| 档B 可逆但规模大 | 内容审核、推荐降权 | 政策类别+抽样复核,全局依赖可审计 | 把注意力图发给用户 |
| 档C 低风险便利 | 歌单、输入法候选 | 可解释可选,仍禁敏感代理 | 用低风险当借口给高风险功能免检 |
| 档D 生成式行动 | 已接邮件、支付、工单 | 工具调用链可追溯,不可逆必须人 | 「模型说可以」直接执行 |
治理检查项(缺一项阻断发布):拒绝案例能否出局部理由;换种子关键因素重叠率是否记录;输入微扰后理由是否翻盘;删除被指出的特征后预测是否真变;解释查询是否限速并计入隐私预算;归因指向敏感代理时停用责任人是谁;当事人文案有无禁用内部变量名。反例要具体:把 SHAP 瀑布图邮件发给申请人,是未完成产品;只解释通过案例、拒贷集体失语,是解释权空转;用事后解释给依赖邮编的模型出 ESG 图,是洗白;模型卡空白「为何不用树」却上了深度网络做表格风控,是选型失败。
解释选型决策树 表格 + 高风险 ──► 先树或线性 ──不够──► 黑箱+后验且测稳定 感知 + 高风险 ──► 深度感知 + 规则与人做决定 生成 + 不可逆 ──► 无工具链追溯则禁止自动执行 任何档 + 敏感代理入归因 ──► 停用,不准优化图表
下一节用隐私增强技术处理「模型还记得人」的问题。
信贷拒绝必须同时交出三样东西:因素类别(逾期次数、负债比,而不是内部隐变量名)、一条反事实(「若逾期少一次可能过线」)、申诉入口。若反事实指向出身或受保护属性,改口为人工复核,不许叫人改身份。影像模型给医生的解释应落到部位与相似病例约束,概率数字单独不够;医生若无法核对,系统只能当第二意见,不能当自动活检决定。生成式客服若已接工单系统,解释义务变成:引用了哪几条知识库、安全过滤是否命中、是否调用了改单工具。调用了改单却追溯不到,就降级为草稿,等人点确认。
稳定性测试写进发布包:同一拒绝样本换三种扰动,关键因素集合交集应过内部地板;种子换三次,排序前三因素应重叠。测不过视为解释器在编故事,高风险不得放行。解释查询计入隐私预算,对同一证件号限速,防止把 SHAP 当侧信道拖画像。分层披露与第 4.5 节对齐:当事人得可行动短文,审计得特征贡献与稳定性数字,监管看得过程(谁能改阈值)。三层用同一证据库,禁止给当事人寄审计原图。
内在可解释与后验的账单要写进模型卡:树可能少两个点的全局精度,换来的是可走完的分支;黑箱必须证明这几个点买到的是不可替代的感知能力,而不是调参惯性。表格风控上证明不了,就换回去。注意力不等于因果,规则蒸馏必须报蒸馏损失,否则是撒谎的透明。这些不是研究品味,是上线许可证。
发布包里解释质量三测必须有责任人签字:重叠率、微扰不翻盘、删特征后果真变。当事人样例与审计样例用同一拒绝样本生成,禁止两套故事。生成式工单场景若不能列出检索片段与过滤器命中,自动改单权限保持关闭。这三条把 5.1 从方法名录收成闸门。
选型口诀当场用:表格高风险先树后黑箱;感知结果之上必须有规则与人;生成式无追溯则关闭不可逆工具。模型卡「为何不用可解释模型」空着,发布系统应直接阻断。解释权落地看拒绝信能不能让人补材料,而不是看图漂不漂亮。
把 SHAP 原图发给申请人列为禁止项。拒绝信必须能让人决定下一步补什么材料。
工作纸:三层解释样例是否齐全。解释质量三项测试是否记录。拒绝案例能否出局部理由。模型卡「为何不用可解释模型」一栏。生成式追溯检索与过滤。解释查询是否限速并记账。归因指向代理则停用的流程有无责任人。把 SHAP 原图发给用户的旧做法列入禁止。合规「有意义信息」清单:因素类别、人工介入、投诉路径。全局重要性与局部理由都要,且用途不同。
下一节用隐私增强技术处理「模型还记得人」的问题。