本节摘要:透明度要求过程可被审视;可解释性要求用人类能懂的方式说明「为什么是这个输出」。医疗、信贷、司法、自动驾驶复盘里,给不出理由就等于无法建立信任、无法调试偏见、难以满足解释权。内在可解释模型牺牲部分性能换透明;LIME、SHAP 等后验方法给局部近似,不能当成模型的真实内心。解释必须面向受众:当事人要的是可行动原因,监管要的是可审计证据,工程师要的是可改的特征。
阅读完本节,你应当能够:
影像模型标出「恶性可能高」,却说不清依据哪片纹理、哪类相似病例。有经验的医生会把系统当第二意见;没有解释时,它更像来历不明的压力。贷款被拒的人若只能听到「综合评分不足」,既无法改材料,也无法怀疑是否用了不该用的代理变量。监管要复盘辅助驾驶事故时,若只有最终转向角而没有决策链,问责会退回第 2.3 节的罗生门。
原文把这些写成黑箱的具体表现:不信任、无法告知原因、难以监管、难以调试偏见。性能与可解释常常权衡,复杂任务上深度模型更准也更不透明。权衡不是让你永远选黑箱,而是迫使你按风险分级:决定人命运的,优先可审计;推荐下一首歌的,可以松。
内在可解释:线性模型、稀疏规则、浅树。人可以顺着系数或分支走完。适合作为高风险决策的主模型,或作为复杂模型旁边的约束/门控。后验解释:模型先训完,再用局部代理或归因来讲故事。LIME 在预测点附近拟合简单模型;基于 Shapley 值的方法把贡献分到特征上。它们对调试极有用,对「法律上的真实原因」要谨慎——解释器自己也可能不稳定,换随机种子会换故事。
| 受众 | 需要的解释 | 错误示范 |
|---|---|---|
| 当事人 | 可改的因素、申诉路径 | 把 SHAP 瀑布图邮件发出 |
| 领域专家 | 是否符合专业规则、反事实 | 只给概率不分部位 |
| 工程师 | 哪类样本、哪类特征导致失败 | 只看全局准确率 |
| 审计/监管 | 版本、数据、测试切片、是否用人复核 | 一页原则声明 |
⚠️ 常见坑:用事后解释给黑箱「洗白」。若归因显示决策依赖种族代理,正确动作是停用并改模型,而不是把图放进 ESG 报告。
💡 关键直觉:解释是产品。要规定最大长度、禁用内部变量名、必须给出反事实(「如果收入证明补齐会怎样」)。
解释门禁 if risk == high and not human_readable_reason: deny_automation() if explanation_method is post_hoc: record_instability_tests() if reason_contains_proxy_sensitive: escalate_fairness_review()
全球数据保护规则里,自动化决策相关的「有意义信息」并不等于公开全部权重,但也不等于「本决定由人工智能作出」。工程上至少要能列出主要因素类别、是否人工介入、如何投诉。医疗设备与金融风控还有行业说明义务。可解释性因此不是研究加分项,是上线许可证的一部分。
反事实解释往往比特征排序更对人有用:「若逾期次数少一次,结果会变」。但必须防止它变成「请按系统喜欢的方式整容你的人生」——尤其当因素不可改变(出身、既往病史)时,解释应导向申诉与人工,而不是羞辱。
不一定。表格数据上,梯度提升或即便是正则化线性模型,常常已够用;深度网络的增益来自非结构化数据。混合很常见:深度模型做感知,规则与人做高风险决策。原文承认性能与可解释权衡,但没有说必须处处牺牲可解释。
生成式输出的「为什么这句话」更难。至少要能追溯检索到的文档、安全过滤是否触发、系统提示的约束。对影响人的摘要与建议,应限制自由发挥,并留下引用。不能解释的自动化,就不要放进不可逆流程。
原文把透明度定义为机制、数据来源、决策逻辑对外部可见,侧重结构与过程开放。可解释性关注「为什么是这个输出」,要把行为翻译成人类能懂的形式。可理解性更强调模型内在好懂:树和线性天生较高,深度网络低,需要外挂方法。混用的后果是:公开了架构图却仍无法告诉被拒的人原因,或者给了 SHAP 图却没有任何过程透明(数据从哪来、谁能改阈值)。高风险系统三件事都要:过程可审计、单次决定可说明、模型选择可辩护。
黑箱的伦理挑战还包括:开发者自己也走不完数百万参数的路径。因此「我们内部是透明的」常常是错觉。需要的是针对受众的接口,而不是幻想完全追踪。性能与可解释权衡真实存在,但表格数据上很多时候树或约束模型已够用;深度网络的正当理由应写在模型卡的「为何不用可解释模型」一栏,写不出就换模型。医疗与金融还有行业说明义务,解释权不是研究加分。
反事实比特征排序更对人有用,但不可变属性(出身、部分病史)不应变成「请改你的身份」。解释应导向补充材料与人工申诉。若归因显示依赖敏感代理,正确动作是停用,不是优化图表。生成式系统至少追溯检索与过滤;不能逐步证明就不要自动执行不可逆操作。这是解释与控制闸的接头。
透明、可解释、可理解三个词不要混用。过程可审计是透明;单次决定能说明为什么是可解释;模型天生好不好懂是可理解。高风险三件事都要。决策树按听众走:当事人要可改因素、反事实、申诉路径,字数限制在能读完;领域专家要符合专业规则;工程师要可改的失败模式;审计要版本、数据、切片、是否用人复核。后验方法是手电筒:LIME 对邻域敏感,SHAP 在特征相关时难懂,都要做稳定性测试。归因指向敏感代理则停用,不准优化图表进 ESG。
| 伤害档 | 现场 | 交付物 | 反例 |
|---|---|---|---|
| 无法申诉 | 拒贷综合评分不足 | 可行动原因+人工 | 把瀑布图邮件发出 |
| 医生不信 | 影像只给概率 | 部位与相似病例约束 | 来历不明的压力按钮 |
| 事故罗生门 | 只有最终转向角 | 决策链与版本 | 内部自称透明却走不完参数 |
| 洗白歧视 | 归因含种族代理 | 停用模型 | 把图放进社会责任报告 |
| 生成不可溯 | 自动执行不可逆 | 检索与过滤追溯 | 「AI 已决定」无引用 |
治理检查项:拒绝案例必须有样例;换种子关键因素重叠率写进发布包;模型卡「为何不用内在可解释模型」写不出就换模型;解释查询计入隐私预算。反例:公开了架构图却仍无法告诉被拒的人原因;表格数据未证明树不够用就上深度网络;反事实要求人改出身或病史。有意义信息不是公开全部权重,也不是「本决定由人工智能作出」。混合架构常见:深度做感知,规则与人做高风险决定。不能解释的自动化,不要放进不可逆流程。
黑箱分诊决策树 高风险无人类可读理由 ──► 禁止全自动 后验方法 ──► 必须测稳定 归因含代理 ──► 停用 生成无工具链 ──► 禁止不可逆自动执行 只解释通过 ──► 解释权空转
下一节把镜头拉到岗位与注意力:自动化如何在没有「算法暴政」口号的情况下改写人的自主。
解释是产品。规定最大长度、禁用内部变量名、必须给出反事实、必须给出申诉入口。不可变属性不得变成请改你的身份。拒绝案例必须有样例。后验方法稳定性:换种子重叠率、输入微扰不翻盘、删掉被指出的特征后预测真的变。三测不过,解释器在编故事。全局重要性用来发现系统性代理依赖,局部理由服务当事人,两套都要。生成式至少追溯检索与过滤;不能逐步证明就不要自动执行不可逆操作。解释查询计入隐私预算并限速。
合规有意义信息:主要因素类别、是否人工介入、如何投诉。与商业秘密冲突时分层:当事人可行动原因,审计更深特征。表格数据先证明树或线性不够用。深度网络的正当理由写在模型卡。注意力可视化不等于因果。规则蒸馏报蒸馏损失。若归因暴露代理歧视,停用而不是美化。开源大模型「为什么这句话」更难,至少能追溯工具与过滤。把透明、可解释、可理解三词贴在评审墙禁止混用。开发者自己也走不完数百万参数,内部透明常常是错觉,需要的是针对受众的接口。
工作纸:为当事人、专家、审计各写一份解释样例,字数限制在当事人能读完的长度。拒绝案例必须有样例,不能只解释通过。后验方法要做稳定性测试:换种子关键因素重叠率写进发布包。归因若指向敏感代理,流程是停用而不是改图颜色。生成式功能列出可追溯的检索与过滤器;没有就不要自动执行不可逆操作。模型卡增加一栏「为何不用内在可解释模型」,写不出就换模型。解释查询计入隐私预算。把透明(过程)、可解释(为何)、可理解(模型天生好不好懂)三词贴在评审墙,禁止混用。
下一节把镜头拉到岗位与注意力:自动化如何在没有「算法暴政」口号的情况下改写人的自主。