5.5 可解释性与微调


5.5 模型可解释性与微调

本节摘要:模型越强越像黑箱,微调让它更"陌生"——用户会问"你凭什么这么答"。可解释性(Interpretability)解决"模型为什么这么判断"。本节讲清可解释性对微调的意义、两类解释方法(局部与全局)、以及医疗金融等场景的落地要求。

你能学到什么

阅读完本节,你应当能够:

  1. 说出可解释性要解决的问题
  2. 区分局部解释与全局解释
  3. 理解微调对可解释性的影响
  4. 认识高合规场景的要求
  5. 判断自己的场景需要多强的可解释性

一、问题与直觉

"AI 说我这个病例有风险,凭什么?"——医疗、金融、法律场景必须回答这个问题。可解释性就是给模型行为"给说法":为什么这么答、依据是什么、哪些输入起了作用。微调让模型更专业,也让它更像"陌生人"——解释能力反而更重要。

二、核心原理

2.1 两类解释

  • 局部解释:解释单个预测——"为什么这条回复这么写"
  • 全局解释:解释模型整体——"这个模型靠什么特征工作"

2.2 为什么微调后更难解释

微调让模型从"通用知识"转向"领域行为",行为更专门化,通用解释方法(如注意力可视化)在领域场景的参考价值下降。模型越专,解释的需求反而越强

三、工程实践要点

3.1 常用解释手段

手段 类型 适用
注意力可视化 局部 文本模型
特征归因 局部 通用
消融实验 局部 验证依据
简化代理模型 全局 概览

3.2 微调场景的务实做法

做法一 引用来源:要求回答附带知识来源 做法二 置信表达:不确定时明确说明 做法三 输入标注:解释哪些信息影响结论 做法四 人工兜底:高风险场景人工复核

💡 关键直觉:工程上的"可解释性"不等于学术的"解释算法"——要求模型"引用来源、说明依据、不确定就明说",比跑解释算法更实用、更直接。

3.3 高合规场景的要求

场景 可解释性要求
医疗辅助 必须说明依据,医生复核
金融信贷 拒绝理由必须可解释
法律咨询 引用的法条必须可溯
一般场景 透明即可,不强求

3.4 评估可解释性

维度 问什么
忠实度 解释与真实依据一致吗
可用性 用户看得懂吗
稳定性 类似输入解释一致吗

⚠️ 常见坑:把"注意力可视化"当解释结论。注意力高不等于因果依据——它只是相关性。高合规场景,用消融实验与引用追溯验证解释,别只信可视化。

3.5 微调前后如何对比可解释性

可解释性对比是评估微调质量的重要一环。推荐做三个层面的对比:行为层——用一组固定的"边界问题"(如用户反复追问、输入模糊、包含陷阱信息)分别问微调前与微调后的模型,观察回答风格与稳定性是否一致;归因层——用 LIME/SHAP 看关键预测依赖哪些特征,微调后模型是否开始依赖领域特有特征(这是"真正学到了领域规律"的信号);分布层——比较两个模型的输出分布(回答长度、用词、拒绝率),微调后分布是否向领域风格收敛。

行为层:固定边界问题集,对比回答质量与稳定性 归因层:SHAP/LIME 看特征依赖变化 分布层:输出长度、用词、拒绝率的分布对比

如果微调后模型在边界问题上明显变差(比如更容易被诱导、拒绝率骤降),即使常规评测指标提升了,也要谨慎上线——可解释性对比能帮你发现"指标掩盖的退化"。建议把这三个层面的对比脚本固化到评测流程里,每次微调都跑一遍,形成可追溯的对比记录。

重点提炼

  • 要点一:可解释性回答"为什么这么答"
  • 要点二:两类解释——局部(单预测)与全局(整体)
  • 要点三:微调让模型更专,解释需求更强
  • 要点四:工程务实做法——引用来源、置信表达、输入标注
  • 要点五:医疗金融等场景必须可解释、人工兜底
  • 要点六:注意力是相关不是因果,高合规要验证

五章全部收尾。回到导读页查漏补缺,然后选一个真实项目动手——微调这门手艺,练过才算会。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U