本节摘要:模型越强越像黑箱,微调让它更"陌生"——用户会问"你凭什么这么答"。可解释性(Interpretability)解决"模型为什么这么判断"。本节讲清可解释性对微调的意义、两类解释方法(局部与全局)、以及医疗金融等场景的落地要求。
阅读完本节,你应当能够:
"AI 说我这个病例有风险,凭什么?"——医疗、金融、法律场景必须回答这个问题。可解释性就是给模型行为"给说法":为什么这么答、依据是什么、哪些输入起了作用。微调让模型更专业,也让它更像"陌生人"——解释能力反而更重要。
微调让模型从"通用知识"转向"领域行为",行为更专门化,通用解释方法(如注意力可视化)在领域场景的参考价值下降。模型越专,解释的需求反而越强。
| 手段 | 类型 | 适用 |
|---|---|---|
| 注意力可视化 | 局部 | 文本模型 |
| 特征归因 | 局部 | 通用 |
| 消融实验 | 局部 | 验证依据 |
| 简化代理模型 | 全局 | 概览 |
做法一 引用来源:要求回答附带知识来源 做法二 置信表达:不确定时明确说明 做法三 输入标注:解释哪些信息影响结论 做法四 人工兜底:高风险场景人工复核
💡 关键直觉:工程上的"可解释性"不等于学术的"解释算法"——要求模型"引用来源、说明依据、不确定就明说",比跑解释算法更实用、更直接。
| 场景 | 可解释性要求 |
|---|---|
| 医疗辅助 | 必须说明依据,医生复核 |
| 金融信贷 | 拒绝理由必须可解释 |
| 法律咨询 | 引用的法条必须可溯 |
| 一般场景 | 透明即可,不强求 |
| 维度 | 问什么 |
|---|---|
| 忠实度 | 解释与真实依据一致吗 |
| 可用性 | 用户看得懂吗 |
| 稳定性 | 类似输入解释一致吗 |
⚠️ 常见坑:把"注意力可视化"当解释结论。注意力高不等于因果依据——它只是相关性。高合规场景,用消融实验与引用追溯验证解释,别只信可视化。
可解释性对比是评估微调质量的重要一环。推荐做三个层面的对比:行为层——用一组固定的"边界问题"(如用户反复追问、输入模糊、包含陷阱信息)分别问微调前与微调后的模型,观察回答风格与稳定性是否一致;归因层——用 LIME/SHAP 看关键预测依赖哪些特征,微调后模型是否开始依赖领域特有特征(这是"真正学到了领域规律"的信号);分布层——比较两个模型的输出分布(回答长度、用词、拒绝率),微调后分布是否向领域风格收敛。
行为层:固定边界问题集,对比回答质量与稳定性 归因层:SHAP/LIME 看特征依赖变化 分布层:输出长度、用词、拒绝率的分布对比
如果微调后模型在边界问题上明显变差(比如更容易被诱导、拒绝率骤降),即使常规评测指标提升了,也要谨慎上线——可解释性对比能帮你发现"指标掩盖的退化"。建议把这三个层面的对比脚本固化到评测流程里,每次微调都跑一遍,形成可追溯的对比记录。
五章全部收尾。回到导读页查漏补缺,然后选一个真实项目动手——微调这门手艺,练过才算会。