5.1 可解释性对照


5.1 可解释性对照

本节摘要:黑箱在高风险场景过不了信任与合规。Parlant 的可解释性是:执行某动作时能回溯激活了哪些指南、调用了哪些工具、用了哪些上下文、关系如何作用。对照端到端模型只能给注意力或事后借口、规则引擎只能给代码行号、通用 Agent 只能给思维链文本,这里的解释对象是规则图上的节点与边。

上手前先明确

阅读完本节,你应当能够:

  1. 把一次退货响应还原成规则匹配与关系边
  2. 区分给用户、给运营、给开发的三层解释
  3. 说明反事实能力如何服务体验而不破坏合规
  4. 避免把完整执行日志当成对客文案

可读不等于易懂

自然语言规则已经比权重可读。法务面对数百条时,需要的不是「根据某编号」,而是为何拒、依据哪类政策、有无例外。可解释性:不仅结果,还有路径。

架构上,工具与指南分离本身提供潜力。用户说要退货,不是概率猜意图,而是规则链:表达退货且订单已签收则激活处理工具。规则是节点,关系是边。日志应能逐跳回放。

对照思维链:模型可以编一条听起来合理的链,和真实工具调用不一致。对照代码行号:能给开发,不能给顾客。对照「本回复由 AI 生成」:免责不是解释。

激活追踪、因果回溯、分层

原文技术维度包括规则激活日志:记下候选、命中、被优先级抑制、因依赖未满足而跳过。没有「未激活原因」,排错会以为模型没听懂,其实是订单状态不满足依赖。

因果回溯把工具调用挂到指南 ID。抽检问「为什么建议退货」时,答案是触发词加签收状态,而不是「根据我的经验」。关系边要出现在解释里:因为蕴含才发了邮件;因为消歧才先问国内还是国际。

反事实:未满减时说明「若再购一件满条件则可减免」。这提升体验,但必须仍受指南约束——不能为了友好虚构满减规则。反事实是模拟另一条合法路径,不是让模型许愿。

受众 该看到什么 不该看到什么 对照错误做法
终端用户 简明原因与下一步 全量规则 ID 甩执行栈
运营/质检 流程快照、命中指南 原始模型采样 只有聊天截图
开发 完整轨迹、抑制原因 对客口吻 只有应用日志无规则维

⚠️ 常见坑:为了「透明」把内部权重式推理或未过滤工具参数展示给用户,造成认知负担甚至泄漏。分层是安全特性。
💡 关键直觉:法院要的是判决理由,不是法官脑电波。指南图是理由,模型采样是脑电波。

实时调试面板在原文里给开发看状态图与工具链。生产解释 API 若存在,应对齐同一套轨迹,避免调试看见 A、用户看见 B。双真源会把可解释性变成表演。

图 分层可解释性

图 分层可解释性

律师要确信建议基于条款节点,不是统计偏好。金融同理。没有激活追踪的 Parlant 用法,会退化成「我们用了可控框架」的口号。把追踪当验收项:抽十条对话,十条都能指到指南。

把抽检做成每周仪式

每周固定抽十条对话,三层各写一句:对客原因、运营命中的指南、开发侧有无被抑制规则。十条都能指到指南,才算及格。指不到的记缺陷:是没写指南、是轨迹没记,还是对客文案胡编。三种缺陷修法不同,不要统称「解释性不够」。

反事实话术要做法务备案。允许说的「若再购一件可满减」必须来自真实规则模拟,不允许模型估算。备案清单外的反事实一律禁止。体验团队会觉得可惜,可惜比虚假优惠便宜。

给用户的解释忌内部编号。翻译成政策语言:「因商品属于不可无理由类目」。编号留给运营。开发层的耗时与失败码不要出现在对客。分层做不好时,宁可少说,也不要倾倒。倾倒会泄漏,也会让用户觉得系统在推卸。

调试与生产轨迹单真源。若预发面板和线上审计字段不一致,先修一致性再谈新功能。双真源会让「可解释」变成各部门各执一份故事。对照思维链的不可信,规则图的可信建立在同一份日志上。

指标建议:指南可指认率、抑制规则可见率、对客解释投诉率。不要用「用户觉得透明」这种无法行动的调研题当唯一指标。觉得透明可能来自语气友好,与是否真解释无关。

对客解释的翻译表

建立指南 ID 到对客短句的翻译表,禁止模型现场翻译内部编号。翻译表由运营维护,变更走评审。这样解释层也是资产,而不是又一次生成。对照让模型「用通俗语言解释你的推理」——那会再幻觉一次。可解释性要减少生成环节,不是增加。翻译表还有一个好处:多语言客服可先译表,不必等模型懂方言。解释是产品,产品要有稿。

对照作业:抽检仪式与翻译表

围绕「抽检仪式与翻译表」,把四条路径再过一遍。表里每格都是可执行判断,不是形容词。读完请把你的项目钉进一格,不要钉在两格之间假装都占了。

检查项 纯 prompt 通用 Agent 规则引擎 Parlant
决策权放哪 免责声明当解释 思维链当解释 行号当解释 每周十条三层各一句
改口径谁动手 倾倒日志 展示中间步骤 给开发看 分层开口径
行动如何被拦 让模型通俗解释推理 再生成一次解释 无对客层 ID到短句翻译表禁止现场译
出事如何复盘 预发线上两套故事 调试与线上字段不一 同一堆栈 单真源
口语进得来吗 主观透明分 看是否像在思考 无用户层 可指认率当指标
上线第一周验什么 编号甩给顾客 工具参数给用户看 术语不翻译 对客用政策语言

解释要减少生成,不是增加生成。翻译表是产品稿。多语言先译表,不必等模型懂方言。

反事实必须来自合法路径模拟。法务备案外的「若怎样就怎样」一律禁止。虚假优惠比少说一句更贵。

钉列纪律:分层解释抽检

在「分层解释抽检」上,纯 prompt 把判断写进一段话,改的人必须会改提示,复盘只能翻聊天,口语进得来但口径会漂。通用 Agent 把判断交给循环,灵活的代价是越权与路径不可复现。规则引擎把判断写进分支,确定的代价是口语进不来、改口径要排期。Parlant 把判断写成指南与契约:业务改口径,未授权则无行动,复盘指轨迹。把这四句贴到工位上,比再记一组术语有用。

针对分层解释抽检,本周只做一件可验收的事:找出一条真实对话或工单,标注它今天落在哪一列;若要迁到第四列,缺的是指南、工具还是关系边。缺指南就写草稿,缺工具就列契约,缺关系就补消歧或依赖。不要同时开十条战线。最常见的伪装是文件名叫指南、真源仍是提示词,或者架构图上有网关、运行时模型仍直接调函数。用「改文本能否改行为」和「低权限点名是否被拒」两张试纸识破。识破了再谈优化与案例。优化在伪装上加速,只会让错误承诺更多;案例在伪装上复制,只会把新闻变成事故。

分层解释抽检的纪律是先钉列,再谈快。钉列需要抽检,抽检需要轨迹,轨迹需要审计真的在记抑制原因,而不只记最终回复。若没有抑制原因,排错会以为没写规则,其实是优先级压了。看得见「为什么没走另一条路」,才叫对照,才叫可控。把这句话写进值班手册,分层解释抽检才从概念变成岗位。对照驱动不是文风,是岗位制:模型是引擎和笔杆子,方向盘在指南与工具契约上。谁把方向盘又塞回提示词,谁就在分层解释抽检上退回第一列。

核心回顾

  • 解释对象是规则图:节点与边,不是脑电波
  • 未激活原因同样重要:否则误判为模型听不懂
  • 反事实须合法:模拟另一条受权路径
  • 分层开口径:用户/运营/开发
  • 单真源:调试与对客解释对齐同一轨迹
  • 抽检验收:能指到指南才算可解释

下一节处理规模:规则一多、工具一慢,轨迹再清楚也会超时。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U