7.2 幻觉、可解释性与鲁棒性:四大技术挑战


7.2 幻觉、可解释性与鲁棒性:四大技术挑战

本节摘要:幻觉、可解释性、效率、鲁棒性——这四项挑战在单轮问答时代就存在,到了多步执行的智能体形态里,每一种都被放大出新的形态。本节逐个讲清它们在智能体里的具体症状、检测方法与治理手段,并给出"哪一层负责治"的归属表。

单轮时代,幻觉是一条错误的回答;智能体时代,幻觉可以是一条错误的工具调用——编一个不存在的订单号去查库,查到空结果再编一个解释。挑战没有变名字,但危害等级与传播路径全变了。逐个过堂。

幻觉:从说错话到做错事

智能体里的幻觉有三种形态,危害递增:事实幻觉(编造知识,第 6 章的 RAG 与引用已给出主疗法);动作幻觉(编造工具名或参数——查不存在的订单号、传错误格式的日期);结果幻觉(无视工具返回的真实结果,按自己的预期复述——最危险的一种,因为观察是真实的,转述却是编的)。

检测与治理分层负责。动作幻觉由 2.2 节的参数校验拦(不在枚举内的值直接报错回填);结果幻觉靠回答与观察的一致性比对——把最终回答与轨迹里的关键观察交给判分模型核对"每个数字是否来自观察",这在 7.1 节的评测里落地为常规检查项;残余的漏网之鱼由 7.3 节的输出校验闸兜底。

可解释性:从"为什么这么说"到"为什么这么做"

用户和审计者对智能体的追问不再止于答案,而是"你为什么订了这间会议室"。好消息是智能体天然自带解释材料——完整轨迹(思考、行动、观察的序列)就是决策过程的记录。工程上的要点是把轨迹从调试日志升级为可交付的解释:面向用户的解释只呈现"做了什么、依据是什么"(关键动作与观察),面向内部排查的版本保留全部思考过程。两份材料从同一份轨迹渲染,粒度不同而已。

真正的难点在"解释的可信度":模型的思考文本是对它行为的合理化叙述,未必是真实的因果。所以对外的解释要以观察为锚——"因为查询返回了 A302 有空且带投影,所以选择它"(观察支撑),而不是"我认为 A302 更合适"(无支撑的主观叙述)。7.1 节评测里的引用校验,同样适用于解释文本。

效率:步数是成本与延迟的共同根源

智能体的成本结构由三个变量决定:每步的调用成本、步数、并行度。单轮应用的延迟以秒计且稳定;智能体的延迟以步数计且方差巨大——同样的任务,顺利时四步、不顺时十四步。效率治理的手段前三章其实都已埋好:窗口预算控单步成本(3.1)、计划减少决策轮次(4.3)、观察清洗降低每步输入体积(2.4)。本节补一个监控口径:步数长尾。平均值好看不等于体验好,p95 步数才是用户真实感知的上限;步数分布的突变(某天 p95 从八步涨到二十步)往往是上游数据变化的最早信号。

鲁棒性:环境不按剧本配合

单轮应用的输入是用户的文字,智能体的输入还包括工具返回、外部系统状态——环境的噪声会直接进入决策链。典型场景:接口偶发超时、返回格式悄悄变更、依赖的下游服务降级返回半截数据。治理思路与其说"防"不如说"消化":重试机制消化偶发失败(2.3 节的 fails 计数)、schema 校验消化格式变更(变了就报错而不是硬读)、降级预案消化服务不可用(第 8 章的降级设计)。评测集里应当常备一批"环境异常"用例:超时、空返回、格式错乱——鲁棒性是测出来的,不是希望出来的。

四大挑战的归属表

挑战 智能体形态的新症状 首要治理层 本章相关节
幻觉 动作幻觉、结果幻觉 参数校验 + 一致性比对 + 输出闸 7.1 / 7.3
可解释性 解释要覆盖动作依据 轨迹渲染 + 观察锚定 7.1
效率 步数方差、成本长尾 预算与计划 + p95 监控 3.1 / 4.3 / 第 8 章
鲁棒性 环境噪声入决策链 重试 + 校验 + 降级预案 7.3 / 第 8 章

⚠️ 常见坑:把四大挑战都推给"换更强的模型"。逐项检验会发现,四种症状的治理手段全在系统层——校验、轨迹、预算、重试,模型升级只是让基线好看一点,系统的免疫力一点没涨。

本节要点回顾

  • 幻觉三级形态:事实、动作、结果幻觉;结果幻觉最险——观察真实、转述造假,必须做回答与观察的一致性比对。
  • 解释以观察为锚:对外解释引用工具返回的事实,不引用模型的自我叙述;轨迹是解释的原材料。
  • 盯 p95 不盯均值:步数长尾决定用户体验上限,步数分布突变是最早的异常信号。
  • 鲁棒性靠消化不靠祈祷:偶发用重试、格式用校验、不可用用降级,评测集里常备异常用例。

问题定位与度量都有了,下一节把拦截机制正式建成:三道闸的护栏管道。

四大挑战的监控落点

挑战讲清了机理,还要落到"平时盯什么"。四项各有一个性价比最高的监控指标:幻觉看引用核验通过率——抽样答案的关键主张回溯到观察或检索来源,核验不通过的占比趋势就是幻觉率的水位计;可解释性看解释采样的可读性评分——每月抽几十条对外解释请非研发同事打分,骤降往往对应着某次提示词改动;效率看 p95 步数与步数分布的周环比——分布形状突变(双峰、长尾变长)比均值更能提前暴露问题,常见诱因是上游数据或某个工具悄悄变慢;鲁棒性看异常注入用例的回归通过率——评测集里那批超时、空返回、格式错乱的用例,每次发布必跑,通过率下跌说明防御代码被新改动破坏了。

四个指标都进入周报后,四大挑战就从文档里的名词变成了运营中的数字——这也是本册一贯的立场:没有度量的问题,等于不存在的问题,直到它以事故的形式强行存在。

一个成本视角的优先级建议

四个挑战的治理成本差异巨大,预算有限时的排序建议:先治幻觉中的结果幻觉(一致性比对是一次性的工程投入,回报持续);再建效率监控(步数长尾的告警几乎零成本,防的是账单与体验的双杀);然后是鲁棒性用例(评测集里加十来条异常用例,一次投入长期生效);可解释性排在最后不是不重要,而是它的缺陷暴露慢、直接损失小——前提是轨迹留痕已经做到位(2.3 节),真出事时材料齐全,补渲染随时来得及。反过来排的团队常犯的错是先花重金做漂亮的解释面板,结果系统引用作废政策、账单失控,面板再漂亮也救不了场。治理顺序反映的是风险排序,不是技术趣味。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U