2.2 LLM集成机制对照


2.2 LLM 集成机制对照

本节摘要:通用 Agent 把大模型当操作系统;纯 prompt 把任务压进一次调用;Parlant 把模型当成被调度的认知资源。规则引擎决定何时调用、上下文管理器决定喂什么、工具网关决定能碰什么、审计记下整条链。目标不是驯服采样随机性,而是在模型外加控制环。

本节地图

阅读完本节,你应当能够:

  1. 对照「一次提示赌对」说明外置控制环挡的是什么
  2. 描述规则如何编译进系统提示,而不是整本 SOP 硬塞
  3. 说明动态缓存与多模型抽象各自省什么成本
  4. 画出计划-执行-验证循环,指出验证失败时发生什么

从黑箱一次调用,到白盒代理

开放域问答可以接受一次生成。贷款利率、病历、合同条款不行。通用 Agent 进了一步:多步工具循环,但仍常由模型决定「下一步」。Parlant 的集成目标写成三句:行为可约束(指南限定情境与操作)、决策可追溯(推理与工具调用进审计)、能力可扩展(模型当认知中枢协同工具)。

它不幻想把温度调到零就等于合规。随机性还在生成里,约束在环外。这和「更好的提示词」不是程度差,是结构差。

图里真正的主控是规则与上下文,不是 D 节点。很多架构图把 LLM 画在顶上,那张图已经选错了主角。

规则编译、缓存、模型无关 IR

自然语言指南对模型是模糊的。「问余额必须先验身份,再查余额,且不得透露数字以外的信息。」规则引擎要抽出触发条件、映射工具、把约束变成过滤或负向提示,生成中间表示,再拼进系统提示。业务逻辑和提示解耦:改指南不必改调用代码。

高频客服问题若每次推理,成本和延迟都会打穿服务协议。动态缓存存「规则-上下文-响应」三元组,相同请求可绕过模型。失效可按时间、上下文相似度、业务标签。对照通用 Agent:缓存常只做嵌入检索,不管「这条规则在该上下文是否仍有效」。

多模型靠统一接口:输入输出、工具调用协议、错误处理。IR 模型无关,同一套指南换后端,只调 token 限制、温度等适配参数。原文列举多家云与开源模型作为兼容目标,不在此写死版本号。

机制 解决的问题 对照一次 prompt 对照通用 Agent 循环
规则编译为 IR 指南模糊、提示膨胀 整段 SOP 塞进提示 工具说明塞进提示,规则仍靠模型记
动态缓存 重复问法的成本与延迟 几乎每次都调用 可能有记忆,但少规则级缓存
模型抽象层 厂商锁定与差价 绑死一个 SDK 有的框架有,有的没有
输出合规验证 越界生成 无或事后正则 常缺独立验证层

⚠️ 常见坑:把「支持多模型」理解成「换模型行为不变」。IR 可移植,生成风格、工具调用遵守度仍因模型而异。换模型要回归指南覆盖的关键路径,不能只改配置。
💡 关键直觉:模型是发动机,控制环是变速箱和刹车。马力再大,没有刹车不能上路。

与工具的多轮:计划-执行-验证

头痛要不要做影像学检查——原文用医疗例子:先症状评估工具,再预约工具,再综合回复。每步输出先验证是否符合当前指南;要调工具则网关执行,结果回填上下文,再进入下一轮推理。不符合则拒绝、重试或报错,而不是「模型说了就算」。

金融客服引用条款、医疗脱敏、法律条款比对——都是「模型在边界内执行」,不是自由发挥。优点:可控、可维护、可扩展、审计友好。代价:组件多、规则与工具接口要设计、多轮验证增加延迟、指南盲区会僵住。原文也提到,随着模型自身规划变强,架构可能走向「更轻的规则引导 + 模型自主规划」——那是演化判断,今天的对照仍是:企业治理底线在环上,不在模型内部。

自适应规则演化、从失败日志提炼新规则、多代理分别做法务/安抚/技术再协商,被写成前沿。微服务形态理论上接得住,但「自动提炼」没有人工审核会放大错误 SOP。

图 LLM 角色从主角到协作者

图 LLM 角色从主角到协作者

信任尚未建立时,如何安全使用 LLM?原文的答案在外部框架,不在更大参数。这是集成机制的全部政治:把职位从 CEO 改成首席笔杆子。

控制环的日常运营

控制环不是画一次就结束。运营上要规定:指南发布后,哪些路径必须回归;模型升级后,验证层失败率是否上升;缓存命中率上升时,正确率有没有一起掉。验证失败变多,常常是指南写得更严,也可能是新模型更不听话。要分开看,不能只看用户满意度。满意度会奖励那些口头放宽政策的回复。

一次提示赌对的团队,迁移到控制环会觉得「变慢了」。慢来自多一轮验证和可能的工具往返。要用服务协议重新谈:正确优先的路径允许多几百毫秒,闲聊式 FAQ 走缓存。把所有请求当探索式 Agent 循环,成本会打穿。集成机制的产品化就是给不同路径不同预算。

IR 模型无关是设计目标,不是魔法。工具调用协议在各家模型上的遵守程度不同,抽象层要处理失败:重试、降级到罐头、转人工。不要在抽象层里静默改写用户可见语义。改写发生在指南允许的后处理,且要进审计。否则控制环自己变成黑箱。

计划-执行-验证循环在医疗例子里很好懂,在客服里同样:先查订单,再决定解释还是补偿。验证的是「当前指南允不允许补偿」,不是「模型是否同情」。同情是风格层的事,补偿是授权层的事。集成机制把这两层拆开,运营就不要再把它们混在一张提示里。

若验证层经常拒绝模型输出,说明指南与模型能力不匹配:要么指南过细到模型无法遵守,要么模型太弱。处理是改指南粒度或换模型,而不是关掉验证。关掉验证等于回到主角模型。本章的对照在日常里只体现为:拒绝记录是资产,不是噪音。

给模型的「入职须知」

把模型当新同事:只能看见本轮匹配到的指南和工具,不能看见全公司 SOP 文件夹;输出要过验证才能出门;不许自己发明工具调用。入职须知写进系统提示的 IR,而不是写成企业文化海报。同事(模型)换人(换厂商)时,须知还在,回归的是遵守度。控制环日常就是检查这名同事有没有偷偷把须知当建议。验证失败记录是考勤表。关掉验证等于让新同事第一天就当总经理。集成机制讲的就是岗位等级,不要把它讲成模型参数调优。

对照作业:控制环考勤

围绕「控制环考勤」,把四条路径再过一遍。表里每格都是可执行判断,不是形容词。读完请把你的项目钉进一格,不要钉在两格之间假装都占了。

检查项 纯 prompt 通用 Agent 规则引擎 Parlant
决策权放哪 一次调用赌对 循环赌对 无模型或模型只填槽 何时调用由引擎决定
改口径谁动手 失败再写长提示 失败换工具再试 失败抛错 验证失败记考勤不准时
行动如何被拦 无验证层 思维链自称已遵守 确定但无口语 输出过验证才出门
出事如何复盘 换人设 换更大模型 改代码 换模型要回归遵守度
口语进得来吗 全SOP进窗口 全工具可见 无生成风格问题 只注入匹配子集
上线第一周验什么 满意度当唯一指标 看步数炫技 看分支覆盖 满意度与越权分开看

入职须知:看不见全公司文件夹,不许发明工具。须知在 IR 里,不在海报里。关掉验证等于第一天当总经理。

慢要重新谈服务协议:正确路径允许多几百毫秒,FAQ 走缓存。用探索循环打所有请求,成本会穿。

钉列纪律:控制环与模型职位

在「控制环与模型职位」上,纯 prompt 把判断写进一段话,改的人必须会改提示,复盘只能翻聊天,口语进得来但口径会漂。通用 Agent 把判断交给循环,灵活的代价是越权与路径不可复现。规则引擎把判断写进分支,确定的代价是口语进不来、改口径要排期。Parlant 把判断写成指南与契约:业务改口径,未授权则无行动,复盘指轨迹。把这四句贴到工位上,比再记一组术语有用。

针对控制环与模型职位,本周只做一件可验收的事:找出一条真实对话或工单,标注它今天落在哪一列;若要迁到第四列,缺的是指南、工具还是关系边。缺指南就写草稿,缺工具就列契约,缺关系就补消歧或依赖。不要同时开十条战线。最常见的伪装是文件名叫指南、真源仍是提示词,或者架构图上有网关、运行时模型仍直接调函数。用「改文本能否改行为」和「低权限点名是否被拒」两张试纸识破。识破了再谈优化与案例。优化在伪装上加速,只会让错误承诺更多;案例在伪装上复制,只会把新闻变成事故。

控制环与模型职位的纪律是先钉列,再谈快。钉列需要抽检,抽检需要轨迹,轨迹需要审计真的在记抑制原因,而不只记最终回复。若没有抑制原因,排错会以为没写规则,其实是优先级压了。看得见「为什么没走另一条路」,才叫对照,才叫可控。把这句话写进值班手册,控制环与模型职位才从概念变成岗位。对照驱动不是文风,是岗位制:模型是引擎和笔杆子,方向盘在指南与工具契约上。谁把方向盘又塞回提示词,谁就在控制环与模型职位上退回第一列。

要点串联

  • 外置控制环:约束不靠把温度调零
  • 模型是资源:何时调用由规则与上下文决定
  • IR 编译:指南结构化后注入,避免提示膨胀
  • 缓存与抽象:重复问题省推理;换模型不改指南,但要回归
  • 计划-执行-验证:不符合指南的动作进不了网关
  • 代价:延迟与复杂度换来的是可辩护的边界

下一节看零件如何可替换:依赖注入,让测试不必真打模型 API。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U