本节摘要:通用 Agent 把大模型当操作系统;纯 prompt 把任务压进一次调用;Parlant 把模型当成被调度的认知资源。规则引擎决定何时调用、上下文管理器决定喂什么、工具网关决定能碰什么、审计记下整条链。目标不是驯服采样随机性,而是在模型外加控制环。
阅读完本节,你应当能够:
开放域问答可以接受一次生成。贷款利率、病历、合同条款不行。通用 Agent 进了一步:多步工具循环,但仍常由模型决定「下一步」。Parlant 的集成目标写成三句:行为可约束(指南限定情境与操作)、决策可追溯(推理与工具调用进审计)、能力可扩展(模型当认知中枢协同工具)。
它不幻想把温度调到零就等于合规。随机性还在生成里,约束在环外。这和「更好的提示词」不是程度差,是结构差。
图里真正的主控是规则与上下文,不是 D 节点。很多架构图把 LLM 画在顶上,那张图已经选错了主角。
自然语言指南对模型是模糊的。「问余额必须先验身份,再查余额,且不得透露数字以外的信息。」规则引擎要抽出触发条件、映射工具、把约束变成过滤或负向提示,生成中间表示,再拼进系统提示。业务逻辑和提示解耦:改指南不必改调用代码。
高频客服问题若每次推理,成本和延迟都会打穿服务协议。动态缓存存「规则-上下文-响应」三元组,相同请求可绕过模型。失效可按时间、上下文相似度、业务标签。对照通用 Agent:缓存常只做嵌入检索,不管「这条规则在该上下文是否仍有效」。
多模型靠统一接口:输入输出、工具调用协议、错误处理。IR 模型无关,同一套指南换后端,只调 token 限制、温度等适配参数。原文列举多家云与开源模型作为兼容目标,不在此写死版本号。
| 机制 | 解决的问题 | 对照一次 prompt | 对照通用 Agent 循环 |
|---|---|---|---|
| 规则编译为 IR | 指南模糊、提示膨胀 | 整段 SOP 塞进提示 | 工具说明塞进提示,规则仍靠模型记 |
| 动态缓存 | 重复问法的成本与延迟 | 几乎每次都调用 | 可能有记忆,但少规则级缓存 |
| 模型抽象层 | 厂商锁定与差价 | 绑死一个 SDK | 有的框架有,有的没有 |
| 输出合规验证 | 越界生成 | 无或事后正则 | 常缺独立验证层 |
⚠️ 常见坑:把「支持多模型」理解成「换模型行为不变」。IR 可移植,生成风格、工具调用遵守度仍因模型而异。换模型要回归指南覆盖的关键路径,不能只改配置。
💡 关键直觉:模型是发动机,控制环是变速箱和刹车。马力再大,没有刹车不能上路。
头痛要不要做影像学检查——原文用医疗例子:先症状评估工具,再预约工具,再综合回复。每步输出先验证是否符合当前指南;要调工具则网关执行,结果回填上下文,再进入下一轮推理。不符合则拒绝、重试或报错,而不是「模型说了就算」。
金融客服引用条款、医疗脱敏、法律条款比对——都是「模型在边界内执行」,不是自由发挥。优点:可控、可维护、可扩展、审计友好。代价:组件多、规则与工具接口要设计、多轮验证增加延迟、指南盲区会僵住。原文也提到,随着模型自身规划变强,架构可能走向「更轻的规则引导 + 模型自主规划」——那是演化判断,今天的对照仍是:企业治理底线在环上,不在模型内部。
自适应规则演化、从失败日志提炼新规则、多代理分别做法务/安抚/技术再协商,被写成前沿。微服务形态理论上接得住,但「自动提炼」没有人工审核会放大错误 SOP。

信任尚未建立时,如何安全使用 LLM?原文的答案在外部框架,不在更大参数。这是集成机制的全部政治:把职位从 CEO 改成首席笔杆子。
控制环不是画一次就结束。运营上要规定:指南发布后,哪些路径必须回归;模型升级后,验证层失败率是否上升;缓存命中率上升时,正确率有没有一起掉。验证失败变多,常常是指南写得更严,也可能是新模型更不听话。要分开看,不能只看用户满意度。满意度会奖励那些口头放宽政策的回复。
一次提示赌对的团队,迁移到控制环会觉得「变慢了」。慢来自多一轮验证和可能的工具往返。要用服务协议重新谈:正确优先的路径允许多几百毫秒,闲聊式 FAQ 走缓存。把所有请求当探索式 Agent 循环,成本会打穿。集成机制的产品化就是给不同路径不同预算。
IR 模型无关是设计目标,不是魔法。工具调用协议在各家模型上的遵守程度不同,抽象层要处理失败:重试、降级到罐头、转人工。不要在抽象层里静默改写用户可见语义。改写发生在指南允许的后处理,且要进审计。否则控制环自己变成黑箱。
计划-执行-验证循环在医疗例子里很好懂,在客服里同样:先查订单,再决定解释还是补偿。验证的是「当前指南允不允许补偿」,不是「模型是否同情」。同情是风格层的事,补偿是授权层的事。集成机制把这两层拆开,运营就不要再把它们混在一张提示里。
若验证层经常拒绝模型输出,说明指南与模型能力不匹配:要么指南过细到模型无法遵守,要么模型太弱。处理是改指南粒度或换模型,而不是关掉验证。关掉验证等于回到主角模型。本章的对照在日常里只体现为:拒绝记录是资产,不是噪音。
把模型当新同事:只能看见本轮匹配到的指南和工具,不能看见全公司 SOP 文件夹;输出要过验证才能出门;不许自己发明工具调用。入职须知写进系统提示的 IR,而不是写成企业文化海报。同事(模型)换人(换厂商)时,须知还在,回归的是遵守度。控制环日常就是检查这名同事有没有偷偷把须知当建议。验证失败记录是考勤表。关掉验证等于让新同事第一天就当总经理。集成机制讲的就是岗位等级,不要把它讲成模型参数调优。
围绕「控制环考勤」,把四条路径再过一遍。表里每格都是可执行判断,不是形容词。读完请把你的项目钉进一格,不要钉在两格之间假装都占了。
| 检查项 | 纯 prompt | 通用 Agent | 规则引擎 | Parlant |
|---|---|---|---|---|
| 决策权放哪 | 一次调用赌对 | 循环赌对 | 无模型或模型只填槽 | 何时调用由引擎决定 |
| 改口径谁动手 | 失败再写长提示 | 失败换工具再试 | 失败抛错 | 验证失败记考勤不准时 |
| 行动如何被拦 | 无验证层 | 思维链自称已遵守 | 确定但无口语 | 输出过验证才出门 |
| 出事如何复盘 | 换人设 | 换更大模型 | 改代码 | 换模型要回归遵守度 |
| 口语进得来吗 | 全SOP进窗口 | 全工具可见 | 无生成风格问题 | 只注入匹配子集 |
| 上线第一周验什么 | 满意度当唯一指标 | 看步数炫技 | 看分支覆盖 | 满意度与越权分开看 |
入职须知:看不见全公司文件夹,不许发明工具。须知在 IR 里,不在海报里。关掉验证等于第一天当总经理。
慢要重新谈服务协议:正确路径允许多几百毫秒,FAQ 走缓存。用探索循环打所有请求,成本会穿。
在「控制环与模型职位」上,纯 prompt 把判断写进一段话,改的人必须会改提示,复盘只能翻聊天,口语进得来但口径会漂。通用 Agent 把判断交给循环,灵活的代价是越权与路径不可复现。规则引擎把判断写进分支,确定的代价是口语进不来、改口径要排期。Parlant 把判断写成指南与契约:业务改口径,未授权则无行动,复盘指轨迹。把这四句贴到工位上,比再记一组术语有用。
针对控制环与模型职位,本周只做一件可验收的事:找出一条真实对话或工单,标注它今天落在哪一列;若要迁到第四列,缺的是指南、工具还是关系边。缺指南就写草稿,缺工具就列契约,缺关系就补消歧或依赖。不要同时开十条战线。最常见的伪装是文件名叫指南、真源仍是提示词,或者架构图上有网关、运行时模型仍直接调函数。用「改文本能否改行为」和「低权限点名是否被拒」两张试纸识破。识破了再谈优化与案例。优化在伪装上加速,只会让错误承诺更多;案例在伪装上复制,只会把新闻变成事故。
控制环与模型职位的纪律是先钉列,再谈快。钉列需要抽检,抽检需要轨迹,轨迹需要审计真的在记抑制原因,而不只记最终回复。若没有抑制原因,排错会以为没写规则,其实是优先级压了。看得见「为什么没走另一条路」,才叫对照,才叫可控。把这句话写进值班手册,控制环与模型职位才从概念变成岗位。对照驱动不是文风,是岗位制:模型是引擎和笔杆子,方向盘在指南与工具契约上。谁把方向盘又塞回提示词,谁就在控制环与模型职位上退回第一列。
下一节看零件如何可替换:依赖注入,让测试不必真打模型 API。