本节摘要:从能对话到可信赖,隔着准确性、可控性、合规性。通用 LLM 直连客服会在退货政策上口嗨;纯规则机器人听不懂「这内衣能退吗」。本节用原文中的电商、法律科技、企业内部服务对照:把政策写成指南、把查询写成工具,运营改口径不必等发版。案例用来检验四柱,不是用来当成功学。
阅读完本节,你应当能够:
人力贵、质量漂。旧机器人僵;通用模型可能说「可无条件退货」。原文头部跨境电商思路:业务规则显式编码,不靠模型常识。问能否七天无理由:识别类别(内衣、生鲜)、匹配政策、结合是否发货签收、生成法务审过的口径。
工具取商品与订单数据;指南写政策。内衣或食品明确告知不支持无理由;可退且已签收则引导申请。政策调整改指南文本,不必工程师改代码。输出经规则过滤,杜绝自由发挥。
@p.tool async def check_return_policy(context: p.ToolContext, product_id: str) -> p.ToolResult: # 调用内部策略查询,返回结构受契约约束 return p.ToolResult("该类目退货策略摘要")
物流异常时主动补偿——原文强调前提是方案已写入规则,不是模型同情。对照通用 Agent:同情心会变成优惠券超发。
法律:不仅引用法条,还按复杂度决定直接给标准答案还是生成摘要供律师复核——动态粒度。高风险路径依赖人工,低风险路径自动化。对照端到端模型一律生成「看起来像法律意见」的段落,那是责任事故。工具做条款比对,指南决定披露级别。
内部:休假申请解析 → 查余额 → 是否需经理批 → 发审批 → 同步日历。全程规则约束、可解释。这是工作流引擎特质,对话只是入口。对照在聊天里「帮我请假」然后模型假装已批准:必须有工具副作用和指南授权,否则只是角色扮演。
原文还提到某国际银行跨境支付审核时长与错误率改善、某公司客户成功代理与满意度变化——那是原文叙述的案例结果,部署时当作激励而非你的 KPI 承诺。你的验收应是:错误承诺次数、越权调用次数、抽检能指到指南的比例。
| 行业 | 若用通用模型直连 | 若用纯规则机器人 | Parlant 部署要点 |
|---|---|---|---|
| 电商客服 | 政策口嗨、补偿超发 | 口语进不来 | 类目+订单状态进指南,补偿必须预写 |
| 法律辅助 | 伪造确定性意见 | 条款检索僵 | 复杂度分流,高风险人工复核 |
| 内部流程 | 假装已审批 | 表单系统无对话 | 工具真写系统,指南管审批门槛 |
| 金融问答 | 随口报价 | 听不懂问法 | 预审工具+免责罐头,禁止直接金额 |
⚠️ 常见坑:案例演示用了真实生产接口。行业部署第一步仍是沙箱。把成功案例理解成可以跳过 5.1–5.3,会把别人的新闻变成自己的事故。
💡 关键直觉:可靠比聪明值钱的时刻,都发生在「能不能退」「能不能贷」「批没批」这种句子上,不发生在闲聊打分上。

回到开篇四条路径:生产环境里纯 prompt 几乎不可签字;通用 Agent 适合探索;规则引擎适合无口语入口的固定作业;Parlant 适合「必须懂人话,又不许乱承诺」的那一段。选错了,案例再漂亮也是别人的。
未来方向原文写过:规则更形式化、从历史辅助生成指南草案、跨代理协作。方向不能替代你今天的抽检清单。教程到此收束:方向盘在指南与工具契约上,模型是引擎与笔杆子。
电商试纸:改一句不可退类目指南,不发版,抽检该类目问法是否立刻变。变了,解耦发生了;没变,你可能仍把政策写在提示或代码常量里。法律试纸:高复杂度案件是否稳定交给复核队列,而不是模型自信地给结论。内部试纸:无授权时假期系统零写入,聊天再像审批也无效。
补偿与优惠必须预写。案例里物流异常主动补偿,前提是规则已有方案。把「主动」理解成模型自发,会回到超发。主动的主体是规则引擎在状态满足时触发,不是感情。产品可以设计主动,但不能把主动权交给采样。
原文中的时长下降、错误率下降、满意度上升,当作他人环境的叙述。你的仪表盘用:错误承诺次数、越权调用、指南可指认率、变更是否热更新。四项比新闻更诚实。诚实才能决定扩面还是停在试点。
扩面顺序建议:查单与政策问答 → 标准退货申请 → 带补偿的异常 → 资金类。越往后网关越硬、人审越多。不要因为第一阶段顺就跳到转账。行业案例的诱惑是「别人已经做了复杂的」,忽略别人可能有更重的治理。
回到导读四列图。若生产上仍靠提示词改口径,你在第一列。若模型自己规划工具,你在第二列。若用户必须填表,你在第三列。只有口语进得来、行动出得去且可指认指南,才在第四列。案例读完,请把项目钉回其中一列,不要钉在演讲稿上。
开会不播放案例宣传。只带错误承诺次数、越权调用、指南可指认率、口径热更新是否成功。四项达标才扩面到下一类目或下一业务线。新闻里的时长和满意度当作附录。决策会若开始讨论模型是否够聪明,说明试纸没被使用。聪明是模型厂商的事,扩面是治理的事。案例节的全部意义,就是让决策会把议程从聪明改成治理。改不了议程,部署只是换皮聊天。
围绕「试纸与扩面会」,把四条路径再过一遍。表里每格都是可执行判断,不是形容词。读完请把你的项目钉进一格,不要钉在两格之间假装都占了。
| 检查项 | 纯 prompt | 通用 Agent | 规则引擎 | Parlant |
|---|---|---|---|---|
| 决策权放哪 | 抄新闻数字 | 看是否更会办事 | 看流程对不对 | 四项数字决策 |
| 改口径谁动手 | 主动等于模型同情 | 自发补偿 | 补偿写在代码 | 主动是规则触发 |
| 行动如何被拦 | 改政策仍改提示 | 改工具描述 | 发版改规则 | 运营改指南立刻变 |
| 出事如何复盘 | 第一阶段顺就跳转账 | 探索接口当生产 | 扩面前要表单化 | 查单到退货到补偿再到资金 |
| 口语进得来吗 | 议程讨论是否聪明 | 议程换更大模型 | 议程加机器 | 议程钉治理 |
| 上线第一周验什么 | 案例当成功学 | Demo 当部署 | 稳定当够用 | 试纸不过不扩面 |
电商试纸是改类目指南不发版问法立刻变。不变就还在第一列或代码常量里。
别人案例有更重治理。忽略治理只抄复杂度,是把别人的新闻变成自己的事故。
在「行业试纸与扩面」上,纯 prompt 把判断写进一段话,改的人必须会改提示,复盘只能翻聊天,口语进得来但口径会漂。通用 Agent 把判断交给循环,灵活的代价是越权与路径不可复现。规则引擎把判断写进分支,确定的代价是口语进不来、改口径要排期。Parlant 把判断写成指南与契约:业务改口径,未授权则无行动,复盘指轨迹。把这四句贴到工位上,比再记一组术语有用。
针对行业试纸与扩面,本周只做一件可验收的事:找出一条真实对话或工单,标注它今天落在哪一列;若要迁到第四列,缺的是指南、工具还是关系边。缺指南就写草稿,缺工具就列契约,缺关系就补消歧或依赖。不要同时开十条战线。最常见的伪装是文件名叫指南、真源仍是提示词,或者架构图上有网关、运行时模型仍直接调函数。用「改文本能否改行为」和「低权限点名是否被拒」两张试纸识破。识破了再谈优化与案例。优化在伪装上加速,只会让错误承诺更多;案例在伪装上复制,只会把新闻变成事故。
行业试纸与扩面的纪律是先钉列,再谈快。钉列需要抽检,抽检需要轨迹,轨迹需要审计真的在记抑制原因,而不只记最终回复。若没有抑制原因,排错会以为没写规则,其实是优先级压了。看得见「为什么没走另一条路」,才叫对照,才叫可控。把这句话写进值班手册,行业试纸与扩面才从概念变成岗位。对照驱动不是文风,是岗位制:模型是引擎和笔杆子,方向盘在指南与工具契约上。谁把方向盘又塞回提示词,谁就在行业试纸与扩面上退回第一列。
学完后用导读那张四列图回头看自己的项目:控制权现在到底在哪一列。