本节摘要:通用模型博学,进了保险或制药柜台上,博学会变成错词。领域自适应是把内部表征向业务语义对齐。Parlant 更倾向运行时注入术语库与指南,而不是动辄全量微调。对照提示词堆同义词、规则引擎硬编码词典,术语在这里是可版本化的语义锚点,还能绑到工具。
阅读完本节,你应当能够:
「免赔额」「严重不良事件」在公开语料里要么含糊要么几乎不出现。不引导就会幻觉或用外行话。医疗里把「阳性」听成情绪,金融里把「净资本」和「净资产」混用——用户体验是轻的,合规是重的。
自适应本质是语义对齐。全参数微调或低秩适配在部分场景有效,但原文的企业范式更警惕:频繁改基座不利于版本与行为审计。策略是外部知识注入 + 运行时上下文调控,非侵入、可解释。两块耦合:结构化术语库,情境化指南。
对照:
| 路径 | 怎么对齐 | 改口径 | 审计 | 风险 |
|---|---|---|---|---|
| 全量/低秩微调 | 改权重 | 再训再发 | 难对着词条 | 灾难性遗忘、版本漂 |
| 提示词堆词典 | 系统提示里列术语 | 改提示 | 几乎无 | 一长就挤掉真正规则 |
| 规则引擎词表 | 关键词匹配 | 改代码配置 | 可 | 口语同义覆盖不全 |
| Parlant 术语库 | 运行时识别+上下文校验 | 改词条与指南 | 术语 ID 可追溯 | 依赖词库质量与规则 |
原文给术语的维度:标准名与释义、同义词、子领域差异;使用上下文(阳性在检测 vs 情感);与工具绑定(提到查询某类安全事件则关联对应查询能力)。解析流程:文本→候选实体→上下文验证→绑定标准 ID→注入对话状态→供指南与工具使用。验证失败则当普通词,避免到处触发。
术语 ID(原文示例形态如带领域与版本的标识)让自然语言变了仍指向同一概念。从「严重不良事件」改口「重大药物反应」,映射不变则后端调用不变。这是和提示词典最大的工程差:提示里换词等于换逻辑,ID 把词和逻辑拆开。
⚠️ 常见坑:只做字符串替换。用户说的是黑话,替换表没有,后面指南全灭。同义词与上下文规则是一等公民,不是附录。
💡 关键直觉:术语像零件编号。车间口语可以变,图纸编号不能变,否则装错发动机。
指南把原子收成分子。保险例子:「问理赔进度且已有保单号,则查询并以列表返回阶段、时间和联系人。」匹配不是简单 if。原文提到基于动态构造的推理查询:把历史、已识别术语、可用工具注入,让模型判断哪条指南更适用。术语在这里既是理解单位,也是触发器。
同一会话跨子领域:挂号预约转到医保政策,要换术语集,也要换行为指南和安全约束。这是上下文管理器与术语模块的交接,避免知识越界、语气错位。矛盾校验:术语冲突时请求澄清或走默认策略,而不是猜一个专业含义。
不是禁微调。口吻、口音、极领域的生成习惯,微调仍可能有用。原文立场是:行为边界和术语真源放在外部,权重不承担审计角色。先把词条和指南建起来,再决定要不要为流畅度微调。反过来先微调再补词库,权重里的错误同义会和词库打架,排查极痛。
小团队没词库时,不要假装已经领域自适应。宁可缩小场景,把二十个核心术语写全,也比贴三百行提示词典却无 ID、无上下文规则更接近 Parlant 的用法。词库要有负责人,像代码一样评审:谁加了「可退货」的同义,谁就要对误触发退货负责。

形式化验证、少样本归纳新规则,原文当补短板的探索。在词库还乱的时候上自动归纳,会把错误同义写成制度。先人工把锚点钉住。
术语库第一版不要追求覆盖行业全书。列出二十个会引发事故的词:退货相关类目、金融披露用词、医疗阴阳性、内部系统黑话。每个词写标准名、禁止替代名、上下文、绑定工具。上线后再按工单增量。全书式词表没有上下文规则,等于给匹配引擎喂噪音。
同义词要分级。安全的同义:用户口语变体。危险的同义:把「协商退款」等同「无条件退款」。后者不是同义,是政策。应写成指南,不要写成词条。词条只负责概念锚点,政策负责动作。混在一起,改词就等于改法。
跨子领域切换要可测。构造一轮对话:先预约挂号,再问报销。期望术语集切换、指南切换、不把检测阳性解释成心情不错。测不过,说明上下文管理器与术语模块没交接。这比测「单个词能识别」更接近真实伤害。
与微调并用时,冻结行为真源:对外口径以指南和术语 ID 为准,权重只负责通顺。出现冲突,改词库或指南,不改「再训一版看看」。再训会引入不可审计漂移。版本上,术语 ID 带版本后缀,旧会话仍能解释当时用的是哪版定义。
词条卡片最小字段 标准名 / 禁止说法 / 同义口语 适用上下文 / 不适用上下文 绑定工具 / 绑定指南 负责人 / 生效版本
花一天跟班客服,只收集用户原话,不收集标准问法。原话进同义口语栏,标准问法进标准名。很多词库失败是因为按文档语言建,用户不说文档语言。对照规则引擎关键词表,同样的坑更早出现。术语管理要承认口语脏。脏不是不管,是分级:脏口语映射到干净 ID,干净 ID 绑定干净工具。千万不要把脏口语直接绑工具,否则新黑话出现时调用逻辑跟着裂。收集日每季重复,词库才是活的。
围绕「词库制度与黑话」,把四条路径再过一遍。表里每格都是可执行判断,不是形容词。读完请把你的项目钉进一格,不要钉在两格之间假装都占了。
| 检查项 | 纯 prompt | 通用 Agent | 规则引擎 | Parlant |
|---|---|---|---|---|
| 决策权放哪 | 提示堆同义词 | 工具描述里写术语 | 关键词表 | ID锚点加上下文校验 |
| 改口径谁动手 | 改口即改逻辑 | 描述一变规划变 | 改配置发版 | 话术变调用不变 |
| 行动如何被拦 | 无上下文关 | 靠模型认词 | 无口语同义 | 不符则当普通词 |
| 出事如何复盘 | 外行话也生成 | 认错仍可能调工具 | 匹配不到就失败 | 绑定工具前先过验证 |
| 口语进得来吗 | 微调当真源 | 权重与说明双真源 | 代码是真源 | 对外口径以词条与指南为准 |
| 上线第一周验什么 | 按文档语言建库 | 按英文手册建库 | 按字段名建库 | 跟班收集原话进同义栏 |
危险同义其实是政策,不要写成词条。词条锚概念,指南管动作。混在一起,改词等于改法。
跨域对话测试:挂号转到报销,阳性不得理解成心情好。这比测单个词更接近真实伤害。
在「术语锚点运营」上,纯 prompt 把判断写进一段话,改的人必须会改提示,复盘只能翻聊天,口语进得来但口径会漂。通用 Agent 把判断交给循环,灵活的代价是越权与路径不可复现。规则引擎把判断写进分支,确定的代价是口语进不来、改口径要排期。Parlant 把判断写成指南与契约:业务改口径,未授权则无行动,复盘指轨迹。把这四句贴到工位上,比再记一组术语有用。
针对术语锚点运营,本周只做一件可验收的事:找出一条真实对话或工单,标注它今天落在哪一列;若要迁到第四列,缺的是指南、工具还是关系边。缺指南就写草稿,缺工具就列契约,缺关系就补消歧或依赖。不要同时开十条战线。最常见的伪装是文件名叫指南、真源仍是提示词,或者架构图上有网关、运行时模型仍直接调函数。用「改文本能否改行为」和「低权限点名是否被拒」两张试纸识破。识破了再谈优化与案例。优化在伪装上加速,只会让错误承诺更多;案例在伪装上复制,只会把新闻变成事故。
术语锚点运营的纪律是先钉列,再谈快。钉列需要抽检,抽检需要轨迹,轨迹需要审计真的在记抑制原因,而不只记最终回复。若没有抑制原因,排错会以为没写规则,其实是优先级压了。看得见「为什么没走另一条路」,才叫对照,才叫可控。把这句话写进值班手册,术语锚点运营才从概念变成岗位。对照驱动不是文风,是岗位制:模型是引擎和笔杆子,方向盘在指南与工具契约上。谁把方向盘又塞回提示词,谁就在术语锚点运营上退回第一列。
下一节处理说出来的那一半:罐头回复与风格,如何避免今天热情明天冰冷。