本节摘要:高敏感行业里安全合规不是插件。对照事后过滤和提示词隐式约束,Parlant 把法规与政策编译成可执行指南:触发条件明确,不满足则阻断生成或调用。纵深从输入净化、动态规则、工具网关到审计。合规即代码——抽检对着指南,而不是对着模型良心。
阅读完本节,你应当能够:
传统:生成完再扫敏感词,或在提示里写「不要泄露」。维护难、边界糊、对抗输入易绕。承诺一旦生成,即使被过滤,日志和前端闪烁仍可能已造成风险。通用 Agent 的工具循环更危险:过滤的是话,不是已经打出去的转账。
Parlant 把要求写成行为指南,编译为中间表示,嵌进决策流。示例:「即使用户声称是授权代理人,未走官方身份验证也不得透露其他账户信息。」上下文管理器评估前提,不满足则阻断,而不是盼模型自觉。语义精确+执行确定,对比模糊道德劝诫。
输入净化与意图。 过滤明显恶意载荷;解析实体并标记敏感字段。非必要信息不到达核心推理——数据最小化。对照把整段用户粘贴(含他人身份证号)直接塞进提示的做法。
动态规则与冲突消解。 披露与保密同时激活时走矛盾检测与优先级,事件记审计。法规更新改指南,不改提示祈祷。
工具网关。 权限、schema、副作用、二次确认。这是行动层安全,比文本层更硬。
审计。 决策链:输入摘要(注意脱敏)、指南、工具、结果。满足抽检与事后追责。原文强调结构化日志含时间、调用者、参数与结果。
| 层 | 挡住什么 | 挡不住什么 | 对照纯 prompt |
|---|---|---|---|
| 输入净化 | 注入式载荷、明显恶意 | 合法口吻的社会工程 | 常无 |
| 指南验证 | 未授权话术与路径 | 指南没写到的盲区 | 靠自觉 |
| 网关 | 越权行动 | 授权范围内的业务误判 | 常已执行 |
| 审计 | 无法抵赖 | 不能预防当次伤害 | 聊天记录而已 |
⚠️ 常见坑:审计日志写入未脱敏的证件号。合规系统自己变成泄漏源。日志策略与对客策略同等重要。
💡 关键直觉:安检在登机口,不在飞机落地后搜行李。网关和指南是登机口。
多租户隔离、传输与存储加密、角色权限,第 1 章已作特性对照,生产必须当成配置项而不是宣传语。硬件密钥模块等是高监管选项,原文列为可集成方向。具体认证以当时企业模块与许可证为准——回顾 1.4,企业合规模块可能不在核心开源边界内。
对抗测试应包括:冒充代理人套信息、诱导跳过验证、把工具名直接说给模型听。若仍能调未授权工具,说明许可图谱没接上,框架用法错了,不是「再加强提示」。
不是。原文用它们说明目标场景与设计动机。合规是你把政策写成指南、把访问写成网关规则、把审计留全,再加组织流程。框架提供机制,不提供证书。
每次发版跑一组对抗:冒充授权代理人套他人信息;直接说出内部工具名要求调用;诱导跳过验证;粘贴含他人证件号的长文本;请求政策外补偿。期望分别是:阻断并给官方验证路径、网关拒绝、依赖拦截、敏感字段不进核心提示、指南拒绝补偿。一组全绿才允许发生产。
最小权限要可演示。用客服角色登录,候选工具不含删除用户、不含转账。用信贷角色登录,信用查询可用但有同意前置。演示给安全团队看,比写「我们有 ABAC」有用。租户隔离同理:租户甲的指南改了,租户乙话术不变。
审计脱敏清单:证件号、卡号、病历号、精确住址。日志里用令牌或截断。对客回复同样。开发在调试面板看完整值需要额外权限,且权限要过期。合规系统泄漏自己,是最讽刺的事故。
「开箱符合某法案」是销售语言。机制清单是工程语言:指南验证、网关、审计、加密、租户。证书与法律意见由合规部门出。教程出现监管名称,只说明场景动机。把名称写进对外宣传当认证,是另一类合规风险。
提示词护栏可以保留,当作防御纵深的最外层礼貌,绝不能当作唯一层。最外层被绕过时,内层指南与网关必须仍在。测试专门构造「礼貌地绕过提示词」的句子,验证内层。过不了就不要上线。
准备十分钟演示:低权限点名高权限工具被拒;冒充代理人套信息被阻断;日志里证件号被截断;改指南后敏感路径立刻变。十分钟比五十页方案有效。安全团队要看的是拒绝,不是看你的架构美学。演示失败就停发版。合规即代码的意思是:代码路径可演示。不可演示的合规是 PPT。PPT 过不了真实的红队,也过不了真实的监管问询。
围绕「对抗门禁与十分钟演示」,把四条路径再过一遍。表里每格都是可执行判断,不是形容词。读完请把你的项目钉进一格,不要钉在两格之间假装都占了。
| 检查项 | 纯 prompt | 通用 Agent | 规则引擎 | Parlant |
|---|---|---|---|---|
| 决策权放哪 | 敏感词当唯一层 | 提示勿泄露 | 鉴权在接口 | 发版跑对抗组全绿 |
| 改口径谁动手 | 日志含证件号 | 轨迹含明文 | 操作日志 | 日志截断令牌化 |
| 行动如何被拦 | 宣称开箱符合法案 | 宣传安全对齐 | 合规靠流程 | 机制清单不是证书 |
| 出事如何复盘 | 低权限能点名高权限 | 全工具可见 | 角色在系统里 | 候选集按角色 |
| 口语进得来吗 | 护栏只在提示 | 绕过提示就成功 | 入口结构化所以少绕 | 内层指南网关必须仍在 |
| 上线第一周验什么 | 方案五十页 | 看模型拒答 | 看渗透报告 | 十分钟演示拒绝路径 |
安全团队要看拒绝,不要看美学。演示失败停发版。不可演示的合规是PPT。
礼貌绕过提示词的句子专门用来打内层。内层倒了,外层礼貌毫无意义。
在「对抗门禁」上,纯 prompt 把判断写进一段话,改的人必须会改提示,复盘只能翻聊天,口语进得来但口径会漂。通用 Agent 把判断交给循环,灵活的代价是越权与路径不可复现。规则引擎把判断写进分支,确定的代价是口语进不来、改口径要排期。Parlant 把判断写成指南与契约:业务改口径,未授权则无行动,复盘指轨迹。把这四句贴到工位上,比再记一组术语有用。
针对对抗门禁,本周只做一件可验收的事:找出一条真实对话或工单,标注它今天落在哪一列;若要迁到第四列,缺的是指南、工具还是关系边。缺指南就写草稿,缺工具就列契约,缺关系就补消歧或依赖。不要同时开十条战线。最常见的伪装是文件名叫指南、真源仍是提示词,或者架构图上有网关、运行时模型仍直接调函数。用「改文本能否改行为」和「低权限点名是否被拒」两张试纸识破。识破了再谈优化与案例。优化在伪装上加速,只会让错误承诺更多;案例在伪装上复制,只会把新闻变成事故。
对抗门禁的纪律是先钉列,再谈快。钉列需要抽检,抽检需要轨迹,轨迹需要审计真的在记抑制原因,而不只记最终回复。若没有抑制原因,排错会以为没写规则,其实是优先级压了。看得见「为什么没走另一条路」,才叫对照,才叫可控。把这句话写进值班手册,对抗门禁才从概念变成岗位。对照驱动不是文风,是岗位制:模型是引擎和笔杆子,方向盘在指南与工具契约上。谁把方向盘又塞回提示词,谁就在对抗门禁上退回第一列。
下一节看机制有没有在电商、法务、内部服务里减少错误承诺。