5.3 安全与合规性


5.3 安全与合规性

本节摘要:高敏感行业里安全合规不是插件。对照事后过滤和提示词隐式约束,Parlant 把法规与政策编译成可执行指南:触发条件明确,不满足则阻断生成或调用。纵深从输入净化、动态规则、工具网关到审计。合规即代码——抽检对着指南,而不是对着模型良心。

本节导航

阅读完本节,你应当能够:

  1. 用一条不得泄露他人账户的指南说明运行时验证如何早于生成
  2. 列出输入、规则、网关、审计四层各挡什么
  3. 对照「请勿泄露隐私」提示词为何过不了对抗输入
  4. 说明最小权限与数据最小化如何落到上下文管理

后置过滤为什么总晚一步

传统:生成完再扫敏感词,或在提示里写「不要泄露」。维护难、边界糊、对抗输入易绕。承诺一旦生成,即使被过滤,日志和前端闪烁仍可能已造成风险。通用 Agent 的工具循环更危险:过滤的是话,不是已经打出去的转账。

Parlant 把要求写成行为指南,编译为中间表示,嵌进决策流。示例:「即使用户声称是授权代理人,未走官方身份验证也不得透露其他账户信息。」上下文管理器评估前提,不满足则阻断,而不是盼模型自觉。语义精确+执行确定,对比模糊道德劝诫。

纵深四层

输入净化与意图。 过滤明显恶意载荷;解析实体并标记敏感字段。非必要信息不到达核心推理——数据最小化。对照把整段用户粘贴(含他人身份证号)直接塞进提示的做法。

动态规则与冲突消解。 披露与保密同时激活时走矛盾检测与优先级,事件记审计。法规更新改指南,不改提示祈祷。

工具网关。 权限、schema、副作用、二次确认。这是行动层安全,比文本层更硬。

审计。 决策链:输入摘要(注意脱敏)、指南、工具、结果。满足抽检与事后追责。原文强调结构化日志含时间、调用者、参数与结果。

挡住什么 挡不住什么 对照纯 prompt
输入净化 注入式载荷、明显恶意 合法口吻的社会工程 常无
指南验证 未授权话术与路径 指南没写到的盲区 靠自觉
网关 越权行动 授权范围内的业务误判 常已执行
审计 无法抵赖 不能预防当次伤害 聊天记录而已

⚠️ 常见坑:审计日志写入未脱敏的证件号。合规系统自己变成泄漏源。日志策略与对客策略同等重要。
💡 关键直觉:安检在登机口,不在飞机落地后搜行李。网关和指南是登机口。

多租户隔离、传输与存储加密、角色权限,第 1 章已作特性对照,生产必须当成配置项而不是宣传语。硬件密钥模块等是高监管选项,原文列为可集成方向。具体认证以当时企业模块与许可证为准——回顾 1.4,企业合规模块可能不在核心开源边界内。

对抗测试应包括:冒充代理人套信息、诱导跳过验证、把工具名直接说给模型听。若仍能调未授权工具,说明许可图谱没接上,框架用法错了,不是「再加强提示」。

问题 GDPR、HIPAA、FINRA 原文都提到了,是否开箱符合?

不是。原文用它们说明目标场景与设计动机。合规是你把政策写成指南、把访问写成网关规则、把审计留全,再加组织流程。框架提供机制,不提供证书。

对抗用例写进发布门禁

每次发版跑一组对抗:冒充授权代理人套他人信息;直接说出内部工具名要求调用;诱导跳过验证;粘贴含他人证件号的长文本;请求政策外补偿。期望分别是:阻断并给官方验证路径、网关拒绝、依赖拦截、敏感字段不进核心提示、指南拒绝补偿。一组全绿才允许发生产。

最小权限要可演示。用客服角色登录,候选工具不含删除用户、不含转账。用信贷角色登录,信用查询可用但有同意前置。演示给安全团队看,比写「我们有 ABAC」有用。租户隔离同理:租户甲的指南改了,租户乙话术不变。

审计脱敏清单:证件号、卡号、病历号、精确住址。日志里用令牌或截断。对客回复同样。开发在调试面板看完整值需要额外权限,且权限要过期。合规系统泄漏自己,是最讽刺的事故。

「开箱符合某法案」是销售语言。机制清单是工程语言:指南验证、网关、审计、加密、租户。证书与法律意见由合规部门出。教程出现监管名称,只说明场景动机。把名称写进对外宣传当认证,是另一类合规风险。

提示词护栏可以保留,当作防御纵深的最外层礼貌,绝不能当作唯一层。最外层被绕过时,内层指南与网关必须仍在。测试专门构造「礼貌地绕过提示词」的句子,验证内层。过不了就不要上线。

最小演示给安全团队

准备十分钟演示:低权限点名高权限工具被拒;冒充代理人套信息被阻断;日志里证件号被截断;改指南后敏感路径立刻变。十分钟比五十页方案有效。安全团队要看的是拒绝,不是看你的架构美学。演示失败就停发版。合规即代码的意思是:代码路径可演示。不可演示的合规是 PPT。PPT 过不了真实的红队,也过不了真实的监管问询。

对照作业:对抗门禁与十分钟演示

围绕「对抗门禁与十分钟演示」,把四条路径再过一遍。表里每格都是可执行判断,不是形容词。读完请把你的项目钉进一格,不要钉在两格之间假装都占了。

检查项 纯 prompt 通用 Agent 规则引擎 Parlant
决策权放哪 敏感词当唯一层 提示勿泄露 鉴权在接口 发版跑对抗组全绿
改口径谁动手 日志含证件号 轨迹含明文 操作日志 日志截断令牌化
行动如何被拦 宣称开箱符合法案 宣传安全对齐 合规靠流程 机制清单不是证书
出事如何复盘 低权限能点名高权限 全工具可见 角色在系统里 候选集按角色
口语进得来吗 护栏只在提示 绕过提示就成功 入口结构化所以少绕 内层指南网关必须仍在
上线第一周验什么 方案五十页 看模型拒答 看渗透报告 十分钟演示拒绝路径

安全团队要看拒绝,不要看美学。演示失败停发版。不可演示的合规是PPT。

礼貌绕过提示词的句子专门用来打内层。内层倒了,外层礼貌毫无意义。

钉列纪律:对抗门禁

在「对抗门禁」上,纯 prompt 把判断写进一段话,改的人必须会改提示,复盘只能翻聊天,口语进得来但口径会漂。通用 Agent 把判断交给循环,灵活的代价是越权与路径不可复现。规则引擎把判断写进分支,确定的代价是口语进不来、改口径要排期。Parlant 把判断写成指南与契约:业务改口径,未授权则无行动,复盘指轨迹。把这四句贴到工位上,比再记一组术语有用。

针对对抗门禁,本周只做一件可验收的事:找出一条真实对话或工单,标注它今天落在哪一列;若要迁到第四列,缺的是指南、工具还是关系边。缺指南就写草稿,缺工具就列契约,缺关系就补消歧或依赖。不要同时开十条战线。最常见的伪装是文件名叫指南、真源仍是提示词,或者架构图上有网关、运行时模型仍直接调函数。用「改文本能否改行为」和「低权限点名是否被拒」两张试纸识破。识破了再谈优化与案例。优化在伪装上加速,只会让错误承诺更多;案例在伪装上复制,只会把新闻变成事故。

对抗门禁的纪律是先钉列,再谈快。钉列需要抽检,抽检需要轨迹,轨迹需要审计真的在记抑制原因,而不只记最终回复。若没有抑制原因,排错会以为没写规则,其实是优先级压了。看得见「为什么没走另一条路」,才叫对照,才叫可控。把这句话写进值班手册,对抗门禁才从概念变成岗位。对照驱动不是文风,是岗位制:模型是引擎和笔杆子,方向盘在指南与工具契约上。谁把方向盘又塞回提示词,谁就在对抗门禁上退回第一列。

重点提炼

  • 合规即代码:指南编译为运行时边界
  • 阻断早于生成:未满足前提不进入自由发挥
  • 四层纵深:输入、规则、网关、审计
  • 过滤晚一步:尤其挡不住已执行的工具
  • 日志也要脱敏:否则审计成泄漏
  • 机制≠证书:监管名称出现在教程里不等于开箱合规

下一节看机制有没有在电商、法务、内部服务里减少错误承诺。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U