agent attack surface
Agent 的攻击面不在模型本身,在它"能动手"。三类攻击对应三个入口:
下面 10 个场景,每个判断你的 Agent 在这个场景下"安全 / 有风险 / 已被打穿"。答完看你的攻击面得分。
知道攻击面后,防御按"入口 → 工具 → 执行"三层布防,每层都不能漏:
记住一个原则:信任按来源分级,不按"看起来像不像指令"分级。用户 prompt 是可信的,工具返回的数据是不可信的——哪怕它长得像指令。