AI 安全与攻防 · 第 7 期

红队思维 · 像攻击者一样测你的 Agent

red team · 上线前自己先打一遍

前 6 期讲怎么防,第 7 期讲怎么攻——主动找自己 Agent 的洞。红队不是找茬,是上线前自己先打一遍:10 个攻击场景跑一遍,看你的 Agent 漏几个。漏了不可怕,上线前不知道才可怕。
⏱ 约 10 分钟 🎯 Agent 即将上线的工程师 📦 源:OpenAI 红队手册

01反共识:红队不是"找茬",是"上线前的保险"

很多团队把红队测试当"找茬"——觉得自己的 Agent 没问题,何必花钱找人攻。真相是:你不攻,攻击者会攻。红队是上线前自己先打一遍,把攻击者会用的招提前跑一遍,发现洞就补,比上线后被攻击者打出来便宜得多。

红队和测试不一样:测试是"验证功能正常"(happy path),红队是"主动找功能不正常"(adversarial path)。测试问"它能做对吗",红队问"它怎么会被做错"。两个问题都要问,只问前一个等于没测。

关键认知:红队是持续的,不是一次性的。Agent 每次加新工具、换模型、改提示,都要重新跑一遍——昨天守得住的,今天加个工具可能就漏了。

你不攻,
攻击者会攻。
灏天文库 · AI 安全与攻防 P.19

02红队检查单:10 个攻击场景自测

下面是 10 个最常见的攻击场景,对应前 6 期讲过的防御。逐条标"通过/未通过/未测",看你的 Agent 整体得分和哪类防御最弱。

🎯 红队检查单
逐条标 通过/未通过/未测,看整体得分和薄弱类别。
← 标完 10 条看结果

03红队怎么跑:分类、定级、回归

红队不是随便试几下,要按方法跑:

  1. 分类:把攻击场景按类别分(注入/对齐/泄露/工具/沙箱/数据/资源),每类对应一套防御。哪类漏得多,就重点补哪类。
  2. 定级:每个场景按影响定级——不可逆(删库、外泄)= 高危,可逆(读文件)= 中危,骚扰(耗 token)= 低危。高危先补。
  3. 回归:补完后重跑一遍,确认补住了。Agent 每次改版都要回归,不是补一次就一劳永逸。

关键认知:红队的产出不是"我测过了",而是"我测过且补过且回归过"。只测不补等于没测,补了不回归等于没补。

红队的产出是
测过+补过+回归过。
灏天文库 · AI 安全与攻防 P.20

04带走这套清单

✅ 红队执行 6 条

  1. 上线前必跑:10 个攻击场景全跑一遍,不留"应该没事"的侥幸。
  2. 分类补漏:哪类漏得多重点补哪类,不要平均用力。
  3. 按影响定级:不可逆动作(删库、外泄)先补,骚扰类后补。
  4. 补完回归:重跑确认补住了,不是补了就完。
  5. 每次改版重跑:加工具、换模型、改提示都要重跑红队。
  6. 留红队报告:测了什么、漏了什么、补了什么,留档可审计。
漏了不可怕,
上线前不知道才可怕。
灏天文库 · AI 安全与攻防 P.21