AI 安全与攻防 · 第 2 期

越狱攻防 · 让模型说出"不该说的"

jailbreak · 对齐的缝 · 意图识别

越狱不是黑魔法,是利用对齐的缝——把模型推到训练分布之外,让它"忘了"自己不该说什么。单靠 RLHF 拦不住,得在推理时加意图识别 + 拒答模板兜底。越狱和注入不一样:注入劫持动作,越狱撬开嘴巴。
⏱ 约 9 分钟 🎯 关心模型安全对齐的工程师 📦 源:OWASP LLM Top 10 #2

01反共识:越狱不是"破解",是"绕到训练分布外"

很多人把越狱想象成破解密码——找到一个"钥匙"就开了。其实模型没有那把锁。RLHF 做的事是:在训练数据里把"该说的"标高、"不该说的"压低,让模型学会偏好。但偏好是概率,不是边界。

攻击者只要把对话推到训练时没怎么覆盖的角落——虚构场景、角色扮演、翻译诡计——模型的偏好分布就变薄,"不该说的"概率就升上来了。这不是模型"被破解",是它从来没真正学过在这些场景里也要拒答。

所以防御不是"把锁加厚",是"在推理时再判一次意图"——不管模型被推到哪个角落,意图识别都能看出"这是在套危险信息",然后强制拒答。

越狱不是破解锁,
是绕到没锁的地方。
灏天文库 · AI 安全与攻防 P.04

02越狱闯关:四套模板能撬开几道闸

下面是四套最常见的越狱模板。选一个,切防御档,点"发起越狱",看模型守不守得住——以及哪道闸在起作用。

🔓 越狱闯关演示
选越狱模板 → 选防御档 → 发起,看模型是否被撬开。
① 选越狱模板
② 选防御档
模型反应— 待发起 —
点上方按钮,看模型怎么应对这套越狱。
← 选好模板和防御档,再发起

03防御:意图识别 + 拒答模板,推理时再判一次

演示里的"对齐+意图识别+拒答模板"档能拦住全部,关键不在对齐本身,而在推理时叠了两层:

  1. 意图识别:在用户输入送进主模型前,先过一个小分类器——"这段话的真实意图是不是在套危险信息?"它看的是意图不是关键词,所以"我在写小说反派需要..."这种伪装也能被识破。
  2. 拒答模板:主模型如果还是输出了敏感内容,再过一道规则——命中危险类别(武器、自残、非法)就强制替换成拒答模板。哪怕前两道都漏,这最后一道还能兜住。

关键认知:越狱防御是推理时的事,不是训练时的事。RLHF 把基线拉好,意图识别和拒答模板把推理时的缝补上。两者缺一不可。

RLHF 拉基线,
推理时再判一次。
灏天文库 · AI 安全与攻防 P.05

04带走这套清单

✅ 越狱防御 6 条

  1. 别只靠 RLHF:训练时拉基线,推理时还要再判一次意图。
  2. 意图识别看意图不看关键词:分类器要能识别"伪装成创作的套话"。
  3. 拒答模板兜底:主模型输出再过一道危险类别规则,命中即替换。
  4. 多轮上下文也要判:渐进式越狱单轮无害,看多轮模式才能识破。
  5. 红队定期回归:每月用新越狱模板跑一遍,看防御是否还顶得住(详见第 7 期)。
  6. 拒答要带理由:不答的同时说明"这类问题不回答",引导用户走合规渠道。
对齐是训练时的事,
守门是推理时的事。
灏天文库 · AI 安全与攻防 P.06