内容摘要
越狱攻防 · 让模型说出"不该说的" 灏 灏天文库 · AI 安全与攻防 第 2 期 AI 安全与攻防 · 第 2 期 越狱攻防 · 让模型说出 "不该说的" jailbreak · 对齐的缝 · 意图识别 越狱不是黑魔法,是 利用对齐的缝 ——把模型推到训练分布之外,让它"忘了"自己不该说什么。单靠 RLHF 拦不住,得在推理时加 意图识别 + 拒答模板 兜底。越狱和注入不一样:注入劫持动作,越狱撬开嘴巴。 ⏱ 约 9 分钟 🎯 关心模型安全对齐的工程师 📦 源:OWASP LLM Top 10 #2 01 反共识:越狱不是"破解",是"绕到训练分布外" 很多人把越狱想象成破解密码——找到一个"钥匙"就开了。其实模型没有那把锁。RLHF 做的事是:在训练数据里把"该说的"标高、"不该说的"压低,让模型学会偏好。但偏好是概率,不是边界。 攻击者只要把对话推到 训练时没怎么覆盖的角落 ——虚构场景、角色扮演、翻译诡计——模型的偏好分布就变薄,"不该说的"概率就升上来了。这不是模型"被破解",是它 从来没真正学过在这些场景里也要拒答 。