jailbreak · 对齐的缝 · 意图识别
很多人把越狱想象成破解密码——找到一个"钥匙"就开了。其实模型没有那把锁。RLHF 做的事是:在训练数据里把"该说的"标高、"不该说的"压低,让模型学会偏好。但偏好是概率,不是边界。
攻击者只要把对话推到训练时没怎么覆盖的角落——虚构场景、角色扮演、翻译诡计——模型的偏好分布就变薄,"不该说的"概率就升上来了。这不是模型"被破解",是它从来没真正学过在这些场景里也要拒答。
所以防御不是"把锁加厚",是"在推理时再判一次意图"——不管模型被推到哪个角落,意图识别都能看出"这是在套危险信息",然后强制拒答。
下面是四套最常见的越狱模板。选一个,切防御档,点"发起越狱",看模型守不守得住——以及哪道闸在起作用。
演示里的"对齐+意图识别+拒答模板"档能拦住全部,关键不在对齐本身,而在推理时叠了两层:
关键认知:越狱防御是推理时的事,不是训练时的事。RLHF 把基线拉好,意图识别和拒答模板把推理时的缝补上。两者缺一不可。