Constitutional 安全防线与红队靶场


文档摘要

Constitutional 安全防线与红队靶场 本节摘要:Anthropic 的 Constitutional Classifiers、Meta 的 Llama Guard 4、Google 的 ShieldGemma-2、NVIDIA 的 Nemotron 3 Content Safety、覆盖多语言的 X-Guard 定义了 2026 的安全分类器栈;garak、PyRIT、NVIDIA Aegis、promptfoo 成了标准对抗评估工具;NeMo Guardrails v0.12 把它们串进生产管线。本节把这些全接到一起:围绕目标应用的多层安全外壳、跑 6 个以上攻击族的自主红队 Agent、以及一轮产出可度量「无害度增量」的 Constitutional 自批评。

Constitutional 安全防线与红队靶场

本节摘要:Anthropic 的 Constitutional Classifiers、Meta 的 Llama Guard 4、Google 的 ShieldGemma-2、NVIDIA 的 Nemotron 3 Content Safety、覆盖多语言的 X-Guard 定义了 2026 的安全分类器栈;garak、PyRIT、NVIDIA Aegis、promptfoo 成了标准对抗评估工具;NeMo Guardrails v0.12 把它们串进生产管线。本节把这些全接到一起:围绕目标应用的多层安全外壳、跑 6 个以上攻击族的自主红队 Agent、以及一轮产出可度量「无害度增量」的 Constitutional 自批评。你会学到分层防御(输入消毒/策略/分类门/输出过滤/HITL)与过拒绝权衡。

对应原课程:Phase 19 · Lesson 15 · constitutional-safety-harness(原英文 phases/19-capstone-projects/15-constitutional-safety-harness/docs/en.md)。

学习目标

阅读完本节,你应当能够:

  1. 构建五层安全管线:输入消毒、NeMo Guardrails 策略、分类门(Llama Guard 4/X-Guard/ShieldGemma-2)、目标模型、输出过滤(Llama Guard 4 + Presidio + 引用检查)。
  2. 调度 6+ 攻击族:PAIR、TAP、GCG、ASCII/base64/rot13 编码、多轮角色采用、多语言 code-switch。
  3. 用 garak 与 PyRIT 跑红队,产出带 CVSS 4.0 评分与披露时间线的结构化发现文件。
  4. 实现 Constitutional 自批评:草拟 → 评委按成文宪法打分 → 重写 → 在批评改进对上微调,度量前后无害度增量。
  5. 在 XSTest 良性集上度量过拒绝率,确保良性问题上保持有用。
  6. 把全流程跑在 cron 上,发现写队列,过拒绝回归告警到 Slack。

一、问题与直觉

2026 年 LLM 安全的前沿不是分类器灵不灵(大致灵),而是如何围绕生产应用正确组合它们——既不过拒绝,也不留明显漏洞。Llama Guard 4 处理英文策略违规;X-Guard(132 语言)处理多语言越狱;ShieldGemma-2 抓图像提示注入;NVIDIA Nemotron 3 Content Safety 覆盖企业类别;Anthropic 的 Constitutional Classifiers 是另一条路,用在训练而非服务时。

攻击演化也要紧。PAIR 与 TAP 自动发现越狱;GCG 跑梯度后缀攻击;多轮与 code-switch 攻击利用 Agent 记忆。任何部署的 LLM 都需要一个红队靶场——garak 与 PyRIT 是标准驱动器——加文档化的缓解与 CVSS 评分发现。

你要硬化一个目标应用(一个 8B 指令微调模型或另一个毕业项目的 RAG 聊天机器人),对它跑 6+ 攻击族,并产出前后无害度度量。

二、从零实现

安全管线五层。输入消毒:去零宽字符、解码 base64/rot13、Unicode 归一化。策略层:NeMo Guardrails v0.12 栏(越域、毒性、PII 抽取)。分类门:输入用 Llama Guard 4,非英文用 X-Guard,图像输入用 ShieldGemma-2。模型:目标 LLM。输出过滤:输出用 Llama Guard 4,Presidio PII 清洗,适用时引用强制。HITL 层:标为高风险的输出进 Slack 队列。

五层管线骨架:

def safety_pipeline(req): req = sanitize(req) # 去零宽/解码/归一化 req = nemoguardrails(req) # 策略栏 if not classifier_gate(req): return refuse # Llama Guard 4 / X-Guard / ShieldGemma resp = target_llm(req) resp = llama_guard_out(resp) # 输出分类 resp = presidio_scrub(resp) # PII 脱敏 if high_risk(resp): queue_hitl(resp) return resp

Constitutional 自批评是训练时介入。取 1k 有害尝试提示,让模型草拟响应,按一份成文宪法(「不伤害」「引证据」「拒非法请求」)让评委批评,重写后在批评循环上重训。度量留出集上的前后无害度增量。

红队靶场跑在调度器上。每个成功越狱按 CVSS 4.0 评分(攻击向量、复杂度、影响),产出披露时间线与缓解计划。

三、架构与技术栈

  • 安全分类器:Llama Guard 4、ShieldGemma-2、NVIDIA Nemotron 3 Content Safety、X-Guard。
  • 护栏框架:NeMo Guardrails v0.12 + OPA。
  • 红队驱动器:garak(NVIDIA)、PyRIT(Microsoft Azure)、NVIDIA Aegis、promptfoo。
  • 越狱 Agent:PAIR(Chao 等 2023)、Tree-of-Attacks(TAP)、GCG 后缀。
  • Constitutional 训练:Anthropic 风格自批评循环 + 在批评上 SFT。
  • PII 清洗:Presidio。
  • 目标:一个 8B 指令微调模型或另一个毕业项目的 RAG 聊天机器人。

四、可复用产物

outputs/skill-safety-harness.md 是交付物:一个生产级分层安全管线 + 可复现红队靶场,带前后无害度增量。评分量表:

权重 标准 度量方式
25 攻击面覆盖 6+ 攻击族,2+ 语言
20 真阳/假阳权衡 攻击拦截率 vs XSTest 良性通过率
20 自批评增量 留出集上前后无害度
20 文档与披露 CVSS 评分发现带时间线
15 自动化与可复现 全流程跑 cron 带告警
100

一次典型探测:

$ safety probe --model=target --family=PAIR --budget=50 [attacker] PAIR agent running on target [attack] attempt 1/50: disguise query as academic research ... blocked [attack] attempt 2/50: appeal to roleplay ... blocked [attack] attempt 3/50: chain-of-thought coax ... SUCCEEDED [finding] CVSS 4.8 medium: roleplay bypass on target [range] 7 successes out of 50 (14% success rate)

五、框架对比

Llama Guard 4 是 2026 输入/输出内容分类器参考,英文最强;X-Guard 覆盖 132 语言,多语言最强;ShieldGemma-2 抓图像与多模态;Nemotron 3 Content Safety 覆盖企业类别。攻击侧,PAIR 与 TAP 是 LLM 驱动越狱发现的两条主路(后者是树搜索变体),GCG 是梯度后缀攻击(对开源模型有效,对闭源 API 无效)。本节的差异化在「分层 + 自批评」——单一分类器总有漏洞,多层串接能堵大部分,而 Constitutional 自批评在训练时把模型本身变得更强,是从根上降无害度风险的招。

六、练习

  1. RAG 注入:对一个 RAG 聊天机器人跑 garak 的提示注入插件,对比有/无输出过滤层的攻击成功率。
  2. 第七族:加第七个攻击族——经检索文档的间接提示注入,度量需要的额外防御。
  3. 拒绝带帮助:实现「拒绝带帮助」模式——护栏拦截时,目标提供一个更安全的相关答案而非生硬拒绝,度量 XSTest 增量。
  4. 多语言缺口:找一个 X-Guard 表现差的语言,提出针对它的微调数据集。
  5. 规模化:在 30B 模型上跑 Constitutional 自批评,度量增量是否随规模放大。

本节要点回顾

  1. 2026 安全栈:Llama Guard 4 + X-Guard + ShieldGemma-2 + Nemotron 3 + Constitutional Classifiers。
  2. 五层管线:输入消毒 → 策略栏 → 分类门 → 模型 → 输出过滤 + HITL。
  3. 6+ 攻击族:PAIR、TAP、GCG、编码、多轮角色、多语言 code-switch。
  4. CVSS 评分发现:每成功越狱按 CVSS 4.0 评分,带披露时间线。
  5. Constitutional 自批评:草拟-批评-重写-重训,度量前后无害度增量。
  6. 过拒绝权衡:在 XSTest 良性集上度量假阳率,确保有用性。

下一节,我们转向「GitHub Issue 转 PR Agent」——给 issue 打个标签就自动出 PR 的异步云编程 Agent。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U