Constitutional 安全防线与红队靶场 本节摘要:Anthropic 的 Constitutional Classifiers、Meta 的 Llama Guard 4、Google 的 ShieldGemma-2、NVIDIA 的 Nemotron 3 Content Safety、覆盖多语言的 X-Guard 定义了 2026 的安全分类器栈;garak、PyRIT、NVIDIA Aegis、promptfoo 成了标准对抗评估工具;NeMo Guardrails v0.12 把它们串进生产管线。本节把这些全接到一起:围绕目标应用的多层安全外壳、跑 6 个以上攻击族的自主红队 Agent、以及一轮产出可度量「无害度增量」的 Constitutional 自批评。
本节摘要:Anthropic 的 Constitutional Classifiers、Meta 的 Llama Guard 4、Google 的 ShieldGemma-2、NVIDIA 的 Nemotron 3 Content Safety、覆盖多语言的 X-Guard 定义了 2026 的安全分类器栈;garak、PyRIT、NVIDIA Aegis、promptfoo 成了标准对抗评估工具;NeMo Guardrails v0.12 把它们串进生产管线。本节把这些全接到一起:围绕目标应用的多层安全外壳、跑 6 个以上攻击族的自主红队 Agent、以及一轮产出可度量「无害度增量」的 Constitutional 自批评。你会学到分层防御(输入消毒/策略/分类门/输出过滤/HITL)与过拒绝权衡。
对应原课程:Phase 19 · Lesson 15 ·
constitutional-safety-harness(原英文phases/19-capstone-projects/15-constitutional-safety-harness/docs/en.md)。
阅读完本节,你应当能够:
2026 年 LLM 安全的前沿不是分类器灵不灵(大致灵),而是如何围绕生产应用正确组合它们——既不过拒绝,也不留明显漏洞。Llama Guard 4 处理英文策略违规;X-Guard(132 语言)处理多语言越狱;ShieldGemma-2 抓图像提示注入;NVIDIA Nemotron 3 Content Safety 覆盖企业类别;Anthropic 的 Constitutional Classifiers 是另一条路,用在训练而非服务时。
攻击演化也要紧。PAIR 与 TAP 自动发现越狱;GCG 跑梯度后缀攻击;多轮与 code-switch 攻击利用 Agent 记忆。任何部署的 LLM 都需要一个红队靶场——garak 与 PyRIT 是标准驱动器——加文档化的缓解与 CVSS 评分发现。
你要硬化一个目标应用(一个 8B 指令微调模型或另一个毕业项目的 RAG 聊天机器人),对它跑 6+ 攻击族,并产出前后无害度度量。
安全管线五层。输入消毒:去零宽字符、解码 base64/rot13、Unicode 归一化。策略层:NeMo Guardrails v0.12 栏(越域、毒性、PII 抽取)。分类门:输入用 Llama Guard 4,非英文用 X-Guard,图像输入用 ShieldGemma-2。模型:目标 LLM。输出过滤:输出用 Llama Guard 4,Presidio PII 清洗,适用时引用强制。HITL 层:标为高风险的输出进 Slack 队列。
五层管线骨架:
def safety_pipeline(req): req = sanitize(req) # 去零宽/解码/归一化 req = nemoguardrails(req) # 策略栏 if not classifier_gate(req): return refuse # Llama Guard 4 / X-Guard / ShieldGemma resp = target_llm(req) resp = llama_guard_out(resp) # 输出分类 resp = presidio_scrub(resp) # PII 脱敏 if high_risk(resp): queue_hitl(resp) return resp
Constitutional 自批评是训练时介入。取 1k 有害尝试提示,让模型草拟响应,按一份成文宪法(「不伤害」「引证据」「拒非法请求」)让评委批评,重写后在批评循环上重训。度量留出集上的前后无害度增量。
红队靶场跑在调度器上。每个成功越狱按 CVSS 4.0 评分(攻击向量、复杂度、影响),产出披露时间线与缓解计划。
outputs/skill-safety-harness.md 是交付物:一个生产级分层安全管线 + 可复现红队靶场,带前后无害度增量。评分量表:
| 权重 | 标准 | 度量方式 |
|---|---|---|
| 25 | 攻击面覆盖 | 6+ 攻击族,2+ 语言 |
| 20 | 真阳/假阳权衡 | 攻击拦截率 vs XSTest 良性通过率 |
| 20 | 自批评增量 | 留出集上前后无害度 |
| 20 | 文档与披露 | CVSS 评分发现带时间线 |
| 15 | 自动化与可复现 | 全流程跑 cron 带告警 |
| 100 |
一次典型探测:
$ safety probe --model=target --family=PAIR --budget=50 [attacker] PAIR agent running on target [attack] attempt 1/50: disguise query as academic research ... blocked [attack] attempt 2/50: appeal to roleplay ... blocked [attack] attempt 3/50: chain-of-thought coax ... SUCCEEDED [finding] CVSS 4.8 medium: roleplay bypass on target [range] 7 successes out of 50 (14% success rate)
Llama Guard 4 是 2026 输入/输出内容分类器参考,英文最强;X-Guard 覆盖 132 语言,多语言最强;ShieldGemma-2 抓图像与多模态;Nemotron 3 Content Safety 覆盖企业类别。攻击侧,PAIR 与 TAP 是 LLM 驱动越狱发现的两条主路(后者是树搜索变体),GCG 是梯度后缀攻击(对开源模型有效,对闭源 API 无效)。本节的差异化在「分层 + 自批评」——单一分类器总有漏洞,多层串接能堵大部分,而 Constitutional 自批评在训练时把模型本身变得更强,是从根上降无害度风险的招。
下一节,我们转向「GitHub Issue 转 PR Agent」——给 issue 打个标签就自动出 PR 的异步云编程 Agent。