5.4 鲁棒性与安全强化


5.4 鲁棒性与安全强化

本节摘要:安全强化针对对抗扰动、数据投毒、模型窃取与运行时异常。对抗训练把最坏扰动纳入学习,是目前相对有效的主动防御;输入净化与检测构成纵深但怕自适应攻击;形式化验证在窄规范内给证明;权限最小化、训练数据完整性、查询限速则是传统安全挪到模型时代的版本。评估必须含自适应对手。高风险系统还要有拒绝与降级,避免「防住一种攻击、在另一种上满分错」。

学习目标

阅读完本节,你应当能够:

  1. 把对抗训练放进训练预算,并预期干净精度可能下降。
  2. 说明为何净化与检测不能当唯一防线。
  3. 列出投毒与窃取的工程控制,不写利用步骤。
  4. 设计含自适应评估的发布门槛。

一、把模型当会撒谎的新攻击面

传统安全管主机与网络;模型增加了数据投毒、对抗输入、模型反演与窃取。原文 5.4 与 3.1 对应:防御是训练、架构、预处理、检测、集成随机化、形式化验证。与 649 文集分工:这里定组合拳与门禁,不展开 PGD 变体竞赛。

投毒发生在数据入口:公开爬取、众包标注、联邦更新。控制是来源审查、异常更新检测、可追溯的数据版本。窃取发生在查询接口:用大量查询拟合替代模型。控制是身份、配额、水印、对异常查询模式告警。这些控制便宜,却常被当成「不够智能」而忽略。

二、纵深:每一层都假设下一层会被绕过

对抗训练贵,应优先给安全关键模型,而不是给每一个推荐小模型。净化(压缩、模糊、重建)可提高偶然扰动下的稳定性,自适应攻击者会把净化算进循环。检测器同样。随机化增加攻击成本,也增加延迟。形式化方法给「在某范数球内标签不变」的证明,模型一大就算不动——适合控制策略的小模块,而不是整网感知。

控制 被绕过之后
数据完整性 签名、审核、版本 仍可能漏过隐蔽投毒
训练 对抗训练、正则 新攻击规范外失效
输入 净化、拒绝 OOD 自适应扰动
运行 限速、权限、人复核 社会工程打人
证明 形式化窄模块 规范外行为

⚠️ 常见坑:用过时的弱攻击刷新「已防御」海报。评估协议要公开攻击强度与是否自适应。
💡 关键直觉:鲁棒是预算。你买的是某种扰动族上的平滑,不是万能盔甲。

security_gate: require adaptive_eval require poison_review if external_data require query_quota on model_api require fallback_on_low_confidence physical_eval if sensors

不确定拒绝与第 3.2 节共用:许多攻击样本落在高损失或 OOD 分数异常区。把它们交给人或拒绝,比硬分类更负责任。工业控制系统还应隔离模型网络,避免第 3.4 节的物理劫持。

问题:是否所有产品都要对抗训练?

不是。按暴露面:攻击者能否提交输入、收益是否高、失败是否伤人。内容审核与身份核验优先;内部报表模型可以低优先级。但「我们不是高风险」要经用途定性,不能自封。

问题:加密模型权就能防窃取吗?

推理仍要解密或在可信环境。API 窃取不需要你的权重文件。权重量化与保密是防直接泄露,防不住查询拟合。两者都要。

四、安全比鲁棒更宽:危险后果与纵深假设

原文区分鲁棒与安全:鲁棒是扰动下性能稳定;安全是即使未预料情况也不导致危险后果。不鲁棒容易因意外输入出错从而触发安全事故,但安全还包括权限、隔离、人复核、拒绝。PGD 对抗训练通常比单步 FGSM 训练提供更强鲁棒,账单是算力与干净精度。局限性是主要针对训练时的攻击类型与扰动大小。数据增强与正则化补自然扰动与平滑边界。每一层都假设下一层被绕过:数据完整性仍可能漏过隐蔽投毒;对抗训练在新规范外失效;净化怕自适应;人会被社会工程打。

不是所有产品都要对抗训练,按暴露面与伤害选。内部报表模型低优先级,身份核验与内容审核优先。「不是高风险」须经用途定性。加密权重防直接泄露,防不住 API 查询拟合。工业控制隔离模型网络,避免物理劫持。评估协议公开攻击强度与是否自适应。不确定拒绝与 OOD 共用。CW 等攻击名称留给专集,这里要的是组合拳与门禁:自适应评估、外部数据则审查投毒、API 配额、低置信降级、有传感器则物理评估。

把模型当会撒谎的新攻击面,传统主机安全仍然要做。缺主机安全,模型安全会建立在被攻陷的训练集群上。两条线都要进审计包。

五、暴露面决策树、失效分档与虚假保证反例

不是所有产品都上对抗训练。先问三件事:攻击者能否提交输入;骗过之后收益是否高;失败是否伤人身、自由或关键服务。内容审核、身份核验、辅助驾驶感知:优先对抗训练加自适应评估,并预期干净精度下降要书面接受。内部报表模型:先做数据版本、权限与限速,对抗训练低优先级,但仍要用途定性,禁止自封「不是高风险」。有传感器:物理评估档与自然扰动集(雨雾、模糊、打印失真)分开报,只在无穷范数小球里过线不算。开放查询接口:配额、身份、异常查询告警,防的是模型窃取与反演,加密权重文件防不住这一条。

失效档 机制 最低门禁 反例
档α 对抗越界 沿敏感方向小扰动改判 自适应评估+不确定降级 用单步弱攻击刷「已防御」
档β 自然扰动 天气、设备、压缩 自然扰动集单独过线 只做对抗训练当万能盔甲
档γ 训练投毒 爬取、众包、联邦更新 来源审查+异常更新+可追溯版本 公开爬取无审查
档δ 查询窃取 API 拟合替代模型 身份、配额、模式告警 以为权重量化即可
档ε 运行危险 错判导致动作 拒绝、人复核、工业接口隔离 永远满分输出

治理检查项:评估协议是否写清攻击强度与是否自适应;外部数据是否审查投毒;低置信是否降级而不是硬贴标签;主机安全与模型安全是否都进审计包——训练集群被攻陷时,对抗训练建立在沙子上。反例:净化当唯一防线,自适应攻击把压缩算进循环;检测器自己成为新靶却无后备;形式化验证只覆盖小模块却宣传整网已证明;工业控制网与模型推理网不通隔离。与专集分工不变:这里不写可运行攻击,只留组合拳与门禁。

鲁棒选型决策树 能提交输入 + 伤人 ──► 对抗训练 + 自适应评估 + 拒绝 有传感器 ──► 加物理档与自然扰动集 数据来自外部 ──► 投毒审查先于新防御算法 只有查询 API ──► 限速与身份,不靠加密权重当防窃取 不确定或 OOD ──► 降级交人,禁止满分错

下一节用审计把解释、隐私、公平、鲁棒的成绩单变成持续验货。

六、组合拳怎么排程:先便宜控制,再买对抗训练

排程顺序故意反过来:先做数据签名与版本、查询配额、低置信拒绝、工业接口隔离——这些便宜,却常被当成不够智能而跳过。然后按暴露面决定是否把对抗训练写进训练预算,并让业务书面接受干净精度可能下降。有传感器再加物理档与自然扰动集。净化与检测最后叠,且默认假设会被自适应绕过。形式化验证只给窄模块(例如控制策略),不要用来给整网感知发证明。主机安全与模型安全进同一审计包:训练集群被攻陷,对抗训练建立在沙子上。

评估协议对外可公开攻击强度与是否自适应,对内保留完整配置。禁止用最弱单步攻击刷海报。投毒与后门和对抗输入分账:入口审查、异常更新、可追溯数据版本。API 窃取不需要权重文件,权重量化与查询拟合分开控制。不确定样本交给人或拒绝,比在对抗样本上硬给标签更负责任。内容审核假设对抗文本存在。与 649 专集边界:算法变体去专集,门禁留在这里,不写可运行攻击。

不是高风险的自封必须经用途定性。内部报表可以低优先对抗训练,但不能用这句话给身份核验或审核开脱。安全比鲁棒更宽:鲁棒是扰动下稳定,安全是未预料情况也不导致危险后果,权限、隔离、人复核都算安全层。

评估协议封面写清:攻击是否自适应、扰动族、是否含物理档、是否含自然扰动集。四格空一格视为评测作废。查询 API 的配额与身份告警先于新的防御模型采购。工业控制网与推理网不通隔离,鲁棒训练不得称为已完成安全强化。把这三句写进 5.4 的发布门槛。

便宜控制先于贵训练:数据版本、查询配额、低置信拒绝、网络隔离。对抗训练账单由业务书面接受干净精度下降。评估必须自适应,最弱攻击海报列为虚假保证。不确定降级与 OOD 共用,禁止满分错。与专集分工:此处无攻击实现。

主机安全与模型安全必须进同一审计包,训练集群被攻陷则对抗训练建立在沙子上。永远满分输出不得作为高风险上线理由。

本节要点回顾

  • 模型是新攻击面:投毒、对抗、窃取、反演。
  • 对抗训练是主主动防御:有精度账单。
  • 净化与检测怕自适应:只能当层。
  • 限速与数据版本是便宜控制:先做。
  • 形式化给窄证明:不是大网灵药。
  • 评估必须自适应:否则自欺。
  • 拒绝与隔离:运行时最后的诚实。

图 纵深防御每层都会被绕过

图 纵深防御每层都会被绕过

工作纸:自适应评估是否存在。外部数据是否审查投毒。API 配额。低置信降级。传感器物理评估。主机安全与模型安全是否都进审计包。对抗训练账单是否书面接受。评估协议是否公开攻击强度。工业接口是否隔离。不是高风险的自封是否经过用途定性。查询拟合与权重量化是否被当成同一件事——应分开控制。把最弱攻击海报列为虚假保证。

下一节用审计把解释、隐私、公平、鲁棒的成绩单变成持续验货。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U