第 1 章 · AI安全攻防全景 章节摘要:AI 系统上线后,攻击者会从各个方向找它的漏洞——往输入里塞恶意指令、往训练数据里掺毒、反复查询来"偷"模型、用肉眼看不出的扰动骗它犯错、甚至在模型里埋后门。这一章把这五类核心威胁拆开讲清楚:每一类怎么打、为什么能打成功、以及工程上怎么防。读完你会对"我的 AI 系统到底有哪些暴露面"有一个完整的判断,并能针对每一类给出防御对策。 学习目标 阅读完本章,你应当能够: 说出提示注入、数据投毒、模型窃取、对抗样本、后门攻击这五类威胁各自的攻击原理 针对每类威胁,列出至少两种工程上可落地的防御手段 解释为什么"单一防御必被绕过",并能设计一个多层纵深防御方案 看懂提示清洗、投毒检测、速率限制、对抗训练、激活分析这些技术的代码骨架
章节摘要:AI 系统上线后,攻击者会从各个方向找它的漏洞——往输入里塞恶意指令、往训练数据里掺毒、反复查询来"偷"模型、用肉眼看不出的扰动骗它犯错、甚至在模型里埋后门。这一章把这五类核心威胁拆开讲清楚:每一类怎么打、为什么能打成功、以及工程上怎么防。读完你会对"我的 AI 系统到底有哪些暴露面"有一个完整的判断,并能针对每一类给出防御对策。
阅读完本章,你应当能够:
AI 安全的本质不是"堵住一个洞",而是"认清一整条攻击链"——攻击者只要找到一个薄弱环节就够了,防御者却要守住所有环节。
聚焦当前 LLM 应用最常见、也最棘手的威胁:攻击者用一段精心构造的输入覆盖系统指令。这节拆解直接注入、间接注入、越狱的差别,并给出输入清洗、输出监控、分层隔离三道防线。
把两个"潜伏期长"的威胁放在一起:投毒污染训练数据让模型学到恶意模式,窃取靠反复查询复制你的模型。这节讲数据溯源、异常检测、速率限制、输出水印等手段。
聚焦"输入层和模型层"的攻击:对抗样本用微小扰动骗模型,后门在模型里埋触发器。这节讲对抗训练、输入预处理、激活分析、剪枝微调。
先认清"外部输入"这条最直接的攻击路径(1.1),再退一步看"数据和模型资产"是怎么被污染和窃取的(1.2),最后钻进"模型内部"看对抗扰动和后门(1.3)。三节从外到内,覆盖了 AI 系统的完整攻击面。
1.1 外部输入 ──► 1.2 数据与资产 ──► 1.3 模型内部 (提示注入) (投毒/窃取) (对抗/后门) │ │ │ └────────纵深防御──────────────────────┘
读完三节之后,还需要补一块"组织层面"的内容:防御不是一次性工程。攻击手法在演化,去年够用的清洗规则今年就会被新变体绕过,所以成熟团队会把攻防做成常态化机制。具体做法有三层。第一层是订阅威胁情报,OWASP 对 LLM 应用的十大风险清单每年更新,把它当作检查表逐项对照自己的系统,能低成本补盲区。第二层是内部红队,每季度安排专人用当期最新的攻击语料对新版本做渗透,成功绕过的案例一律沉淀进回归测试集,让同一个洞不被打穿第二次。第三层是漏洞赏金,把外部研究者纳入防御体系,成本可控且能覆盖内部视角的盲区。
这三层的投入要和资产价值匹配。做内部工具的团队,第一层加日志审计通常够;面向公众且接了工具调用的 Agent,三层都不能省。下面的矩阵把五类威胁和对应的检测信号、响应动作放在一张图里,可以直接当作值班手册的目录来用。

顺带说明本章与后续章节的分工边界。本章讲的防御都是"外功"——在模型之外加检测、加隔离、加监控;第 2 章的对齐是"内功"——让模型本身更难被诱导。两者不是替代关系:再好的对齐也挡不住精心构造的越狱,再严的过滤也会误伤正常请求,生产系统永远是内外兼修。读本章时可以带着一个问题:这一层的防御失效后,下一道防线在哪里?能回答这个问题,说明你不是在背清单,而是真的建立了纵深防御的思维。
本章各节代码骨架的公共依赖是一套日志埋点:输入原文哈希、命中的检测规则、模型的输出摘要、最终放行或拦截的决策,四项缺一不可。没有这套埋点,后面所有的监控和回溯都是空谈。动手复现示例前,先把埋点字段设计好,是性价比最高的准备工作。
再补一句关于工具链的准备:本章示例依赖的检测规则库和日志埋点,建议抽成独立的公共模块维护,别散落在各个应用里复制粘贴。规则库集中管理后,一次更新全系统生效,红队沉淀的新用例也能立刻变成全线防御,这是把本章内容规模化的前提。