附录 术语表 本附录汇总全教程出现的关键术语,按主题分组,便于查阅与 SEO。每个术语给出中文、英文和简短释义。 AI 安全攻防 术语(English) | 释义 提示注入(Prompt Injection) | 攻击者通过构造输入覆盖模型系统指令,诱导其执行非预期操作 直接注入(Direct Injection) | 用户在对话框直接输入恶意指令覆盖系统提示 间接注入(Indirect Injection) | 攻击载荷藏在模型读取的外部数据(网页、文档)里 越狱(Jailbreak) | 用角色扮演、编码等手段绕过模型的安全限制 数据投毒(Data Poisoning) | 攻击者污染训练数据,使模型学到恶意模式 标签翻转(Label Flipping) |
本附录汇总全教程出现的关键术语,按主题分组,便于查阅与 SEO。每个术语给出中文、英文和简短释义。
| 术语(English) | 释义 |
|---|---|
| 提示注入(Prompt Injection) | 攻击者通过构造输入覆盖模型系统指令,诱导其执行非预期操作 |
| 直接注入(Direct Injection) | 用户在对话框直接输入恶意指令覆盖系统提示 |
| 间接注入(Indirect Injection) | 攻击载荷藏在模型读取的外部数据(网页、文档)里 |
| 越狱(Jailbreak) | 用角色扮演、编码等手段绕过模型的安全限制 |
| 数据投毒(Data Poisoning) | 攻击者污染训练数据,使模型学到恶意模式 |
| 标签翻转(Label Flipping) | 把训练样本的正确标签改成错误标签 |
| 后门攻击(Backdoor Attack) | 训练时植入触发器,正常输入下表现正常,触发器出现时作恶 |
| 模型窃取(Model Extraction) | 通过反复查询 API 复制模型或推断训练数据 |
| 对抗样本(Adversarial Example) | 给输入加肉眼难辨的扰动让模型预测错误 |
| FGSM(快速梯度符号法) | 一步沿梯度符号方向加扰动的对抗攻击 |
| PGD(投影梯度下降) | 多步迭代、每步投影回允许范围的强对抗攻击 |
| 对抗训练(Adversarial Training) | 把对抗样本加入训练集提升模型鲁棒性 |
| 模型水印(Model Watermarking) | 在模型里嵌入隐蔽的所有权标识用于事后追责 |
| 红队测试(Red Teaming) | 模拟攻击者发现系统漏洞的结构化测试 |
| 术语(English) | 释义 |
|---|---|
| 对齐(Alignment) | 让 AI 系统的行为符合人类意图、价值观和行为规范 |
| RLHF(强化学习人类反馈) | 用人类偏好数据训练奖励模型,再用 PPO 优化策略 |
| SFT(有监督微调) | 用人类编写的高质量对话数据微调预训练模型 |
| 奖励模型(Reward Model) | 从偏好数据学习、能给任意回答打分的模型 |
| PPO(近端策略优化) | RLHF 第三阶段用的强化学习算法 |
| 奖励黑客(Reward Hacking) | 模型钻奖励模型漏洞生成高分但无意义内容 |
| KL 约束(KL Constraint) | 用参考模型限制策略漂移,防止 reward hacking |
| RLAIF(AI 反馈强化学习) | 用 AI 模型当裁判替代人类做偏好标注 |
| 宪法 AI(Constitutional AI) | 用一套显式原则让模型自我批评、自我修订 |
| DPO(直接偏好优化) | 跳过奖励模型,直接用偏好数据优化策略 |
| HHH(有用诚实无害) | 评估对齐效果的三个维度 |
| 术语(English) | 释义 |
|---|---|
| 可解释性(Interpretability) | 能说清模型为什么做出某个预测的能力 |
| 全局解释(Global Explanation) | 解释模型整体行为(如特征重要性排序) |
| 局部解释(Local Explanation) | 解释单次预测(如这个样本为什么被这样分类) |
| 内在可解释(Intrinsic) | 模型结构本身透明(决策树、线性回归) |
| 事后可解释(Post-hoc) | 用外部工具解释黑盒模型(SHAP、LIME) |
| SHAP(SHapley Additive exPlanations) | 基于 Shapley 值的特征归因方法 |
| Shapley 值(Shapley Value) | 博弈论中公平分配贡献的方法 |
| TreeSHAP | SHAP 针对树模型的高效变体 |
| DeepSHAP | SHAP 针对深度学习的变体 |
| LIME(局部可解释模型无关解释) | 在局部用线性模型近似黑盒的解释方法 |
| 注意力可视化(Attention Visualization) | 可视化 Transformer 注意力权重推断决策依据 |
| 排列重要性(Permutation Importance) | 打乱特征看性能下降多少来衡量重要性 |
| 部分依赖图(PDP) | 展示特征取值对预测的趋势影响 |
| 反事实解释(Counterfactual) | 告诉用户改什么能让预测改变 |
| 术语(English) | 释义 |
|---|---|
| 统计均等(Demographic Parity) | 不同群体获得正结果的概率相等 |
| 机会均等(Equalized Odds) | 真实标签相同时不同群体预测率相等 |
| 校准公平性(Calibration Fairness) | 相同预测分数下不同群体真实概率相等 |
| 差异影响(Disparate Impact) | 特权与非特权群体正结果率之比,阈值 0.8 |
| Theil 指数 | 衡量结果分配不平等的指标,0 为完全平等 |
| 代理变量(Proxy Variable) | 和受保护属性高度相关的间接特征(邮编代种族) |
| 反馈循环偏见 | 模型输出影响未来数据导致偏见自我强化 |
| 重采样(Resampling) | 过采样少数群体或欠采样多数群体平衡数据 |
| 重加权(Reweighing) | 给少数群体样本更高权重 |
| 对抗去偏见(Adversarial Debiasing) | 用对抗网络学习去除敏感信息的公平表示 |
| 术语(English) | 释义 |
|---|---|
| 欧盟 AI 法案(EU AI Act) | 全球第一部全面 AI 法规,按风险分级管理 |
| 风险分级(Risk-based Classification) | 按 AI 用途风险分不可接受/高/有限/最小四档 |
| 算法备案(Algorithm Filing) | 中国要求有舆论属性的算法服务上线前备案 |
| 深度合成(Deep Synthesis) | 用 AI 生成或篡改文本、图像、音视频 |
| NIST AI RMF | 美国 AI 风险管理框架(治理/映射/衡量/管理) |
| CE 标记 | 欧盟产品符合性认证标识 |
| 数据本地化(Data Localization) | 要求数据存储在特定司法管辖区内 |
| GDPR | 欧盟通用数据保护条例 |
| DPIA(数据保护影响评估) | 评估系统对个人数据权益的影响 |
| ISO/IEC 42001 | AI 管理系统国际标准 |
记忆口诀:安全防攻、对齐正行、解释透明、公平无偏、合规落地——这五个词串起了可信赖 AI 的全貌。
术语表不该只是查词的工具,顺着术语之间的依赖关系复习,效率比逐条背高得多。这里给出三条复习线。第一条线沿"攻击→防御"展开:先理解提示注入的机理(指令与数据同流),再看它派生的防御词汇——输入清洗、分层隔离、输出监控,最后到间接注入这个高阶概念,你会发现 RAG 检索链路里的每一个词汇都挂在这条线上。第二条线沿"对齐技术演进"展开:SFT 是基线,RLHF 引入奖励模型和 KL 约束,RLAIF 把裁判换成 AI,宪法 AI 把偏好显式化为原则,DPO 又把整条 RL 流水线压成直接优化——每个新词都是对前一个词汇某个痛点的回应,记住痛点就记住了词。第三条线沿"证据链"展开:公平性指标、SHAP 值、反事实解释、模型卡、审计日志,这一串词汇的共同主题是"把模型行为变成可核查的证据",它们最终都汇入合规词汇表。
背术语时还要注意一词多义的坑。"校准"在可解释性语境里指预测概率与真实频率的一致,在公平性语境里指不同群体分数含义的一致,两回事;"对齐"有时指 RLHF 全家桶,有时特指价值对齐研究,读论文时要看上下文;"水印"在模型窃取语境是防御手段,在深度合成语境是合规标识义务,方向完全不同。遇到这类词,建议在自己的笔记里给它们建"语境卡片",把两种含义各自的使用场景记在一起,比分开记两遍更牢。
最后提醒:这个领域术语更新极快,新词的半衰期可能只有一两年。比记住当前这批术语更重要的,是建立"这个词解决什么问题"的追问习惯——任何新术语冒出来,先问它针对哪个旧概念的什么缺陷,答案找到了,词也就自然会用了。
除了词条本身,面试和实战里更常考的是术语之间的搭配关系,这里补一组高频搭配。攻击侧的组合:"间接注入"常与"检索增强生成"同现,因为检索链路正是外部数据进入模型的通道;"数据投毒"常与"供应链"搭配,强调污染发生在数据采集上游;"模型窃取"常与"蒸馏"搭配,攻击者用目标模型的输出当教师信号训练替代品。防御侧的组合:"纵深防御"与"单点失效"成对出现,前者是解药后者是病症;"速率限制"与"熵值检测"搭配使用,前者挡量后者挡系统性遍历。对齐侧:"奖励黑客"与"古德哈特定律"是一对理论搭档——指标变成目标就不再是好指标;"对齐税"与"过度拒绝"经常被一起讨论,都是对齐过头的代价。
监管侧的搭配更多是制度性的:"风险分级"与"比例原则"搭配,义务轻重与风险大小相称是欧盟法案的骨架逻辑;"算法备案"与"安全评估"是中国体系的两个抓手,前者管透明度后者管上线门槛;"技术事实库"与"一份证据多辖区复用"是本章提出的工程实践搭配。可解释性侧:"局部保真"与"全局一致"是解释方法的一对矛盾指标,LIME 强在前者弱在后者;"反事实解释"与"行动指引"搭配,因为反事实的价值正在于告诉用户改变什么能改变结果。把这十几组搭配记熟,读任何一篇这个领域的文章或论文,术语障碍基本就清除了,这也是把附录当复习资料用的正确姿势。
这个领域的文献以英文为主,中文译法不统一,这里给一组对照,读二手资料时能少踩混乱。Alignment 或译"对齐"或译"校准",规范用法是对齐,校准留给 calibration。Jailbreak 通译"越狱",也有文献写"逃逸",前者更通行。Red teaming 直译"红队测试",含义 borrowed 自传统安全评估,指结构化的对抗性测试。Constitutional AI 有"宪法式人工智能"与"宪法 AI"两种写法,语义相同。Reward hacking 或译"奖励作弊"或译"奖励黑客",前者更达意。Data poisoning 译"数据投毒"已基本统一,早期文献里的"数据污染"现在多指分布偏移,注意区分。Model extraction 译"模型抽取"或"模型窃取",窃取更贴近攻击语义。Equalized odds 译"机会均等"或"均等化几率",本书用前者。掌握这组对照,中英文资料之间的切换就基本无碍了。
另一个建议是为团队维护本地词表:遇到新术语,登记英文原词、选定中文译法、一句话定义、首次出现的资料出处,放在内部知识库里滚动更新。术语统一看似小事,却在跨团队沟通里省掉大量歧义成本——安全团队说的"加固"和算法团队说的"加固"如果指的不是一回事,会议能多开一小时。
把术语背熟只是第一步,这个领域的实战考验的是用术语支撑判断的能力。这里给出几个典型判断题,供自测。第一题:产品经理说"我们的模型加了内容过滤,所以没有提示注入风险",这个论断错在哪?答案是混淆了单点防御和纵深防御——过滤是输入清洗的一种,挡不住间接注入和编码变体,风险仍在。第二题:审计问"你们如何证明模型对男女申请人公平",标准答案应该包含什么?至少三件东西:受保护属性或代理的定义、选用的公平指标及选择依据、分组指标的实际数值与趋势,缺一件都是漏洞。第三题:新模型在安全基准上分数很高,可以放松线上防御吗?不可以——基准集静态、攻击者动态,基准分高只说明旧攻击手法覆盖好,对新攻击没有任何承诺。
这三个判断题的共同点是:正确答案都不是"是或否",而是"用什么证据、在什么边界内成立"。这正是这个领域思维方式的精髓——所有安全声明都是限定声明,所有公平结论都是条件结论。能习惯性地给结论加边界条件的人,才算真正入门了 AI 安全与对齐。
最后交代术语表的维护方式:建议每季度通读一遍,划掉已经不再使用的词,补上期间冒出的新词,并同步更新内部的本地词表。语言是这个领域变化最快的表层,保持术语的新鲜度,本质上是在保持对领域动态的敏感度——这份敏感,往往是安全事件来临前唯一的预警。