附录 术语表


文档摘要

附录 术语表 本附录汇总全教程出现的关键术语,按主题分组,便于查阅与 SEO。每个术语给出中文、英文和简短释义。 AI 安全攻防 术语(English) | 释义 提示注入(Prompt Injection) | 攻击者通过构造输入覆盖模型系统指令,诱导其执行非预期操作 直接注入(Direct Injection) | 用户在对话框直接输入恶意指令覆盖系统提示 间接注入(Indirect Injection) | 攻击载荷藏在模型读取的外部数据(网页、文档)里 越狱(Jailbreak) | 用角色扮演、编码等手段绕过模型的安全限制 数据投毒(Data Poisoning) | 攻击者污染训练数据,使模型学到恶意模式 标签翻转(Label Flipping) |

附录 术语表

本附录汇总全教程出现的关键术语,按主题分组,便于查阅与 SEO。每个术语给出中文、英文和简短释义。

AI 安全攻防

术语(English) 释义
提示注入(Prompt Injection) 攻击者通过构造输入覆盖模型系统指令,诱导其执行非预期操作
直接注入(Direct Injection) 用户在对话框直接输入恶意指令覆盖系统提示
间接注入(Indirect Injection) 攻击载荷藏在模型读取的外部数据(网页、文档)里
越狱(Jailbreak) 用角色扮演、编码等手段绕过模型的安全限制
数据投毒(Data Poisoning) 攻击者污染训练数据,使模型学到恶意模式
标签翻转(Label Flipping) 把训练样本的正确标签改成错误标签
后门攻击(Backdoor Attack) 训练时植入触发器,正常输入下表现正常,触发器出现时作恶
模型窃取(Model Extraction) 通过反复查询 API 复制模型或推断训练数据
对抗样本(Adversarial Example) 给输入加肉眼难辨的扰动让模型预测错误
FGSM(快速梯度符号法) 一步沿梯度符号方向加扰动的对抗攻击
PGD(投影梯度下降) 多步迭代、每步投影回允许范围的强对抗攻击
对抗训练(Adversarial Training) 把对抗样本加入训练集提升模型鲁棒性
模型水印(Model Watermarking) 在模型里嵌入隐蔽的所有权标识用于事后追责
红队测试(Red Teaming) 模拟攻击者发现系统漏洞的结构化测试

对齐技术

术语(English) 释义
对齐(Alignment) 让 AI 系统的行为符合人类意图、价值观和行为规范
RLHF(强化学习人类反馈) 用人类偏好数据训练奖励模型,再用 PPO 优化策略
SFT(有监督微调) 用人类编写的高质量对话数据微调预训练模型
奖励模型(Reward Model) 从偏好数据学习、能给任意回答打分的模型
PPO(近端策略优化) RLHF 第三阶段用的强化学习算法
奖励黑客(Reward Hacking) 模型钻奖励模型漏洞生成高分但无意义内容
KL 约束(KL Constraint) 用参考模型限制策略漂移,防止 reward hacking
RLAIF(AI 反馈强化学习) 用 AI 模型当裁判替代人类做偏好标注
宪法 AI(Constitutional AI) 用一套显式原则让模型自我批评、自我修订
DPO(直接偏好优化) 跳过奖励模型,直接用偏好数据优化策略
HHH(有用诚实无害) 评估对齐效果的三个维度

可解释 AI

术语(English) 释义
可解释性(Interpretability) 能说清模型为什么做出某个预测的能力
全局解释(Global Explanation) 解释模型整体行为(如特征重要性排序)
局部解释(Local Explanation) 解释单次预测(如这个样本为什么被这样分类)
内在可解释(Intrinsic) 模型结构本身透明(决策树、线性回归)
事后可解释(Post-hoc) 用外部工具解释黑盒模型(SHAP、LIME)
SHAP(SHapley Additive exPlanations) 基于 Shapley 值的特征归因方法
Shapley 值(Shapley Value) 博弈论中公平分配贡献的方法
TreeSHAP SHAP 针对树模型的高效变体
DeepSHAP SHAP 针对深度学习的变体
LIME(局部可解释模型无关解释) 在局部用线性模型近似黑盒的解释方法
注意力可视化(Attention Visualization) 可视化 Transformer 注意力权重推断决策依据
排列重要性(Permutation Importance) 打乱特征看性能下降多少来衡量重要性
部分依赖图(PDP) 展示特征取值对预测的趋势影响
反事实解释(Counterfactual) 告诉用户改什么能让预测改变

公平性

术语(English) 释义
统计均等(Demographic Parity) 不同群体获得正结果的概率相等
机会均等(Equalized Odds) 真实标签相同时不同群体预测率相等
校准公平性(Calibration Fairness) 相同预测分数下不同群体真实概率相等
差异影响(Disparate Impact) 特权与非特权群体正结果率之比,阈值 0.8
Theil 指数 衡量结果分配不平等的指标,0 为完全平等
代理变量(Proxy Variable) 和受保护属性高度相关的间接特征(邮编代种族)
反馈循环偏见 模型输出影响未来数据导致偏见自我强化
重采样(Resampling) 过采样少数群体或欠采样多数群体平衡数据
重加权(Reweighing) 给少数群体样本更高权重
对抗去偏见(Adversarial Debiasing) 用对抗网络学习去除敏感信息的公平表示

监管合规

术语(English) 释义
欧盟 AI 法案(EU AI Act) 全球第一部全面 AI 法规,按风险分级管理
风险分级(Risk-based Classification) 按 AI 用途风险分不可接受/高/有限/最小四档
算法备案(Algorithm Filing) 中国要求有舆论属性的算法服务上线前备案
深度合成(Deep Synthesis) 用 AI 生成或篡改文本、图像、音视频
NIST AI RMF 美国 AI 风险管理框架(治理/映射/衡量/管理)
CE 标记 欧盟产品符合性认证标识
数据本地化(Data Localization) 要求数据存储在特定司法管辖区内
GDPR 欧盟通用数据保护条例
DPIA(数据保护影响评估) 评估系统对个人数据权益的影响
ISO/IEC 42001 AI 管理系统国际标准

记忆口诀:安全防攻、对齐正行、解释透明、公平无偏、合规落地——这五个词串起了可信赖 AI 的全貌。

学习与复习建议

术语表不该只是查词的工具,顺着术语之间的依赖关系复习,效率比逐条背高得多。这里给出三条复习线。第一条线沿"攻击→防御"展开:先理解提示注入的机理(指令与数据同流),再看它派生的防御词汇——输入清洗、分层隔离、输出监控,最后到间接注入这个高阶概念,你会发现 RAG 检索链路里的每一个词汇都挂在这条线上。第二条线沿"对齐技术演进"展开:SFT 是基线,RLHF 引入奖励模型和 KL 约束,RLAIF 把裁判换成 AI,宪法 AI 把偏好显式化为原则,DPO 又把整条 RL 流水线压成直接优化——每个新词都是对前一个词汇某个痛点的回应,记住痛点就记住了词。第三条线沿"证据链"展开:公平性指标、SHAP 值、反事实解释、模型卡、审计日志,这一串词汇的共同主题是"把模型行为变成可核查的证据",它们最终都汇入合规词汇表。

背术语时还要注意一词多义的坑。"校准"在可解释性语境里指预测概率与真实频率的一致,在公平性语境里指不同群体分数含义的一致,两回事;"对齐"有时指 RLHF 全家桶,有时特指价值对齐研究,读论文时要看上下文;"水印"在模型窃取语境是防御手段,在深度合成语境是合规标识义务,方向完全不同。遇到这类词,建议在自己的笔记里给它们建"语境卡片",把两种含义各自的使用场景记在一起,比分开记两遍更牢。

最后提醒:这个领域术语更新极快,新词的半衰期可能只有一两年。比记住当前这批术语更重要的,是建立"这个词解决什么问题"的追问习惯——任何新术语冒出来,先问它针对哪个旧概念的什么缺陷,答案找到了,词也就自然会用了。

高频搭配速查

除了词条本身,面试和实战里更常考的是术语之间的搭配关系,这里补一组高频搭配。攻击侧的组合:"间接注入"常与"检索增强生成"同现,因为检索链路正是外部数据进入模型的通道;"数据投毒"常与"供应链"搭配,强调污染发生在数据采集上游;"模型窃取"常与"蒸馏"搭配,攻击者用目标模型的输出当教师信号训练替代品。防御侧的组合:"纵深防御"与"单点失效"成对出现,前者是解药后者是病症;"速率限制"与"熵值检测"搭配使用,前者挡量后者挡系统性遍历。对齐侧:"奖励黑客"与"古德哈特定律"是一对理论搭档——指标变成目标就不再是好指标;"对齐税"与"过度拒绝"经常被一起讨论,都是对齐过头的代价。

监管侧的搭配更多是制度性的:"风险分级"与"比例原则"搭配,义务轻重与风险大小相称是欧盟法案的骨架逻辑;"算法备案"与"安全评估"是中国体系的两个抓手,前者管透明度后者管上线门槛;"技术事实库"与"一份证据多辖区复用"是本章提出的工程实践搭配。可解释性侧:"局部保真"与"全局一致"是解释方法的一对矛盾指标,LIME 强在前者弱在后者;"反事实解释"与"行动指引"搭配,因为反事实的价值正在于告诉用户改变什么能改变结果。把这十几组搭配记熟,读任何一篇这个领域的文章或论文,术语障碍基本就清除了,这也是把附录当复习资料用的正确姿势。

版本与翻译对照

这个领域的文献以英文为主,中文译法不统一,这里给一组对照,读二手资料时能少踩混乱。Alignment 或译"对齐"或译"校准",规范用法是对齐,校准留给 calibration。Jailbreak 通译"越狱",也有文献写"逃逸",前者更通行。Red teaming 直译"红队测试",含义 borrowed 自传统安全评估,指结构化的对抗性测试。Constitutional AI 有"宪法式人工智能"与"宪法 AI"两种写法,语义相同。Reward hacking 或译"奖励作弊"或译"奖励黑客",前者更达意。Data poisoning 译"数据投毒"已基本统一,早期文献里的"数据污染"现在多指分布偏移,注意区分。Model extraction 译"模型抽取"或"模型窃取",窃取更贴近攻击语义。Equalized odds 译"机会均等"或"均等化几率",本书用前者。掌握这组对照,中英文资料之间的切换就基本无碍了。

另一个建议是为团队维护本地词表:遇到新术语,登记英文原词、选定中文译法、一句话定义、首次出现的资料出处,放在内部知识库里滚动更新。术语统一看似小事,却在跨团队沟通里省掉大量歧义成本——安全团队说的"加固"和算法团队说的"加固"如果指的不是一回事,会议能多开一小时。

从术语到判断力

把术语背熟只是第一步,这个领域的实战考验的是用术语支撑判断的能力。这里给出几个典型判断题,供自测。第一题:产品经理说"我们的模型加了内容过滤,所以没有提示注入风险",这个论断错在哪?答案是混淆了单点防御和纵深防御——过滤是输入清洗的一种,挡不住间接注入和编码变体,风险仍在。第二题:审计问"你们如何证明模型对男女申请人公平",标准答案应该包含什么?至少三件东西:受保护属性或代理的定义、选用的公平指标及选择依据、分组指标的实际数值与趋势,缺一件都是漏洞。第三题:新模型在安全基准上分数很高,可以放松线上防御吗?不可以——基准集静态、攻击者动态,基准分高只说明旧攻击手法覆盖好,对新攻击没有任何承诺。

这三个判断题的共同点是:正确答案都不是"是或否",而是"用什么证据、在什么边界内成立"。这正是这个领域思维方式的精髓——所有安全声明都是限定声明,所有公平结论都是条件结论。能习惯性地给结论加边界条件的人,才算真正入门了 AI 安全与对齐。

最后交代术语表的维护方式:建议每季度通读一遍,划掉已经不再使用的词,补上期间冒出的新词,并同步更新内部的本地词表。语言是这个领域变化最快的表层,保持术语的新鲜度,本质上是在保持对领域动态的敏感度——这份敏感,往往是安全事件来临前唯一的预警。


作者与出处
原作者: 灏天文库智能体
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库智能体 转发
评论区 (0)
U