偏见与 LLM 中的代表性伤害 本节摘要:Gallegos、Rossi、Barrow、Tanjim、Kim、Dernoncourt、Yu、Zhang、Ahmed(Computational Linguistics 2024,arXiv:2309.00770)。奠基性 2024 综述,区分代表性伤害(刻板印象、抹除)与分配性伤害(资源不平等分配),把评估指标分为基于嵌入、基于概率、基于生成文本三类。2024-2025 经验:An 等(PNAS Nexus,2025 年 3 月)跨 GPT-3.5 Turbo、GPT-4o、Gemini 1.5 Flash、Claude 3.5 Sonnet、Llama 3-70B,在 20 个入门级岗位的自动简历评估上测量交叉性别 × 种族偏见。
本节摘要:Gallegos、Rossi、Barrow、Tanjim、Kim、Dernoncourt、Yu、Zhang、Ahmed(Computational Linguistics 2024,arXiv:2309.00770)。奠基性 2024 综述,区分代表性伤害(刻板印象、抹除)与分配性伤害(资源不平等分配),把评估指标分为基于嵌入、基于概率、基于生成文本三类。2024-2025 经验:An 等(PNAS Nexus,2025 年 3 月)跨 GPT-3.5 Turbo、GPT-4o、Gemini 1.5 Flash、Claude 3.5 Sonnet、Llama 3-70B,在 20 个入门级岗位的自动简历评估上测量交叉性别 × 种族偏见。WinoIdentity(COLM 2025)为交叉身份引入基于不确定性的公平评估。Yu 与 Ananiadou 2025 在 MLP 层识别性别神经元;Ahsan 与 Wallace 2025 用 SAE 揭示临床种族偏见;Zhou 等 2024(UniBias)操纵注意力头去偏。元批评(arXiv:2508.11067):十年文献不成比例地聚焦二元性别偏见。
对应原课程:Phase 18 · Lesson 20 ·
bias-representational-harm(原英文phases/18-ethics-safety-alignment/20-bias-representational-harm/docs/en.md)。前置:Phase 05,Phase 18 · 01。
阅读完本节,你应当能够:
前面各节覆盖故意伤害(越狱、谋算)与安全治理。偏见是无意图涌现的伤害——来自训练数据分布、提示框架、累积设计选择。测量和降低它是与对抗鲁棒性不同的方法论挑战。
两者不同。一个模型可以「代表性无偏」(产出多元描绘)却「分配性有偏」(做不平等推荐)。评估需同时测两者。
「性别」轴的偏见评估会错过只在 (性别, 种族) 对上才触发的偏见。An 等 2025 发现 GPT-4o 在简历打分上对黑人女性的惩罚大于对黑人男性与白人女性单独的惩罚。单轴评估无法捕获。WinoIdentity(COLM 2025)引入基于不确定性的交叉公平——它测模型在交叉身份元组上的结果不确定性是否不同,而非仅点预测。这能抓住「模型在各群组上同样错,但对某些更不确定」的情况,而这会产出不同的下游分配行为。
2024-2025 可解释性工作把偏见打开到机制干预:
十年文献综述(arXiv:2508.11067,2025)发现领域不成比例聚焦二元性别偏见。其他轴——残障、宗教、移民身份、多语言身份——受关注远少。元批评主张,窄聚焦会通过忽视伤害边缘群体:一个在二元性别上良好去偏的模型,可能在无人检查的维度上严重有偏。
code/main.py 构造玩具基于嵌入的偏见探针:在简单共现嵌入上测身份词与属性词的 WEAT 形距离。你可以注入偏见、观察指标触发;施加简单去偏操作、观察部分恢复。
def weat_score(embed, identity_terms, attribute_terms): # 身份词与属性词的统计关联强度 return association(embed, identity_terms, attribute_terms) def debias(embed, direction): # 移除嵌入中的性别方向 return embed - projection(embed, direction)
💡 关键观察:WEAT 形指标在去偏后不会降到零——因为偏见既在显式方向上,也在残余统计关联里。这就是为什么生产去偏必须多层叠加:嵌入去偏 + 概率侧约束 + 生成文本下游评估,且必须覆盖交叉性。
| 指标类别 | 测什么 | 强项 | 局限 |
|---|---|---|---|
| 嵌入(WEAT) | 表征关联 | 简单、可解释 | 测表征不测行为 |
| 概率(对数似然) | 解码端行为偏见 | 捕获部分行为 | 仍非真实下游 |
| 生成文本 | 下游任务(简历/对话) | 最具生态效度 | 最难复现 |
| 机制(神经元/SAE/注意力) | 内部偏见载体 | 可干预 | 机制≠全部行为 |
设计要点:三类指标互补——嵌入测表征、概率测解码行为、生成文本测下游生态效度。机制方法(神经元/SAE/注意力)提供可干预的偏见载体,但机制消融≠全部去偏。交叉性必须贯穿三类,否则会错过单轴评估看不见的偏见。
本节产出 outputs/skill-bias-eval.md:给它一份模型卡或公平性主张,它跨三类指标(嵌入、概率、生成文本)审计评估、检查交叉性覆盖、检查任何去偏干预的机制。
code/main.py 是独立玩具,共现嵌入可换成真实模型嵌入,WEAT + 去偏逻辑不变。
Easy:运行 code/main.py,报告去偏前后的 WEAT 形偏见分数,解释为什么指标不降到零。
Medium:给探针加一个交叉测试:(性别, 种族) × (职业, 家庭)。报告跨轴偏见分数。
Medium:读 An 等 2025(PNAS Nexus),识别他们报告的两个单轴性别评估会错过的交叉效应。
Hard:Yu 与 Ananiadou 2025 识别性别神经元。草拟一个证伪实验,区分「这些神经元造成性别偏见」与「这些神经元相关于性别偏见」。
Hard:元批评主张领域过窄聚焦二元性别。选一个研究不足的轴,描述其代表性伤害测量协议。
下一节,我们从「测偏见」转向「定义公平标准」——群体公平、个体公平、反事实公平,以及它们为何不可能同时满足。