第 4 章 · AI 公平性与去偏见 章节摘要:AI 系统的不公平,往往不是谁故意为之,而是数据和算法在不知不觉中放大了历史的、社会的偏见。一个招聘 AI 可能偏好男性候选人,一个信贷模型可能对少数族裔更严苛,一个司法评估系统可能高估某些群体的再犯风险——这些偏见一旦进入生产,轻则引发公关危机,重则违法。本章从偏见的来源讲起(数据、算法、部署三个层面),重点拆解统计均等、机会均等等公平性指标的数学定义和代码实现,再到用 Fairlearn 和 AIF360 两个主流工具检测偏见,最后落到预处理、训练中、后处理三种去偏见技术和招聘、信贷、司法的真实落地案例。
章节摘要:AI 系统的不公平,往往不是谁故意为之,而是数据和算法在不知不觉中放大了历史的、社会的偏见。一个招聘 AI 可能偏好男性候选人,一个信贷模型可能对少数族裔更严苛,一个司法评估系统可能高估某些群体的再犯风险——这些偏见一旦进入生产,轻则引发公关危机,重则违法。本章从偏见的来源讲起(数据、算法、部署三个层面),重点拆解统计均等、机会均等等公平性指标的数学定义和代码实现,再到用 Fairlearn 和 AIF360 两个主流工具检测偏见,最后落到预处理、训练中、后处理三种去偏见技术和招聘、信贷、司法的真实落地案例。
阅读完本章,你应当能够:
公平性不是"把模型调平等",而是"认清偏见从哪来、用对指标量它、在正确的环节干预它"。
拆解偏见在数据、算法、部署三层的来源,重点讲统计均等、机会均等、校准公平性、Theil 指数四个核心指标的数学定义和代码实现——以及它们之间为什么常常互相冲突。
讲 Fairlearn(微软)和 AIF360(IBM)两个主流偏见检测工具库的用法,包括按群体分解指标、差异影响计算、阈值优化。
讲预处理(重采样、重加权)、训练中(公平约束、对抗去偏见)、后处理(阈值优化)三种去偏见技术,配招聘、信贷、司法三个真实案例。
先认清偏见从哪来、怎么量它(4.1),再用工具把检测自动化(4.2),最后在不同环节实施去偏见并看真实案例怎么落地(4.3)。
4.1 来源+指标 ──► 4.2 工具检测 ──► 4.3 去偏见+案例 (理论) (工程化) (落地)
技术之外,公平性项目成败更多取决于组织安排。第一个现实是:公平性指标没有免费午餐,统计均等和校准公平在基率不同的群体间数学上不可兼得,所以"选哪个指标"本质是价值判断而非技术判断。这个判断不该由算法工程师悄悄做,而应该有业务和法务参与、留下书面记录——将来被质疑时,"我们为什么选机会均等而不是统计均等"这份文档就是你的辩护材料。
第二个现实是:去偏见有代价,而且代价常常落在准确率之外的地方。重采样会稀释少数群体里有信息量的样本,公平约束可能让所有群体的通过率都下降。工程上合理的做法是把公平指标当作和 AUC 并列的一等公民指标放进评估报表,每次迭代都同时看两边,而不是等出事再补。第三个现实是公平性会漂移:用户群体构成、经济环境、甚至前端交互改版都会让原本达标的指标失衡,所以分组指标必须进监控大盘,配告警阈值,而不是一年审一次。

本章的阅读心态也要摆正:公平性工作是持续的管理行为,不是一次性的技术修复。读完三节你会掌握指标、工具、干预手段,但真正决定项目成败的是把它们变成流程——指标进看板、检测进流水线、干预决策留记录。建议边读边问自己三个问题:我的系统里受保护属性是什么(或者它的代理是什么)、我选的公平指标为什么是它、出问题后谁来负责重训。这三个问题都有答案,公平性工作才算落地。没有答案也不必焦虑,说明你发现了下一个季度该做的事。
还有一个跨章的连接点值得点出:公平性的分组分析和第 3 章的可解释性是天然搭档。分组指标发现差异后,解释工具能回答"差异来自哪些特征"——如果贡献靠前的特征恰是受保护属性的代理,去偏见的靶点就找到了。只会算指标不会归因的团队,往往在错误的层面上浪费干预预算。
再强调一次度量的粒度:分组之下还有交叉分组,性别与年龄、地域与语言的交叉处往往藏着最不公平的亚群体,而单维分组指标完全看不见它们。算力允许时把关键交叉维度也纳入看板,是低成本高回报的补充。