4.5 技术陪审席新开审:人工智能的旧问新审


4.5 技术陪审席新开审:人工智能的旧问新审

本节摘要:算法进入保释、招聘、信贷与量刑建议的名单,等于把一份"无需签名的高风险裁量权"交给了系统。本节证明:本教程的老工具——证据分级、责任链条、平庸之恶、区分性原则——在新案上全部适用,并用一桩再犯风险评估算法的实测争议做完整过堂。

庭前准备:学习目标

  1. 说出算法裁量与人类裁量的三个结构差异——规模、速度、可问责性的错位;
  2. 用"错误率公平"与"校准公平"的不可兼得,解释算法争议为何总在数据里打转;
  3. 拿着历史类比检验表,判断哪些旧案可以平移到人工智能案上,哪些类比会失效。

新瓶旧酒:为什么老工具还锋利

人工智能案的表象是新的——模型、参数、训练数据——但把案情剥开,内核仍是老问题。算法给被告打"风险分",这活儿过去由坏法官做,曾有一份臭名昭著的问卷替法官把偏见标准化;算法隐藏在"技术中立"的外衣下,这外衣我们在风险滞后案里见过同款;算法出错没人负责,这是平庸之恶的机器版——不思考的服从被升级为根本无需思考。结构差异有三处值得点名:规模,一个模型一晚上能给十万人打分,个体偏见升格为系统偏见;速度,受害人还没反应过来,批量裁决已经执行完毕;可问责性,决策链条被拆散在数据标注者、模型训练者、采购决策者与使用者之间,每只手都只碰了一小段,责任像水银一样从指缝漏走。老工具的任务就是把这摊水银重新聚起来。

审计点一至六:模型流水线的每一段都对应一件老工具——数据核验、代理变量甄别、比例性论证、责任链条。

演练:一个风险分的过堂

背景:某国的多个司法辖区采购了一款商用再犯风险评估问卷的算法版:答题数十道,输出一名被告的再犯风险分,法官在保释与量刑听证时参照使用。采购逻辑动听:比人类法官的直觉更稳定、更不带偏见。操作:一家新闻机构获取了数千名真实被告的档案与后续两年的实际记录,做了一次此前无人做过的核算——按种族分组统计错误率。结果两处扎眼:黑人被告中被误标为"高风险"的比例约为白人被告的两倍;而白人被告中真正再犯却被标为"低风险"的漏网率也显著更高。算法供应商随即反驳:把"是否再犯"作为预测目标时,模型在每组内部的分数校准都是准的——同分者再犯率确实接近。双方的数据竟都成立。结果:争议进入学术与司法界持续发酵,多州立法要求算法影响评估,部分辖区停用商业风险分。结果之外的解读是全案最精彩的部分:两个统计事实同时为真,是因为两组的基线再犯率不同——当被捕记录本身已浸透历史执法偏差(同样的行为,某些街区被巡逻得更密),"尽量预测被捕"的模型就会把执法偏差再学习一遍、放大一遍。义务论的判词随之出炉:用历史不正义的数据预测个体未来,等于让过去替未来签发判决;此案的责任链条也能逐段追出——采购者选择了这把尺,建模者优化了那个目标,使用者引用了那个分数,平庸之恶四散于流水线。变式:把同样的审计动作平移到招聘筛选与信贷额度模型上,套路一致——换掉分组变量与结果变量即可。变式同时划出类比失效的边界:医疗辅助诊断模型若以"总体准确率优先",其伦理结构与保释案相似;而纯属娱乐推荐的排序算法,即使也有偏差,道德权重不可同日而语。类比的强度随后果的不可逆性递增——这是历史类比检验表里最核心的一条。

两个统计事实为何能同时为真,用一段代码演示一遍胜过千言。

# "校准公平"与"错误率公平"为何不可兼得(示意演算) def audit(group_base_rate, threshold_score): """group_base_rate: 该组的真实再犯基线率 threshold_score: 打分阈值。示意逻辑:分数以基线率为中心摆动""" import random random.seed(7) n = 4000 high_risk_flag = [] for _ in range(n): true_recid = random.random() < group_base_rate # 简化:分数围绕真实再犯概率波动,加一点噪声 score = group_base_rate + random.uniform(-0.18, 0.18) high_risk_flag.append((score >= threshold_score, true_recid)) flagged = [f for f, t in high_risk_flag if f] false_pos = [f for f, t in high_risk_flag if f and not t] false_neg = [f for f, t in high_risk_flag if not f and t] return (len(false_pos) / max(len(flagged), 1), len(false_neg) / max(n - len(flagged), 1)) fp_a, fn_a = audit(group_base_rate=0.5, threshold_score=0.55) fp_b, fn_b = audit(group_base_rate=0.25, threshold_score=0.55) print(f"高基线组 误报率 {fp_a:.0%} 漏报率 {fn_a:.0%}") print(f"低基线组 误报率 {fp_b:.0%} 漏报率 {fn_b:.0%}") # 读法:同一个阈值,两组的误报与漏报天然不均—— # 要抹平错误率差异,就得放弃跨组同分同义(校准)。 # 这是数学上的紧张,不是工程没做好。

老工具平移到新案前,先过一遍类比检验,防止"历史押韵"变成历史硬套。

# 历史类比检验表(旧案平移新案前必过) 第1问 结构同源吗 旧案的因果结构(收益归谁 风险归谁 责任散在谁手里) 与新案是否同构 —— 而非仅表面相似 第2问 后果同量级吗 不可逆性、受害面、纠错窗口三项目逐项比量级 第3问 当时立的规矩解决了吗 旧案催生的规则(知情同意 区分性 举证前置) 在新案语境里是否已有对应物 第4问 类比用在哪一侧 同一类比可同时被两造引用(如"都像流感") —— 说明它只提供框架不提供结论 # 四问过完,类比才能写进裁量书;否则只配写在脚注里。

合议要点回顾

  • 算法裁量的新意只在规模与速度,责任散布与"中立外衣"都是旧相识;
  • 校准公平与错误率公平在数学上紧张,只报其中一个指标本身就是立场;
  • 历史偏差的数据会教会模型重复偏差:用过去的记录预测未来,先审过去;
  • 类比须经四问检验:结构同源、后果同量级、规则有对应、两造皆可用才入裁量。

第四章五案全部收庭。走下这层法庭前,把五份案卷叠好——下一章,你要带着它们回到自己的时代,并且亲自主持一场审议。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U