本节摘要:系统性风险来自系统与人、市场、其他算法的耦合,设计者未预见的后果在规模上涌现。推荐优化参与度时加剧茧房;自动交易在特定条件下互相踩踏;物流优化改写区域就业与交通。这类失败往往没有单一 bug,也没有单一恶人。应对是系统性思维、多学科风险分析、上线后的反馈回路,以及能在指标异常时集体降速,而不是每个模型各自报「我这边正常」。
阅读完本节,你应当能够:
复杂系统的老教训:接口处长出行为。推荐系统与用户注意力互相训练;交易策略与其他策略互为环境;调度算法与司机、道路、监管互为约束。原文把意外后果定义为与其他系统、人类、环境相互作用产生的、设计者未预见的结果,覆盖社会、环境与系统性风险。
2010 年美股闪电崩盘常被当作「自动交易耦合」的教学案例:在特定流动性条件下,算法互相触发,价格瞬间脱离基本面。它不是某一个现代大模型的事故,但说明同一机制:速度 + 相同反应函数 + 无总闸。推荐极化则更日常:没有人写下「请分裂社会」,参与度梯度自己走过去。
完全预测做不到,可做的是:列出系统将改变哪些激励;哪些其他算法会看到你的输出;失败时伤害是否不可逆;是否存在正反馈。物流优化可能减少空驶,也可能抽干某地区的零售就业、把拥堵转移到未被建模的小路。环境成本则是另一条外部性:训练与推理的能源,原文在生成式浪潮部分已点名。
多学科不是装饰。交通、劳动、公共卫生、传播学的人能看见工程师仪表盘上看不见的变量。利益相关者参与应发生在设计期,而不是公关期。上线后要有能把「投诉、切片指标、外部事件」打回训练与产品的回路——否则意外一旦成为新的训练数据,会被当成真相学进去。
| 信号 | 可能含义 | 动作 |
|---|---|---|
| 用户停留上升但投诉极化 | 参与度与社会福祉分叉 | 改目标或加多样性约束 |
| 多策略同时方向一致 | 拥挤交易或拥挤推荐 | 熔断、随机化、限速 |
| 某地区指标突变 | 外部性集中 | 暂停扩张、做社会影响评估 |
| 能耗与调用暴涨 | 环境与成本风险 | 配额、蒸馏、错峰 |
⚠️ 常见坑:用「我们无法预见所有后果」当免责。不能预见全部,但能预见正反馈和不可逆,这两类必须有闸。
💡 关键直觉:系统性安全的单位是生态,不是单模型准确率。你的 A/B 测试赢了,城市可能输了。
集体熔断草稿 if correlated_actions > threshold: slow_all if external_harm_alerts spike: freeze_new_rollout require_cross_team_oncall for shared_incentives document_unmodeled_stakeholders before launch
与对齐的关系:对齐处理「单个智能体目标歪了」;系统性风险处理「很多并不歪的局部目标叠在一起歪了」。治理上需要行业级压力测试,类似金融的压力测试,而不是每家公司自己说已合规。第 4 章的标准与监管,有一部分就是为这种跨组织外部性存在的。
对可能不可逆的社会实验,放慢是创新仍被允许的条件。生物与航空早已如此。人工智能若只在软件许可协议里免责,却在城市尺度做实验,监管终究会用更粗的刹车。自己先装熔断,比被整行业暂停更可控。
更难。可用的是:共享危险模式通报、默认安全配置、关键基础设施不直接接未审计模型、公共部门采购要求压力测试证据。完全中心化关停不现实,但采购与认证能改变默认。
原文把 AI 容易成为系统性风险源的原因写成:规模普及、互联依赖、不透明难诊断、决策速度与自主、反馈循环、集中化与同质性。少数基础模型或云平台的共同漏洞,会变成生态系统单点。高频交易里错误决策在人类来不及反应时完成;信息流里异常输出成为另一个模型的输入,负反馈或正反馈迅速蔓延。意外行为来自数据偏差、目标错位、环境误解或涌现,不是必须有恶人。当局部意外被大规模复制,就升级为系统性危机。
评估「还没发生」的意外,要列出激励将如何改变、哪些算法会看到你的输出、失败是否不可逆、是否存在正反馈。物流优化抽干就业、把拥堵转移到未建模小路,是外部性例子。环境成本——训练与推理能耗——是另一条被原文点名的外部性,应进配额与蒸馏决策。多学科参与必须在设计期:交通、劳动、公共卫生、传播学看见工程师仪表盘上看不见的变量。上线后要把投诉与外部事件打回训练,防止意外被当成新真相学进去。
行业级压力测试类似金融:单公司 A/B 赢了,城市可能输了。熔断是生态功能:相关动作超阈就一起减速。开源生态更难中心化关停,但采购、认证、危险模式通报、关键基础设施不直接接未审计模型,仍能改变默认。不能预见一切,但能预见正反馈与不可逆——这两类必须有闸,不能用「复杂」当免责。
系统性风险的单位是生态。决策树先问:你的输出会不会成为其他算法的环境;是否存在正反馈;失败是否不可逆。三项里占两项,必须有集体熔断:相关动作超阈一起减速,而不是每个模型报「我这边正常」。推荐停留上升但投诉极化,是参与度与社会福祉分叉,要改目标或加多样性约束。多策略同时方向一致,是拥挤交易或拥挤推荐,要随机化与限速。某地区指标突变,是外部性集中,暂停扩张并做社会影响评估。能耗与调用暴涨,是环境成本,进配额与蒸馏。2010 年美股闪电崩盘用作「速度 + 相同反应函数 + 无总闸」的教学案例,不是某一个现代大模型的已证事故。
| 系统档 | 机制 | 闸 | 反例 |
|---|---|---|---|
| 反馈极化 | 参与度训练注意力 | 改奖励、多样性、非个性化排序 | 用停留时长证明成功 |
| 拥挤踩踏 | 相似策略互为环境 | 熔断、限速 | 单公司仪表盘全绿 |
| 同质单点 | 少数基础模型或云平台 | 采购多样化、压力测试 | 生态共用一个漏洞还声称分散 |
| 劳动交通外部性 | 优化抽干未建模变量 | 设计期请劳动与交通的人 | 上线后才请公关 |
| 意外当真相 | 事故日志回流训练 | 打回回路、隔离评估 | 把投诉当新标签学进去 |
治理检查项:影响评估是否在设计期请过非技术利益相关者;开源或供应链上采购是否要求压力测试证据;正反馈与不可逆是否写进发布检查单。反例:用「无法预见所有后果」当免责——不能预见全部,但能预见正反馈和不可逆;对可能不可逆的社会实验不放慢,等监管用更粗的刹车。对齐处理单个目标歪了,系统性风险处理很多并不歪的局部目标叠在一起歪了,两套闸都要。
系统性风险决策树 有正反馈或不可逆 ──► 必须有闸,复杂不是免责 输出被其他算法当环境 ──► 行业级压力测试 A/B 赢但投诉极化 ──► 改目标,不准只报停留 同质化基础模型 ──► 当单点风险登记 关键基础设施 ──► 不直接接未审计模型
下一章问:原则、法律、标准、企业与公众,如何把这些闸装进制度。
设计期请交通、劳动、公共卫生、传播学的人看激励将如何改变,而不是上线后请公关。列出哪些其他算法会看到你的输出。失败是否不可逆、是否存在正反馈,两项必须有闸。熔断草稿要有数字或可观察信号:相关动作超阈、外部伤害告警飙升、共享激励的跨团队值班。物流优化可能抽干就业、把拥堵转到未建模小路。环境成本进配额与蒸馏。上线后把投诉与外部事件打回训练,防止意外被当成新真相。
行业级压力测试类似金融:单公司 A/B 赢了,城市可能输了。开源生态更难中心化关停,但采购、认证、危险模式通报、关键基础设施不直接接未审计模型,仍能改变默认。不能预见一切,但能预见正反馈与不可逆。对可能不可逆的社会实验,放慢是创新仍被允许的条件。自己先装熔断,比被整行业暂停更可控。原文把系统性风险源写成规模普及、互联依赖、不透明、决策速度、反馈循环、集中化与同质性。少数基础模型共同漏洞会变成生态单点。高频错误在人类来不及反应时完成。当局部意外被大规模复制,升级为系统性危机。把这些写成风险登记,而不是写成无法预见故免责。

工作纸:列出本系统将改变的他人激励,以及其他算法是否以你的输出为环境。正反馈与不可逆两项必须有闸。熔断阈值:相关动作过密时是否一起减速。影响评估是否请过劳动、交通或传播方面的人,若没有,记为设计期缺失。A/B 指标与社会福祉分叉时谁有权改目标。基础模型或云平台同质化是否造成单点。能耗是否进入配额。开源或供应链路径上,采购是否要求压力测试证据。不能预见一切,但正反馈与不可逆必须写进发布检查单,否则「复杂系统」会变成免责文学。
下一章问:原则、法律、标准、企业与公众,如何把这些闸装进制度。