数据溯源与训练数据治理 本节摘要:每一个模型卡(第 26 节)和每一项监管义务(第 24 节)的上游都是训练数据治理。2024-2025 年,全球监管在三条原则上收敛:机器可读的退出机制(opt-out)、按数据集披露、对公开数据适用合法利益(legitimate interest)。本节覆盖三件事:① 立法——加州 AB 2013(2024 签署)要求生成式 AI 开发者披露训练数据集的 12 个法定字段;EU AI Act 借助版权指令的 TDM 例外要求尊重机器可读的退出信号(robots.txt、C2PA「禁止 AI 训练」)。② 司法趋同——爱尔兰 DPC(2025 年 5 月)、科隆高等法院、英国 ICO、汉堡 DPA 在「合法利益 + 退出机制」前提下接受对公开内容训练。
本节摘要:每一个模型卡(第 26 节)和每一项监管义务(第 24 节)的上游都是训练数据治理。2024-2025 年,全球监管在三条原则上收敛:机器可读的退出机制(opt-out)、按数据集披露、对公开数据适用合法利益(legitimate interest)。本节覆盖三件事:① 立法——加州 AB 2013(2024 签署)要求生成式 AI 开发者披露训练数据集的 12 个法定字段;EU AI Act 借助版权指令的 TDM 例外要求尊重机器可读的退出信号(robots.txt、C2PA「禁止 AI 训练」)。② 司法趋同——爱尔兰 DPC(2025 年 5 月)、科隆高等法院、英国 ICO、汉堡 DPA 在「合法利益 + 退出机制」前提下接受对公开内容训练。③ 不可逆难题——数据一旦进入模型权重,外科擦除就不可能,合规窗口只在采集时;Data Provenance Initiative《Consent in Crisis》(2024 年 7 月)揭示 AI 数据公地正加速收缩,2023→2024 约 25% 的头部训练源新增了限制。本节是模型卡的数据集层上游。
对应原课程:Phase 18 · Lesson 27 ·
data-provenance-training-governance(原英文phases/18-ethics-safety-alignment/27-data-provenance-training-governance/docs/en.md)。前置:Phase 18 · 24、26。
阅读完本节,你应当能够:
训练数据治理是「上游的上游」:它决定了模型卡(第 26 节)里训练数据那一栏能写得多准,也决定了能否满足监管(第 24 节)的透明度义务。关键的不对称:cookie 同意框架是为实时、可逆的追踪设计的——用户点了拒绝,追踪就停了;而训练数据一旦进入权重,擦除就不可能。这意味着合规窗口只在采集时,错过之后再也无法在下游补救。
2024-2025 年的监管图景围绕三条原则收敛:
⚠️ 采集时是唯一的合规窗口。一旦数据进了权重,任何下游的「整改」都只能是部分缓解——重训是唯一彻底方案,而它贵到不现实。这和第 26 节的模型卡不同(模型卡可以事后补),数据治理的义务必须在采集时就尽到。
2024 年签署。对于 2022 年 1 月 1 日及之后发布的系统,文档须在 2026 年 1 月 1 日前公布。第 3111(a) 节要求开发者公布训练所用数据集的高层摘要,含 12 个法定项:
💡 第 12 项(合成数据)是相对 Gebru 等 2018 数据表的新增;第 7 项(个人信息)会触发 CPRA(隐私权法)义务。法案豁免安全/完整性、航空操作、联邦专属国家安全系统(第 3111(b) 节)。
EU 版权指令的文本与数据挖掘(TDM)例外允许在公开内容上训练,除非权利人退出(opt-out)。EU AI Act 的 GPAI 实务准则版权章要求 GPAI 提供者尊重机器可读的退出信号:robots.txt、C2PA「禁止 AI 训练」声明等。
| 机构 | 时间 | 立场 |
|---|---|---|
| 爱尔兰 DPC | 2025-05-21 | 在 EDPB 意见后,接受 Meta 在保障措施下对第一方公开的欧盟/欧洲经济区成人用户内容的训练计划 |
| 科隆高等法院 | 2025-05-23 | 驳回针对 Meta 的禁令:退出机制已足够 |
| 汉堡 DPA | 2025 | 撤销紧急程序,为求欧盟层面一致 |
| 英国 ICO | 2025-09-23 | 对 LinkedIn 恢复 AI 训练(类似保障措施 + 持续监控)给出积极监管回应(非正式放行) |
| 巴西 ANPD | 2024-06-02 | 因信息透明度不足,暂停 Meta 对巴西用户数据的训练处理;同年 8-30 在 Meta 提交合规计划后解除 |
趋同原则:在提供退出机制的前提下,合法利益可作为对公开的第一方内容训练的法律基础,无需同意。巴西 ANPD 走了不同的路——它把透明度置于合法利益可采性之上。
cookie 同意是为实时、可逆的追踪设计的。训练数据不同:数据一旦进权重,外科擦除不可能。从头重训是唯一彻底补救,而它贵到不现实。部分缓解包括:
三者都不能完全解决问题。合规窗口只在采集时。
dataprovenance.org。Longpre、Mahari、Lee 等《Consent in Crisis》(2024 年 7 月):对 AI 训练数据公地的大规模审计。核心发现:发布者正以加速速率添加 robots.txt 限制;可公开训练的数据公地正在快速收缩。2023→2024 约 25% 的头部训练源新增了某种限制。
含义:未来的训练数据可得性将依赖新的获取范式——许可、合成生成、激励性参与。
code/main.py 为一个玩具数据集生成符合 AB 2013 的 12 字段摘要骨架,你可以填充字段,观察哪些字段触发隐私或版权的后续义务。
def dataset_summary_ab2013(dataset): """生成 AB 2013 的 12 字段训练数据摘要骨架。""" return { "1_source_or_owner": dataset.owners, # 数据集所有者 "2_purpose_fit": dataset.intended_purpose, # 如何推进预期用途 "3_num_datapoints": dataset.size_estimate, # 数量(可估算) "4_datapoint_types": dataset.types, # 类型描述 "5_ip_status": dataset.ip_status, # 版权/商标/专利 / 公共领域 "6_acquisition": dataset.acquired_via, # 购买 / 许可 "7_personal_info": dataset.has_personal_info, # 若 True → 触发 CPRA 义务 "8_aggregate_consumer_info": dataset.has_aggregate, # 触发 CCPA 义务 "9_cleaning_modifications": dataset.processing_log, "10_collection_period": dataset.collected_range, # 标注是否仍在采集 "11_first_used_date": dataset.first_used, "12_synthetic_data": dataset.uses_synthetic, # 新增于 Gebru 2018 之外 }
💡 设计要点:字段 7 和字段 5 是「触发器」——它们一旦为真,就分别打开隐私(CPRA)和版权(TDM/许可)的后续义务链。把这个判断写进脚手架,可以让数据团队在采集时就看到「这个数据集会带来什么合规负担」,而不是到模型卡阶段才发现。
| 治理工具 | 管辖区 | 强制性 | 触发点 | 关键内容 |
|---|---|---|---|---|
| 加州 AB 2013 | 美国(加州) | 法定,2026-01-01 前 | 训练数据披露 | 12 字段摘要,含合成数据项 |
| EU TDM 例外 | 欧盟 | 法定(版权指令) | 采集时尊重退出 | robots.txt、C2PA「禁止训练」 |
| GDPR 合法利益 | 欧盟 | 法定(第 6 条) | 训练前评估 | 公开第一方内容 + 退出 + 保障 |
| 机器可读退出信号 | 全球(技术层) | 由监管要求尊重 | 采集时 | robots.txt / C2PA / TDM.Reservation |
| 不可逆性约束 | 物理事实 | 不可规避 | 训练后 | 合规窗口只在采集时 |
设计要点:这套治理工具是分层叠加的——退出信号是技术层,AB 2013/TDM 是披露层,合法利益是法律基础层,不可逆性是物理约束层。任何一层缺失都会导致整体失败:没有退出信号,TDM 例外就空转;没有披露,事后审计无从做起;不在采集时合规,不可逆性让事后补救成为不可能。
本节产出 outputs/skill-provenance-check.md:给它一份用于训练的数据集,它检查 AB 2013 12 字段覆盖、退出机制基础设施合规、DPA 立场对齐,以及不可逆性风险评估。
code/main.py 是独立脚手架,玩具数据集可换成真实数据集,12 字段结构不变。
Easy:运行 code/main.py,为一个玩具数据集产出 12 字段摘要,识别哪些字段规格不足,并指明需要什么证据来加强它们。
Medium:EU 版权指令的 TDM 退出是机器可读的。提出一种退出信号的标准格式,并与 robots.txt、C2PA「禁止 AI 训练」对比。
Medium:读 Data Provenance Initiative《Consent in Crisis》(2024 年 7 月)。描述限制增速最快的三类内容,并论证一个经济后果。
Hard:2025 年的 DPA 趋同接受了对公开内容训练的合法利益。构造一个合法利益不足以成立的场景,并指明提供者需要的替代法律基础。
Hard:草拟一份训练数据溯源清单,组合 AB 2013 字段与每个数据集的 C2PA 签名溯源链。识别一个技术障碍和一个法律障碍。
下一节,我们把视角从「数据治理」抬到「研究生态」——绘制实验室之外的对齐研究组织版图:MATS、Redwood、Apollo、METR、Eleos,它们构成了对前沿实验室自我评估的外部制衡。