模型卡、系统卡与数据卡 本节摘要:三种文档格式结构化了 AI 透明度。模型卡(Mitchell 等 2019)——模型的「营养标签」:训练数据、定量分解分析、伦理考量、注意事项;但 Hugging Face 上仅 0.3% 的模型卡记录了伦理考量(Oreamuno 等 2023)。数据集数据表(Gebru 等 2018,CACM)——动机、构成、采集过程、标注、分发、维护;类比电子元件数据表。数据卡(Pushkarna 等,Google 2022)——模块化分层细节(望远镜、潜望镜、显微镜)作为面向多元读者的边界对象。
本节摘要:三种文档格式结构化了 AI 透明度。模型卡(Mitchell 等 2019)——模型的「营养标签」:训练数据、定量分解分析、伦理考量、注意事项;但 Hugging Face 上仅 0.3% 的模型卡记录了伦理考量(Oreamuno 等 2023)。数据集数据表(Gebru 等 2018,CACM)——动机、构成、采集过程、标注、分发、维护;类比电子元件数据表。数据卡(Pushkarna 等,Google 2022)——模块化分层细节(望远镜、潜望镜、显微镜)作为面向多元读者的边界对象。2024-2025 发展:经 LLM 自动生成(CardGen,Liu 等 2024);模型卡细节与 HF 上高达 29% 的下载增长相关(Liang 等 2024);可验证证明(Laminator,Duddu 等 2024);碳/水可持续性报告新增(Jouneaux 等 2025 年 7 月);EU/ISO 监管卡涌现。系统卡(Sidhpurwala 2024;Meta 系统级透明度;《Blueprints of Trust》arXiv:2509.20394)——覆盖安全能力、提示注入防护、数据外泄检测、与人类价值对齐的端到端 AI 系统文档。
对应原课程:Phase 18 · Lesson 26 ·
model-system-dataset-cards(原英文phases/18-ethics-safety-alignment/26-model-system-dataset-cards/docs/en.md)。前置:Phase 18 · 18、24。
阅读完本节,你应当能够:
监管框架(第 24 节)与实验室安全政策(第 18 节)都要求文档。文档格式从模型特定(模型卡)演进到数据集特定(数据表)再到系统特定(系统卡)。每种针对不同透明度范围。2024-2025 的自动化与可验证证明工作针对长期存在的采用问题。
章节:模型细节、预期用途、因子(评估相关的人口或环境因子)、指标、评估数据、训练数据、定量分析(按因子分解)、伦理考量、注意事项与建议。采用问题:Oreamuno 等 2023 审计 Hugging Face 模型卡,发现仅 0.3% 记录伦理考量。
电子元件数据表类比。章节:动机(数据集为何创建)、构成(里面是什么)、采集过程(如何组装)、标注(若适用)、用途(预期/禁止/风险)、分发、维护。2021 年发表于 CACM。数据表是上游文档;模型卡依赖数据表准确。
模块化分层细节,三个缩放级别:望远镜(面向非专家的高层摘要)、潜望镜(面向 ML 从业者的中层概览)、显微镜(面向审计员的详细特征级文档)。边界对象框架:不同读者从同一文档提取不同信息。
范围:端到端 AI 系统,含模型 + 安全栈 + 部署上下文。典型章节:安全能力、提示注入防护、数据外泄检测、与声明的人类价值对齐、事件响应。Sidhpurwala 2024 与 Meta 系统级透明度工作。《Blueprints of Trust》(arXiv:2509.20394)把系统卡形式化为模型卡的部署层补充。
⚠️ 三种卡的范围递进:数据表(数据集)→ 模型卡(模型)→ 系统卡(模型 + 安全栈 + 部署)。许多团队只做模型卡,但生产安全论证需要系统卡——因为第 25 节的 CVE 出现在系统层(RAG + CSP + 工具),而非模型层。
code/main.py 为玩具部署生成最小模型卡、数据表、系统卡,各自遵循经典章节结构。你可以检查格式并对比三种范围。
def model_card(model, eval_data, train_data): return { "model_details": model.meta, "intended_use": model.intended_use, "factors": ["gender", "race", "language"], "metrics": eval_data.metrics, "evaluation_data": eval_data.source, "training_data": train_data.summary, # 依赖数据表准确 "quantitative_analyses": disaggregate(eval_data, by=["gender","race"]), "ethical_considerations": ..., # HF 上仅 0.3% 填写 "caveats": ..., } def system_card(model, safety_stack, deployment): return { "security_capabilities": safety_stack.list(), "prompt_injection_protection": safety_stack.xpia_filter, "data_exfiltration_detection": safety_stack.csp_policy, "alignment_with_human_values": model.value_alignment, "incident_response": deployment.runbook, }
💡 可验证证明的价值:Laminator 让模型卡字段携带密码证明(如「此评估结果由 TEE 签名」),而非仅「我们声称」。这把模型卡从「自报」升级为「可审计」,是应对 0.3% 伦理考量填写率的根本路径——让透明度可验证,而非依赖善意。
| 卡类型 | 范围 | 主要读者 | 关键章节 |
|---|---|---|---|
| 数据表(Gebru) | 数据集 | 数据治理、合规 | 动机/构成/采集/标注/用途/分发/维护 |
| 模型卡(Mitchell) | 模型 | ML 从业者、下游用户 | 因子/指标/分解分析/伦理考量 |
| 数据卡(Pushkarna) | 数据集(分层) | 多元(非专家→审计员) | 望远镜/潜望镜/显微镜 |
| 系统卡 | 模型 + 安全栈 + 部署 | 安全工程师、审计员 | 安全能力/注入防护/外泄检测/对齐 |
设计要点:四种卡互补而非替代——数据表/数据卡在上游,模型卡在中游,系统卡在下游生产层。EU AI Act 把模型卡变成合规产物意味着:不做的代价从「市场劣势」升级为「违法」。但 0.3% 伦理考量填写率说明,自愿透明不可靠,可验证证明 + 监管强制是唯一可靠路径。
本节产出 outputs/skill-card-audit.md:给它一份模型卡、数据表或系统卡,它审计章节覆盖、数值分解、是否有可验证证明。
code/main.py 是独立玩具,玩具部署可换成真实模型/数据集/系统,三种卡的章节结构不变。
Easy:运行 code/main.py,检查生成的卡,识别薄弱章节(仅占位)并指明什么证据能加强它们。
Medium:用两个人口群体的定量分解分析(第 20 节)扩展模型卡。
Medium:读 Oreamuno 等 2023 关于 0.3% 采用率。提出一项对模型卡规范的结构性改动,以提高伦理考量采用。
Hard:Laminator(Duddu 等 2024)用 TEE 做可验证证明。设计一个携带评估结果密码证明的模型卡字段,描述验证者角色。
Hard:为你过去的一个项目或假设部署写一份系统卡(非模型卡)。识别对第三方审计员价值最高的章节。
下一节,我们看文档的上游——数据溯源与训练数据治理:一旦数据进权重,外科擦除就不可能。