本节摘要:审计把前四节的控制从一次性实验变成可重复证据。评估覆盖功能正确、公平切片、隐私威胁、鲁棒与 OOD、人监控负荷、日志完整性。工具可以是开源公平库、隐私攻击评测、鲁棒基准、模型卡生成器,但工具替代不了用途定性与否决。持续监控要能触发回滚。对外审计需要分层披露。审计失败的系统应降级,而不是补一页整改承诺继续满流量。
阅读完本节,你应当能够:
审计问:这个版本在这些用途下,控制是否按设计工作。因此必须钉死版本哈希、数据快照、配置、随机种子。原文把审计与评估工具当作生命周期最后一环,并强调持续。没有持续,公平会在反馈循环里腐烂,鲁棒会在攻击升级后过期。
内部审计服务发布闸门;独立审计服务第 4.5 节的外部信任;监管报送服务法律。三套报告可以共用证据库,但结论主体不同,不能把内部开心的红队当独立意见对外。
开源生态里有公平度量、对抗评测、成员推断实验工具。使用原则:固定版本、记录参数、禁止只报最好一次。成员推断与反演评测本身有攻击性,应在隔离环境由授权人员执行,对外只报风险等级与是否过门,不报可复现利用。这是伦理,也是安全。
| 审计项 | 通过看起来像什么 | 假通过 |
|---|---|---|
| 公平 | 主指标过地板,对照指标公开 | 只报优势群体 |
| 隐私 | 推断攻击低于阈值,预算未透支 | 未测查询接口 |
| 鲁棒 | 自适应评估过线 | 只用最弱攻击 |
| 日志 | 抽检能复现事故包 | 字段全空或时钟乱 |
| 人监控 | 负荷与否决真实演练 | 确认键无人使用记录 |
| 用途 | 与定性一致 | 上线后偷偷加高风险功能 |
⚠️ 常见坑:审计范围写成「算法」,漏掉标注外包、特征平台、提示词、检索库。系统边界要画到真会改变决策的一切。
💡 关键直觉:审计的产品是「能否复现当时的决定」。复现不了,问责与改进都是文学。
audit_bundle: model_hash, data_snapshot, config fairness_tables, privacy_eval, robust_eval log_sample_replay human_override_drill known_limitations rollback_command
生产监控:切片指标、OOD 分数、投诉、查询异常、能耗与成本(环境外部性也是原文点名的议题)。触发器必须连到降流量,而不是只发邮件到公共邮箱。再训练本身要再审计,防止用带偏的生产日志把系统训歪。
高风险:大版本必审,生产漂移超阈必审,至少按固定日历审。低风险:日历可以稀,但仍要用途变更触发。用途一变,旧审计作废。
加入:越狱与滥用探测集、版权与记忆测试、工具调用权限检查、内容标识是否工作。开放域没有完整正确答案,要用风险案例集与人工抽检,而不是只看困惑度。
原文把审计工具的作用写成:风险识别与度量、合规验证、性能与鲁棒、解释有效性、持续监控、提升信任。传统软件测试不够,因为数据依赖、黑箱、持续学习。核心维度对齐公平、XAI、鲁棒安全、隐私。工具功能包括公平仪表板、解释质量评估、对抗评测、成员推断实验。使用原则:固定版本与参数,禁止只报最好一次;攻击性评测在隔离环境由授权人员执行,对外只报是否过门。系统边界要画到标注外包、特征平台、提示词、检索库。
持续监控连到降流量:切片、OOD、投诉、查询异常、能耗。再训练要再审计,防止生产日志把系统训歪。高风险大版本必审、漂移超阈必审、固定日历审;用途变更使旧审计作废。生成式加项:越狱与滥用探测集、版权与记忆测试、工具权限、内容标识、风险案例集与人工抽检,而不是只看困惑度。审计的产品是「能否复现当时的决定」。复现不了,问责是文学。内部开心的红队不能当独立意见对外。失败就降级,不要只补整改承诺继续满流量。
独立审计与监管报送共用证据库但结论主体不同。把审计范围写成「算法」是最常见的缩水。把本节清单与附录对照打印,带进发布会。
审计对象是钉死哈希的系统,不是笔记本里一次拟合。发布前按伤害走决策树:用途触及人身自由财产基本服务,走完整包——公平全家福、隐私推断评测、自适应鲁棒、日志抽检复现、人监控演练、关停命令。生成式另加越狱与滥用集、记忆测试、工具权限、内容标识。用途变更或提示词、检索库、特征平台变更,旧审计作废,不要靠「算法没改」。生产上切片、OOD、投诉、查询异常任一超阈,必须降流量,只发邮件到公共邮箱不算控制。再训练用生产日志,必须再审计,防止把带偏回流当成新真相。
| 失败档 | 看起来像什么 | 正确动作 | 反例 |
|---|---|---|---|
| 档1 证据漂 | 复现不了当时决定 | 阻断发布,补快照与时钟 | 「大概是这个版本」 |
| 档2 范围缩水 | 只审权重,漏提示与外包 | 重画系统边界再审 | 「算法已审计」 |
| 档3 假绿 | 只报最好一次、最弱攻击 | 固定工具版本与参数重跑 | 海报式鲁棒分数 |
| 档4 主体混淆 | 内部红队当独立意见对外 | 三套报告分开发 | 把开心结论外送 |
| 档5 监控空转 | 告警不降流量 | 触发器接熔断 | 整改承诺继续满流量 |
治理检查项:模型哈希、数据快照、配置能否对上一条线上决策;独立审计与监管报送是否共用证据库但结论主体分开;攻击性评测是否隔离环境、对外只报过门与否;高风险日历审计、漂移触发审计、大版本必审是否写进值班手册。反例:审计范围写成「算法」;成员推断评测把可复现利用写进对外材料;低风险日历稀到用途已变仍拿旧报告投标;生成式只看困惑度。失败就降级,不要用一页整改承诺换满流量。
验货决策树 复现不了事故包 ──► 否决,先补日志 用途或检索库已变 ──► 旧审计作废 工具绿但未固定参数 ──► 假通过,重跑 监控不能降流量 ──► 控制不存在 生成式缺记忆或越狱集 ──► 不得放进不可逆流程
下一篇附录把审查清单与术语收成可打印的一页,便于带进评审。
十分钟不够就不应原则同意。六张成绩单按序翻:版本哈希能否对上一条线上决策;公平全家福是否含对照指标与小样本标记;隐私推断是否过门、预算是否透支;鲁棒是否自适应、有传感器是否含物理档;人监控演练有否决记录;关停命令当场演示。生成式另翻越狱集、记忆测试、工具权限、内容标识。缺一张,结论只能是否决或限制流量,不能是「整改承诺+满流量」。
持续监控的触发器必须接到降流量:切片跌破地板、OOD 触发率异常、投诉飙升、查询模式异常、人工改写率上升。只发邮件到公共邮箱等于没有控制。再训练本身再审计,防止生产日志把偏见焊回去。用途、提示词、检索库、特征平台任一变更,旧审计作废。内部、独立、监管三套报告共用证据库、结论主体分开,禁止把内部开心红队当独立意见外送。攻击性评测隔离执行,对外不报可复现利用。系统边界画到标注外包。失败就降级。把「算法已审计」改成「系统已审计」。
高风险:大版本必审、漂移超阈必审、固定日历审。低风险日历可稀,但用途变更仍触发。开放域生成没有完整正确答案,用风险案例集与人工抽检,不看困惑度充数。审计的产品是能否复现当时的决定。
监控触发器联调演练每年至少一次:人为拉低某切片或拉高 OOD,必须看到流量被降而不是只看到邮件。演练失败视为控制不存在。生成式加项缺一不可:越狱集、记忆测试、工具权限、内容标识。用途或检索库变更当天作废旧审计。把内部红队报告的页眉印上「非独立审计」,防止外送时主体混淆。失败降级,整改承诺换不满流量。
验货对象是钉死哈希的系统。六张成绩单缺一即否决或限流。监控必须能降流量。内部红队不得冒充独立审计。生成式四件套与公平切片同级。用途变更当天作废旧报告。审计失败补整改承诺换不满流量,只能降级。复现不了当时决定,问责仍是文学。
把「算法已审计」改成「系统已审计」,范围写到提示词、检索库与标注外包。复现不了当时决定,不得放行。

工作纸:版本哈希与数据快照能否钉死。事故包能否复现。监控触发器是否降流量而不只发邮件。用途变更是否作废旧审计。生成式加项是否齐全。系统边界是否含提示与检索。内部红队是否被误标为独立审计。工具参数是否固定、禁止只报最好一次。攻击性评测是否隔离。失败是否降级。把「算法已审计」缩水说法改成「系统已审计」,范围写到外包与特征平台。
下一篇附录把审查清单与术语收成可打印的一页,便于带进评审。