本节摘要:隐私增强技术在不交出明文的前提下完成统计或训练。差分隐私用校准噪声使单条记录对输出几乎无影响,提供可量化预算。联邦学习把训练留在数据原地,只聚合更新,但仍要防梯度泄露与投毒。同态加密允许密文计算,全同态仍贵;安全多方计算让多方输入不互看。选型看威胁模型:防外部统计推断用 DP;防数据集中用联邦;防计算外包偷看用加密计算。它们都必须叠最小化与访问控制,并诚实公布效用损失。
阅读完本节,你应当能够:
对手是能查询模型的外人,还是能看到更新的聚合服务器,还是能串通其中一方的参与者?差分隐私主要对付「从输出还原个体」;联邦对付「原始数据不要出门」;若服务器恶意,联邦需要安全聚合与对更新再加噪。原文对 DP 的定义很清楚:加入或删除任意一条记录,对统计分析或模型参数的影响微乎其微,从而难以推断某个体是否在集中或其值。这是数学保证,不是营销词,所以必须报告预算参数与组成定理怎么花预算。
联邦学习:设备或机构下载当前模型,本地训练,上传梯度或参数,服务器聚合后再分发。医院联盟与手机输入法是典型。挑战是非独立同分布数据、掉线、通信,以及原文在安全章也会提到的投毒——恶意参与者上传有害更新。同态加密:外包方看不见明文仍能算,部分同态已有窄场景,全同态训练大模型仍重。MPC:两家公司算交集大小而不交换名单,轮次与工程复杂。
| 场景 | 更匹配 | 仍须叠加 |
|---|---|---|
| 发布统计表 | 差分隐私 | 查询次数上限 |
| 多医院联合建模 | 联邦加安全聚合 | 对更新 DP、投毒检测 |
| 云上处理极度敏感字段 | HE 或可信执行环境 | 密钥与侧信道 |
| 两机构求交 | MPC | 输入真实性 |
⚠️ 常见坑:epsilon 取很大还宣传「差分隐私」。预算耗尽后的查询应拒绝,而不是继续「差不多也行」。
💡 关键直觉:隐私是花掉的预算。每一次发布、每一轮联邦、每一次解释查询都可能花钱。

机器遗忘仍是研究区:从参数里抠掉某用户,验证困难。工程上更可控的是:训练数据有合法基础与到期日;到期重训;日志与特征缓存同步到期。解释查询也可能泄露,要对解释接口同样限速与加噪,否则第 5.1 节的 SHAP 变成侧信道。
隐私预算账本 total_budget = assigned spend(release_statistics) spend(training_rounds) spend(explanation_queries) if remaining <= 0: refuse
有助于减少原文出境,但更新、嵌入、错误样本仍可能跨境。法律上的「出境」认定要看法域,不能把联邦当自动合规。还要看聚合服务器在哪、谁能解密安全聚合的结果。
差分隐私的组成意味着多次查询会花光预算。必须有账本:统计发布、训练轮次、解释查询都记账,耗尽则拒绝。epsilon 很大还宣传「已保护」是虚假广告。联邦学习的非独立同分布、掉线、通信成本是工程现实;安全聚合与对更新加噪是防恶意服务器与偷梯度的配套,不是可选项。投毒检测针对恶意参与者。医院数据出境认定要看法域,聚合服务器位置与谁能解密,决定「数据不出境」宣传是否诚实。
同态加密适合窄查询与高敏感外包,不适合作为大模型端到端训练的默认。MPC 适合两机构求交,输入真实性仍要保证——垃圾输入会得到合法但无意义的密文结果。匿名化单独上场会被链接攻击击穿。隐私设计默认最小收集,比事后加噪便宜一个数量级。机器遗忘仍研究中,工程诚实方案是留存到期重训、停止增量使用被删除用户。特征缓存、嵌入、日志必须同步到期,否则删除权只删了主库。
内部人员过度授权与二次使用,往往比外部黑客更常见。最小化、目的锁定、查询审计是针对内部对手的 PET 之外的控制。把三种对手画在同一张图上再采购技术,才不会买错贵重安慰剂。
先画三种对手,再买技术。外部查询者:差分隐私加查询上限,解释接口同样记账。中心聚合服务器:联邦必须安全聚合,更新再加噪,否则「数据没出门」是假的。内部人员与供应商:最小化、目的锁定、访问审计,往往比再买一层全同态更先做。医院联盟联合建模:联邦 + 安全聚合 + 对更新的差分隐私 + 投毒检测,四件套缺一则记为未完成。两家机构求交:多方计算,并验证输入真实性——密文上的垃圾输入仍是垃圾。云上处理证件号或病历字段:窄查询用同态或可信执行环境,密钥与侧信道单独评审。发布统计表:差分隐私,预算耗尽拒绝,禁止把很大的隐私参数还写成「已保护」。
| 泄露档 | 机制 | 最低控制 | 反例 |
|---|---|---|---|
| 档1 成员推断 | 过拟合记忆「谁在集中」 | 推断评测过门、查询限速 | 只加密磁盘 |
| 档2 模型反演 | 输出重构脸或文本片段 | 输出过滤、记忆测试、留存上限 | 「匿名化已删姓名」 |
| 档3 梯度泄露 | 联邦更新还原样本 | 安全聚合+对更新加噪 | 宣传联邦即合规出境 |
| 档4 解释侧信道 | SHAP 或过细推荐文案 | 解释限速、因素停在类别 | 「因为你上周去过某医院」 |
| 档5 删除权落空 | 主库删了缓存还在 | 特征、嵌入、日志同步到期重训 | 承诺「参数已立即忘记」 |
治理检查项:隐私预算数字能否报出、组成花费记在哪;删除请求来时增量是否停止、下次重训日是否在日历;供应商与聚合服务器地理位置是否影响出境认定;开源权重是否做过记忆测试。反例:epsilon 取很大仍印「差分隐私」;联邦学习当绝对保险箱;匿名化单独上场对抗链接攻击;把解释接口当免费调试窗不加噪。机器遗忘仍是研究区,工程诚实写法是留存到期与停止增量,不是魔法擦除。
PET 选型决策树 对手=外部统计推断 ──► 差分隐私 + 查询账本 对手=数据集中风险 ──► 联邦,并假设梯度会漏 对手=外包计算偷看 ──► 同态或多方计算,窄场景 对手=内部二次使用 ──► 最小化与目的锁定,先于新加密 删除权触发 ──► 停增量 + 到期重训,禁止承诺立即遗忘
下一节把公平从原则变成可跑在流水线上的检测与缓解。
收集段:能不收的默认关;派生特征单独登记合法基础。训练段:差分隐私的组成从第一轮就算,联邦每一轮上传都可能花钱;医院联盟要把聚合服务器位置、谁能解密、掉线策略写进数据说明书。查询段:统计发布、解释接口、成员推断评测本身都消耗预算或暴露面,评测放隔离环境,对外只报过门。删除段:主库、特征缓存、嵌入、日志四份到期日对齐;到期重训进日历,增量学习在删除请求到达当天停止。四段任何一段没有记账人,PET 采购视为未完成。
效用账单必须公开给业务:噪声加大、模型变糊,这是定价问题。业务不能接受任何效用下降,等于要求把泄露成本外部化给被推断的人。全同态加密适合窄查询,拿它当大模型端到端训练的默认,是把研究演示写成产品规格。多方计算求交仍要保证输入真实性。可信执行环境有侧信道与密钥托管问题,不能口头「进了安全区」。内部过度授权往往比外部黑客常见:访问审计、二次使用审批,比再买一层加密更先做。
开源权重若记忆个人数据,公开即扩散,训练前过滤与记忆测试必须进流水线。出境认定不能靠「联邦」三个字自动过关。把三种对手画在同一张图上再签字:外部查询、中心服务器、内部人员。缺一张图就买错贵重安慰剂。
隐私预算账本指定唯一记账人,统计发布、训练轮次、解释查询分列花费。预算耗尽自动拒绝,禁止人工「这次例外」。删除请求工单必须同时勾选主库、缓存、嵌入、日志四项到期。联邦项目把聚合服务器法域写进数据说明书。四项缺一,PET 宣传从材料删除。
威胁模型三格签字后再采购:外部查询、聚合服务器、内部人员。缺一格不准上差分隐私海报。机器遗忘仍研究中,对外口径只许留存到期与停增量,不许承诺参数立即忘记。解释接口按侧信道管理,与统计发布共用账本。
工作纸:隐私预算数字能否报出,组成花费是否记账。联邦的安全聚合与更新加噪。删除权对应的重训日历与缓存到期。三种对手的控制缺口。匿名化是否还被单独宣传。FHE 是否被错误当成大模型默认。解释接口是否当侧信道管。供应商位置是否影响出境认定。内部授权最小化是否比外部黑客更先做。把「数据没出门所以绝对隐私」从材料删除。
下一节把公平从原则变成可跑在流水线上的检测与缓解。