3.4 差分隐私 (Differential Privacy, DP)
本节摘要:统计结果怎么保护个体?差分隐私给数学答案。本节讲清楚 DP 定义(相邻数据集不可区分)、机制(拉普拉斯/高斯/指数)、组合定理、本地 vs 中心 DP、工程落地。读完你能给项目配 DP 参数。
一、DP 的核心问题
差分隐私原理

传统匿名化(去姓名/身份证)不够——多数据集交叉能重新识别个体。1997 年马萨诸塞州州长医疗记录被重新识别(去名但含邮编+生日+性别,和选民登记交叉)。2006 年 AOL 搜索记录"匿名"但能从搜索内容识别个体。
需要更强的保证——即使攻击者有背景知识,也不能从统计结果推断个体是否在数据集。
差分隐私(Differential Privacy, DP):Dwork 2006 提出,数学化"个体加入/移除几乎不改变输出"——相邻数据集(差一个个体)的查询输出分布几乎相同。
直觉:你的数据在不在,结果几乎一样——所以从结果看不出你的数据。
二、DP 的形式定义
ε-差分隐私:机制 M 满足 ε-DP,如果对所有相邻数据集 D, D'(差一个个体)和所有输出集 S:
Pr[M(D) ∈ S] ≤ e^ε · Pr[M(D') ∈ S]
直觉:相邻数据集输出概率比 ≤ e^ε——ε 小则分布几乎相同(强隐私),ε 大则差异大(弱隐私)。
(ε, δ)-差分隐私:放宽——允许 δ 概率"破坏":
Pr[M(D) ∈ S] ≤ e^ε · Pr[M(D') ∈ S] + δ
δ 是"失败概率"——小概率下不保证。δ 要极小(如 1/n²),否则可能泄露个体。
参数选择:
- ε:0.1-1 强隐私,1-10 中等,>10 弱。Apple 用 ε≈1-4,Google 用 ε≈1-2,美国普查 2020 用 ε≈19.61(争议大)。
- δ:要远小于 1/n(n 是数据集大小),如 1e-6 到 1e-9。
三、DP 的机制
怎么实现 DP?加噪声。
1. 拉普拉斯机制(Laplace Mechanism)
- 对查询 f,加 Laplace 噪声:M(D) = f(D) + Lap(Δf/ε),Δf 是 f 的敏感度(相邻数据集 f 最大变化)。
- 适合数值查询(求和、计数、均值)。
- 敏感度小(如计数 Δf=1)则噪声小,敏感度大(如求和 Δf=最大值)则噪声大。
2. 高斯机制(Gaussian Mechanism)
- 加高斯噪声:M(D) = f(D) + N(0, σ²),σ ≈ Δf·√(2ln(1.25/δ))/ε。
- 给 (ε, δ)-DP,比拉普拉斯更易分析组合。
- 机器学习训练常用(DP-SGD)。
3. 指数机制(Exponential Mechanism)
- 对离散输出(非数值),按效用函数 u(D, r) 指数概率选输出。
- 适合选择类查询(如"最受欢迎的项")。
4. 随机响应(Randomized Response)
- 本地 DP 的基础——用户回答前随机翻转:以 p 概率真答,1-p 概率假答。
- 个体回答有噪声,聚合时去噪得群体统计。
- 不需信任收集者(本地加噪)。
四、DP 的组合定理
DP 的关键——多次查询的隐私累积。
1. 顺序组合(Sequential Composition)
- k 次 ε-DP 查询,总隐私是 k·ε。
- 直觉:每次查询泄露一点,累积泄露增加。
2. 并行组合(Parallel Composition)
- k 次查询各作用不相交子集,总隐私是 max(ε_i)(不是 k·ε)。
- 直觉:不交子集不累积,因为每个个体只被查一次。
3. 后处理(Post-processing)
- 对 ε-DP 输出做任意函数,仍是 ε-DP。
- 直觉:后处理不增加隐私泄露(信息已限定)。
4. 高级组合(Advanced Composition)
- k 次 (ε, δ)-DP,总隐私约 ε' = O(√(k·ε²)) + k·δ,比顺序组合 k·ε 好。
- 让多次查询隐私累积更慢。
组合定理让"隐私预算"管理——总 ε 分配给多次查询,超预算则停。
五、本地 DP vs 中心 DP
按加噪位置分:
1. 中心 DP(Central DP)
- 数据集中到可信收集者,收集者在结果上加噪。
- 优点:噪声小(一次加噪),精度高。
- 缺点:要信任收集者——收集者看到原始数据。
- 适合:可信机构(如统计局)、数据已集中的场景。
2. 本地 DP(Local DP)
- 用户在设备上本地加噪,只发噪声数据给收集者。
- 优点:不信任收集者(数据未集中)。
- 缺点:噪声大(每用户加噪,聚合去噪),精度低。
- 适合:不可信收集者、隐私敏感场景(如 Google RAPPOR 收 Chrome 使用数据、Apple 收键盘数据)。
3. 混合
- 分布式 DP——多方各加噪,安全聚合(用 MPC/HE 聚合)。
- 兼顾——不信任收集者,但噪声比纯本地小。
六、DP 的工程挑战
1. 精度-隐私权衡:ε 小则噪声大则精度低。要找平衡——足够隐私且结果可用。
2. 隐私预算管理:总 ε 分配给多次查询,超预算则停。要监控累积消耗。
3. 敏感度计算:要算查询敏感度(Δf),复杂查询敏感度难算。
4. 机器学习 DP:DP-SGD(Abadi 2016)——训练时梯度加噪+裁剪。精度损失(如 ImageNet 降 1-5%)、训练慢。
5. 流式 DP:流数据持续查询,隐私随时间累积。用滑动窗口、事件级 DP。
6. 公开 ε:要透明公布 ε,让用户和监管评估。Apple/Google 公布,美国普查 2020 公布 ε=19.61 引争议(太大)。
七、DP 的工程落地
1. 库:
- Google DP 库(开源,C++/Java/Go)。
- OpenDP(哈佛,Python/R)。
- PipelineDP(Google,分布式)。
- TF-Privacy(TensorFlow,DP-SGD)。
- Opacus(PyTorch,DP-SGD)。
- IBM DP Library。
2. 应用案例:
- 美国普查 2020:用 DP 发布统计,保护个体(虽 ε 大争议)。
- Apple 键盘/照片:本地 DP 收使用数据,改进产品。
- Google RAPPOR:Chrome 浏览器统计,本地 DP。
- Microsoft 365:遥测用 DP。
- Meta 广告归因:DP 保护用户。
- DP 机器学习:Opacus 训练隐私模型。
3. 部署要点:
- 选模式:可信收集者用中心 DP,不可信用本地 DP,混合用分布式。
- 设 ε:按敏感度设,强隐私 0.1-1,中等 1-10,公布让评估。
- 管预算:总 ε 分配,监控累积,超预算停。
- 算敏感度:查询敏感度要算对,复杂查询用高级机制。
- 评估精度:加噪后结果可用性,调 ε/噪声平衡。
- 持续监控:隐私预算消耗、精度变化、新查询影响。
八、DP 在 PETs 中的定位
1. 统计隐私金标准:DP 是统计发布/查询/ML 训练的隐私标准——可证明、可量化、可组合。
2. 和 HE/MPC 互补:HE/MPC 保护计算过程,DP 保护输出——MPC 算完结果加 DP 发布,HE 推理结果加 DP。
3. 联邦学习核心:联邦学习常用 DP——客户端梯度加本地 DP,或聚合加中心 DP,防推断用户。
4. 不是银弹:DP 有精度损失、预算消耗、敏感度计算复杂——适合统计场景,不适合需精确结果场景。
⚠️ 常见误读:以为"加了 DP 就完全隐私"。DP 是相对的——ε 大则弱保护。美国普查 2020 ε=19.61 被批"几乎无隐私"。要按敏感度设 ε 并公布。
💡 关键直觉:DP 是相邻数据集(差一个个体)输出分布几乎相同(比≤e^ε),个体加入/移除几乎不改变结果。机制加噪声——拉普拉斯(数值)、高斯((ε,δ)-DP,ML)、指数(离散)、随机响应(本地 DP)。组合定理管理隐私累积——顺序(k·ε)、并行(max)、后处理(不变)、高级(√(k·ε²))。中心 DP(可信收集者,噪声小)vs 本地 DP(不可信,噪声大)vs 混合(分布式)。挑战是精度-隐私权衡、预算管理、敏感度计算、DP-SGD 精度损失。是统计隐私金标准,和 HE/MPC/FL 互补,不是银弹。
本节速览
- DP 核心:相邻数据集(差一个个体)查询输出分布几乎相同(比≤e^ε),个体加入/移除几乎不改变结果。
- 定义:ε-DP(强),(ε,δ)-DP(放宽,δ 极小失败概率)。
- 参数:ε 0.1-1 强/1-10 中/>10 弱,δ 远小于 1/n。
- 机制:拉普拉斯(数值,敏感度/ε)、高斯((ε,δ)-DP,ML)、指数(离散选择)、随机响应(本地 DP)。
- 组合定理:顺序(k·ε)、并行(max,不交子集)、后处理(不变)、高级(√(k·ε²))——管理隐私预算。
- 模式:中心 DP(可信收集者,噪声小精度高)、本地 DP(不可信,噪声大)、混合(分布式+安全聚合)。
- 挑战:精度-隐私权衡、隐私预算管理、敏感度计算、DP-SGD(梯度加噪+裁剪,精度降 1-5%)、流式 DP、公开 ε。
- 库:Google DP、OpenDP、PipelineDP、TF-Privacy、Opacus、IBM DP。
- 案例:美国普查 2020、Apple 键盘/照片、Google RAPPOR、Microsoft 365、Meta 广告归因、Opacus DP-ML。
- 定位:统计隐私金标准(可证/可量化/可组合)、和 HE/MPC 互补(保护输出)、联邦学习核心、不是银弹(精度损失/预算/敏感度)。
差分隐私机制
