3.4 差分隐私 (Differential Privacy, DP)


3.4 差分隐私 (Differential Privacy, DP)

本节摘要:统计结果怎么保护个体?差分隐私给数学答案。本节讲清楚 DP 定义(相邻数据集不可区分)、机制(拉普拉斯/高斯/指数)、组合定理、本地 vs 中心 DP、工程落地。读完你能给项目配 DP 参数。

一、DP 的核心问题

差分隐私原理

差分隐私原理

传统匿名化(去姓名/身份证)不够——多数据集交叉能重新识别个体。1997 年马萨诸塞州州长医疗记录被重新识别(去名但含邮编+生日+性别,和选民登记交叉)。2006 年 AOL 搜索记录"匿名"但能从搜索内容识别个体。

需要更强的保证——即使攻击者有背景知识,也不能从统计结果推断个体是否在数据集。

差分隐私(Differential Privacy, DP):Dwork 2006 提出,数学化"个体加入/移除几乎不改变输出"——相邻数据集(差一个个体)的查询输出分布几乎相同。

直觉:你的数据在不在,结果几乎一样——所以从结果看不出你的数据。

二、DP 的形式定义

ε-差分隐私:机制 M 满足 ε-DP,如果对所有相邻数据集 D, D'(差一个个体)和所有输出集 S:

Pr[M(D) ∈ S] ≤ e^ε · Pr[M(D') ∈ S]

直觉:相邻数据集输出概率比 ≤ e^ε——ε 小则分布几乎相同(强隐私),ε 大则差异大(弱隐私)。

(ε, δ)-差分隐私:放宽——允许 δ 概率"破坏":
Pr[M(D) ∈ S] ≤ e^ε · Pr[M(D') ∈ S] + δ

δ 是"失败概率"——小概率下不保证。δ 要极小(如 1/n²),否则可能泄露个体。

参数选择:

  • ε:0.1-1 强隐私,1-10 中等,>10 弱。Apple 用 ε≈1-4,Google 用 ε≈1-2,美国普查 2020 用 ε≈19.61(争议大)。
  • δ:要远小于 1/n(n 是数据集大小),如 1e-6 到 1e-9。

三、DP 的机制

怎么实现 DP?加噪声。

1. 拉普拉斯机制(Laplace Mechanism)

  • 对查询 f,加 Laplace 噪声:M(D) = f(D) + Lap(Δf/ε),Δf 是 f 的敏感度(相邻数据集 f 最大变化)。
  • 适合数值查询(求和、计数、均值)。
  • 敏感度小(如计数 Δf=1)则噪声小,敏感度大(如求和 Δf=最大值)则噪声大。

2. 高斯机制(Gaussian Mechanism)

  • 加高斯噪声:M(D) = f(D) + N(0, σ²),σ ≈ Δf·√(2ln(1.25/δ))/ε。
  • 给 (ε, δ)-DP,比拉普拉斯更易分析组合。
  • 机器学习训练常用(DP-SGD)。

3. 指数机制(Exponential Mechanism)

  • 对离散输出(非数值),按效用函数 u(D, r) 指数概率选输出。
  • 适合选择类查询(如"最受欢迎的项")。

4. 随机响应(Randomized Response)

  • 本地 DP 的基础——用户回答前随机翻转:以 p 概率真答,1-p 概率假答。
  • 个体回答有噪声,聚合时去噪得群体统计。
  • 不需信任收集者(本地加噪)。

四、DP 的组合定理

DP 的关键——多次查询的隐私累积。

1. 顺序组合(Sequential Composition)

  • k 次 ε-DP 查询,总隐私是 k·ε。
  • 直觉:每次查询泄露一点,累积泄露增加。

2. 并行组合(Parallel Composition)

  • k 次查询各作用不相交子集,总隐私是 max(ε_i)(不是 k·ε)。
  • 直觉:不交子集不累积,因为每个个体只被查一次。

3. 后处理(Post-processing)

  • 对 ε-DP 输出做任意函数,仍是 ε-DP。
  • 直觉:后处理不增加隐私泄露(信息已限定)。

4. 高级组合(Advanced Composition)

  • k 次 (ε, δ)-DP,总隐私约 ε' = O(√(k·ε²)) + k·δ,比顺序组合 k·ε 好。
  • 让多次查询隐私累积更慢。

组合定理让"隐私预算"管理——总 ε 分配给多次查询,超预算则停。

五、本地 DP vs 中心 DP

按加噪位置分:

1. 中心 DP(Central DP)

  • 数据集中到可信收集者,收集者在结果上加噪。
  • 优点:噪声小(一次加噪),精度高。
  • 缺点:要信任收集者——收集者看到原始数据。
  • 适合:可信机构(如统计局)、数据已集中的场景。

2. 本地 DP(Local DP)

  • 用户在设备上本地加噪,只发噪声数据给收集者。
  • 优点:不信任收集者(数据未集中)。
  • 缺点:噪声大(每用户加噪,聚合去噪),精度低。
  • 适合:不可信收集者、隐私敏感场景(如 Google RAPPOR 收 Chrome 使用数据、Apple 收键盘数据)。

3. 混合

  • 分布式 DP——多方各加噪,安全聚合(用 MPC/HE 聚合)。
  • 兼顾——不信任收集者,但噪声比纯本地小。

六、DP 的工程挑战

1. 精度-隐私权衡:ε 小则噪声大则精度低。要找平衡——足够隐私且结果可用。

2. 隐私预算管理:总 ε 分配给多次查询,超预算则停。要监控累积消耗。

3. 敏感度计算:要算查询敏感度(Δf),复杂查询敏感度难算。

4. 机器学习 DP:DP-SGD(Abadi 2016)——训练时梯度加噪+裁剪。精度损失(如 ImageNet 降 1-5%)、训练慢。

5. 流式 DP:流数据持续查询,隐私随时间累积。用滑动窗口、事件级 DP。

6. 公开 ε:要透明公布 ε,让用户和监管评估。Apple/Google 公布,美国普查 2020 公布 ε=19.61 引争议(太大)。

七、DP 的工程落地

1. 库

  • Google DP 库(开源,C++/Java/Go)。
  • OpenDP(哈佛,Python/R)。
  • PipelineDP(Google,分布式)。
  • TF-Privacy(TensorFlow,DP-SGD)。
  • Opacus(PyTorch,DP-SGD)。
  • IBM DP Library

2. 应用案例

  • 美国普查 2020:用 DP 发布统计,保护个体(虽 ε 大争议)。
  • Apple 键盘/照片:本地 DP 收使用数据,改进产品。
  • Google RAPPOR:Chrome 浏览器统计,本地 DP。
  • Microsoft 365:遥测用 DP。
  • Meta 广告归因:DP 保护用户。
  • DP 机器学习:Opacus 训练隐私模型。

3. 部署要点

  • 选模式:可信收集者用中心 DP,不可信用本地 DP,混合用分布式。
  • 设 ε:按敏感度设,强隐私 0.1-1,中等 1-10,公布让评估。
  • 管预算:总 ε 分配,监控累积,超预算停。
  • 算敏感度:查询敏感度要算对,复杂查询用高级机制。
  • 评估精度:加噪后结果可用性,调 ε/噪声平衡。
  • 持续监控:隐私预算消耗、精度变化、新查询影响。

八、DP 在 PETs 中的定位

1. 统计隐私金标准:DP 是统计发布/查询/ML 训练的隐私标准——可证明、可量化、可组合。

2. 和 HE/MPC 互补:HE/MPC 保护计算过程,DP 保护输出——MPC 算完结果加 DP 发布,HE 推理结果加 DP。

3. 联邦学习核心:联邦学习常用 DP——客户端梯度加本地 DP,或聚合加中心 DP,防推断用户。

4. 不是银弹:DP 有精度损失、预算消耗、敏感度计算复杂——适合统计场景,不适合需精确结果场景。

⚠️ 常见误读:以为"加了 DP 就完全隐私"。DP 是相对的——ε 大则弱保护。美国普查 2020 ε=19.61 被批"几乎无隐私"。要按敏感度设 ε 并公布。

💡 关键直觉:DP 是相邻数据集(差一个个体)输出分布几乎相同(比≤e^ε),个体加入/移除几乎不改变结果。机制加噪声——拉普拉斯(数值)、高斯((ε,δ)-DP,ML)、指数(离散)、随机响应(本地 DP)。组合定理管理隐私累积——顺序(k·ε)、并行(max)、后处理(不变)、高级(√(k·ε²))。中心 DP(可信收集者,噪声小)vs 本地 DP(不可信,噪声大)vs 混合(分布式)。挑战是精度-隐私权衡、预算管理、敏感度计算、DP-SGD 精度损失。是统计隐私金标准,和 HE/MPC/FL 互补,不是银弹。

本节速览

  • DP 核心:相邻数据集(差一个个体)查询输出分布几乎相同(比≤e^ε),个体加入/移除几乎不改变结果。
  • 定义:ε-DP(强),(ε,δ)-DP(放宽,δ 极小失败概率)。
  • 参数:ε 0.1-1 强/1-10 中/>10 弱,δ 远小于 1/n。
  • 机制:拉普拉斯(数值,敏感度/ε)、高斯((ε,δ)-DP,ML)、指数(离散选择)、随机响应(本地 DP)。
  • 组合定理:顺序(k·ε)、并行(max,不交子集)、后处理(不变)、高级(√(k·ε²))——管理隐私预算。
  • 模式:中心 DP(可信收集者,噪声小精度高)、本地 DP(不可信,噪声大)、混合(分布式+安全聚合)。
  • 挑战:精度-隐私权衡、隐私预算管理、敏感度计算、DP-SGD(梯度加噪+裁剪,精度降 1-5%)、流式 DP、公开 ε。
  • :Google DP、OpenDP、PipelineDP、TF-Privacy、Opacus、IBM DP。
  • 案例:美国普查 2020、Apple 键盘/照片、Google RAPPOR、Microsoft 365、Meta 广告归因、Opacus DP-ML。
  • 定位:统计隐私金标准(可证/可量化/可组合)、和 HE/MPC 互补(保护输出)、联邦学习核心、不是银弹(精度损失/预算/敏感度)。

差分隐私机制

差分隐私机制


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U