5.2 隐私增强技术怎么用


5.2 隐私增强技术怎么用

本节摘要:隐私增强技术在不交出明文的前提下完成统计或训练。差分隐私用校准噪声使单条记录对输出几乎无影响,提供可量化预算。联邦学习把训练留在数据原地,只聚合更新,但仍要防梯度泄露与投毒。同态加密允许密文计算,全同态仍贵;安全多方计算让多方输入不互看。选型看威胁模型:防外部统计推断用 DP;防数据集中用联邦;防计算外包偷看用加密计算。它们都必须叠最小化与访问控制,并诚实公布效用损失。

学习目标

阅读完本节,你应当能够:

  1. 用「相邻数据集输出难区分」说明差分隐私直觉,不写攻击代码。
  2. 列出联邦学习仍存在的泄露与投毒面。
  3. 判断何时该上 MPC/HE,何时只是浪费算力。
  4. 把隐私预算与删除/重训策略写进数据生命周期。

一、选技术之前先写对手

对手是能查询模型的外人,还是能看到更新的聚合服务器,还是能串通其中一方的参与者?差分隐私主要对付「从输出还原个体」;联邦对付「原始数据不要出门」;若服务器恶意,联邦需要安全聚合与对更新再加噪。原文对 DP 的定义很清楚:加入或删除任意一条记录,对统计分析或模型参数的影响微乎其微,从而难以推断某个体是否在集中或其值。这是数学保证,不是营销词,所以必须报告预算参数与组成定理怎么花预算。

二、菜单:效用账单要公开

联邦学习:设备或机构下载当前模型,本地训练,上传梯度或参数,服务器聚合后再分发。医院联盟与手机输入法是典型。挑战是非独立同分布数据、掉线、通信,以及原文在安全章也会提到的投毒——恶意参与者上传有害更新。同态加密:外包方看不见明文仍能算,部分同态已有窄场景,全同态训练大模型仍重。MPC:两家公司算交集大小而不交换名单,轮次与工程复杂。

场景 更匹配 仍须叠加
发布统计表 差分隐私 查询次数上限
多医院联合建模 联邦加安全聚合 对更新 DP、投毒检测
云上处理极度敏感字段 HE 或可信执行环境 密钥与侧信道
两机构求交 MPC 输入真实性

⚠️ 常见坑:epsilon 取很大还宣传「差分隐私」。预算耗尽后的查询应拒绝,而不是继续「差不多也行」。
💡 关键直觉:隐私是花掉的预算。每一次发布、每一轮联邦、每一次解释查询都可能花钱。

图 威胁模型决定选型

图 威胁模型决定选型

机器遗忘仍是研究区:从参数里抠掉某用户,验证困难。工程上更可控的是:训练数据有合法基础与到期日;到期重训;日志与特征缓存同步到期。解释查询也可能泄露,要对解释接口同样限速与加噪,否则第 5.1 节的 SHAP 变成侧信道。

隐私预算账本 total_budget = assigned spend(release_statistics) spend(training_rounds) spend(explanation_queries) if remaining <= 0: refuse

问题:联邦学习能满足数据不出境吗?

有助于减少原文出境,但更新、嵌入、错误样本仍可能跨境。法律上的「出境」认定要看法域,不能把联邦当自动合规。还要看聚合服务器在哪、谁能解密安全聚合的结果。

四、效用账单、组成定理与删除权如何同时记账

差分隐私的组成意味着多次查询会花光预算。必须有账本:统计发布、训练轮次、解释查询都记账,耗尽则拒绝。epsilon 很大还宣传「已保护」是虚假广告。联邦学习的非独立同分布、掉线、通信成本是工程现实;安全聚合与对更新加噪是防恶意服务器与偷梯度的配套,不是可选项。投毒检测针对恶意参与者。医院数据出境认定要看法域,聚合服务器位置与谁能解密,决定「数据不出境」宣传是否诚实。

同态加密适合窄查询与高敏感外包,不适合作为大模型端到端训练的默认。MPC 适合两机构求交,输入真实性仍要保证——垃圾输入会得到合法但无意义的密文结果。匿名化单独上场会被链接攻击击穿。隐私设计默认最小收集,比事后加噪便宜一个数量级。机器遗忘仍研究中,工程诚实方案是留存到期重训、停止增量使用被删除用户。特征缓存、嵌入、日志必须同步到期,否则删除权只删了主库。

内部人员过度授权与二次使用,往往比外部黑客更常见。最小化、目的锁定、查询审计是针对内部对手的 PET 之外的控制。把三种对手画在同一张图上再采购技术,才不会买错贵重安慰剂。

五、选型决策树、泄露分档与假安全感反例

先画三种对手,再买技术。外部查询者:差分隐私加查询上限,解释接口同样记账。中心聚合服务器:联邦必须安全聚合,更新再加噪,否则「数据没出门」是假的。内部人员与供应商:最小化、目的锁定、访问审计,往往比再买一层全同态更先做。医院联盟联合建模:联邦 + 安全聚合 + 对更新的差分隐私 + 投毒检测,四件套缺一则记为未完成。两家机构求交:多方计算,并验证输入真实性——密文上的垃圾输入仍是垃圾。云上处理证件号或病历字段:窄查询用同态或可信执行环境,密钥与侧信道单独评审。发布统计表:差分隐私,预算耗尽拒绝,禁止把很大的隐私参数还写成「已保护」。

泄露档 机制 最低控制 反例
档1 成员推断 过拟合记忆「谁在集中」 推断评测过门、查询限速 只加密磁盘
档2 模型反演 输出重构脸或文本片段 输出过滤、记忆测试、留存上限 「匿名化已删姓名」
档3 梯度泄露 联邦更新还原样本 安全聚合+对更新加噪 宣传联邦即合规出境
档4 解释侧信道 SHAP 或过细推荐文案 解释限速、因素停在类别 「因为你上周去过某医院」
档5 删除权落空 主库删了缓存还在 特征、嵌入、日志同步到期重训 承诺「参数已立即忘记」

治理检查项:隐私预算数字能否报出、组成花费记在哪;删除请求来时增量是否停止、下次重训日是否在日历;供应商与聚合服务器地理位置是否影响出境认定;开源权重是否做过记忆测试。反例:epsilon 取很大仍印「差分隐私」;联邦学习当绝对保险箱;匿名化单独上场对抗链接攻击;把解释接口当免费调试窗不加噪。机器遗忘仍是研究区,工程诚实写法是留存到期与停止增量,不是魔法擦除。

PET 选型决策树 对手=外部统计推断 ──► 差分隐私 + 查询账本 对手=数据集中风险 ──► 联邦,并假设梯度会漏 对手=外包计算偷看 ──► 同态或多方计算,窄场景 对手=内部二次使用 ──► 最小化与目的锁定,先于新加密 删除权触发 ──► 停增量 + 到期重训,禁止承诺立即遗忘

下一节把公平从原则变成可跑在流水线上的检测与缓解。

六、生命周期账本:收集、训练、查询、删除四段怎么花预算

收集段:能不收的默认关;派生特征单独登记合法基础。训练段:差分隐私的组成从第一轮就算,联邦每一轮上传都可能花钱;医院联盟要把聚合服务器位置、谁能解密、掉线策略写进数据说明书。查询段:统计发布、解释接口、成员推断评测本身都消耗预算或暴露面,评测放隔离环境,对外只报过门。删除段:主库、特征缓存、嵌入、日志四份到期日对齐;到期重训进日历,增量学习在删除请求到达当天停止。四段任何一段没有记账人,PET 采购视为未完成。

效用账单必须公开给业务:噪声加大、模型变糊,这是定价问题。业务不能接受任何效用下降,等于要求把泄露成本外部化给被推断的人。全同态加密适合窄查询,拿它当大模型端到端训练的默认,是把研究演示写成产品规格。多方计算求交仍要保证输入真实性。可信执行环境有侧信道与密钥托管问题,不能口头「进了安全区」。内部过度授权往往比外部黑客常见:访问审计、二次使用审批,比再买一层加密更先做。

开源权重若记忆个人数据,公开即扩散,训练前过滤与记忆测试必须进流水线。出境认定不能靠「联邦」三个字自动过关。把三种对手画在同一张图上再签字:外部查询、中心服务器、内部人员。缺一张图就买错贵重安慰剂。

隐私预算账本指定唯一记账人,统计发布、训练轮次、解释查询分列花费。预算耗尽自动拒绝,禁止人工「这次例外」。删除请求工单必须同时勾选主库、缓存、嵌入、日志四项到期。联邦项目把聚合服务器法域写进数据说明书。四项缺一,PET 宣传从材料删除。

威胁模型三格签字后再采购:外部查询、聚合服务器、内部人员。缺一格不准上差分隐私海报。机器遗忘仍研究中,对外口径只许留存到期与停增量,不许承诺参数立即忘记。解释接口按侧信道管理,与统计发布共用账本。

本节要点回顾

  • DP 给可量化保证:必须公布预算与花费。
  • 联邦减少原文集中:不自动防梯度泄露与投毒。
  • HE/MPC 针对计算中偷看:成本决定场景。
  • 匿名化易被击穿:与 PET 叠用。
  • 解释接口也是攻击面:同样记账。
  • 删除权靠留存与重训:不要承诺魔法遗忘。
  • 先威胁模型后采购技术:否则买错贵重安慰剂。

工作纸:隐私预算数字能否报出,组成花费是否记账。联邦的安全聚合与更新加噪。删除权对应的重训日历与缓存到期。三种对手的控制缺口。匿名化是否还被单独宣传。FHE 是否被错误当成大模型默认。解释接口是否当侧信道管。供应商位置是否影响出境认定。内部授权最小化是否比外部黑客更先做。把「数据没出门所以绝对隐私」从材料删除。

下一节把公平从原则变成可跑在流水线上的检测与缓解。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U