1.1 核心概念与发展历程


1.1 核心概念与发展历程

本节摘要:PETs 是什么?从哪来?本节讲清楚 PETs 的定义、核心理念(数据可用不可见)、从 1970s 到现在的发展脉络、以及为什么 GDPR 后突然爆发。读完你能理解 PETs 不是新概念,但近年才被迫落地。

一、什么是 PETs

隐私增强技术(Privacy-Enhancing Technologies, PETs):一类在数据流通和使用中保护隐私的技术——让数据"可用不可见",即能计算/分析/共享,但不暴露原始数据。

注意定义的三个关键:

  • 流通和使用中:不是静态加密存储(那是传统加密),是数据在计算/传输/共享时保护。
  • 可用:数据要能用——能统计、能训练模型、能验证、能联合计算。
  • 不可见:原始数据不暴露给对方——对方拿到结果但看不到输入。

对比传统手段:

  • 加密存储:数据静止时加密,但用时解密就暴露。PETs 解决"用时也保护"。
  • 匿名化:去掉姓名/身份证,但多数据集交叉能重新识别。PETs 用密码学/统计保证更难关联。
  • 访问控制:限制谁能看,但授权人能看到全部。PETs 让计算者看不到原始数据。

二、核心理念:数据可用不可见

PETs 的核心理念是"数据可用不可见"——把"能计算"和"能看到"分离。

传统模式:A 要用 B 的数据 → B 把数据发给 A → A 看到数据并计算。隐私风险:A 看到了不该看的。

PETs 模式:A 要用 B 的数据 → B 用 PETs 让 A 能计算但看不到原始 → A 拿到结果。隐私保护:A 算了但没看到。

实现"可用不可见"的方法:

  • 密码学:加密后直接计算(同态加密)、多方各持部分(MPC)、证明而不展示(ZKP)。
  • 统计:加噪声让结果可用但个体不可识别(差分隐私)。
  • 系统级:硬件隔离让数据在飞地内计算(TEE)。
  • 分布式:数据不动模型动(联邦学习)。

每类方法解决不同场景,后面章节详述。

三、发展历程

1970s-1980s:理论奠基

  • 1977:RSA 公钥加密发明,密码学基础。
  • 1982:姚期智提出"百万富翁问题"——两个百万富翁想知道谁更富但不透露财富,启发了 MPC。
  • 1985:ElGamal、零知识证明概念(Goldwasser-Micali-Rackoff)。

1990s:理论成熟

  • 1986-1999:MPC 安全性证明(Goldreich-Micali-Wigderson)、GMW 协议、BGW 协议。
  • 1999:Chaum 提出匿名通信(混合网络),后来演化为 Tor。
  • 2006:差分隐私正式定义(Dwork)——给隐私保护数学基础。

2000s:工程萌芽

  • 2009:全同态加密发明(Gentry)——理论突破,让加密后任意计算成为可能(虽慢)。
  • 2013:Intel SGX 商用——TEE 走向实用。
  • 2016:Google 联邦学习论文——数据不动模型动,工业落地。

2018-至今:爆发期

  • 2018:GDPR 生效——法律强制隐私保护,PETs 从"锦上添花"变"必需"。
  • 2020-2022:差分隐私被 Apple/Google/美国普查采用,联邦学习在手机输入法落地。
  • 2023-2024:大模型隐私问题(训练数据泄露)推动 PETs 在 AI 领域应用,PETs 标准化加速。

所以 PETs 不是新概念——理论 40 年,但工程落地是近 5-10 年,法律驱动是近 3 年。

四、为什么近年爆发

PETs 爆发的原因:

1. 法律驱动:GDPR(欧盟)、CCPA(加州)、PIPL(中国)、PDPA(新加坡)等强制隐私保护,违规罚款巨额。企业被迫找技术方案,PETs 是为数不多的"既能用数据又合规"的路。

2. 数据流通需求:跨组织数据合作(银行联合风控、医院联合研究、广告跨平台归因)需求增长,但传统"数据集中"模式法律不允许,PETs 让"数据不出域"合作成为可能。

3. AI 隐私问题:大模型训练数据可能泄露(记忆攻击),用户数据被模型"记住"。PETs(差分隐私训练、联邦学习)是缓解方案。

4. 硬件成熟:TEE(SGX/TrustZone/SEV)商用,让"硬件隔离计算"可行,降低了部分 PETs 的部署门槛。

5. 标准化:ISO/IEC 27550(隐私工程)、NIST PETs 指南等标准出台,给企业选型依据。

6. 供应商生态:专业 PETs 公司(Oasis Labs、Cornami、Zama)和大厂(Google、Microsoft)推动,工具链成熟。

五、PETs 的定位

PETs 发展时间线

PETs 发展时间线

PETs 在隐私保护体系中的定位:

  • 不是替代传统手段:PETs 不替代加密存储、访问控制、审计——它们互补。
  • 解决"数据流通"场景:传统手段解决"数据存储",PETs 解决"数据使用/共享"。
  • 工程权衡技术:PETs 有性能/精度/部署代价,不是"零成本隐私"。
  • 合规工具之一:PETs 是合规工具箱的一员,不是合规全部——还需治理、流程、审计。

理解这定位,避免两个极端:一是"PETs 无用"(认为传统加密够了),二是"PETs 万能"(认为上了 PETs 就完全隐私)。实际是 PETs 在特定场景提供特定保护,要按需选型。

⚠️ 常见误读:以为"PETs 是新技术"。理论 40 年(1977 RSA、1982 MPC、2006 差分隐私),工程落地近 10 年,法律驱动爆发近 3 年。是成熟理论近年被迫落地。

💡 关键直觉:PETs 是数据流通中保护隐私的技术,核心理念"可用不可见"——能计算但不暴露原始。对比传统加密(静态)和匿名化(去标识),PETs 用密码学/统计/系统级/分布式实现。发展 1970s 理论、2000s 工程、2018 后法律驱动爆发。定位是传统手段互补、工程权衡技术、合规工具之一。

要点速记

  • 定义:PETs 在数据流通/使用中保护隐私,让数据"可用不可见"——能计算但不暴露原始。
  • 三个关键:流通中使用、可用(能算)、不可见(不暴露原始)。
  • 对比传统:加密存储(静态)、匿名化(去标识易关联)、访问控制(授权人看全)——PETs 解决"用时也保护"。
  • 核心理念:分离"能计算"和"能看到",用密码学/统计/系统级/分布式实现。
  • 发展历程:1970s 理论奠基(RSA/MPC 概念)、1990s 理论成熟(MPC 证明/差分隐私)、2000s 工程萌芽(FHE/SGX/联邦学习)、2018 后法律驱动爆发(GDPR)。
  • 爆发原因:法律驱动、数据流通需求、AI 隐私问题、硬件成熟、标准化、供应商生态。
  • 定位:传统手段互补、工程权衡技术、合规工具之一——不是替代也不是万能。

实际影响

PETs 的工程价值在数据要素流通场景中尤为突出:当多个机构需要协作分析但受制于数据主权与合规要求时,PETs 提供了"数据不动模型动"或"数据可用不可见"的可行路径。例如金融机构间的联合风控、医疗机构间的多中心研究、政务数据的安全共享,都依赖 PETs 在保护原始数据的同时释放数据价值。理解 PETs 的发展脉络,有助于把握其技术演进与行业需求的关系。

总体而言,PETs 已从学术密码学概念演变为数据要素市场的关键基础设施。把握其定义边界、发展脉络与分类框架,是后续学习各类具体技术与工程实践的前提。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U