Google 把联邦学习搬进 TEE:Gboard 隐私预算缩小 3 倍,训练仅 3 周

Toward provably private learning from federated data

Katharine Daly, Yu Xiao, Zachary Garrett, Brett McLarnon, Jianpeng Hou, Arun Ganesh, Yanxiang Zhang, Noriyuki Takahashi, Haicheng Sun, Yuanbo Zhang, Timon Van Overveldt, Daniel Ramage

cs.CR

2026-09-26

设备只上传加密原始数据,训练全部搬进服务器 TEE,Gboard 英文模型隐私预算缩到三分之一,训练从 2 个月压到 3 周。

这篇在解决什么

联邦学习从 2016 年起支撑 Google、Apple 的键盘预测和语音识别,基本形态是设备本地算梯度、服务器聚合。这个形态有三个长期代价:模型大小被手机算力封顶;几十万台可用时间不可预测的设备要做多轮同步,运营成本高;隐私声明只能靠信任,用户和第三方审计者看不到服务端代码,没法核实噪声是否真的按声称的方式加上了。

Google 在 2024 年重定义联邦学习,把要求收敛到四条隐私原则:数据最小化、匿名化、透明与控制、可验证可审计。这篇论文描述的就是按这四条造出来、并且已经跑在生产上的系统。

方法

核心置换只有一处:设备不再上传受安全聚合保护的梯度,而是上传用 KMS 公钥加密的原始数据,训练整个搬进服务器端的 TEE(基于 AMD SEV-SNP 和 Intel TDX)。

上传原始数据的直接收益是自由度:DP 训练循环在数据收齐后才运行,设备可用性不再决定参与模式。系统可以让每台设备参与次数相等、把轮间距 minSep 推到当前数据量下的最大值,再据此优化 BLT 噪声矩阵(带状下三角的相关噪声)和噪声乘子。同样的 zCDP 预算,需要加的噪声更小。

结果

日文模型(3000 轮,cohort 6500)的设备覆盖:

对比项旧系统新 TEE 系统
实际参与38 天里 8.5M 台,占 35.5M 可用设备的 23.9%约 6 天收 17.8M 份上传,全部入训
未参与原因20.5M 台从未收到任务,6.5M 台收到后被中断绝大多数只是没有合格数据

英文模型的隐私-效用(两边都用 MF-DP-FTRL,cohort 6500):

指标旧系统新 TEE 系统
噪声乘子(zCDP=0.232,T=5000)9.545.16
maxP / minSep(T=5000)8 / 5613 / 1822
训练设置8616 轮、85 天、噪声乘子固定 7.385000 轮,按 11.8M 份上传运行时定参

线上 A/B(每臂 3.5M 台设备):最优 TEE 臂的隐私预算 zCDP=0.215,只有换算到同一机制下的旧生产模型(0.641)的三分之一,Words Per Minute 和 Words Modified Ratio 两项体验指标持平;训练用时 3 周,旧模型要 2 个月。

为什么重要

论文称之为第一次让中心 DP 保证可以被外部验证。以前的 DP 声明是「信不信由你」,现在程序和二进制哈希躺在公开透明日志里,任何人都能核对声明的代码和实际执行的代码是不是同一份。工程收益同样实际:训练不再受设备算力和可用性牵制,参与在 17.8M 份上传上无偏,训练周期从两个月压到三周。对做隐私保护机器学习的团队,这条路给出了 SecAgg 密码学方案之外的另一种取舍:信任从数学难题换到硬件远程证明,换来可验证性和更优的隐私-效用曲线。

局限与存疑

作者自列的:当前一代 TEE 有已知安全弱点;专有的按用户处理逻辑不破坏对外可验证的 DP 保证,但要受侧信道可观测性限制;每个模型只测了一组超参,maxP 跳变处信噪比会突然下跌,最优配置还需要更多实验;管道运营方仍能看到每轮用了哪些(加密的)上传,遮蔽它以获得采样隐私放大是后续工作;TTL 逼着运营者在多等上传和给训练留时间之间做取舍。规模上目前只训到 10M 参数的模型,更大的要等 GPU 版工作 TEE。

两点存疑:可验证性的地基是 AMD 和 Intel 的硬件承诺,侧信道问题没有解决,只是被划出了保证范围;A/B 只报了两项打字体验指标持平,没有给出模型准确率的直接对照,摘要里 better accuracy 的说法在 A/B 部分没有对应数字。

术语

原文与代码

社区讨论

相关论文

全部论文解读