Google 为 Gboard 部署可验证的私密联邦学习系统
Google Research 推出使用可信执行环境和公开透明日志的联邦学习架构,为 Gboard 的英文和日文下一词预测提供可外部验证的隐私保障。

背景概述
Google Research 最近宣布了一套全新的联邦学习架构,专门为移动输入法 Gboard 的英文和日文下一词预测模型提供可验证的隐私保障。该系统把关键的训练流水线迁移到基于可信执行环境(TEE)的已认证服务器安全区,并配合公开透明的日志服务,使差分隐私的承诺能够被第三方独立审计。
架构工作原理
在客户端,所有训练示例先被强加密,并附带一段访问策略。策略明确规定只有符合条件的服务器端 TEE 程序可以解密数据,并限定哪些匿名化结果可以被发布。策略与加密负载通过密码学绑定,确保未经授权的工作负载永远看不到原始输入。
系统内部还部署了一个专用的密钥管理集群,同样运行在 TEE 内部。该集群使用 RAFT 共识协议来管理解密密钥的生成、轮换和撤销。只有在满足已发布策略的工作负载被调度到安全区时,密钥才会被安全释放,即使攻击者控制了安全区外的进程,也无法直接获取明文数据。
通过 Rekor 实现公开可验证性
所有访问策略以及密钥使用的关键事件都会被写入公开的 Rekor 透明日志。外部观察者可以自由查询该日志,准确看到哪些服务器工作负载获得了授权、何时解密了哪些加密示例,以及哪些匿名化结果被发布,从而在无需依赖 Google 内部基础设施的情况下完成完整审计。
- 在 Rekor 中发布供公众检查的策略
- 使用 RAFT 的 TEE 托管密钥管理集群
- 来自 Confidential Federated Compute 仓库的可复现二进制文件
- 仅有指标和差分隐私模型权重离开安全区
对 Gboard 的收益
Google 报告称,基于该系统训练的 Gboard 英文和日文下一词预测模型已经上线。相较于此前的生产流水线,新架构实现了更快的训练周期、更高的预测准确率,同时在差分隐私预算上实现了更紧凑的消耗。
梯度计算和调度被迁移到服务器端后,设备不再需要长时间保持在线状态即可参与训练。这降低了对用户设备同步的依赖,使得系统能够在更大、更具多样性的用户群体中优化隐私参数,提升差分隐私模型的整体效用。
在整个过程中,只有聚合后的统计指标和差分隐私模型权重会被暴露给工作负载运营者。原始加密示例始终保留在授权的安全区内,并在限定时间后自动销毁,显著降低了数据泄漏的攻击面。
Google 同时提供了密钥管理和数据处理二进制文件的可复现构建方式,这些构件源自开源的 Confidential Federated Compute 仓库。研究者和审计员可以下载相同的二进制文件,复现安全区内部的执行路径,以验证代码的完整性和行为。
尽管取得了上述进展,TEE 本身仍面临代际限制和潜在的侧信道攻击风险。公开的策略和日志只能证明流程符合设计,但无法消除硬件缺陷、实现漏洞或更广泛的数据治理实践带来的全部风险。
对于依赖 Gboard 或类似联邦学习服务的企业和组织而言,这一变化意味着他们可以指向一个不仅仅是口头承诺的隐私保证。通过公开日志进行审计的能力为监管合规提供了额外的信心,尤其是在那些要求展示数据保护合规性的司法管辖区。
本地化结语:在中国市场,Gboard 的用户数量持续增长,隐私合规已成为产品竞争的关键因素。Google 通过可验证的联邦学习系统,为本地用户提供了更透明的隐私保护路径,也为国内监管机构提供了可审计的技术依据,推动移动输入体验与数据安全的同步提升。
信息来源
- Toward provably private learning from federated dataGoogle Research · 2026年10月2日
- Toward provably private learning from federated dataarXiv · 2026年9月25日



