Google、Gboardの次単語予測に検証可能なプライバシー保護フェデレーテッド学習を導入
Google Researchは、信頼できる実行環境と公開透明性ログを活用したフェデレーテッド学習システムを展開し、英語と日本語のGboard次単語予測で外部検証可能なプライバシーを約束した。

Google Researchは、トラステッド・エグゼキューション・エンバイロメント(TEE)上に構築された認証サーバーエンクレーブに学習パイプラインの主要部分を移行する新しいフェデレーテッド学習アーキテクチャを発表した。この設計は、従来のフェデレーテッド設定の不透明なプライバシー保証を超え、第三者が差分プライバシーの保証を検証できるようにすることを目的としている。
アーキテクチャの仕組み
クライアントデバイスは各学習サンプルを暗号化し、どのサーバー側TEEプログラムがデータを復号でき、どの匿名化結果が公開可能かを定義するアクセスポリシーを付与する。ポリシーは暗号化ペイロードに暗号的に結び付けられ、権限のあるワークロードだけが生データにアクセスできるようになる。
TEE内部で動作する専用のキー管理クラスタは、RAFTコンセンサスプロトコルを用いて復号キーを管理する。キーは公開されたポリシーと一致するワークロードにのみ提供され、エンクレーブの制御を奪われても不正プロセスがデータにアクセスできないようにする。
Rekorによる公開検証
すべてのアクセスポリシーは公開のRekor透明性ログに記録される。外部の観察者はログを照会して、どのサーバーワークロードが暗号化サンプルを処理する権限を持つか正確に確認でき、Google内部のインフラに依存しない監査証跡が提供される。
- 公開検査用にRekorに掲載されたポリシー
- RAFTを使用するTEEホスト型キー管理クラスタ
- Confidential Federated Computeリポジトリからの再現可能バイナリ
- メトリクスとDPモデル重みのみがエンクレーブ外へ出る
Gboardへのメリット
Googleは、Gboardの英語および日本語次単語予測モデルがこのシステムで訓練されていると報告している。論文と併せて、従来の本番システムに比べて訓練サイクルが高速化し、予測精度が向上し、プライバシー予算が削減されたことが示されている。
勾配計算とスケジューリングをサーバー側に移すことで、同時にデバイスが利用可能である必要性が減少する。これにより、より大規模で多様なコホートにわたってプライバシーパラメータを最適化でき、差分プライバシーモデルの実用性が向上する。
公開されるのは集計メトリクスと差分プライベートなモデル重みだけであり、生の暗号化サンプルは認可されたエンクレーブ内に限定期間保管された後、自動的に破棄されるため、データ漏洩の攻撃面が最小化される。
Googleはまた、キー管理およびデータ処理バイナリをオープンソースのConfidential Federated Computeリポジトリから再現可能にビルドできるようにし、エンクレーブ内部で実行されるコードの独立検証を可能にしている。
これらの進展にもかかわらず、TEEは世代固有の制限や潜在的なサイドチャネル攻撃のリスクを抱えている。コードとポリシーの外部検証だけでは、ハードウェア欠陥、実装バグ、あるいは広範なデータガバナンス慣行に起因するリスクをすべて排除できない。
Gboardや類似のフェデレーテッド学習サービスを利用する企業にとって、この変更はプライバシー保証が単なる主張に留まらず、公開ログを通じて監査可能となったことを意味する。日本の個人情報保護法やEUのGDPRなど、データ保護基準の遵守を実証する必要がある規制当局に対して、より確実なコンプライアンス証拠を提示できるようになる。
出典
- Toward provably private learning from federated dataGoogle Research · 2026年10月2日
- Toward provably private learning from federated dataarXiv · 2026年9月25日



