Google, Gboard의 다음 단어 예측에 검증 가능한 프라이버시 연합 학습 도입
Google Research는 신뢰 실행 환경과 공개 투명성 로그를 활용해 Gboard의 영어·일본어 다음 단어 예측에 외부 검증 가능한 프라이버시를 제공하는 연합 학습 시스템을 출시했습니다.

Google Research는 핵심 학습 파이프라인을 신뢰 실행 환경(TEE) 기반의 인증된 서버 인클레이브로 이동시키는 새로운 연합 학습 아키텍처를 발표했습니다. 이 설계는 시스템의 차등 프라이버시 보장을 제3자가 검증할 수 있게 하여, 이전 연합 설정의 불투명한 프라이버시 보장보다 한 단계 앞선 접근을 제공합니다.
아키텍처 작동 방식
클라이언트 디바이스는 각 학습 예제를 암호화하고, 어떤 서버 측 TEE 프로그램이 데이터를 복호화할 수 있는지와 어떤 익명화된 결과가 공개될 수 있는지를 정의하는 접근 정책을 첨부합니다. 이 정책은 암호화된 페이로드와 암호학적으로 결합되어, 권한이 있는 워크로드만 원시 데이터를 볼 수 있도록 보장합니다.
TEE 내부에서 실행되는 전용 키 관리 클러스터는 RAFT 합의 프로토콜을 사용해 복호화 키를 관리합니다. 키는 공개된 정책과 일치하는 워크로드에만 제공되어, 인클레이브를 장악하더라도 악의적인 프로세스가 데이터를 접근하는 것을 방지합니다.
Rekor를 통한 공개 검증
모든 접근 정책은 공개 Rekor 투명성 로그에 기록됩니다. 외부 관찰자는 로그를 조회해 어떤 서버 워크로드가 암호화된 예제를 처리하도록 허가받았는지 정확히 확인할 수 있으며, Google 내부 인프라 없이도 감사 추적을 검토할 수 있습니다.
- 공개 검토를 위한 Rekor에 정책 게시
- RAFT 기반 TEE 호스트 키 관리 클러스터
- Confidential Federated Compute 저장소의 재현 가능한 바이너리
- 인클레이브를 떠나는 것은 메트릭과 차등 프라이버시 모델 가중치뿐
Gboard에 대한 이점
Google은 Gboard의 영어 및 일본어 다음 단어 예측 모델이 이제 이 시스템으로 학습되고 있다고 보고했습니다. Google과 동봉된 논문에 따르면, 새로운 파이프라인은 이전 생산 시스템에 비해 학습 주기가 빨라지고 예측 정확도가 높아지며 프라이버시 예산도 감소했습니다.
그래디언트 계산과 스케줄링을 서버로 옮김으로써 동시에 디바이스가 가용해야 하는 필요성이 줄어듭니다. 이는 시스템이 더 크고 다양한 코호트에 걸쳐 프라이버시 매개변수를 최적화하도록 해, 차등 프라이버시 모델의 전반적인 유용성을 향상시킵니다.
노출되는 것은 집계된 메트릭과 차등 프라이버시 모델 가중치뿐이며, 원시 암호화 예제는 권한이 있는 인클레이브 안에 제한된 기간 동안만 존재하고 그 후 자동으로 파기됩니다. 이는 데이터 유출 위험을 최소화합니다.
Google은 또한 키 관리 및 데이터 처리 바이너리를 Confidential Federated Compute 오픈소스 저장소에서 재현 가능하도록 제공해, 인클레이브 내부에서 실행되는 코드의 독립적인 검증을 가능하게 했습니다.
이러한 진보에도 불구하고 TEE는 세대별 제한과 잠재적 사이드채널 공격에 여전히 취약합니다. 코드와 정책의 외부 검증이 하드웨어 결함, 구현 버그, 혹은 광범위한 데이터 거버넌스 관행과 관련된 모든 위험을 제거하지는 못합니다.
이 시스템이 제공하는 검증 가능한 프라이버시 보장은 단순히 이론적 선언에 머무르지 않는다. 공개된 투명성 로그와 연계된 정책 기록을 통해 외부 감시자가 실제로 어떤 워크로드가 데이터에 접근했는지를 실시간으로 확인할 수 있다. 이는 기존 연합 학습에서 흔히 발생하던 ‘블랙 박스’ 문제를 해소하고, 데이터 주체와 규제 기관 모두가 프라이버시 보호 메커니즘이 의도대로 작동했는지를 독립적으로 검증할 수 있게 한다. 특히, 정책이 암호화된 페이로드와 결합되어 전달되므로, 허가되지 않은 프로세스가 원시 데이터를 해독하려는 시도는 즉각적으로 차단된다.
정책 검증 과정은 Rekor 로그에 기록된 해시와 서명을 기반으로 이루어진다. 외부 관찰자는 로그 엔트리를 조회해 특정 정책이 언제, 어떤 서버 인클레이브에 의해 적용되었는지를 추적한다. 이러한 투명성은 내부 감사 절차를 넘어, 제3자 감사기관이나 학계가 독립적으로 시스템의 프라이버시 준수 여부를 평가할 수 있는 기반을 제공한다. 로그는 변경 불가능한 형태로 보관되므로, 사후에 정책이 변조되거나 누락되는 위험을 원천적으로 차단한다.
TEE 내부의 키 관리 클러스터가 RAFT 합의를 통해 복호화 키를 배포한다는 설계는 키 유출 위험을 최소화한다. 합의 프로토콜은 다수의 노드가 키를 검증하고 승인하도록 요구하므로, 단일 노드가 손상되더라도 전체 시스템이 위험에 노출되지 않는다. 또한, 키는 정책과 일치하는 워크로드에만 제공되므로, 인클레이브를 장악한 공격자라도 정책이 허용하지 않는 경우에는 데이터를 복호화할 수 없게 된다. 이러한 다중 방어선은 하드웨어 수준의 취약점이 발견되더라도 전체 프라이버시 체계를 유지하도록 설계되었다.
TEE와 연합 학습 파이프라인의 결합은 학습 효율성에도 영향을 미친다. 그래디언트 계산과 스케줄링을 서버 측으로 이전함으로써 디바이스의 연산 부하와 배터리 소모가 크게 감소한다. 결과적으로 더 많은 사용자가 참여 가능한 코호트를 형성할 수 있어, 차등 프라이버시 매개변수의 최적화가 보다 넓은 데이터 분포를 반영하게 된다. 이는 모델의 예측 정확도를 유지하면서도 프라이버시 예산을 절감하는 효과를 가져온다.
시스템이 제공하는 프라이버시 보장은 원시 데이터가 인클레이브 내부에 제한된 시간만 존재하고 이후 자동 파기된다는 점에서 데이터 유출 위험을 크게 낮춘다. 노출되는 것은 집계된 메트릭과 차등 프라이버시 가중치뿐이며, 이러한 정보는 이미 차등 프라이버시 메커니즘에 의해 노이즈가 추가돼 개인 식별이 불가능하도록 설계되었다. 따라서 외부 공격자가 로그를 분석하더라도 개별 사용자의 입력을 복원할 수 있는 실질적 경로가 차단된다.
그럼에도 불구하고 TEE는 세대별 하드웨어 제한과 사이드채널 공격에 취약할 수 있다. 외부 검증이 코드와 정책의 무결성을 확인하더라도, 하드웨어 자체의 결함이나 미세한 전력 소비 분석을 통한 정보 유출 가능성을 완전히 배제하지는 못한다. 따라서 실무에서는 이러한 잠재적 위험을 보완하기 위해 정기적인 펌웨어 업데이트와 보안 패치 적용, 그리고 다중 레이어의 모니터링 체계를 병행하는 것이 필요하다. 이러한 보완 조치는 프라이버시 보장의 신뢰성을 유지하면서도 실제 운영 환경에서 발생할 수 있는 다양한 위협에 대응하도록 돕는다.
Gboard나 유사한 연합 학습 서비스를 활용하는 한국 기업 및 기관은 이제 프라이버시 보장이 주장에 그치지 않고 공개 로그를 통해 감사 가능하다는 점을 강조할 수 있습니다. 이는 특히 개인정보 보호법 등 데이터 보호 기준을 입증해야 하는 규제 환경에서 신뢰성을 크게 높여줍니다.
출처
- Toward provably private learning from federated dataGoogle Research · 2026년 10월 2일
- Toward provably private learning from federated dataarXiv · 2026년 9월 25일



