Google leva aprendizado federado para ambientes de execução confiáveis e o Gboard passa a treinar modelos com privacidade diferencial verificável

O Google Research anunciou um sistema de nova geração de Aprendizado Federado, ou FL, construído sobre Ambientes de Execução Confiáveis, conhecidos pela sigla TEE, que são áreas isoladas de processamento em que o código em execução pode ser verificado por terceiros. Segundo a equipe de pesquisa, a abordagem entrega, pela primeira vez, garantias de privacidade diferencial central que podem ser verificadas externamente no aprendizado federado, ao mesmo tempo em que acelera o treinamento e melhora a precisão dos modelos.

O aprendizado federado foi apresentado pelo Google em 2017 e hoje alimenta recursos como a previsão da próxima palavra e o Smart Compose no teclado Gboard, as sugestões de resposta no Google Mensagens e o Smart Text Selection no Android. A técnica permite treinar modelos a partir de dados que permanecem nos dispositivos dos usuários, sem que as informações brutas sejam expostas a servidores. Ainda assim, os sistemas anteriores carregavam uma lacuna de confiança: os dispositivos enviavam dados para agregação imediata, mas pessoas de fora não tinham como confirmar que essas informações jamais foram registradas ou inspecionadas.

Aprender Sem Espiar: Google Treina o Gboard em Ambientes de Execução Confiáveis com Privacidade que Qualquer Um Pode Auditar - Imagem complementar

Uma camada adicional chamada Secure Aggregation trouxe proteção criptográfica ao processo, porém ela não era compatível com algoritmos de privacidade diferencial central de ponta, como o DP-FTRL com fatoração de matrizes. Além disso, o próprio Google precisava ser confiado para adicionar corretamente o ruído que garante a privacidade diferencial, técnica que distorce os resultados para impedir a identificação de qualquer indivíduo nos dados. O novo desenho transfere o cálculo dos gradientes dos clientes para o servidor e torna essa lógica verificável, eliminando a necessidade de confiar no operador do sistema.

A arquitetura, baseada em trabalhos anteriores de análise federada confidencial do Google, coordena quatro componentes principais. No envio de dados, cada dispositivo criptografa localmente seus exemplos de treinamento e autoriza previamente uma política de acesso que define quais computações em TEEs podem processar aquelas informações, exigindo que a política seja publicada em um registro público de transparência. Um sistema de gerenciamento de chaves, construído com TEEs que executam o protocolo de consenso RAFT, libera as chaves apenas para cargas de trabalho que correspondam à política estabelecida.

PUBLICIDADE

Na execução, um TEE raiz roda o laço de treinamento em Python e distribui subtarefas para TEEs trabalhadores, com orquestração feita por meio do Federated Language, linguagem derivada do TensorFlow Federated. Somente os pesos do modelo protegidos por privacidade diferencial são liberados ao analista. Para lidar com falhas, cada rodada salva um estado de recuperação criptografado pelo sistema de chaves, permitindo retomar o treinamento sem vazar informações sensíveis.

A verificabilidade das garantias de privacidade se apoia no registro público Rekor, do projeto Sigstore, onde as políticas de acesso são publicadas e onde auditores externos podem acompanhar toda carga de trabalho de servidor que poderia receber dados de um dispositivo. Os binários do sistema de chaves e do processamento de dados podem ser construídos de forma reproduzível a partir de código aberto. Para proteger arquiteturas de modelos proprietárias, os TEEs permitem carregar em tempo de execução lógica serializada, mas toda a lógica relevante à privacidade precisa permanecer embutida no programa verificado. Os operadores veem apenas métricas e pesos protegidos, e os dados criptografados só podem ser decifrados por um período limitado após o envio.

O Gboard já utilizou o sistema para lançar modelos de previsão de próxima palavra em inglês e japonês com garantias de privacidade mais fortes e precisão melhorada. Dois fatores explicam o ganho. Primeiro, todos os envios são coletados antes do início do treinamento no servidor, o que elimina os atrasos causados pela variação na disponibilidade dos dispositivos ao longo do dia e permite calcular um cronograma otimizado de participação e ajustar os parâmetros de privacidade. As curvas de privacidade e utilidade divulgadas pelo Google vieram de um modelo em inglês treinado por 5 mil rodadas com coortes de 6.500 dispositivos nos dois sistemas, o antigo e o novo.

Segundo, o gargalo computacional migrou para o servidor. Modelos anteriores de aprendizado federado levavam de um a dois meses para serem treinados, enquanto agora o treinamento se paraleliza entre máquinas, limitado apenas pela disponibilidade de recursos dos TEEs. O Google relata tempos de computação substancialmente mais rápidos, embora não divulgue uma única cifra de aceleração.

A abordagem também se diferencia de outras estruturas de aprendizado federado. Enquanto o NVIDIA FLARE, o Flower e o pfl-research da Apple são voltados, respectivamente, a kit de desenvolvimento com suporte a hardware confidencial, à construção de sistemas federados e apenas à simulação, a solução do Google é usada em produção em treinamento entre dispositivos no Gboard, com privacidade diferencial central verificável e binários reconstruíveis, tudo sob licença Apache 2.0. Os detalhes completos estão no blog oficial do Google Research, e o trabalho também foi descrito em artigo científico publicado no arXiv sob o identificador 2609.31494.