Inteligência artificial, sem ruído.
Pesquisa e Ciência2 min

Estudo revela quando SCAFFOLD perde para FedAvg em aprendizado federado

Pesquisa controlada mostra que a dinâmica de Edge of Stability faz os dois algoritmos empatarem, e a sharpness é a chave.

Estudo revela quando SCAFFOLD perde para FedAvg em aprendizado federado

No aprendizado federado, dois algoritmos dominam o debate: o FedAvg, que faz a média simples dos modelos locais, e o SCAFFOLD, que corrige o “desvio de cliente” com gradientes de controle. Um preprint testou os dois em experimentos controlados e encontrou um padrão curioso: quando a dinâmica de “Edge of Stability” aparece, os dois empatam — e quando ela não aparece, o SCAFFOLD vence com folga.

O que foi medido

Os pesquisadores rastrearam a sharpness — a curvatura local do landscape de perda, estimada pelo maior autovalor da Hessiana via método de Lanczos — em redes MLP e CNN treinadas com gradientes em batch completo. Os experimentos usaram 5.000 imagens do CIFAR-10 e do MNIST, divididas entre oito clientes, variando taxa de aprendizado, heterogeneidade de rótulo, intervalo de comunicação, profundidade da rede e tamanho do dataset.

A sharpness de equilíbrio

A sharpness de equilíbrio — o nível em que a medida se estabiliza — foi inversamente proporcional à taxa de aprendizado: dobrar a taxa de 0,005 para 0,01 reduziu o valor à metade. A associação com a heterogeneidade de rótulo diferiu entre os métodos: para o FedAvg, a sharpness caiu de cerca de 550 (h=0) para 350 (h=0,9); o SCAFFOLD foi menos influenciado, mas ficou errático em h=0,9. O intervalo de comunicação quase não mostrou relação com a sharpness.

O sinal que separa os dois algoritmos

O estudo introduziu uma medida de misalignment de atualização — quão perto a atualização de cada algoritmo está do gradiente global real. No SCAFFOLD, o misalignment ficou altamente correlacionado com a sharpness; no FedAvg, praticamente não. A hipótese dos autores: a correção de gradiente histórico do SCAFFOLD se torna pouco confiável em alta sharpness, o que explicaria por que o FedAvg se sai comparável (ou levemente melhor) quando a dinâmica de Edge of Stability está ativa.

O que fica em aberto

Os resultados vêm de experimentos computacionais controlados — MLPs e CNNs pequenos, gradientes em batch completo, datasets de imagem selecionados. Não foram testados gradientes estocásticos, Transformers, datasets maiores ou tarefas de linguagem, e não há uma fórmula fechada para prever a sharpness de equilíbrio. A lição prática, porém, é relevante para quem implanta federated learning: a escolha entre FedAvg e SCAFFOLD pode depender menos da profundidade da rede e mais da complexidade do dataset e da sharpness resultante.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.