Inteligência artificial, sem ruído.
Pesquisa e Ciência2 min

Pulsos de weight decay revelam sinal precoce de grokking em redes neurais

Estudo identifica resposta ordenada a perturbações temporárias que aparece milhares de épocas antes de a acurácia de teste melhorar.

Pulsos de weight decay revelam sinal precoce de grokking em redes neurais

O que é grokking

“Grokking” é o fenômeno em que uma rede neural permanece por um longo período com acurácia de teste próxima do acaso e, de repente, passa a generalizar. Entender o que acontece dentro da rede durante esse “platô pré-generalização” é um dos problemas abertos da interpretabilidade de modelos.

Um pré-print do arXiv traz uma pista nova: há um sinal ordenado nas respostas da rede a pulsos temporários de weight decay (decaimento de peso) que aparece antes de a acurácia de teste melhorar de forma visível.

Como o teste funcionou

A partir de um estado de treinamento salvo, cada ramificação mudava o coeficiente de weight decay por 500 épocas, usando perturbações positivas ou negativas de 0,05 a 0,25, e depois restaurava a configuração original. Os pesquisadores examinaram 23.926 pontos de início de pulso e 239.260 ramificações de intervenção em 70 execuções de referência.

O sinal antes da mudança

No início do platô (até cerca da época 5.000), as respostas não mostravam relação estável com a direção ou magnitude do pulso. Por volta das épocas 5.000 a 5.500, essa relação se tornou persistente: aumentos mais fortes de weight decay foram associados a generalização mais cedo, e diminuições mais fortes, a generalização mais tarde — mesmo com a acurácia de teste ainda no nível do acaso.

A estrutura de dose do weight decay foi estabelecida cerca de 4.000 épocas antes de a execução cruzar 0,90 de acurácia de teste. O padrão se repetiu nas três tarefas testadas (paridade, paridade esparsa e adição modular fatorada), mas os pesquisadores ressaltam que isso vale para os três grupos algorítmicos estudados, não necessariamente para todos os problemas de aprendizado de máquina.

Limites do estudo

Os autores chamam o padrão de “canalização da seleção de função” — a seleção de função se torna mais restrita com o tempo, enquanto a resposta ordenada à dose persiste. A interpretação depende das tarefas pequenas e algorítmicas usadas, e se o fenômeno se estende a modelos maiores ou dados não algorítmicos segue em aberto. O trabalho é um pré-print versão 1, datado de 26 de agosto de 2026, e ainda não passou por revisão por pares.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.