Inteligência artificial, sem ruído.
Modelos e LLMs2 min

Muon: otimizador reduz interferência entre tarefas e melhora fusão de modelos em até 5 pontos

Estudo mostra que o otimizador Muon controla a norma espectral por construção e supera o AdamW em fusão de modelos e aprendizado contínuo.

Muon: otimizador reduz interferência entre tarefas e melhora fusão de modelos em até 5 pontos

Treinar um modelo para desempenhar bem várias tarefas ao mesmo tempo é um dos problemas mais antigos do aprendizado de máquina. Duas linhas de pesquisa — aprendizado contínuo e fusão de modelos (model merging) — tentam resolvê-lo por caminhos diferentes, mas um novo estudo do arXiv mostra que ambas enfrentam, na verdade, o mesmo fenômeno: a interferência entre tarefas.

Duas dificuldades, uma só causa

No aprendizado contínuo, o vilão é o esquecimento catastrófico: aprender uma tarefa nova apaga o que o modelo já sabia da anterior. Na fusão de modelos, o erro de disentanglement dos pesos embaralha habilidades vindas de modelos diferentes. Os autores demonstram que os dois casos são instâncias de um mesmo efeito: uma atualização de parâmetro útil para uma tarefa desloca a saída do modelo em outra.

Eles formalizam essa interferência como um produto interno de Frobenius por camada, <ΔW_ℓ, J_ℓ(x)>_F, e derivam um limite superior que isola a norma espectral ‖ΔW_ℓ‖₂ como o fator controlável pelo otimizador.

O papel do Muon

É aí que entra o Muon, otimizador que vem ganhando tração na comunidade open source. O trabalho mostra que o Muon regula justamente a norma espectral “por construção”, apertando o limite de interferência para as duas frentes — aprendizado contínuo e fusão de modelos — de forma complementar às soluções existentes.

Nos experimentos, trocar o AdamW pelo Muon melhorou a acurácia em até +5,02 pontos no benchmark de fusão de oito tarefas, usando três backbones CLIP diferentes. No aprendizado contínuo, o ganho foi uniformemente positivo em dez protocolos de incremento de classe, três de incremento de tarefa e no benchmark MTIL de 11 tarefas.

Por que isso importa

Para quem treina ou funde modelos locais, a escolha do otimizador deixa de ser um detalhe de implementação e passa a ser uma alavanca de qualidade. O Muon se posiciona como alternativa com princípio matemático ao AdamW dominante — especialmente relevante em cenários de treinamento contínuo, onde esquecer o que já se aprendeu custa caro.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.