Inteligência artificial, sem ruído.
Pesquisa e Ciência3 min

Meta FAIR apresenta RPMs: modelos que classificam experimentos de ML antes de gastar horas de GPU

Modelos de preferência da Meta FAIR classificam experimentos de ML antes de gastar horas de GPU, elevando o AIRS-Bench de 0,684 para 0,729.

Meta FAIR apresenta RPMs: modelos que classificam experimentos de ML antes de gastar horas de GPU

O gargalo que os RPMs atacam: gerar ideias é barato, validar não é

Agentes de pesquisa em IA já conseguem propor, implementar e avaliar seus próprios experimentos de aprendizado de máquina. A geração de ideias virou commodity; a verificação, não. Treinar um único candidato pode consumir de horas a dias de GPU, então um agente propõe muito mais candidatos do que consegue executar. Decidir quais experimentos realmente rodam é a verdadeira alavanca do progresso científico automatizado.

É esse gargalo que uma equipe da FAIR (Meta), em parceria com a Universidade de Oxford e a University College London, formaliza como “preferência de pesquisa” — e ataca com os AI Research Preference Models (RPMs).

O que os RPMs fazem — e o que deliberadamente não fazem

Um RPM classifica candidatos ainda não executados e escolhe um para rodar. O detalhe importante: ele nunca prevê uma pontuação absoluta. A equipe constatou que modelos de linguagem são pouco confiáveis para prever métricas ou resultados de execução. Em vez de adivinhar “este experimento vai atingir score X”, o RPM compara candidatos entre si e escolhe o mais promissor.

Quanto à implementação, a resposta é “parcialmente”: os RPMs usam LLMs pré-treinados congelados, sem fine-tuning; o scaffold AIRA-dojo e o benchmark AIRS-Bench são open source; e o backbone Qwen3.6-27B tem pesos abertos.

Onde o RPM entra no loop do agente

O AIRA-dojo é uma busca em árvore evolutiva: seleção gulosa de pais, operadores de Draft, Improve e Debug, e o nó com maior pontuação de validação retornado ao final. O RPM intervém apenas na criação de filhos. Em vez de gerar um único filho e executá-lo, o agente aplica o operador 15 vezes em paralelo para produzir 15 candidatos não executados e os compara dois a dois em um torneio eliminatório. Só o vencedor é executado.

Cada comparação é fundamentada em nós de contexto coletados por uma busca em largura (BFS) na árvore já explorada, cada um exibido com a pontuação de validação que obteve.

Resultados e implicações práticas

O ganho relatado é expressivo: os RPMs elevaram o AIRS-Bench de 0,684 para 0,729 sem nenhum treinamento adicional. Para laboratórios e equipes que rodam experimentos de ML em escala, a implicação é clara — direcionar horas de GPU para os candidatos com maior chance de sucesso, em vez de queimá-las em uma busca cega.

O trabalho também reforça uma tendência mais ampla: o custo computacional está migrando da “inteligência” do modelo para a “orquestração” do processo de pesquisa. Modelos congelados e reutilizáveis, combinados com busca estruturada, conseguem extrair mais valor das mesmas GPUs — um argumento econômico relevante para o mercado brasileiro, onde o acesso a hardware de ponta é caro e cada hora de treinamento precisa render.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.