Agentes de inteligência artificial já conseguem produzir abordagens mais inéditas do que soluções humanas vencedoras em algumas tarefas de engenharia de machine learning, mas ainda falham em transformar essa novidade em resultados consistentes. Essa é a conclusão central de um estudo disponibilizado no arXiv em 30 de agosto de 2026, que mede criatividade de agentes baseados em grandes modelos de linguagem (LLMs) em dez desafios no estilo Kaggle. O trabalho não trata novidade como sinônimo de descoberta: ele separa originalidade, viabilidade e impacto mensurável.
O estudo, Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks, avaliou os frameworks AIDE e AIRA-Dojo com GPT-5 e Qwen3-32B. A pergunta prática é relevante para equipes que consideram agentes para pesquisa, ciência de dados e otimização: um sistema que gera hipóteses diferentes pode ampliar o espaço de busca, mas não deve receber autonomia por isso antes de provar que suas ideias funcionam.
Resumo: o que a pesquisa encontrou
- Os pesquisadores propõem medir criatividade como combinação de novidade e utilidade, em vez de usar apenas a pontuação final de uma tarefa.
- O experimento cobre dez tarefas de engenharia de machine learning, com 877 a 3.747 notebooks humanos de referência por desafio.
- O AIDE com GPT-5 obteve 1,423 em criatividade histórica, acima dos grupos humanos de medalha de ouro, prata e bronze usados na comparação.
- Apesar disso, somente 21% das execuções do GPT-5 alcançaram alguma medalha no recorte relatado; ideias incomuns não se converteram automaticamente em desempenho.
- O resultado reforça que avaliação de agentes de pesquisa precisa medir exploração, execução e validação, não apenas respostas aparentemente originais.
O que o estudo chama de criatividade
O artigo parte de uma definição consolidada em estudos de criatividade: uma ideia precisa ser simultaneamente original e útil. Para levar essa definição a agentes que executam várias etapas, os autores dividem a avaliação em quatro partes. A criatividade-P mede se uma solução é nova em relação às tentativas anteriores do próprio agente. A criatividade-H mede se ela é nova diante do histórico de soluções humanas. Impacto mede o quanto a solução melhora a métrica do desafio; viabilidade exige que o código efetivamente rode.
| Dimensão | Pergunta que responde | Como foi operacionalizada |
|---|---|---|
| Criatividade-P | A tentativa é diferente do histórico do próprio agente? | Um avaliador baseado em LLM compara episódios anteriores numa escala de 0 a 4. |
| Criatividade-H | A tentativa é diferente do repertório humano disponível? | Recuperação por embeddings e avaliação contra notebooks públicos de cada competição. |
| Impacto | A tentativa melhora o resultado de forma relevante? | Desempenho normalizado entre uma linha de base e o melhor resultado humano. |
| Viabilidade | A proposta pode ser executada? | Apenas episódios com código bem-sucedido entram na análise. |
Essa separação é importante porque um agente pode se afastar de padrões conhecidos simplesmente por errar, escolher um caminho irrelevante ou gerar código frágil. A novidade só ganha valor científico ou operacional quando supera esse teste de execução e desempenho.
Como os autores testaram agentes em tarefas reais
O conjunto escolhido foi o MLE-Bench, que organiza tarefas de engenharia de machine learning inspiradas em competições Kaggle. Os autores selecionaram dez desafios de visão computacional, linguagem natural e dados tabulares que tinham muitos notebooks públicos de pessoas como referência. Cada combinação de modelo, framework e tarefa teve oito execuções, orçamento de oito horas e até dez episódios por execução.
Foram comparados dois estilos de agente. O AIDE usa busca em árvore com estratégia gulosa. O AIRA-Dojo parte dele e adiciona estratégias e operadores de busca. Os modelos de base foram GPT-5 e Qwen3-32B. Em vez de deduzir criatividade apenas da pontuação de uma submissão, o trabalho inspecionou a trajetória de tentativas que levou a cada episódio executável.

Mais novidade, menos conversão em resultado
O dado mais revelador aparece quando a criatividade-H é comparada aos notebooks humanos de participantes premiados. No recorte apresentado pelos autores, AIDE com GPT-5 registrou 1,423 numa escala de 0 a 4; AIDE com Qwen3-32B ficou em 0,838 e AIRA-MCTS com Qwen3-32B em 0,800. As referências humanas de medalha de ouro, prata e bronze registraram, respectivamente, 0,744, 0,524 e 0,293.
O contraste não autoriza concluir que o agente seja “mais criativo” que pessoas em sentido amplo. Ele mostra, no protocolo específico, que suas soluções executáveis se afastaram mais do corpus público escolhido. O próprio estudo relata a lacuna decisiva: no caso do GPT-5, a proporção de execuções que chegou a alguma medalha foi de 21%. Em outras palavras, o agente alcança regiões menos exploradas do espaço de soluções, mas frequentemente não encontra um caminho de alto impacto.
Um exemplo descrito no artigo é uma tarefa de classificação de doença em folhas de mandioca. O agente começou com uma abordagem de ridge classifier e, depois, testou LightGBM com atributos construídos manualmente. Essa escolha se destacou como historicamente nova porque muitas soluções humanas haviam convergido para redes neurais convolucionais. Ainda assim, a trajetória acabou repetindo tentativas e ficou distante de uma medalha. O caso ilustra a diferença entre diversificar hipóteses e sustentar um ciclo de experimentação produtivo.
O que é sólido — e o que o estudo ainda não prova
Há uma contribuição metodológica concreta: os autores anotaram 300 episódios com três avaliadores humanos para verificar se métricas automatizadas acompanhavam julgamentos de criatividade-P. Eles argumentam que o avaliador por LLM teve boa correlação com essa referência humana, viabilizando análise em escala maior do que uma banca de especialistas permitiria.
Mas o método também tem limites. A criatividade-H depende do conjunto de notebooks recuperado, e o impacto depende de métricas bem definidas de competição. Os próprios autores reconhecem que tarefas abertas de ciência não oferecem, em geral, uma métrica única de sucesso nem um corpus humano tão comparável. O experimento também limita cada trajetória a dez episódios, uma restrição de contexto e computação que pode alterar o comportamento de exploração em projetos longos.
Outro cuidado é a função do avaliador LLM. Mesmo calibrado contra uma amostra humana, ele não substitui revisão técnica independente nem demonstra que uma ideia é cientificamente correta. A métrica é útil para observar padrões de busca; não é um selo de descoberta.
Impacto prático para equipes brasileiras
Para laboratórios, startups e áreas de dados no Brasil, o estudo sugere uma arquitetura de trabalho mais segura do que delegar uma pauta de pesquisa inteira a um agente. O agente pode gerar alternativas, vasculhar combinações de modelos e propor experimentos; uma pessoa deve definir a métrica, revisar a procedência dos dados, validar o código, reproduzir o resultado e decidir se a hipótese faz sentido para o problema de negócio ou pesquisa.
Também vale registrar a trilha das tentativas. Se a criatividade-P mede novidade em relação ao próprio histórico, equipes podem usar registros de experimentos para detectar repetição improdutiva, comparar hipóteses e impedir que um agente recicle a mesma estratégia com pequenas mudanças de texto. Em contextos regulados ou com dados sensíveis, a verificação humana deve ser obrigatória antes de qualquer decisão automatizada.
Análise do NoticIA: a métrica útil é novidade com prestação de contas
Na análise do NoticIA, o principal valor deste trabalho não é anunciar que agentes “descobrem” sozinhos. É oferecer uma linguagem para separar quatro coisas que ainda aparecem misturadas em demonstrações de agentes: algo diferente, algo executável, algo que melhora uma métrica e algo que merece confiança fora do ambiente de teste.
O mercado tende a valorizar demos em que o agente encontra uma abordagem inesperada. Para adoção real, porém, a pergunta mais importante é outra: qual foi a taxa de hipóteses novas que sobreviveram à reprodução, ao custo computacional e à revisão de domínio? Um painel operacional de agentes deveria exibir essas taxas, a origem dos dados e o histórico de falhas, não apenas a melhor resposta encontrada.
Conclusão
O estudo indica que agentes LLM podem explorar soluções menos semelhantes às registradas por participantes humanos, mas também evidencia a barreira entre inventar e entregar. A pesquisa autônoma exigirá sistemas capazes de manter diversidade de hipóteses sem perder capacidade de teste, correção e seleção. Até lá, o uso mais responsável é tratar o agente como amplificador de exploração e manter pessoas responsáveis pela validação e pelo impacto das conclusões.
Perguntas frequentes
O estudo prova que LLMs são mais criativos que pesquisadores?
Não. Ele mede novidade e utilidade em um protocolo delimitado de tarefas de engenharia de machine learning e comparação com notebooks públicos. O resultado não é uma medida geral de criatividade humana.
O que significa criatividade-H?
É a novidade histórica: o quanto uma solução se diferencia do corpus de soluções humanas usado como referência para aquela tarefa.
Por que uma solução nova pode ter baixo impacto?
Ela pode ser difícil de executar, usar uma hipótese inadequada ou não melhorar a métrica avaliada. A originalidade não garante desempenho.
Qual foi a fonte primária?
O preprint dos próprios autores está disponível no arXiv desde 30 de agosto de 2026 e detalha dados, método e limitações.
Como aplicar o achado em uma equipe?
Use agentes para propor e registrar experiências, mas imponha métricas explícitas, testes reproduzíveis e revisão humana antes de transformar resultados em decisões ou produtos.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



