Inteligência artificial, sem ruído.
Modelos e LLMs2 min

Receita aberta para medalha de ouro: como a NVIDIA treinou o Nemotron para a Olimpíada de Matemática

Sistema 100% em linguagem natural marcou 30 de 42 pontos na IMO 2026, atingindo o nível de medalha de ouro sem provador formal nem internet.

Receita aberta para medalha de ouro: como a NVIDIA treinou o Nemotron para a Olimpíada de Matemática

A NVIDIA publicou um estudo que descreve uma “receita aberta” para alcançar o nível de medalha de ouro na Olimpíada Internacional de Matemática (IMO). O sistema, construído a partir do modelo Nemotron 3 Ultra, marcou 30 de 42 pontos na IMO 2026 — exatamente o limiar necessário para o ouro — usando apenas linguagem natural, sem provador formal, sem ferramentas externas e sem acesso à internet.

Como o sistema funciona

A pesquisa explora como o pós-treinamento e o design de inferência em tempo de teste afetam a geração de provas matemáticas. A partir do Nemotron 3 Ultra, os pesquisadores treinaram dois checkpoints especializados usando fine-tuning supervisionado (SFT) e aprendizado por reforço (RL).

O resultado é um pipeline de computação em tempo de teste que opera em três frentes: gerar, verificar e refinar provas candidatas. Três checkpoints do Nemotron 3 Ultra — o modelo de disponibilidade geral e os dois especialistas pós-treinados — alimentam uma busca iterativa que gera provas, checa a consistência e refina as candidatas. Uma etapa separada de alto custo computacional seleciona a resposta final de cada problema.

O diferencial: prova em linguagem natural

Ao contrário de sistemas anteriores que dependiam de provadores formais como Lean ou de chamadas a ferramentas externas, este funciona inteiramente em linguagem natural. Isso aproxima o comportamento do modelo do de um matemático humano: ele escreve a prova como um raciocínio textual, não como código verificado por máquina.

Por que isso importa

O ponto central é a palavra “aberta”. A equipe libera os dois checkpoints pós-treinados, permitindo que a comunidade reproduza e estenda o trabalho. Em um cenário onde os melhores resultados em raciocínio matemático costumam ficar fechados dentro dos laboratórios, uma receita aberta com ouro na IMO é um marco relevante para pesquisa reproduzível.

Vale o contexto: a IMO é um benchmark de raciocínio de altíssima dificuldade, e 30/42 representa um salto em relação a sistemas de poucos anos atrás. Ainda assim, o domínio é específico — problemas de olimpíada são bem definidos e de enunciado curto — e o resultado não se traduz automaticamente em matemática de pesquisa aberta ou raciocínio geral.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.