Inteligência artificial, sem ruído.
Pesquisa e Ciência2 min

IA ainda tropeça ao transformar respostas de matemática em provas formais

Benchmark MathAdv mostra que modelos de IA ainda têm dificuldade em transformar respostas corretas em provas formais verificadas.

IA ainda tropeça ao transformar respostas de matemática em provas formais

Um novo teste de sistemas de prova de teoremas com IA aponta uma divisão clara entre responder corretamente a uma questão de matemática e produzir uma prova formal que passa pela checagem do Lean 4. No benchmark MathAdv, a maior acurácia reportada em Lean 4 foi de 21,88%, alcançada pelo Goedel-Prover-V2; o DeepSeek-Prover-V1.5 RL com RMaxTS ficou em 16,56%.

O que o MathAdv mede

O benchmark foi construído para separar habilidades que, vistas de fora, parecem a mesma coisa: resolver o problema, formalizar a solução e generalizar o raciocínio para problemas novos. Um modelo pode acertar a resposta numérica e ainda assim falhar ao expressar o mesmo argumento em uma linguagem de prova formal que um assistente como o Lean 4 aceita sem erro.

Por que isso importa

A formalização é o elo entre o raciocínio de um modelo e a verificação confiável de que a matemática está correta. Se os modelos continuam abaixo de 22% em precisão formal, há uma distância considerável até o ponto em que IAs possam, de forma autônoma, produzir provas verificáveis em pesquisa ou em verificação de software. O resultado reforça que “acertar a resposta” não é o mesmo que “provar que está certo”.

Leitura cuidadosa

Os números vêm de um preprint (ainda não revisado por pares) e de um único benchmark. A acurácia formal baixa não significa ausência de progresso — a taxa saltou nos últimos modelos — mas indica onde está o gargalo atual do campo.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.