
Aprendizado por imitação faz provador de teoremas resolver 46% mais problemas
Políticas aprendidas por imitação guiam a busca de provas e resolvem até 46% mais teoremas com uma ordem de magnitude menos passos.
Benchmarks, papers acadêmicos, descobertas científicas e inovação
205 publicações encontradas

Políticas aprendidas por imitação guiam a busca de provas e resolvem até 46% mais teoremas com uma ordem de magnitude menos passos.

Fusão por atenção de sinais cardíacos alcançou o menor erro médio geral, mas perdeu vantagem quando o ECG falha por completo.

Método DualOPSD faz o professor aprender durante a auto-destilação e eleva em até 23 pontos a nota do Qwen3-8B em benchmarks de…

Camada de decisão guiada por linguagem bloqueia manobras de direção autônoma cerca de 161 ms antes da saída de um corredor de…

Técnica de baixa ordem compartilhada corta mais de 77% dos parâmetros de CNNs de kernel grande, com queda de precisão abaixo de…

Estudo ajusta o Whisper Small ao baniwa, língua indígena do Brasil, com taxa de erro de palavra de 37,5% — um primeiro…

Preprint compara estratégias de treino para raciocínio e mostra que SFT misto supera NTR e NSR após RLVR, gastando muito menos GPU.

Sistema com SDXL melhora em 11% a aderência a combinações inéditas de lente, ponto de vista e sensor em direção autônoma e…

Técnica usa 1% dos dados e expansão de Taylor para antecipar mecanismos pós-SFT; atualizar só os 20% de neurônios mais relevantes mantém…

Método de visão computacional inverte a hierarquia de processamento e reduz o erro em super-resolução de profundidade a 32×.

Método que combina LLM e PySR recupera 95% das fórmulas exatas no benchmark Feynman, com R² médio de 0,9999.

Modelo de visão-linguagem detecta malignidade em biópsias de próstata com 97,6% de acurácia, mas a graduação detalhada ainda fica abaixo.

LiteraryBigFive representa o estilo de um autor em cinco dimensões interpretáveis e ajusta as ativações do modelo para imitá-lo.

TrustDABench avalia oito LLMs em análise de tabelas e revela que 74,8% das falhas são respostas silenciosas sem evidência suficiente.

PaSta combina auto-treinamento e rótulos parciais para classificar nós em grafos com rótulos ruidosos, superando métodos tradicionais.

Técnica de inferência cortou viés em até 96% em teste de gênero e preservou a precisão no MMStar, segundo preprint publicado no…

Estudo combina 371 mil notícias, 1,4 milhão de tuítes e 57 entrevistas para organizar o debate público sobre IA em quatro áreas.

Técnica rastreia cada fato atômico até os tokens de origem e usa verificação para guiar o aprendizado, superando baselines de factualidade.

Controlador sem treino atua no fluxo residual do modelo para reduzir reflexão desnecessária, com economia que chega a 23% em matemática.

Preprint usa transformer para recuperação em recomendação e reporta ganho de receita de 2,53% em teste online de um mês.

Método quebra documentos em triplas verificáveis para combater informação enganosa em respostas RAG de múltiplas etapas, com melhores pontuações.

Framework combina descrições de movimento geradas por IA com um codificador visual para reconhecer e localizar sinais em vídeo, liderando quatro benchmarks.

Preprint aponta que a estrutura do ajuste de desaprendizado prevê melhor a robustez contra o retorno do conhecimento do que a distância…

Preprint revela que a maioria das métricas automáticas de criatividade tem correlação fraca com o julgamento humano, e juízes-LLM apresentam efeito teto.