
Nenhum sistema de checagem de fatos domina todos os cenários, mostra avaliação
Avaliação em 4 benchmarks mostra que nenhum sistema de checagem de fatos domina todos os cenários — e que a evidência importa…
Modelos de IA, LLMs, agentes, IA generativa e pesquisa em inteligência artificial
4431 publicações encontradas

Avaliação em 4 benchmarks mostra que nenhum sistema de checagem de fatos domina todos os cenários — e que a evidência importa…

Reexecutar um agente de IA até ele acertar não é corrigir. Estudo mede quando o reparo guiado de fato conserta a falha…

Erros de digitação, ruído de transcrição e OCR quebram buscas em RAG. Veja quando o corretor clássico resolve — e quando só…

Estudo testou como empacotar o texto em grafos de conhecimento multimodais e descobriu que contexto no nível da frase supera parágrafos completos.

Abordagem guiada por lesões alcançou 97,56% de precisão em ultrassom ovariano exigindo menos anotação manual do que métodos por contorno.

O modelo PANDA combina MRI, tabelas clínicas, PET e caligrafia para separar Alzheimer de casos saudáveis — mesmo com dados incompletos e…

Rastreadores sem tela como Fitbit Air e Whoop prometem coletar seus dados de saúde sem disputar sua atenção. A IA é causa…

Humanos e modelos de linguagem reagem de forma diferente a erros conceituais e referenciais, revelando onde a máquina diverge da cognição.

Políticas aprendidas por imitação guiam a busca de provas e resolvem até 46% mais teoremas com uma ordem de magnitude menos passos.

Fusão por atenção de sinais cardíacos alcançou o menor erro médio geral, mas perdeu vantagem quando o ECG falha por completo.

Difusão guiada por incerteza restaura detalhe só onde a reconstrução é duvidosa, melhorando o equilíbrio entre fidelidade e qualidade.

Sistema de memória de voz em streaming lidera benchmarks usando 4,4 vezes menos tokens e 134 ms de recuperação.

Sistema de síntese de dados que se autoavalia em loop fechado elevou o Qwen3.5-4B no benchmark MM-IFEval sem anotação humana.

Memória externa de regras que evolui em tempo de teste reduz a taxa de sucesso de ataques de jailbreak para perto de…

Método de decodificação especulativa reduz o custo computacional de LLMs agentivos a 20–30% mantendo cerca de 90% da precisão.

Preprint mostra que renomear identificadores, sem alterar a função do código, derruba em até 77% o ranqueamento de busca de código por…

Método DualOPSD faz o professor aprender durante a auto-destilação e eleva em até 23 pontos a nota do Qwen3-8B em benchmarks de…

Anthropic abre preview do Model Hardware Standard (MHS), especificação que permite a agentes de IA descobrir e operar equipamentos físicos com segurança.

Camada de decisão guiada por linguagem bloqueia manobras de direção autônoma cerca de 161 ms antes da saída de um corredor de…

Toolkit de código aberto combina ROS 2 e Unity para testar frotas de robôs em realidade virtual e mista, sem precisar de…

Técnica de baixa ordem compartilhada corta mais de 77% dos parâmetros de CNNs de kernel grande, com queda de precisão abaixo de…

Estudo ajusta o Whisper Small ao baniwa, língua indígena do Brasil, com taxa de erro de palavra de 37,5% — um primeiro…

Novo método para modelos Mixture-of-Experts ganha robustez contra três normas de ataque ao mesmo tempo, com acréscimo de até 2,37 pontos na…

Pipeline teacher-student reduz de 91% para 16% a taxa de sucesso de ataques em modelos que geram código de hardware (RTL/Verilog), segundo…