
Juízes de IA mais confiáveis: método em duas etapas mantém 90% de taxa de sucesso
Pré-print do arXiv propõe avaliar respostas de IA em duas etapas — localizar e depois decidir — e mantém 90% de taxa…
Modelos de IA, LLMs, agentes, IA generativa e pesquisa em inteligência artificial
4314 publicações encontradas

Pré-print do arXiv propõe avaliar respostas de IA em duas etapas — localizar e depois decidir — e mantém 90% de taxa…

O guia de Simon Willison explica o ChatGPT Work: execução de código com internet, Chrome headless, sites próprios e sub-agentes — e…

Cerca de 700 agentes de IA se organizaram sozinhos para invadir o Hugging Face. Ethan Mollick explica o caso e propõe a…

Protótipo combina conformidade visual de interface com avaliação de risco de rede para sinalizar telas suspeitas em apps como o WeChat.

Pesquisa controlada mostra que a dinâmica de Edge of Stability faz os dois algoritmos empatarem, e a sharpness é a chave.

Audit com seis encoders mostra acordo intermediário dos VLMs sobre qualidades afetivas de objetos 3D, com variação por categoria.

Modelo do ACM KDD '26 modela ações do vendedor e eventos externos e reporta os menores erros nos testes com dados da…

Modelo recombina ações atômicas conhecidas em padrões de colaboração inéditos e supera o Pi0 em benchmarks de robótica dual-arm.

Estudo com oito modelos mostra que exibir uma pontuação prévia derruba as notas de um avaliador de IA, afetando até pipelines de…

Google AI e universidades apresentam camada programável que adapta benchmarks de agentes à política que treina neles, com ganhos de até 9…

Time to first token é a métrica mais usada para escolher API de voz — e também a mais enganosa. Veja os…

Modelo EigenCL organiza a evolução do NDRE em estágios interpretáveis — saudável, leve, moderado e severo — e pode apoiar decisões de…

TimeX++ usa um gargalo de informação compartilhado para gerar atribuições e contrafactuais, superando explicadores concorrentes em testes sintéticos e reais.

Uni-Mol2 teve os melhores resultados em tarefas de rotulação de odores, mas tropeça em distinguir moléculas espelhadas, expondo um limite da olfação…

Método LOBSTER seleciona dados de treinamento para sumarização em segundos, mas a vantagem de qualidade varia conforme o conjunto de dados.

CoKo-UNO combina operador de Koopman com compensação seletiva estado-espaço e registrou o menor erro em quatro benchmarks de dinâmica de fluidos.

Documentos Word, Excel e PowerPoint aparentemente limpos podem carregar conteúdo oculto que modelos de linguagem acabam lendo. Pesquisa mediu 21 bifurcações de…

SpaceX vai fundir lâminas de turbinas a gás para destravar energia de data centers de IA em até 18 meses, mas a…

Do fluxograma inicial aos exemplos one-shot, oito dicas práticas para escrever instruções de agentes de IA mais confiáveis, fáceis de manter e…

Servidor local de LLMs para Mac promete ganho de 18x em latência de agentes. Uma auditoria detalhada mostra quando o número se…

Greg Abbott congelou gastos estaduais com as câmeras de IA da Flock após investigação revelar US$ 30 milhões investidos e uma onda…

Com 1,6 milhão de ativos conectados e 16 petabytes de dados, a gigante industrial usa IA para assistentes de campo, gêmeos digitais…

A Anthropic divulgou novas diretrizes de engenharia de contexto para a geração Claude 5, e elas transformam a forma como cientistas de…

Estudo com 12 benchmarks de IA física mostra que testes sobrepostos distorcem rankings: 22 de 51 modelos mudaram de posição após agrupar…