
Força de jogo de LLMs muda conforme o idioma da interface, mostra estudo com 518 mil partidas
Modelos abertos jogam pior em alguns idiomas; inglês foi forte, hebraico fraco, e Qwen3-4B mostrou a hierarquia mais acentuada.
4267 publicações encontradas

Modelos abertos jogam pior em alguns idiomas; inglês foi forte, hebraico fraco, e Qwen3-4B mostrou a hierarquia mais acentuada.

Defesa baseada em prompt reduziu ataques de agentes de codificação em benchmarks; taxa de sucesso de execução maliciosa caiu de 66,2% para…

Tarifas e restrições de segurança nacional apertam o cerco aos robôs chineses, mas analistas preveem mercado global fragmentado, não uma separação total.

DEFUSE reconstrói imagens a partir de representações internas para detectar modelos de visão comprometidos por backdoor, mesmo sem conhecer o ataque.

Estudo compara modelos de IA e físicos de previsão do tempo e encontra uma assimetria: a IA tem boa acurácia, mas não…

Pré-print do arXiv propõe avaliar respostas de IA em duas etapas — localizar e depois decidir — e mantém 90% de taxa…

O guia de Simon Willison explica o ChatGPT Work: execução de código com internet, Chrome headless, sites próprios e sub-agentes — e…

Cerca de 700 agentes de IA se organizaram sozinhos para invadir o Hugging Face. Ethan Mollick explica o caso e propõe a…

Protótipo combina conformidade visual de interface com avaliação de risco de rede para sinalizar telas suspeitas em apps como o WeChat.

Pesquisa controlada mostra que a dinâmica de Edge of Stability faz os dois algoritmos empatarem, e a sharpness é a chave.

Audit com seis encoders mostra acordo intermediário dos VLMs sobre qualidades afetivas de objetos 3D, com variação por categoria.

Modelo do ACM KDD '26 modela ações do vendedor e eventos externos e reporta os menores erros nos testes com dados da…

Modelo recombina ações atômicas conhecidas em padrões de colaboração inéditos e supera o Pi0 em benchmarks de robótica dual-arm.

Estudo com oito modelos mostra que exibir uma pontuação prévia derruba as notas de um avaliador de IA, afetando até pipelines de…

Google AI e universidades apresentam camada programável que adapta benchmarks de agentes à política que treina neles, com ganhos de até 9…

Time to first token é a métrica mais usada para escolher API de voz — e também a mais enganosa. Veja os…

Modelo EigenCL organiza a evolução do NDRE em estágios interpretáveis — saudável, leve, moderado e severo — e pode apoiar decisões de…

TimeX++ usa um gargalo de informação compartilhado para gerar atribuições e contrafactuais, superando explicadores concorrentes em testes sintéticos e reais.

Uni-Mol2 teve os melhores resultados em tarefas de rotulação de odores, mas tropeça em distinguir moléculas espelhadas, expondo um limite da olfação…

Método LOBSTER seleciona dados de treinamento para sumarização em segundos, mas a vantagem de qualidade varia conforme o conjunto de dados.

CoKo-UNO combina operador de Koopman com compensação seletiva estado-espaço e registrou o menor erro em quatro benchmarks de dinâmica de fluidos.

Documentos Word, Excel e PowerPoint aparentemente limpos podem carregar conteúdo oculto que modelos de linguagem acabam lendo. Pesquisa mediu 21 bifurcações de…

SpaceX vai fundir lâminas de turbinas a gás para destravar energia de data centers de IA em até 18 meses, mas a…

Do fluxograma inicial aos exemplos one-shot, oito dicas práticas para escrever instruções de agentes de IA mais confiáveis, fáceis de manter e…