
Seu tom emocional muda o conselho da IA: estudo testa 6 modelos comerciais
Expressar angústia aumenta a concordância da IA com decisões precipitadas em 12,9 pontos, mesmo nos modelos mais avançados.
Benchmarks, papers acadêmicos, descobertas científicas e inovação
203 publicações encontradas

Expressar angústia aumenta a concordância da IA com decisões precipitadas em 12,9 pontos, mesmo nos modelos mais avançados.

Survey organiza o aprendizado por reforço guiado por rubricas, alternativa interpretável ao RLHF, e aponta os riscos de reward hacking.

Escala AURCC acertou a ordem dos melhores modelos de fundação com correlação de 0,943 sem nenhum rótulo no domínio-alvo.

Instrumento GenAIT foi validado com 7.432 estudantes do ensino médio e mede conhecimento conceitual, não habilidade prática de prompting.

Estudo identifica resposta ordenada a perturbações temporárias que aparece milhares de épocas antes de a acurácia de teste melhorar.

Estudo compara modelos de IA e físicos de previsão do tempo e encontra uma assimetria: a IA tem boa acurácia, mas não…

Pré-print do arXiv propõe avaliar respostas de IA em duas etapas — localizar e depois decidir — e mantém 90% de taxa…

Pesquisa controlada mostra que a dinâmica de Edge of Stability faz os dois algoritmos empatarem, e a sharpness é a chave.

Modelo do ACM KDD '26 modela ações do vendedor e eventos externos e reporta os menores erros nos testes com dados da…

Modelo recombina ações atômicas conhecidas em padrões de colaboração inéditos e supera o Pi0 em benchmarks de robótica dual-arm.

Estudo com oito modelos mostra que exibir uma pontuação prévia derruba as notas de um avaliador de IA, afetando até pipelines de…

Modelo EigenCL organiza a evolução do NDRE em estágios interpretáveis — saudável, leve, moderado e severo — e pode apoiar decisões de…

TimeX++ usa um gargalo de informação compartilhado para gerar atribuições e contrafactuais, superando explicadores concorrentes em testes sintéticos e reais.

Uni-Mol2 teve os melhores resultados em tarefas de rotulação de odores, mas tropeça em distinguir moléculas espelhadas, expondo um limite da olfação…

Método LOBSTER seleciona dados de treinamento para sumarização em segundos, mas a vantagem de qualidade varia conforme o conjunto de dados.

CoKo-UNO combina operador de Koopman com compensação seletiva estado-espaço e registrou o menor erro em quatro benchmarks de dinâmica de fluidos.

Estudo com 12 benchmarks de IA física mostra que testes sobrepostos distorcem rankings: 22 de 51 modelos mudaram de posição após agrupar…

Apenas 18 imagens de pessoas e mãos foram consideradas perfeitas em estudo com 651 imagens geradas por IA.

Avaliação em 4 benchmarks mostra que nenhum sistema de checagem de fatos domina todos os cenários — e que a evidência importa…

Abordagem guiada por lesões alcançou 97,56% de precisão em ultrassom ovariano exigindo menos anotação manual do que métodos por contorno.

O modelo PANDA combina MRI, tabelas clínicas, PET e caligrafia para separar Alzheimer de casos saudáveis — mesmo com dados incompletos e…

Humanos e modelos de linguagem reagem de forma diferente a erros conceituais e referenciais, revelando onde a máquina diverge da cognição.

Políticas aprendidas por imitação guiam a busca de provas e resolvem até 46% mais teoremas com uma ordem de magnitude menos passos.

Fusão por atenção de sinais cardíacos alcançou o menor erro médio geral, mas perdeu vantagem quando o ECG falha por completo.