
Benchmark GMA expõe o quanto assistentes móveis de IA ainda travam em tarefas reais
Com 300 tarefas em sete aplicações, o GMA mostra que o desempenho dos agentes cai conforme a complexidade sobe e o harness…
Modelos de IA, LLMs, agentes, IA generativa e pesquisa em inteligência artificial
4259 publicações encontradas

Com 300 tarefas em sete aplicações, o GMA mostra que o desempenho dos agentes cai conforme a complexidade sobe e o harness…

Estudo mostra que o otimizador Muon controla a norma espectral por construção e supera o AdamW em fusão de modelos e aprendizado…

Expressar angústia aumenta a concordância da IA com decisões precipitadas em 12,9 pontos, mesmo nos modelos mais avançados.

Paradigma representa o mundo físico como código executável e treina modelos de visão-linguagem que superam modelos proprietários no QuantiPhy.

Framework agêntico aprende regras de extração por editor e roda em produção sem chamadas a LLM, superando extratores genéricos.

Survey organiza o aprendizado por reforço guiado por rubricas, alternativa interpretável ao RLHF, e aponta os riscos de reward hacking.

Técnica substitui a projeção densa de saída por busca aproximada em índice HNSW e acelera a decodificação em CPU sem perder qualidade.

Pesquisa do arXiv mostra que a quantização pode ativar backdoors ocultos plantados no treinamento, com até 85% de inversão em modelos de…

Escala AURCC acertou a ordem dos melhores modelos de fundação com correlação de 0,943 sem nenhum rótulo no domínio-alvo.

Banach-KAN lidera em benchmarks limpos, mas se degrada mais rápido sob ruído do que as variantes ℓp-KAN e Tanh-KAN.

Instrumento GenAIT foi validado com 7.432 estudantes do ensino médio e mede conhecimento conceitual, não habilidade prática de prompting.

Estudo identifica resposta ordenada a perturbações temporárias que aparece milhares de épocas antes de a acurácia de teste melhorar.

Modelos abertos jogam pior em alguns idiomas; inglês foi forte, hebraico fraco, e Qwen3-4B mostrou a hierarquia mais acentuada.

Defesa baseada em prompt reduziu ataques de agentes de codificação em benchmarks; taxa de sucesso de execução maliciosa caiu de 66,2% para…

Tarifas e restrições de segurança nacional apertam o cerco aos robôs chineses, mas analistas preveem mercado global fragmentado, não uma separação total.

DEFUSE reconstrói imagens a partir de representações internas para detectar modelos de visão comprometidos por backdoor, mesmo sem conhecer o ataque.

Estudo compara modelos de IA e físicos de previsão do tempo e encontra uma assimetria: a IA tem boa acurácia, mas não…

Pré-print do arXiv propõe avaliar respostas de IA em duas etapas — localizar e depois decidir — e mantém 90% de taxa…

O guia de Simon Willison explica o ChatGPT Work: execução de código com internet, Chrome headless, sites próprios e sub-agentes — e…

Cerca de 700 agentes de IA se organizaram sozinhos para invadir o Hugging Face. Ethan Mollick explica o caso e propõe a…

Protótipo combina conformidade visual de interface com avaliação de risco de rede para sinalizar telas suspeitas em apps como o WeChat.

Pesquisa controlada mostra que a dinâmica de Edge of Stability faz os dois algoritmos empatarem, e a sharpness é a chave.

Audit com seis encoders mostra acordo intermediário dos VLMs sobre qualidades afetivas de objetos 3D, com variação por categoria.

Modelo do ACM KDD '26 modela ações do vendedor e eventos externos e reporta os menores erros nos testes com dados da…