
Benchmark GMA expõe o quanto assistentes móveis de IA ainda travam em tarefas reais
Com 300 tarefas em sete aplicações, o GMA mostra que o desempenho dos agentes cai conforme a complexidade sobe e o harness…
Cobertura de agentes de inteligência artificial: ferramentas autônomas, assistentes baseados em LLMs, automação com IA e as novidades do ecossistema de agentes.
315 publicações encontradas

Com 300 tarefas em sete aplicações, o GMA mostra que o desempenho dos agentes cai conforme a complexidade sobe e o harness…

Paradigma representa o mundo físico como código executável e treina modelos de visão-linguagem que superam modelos proprietários no QuantiPhy.

Framework agêntico aprende regras de extração por editor e roda em produção sem chamadas a LLM, superando extratores genéricos.

Defesa baseada em prompt reduziu ataques de agentes de codificação em benchmarks; taxa de sucesso de execução maliciosa caiu de 66,2% para…

Cerca de 700 agentes de IA se organizaram sozinhos para invadir o Hugging Face. Ethan Mollick explica o caso e propõe a…

Google AI e universidades apresentam camada programável que adapta benchmarks de agentes à política que treina neles, com ganhos de até 9…

Time to first token é a métrica mais usada para escolher API de voz — e também a mais enganosa. Veja os…

Do fluxograma inicial aos exemplos one-shot, oito dicas práticas para escrever instruções de agentes de IA mais confiáveis, fáceis de manter e…

A Anthropic divulgou novas diretrizes de engenharia de contexto para a geração Claude 5, e elas transformam a forma como cientistas de…

Reexecutar um agente de IA até ele acertar não é corrigir. Estudo mede quando o reparo guiado de fato conserta a falha…

Sistema de memória de voz em streaming lidera benchmarks usando 4,4 vezes menos tokens e 134 ms de recuperação.

Anthropic abre preview do Model Hardware Standard (MHS), especificação que permite a agentes de IA descobrir e operar equipamentos físicos com segurança.

Sistema combina busca densa e BM25 para localizar ferramentas em catálogos com milhares de itens; Hit@1 de 84,8% e redução massiva de…

Estudo compara deepagents, pi e dsh e encontra cinco blocos recorrentes na arquitetura de agentes de código — mas nenhum oferece registro…

Estudo com 5.400 episódios mostra que apontar uma verificação para o registro de origem eleva decisões consistentes de 34 para 145 em…

Estrutura Observe-Orient-Decide-Aja elevou a taxa de sucesso de agentes Qwen3 em até 6,86 pontos; ganhos se concentram em tarefas que exigem lembrar…

Não existe agente melhor em tudo: Codex conduz tarefas difíceis até o fim; Claude Code orquestra dezenas de pequenos ajustes em paralelo.

Runtime Metis transforma chamadas de ferramentas em eventos tipados e acelera a execução, mas testes de falha expõem limites de segurança em…

Guia prático mostra como definir agentes especialistas e coordenar o trabalho deles no Codex CLI para tarefas complexas.

Agentes de código dão estimativas calibradas para humanos, não para LLMs. Duas técnicas para obter prazos mais precisos do Claude Code.

Startup capta US$ 10 milhões em seed para clonar Salesforce e Workday em escala real e testar agentes antes do deploy.

AWS demonstra como orquestrar produção criativa com agentes: o Amazon Quick coordena, o MCP conecta e o fal gera imagens, áudio e…

Padrão MHS permite que agentes de IA controlem microscópios, manipuladores de líquidos e braços robóticos, reduzindo a integração de semanas para horas.

Enquanto agentes absorvem a execução, a vantagem humana se desloca para julgamento, accountability e pensamento independente.