
Humanity’s Last Exam é uma distração? O debate sobre o benchmark que os melhores modelos mal passam
O benchmark Humanity's Last Exam testa os limites do raciocínio da IA com 2.500 perguntas de nível PhD. Modelos de fronteira mal…
37 publicações encontradas

O benchmark Humanity's Last Exam testa os limites do raciocínio da IA com 2.500 perguntas de nível PhD. Modelos de fronteira mal…

Modernizar aplicações empresariais é uma das atividades de engenharia de software mais caras e complexas que as organizações enfrentam. A migração…

Agentes de IA baseados em grandes modelos de linguagem (LLMs) frequentemente falham porque suas instruções — ou "skills" — são modificadas…

Agentes de IA atuais são essencialmente sem estado: cada sessão começa do zero, conversas longas exigem releitura de todo o histórico e…

O LMArena, ranking de IA baseado em batalhas pareadas entre chatbots, atingiu US$ 100 milhões em receita menos de um ano após…

A OpenAI acaba de lançar o LifeSciBench , um benchmark ambicioso com 750 tarefas desenvolvidas para avaliar modelos de IA em cenários…

A OpenAI acaba de anunciar o LifeSciBench , um novo benchmark projetado para medir a capacidade de sistemas de IA em apoiar…
Em uma parceria entre a Artificial Analysis e o IBM Research, foi lançado o ITBench-AA, o primeiro benchmark focado em avaliar modelos…
Desafios da Segurança em Grandes Bases de Código Com o crescimento exponencial de sistemas complexos, como o Windows, Hyper-V e Azure, a…
Desafio e objetivo do Parameter Golf O Parameter Golf foi uma competição inovadora que reuniu mais de 1.000 participantes e recebeu mais…
Por que avaliar o raciocínio social em agentes de IA? À medida que agentes de inteligência artificial assumem tarefas mais complexas em…
Com a rápida evolução da inteligência artificial generativa, identificar se uma imagem, áudio ou vídeo é real ou falso tornou-se um desafio…
O aumento exponencial dos custos em avaliações de IA Nos últimos anos, a avaliação de modelos de inteligência artificial (IA) tem se…
O desafio do aprendizado contínuo em agentes inteligentes Agentes baseados em inteligência artificial têm se tornado cada vez mais fundamentais para…
A IBM Research, em parceria com a Hugging Face, lançou o VAKRA, um benchmark inovador que avalia a capacidade de agentes de…
O Desafio da Meta em Reposicionar Sua IA Em um movimento estratégico para retomar protagonismo no cenário da inteligência artificial, a Meta…
O problema do "estagiário eterno" em agentes de IA Imagine um cozinheiro que decorou todos os livros de receita, mas esquece as…
Contexto e objetivo do benchmark O desenvolvedor e committer Ruby Yusuke Endoh conduziu um benchmark inédito para avaliar a eficiência da geração…
Falcon Perception: Uma Nova Arquitetura para Sistemas de Percepção Visual O Falcon Perception é um modelo Transformer com 0,6 bilhão de parâmetros…
O Desafio dos LLMs em Videogames Modelos de linguagem grande (LLMs) avançaram rapidamente, superando benchmarks e resolvendo problemas cada vez mais…
Imagine um robô encarregado de limpar uma cozinha. Para realizar essa tarefa com sucesso, ele precisa observar o ambiente, decidir as ações…
Desafios do Planejamento Robótico com Modelos Visão-Linguagem Modelos de visão e linguagem (VLMs) combinam imagens e texto para planejar ações de…
Desafios na Avaliação de Agentes de Voz Agentes de voz conversacionais precisam equilibrar duas dimensões essenciais para o sucesso: precisão — a…
Com a rápida multiplicação dos modelos de inteligência artificial (IA) e a crescente concorrência no setor, surge uma questão crucial: como…