
The Station: multiagentes de IA reportam resultados matemáticos inéditos sem coordenação central
Sistema descentralizado de agentes de IA apresentou resultados novos em 5 dos 12 problemas do AlphaEvolve, incluindo avanços em Kakeya e números…
Benchmarks, papers acadêmicos, descobertas científicas e inovação
205 publicações encontradas

Sistema descentralizado de agentes de IA apresentou resultados novos em 5 dos 12 problemas do AlphaEvolve, incluindo avanços em Kakeya e números…

Pré-print apresenta o Self-Reflective Policy Optimization, que converte feedback esparso em supervisão por token e supera o GRPO com fração do custo…

O Monsoon traz hindi e inglês indiano ao ranking de reconhecimento de fala, expondo como a métrica única de WER esconde desigualdades…

Apesar dos avanços, modelos de IA seguem falhando em raciocínio espacial e quebra-cabeças visuais. Entenda o que isso revela sobre a cognição…

Método PottsMPNN propõe nova métrica que vai além de reproduzir sequências naturais e aumenta a taxa de sucesso no design de proteínas.

Avaliação duplo-cega mantém benchmarks e pesos do modelo em caixa criptográfica, prevenindo contaminação e protegendo dados sensíveis.

Blocos modulares do MIT mudam de forma e mantêm conexões elétricas, viabilizando móveis assistivos e garras robóticas reconfiguráveis.

Com 0,72 milhão de parâmetros, o GlucoFM supera modelos 100x maiores no monitoramento de glicose. Entenda o que ele faz e o…

Outer Biosciences, de Michael Polansky, mantém tecido de pele humano vivo por um mês e usa IA para gerar novos ingredientes a…

Método η-learning gera cenários plausíveis de tempestades e eventos raros, com aplicações em clima, robótica e mercados financeiros.

Revisão sistemática consolida aplicações de grandes modelos de linguagem na saúde mental, da detecção de depressão aos riscos éticos.

Estudo da Apple analisou 21 mil conversas com quatro LLMs para mapear quando comportamentos 'humanos' são adequados e quando não.

Estudo da IBM com 8 modelos mostra que a memória de agentes de IA precisa de dose calibrada: modelos fracos ganham +16…

Pesquisadores do CSAIL mostram que, em modelos treinados com muitos dados, remover imagens de um artista ou de uma pessoa não muda…

Agentes de IA são bons engenheiros, mas péssimos pesquisadores, mostra estudo que rejeitou dois artigos gerados por Claude Opus 4.8.

Teste com 5 detectores mostra que só o MiniCheck enxerga erros de um único dígito. Biblioteca groundlens propõe verificar número por número.

O GLM-5.3 liderou no CyberGym, mas os benchmarks de exploração revelam um retrato mais complexo — e a própria Zhipu admite onde…

Estudo testou se a confiança de um LLM acompanha a qualidade da evidência em diagnósticos. Acerto de 93,5%, mas com confiança excessiva…

Sistema de aprendizado por reforço faz modelo escrever kernels CUDA 2,11x mais rápidos que o torch.compile em 96,8% das tarefas do KernelBench.

Modelo de deep learning estima composição corporal a partir de fotos 2D e prevê resistência à insulina com precisão próxima à do…

Pesquisa em larga escala com GRPO aponta forte transferência entre idiomas, mas alerta para regressões específicas em cada língua.

Reanotação em larga escala mostra que um terço das imagens do ImageNet-1k tem múltiplos objetos e melhora a precisão de modelos em…

Usando GPT-5.6 e o assistente Lean, cientista de dados atacou dois problemas abertos de matemática em um fim de semana — e…

ReAct, Toolformer, Generative Agents, Voyager e AutoGen: os cinco papers que explicam as peças por trás dos agentes de IA modernos.