O problema de avaliar agentes
Avaliar agentes de IA nos crescentes benchmarks de agência é difícil porque muitos exigem ambientes complexos e integrações específicas. O trabalho Harbor Adapters ataca exatamente esse gargalo, apresentando uma infraestrutura unificada de avaliação para benchmarks agentic.
Três contribuições principais estruturam o projeto. Primeiro, adaptadores de benchmark que portam mais de 80 benchmarks para avaliar agentes arbitrários, validados por revisão rigorosa de código e experimentos de paridade. Segundo, uma avaliação em larga escala de 8 modelos em 54 benchmarks — cada modelo executado com o harness Terminus-2 e com um de três harnesses nativos, permitindo uma análise mais ampla de capacidades e modos de falha do que era possível antes.
Harbor-Index: 82 tarefas difíceis e curadas
A terceira contribuição é o Harbor-Index, um conjunto curado de 82 tarefas difíceis, diversas e de alta qualidade distribuídas por 29 benchmarks, refinado a partir da suíte adaptada por meio de filtragem de dificuldade, auditoria de IA e humana e um loop de auditoria e correção.
O resultado: nenhuma configuração de modelo-harness avaliada supera 30% de taxa de aprovação. A mais forte — GPT-5.5 com Codex — alcança 28,0%. Isso preserva o desafio e a amplitude das avaliações agentic em larga escala sem exigir recursos computacionais proibitivos para executá-las.
Para equipes que desenvolvem agentes, o Harbor-Index oferece uma régua acessível e rigorosa para medir progresso real — não apenas em benchmarks saturados.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



