Como avaliar uma API de busca na web quando o próprio sistema testado consegue ler o gabarito? Um agente de busca tem uma ferramenta de fetch: se as respostas corretas estiverem em um conjunto de dados público, ele pode baixá-las no meio da avaliação e pular a recuperação inteira. Um problema parecido surge quando a resposta já está codificada na memória paramétrica do modelo — acertar não prova mais que a busca funcionou. A resposta da Keenable AI é o NEEDLE, um benchmark open source que reconstrói seu conjunto de consultas a partir de fontes públicas recentes em vez de congelá-lo.
Como o NEEDLE evita a “cola”
Consultas de notícias são regeneradas a cada hora a partir de feeds RSS e do Google Trends. Consultas de finanças, acadêmicas, jurídicas e de entidades raras são regeneradas diariamente a partir de SEC XBRL, arXiv, Europe PMC, CourtListener e logs públicos de agentes. Quinze APIs de busca rodam sobre o mesmo texto de consulta sob um único protocolo, e cada pontuação é lida contra o ultimate, um oráculo que agrega o que todo o campo conseguiu encontrar.
O que o NEEDLE mede
O nome vem de News, Everyday, Expert, Deep-tail e Legal Evaluation — cinco verticais que modelam intenções diferentes de agentes:
- News: projeta o item mais recente de ~124 feeds RSS e do Google Trends em uma consulta por palavra-chave.
- Finance: pergunta fatos cadastrais de Wikidata e GLEIF, além de números trimestrais de formulários 10-Q do SEC XBRL.
- Scholar: transforma um artigo em quatro estilos de consulta — título degradado, detalhe em texto completo, pista em linguagem natural e descrição “na ponta da língua”.
- Deep-tail: amostra consultas de palavras raras de lançamentos públicos de trajetórias de agentes, incluindo DeepResearchGym, OpenResearcher e LRAT.
- Legal: extrai decisões recentes do CourtListener em 14 tribunais federais e seções do eCFR.
Como a pontuação funciona
A pontuação segue a mesma divisão. Notícias e deep-tail não têm um único resultado correto, então um juiz LLM avalia cada resultado de 0 a 4 e o harness reporta nDCG@5 com penalidade por URL duplicada. Finanças reporta answer-recall@5 — se o fato chega ao agente dentro de um snippet entre os cinco primeiros. Scholar e legal são tarefas de item conhecido, pontuadas por correspondência de identificador.
O projeto é um harness de avaliação open source, não um produto: é um CLI em Python instalado com uv sync e conduzido por dois subcomandos por benchmark, generate e run. Exige uma chave do OpenRouter para o julgamento e uma chave de API por mecanismo testado, rodando em notebook ou em CI.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



