Inteligência artificial, sem ruído.
Pesquisa e Ciência3 min

Keenable AI libera NEEDLE, benchmark de busca que reconstrói suas consultas a cada hora

NEEDLE reconstrói seu conjunto de consultas a cada hora a partir de feeds RSS e Google Trends para evitar que agentes de busca colem nas respostas.

Keenable AI libera NEEDLE, benchmark de busca que reconstrói suas consultas a cada hora

Como avaliar uma API de busca na web quando o próprio sistema testado consegue ler o gabarito? Um agente de busca tem uma ferramenta de fetch: se as respostas corretas estiverem em um conjunto de dados público, ele pode baixá-las no meio da avaliação e pular a recuperação inteira. Um problema parecido surge quando a resposta já está codificada na memória paramétrica do modelo — acertar não prova mais que a busca funcionou. A resposta da Keenable AI é o NEEDLE, um benchmark open source que reconstrói seu conjunto de consultas a partir de fontes públicas recentes em vez de congelá-lo.

Como o NEEDLE evita a “cola”

Consultas de notícias são regeneradas a cada hora a partir de feeds RSS e do Google Trends. Consultas de finanças, acadêmicas, jurídicas e de entidades raras são regeneradas diariamente a partir de SEC XBRL, arXiv, Europe PMC, CourtListener e logs públicos de agentes. Quinze APIs de busca rodam sobre o mesmo texto de consulta sob um único protocolo, e cada pontuação é lida contra o ultimate, um oráculo que agrega o que todo o campo conseguiu encontrar.

O que o NEEDLE mede

O nome vem de News, Everyday, Expert, Deep-tail e Legal Evaluation — cinco verticais que modelam intenções diferentes de agentes:

  • News: projeta o item mais recente de ~124 feeds RSS e do Google Trends em uma consulta por palavra-chave.
  • Finance: pergunta fatos cadastrais de Wikidata e GLEIF, além de números trimestrais de formulários 10-Q do SEC XBRL.
  • Scholar: transforma um artigo em quatro estilos de consulta — título degradado, detalhe em texto completo, pista em linguagem natural e descrição “na ponta da língua”.
  • Deep-tail: amostra consultas de palavras raras de lançamentos públicos de trajetórias de agentes, incluindo DeepResearchGym, OpenResearcher e LRAT.
  • Legal: extrai decisões recentes do CourtListener em 14 tribunais federais e seções do eCFR.

Como a pontuação funciona

A pontuação segue a mesma divisão. Notícias e deep-tail não têm um único resultado correto, então um juiz LLM avalia cada resultado de 0 a 4 e o harness reporta nDCG@5 com penalidade por URL duplicada. Finanças reporta answer-recall@5 — se o fato chega ao agente dentro de um snippet entre os cinco primeiros. Scholar e legal são tarefas de item conhecido, pontuadas por correspondência de identificador.

O projeto é um harness de avaliação open source, não um produto: é um CLI em Python instalado com uv sync e conduzido por dois subcomandos por benchmark, generate e run. Exige uma chave do OpenRouter para o julgamento e uma chave de API por mecanismo testado, rodando em notebook ou em CI.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.