Inteligência artificial, sem ruído.
Ferramentas e Apps3 min

Anthropic adiciona avaliação de plugins ao Claude Code: 6 tipos de grader e um gate de CI para skills

Novo comando claude plugin eval mede a contribuição de um plugin com 6 tipos de grader, 4 gratuitos; exige Claude Code v2.1.269+ e funciona como gate de CI.

A Anthropic publicou um novo fluxo de avaliação de plugins para o Claude Code. O comando claude plugin eval executa um plugin contra prompts realistas, avalia o que o Claude produziu e compara o resultado com uma execução em que o plugin não está carregado. A ideia é responder a três perguntas que desenvolvedores de plugins antes não conseguiam medir: a skill dispara quando deveria? Sobrevive a uma edição ou a um modelo novo? E, de fato, supera um modelo “pelado”?

Como funciona um caso de avaliação

Uma suíte de evals vive em um diretório evals/ dentro do plugin. Cada caso é um subdiretório com um prompt.md e uma pasta graders/. O corpo do prompt chega ao Claude exatamente como escrito, e menções a @path não são expandidas. O frontmatter do prompt.md pode definir max_turns (padrão 10), timeout_seconds (padrão 300), model, tags e allowed_tools.

Os graders são arquivos markdown cujo frontmatter define um type, um weight opcional e um arm opcional. São seis tipos no total. Quatro não custam nada, pois são calculados a partir do transcript e dos arquivos em disco: regex, tool_used, tool_order e file_exists. Dois chamam um modelo juiz e entram na fatura: llm (avalia a resposta contra critérios em prosa) e baseline (compara com uma resposta de referência).

O número que importa é o Δ

Por padrão, cada caso roda duas vezes: um braço “com” o plugin carregado e um “sem”. A diferença entre eles — o Δ — é o que o plugin realmente contribuiu. Se um caso pontua 1,0 nos dois braços, o plugin não é o motivo da aprovação. O exemplo da documentação mostra um caso com COM 1,00, SEM 0,33 e Δ de +0,67 em seis execuções, custando cerca de US$ 0,41 e levando 74 segundos.

A Anthropic destaca o achado mais comum no primeiro uso: um Δ próximo de zero com o grader tool_used: Skill falhando. Isso significa que o Claude não está escolhendo a skill em frases naturais — um defeito que o claude plugin validate não enxerga, pois ele checa sintaxe e schema do manifest, não o comportamento.

Custo e integração com CI

Uma suíte gera aproximadamente casos × execuções × braços execuções de agente, além de três chamadas curtas de juiz por grader llm ou baseline por execução. A invocação documentada para CI é:

claude plugin eval . \
  --trust-plugin \
  --json results.json \
  --threshold 0.8 \
  --model claude-sonnet-5 \
  --judge-model claude-haiku-4-5 \
  --no-publish \
  --max-cost-usd 20

O runner exige uma instalação do Claude Code e credenciais como ANTHROPIC_API_KEY. Sem --trust-plugin, um checkout não confiável é recusado com saída 1 quando não há terminal. Os resultados ficam em evals/results/<timestamp>/report.html, com veredictos por grader e votos do juiz. O recurso funciona a partir do Claude Code v2.1.269, e o claude plugin eval init escreve a primeira suíte para você.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.