A Anthropic publicou um novo fluxo de avaliação de plugins para o Claude Code. O comando claude plugin eval executa um plugin contra prompts realistas, avalia o que o Claude produziu e compara o resultado com uma execução em que o plugin não está carregado. A ideia é responder a três perguntas que desenvolvedores de plugins antes não conseguiam medir: a skill dispara quando deveria? Sobrevive a uma edição ou a um modelo novo? E, de fato, supera um modelo “pelado”?
Como funciona um caso de avaliação
Uma suíte de evals vive em um diretório evals/ dentro do plugin. Cada caso é um subdiretório com um prompt.md e uma pasta graders/. O corpo do prompt chega ao Claude exatamente como escrito, e menções a @path não são expandidas. O frontmatter do prompt.md pode definir max_turns (padrão 10), timeout_seconds (padrão 300), model, tags e allowed_tools.
Os graders são arquivos markdown cujo frontmatter define um type, um weight opcional e um arm opcional. São seis tipos no total. Quatro não custam nada, pois são calculados a partir do transcript e dos arquivos em disco: regex, tool_used, tool_order e file_exists. Dois chamam um modelo juiz e entram na fatura: llm (avalia a resposta contra critérios em prosa) e baseline (compara com uma resposta de referência).
O número que importa é o Δ
Por padrão, cada caso roda duas vezes: um braço “com” o plugin carregado e um “sem”. A diferença entre eles — o Δ — é o que o plugin realmente contribuiu. Se um caso pontua 1,0 nos dois braços, o plugin não é o motivo da aprovação. O exemplo da documentação mostra um caso com COM 1,00, SEM 0,33 e Δ de +0,67 em seis execuções, custando cerca de US$ 0,41 e levando 74 segundos.
A Anthropic destaca o achado mais comum no primeiro uso: um Δ próximo de zero com o grader tool_used: Skill falhando. Isso significa que o Claude não está escolhendo a skill em frases naturais — um defeito que o claude plugin validate não enxerga, pois ele checa sintaxe e schema do manifest, não o comportamento.
Custo e integração com CI
Uma suíte gera aproximadamente casos × execuções × braços execuções de agente, além de três chamadas curtas de juiz por grader llm ou baseline por execução. A invocação documentada para CI é:
claude plugin eval . \
--trust-plugin \
--json results.json \
--threshold 0.8 \
--model claude-sonnet-5 \
--judge-model claude-haiku-4-5 \
--no-publish \
--max-cost-usd 20O runner exige uma instalação do Claude Code e credenciais como ANTHROPIC_API_KEY. Sem --trust-plugin, um checkout não confiável é recusado com saída 1 quando não há terminal. Os resultados ficam em evals/results/<timestamp>/report.html, com veredictos por grader e votos do juiz. O recurso funciona a partir do Claude Code v2.1.269, e o claude plugin eval init escreve a primeira suíte para você.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.


