Inteligência artificial, sem ruído.
Tutoriais3 min

RAGAS, DeepEval e Promptfoo: os 3 frameworks para avaliar LLMs que você precisa conhecer

Como medir se seu modelo está funcionando? Três frameworks open source dominam a avaliação de LLMs em 2026 — cada um com uma filosofia diferente sobre o que medir e como.

RAGAS, DeepEval e Promptfoo: os 3 frameworks para avaliar LLMs que você precisa conhecer

Frameworks de avaliação de LLMs: RAGAS, DeepEval e Promptfoo comparados

Avaliar se um LLM está realmente funcionando bem é um dos problemas mais espinhosos da engenharia de IA em 2026. Diferente de um modelo de classificação tradicional — onde você tem uma métrica binária clara —, julgar a qualidade de texto gerado exige critérios subjetivos: a resposta foi relevante? A informação está correta? O tom está adequado?

Três frameworks open source dominam hoje o ecossistema de avaliação de LLMs: RAGAS, DeepEval e Promptfoo. Todos usam o mecanismo de “LLM como juiz” (LLM-as-a-judge) — um modelo avaliador que pontua a saída de outro modelo —, mas cada um adota uma filosofia diferente sobre o que medir e como medir.

RAGAS: foco em pipelines RAG

O RAGAS (Retrieval Augmented Generation Assessment) é especializado em avaliar sistemas que combinam busca e geração. Ele introduz métricas específicas para pipelines RAG:

  • Context Precision: os chunks recuperados são relevantes para a pergunta?
  • Context Recall: a resposta usou toda a informação relevante disponível?
  • Faithfulness: a resposta se mantém fiel ao contexto recuperado, sem alucinar?
  • Answer Relevancy: a resposta final é pertinente à pergunta original?

O RAGAS funciona melhor quando seu sistema tem um componente de recuperação documental claro — chatbots com base de conhecimento, search engines internos, assistentes de documentação.

DeepEval: avaliação como testes unitários

O DeepEval adota a filosofia de que avaliação de LLMs deve ser tratada como testes unitários para IA. Ele oferece:

  • 15+ métricas prontas: hallucination, toxicity, bias, summarization, conversação
  • Integração com pytest: escreva testes de avaliação como se fossem testes de software
  • Dashboard de confiabilidade: monitore a qualidade do modelo ao longo do tempo em produção
  • Synthetic data generation: gere datasets de avaliação a partir de documentos existentes

O ponto forte do DeepEval é a mentalidade de engenharia de software: você define thresholds, roda em CI/CD e bloqueia deploys se a qualidade cair abaixo do esperado.

Promptfoo: comparação e red-teaming

O Promptfoo é focado em comparação lado a lado de diferentes modelos e prompts. Seu diferencial:

  • Testes A/B de prompts: compare múltiplas variações de prompt contra o mesmo dataset
  • Red-teaming automatizado: gere casos de borda para testar vulnerabilidades do modelo
  • Suporte a dezenas de providers: OpenAI, Anthropic, Ollama, vLLM, AWS Bedrock e outros
  • Output em tabelas comparativas: veja qual modelo/prompt vence em cada cenário

O viés do “LLM como juiz”

Todos os três frameworks compartilham uma limitação fundamental: usar um LLM para avaliar outro LLM introduz vieses mensuráveis. Estudos recentes mostram que:

  • Modelos avaliadores tendem a favorecer respostas mais longas e verbosas, mesmo quando são menos precisas
  • Há viés de posição: a ordem em que as respostas são apresentadas afeta a pontuação
  • Modelos da mesma família (ex: GPT-4 avaliando GPT-4) mostram viés de auto-preferência
  • A avaliação numérica (nota de 1-10) é menos confiável que comparação pareada (A vs B)

A recomendação prática: use LLM-as-a-judge como filtro inicial, mas sempre complemente com avaliação humana em amostras representativas, especialmente em domínios de alto risco como saúde, direito e finanças.

Como escolher

A escolha depende do seu caso de uso:

  • RAGAS: se você tem um pipeline RAG e quer métricas específicas de recuperação
  • DeepEval: se você quer integrar avaliação ao seu pipeline de CI/CD com pytest
  • Promptfoo: se você precisa comparar múltiplos modelos ou fazer red-teaming

Na prática, times maduros frequentemente combinam dois ou três: Promptfoo para seleção inicial de modelo, RAGAS para tuning do pipeline de busca, e DeepEval para monitoramento contínuo em produção.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.