Frameworks de avaliação de LLMs: RAGAS, DeepEval e Promptfoo comparados
Avaliar se um LLM está realmente funcionando bem é um dos problemas mais espinhosos da engenharia de IA em 2026. Diferente de um modelo de classificação tradicional — onde você tem uma métrica binária clara —, julgar a qualidade de texto gerado exige critérios subjetivos: a resposta foi relevante? A informação está correta? O tom está adequado?
Três frameworks open source dominam hoje o ecossistema de avaliação de LLMs: RAGAS, DeepEval e Promptfoo. Todos usam o mecanismo de “LLM como juiz” (LLM-as-a-judge) — um modelo avaliador que pontua a saída de outro modelo —, mas cada um adota uma filosofia diferente sobre o que medir e como medir.
RAGAS: foco em pipelines RAG
O RAGAS (Retrieval Augmented Generation Assessment) é especializado em avaliar sistemas que combinam busca e geração. Ele introduz métricas específicas para pipelines RAG:
- Context Precision: os chunks recuperados são relevantes para a pergunta?
- Context Recall: a resposta usou toda a informação relevante disponível?
- Faithfulness: a resposta se mantém fiel ao contexto recuperado, sem alucinar?
- Answer Relevancy: a resposta final é pertinente à pergunta original?
O RAGAS funciona melhor quando seu sistema tem um componente de recuperação documental claro — chatbots com base de conhecimento, search engines internos, assistentes de documentação.
DeepEval: avaliação como testes unitários
O DeepEval adota a filosofia de que avaliação de LLMs deve ser tratada como testes unitários para IA. Ele oferece:
- 15+ métricas prontas: hallucination, toxicity, bias, summarization, conversação
- Integração com pytest: escreva testes de avaliação como se fossem testes de software
- Dashboard de confiabilidade: monitore a qualidade do modelo ao longo do tempo em produção
- Synthetic data generation: gere datasets de avaliação a partir de documentos existentes
O ponto forte do DeepEval é a mentalidade de engenharia de software: você define thresholds, roda em CI/CD e bloqueia deploys se a qualidade cair abaixo do esperado.
Promptfoo: comparação e red-teaming
O Promptfoo é focado em comparação lado a lado de diferentes modelos e prompts. Seu diferencial:
- Testes A/B de prompts: compare múltiplas variações de prompt contra o mesmo dataset
- Red-teaming automatizado: gere casos de borda para testar vulnerabilidades do modelo
- Suporte a dezenas de providers: OpenAI, Anthropic, Ollama, vLLM, AWS Bedrock e outros
- Output em tabelas comparativas: veja qual modelo/prompt vence em cada cenário
O viés do “LLM como juiz”
Todos os três frameworks compartilham uma limitação fundamental: usar um LLM para avaliar outro LLM introduz vieses mensuráveis. Estudos recentes mostram que:
- Modelos avaliadores tendem a favorecer respostas mais longas e verbosas, mesmo quando são menos precisas
- Há viés de posição: a ordem em que as respostas são apresentadas afeta a pontuação
- Modelos da mesma família (ex: GPT-4 avaliando GPT-4) mostram viés de auto-preferência
- A avaliação numérica (nota de 1-10) é menos confiável que comparação pareada (A vs B)
A recomendação prática: use LLM-as-a-judge como filtro inicial, mas sempre complemente com avaliação humana em amostras representativas, especialmente em domínios de alto risco como saúde, direito e finanças.
Como escolher
A escolha depende do seu caso de uso:
- RAGAS: se você tem um pipeline RAG e quer métricas específicas de recuperação
- DeepEval: se você quer integrar avaliação ao seu pipeline de CI/CD com pytest
- Promptfoo: se você precisa comparar múltiplos modelos ou fazer red-teaming
Na prática, times maduros frequentemente combinam dois ou três: Promptfoo para seleção inicial de modelo, RAGAS para tuning do pipeline de busca, e DeepEval para monitoramento contínuo em produção.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



