O que são os Tuned Evaluators
A LangChain anunciou o lançamento dos Tuned Evaluators, um recurso do LangSmith que anexa automaticamente feedback de qualidade a traces e conversas de agentes de IA em produção. A proposta é simples: em vez de cada equipe escrever e manter prompts complexos de avaliação, selecionar e versionar modelos de “LLM como juiz”, gerenciar credenciais e operar infraestrutura de inferência, a LangChain entrega tudo isso pronto — um avaliador gerenciado de ponta a ponta.
O primeiro avaliador da linha é o Perceived Error, voltado para identificar erros que o usuário percebe na interação. Segundo a empresa, é um dos sinais mais claros de que um agente está oferecendo uma experiência útil — e, até agora, um dos mais caros e difíceis de escalar. As equipes precisavam recorrer a modelos de fronteira, amostrar apenas uma fatia pequena dos traces e gastar tempo ajustando o avaliador manualmente.
Precisão de fronteira por uma fração do custo
A LangChain afirma que o Perceived Error usa um modelo especializado treinado internamente que superou o desempenho de modelos de fronteira na tarefa, reduzindo o custo de avaliação em até 82%. Isso ataca diretamente o trade-off clássico da avaliação em produção: modelos grandes oferecem julgamentos fortes, mas aplicá-los a muitas conversas sai caro; modelos menores custam menos, mas têm precisão menor, o que torna difícil confiar em quais traces merecem atenção. O resultado prático é que muitas equipes avaliam apenas uma amostra pequena dos fluxos — e perdem problemas no resto.
Cada Tuned Evaluator é um avaliador pronto e versionado para um objetivo específico. A equipe seleciona o avaliador que precisa e o anexa a um projeto de tracing. O feedback gerado serve para encontrar comportamentos que precisam de atenção, entender o que deu errado e tomar medidas para melhorar os agentes.
Por que isso importa
O lançamento ilustra uma maturação do ecossistema de agentes de IA: a conversa está deixando de ser apenas sobre construir agentes e passando a ser sobre observá-los e melhorá-los de forma contínua. Ferramentas que reduzem o custo de avaliação em produção tornam viável monitorar cada conversa — e não apenas uma amostra —, o que muda a qualidade do feedback disponível para as equipes de engenharia. Para quem já opera agentes conversacionais em produção, é um sinal de que a avaliação contínua está se tornando commodity, e não mais um projeto interno caro.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



