Inteligência artificial, sem ruído.
Agentes de IA2 min

Harbor e LangChain lançam stack unificado para avaliação de agentes de IA em escala

LangChain e Harbor integram Deep Agents, LangSmith Sandboxes e Observability em um stack unificado de avaliação de agentes, com sandboxes isolados e execução paralela em escala.

Harbor e LangChain lançam stack unificado para avaliação de agentes de IA em escala
Imagem de apoio. Fonte: LangChain Blog.

A LangChain e a Harbor anunciaram uma integração que cria um stack completo para avaliação de agentes de IA. A parceria conecta Deep Agents, LangSmith Sandboxes e LangSmith Observability ao HARBOR, o framework que está se tornando o padrão da indústria para executar avaliações de agentes em ambientes isolados e reprodutíveis.

Avaliar agentes é fundamentalmente diferente de avaliar LLMs. Um agente não apenas gera texto — ele lê arquivos, executa scripts, modifica estado e toma decisões em múltiplas etapas. Cada avaliação precisa rodar em um ambiente limpo e isolado, muitas vezes centenas de vezes em paralelo, com verificações determinísticas ao final.

Como funciona

O Harbor é um harness de avaliação onde você fornece três componentes: um agente (neste caso, qualquer LangGraph app incluindo Deep Agents), um dataset de tarefas e um verificador (script de avaliação). Cada tarefa no dataset especifica um ambiente (Dockerfile), uma instrução (Markdown) e um script de avaliação (test.sh).

A integração com LangChain acontece em três pontos:

  • Deep Agents: qualquer agente construído com LangGraph pode rodar dentro do ambiente sandboxado do Harbor via um arquivo langgraph.json de registro e uma função make_graph.
  • LangSmith Sandboxes: cada trial recebe um sandbox limpo do LangSmith, garantindo que execuções nunca compartilhem estado e permitindo centenas de trials em paralelo.
  • LangSmith Observability: cada job vira um dataset e experimento no LangSmith com traces do agente anexados, permitindo entender por que um trial passou ou falhou, não apenas se passou.

Por que isso importa

À medida que agentes ganham mais capacidades — acesso a computadores inteiros para ler arquivos, executar scripts e rodar código — a avaliação precisa acompanhar essa complexidade. Não basta verificar a resposta final do agente; é preciso inspecionar os artefatos que ele produz ao longo do caminho.

O stack Harbor + LangChain resolve o problema de escala: em vez de rodar avaliações serialmente em uma máquina, cada trial ganha seu próprio sandbox e centenas podem rodar simultaneamente. O resultado é um pipeline de avaliação que trata agentes como sistemas de software reais, não como chamadas de API pontuais.

Fonte: LangChain Blog


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.