Um agente de IA é um modelo mais um harness. O modelo faz o raciocínio, e o harness — o system prompt, as descrições de ferramentas, o middleware — é o andaime em que ele trabalha. A LangChain já havia ajustado harnesses para modelos de fronteira antes, mas desta vez decidiu ver até onde conseguia chegar com um modelo aberto: o NVIDIA Nemotron 3 Ultra. O resultado mais importante da experiência: você não precisa ajustar os pesos do modelo para extrair desempenho de ponta.
Principais conclusões
Qualidade de agente quase-frontier por fração do custo. Apenas ajustando o harness, o Nemotron 3 Ultra atingiu score de 0.86 no benchmark Deep Agents — contra 0.87 do Claude Opus 4.8 — com custo aproximadamente 10x menor por execução (cerca de US$ 4,48 contra US$ 43,48 no benchmark completo).
Avaliações são os dados de treinamento do harness. Cada mudança passou por um loop orientado por traces, filtrada primeiro em testes baratos, e só ganhou seu lugar se a melhoria se repetisse em múltiplas tentativas sem regredir em nenhum outro cenário.
O encaixe decide quanto da capacidade do modelo chega à tarefa. Um harness bem ajustado deixa o modelo gastar sua capacidade no trabalho; um harness desalinhado faz o modelo lutar contra o scaffolding. A diferença aparece no score sem tocar nos pesos.
Ajuste de harness tem teto. Ele corrige falhas que vêm do scaffolding, mas não pode adicionar o que não está nos pesos. Um resultado que permanece inalterado após várias mudanças de harness aponta para a necessidade de pós-treinamento, não mais hooks.
O harness é a parte que você controla
Fora da caixa, um harness genérico não está ajustado para nenhum modelo específico. Usar um modelo sem tuning de harness é um padrão razoável, mas está longe do melhor possível. Quando modelo e harness estão alinhados, o modelo gasta sua capacidade na tarefa. Quando não estão, ele gasta capacidade lutando contra o scaffolding — repetindo perguntas, parando cedo demais ou entrando em loops.
A LangChain já demonstrou isso antes: no Terminal-Bench 2.0, levou o GPT-5.2-codex de 52.8 para 66.5 — do Top 30 para o Top 5 na época — sem tocar no modelo. Com perfis de harness por modelo, melhorou um subconjunto do tau2-bench em 10 a 20 pontos apenas seguindo os guias de prompting de cada fornecedor. Os mesmos pesos com scaffolding diferente produzem scores diferentes.
Comece pelas avaliações
Ajustar um harness para um modelo sempre começa com avaliações. Sem um sinal de aprendizado, você está chutando — e um harness ajustado por chutes overfita para a última coisa que você olhou. A LangChain trata as avaliações como dados de treinamento para engenharia de harness. O loop é:
1. Execute a suíte de comportamento nos modelos.
2. Leia o trace de cada execução que falhou para ver onde e como falhou.
3. Agrupe as trajetórias de falha em padrões de comportamento.
4. Priorize os padrões por frequência e gravidade.
5. Aplique uma mudança no harness para abordar o padrão mais impactante e reexecute.
As duas camadas
O ajuste de harness opera em duas camadas: o system prompt (instruções de alto nível que definem o comportamento do agente) e as descrições de ferramentas (como cada função é apresentada ao modelo). Pequenas mudanças na clareza das descrições de ferramentas — por exemplo, especificar exatamente os tipos de parâmetros esperados e o formato de retorno — tiveram impacto desproporcionalmente grande no desempenho.
O que não funcionou
Nem toda ideia promissora sobreviveu ao ciclo de avaliação. A equipe testou instruções excessivamente detalhadas no system prompt (que confundiram o modelo), ordenação diferente de ferramentas (sem efeito consistente) e exemplos few-shot inline (que ajudaram em alguns cenários mas pioraram outros). O padrão foi claro: simplicidade e clareza consistentemente superaram complexidade.
Por que isso importa
Este playbook mostra que o caminho para agentes de IA de alta qualidade em produção não passa necessariamente por fine-tuning caro ou por depender de APIs de modelos fechados. Com um modelo aberto como o Nemotron 3 Ultra e um processo disciplinado de tuning de harness orientado por avaliações, é possível atingir qualidade de ponta com controle total de custos e independência de fornecedor.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



