Nem toda chamada do seu agente precisa de um modelo de fronteira: NVIDIA mostra que 93% podem usar modelos menores
Agentes de IA fazem dezenas de chamadas a modelos de linguagem para completar tarefas. A maioria das equipes envia todas essas chamadas para o mesmo modelo de fronteira — o mais caro disponível. Um novo estudo da NVIDIA revela que isso é um desperdício: apenas 7% das chamadas realmente precisam dele.
O NVIDIA NeMo Switchyard, uma biblioteca open source de roteamento de modelos, automatiza a seleção de modelos entre as etapas do fluxo de trabalho de um agente. A ideia é simples: tarefas triviais como “ler este arquivo” não deveriam custar o mesmo que “descubra por que este teste está falhando”.
Os números que mudam o cálculo
A NVIDIA executou sua suíte de avaliação Deep Agents através do Switchyard e os resultados são impressionantes:
- 7% das chamadas foram roteadas para o modelo de fronteira (Claude Opus 4.8)
- 93% das chamadas foram atendidas por um modelo de 30B parâmetros (Nemotron 3.5 Lightning)
- 74% de redução no custo total em relação a usar apenas o Opus
- 93% da acurácia mantida em relação ao modelo de fronteira sozinho
Em outras palavras: corte três quartos dos seus custos de API perdendo apenas 6 pontos percentuais de acurácia.
A fórmula do tradeoff
O Switchyard oferece três abordagens de roteamento, cada uma com diferentes equilíbrios entre latência e acurácia:
- Classificador LLM: um modelo juiz pequeno decide para onde vai cada chamada
- Roteamento baseado em regras: padrões predefinidos por etapa do workflow
- Pesquisa (em desenvolvimento): abordagem experimental com tradeoffs diferentes
O time da NVIDIA também publicou uma fórmula prática: divida o custo do juiz pela diferença de preço entre os dois modelos. Se os modelos forem muito próximos em preço, o número sobe acima de 100% e o roteamento não compensa — a menos que você hospede o modelo barato você mesmo.
Por que isso importa agora
Agentes de IA estão saindo dos protótipos para produção. Cada chamada desnecessária a um modelo de fronteira como Claude Opus ou GPT-5 consome créditos que poderiam ser usados em tarefas que realmente exigem raciocínio profundo. O Switchyard é open source e funciona como proxy ou middleware — você pode integrá-lo ao seu agente sem reescrever toda a arquitetura.
Se você está construindo agentes em 2026, a pergunta não é mais “qual modelo usar”, mas “qual modelo usar para cada tipo de tarefa”.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



