Inteligência artificial, sem ruído.
Agentes de IA3 min

Nem toda chamada do seu agente precisa de um modelo de fronteira: NVIDIA mostra que 93% podem usar modelos menores

NVIDIA NeMo Switchyard reduziu em 74% o custo de agentes de IA ao rotear 93% das chamadas para modelos menores, mantendo 93% da acurácia do Claude Opus 4.8.

Nem toda chamada do seu agente precisa de um modelo de fronteira: NVIDIA mostra que 93% podem usar modelos menores

Nem toda chamada do seu agente precisa de um modelo de fronteira: NVIDIA mostra que 93% podem usar modelos menores

Agentes de IA fazem dezenas de chamadas a modelos de linguagem para completar tarefas. A maioria das equipes envia todas essas chamadas para o mesmo modelo de fronteira — o mais caro disponível. Um novo estudo da NVIDIA revela que isso é um desperdício: apenas 7% das chamadas realmente precisam dele.

O NVIDIA NeMo Switchyard, uma biblioteca open source de roteamento de modelos, automatiza a seleção de modelos entre as etapas do fluxo de trabalho de um agente. A ideia é simples: tarefas triviais como “ler este arquivo” não deveriam custar o mesmo que “descubra por que este teste está falhando”.

Os números que mudam o cálculo

A NVIDIA executou sua suíte de avaliação Deep Agents através do Switchyard e os resultados são impressionantes:

  • 7% das chamadas foram roteadas para o modelo de fronteira (Claude Opus 4.8)
  • 93% das chamadas foram atendidas por um modelo de 30B parâmetros (Nemotron 3.5 Lightning)
  • 74% de redução no custo total em relação a usar apenas o Opus
  • 93% da acurácia mantida em relação ao modelo de fronteira sozinho

Em outras palavras: corte três quartos dos seus custos de API perdendo apenas 6 pontos percentuais de acurácia.

A fórmula do tradeoff

O Switchyard oferece três abordagens de roteamento, cada uma com diferentes equilíbrios entre latência e acurácia:

  1. Classificador LLM: um modelo juiz pequeno decide para onde vai cada chamada
  2. Roteamento baseado em regras: padrões predefinidos por etapa do workflow
  3. Pesquisa (em desenvolvimento): abordagem experimental com tradeoffs diferentes

O time da NVIDIA também publicou uma fórmula prática: divida o custo do juiz pela diferença de preço entre os dois modelos. Se os modelos forem muito próximos em preço, o número sobe acima de 100% e o roteamento não compensa — a menos que você hospede o modelo barato você mesmo.

Por que isso importa agora

Agentes de IA estão saindo dos protótipos para produção. Cada chamada desnecessária a um modelo de fronteira como Claude Opus ou GPT-5 consome créditos que poderiam ser usados em tarefas que realmente exigem raciocínio profundo. O Switchyard é open source e funciona como proxy ou middleware — você pode integrá-lo ao seu agente sem reescrever toda a arquitetura.

Se você está construindo agentes em 2026, a pergunta não é mais “qual modelo usar”, mas “qual modelo usar para cada tipo de tarefa”.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.