Inteligência artificial, sem ruído.
Agentes de IA3 min

Corte até 90% dos custos de inferência em sistemas multiagente com roteamento adaptativo

Roteador adaptativo de modelos pode cortar até 90% dos custos de inferência em sistemas multiagente sem alterar a lógica dos agentes.

Corte até 90% dos custos de inferência em sistemas multiagente com roteamento adaptativo

Em sistemas multiagente, o desenho ingênuo é usar o mesmo LLM mais poderoso para todos os agentes — o planejador, o pesquisador, o analista e o repórter — independentemente de a tarefa ser uma busca simples na web ou uma análise densa de risco em contratos. Um roteador adaptativo de modelos pode cortar os custos de inferência em até 90% sem tocar na lógica dos agentes, mostra um artigo técnico de Partha Sarkar no Towards Data Science.

O problema da atribuição estática

Quando o tipo de consulta é consistente e previsível, faz sentido atribuir modelos pequenos, equilibrados ou grandes a cada agente de forma estática. Mas, num assistente versátil que atende departamentos diferentes de uma organização, fontes de dados, ferramentas e contexto só são conhecidos em tempo de execução — e a atribuição estática quebra.

A arquitetura proposta

Em vez de um planejador global monolítico, o sistema empurra o planejamento para cada agente, gerando sub-tarefas just-in-time sob medida para as capacidades do agente ativo. Uma camada de classificação leve, posicionada na frente da execução, avalia essas sub-tarefas na hora e atribui o LLM do tamanho certo, dando visibilidade granular sobre o gasto de inferência.

O primeiro princípio é que classificar é muito mais simples do que executar. Descobrir se uma tarefa é de alta ou baixa complexidade exige bem menos inteligência do que realizá-la — então um modelo rápido e barato (como um Gemini-flash-lite ou gpt-nano) faz a classificação. O segundo princípio: o planejamento não precisa ser feito todo de antemão. Cada agente invoca seu próprio planejador no momento certo, e o analista vê a saída completa do pesquisador antes de escolher os modelos, evitando a “cegueira de contexto” do planejador global.

Pontuação e roteamento

O classificador devolve três notas — complexidade (recuperação factual até raciocínio multi-etapas), raciocínio (busca direta até inferência lógica) e tamanho do contexto (menos de 2k até mais de 6k tokens) — somadas num escore de roteamento de 0 a 6 que mapeia para uma camada de modelo: os escores mais baixos vão para modelos rápidos e baratos, os mais altos para modelos de fronteira.

O resultado prático: o mesmo pipeline multiagente passa a gastar apenas o necessário em cada etapa, com o bônus de registrar exatamente onde o custo de inferência está sendo consumido.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.