Inteligência artificial, sem ruído.
Infraestrutura3 min

Fireworks Nexus estreia com roteamento inteligente que reduz em até 5× o custo de agentes de código

Fireworks AI lança plataforma que move tarefas rotineiras para modelos de peso aberto mantendo as complexas em modelos de fronteira, com redução de 33% no custo por PR.

Fireworks Nexus estreia com roteamento inteligente que reduz em até 5× o custo de agentes de código

Fireworks Nexus: roteamento inteligente reduz em até 5× o custo de agentes de código

A Fireworks AI lançou o Fireworks Nexus, uma plataforma de gerenciamento e roteamento de IA voltada para organizações de engenharia. A promessa é simples e ambiciosa: mover tarefas rotineiras de codificação para modelos de peso aberto, mantendo as tarefas complexas nos modelos de fronteira — e reduzir o custo total em 3 a 5 vezes sem mudar o fluxo de trabalho dos desenvolvedores.

O problema que o Nexus resolve

O diagnóstico da Fireworks é direto: a maioria das organizações está rodando trabalho rotineiro a preço de fronteira. A Forbes reportou que o Uber esgotou todo o orçamento de IA de 2026 em apenas quatro meses. O Claude Code atingiu cerca de 5.000 engenheiros após o lançamento em dezembro. A adoção de agentes de IA saltou de um terço para mais de quatro quintos dos engenheiros em dois meses.

O problema não é gastar demais — é gastar errado. A complexidade operacional de migrar para modelos de peso aberto tornou a troca pouco atrativa para times de plataforma. O Nexus ataca exatamente essa fricção.

Três componentes, uma plataforma

O Nexus é composto de três camadas. A primeira são controles empresariais e observabilidade de custos: orçamentos por time ou empresa, rastreamento de ROI entre modelos e ferramentas, e política unificada. As requisições rodam na infraestrutura de inferência da Fireworks, com endpoints nos EUA, retenção zero de dados e cobertura em 20 data centers globais.

A segunda camada é a continuidade de fluxo de trabalho via FireConnect: um instalador de uma linha (Apache 2.0) que mapeia os slots de modelo do harness para modelos Fireworks. Claude Code, Codex e OpenCode continuam funcionando sem alterações.

A terceira é o roteamento inteligente: um modelo treinado pontua a dificuldade de cada requisição. Tarefas rotineiras vão para um modelo de peso aberto; tarefas difíceis são repassadas ao provedor original com a chave do cliente (que a Fireworks afirma nunca armazenar no servidor).

Evidência independente

Dois estudos dão suporte aos números. A Faros AI rodou 211 tarefas reais de engenharia em 12 repositórios, testando 7 combinações de modelo e harness. Claude Code com GLM-5.2 pontuou 0,568 contra 0,521 do Claude Code com Opus 4.8 — mas custou US$ 0,92 por tarefa contra US$ 1,76.

A Arize, em parceria com a Fireworks, avaliou 10 modelos em 40 tarefas do Terminal-Bench com 6 tentativas cada — 2.400 execuções e US$ 626 em gasto de API. O resultado mais revelador: em tarefas fáceis, o prêmio de fronteira não compra nada. O Kimi K2.6 passou em 73% onde o GPT-5.5 passou em 69%. Em tarefas difíceis, só o topo compete. A rotação simulada sobre essas execuções venceu qualquer estratégia de modelo único.

Três caminhos para ativar

As equipes podem adotar o Nexus por três rotas: (1) FireConnect — instalação de uma linha que expõe comandos como /fireconnect:on e /fireconnect:off no Claude Code; (2) API direta — trocar a URL base e o ID do modelo no cliente Anthropic ou OpenAI-compatible; (3) Roteador — preview de pesquisa que posiciona um modelo de roteamento na frente do contrato de fronteira existente.

O roteador está em preview e atualmente alterna entre Claude Opus 5 e GLM-5.2 (requer chave Anthropic) ou entre Kimi K3 e GLM-5.2 (configuração totalmente aberta).

Para times brasileiros, o Nexus é relevante porque ataca diretamente o problema de custo de agentes de IA — um fator crítico em um mercado onde o dólar multiplica o gasto com APIs. A Fireworks cita redução de 33% no custo por pull request merged em testes com Notion e Doximity.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.