Inteligência artificial, sem ruído.
Ferramentas e Apps4 min

GitHub lança Project HydraFusion: orquestração de múltiplos modelos no Copilot CLI

Preview de pesquisa do GitHub orquestra múltiplos modelos por requisição no Copilot CLI, com corte de custo de até 67% em benchmarks.

GitHub lança Project HydraFusion: orquestração de múltiplos modelos no Copilot CLI

O que muda: a escolha de modelo deixa de ser uma configuração única

O GitHub lançou o Project HydraFusion, um preview de pesquisa que deixa de tratar a escolha de modelo como uma decisão feita uma única vez. Em vez de rotear seu prompt para um único modelo, o HydraFusion constrói um plano de execução por requisição: pode redigir o código com um modelo, pedir a um segundo modelo para criticar o rascunho, ou escalar para um modelo mais forte quando um gate de qualidade rejeita a primeira tentativa. Os modelos vêm de múltiplos provedores — e o desenvolvedor escolhe o HydraFusion uma vez, como escolheria qualquer outro modelo.

A novidade importa porque ataca diretamente um dos maiores custos invisíveis do uso de IA para programar: pagar pelo modelo mais caro o tempo todo, mesmo quando a tarefa não exige. O HydraFusion tenta gastar chamadas extras de modelo apenas onde há chance real de melhora.

Disponibilidade: sim, mas estreita por enquanto

É preciso temperar a expectativa. O HydraFusion está disponível como preview de pesquisa para usuários de todos os planos do GitHub Copilot, mas somente dentro do Copilot CLI. Não há pesos abertos nem caminho de self-hosting. Para ativar, o usuário roda /update, depois /experimental on, depois /model e seleciona HydraFusion (Research Preview). O faturamento é por token consumido, conforme os modelos que o fluxo acionar, à taxa padrão de cada modelo.

Os três padrões de execução

O HydraFusion vem depois do Auto model selection, que o GitHub lançou no início de 2026 para casar uma tarefa ao melhor modelo individual. O HydraFusion vai além e trata a seleção de fluxo como um problema de otimização: lê sinais de capacidade para raciocínio, geração de código, depuração e uso de ferramentas, e escolhe o fluxo menos complexo capaz de superar a barra de qualidade.

Para cada requisição, ele seleciona um de três padrões:

  • Single: um único modelo resolve a tarefa diretamente;
  • Cascade: um modelo eficiente redige a solução; um gate de qualidade aceita ou escala para um modelo mais forte;
  • Critique: um modelo redige, um crítico independente de outra família de modelos revisa (sem modificar o repositório), e o modelo original revisa uma vez.

Cada padrão troca qualidade por custo de uma forma diferente: Single preserva velocidade, Cascade mantém aberto um caminho para inferência mais forte, e Critique adiciona uma perspectiva externa quando a revisão supera mais uma tentativa sem auxílio.

Guardrails de engenharia e números de benchmark

O runtime foi construído sobre cinco princípios operacionais que importam para trabalho em nível de repositório: contabilidade completa em cada etapa (redação, crítica, revisão, escalonamento, retry e fallback), execução limitada com timeout e cancelamento por etapa, revisão isolada (críticos rodam em contextos sem ferramentas e não podem alterar o repositório), aplicação à prova de falhas (nenhum patch é aplicado se o fluxo for cancelado ou falhar na validação) e roteamento validado antes do início da execução.

Nos benchmarks, o time do GitHub avaliou políticas fixas do HydraFusion em três conjuntos de codificação agêntica, usando Claude Opus 5 e GPT-5.6 Sol como linhas de base (todos em nível médio de raciocínio). Os números abaixo são relativos ao Opus 5:

BenchmarkCusto estimado vs Opus 5Qualidade verificada vs Opus 5
TerminalBench 2.167% menor+4,9 pontos
DeepSWE36% menor−1,5 pontos
CheckpointBench65% menor−0,1 pontos
Resultados reportados pelo GitHub, relativos ao Claude Opus 5. CheckpointBench é o conjunto interno multi-turno do GitHub, curado de sessões reais do Copilot e ancorado em commits públicos imutáveis.

O destaque é o TerminalBench 2.1: +4,9 pontos de qualidade com custo estimado 67% menor. Em DeepSWE e CheckpointBench, o HydraFusion fica ligeiramente atrás do Opus 5, mas corta custo em 36% e 65%, respectivamente — um trade-off de eficiência que, em muitos cenários reais, compensa a perda marginal de qualidade.

O que isso significa para desenvolvedores brasileiros

Para equipes que usam o Copilot CLI no dia a dia, a lógica por trás do HydraFusion antecipa uma tendência clara: a orquestração de múltiplos modelos como recurso de produto, em vez de um truque manual de prompt. Se a promessa de qualidade se confirmar fora dos benchmarks, a economia de custo em tarefas repetitivas de codificação pode ser significativa — sem exigir que o desenvolvedor gerencie manualmente qual modelo usar a cada chamada.

Vale o alerta de sempre: os números são reportados pelo próprio GitHub e foram obtidos em cenários controlados. A disponibilidade limitada (apenas Copilot CLI, sem pesos abertos) significa que o acesso é restrito a quem já está dentro do ecossistema Copilot.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.