Inteligência artificial, sem ruído.
Agentes de IA3 min

Speculative Macro Commit reduz latência de agentes de IA em até 45%

Mecanismo de execução especulativa acelera agentes de IA em até 45% reutilizando cadeias de ações repetidas, sem perder precisão.

Speculative Macro Commit reduz latência de agentes de IA em até 45%

Agentes de IA que usam ferramentas perdem boa parte do tempo de resposta não na inferência do modelo, mas em turnos seriais de ação e observação: cada chamada de ferramenta, cada transição de ambiente e cada observação atrasa a decisão seguinte. Um novo mecanismo de execução especulativa promete reduzir essa latência de forma significativa — reaproveitando cadeias de ações que se repetem.

Como funciona o Speculative Macro Commit

O Speculative Macro Commit (SMC) propõe um sistema de dois níveis: um modelo ator grande e autoritativo produz a trajetória oficial, enquanto um modelo “drafter” (especulador) mais rápido e leve prevê e executa continuamente cadeias de ações futuras em um snapshot isolado do ambiente.

O segredo está numa biblioteca de macros: o SMC extrai, dos rastros de treinamento, esqueletos de múltiplas ações que se repetem com frequência e os armazena. Em tempo de execução, o drafter compara as cadeias de ações previstas com essas macros. Quando a próxima chamada de ferramenta do ator coincide com a primeira ação especulada, o SMC confirma em lote as etapas restantes já pré-executadas — junto com suas observações — para a trajetória oficial.

Resultados medidos em benchmarks reais

Usando o Qwen3.5-27B INT4 como ator autoritativo e o Qwen3.5-4B como drafter especulativo, o SMC igualou a precisão do agente sequencial enquanto reduziu a latência em 10,23% sobre a linha de base de Speculative Actions (SA) e em 18,59% sobre a execução sequencial no subconjunto Telecom do benchmark τ²-Bench. No AppWorld, a redução de tempo de parede foi de 7,7% sobre o SA e de 44,9% sobre a execução sequencial — com uma pequena redução na conclusão de tarefas.

Por que isso importa

O avanço é relevante porque ataca o gargalo que mais incomoda quem usa agentes em produção: o tempo de espera. Um assistente que precisa chamar dez ferramentas em sequência sente cada uma dessas chamadas como latência acumulada. Técnicas de execução especulativa — já consagradas em outros domínios da computação, como CPUs e decodificação de LLMs — agora chegam aos agentes com uma novidade: a reutilização de padrões de ação em múltiplas etapas.

O código está disponível publicamente no GitHub, o que permite a qualquer time experimentar o mecanismo em seus próprios agentes. Para o ecossistema brasileiro, onde muitas aplicações rodam em hardware local ou com orçamento de nuvem limitado, a combinação de um modelo pequeno como especulador com um modelo maior como ator é uma receita acessível para acelerar agentes sem trocar toda a stack.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.