Agentes de IA que usam ferramentas perdem boa parte do tempo de resposta não na inferência do modelo, mas em turnos seriais de ação e observação: cada chamada de ferramenta, cada transição de ambiente e cada observação atrasa a decisão seguinte. Um novo mecanismo de execução especulativa promete reduzir essa latência de forma significativa — reaproveitando cadeias de ações que se repetem.
Como funciona o Speculative Macro Commit
O Speculative Macro Commit (SMC) propõe um sistema de dois níveis: um modelo ator grande e autoritativo produz a trajetória oficial, enquanto um modelo “drafter” (especulador) mais rápido e leve prevê e executa continuamente cadeias de ações futuras em um snapshot isolado do ambiente.
O segredo está numa biblioteca de macros: o SMC extrai, dos rastros de treinamento, esqueletos de múltiplas ações que se repetem com frequência e os armazena. Em tempo de execução, o drafter compara as cadeias de ações previstas com essas macros. Quando a próxima chamada de ferramenta do ator coincide com a primeira ação especulada, o SMC confirma em lote as etapas restantes já pré-executadas — junto com suas observações — para a trajetória oficial.
Resultados medidos em benchmarks reais
Usando o Qwen3.5-27B INT4 como ator autoritativo e o Qwen3.5-4B como drafter especulativo, o SMC igualou a precisão do agente sequencial enquanto reduziu a latência em 10,23% sobre a linha de base de Speculative Actions (SA) e em 18,59% sobre a execução sequencial no subconjunto Telecom do benchmark τ²-Bench. No AppWorld, a redução de tempo de parede foi de 7,7% sobre o SA e de 44,9% sobre a execução sequencial — com uma pequena redução na conclusão de tarefas.
Por que isso importa
O avanço é relevante porque ataca o gargalo que mais incomoda quem usa agentes em produção: o tempo de espera. Um assistente que precisa chamar dez ferramentas em sequência sente cada uma dessas chamadas como latência acumulada. Técnicas de execução especulativa — já consagradas em outros domínios da computação, como CPUs e decodificação de LLMs — agora chegam aos agentes com uma novidade: a reutilização de padrões de ação em múltiplas etapas.
O código está disponível publicamente no GitHub, o que permite a qualquer time experimentar o mecanismo em seus próprios agentes. Para o ecossistema brasileiro, onde muitas aplicações rodam em hardware local ou com orçamento de nuvem limitado, a combinação de um modelo pequeno como especulador com um modelo maior como ator é uma receita acessível para acelerar agentes sem trocar toda a stack.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



