A cada semana, agentes de IA ganham tarefas mais longas — navegar na web, usar APIs, encadear ferramentas. O problema é que esses cenários “agenticos” costumam exigir janelas de contexto enormes, e o custo de processar tudo a cada passo cresce rapidamente. Um novo preprint do arXiv apresenta o AsymSpec, um método de decodificação especulativa que promete reduzir o custo computacional para cerca de 20% a 30% do processamento completo, mantendo perto de 90% da precisão em tarefas de texto isoladas.
Decodificação assimétrica: duas visões do mesmo texto
A ideia central é dar aos dois componentes do decodificador visões desiguais da entrada. O drafter (rascunhador) lê a entrada completa e propõe tokens; o verifier (verificador) trabalha sobre uma versão comprimida do contexto. O método combina uma fusão contrastiva de logits (δ-fusion) com um portão de aceitação sensível à divergência para guiar o verificador. No artigo, o verificador comprimido é chamado de “Floor” e o de contexto completo de “Ceiling”.
O que os números mostraram
Nos testes, o AsymSpec entregou em média 1,45× o throughput do Ceiling usando 0,23× dos FLOPs normalizados. A vantagem mais clara apareceu sob compressão severa: com apenas 500 tokens de contexto no verificador, o método marcou 52,5 de F1 no LongBench contra 25,8 do Floor — uma diferença de 26,7 pontos. Já com 12.000 tokens, a diferença caiu para 0,8 ponto, sinalizando que o ganho se concentra nos cenários de menor orçamento de contexto.
Em tarefas multimodais e em loops de agente ao vivo, o resultado se repetiu de forma mais modesta. No MathVista, o AsymSpec alcançou 53,9% de acerto, cerca de 10 pontos acima da decodificação especulativa simétrica, embora o artigo alerte que esses números dependem fortemente de detalhes de implementação.
Ressalvas importantes
O preprint é explícito sobre as fronteiras do resultado. Os ganhos variam conforme o par de modelos (drafter–verifier), o compressor usado e o tamanho do drafter: abaixo de 0,6 bilhão de parâmetros, o rascunhador se mostrou pouco confiável, e o artigo aponta 1,7 bilhão como mínimo prático. Pares heterogêneos (como Llama-3B para Llama-70B) tiveram recuperação de apenas 23%, exigindo alinhamento de vocabulário e logits. Além disso, o AsymSpec não preserva uma distribuição alvo estrita e está calibrado para emissão gulosa — os autores não relatam intervalos de confiança para as médias principais.
Para quem roda LLMs em produção ou constrói agentes, o recado é útil: dá para cortar boa parte do custo de contexto em cenários agenticos, desde que a dupla de modelos seja escolhida com cuidado.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



