Inteligência artificial, sem ruído.
Modelos e LLMs3 min

AsymSpec: decodificação assimétrica corta custo computacional de LLMs agentivos

Método de decodificação especulativa reduz o custo computacional de LLMs agentivos a 20–30% mantendo cerca de 90% da precisão.

AsymSpec: decodificação assimétrica corta custo computacional de LLMs agentivos

A cada semana, agentes de IA ganham tarefas mais longas — navegar na web, usar APIs, encadear ferramentas. O problema é que esses cenários “agenticos” costumam exigir janelas de contexto enormes, e o custo de processar tudo a cada passo cresce rapidamente. Um novo preprint do arXiv apresenta o AsymSpec, um método de decodificação especulativa que promete reduzir o custo computacional para cerca de 20% a 30% do processamento completo, mantendo perto de 90% da precisão em tarefas de texto isoladas.

Decodificação assimétrica: duas visões do mesmo texto

A ideia central é dar aos dois componentes do decodificador visões desiguais da entrada. O drafter (rascunhador) lê a entrada completa e propõe tokens; o verifier (verificador) trabalha sobre uma versão comprimida do contexto. O método combina uma fusão contrastiva de logits (δ-fusion) com um portão de aceitação sensível à divergência para guiar o verificador. No artigo, o verificador comprimido é chamado de “Floor” e o de contexto completo de “Ceiling”.

O que os números mostraram

Nos testes, o AsymSpec entregou em média 1,45× o throughput do Ceiling usando 0,23× dos FLOPs normalizados. A vantagem mais clara apareceu sob compressão severa: com apenas 500 tokens de contexto no verificador, o método marcou 52,5 de F1 no LongBench contra 25,8 do Floor — uma diferença de 26,7 pontos. Já com 12.000 tokens, a diferença caiu para 0,8 ponto, sinalizando que o ganho se concentra nos cenários de menor orçamento de contexto.

Em tarefas multimodais e em loops de agente ao vivo, o resultado se repetiu de forma mais modesta. No MathVista, o AsymSpec alcançou 53,9% de acerto, cerca de 10 pontos acima da decodificação especulativa simétrica, embora o artigo alerte que esses números dependem fortemente de detalhes de implementação.

Ressalvas importantes

O preprint é explícito sobre as fronteiras do resultado. Os ganhos variam conforme o par de modelos (drafter–verifier), o compressor usado e o tamanho do drafter: abaixo de 0,6 bilhão de parâmetros, o rascunhador se mostrou pouco confiável, e o artigo aponta 1,7 bilhão como mínimo prático. Pares heterogêneos (como Llama-3B para Llama-70B) tiveram recuperação de apenas 23%, exigindo alinhamento de vocabulário e logits. Além disso, o AsymSpec não preserva uma distribuição alvo estrita e está calibrado para emissão gulosa — os autores não relatam intervalos de confiança para as médias principais.

Para quem roda LLMs em produção ou constrói agentes, o recado é útil: dá para cortar boa parte do custo de contexto em cenários agenticos, desde que a dupla de modelos seja escolhida com cuidado.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.