Rodar modelos de linguagem localmente, em CPU, esbarra em um gargalo conhecido: a matriz de embeddings de saída, que mapeia o estado interno do modelo para todo o vocabulário. Em modelos compactos com vocabulários multilíngues grandes, essa etapa consome uma fatia desproporcional da largura de banda de memória durante a decodificação autoregressiva. Um novo artigo do arXiv propõe trocar essa projeção densa por uma busca aproximada em índice vetorial.
A ideia central
Os autores reformulam a projeção de saída seguida da seleção dos top-k tokens como um problema de busca de máximo produto interno (Maximum Inner Product Search, MIPS) sobre os embeddings dos tokens. No lugar de multiplicar pela matriz densa do vocabulário inteiro, o modelo usa um índice baseado em HNSW — uma estrutura de grafo aproximado que recupera apenas um pequeno conjunto de tokens candidatos de alta pontuação.
Os logits recuperados são então “espalhados” de volta em um tensor esparso do vocabulário completo, permitindo integrar a técnica a pipelines de decodificação já existentes sem reescrever o resto do modelo.
Resultados medidos
Em inferência de CPU com Gemma 3, Llama 3.2 e Qwen 3, a abordagem acelerou de forma substancial a projeção de saída. No melhor caso, o throughput de decodificação ponta a ponta em lote único (batch-size um) cresceu até 82% para o Gemma 3 270M. A qualidade de geração foi preservada na avaliação AlpacaEval.
Por que isso importa
- A decodificação em lote único é o cenário típico de uso local e interativo — exatamente onde a latência mais incomoda.
- Modelos pequenos com vocabulários enormes (caso dos multilíngues) são os que mais se beneficiam.
- A técnica não exige hardware novo: roda em CPU, o que a torna acessível para notebooks e servidores sem GPU dedicada.
A pesquisa indica que a recuperação aproximada é uma alternativa prática às projeções densas de saída para inferência sensível à latência — um caminho promissor para quem quer rodar LLMs leves com mais fluidez no Brasil, onde o custo de GPU em nuvem pesa no orçamento.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



