Um novo método de quantização de modelos de linguagem, chamado FAMPWQ, conseguiu preservar a qualidade dos benchmarks usando média de 3 bits por peso — bem abaixo dos 16 ou 8 bits típicos —, segundo um preprint recente. A técnica atribui precisões numéricas diferentes a camadas diferentes do modelo, guiada pela chamada informação de Fisher.
Como funciona a quantização guiada por Fisher
O FAMPWQ é um framework de quantização pós-treinamento de pesos (weight-only) para implantar LLMs dentro de um orçamento fixo de memória. Ele funciona em duas etapas: primeiro, estima o quanto cada camada é afetada pelo erro de arredondamento exato que a quantização produz; depois, uma busca por aprendizado por reforço (PPO) usa essas estimativas para escolher a largura de bits camada por camada.
Na prática, isso significa que camadas mais sensíveis à perda de precisão recebem mais bits, enquanto camadas mais robustas são comprimidas mais agressivamente — uma distribuição de esforço mais inteligente do que aplicar a mesma precisão a tudo.
Os resultados a 3 e 4 bits
A avaliação cobriu sete LLMs, cinco benchmarks e sete métodos de comparação, todos com as mesmas configurações e 128 sequências de calibração do C4. A perplexidade (PPL) — quanto menor, melhor — foi a métrica principal. No LLaMA-7B a 4 bits médios, o FAMPWQ marcou PPL de 5,81 no WikiText-2 e 10,34 no PTB, superando o AWQ por margens pequenas. A 3 bits, a distância para os concorrentes aumentou, e o método venceu julgamentos pareados de um avaliador automático.
A ressalva: o AWQ foi mais rápido no hardware testado. O FAMPWQ troca velocidade por qualidade — vale a pena quando a prioridade é caber o modelo em menos memória sem degradar as respostas.
Por que isso importa agora
Executar LLMs localmente — em notebooks, servidores próprios ou até no celular — é uma demanda crescente para empresas brasileiras que não querem (ou não podem) enviar dados para APIs na nuvem. Cada redução de bits se traduz diretamente em menos RAM ou VRAM necessária, o que barateia a infraestrutura e permite rodar modelos maiores no mesmo hardware. Métodos como o FAMPWQ atacam exatamente esse gargalo.
Limitações a considerar
Os ganhos de qualidade em relação ao AWQ são pequenos em 4 bits e crescem em 3 bits, mas o custo de velocidade não é desprezível. O preprint ainda não foi revisado por pares, e os resultados dependem das sete famílias de modelos e dos cinco benchmarks testados.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



