O anúncio
A Liquid AI liberou nesta terça-feira (19) novos checkpoints quantizados para a família de modelos LFM2.5, batizados de QAD Q4_0 GGUFs. Eles cobrem quatro tamanhos — LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct e LFM2.5-2.6B — e prometem resolver um dos maiores incômodos de quem roda modelos localmente: a perda de qualidade que normalmente acompanha a quantização para 4 bits.
O que muda na prática
A técnica usada é a Destilação Consciente de Quantização (Quantization-Aware Distillation, ou QAD): um modelo professor de alta precisão “destila” seu conhecimento para um modelo estudante já quantizado, em vez de simplesmente comprimir os pesos depois do treino (a abordagem tradicional, chamada PTQ). O resultado, segundo a empresa:
- 97% da precisão dos checkpoints BF16 é recuperada após a quantização;
- Mesmo consumo de memória e velocidade de um Q4_0 nativo — sem sobrecarga extra;
- Checkpoints prontos para rodar com llama.cpp ou qualquer runtime compatível com GGUF.
Benchmarks
A Liquid AI comparou os checkpoints QAD contra os GGUFs gerados por PTQ em uma bateria que cobre raciocínio, seguimento de instruções, uso de ferramentas e capacidades agênticas: GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF e BFCLv4, além de GSM8K e AIME25 para os modelos menores e maiores, respectivamente. Os números de referência foram calculados sobre a média de cinco execuções.
Os checkpoints QAD retiveram 97,1%, 96,5%, 97,4% e 96,6% do desempenho BF16 de cada modelo — uma melhora substancial sobre o Q4_0 comum. No hardware de borda real, os modelos de 230M e 350M igualam a qualidade de um Q5_K_M com 4% a 33% mais velocidade de decodificação, enquanto os de 1.2B e 2.6B igualam Q4_K_M com 3% a 14% mais vazão. Os resultados também se equiparam aos checkpoints UD-Q4_K_XL da Unsloth, uma referência externa forte.
Para rodar no seu hardware
Os testes foram feitos em quatro alvos de borda: MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra e Raspberry Pi 5 — cobrindo de notebooks a celulares e placas de baixíssimo custo. O uso é direto com llama.cpp:
llama-cli -hf LiquidAI/LFM2.5-350M \
--hf-file LFM2.5-350M-QAD-Q4_0.gguf \
-p "What is C. elegans?"Para quem desenvolve em cenários com memória limitada — apps móveis, dispositivos IoT, assistentes locais — a promessa é atraente: chegar perto da qualidade original sem pagar o preço de modelos maiores ou de quantizações que degradam demais o desempenho.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



