Inteligência artificial, sem ruído.
Modelos e LLMs2 min

Liquid AI lança LFM2.5-2.6B: modelo agentivo de 2.6B que roda em celular com 128K de contexto

Modelo de pesos abertos supera alternativas três vezes maiores em benchmarks de uso de ferramentas e executa a 220 tokens/s em um Mac M5 Max com menos de 2.5 GB de memória.

Liquid AI lança LFM2.5-2.6B: modelo agentivo de 2.6B que roda em celular com 128K de contexto

Um modelo agentivo que cabe no bolso

A Liquid AI acaba de lançar o LFM2.5-2.6B, um modelo de linguagem agentivo de 2,69 bilhões de parâmetros que roda inteiramente no dispositivo — sem depender de APIs na nuvem. O modelo planeja, chama ferramentas e completa tarefas de múltiplas etapas em celulares, laptops, PCs e robôs, com uma janela de contexto de 131.072 tokens e um vocabulário de 128.000 tokens.

O dado mais impressionante é a eficiência: o LFM2.5-2.6B decodifica a 220 tokens por segundo em um Mac M5 Max ocupando menos de 2,5 GB de memória. No celular, chega a 30 tokens/s. Para empresas, uma única GPU NVIDIA H100 SXM5 serve aproximadamente 1,3 bilhão de tokens por dia.

Arquitetura híbrida: convoluções + atenção

O modelo combina 22 blocos de convoluções curtas com 8 blocos de atenção por consultas agrupadas (GQA), em 30 camadas. O pré-treinamento consumiu aproximadamente 34 trilhões de tokens em 16 idiomas. Os pesos estão disponíveis em formatos nativo, GGUF, MLX e ONNX, com suporte imediato a llama.cpp, vLLM, SGLang e LM Studio.

O pós-treinamento foi realizado em quatro estágios: duas rodadas de fine-tuning supervisionado, especialização de professores por domínio com aprendizado por reforço, destilação on-policy e, finalmente, aprendizado por reforço agentivo com GRPO dentro de harnesses reais como Hermes Agent e OpenClaw.

Benchmarks: supera modelos 4x maiores

Nos testes comparativos contra o Gemma-4-E4B-it (8B) e Qwen3.5-9B (9.7B), o LFM2.5-2.6B liderou em quase todos os benchmarks de seguir instruções e uso de ferramentas:

BenchmarkLFM2.5-2.6BGemma-4-E4B-itQwen3.5-9B
ToolSandbox77,8365,0076,44
Multi-IF80,0777,3562,55
IFStruct85,4976,6578,50
IFBench59,1739,2456,47
BFCLv456,8846,3960,13

O modelo perde apenas em tarefas de codificação (LiveCodeBenchv6: 59,41 vs 69,86 do Qwen3.5-9B), o que é esperado para um modelo deste porte. A própria Liquid AI recomenda não usar o modelo para codificação agentiva ou tarefas intensivas em conhecimento.

Por que isso importa para o Brasil

Modelos on-device com essa capacidade têm potencial enorme em setores regulados como saúde, serviços financeiros e defesa — exatamente os alvos da Liquid AI. Fintechs brasileiras poderiam rodar agentes de extração e classificação de documentos localmente, sem enviar dados de clientes para APIs de terceiros. Hospitais poderiam fazer triagem de prontuários em dispositivos air-gapped. O custo marginal de cada execução é praticamente zero.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.