O que é o LFM2.5-VL-3B
A Liquid AI lançou nesta terça-feira (12) o LFM2.5-VL-3B, seu modelo de visão e linguagem mais capaz até agora — e com um diferencial decisivo: ele foi feito para rodar no seu próprio hardware, de celulares a máquinas de uso pessoal. Com apenas 3 bilhões de parâmetros, o modelo entende documentos e telas de aplicativos, localiza objetos em imagens e consegue chamar funções (ferramentas), respondendo de forma direta em vez de “pensar em voz alta”, o que mantém as respostas rápidas em aplicações em tempo real e on-device.
As quatro grandes melhorias
O novo modelo estende as capacidades de visão das versões anteriores em quatro frentes principais:
- Compreensão de telas e interfaces: forte entendimento de telas digitais em diferentes dispositivos, útil para automação de UI e acessibilidade.
- Grounding: detecção de objetos e localização melhoradas a partir de consultas em linguagem natural.
- Entrada de múltiplas imagens: raciocínio aprimorado ao comparar e relacionar várias imagens ao mesmo tempo.
- Chamada de funções: capacidade significativamente mais forte de invocar ferramentas, tanto em cenários só de texto quanto combinando visão e texto.
Como foi treinado
O LFM2.5-VL-3B combina um codificador de visão SigLIP2 400M NaFlex com a mesma espinha dorsal pré-treinada do modelo de texto LFM2.5-2.6B. Ele foi pré-treinado em cerca de 34 trilhões de tokens, com quatro vezes mais dados visuais do que a geração anterior, vindos de conjuntos selecionados e sintéticos de legendas de imagens, OCR, grounding e instrução. Para suportar alfabetos não latinos, o vocabulário foi dobrado para 128 mil tokens, estendendo o tokenizador no lugar — sem retreinar do zero.
O pós-treinamento acontece em duas etapas: primeiro o ajuste fino supervisionado (SFT) com destilação de conhecimento de um modelo professor maior e treinamento Antidoom; depois, aprendizado por reforço com múltiplas recompensas (RL).
Desempenho e velocidade
Nos benchmarks, o modelo lidera sua classe de tamanho em tarefas de imagem do mundo real e fica empatado com o Gemma-4-E2B e o Qwen3.5-2B em uso de ferramentas. Em velocidade, os números impressionam: 228 tokens por segundo em um M5 Max, 116 tokens/s em um Ryzen AI Max+ 395 e até 20 tokens/s em um Galaxy S26 Ultra, rodando totalmente no aparelho. Em GPU, chega a cerca de 11 mil tokens por segundo em alta concorrência — aproximadamente o dobro dos modelos de 4B e à frente até dos de 2B, o que equivale a quase 1 bilhão de tokens por dia em uma única H100.
Como começar a usar
O modelo está disponível no Hugging Face e tem suporte de primeira linha em llama.cpp, MLX, vLLM, SGLang e ONNX. Basta instalar o transformers na versão 5.10.1 ou superior e carregar o checkpoint LiquidAI/LFM2.5-VL-3B. A Liquid AI também oferece um demo WebGPU que roda direto no navegador, sem instalação, além de tutoriais de fine-tuning para adaptar o modelo à sua tarefa.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



