Inteligência artificial, sem ruído.
Modelos e LLMs3 min

Liquid AI lança LFM2.5-VL-3B: modelo de visão que roda no celular e entende telas

Modelo de 3B parâmetros da Liquid AI entende documentos, telas e chama funções, rodando até no celular com 228 tokens/s.

Liquid AI lança LFM2.5-VL-3B: modelo de visão que roda no celular e entende telas

O que é o LFM2.5-VL-3B

A Liquid AI lançou nesta terça-feira (12) o LFM2.5-VL-3B, seu modelo de visão e linguagem mais capaz até agora — e com um diferencial decisivo: ele foi feito para rodar no seu próprio hardware, de celulares a máquinas de uso pessoal. Com apenas 3 bilhões de parâmetros, o modelo entende documentos e telas de aplicativos, localiza objetos em imagens e consegue chamar funções (ferramentas), respondendo de forma direta em vez de “pensar em voz alta”, o que mantém as respostas rápidas em aplicações em tempo real e on-device.

As quatro grandes melhorias

O novo modelo estende as capacidades de visão das versões anteriores em quatro frentes principais:

  • Compreensão de telas e interfaces: forte entendimento de telas digitais em diferentes dispositivos, útil para automação de UI e acessibilidade.
  • Grounding: detecção de objetos e localização melhoradas a partir de consultas em linguagem natural.
  • Entrada de múltiplas imagens: raciocínio aprimorado ao comparar e relacionar várias imagens ao mesmo tempo.
  • Chamada de funções: capacidade significativamente mais forte de invocar ferramentas, tanto em cenários só de texto quanto combinando visão e texto.

Como foi treinado

O LFM2.5-VL-3B combina um codificador de visão SigLIP2 400M NaFlex com a mesma espinha dorsal pré-treinada do modelo de texto LFM2.5-2.6B. Ele foi pré-treinado em cerca de 34 trilhões de tokens, com quatro vezes mais dados visuais do que a geração anterior, vindos de conjuntos selecionados e sintéticos de legendas de imagens, OCR, grounding e instrução. Para suportar alfabetos não latinos, o vocabulário foi dobrado para 128 mil tokens, estendendo o tokenizador no lugar — sem retreinar do zero.

O pós-treinamento acontece em duas etapas: primeiro o ajuste fino supervisionado (SFT) com destilação de conhecimento de um modelo professor maior e treinamento Antidoom; depois, aprendizado por reforço com múltiplas recompensas (RL).

Desempenho e velocidade

Nos benchmarks, o modelo lidera sua classe de tamanho em tarefas de imagem do mundo real e fica empatado com o Gemma-4-E2B e o Qwen3.5-2B em uso de ferramentas. Em velocidade, os números impressionam: 228 tokens por segundo em um M5 Max, 116 tokens/s em um Ryzen AI Max+ 395 e até 20 tokens/s em um Galaxy S26 Ultra, rodando totalmente no aparelho. Em GPU, chega a cerca de 11 mil tokens por segundo em alta concorrência — aproximadamente o dobro dos modelos de 4B e à frente até dos de 2B, o que equivale a quase 1 bilhão de tokens por dia em uma única H100.

Como começar a usar

O modelo está disponível no Hugging Face e tem suporte de primeira linha em llama.cpp, MLX, vLLM, SGLang e ONNX. Basta instalar o transformers na versão 5.10.1 ou superior e carregar o checkpoint LiquidAI/LFM2.5-VL-3B. A Liquid AI também oferece um demo WebGPU que roda direto no navegador, sem instalação, além de tutoriais de fine-tuning para adaptar o modelo à sua tarefa.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.