Inteligência artificial, sem ruído.
Open Source2 min

Liquid AI abre o código do Pipette, benchmark que mede IA no dispositivo como sistema completo

Plataforma Apache 2.0 avalia modelo, quantização, runtime e hardware, revelando diferenças de até 78% versus 33% no throughput.

Liquid AI abre o código do Pipette, benchmark que mede IA no dispositivo como sistema completo

A Liquid AI abriu o código do Pipette, uma plataforma para avaliar modelos de fundação em dispositivos de borda, construída em parceria com a Artificial Analysis como validadora independente da metodologia. A premissa é direta e útil: o comportamento de um modelo no dispositivo é uma propriedade do sistema implantado, não do modelo isolado.

Medindo configurações, não modelos

A unidade de medida do Pipette é uma configuração completa: modelo + quantização + runtime + dispositivo. O conjunto de dados de lançamento cobre cinco métricas de desempenho em mais de 1.000 configurações, abrangendo 30+ modelos, builds do llama.cpp para macOS, iOS, Windows e Android, e contextos de 256 a 8.192 tokens. Os primeiros resultados verificados vêm de um MacBook Pro M5 Max, um iPhone 17 Pro e um Galaxy S26 Ultra.

Por que a configuração muda a resposta

Os exemplos publicados mostram o quanto uma escolha de implantação altera uma decisão:

  • Escalabilidade de contexto divergente: em Q4_K_M no Galaxy S26 Ultra, o Granite-4.0-H-350M retém 78,4% do throughput de decodificação de 256 para 4.096 tokens, enquanto o Granite-4.0-350M retém apenas 33,8%.
  • Ativação esparsa compra velocidade, não memória: o LFM2.5-8B-A1B decodifica 2,4x mais rápido que o Qwen3.5-4B, mas ainda ocupa 5,29 GiB porque todos os pesos de especialistas ficam em memória.
  • Velocidade e qualidade não andam juntas: no iPhone 17 Pro, o MiniCPM5-1B termina uma carga em 3,47s contra 4,12s do LFM2.5-1.2B — mas o LFM marca 9 pontos a mais no MATH-500.

Infraestrutura aberta e verificável

O Pipette chega sob licença Apache 2.0, com três componentes (pipette-mgmt, pipette-clients, pipette-scores), um dataset público de resultados, dashboard hospedado e apps nativos de benchmark para iOS e Android. A qualidade é acompanhada separadamente em IFBench, GPQA Diamond e MATH-500 — essas pontuações vêm de avaliações em GPUs H100 de referência e são casadas com as execuções no dispositivo.

Para times que levam modelos para celulares, automóveis, robôs ou equipamentos médicos, o Pipette oferece um caminho para validar quantização, planejar capacidade de contexto e auditar as promessas dos fornecedores antes de comprometer um sprint.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.