A Liquid AI abriu o código do Pipette, uma plataforma para avaliar modelos de fundação em dispositivos de borda, construída em parceria com a Artificial Analysis como validadora independente da metodologia. A premissa é direta e útil: o comportamento de um modelo no dispositivo é uma propriedade do sistema implantado, não do modelo isolado.
Medindo configurações, não modelos
A unidade de medida do Pipette é uma configuração completa: modelo + quantização + runtime + dispositivo. O conjunto de dados de lançamento cobre cinco métricas de desempenho em mais de 1.000 configurações, abrangendo 30+ modelos, builds do llama.cpp para macOS, iOS, Windows e Android, e contextos de 256 a 8.192 tokens. Os primeiros resultados verificados vêm de um MacBook Pro M5 Max, um iPhone 17 Pro e um Galaxy S26 Ultra.
Por que a configuração muda a resposta
Os exemplos publicados mostram o quanto uma escolha de implantação altera uma decisão:
- Escalabilidade de contexto divergente: em Q4_K_M no Galaxy S26 Ultra, o Granite-4.0-H-350M retém 78,4% do throughput de decodificação de 256 para 4.096 tokens, enquanto o Granite-4.0-350M retém apenas 33,8%.
- Ativação esparsa compra velocidade, não memória: o LFM2.5-8B-A1B decodifica 2,4x mais rápido que o Qwen3.5-4B, mas ainda ocupa 5,29 GiB porque todos os pesos de especialistas ficam em memória.
- Velocidade e qualidade não andam juntas: no iPhone 17 Pro, o MiniCPM5-1B termina uma carga em 3,47s contra 4,12s do LFM2.5-1.2B — mas o LFM marca 9 pontos a mais no MATH-500.
Infraestrutura aberta e verificável
O Pipette chega sob licença Apache 2.0, com três componentes (pipette-mgmt, pipette-clients, pipette-scores), um dataset público de resultados, dashboard hospedado e apps nativos de benchmark para iOS e Android. A qualidade é acompanhada separadamente em IFBench, GPQA Diamond e MATH-500 — essas pontuações vêm de avaliações em GPUs H100 de referência e são casadas com as execuções no dispositivo.
Para times que levam modelos para celulares, automóveis, robôs ou equipamentos médicos, o Pipette oferece um caminho para validar quantização, planejar capacidade de contexto e auditar as promessas dos fornecedores antes de comprometer um sprint.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



