Inteligência artificial, sem ruído.
Modelos e LLMs3 min

Bonsai 27B: modelo de 27 bilhões de parâmetros roda em celular com apenas 3,9 GB

PrismML lança Bonsai 27B: modelo de 27 bilhões de parâmetros comprimido para 3,9 GB que roda em laptops e celulares. Retém 89,5% da performance original.

Bonsai 27B: modelo de 27 bilhões de parâmetros roda em celular com apenas 3,9 GB

Um modelo de IA com 27 bilhões de parâmetros rodando no seu celular. Parecia impossível — até agora. A PrismML acaba de lançar o Bonsai 27B, uma versão ultracomprimida do Qwen3.6-27B que cabe em apenas 3,9 GB na variante binária. É menos que o espaço de um filme em 4K.

Dois sabores, um objetivo

O Bonsai 27B chega em duas variantes, ambas sob licença Apache 2.0:

  • Ternary Bonsai 27B: usa pesos {-1, 0, +1} com 1,71 bits por peso. Tamanho ideal: 5,9 GB.
  • 1-bit Bonsai 27B: usa apenas {-1, +1} com 1,125 bits por peso. Tamanho ideal: 3,9 GB.

Ambas são multimodais — o modelo inclui uma torre de visão de 0,46 bilhão de parâmetros, mantida separadamente em 4-bit (HQQ). O contexto chega a 262 mil tokens, viabilizado pelo fato de que ~75% da atenção do Qwen3.6-27B é linear.

Como a mágica funciona

A compressão não é mágica — é matemática engenhosa. Cada peso do modelo é um código, com uma escala FP16 compartilhada para cada grupo de 128 pesos. O peso efetivo é escala × código.

Na variante ternária, isso resulta em uma redução de ~9,4× em relação ao FP16. Na binária, a redução chega a ~14,2×. Para comparação, o Qwen3.6-27B tradicional em “4-bit” (Q4_K_XL) usa 5,2 bits por peso na prática — muito mais que o 1,125 bits do Bonsai.

Essa representação é aplicada de ponta a ponta nos componentes que mais pesam: embeddings, projeções de atenção, projeções MLP e a cabeça de linguagem. Apenas uma fração irrelevante de parâmetros de normalização e escala permanece em precisão maior.

O que se perde (e o que não se perde)

A PrismML avaliou o Bonsai em 15 benchmarks usando EvalScope com vLLM em GPUs H100. Os resultados:

  • Ternary Bonsai 27B retém 94,6% da performance do baseline FP16.
  • 1-bit Bonsai 27B retém 89,5%.

Para efeito de comparação, compressões sub-4-bit convencionais desabam em tarefas complexas. O IQ2_XXS cai para 57,5 no AIME26 (benchmark de matemática) e 56,4 no LiveCodeBench. Ainda assim, marca 88,93 no MMLU-Redux — mostrando que benchmarks de múltipla escolha mascaram o colapso. O Bonsai não sofre desse problema.

Por que isso importa

Três razões tornam o Bonsai 27B um marco:

1. IA de ponta no bolso: um iPhone de 12 GB expõe cerca de 6 GB para um app. O Bonsai 1-bit (3,9 GB) cabe nesse limite. Pela primeira vez, um modelo de 27B pode rodar inteiramente em um smartphone.

2. Licença aberta: Apache 2.0 significa que qualquer empresa — inclusive no Brasil — pode usar, modificar e distribuir sem restrições comerciais.

3. A quebra do paradigma: diferente do BitNet (que exige treinamento do zero para evitar colapso), o Bonsai aplica compressão pós-treinamento sem perder coerência. Isso abre caminho para comprimir qualquer modelo existente.

O Bonsai 27B não é um novo modelo treinado — é uma prova de conceito de que a fronteira entre “modelos de datacenter” e “modelos de dispositivo” está desmoronando.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.