Inteligência artificial, sem ruído.
Modelos e LLMs3 min

Qwen 3.8 27B: modelo aberto de 17 GB que roda em casa, mas que pensa demais

Modelo Apache 2.0 de 27 bilhões de parâmetros roda em hardware de consumo, mas padrão de raciocínio xhigh o faz gastar tempo demais.

Qwen 3.8 27B: modelo aberto de 17 GB que roda em casa, mas que pensa demais

O lançamento de sexta-feira do Qwen 3.8 27B, modelo com 27 bilhões de parâmetros e capacidade de visão da Alibaba, chamou atenção por um detalhe inusitado: ele é excelente, mas vem configurado para “pensar demais”. A avaliação é do desenvolvedor Simon Willison, que testou o modelo em duas máquinas e documentou resultados impressionantes — e um comportamento padrão que beira o cômico.

Um modelo de 17 GB para rodar em casa

Com licença Apache 2.0, o Qwen 3.8 27B é um dos modelos abertos mais capazes da categoria de tamanho intermediário. Na versão quantizada Q4_K_M, ocupa apenas 17 GB em disco e roda em um MacBook Pro M5 Max com 128 GB de RAM e em um NVIDIA DGX Spark via LM Studio.

Os benchmarks divulgados pela própria Qwen mostram avanço sobre o Qwen 3.6 27B e até sobre o Qwen 3.7-Plus, um dos modelos fechados mais fortes da empresa até maio deste ano.

O padrão que “pensa demais”

O modelo chega configurado por padrão com esforço de raciocínio no nível máximo (“xhigh”). Na prática, isso significa que ele gasta milhares de tokens refletindo até sobre tarefas triviais. Willison relata que, ao pedir um simples “desenhe um SVG de um círculo”, o modelo produziu um círculo animado sofisticado — “absolutamente lindo, e totalmente diferente do que eu pedi”.

O caso extremo: gerar um SVG de um pelicano andando de bicicleta levou 21 minutos, usando 22.276 tokens de raciocínio para produzir 3.223 tokens de saída. Com o raciocínio desligado, a mesma tarefa levou pouco mais de dois minutos.

Velocidade: o único calcanhar de Aquiles

Apesar da qualidade, a velocidade é o ponto fraco. Willison registrou entre 15 e 30 tokens por segundo localmente — distante dos 74 tokens/s do GPT-5.6 Sol e dos 184 tokens/s do 5.6 Luna em APIs hospedadas. Uma otimização promissora é a Multi-Token Prediction, recurso nativo do Qwen que adivinha vários tokens à frente: segundo um benchmark comparativo rodado com Codex, o servidor com MTP superou o padrão em cerca de 72%.

Por que isso importa

O Qwen 3.8 27B demonstra algo estrutural: já é possível ter um modelo aberto de uso geral — com contexto longo, chamada de ferramentas, visão e geração de código competente — dentro de um arquivo de 17 GB rodando em hardware de consumo. Como resume Willison, “o fato de um arquivo de 17 GB fazer tudo isso na minha máquina doméstica é um milagre”. O gargalo deixou de ser capacidade e virou performance de memória — e a comunidade já trabalha para resolvê-lo.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.