O lançamento
A DigitalOcean passou a oferecer o Qwen3.8-2.4T-A95B, o modelo de pesos abertos da Alibaba, em seu serviço de inferência serverless. Trata-se de um modelo do tipo mixture-of-experts com 2,4 trilhões de parâmetros no total — cerca de 95 bilhões ativos por token — voltado para codificação, uso de ferramentas e trabalho agente de longo horizonte.
O preço é agressivo: US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída, além de US$ 0,20 para entrada em cache. Para comparação, o Claude Fable 5 é listado a US$ 10 de entrada e US$ 50 de saída.
Arquitetura e infraestrutura
O modelo é servido em GPUs NVIDIA HGX B300 com pesos quantizados em NVFP4 (4 bits), em colaboração com a Inferact. A escolha do formato de 4 bits é estratégica: um modelo de 2,4 trilhões de parâmetros em FP8 não caberia em um único nó. A quantização NVFP4 traz os pesos para o alcance de um único nó, eliminando o roteamento de especialistas entre nós e simplificando a topologia de serviço.
O contexto nativo é de 262.144 tokens, com saída máxima de até 131.072 tokens. O modelo é apenas texto — não aceita imagem ou vídeo.
Benchmarks e limitações
Segundo os números publicados pela Alibaba para o Qwen3.8-Max (o modelo de fronteira do qual essa versão aberta deriva), o modelo lidera no PaperBench (93,0) e no IFBench (82,8), e marca 86,6 no Terminal-Bench 2.1 — à frente do Claude Opus 4.8 e do Claude Fable 5 (ambos 84,6).
Por outro lado, fica atrás no SWE-bench Pro (67,7 contra 80,0 do Fable 5) e no raciocínio puro de fronteira medido pelo HLE. A própria DigitalOcean publica um número honesto: um spot-check interno do modelo quantizado marcou 88 no GPQA Diamond, contra 92,6 do flagship — uma diferença que cobre, ao mesmo tempo, a mudança de variante e a quantização.
Desempenho medido
Nas medições da DigitalOcean (12/08/2026), o tempo até o primeiro token ficou em torno de 1,1 segundo para entradas de cerca de 1.000 tokens, com prefill a aproximadamente 16.000 tokens por segundo. A geração por stream é modesta — 8 a 9 tokens por segundo —, mas o throughput agregado escala para cerca de 1.900 tokens por segundo em 256 requisições concorrentes, sem ponto de saturação.
Ou seja: é um modelo feito para escala por concorrência e trabalho em lote, não para chat interativo de latência crítica.
O que isso significa para o mercado
A chegada de um modelo de pesos abertos de 2,4 trilhões de parâmetros a preço de US$ 2/US$ 6 reforça a pressão de preço sobre os modelos proprietários de fronteira — e coloca o open source chinês novamente como alternativa concreta para workloads agênticos de alto volume. Para quem constrói agentes com MCP e chamadas de função nativas, a combinação de contexto de 262K, cache de prompt a US$ 0,20 e preço agressivo é um argumento forte.
O modelo está disponível agora no DigitalOcean Serverless Inference e no Inference Router, com endpoint compatível com a API da OpenAI (o ID do modelo na plataforma é qwen3.8-max). Os pesos estão abertos no Hugging Face.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



