Inteligência artificial, sem ruído.
Modelos e LLMs3 min

Alibaba lança Qwen3.8-Max: modelo MoE de 2,4 trilhões de parâmetros com peso aberto na próxima semana

O novo modelo da Qwen aceita texto, imagem e vídeo, tem janela de 1 milhão de tokens, custa US$ 2 por milhão de tokens de entrada e supera o Claude Opus 4.8 em benchmarks de codificação agentiva.

Alibaba lança Qwen3.8-Max: modelo MoE de 2,4 trilhões de parâmetros com peso aberto na próxima semana

O que é o Qwen3.8-Max

A equipe Qwen da Alibaba disponibilizou o Qwen3.8-Max, um modelo Mixture-of-Experts (MoE) de 2,4 trilhões de parâmetros — o mais capaz da família Qwen até agora. O modelo aceita texto, imagem e vídeo como entrada e retorna texto, com uma janela de contexto de 1 milhão de tokens.

Os pesos abertos serão liberados na próxima semana, junto com um checkpoint menor, o Qwen3.8-27B, voltado para hardware on-premise convencional.

O que está disponível tecnicamente

A API hospedada já está no ar e é compatível com os formatos da OpenAI e DashScope — a migração exige apenas trocar a URL base e o ID do modelo. Os limites são generosos: até 991 mil tokens de entrada (983 mil com modo de raciocínio ativado), 131 mil tokens de saída e um orçamento de raciocínio de 262 mil tokens. As taxas são de 2 milhões de tokens por minuto e 15 mil requisições por minuto.

A precificação é competitiva: US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída. O cache implícito custa US$ 0,25 por milhão de tokens, e o cache explícito (criação a US$ 2,50, leitura a US$ 0,17) reduz o custo de entrada em oito vezes — tornando a estabilidade do prefixo mais importante que o comprimento do prompt.

Entre as capacidades suportadas estão function calling, saídas estruturadas, processamento em lote, prefix completion e fine-tuning. A API Responses inclui cinco ferramentas nativas: code_interpreter, web_search, web_extractor, t2i_search e i2i_search.

Performance e benchmarks

O Qwen3.8-Max obteve 86,6 no Terminal-Bench 2.1, à frente do Claude Opus 4.8 (84,6) e atrás apenas do GPT-5.6 Sol (88,8). No SWE-bench Pro marcou 67,7 contra 80,0 do Claude Fable 5, enquanto no FrontierSWE ficou em 73,5 contra 88,8. No PaperBench (93,0) e IFBench (82,8), lidera a tabela.

Os ganhos mais expressivos estão na área multimodal e agentiva, não no raciocínio puro: GPQA Diamond em 92,6 (marginalmente acima dos 92,4 do Qwen3.7-Max), OSWorld-Verified em 86,1 e OmniDocBench 1.5 em 92,1. Contra seu predecessor, o salto é notável: DeepSWE 1.1 saltou de 21,6 para 56,6 e o FrontierSWE de 40,7 para 73,5.

Duas ressalvas importantes: a tabela multimodal compara com o Qwen3.7-Plus, não com o Qwen3.7-Max, o que infla o delta geracional. E a curva de scaling de RL da própria Alibaba atinge pico de 0,725 próximo a 4.000 ambientes de treino, depois cai para 0,689 — sugerindo um platô de rendimento.

Quem pode usar

A API é acessível a empresas de qualquer porte. Para os pesos abertos do modelo de 2,4T, o cenário é diferente: é um artefato de datacenter multi-nó, e a Alibaba não divulgou a contagem de parâmetros ativados — impossibilitando modelar o custo de inferência. O Qwen3.8-27B é o checkpoint realista para GPUs on-premise.

As aplicações mapeadas cobrem quatro setores: engenharia de software, revisão de documentos jurídicos e financeiros, operações de mídia e e-commerce, e design. Os casos de uso incluem agentes de código em escala de repositório, indexação de vídeos longos, extração estruturada de dados e assistentes de pesquisa multi-etapa.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.