A Z.ai lançou o GLM-5.3-Flash, o primeiro modelo nativamente multimodal da série GLM-5 e o mais barato modelo de código capaz que o laboratório chinês já entregou. É um modelo do tipo mistura de especialistas (MoE) com 320 bilhões de parâmetros totais e 18 bilhões ativos por token, janela de contexto de 1.048.576 tokens e entrada de imagem e vídeo — liberado sob licença MIT com pesos no Hugging Face.
O modelo passou a primeira semana rodando anonimamente como “Ox Alpha” no OpenCode e no OpenRouter, servido inteiramente em chips de IA produzidos na China. Segundo a Z.ai, ele supera o GLM-5.2 em benchmarks e cargas de trabalho reais por cerca de um décimo do preço, chegando a meio ponto do Claude Opus 4.8 no benchmark interno de código.
O que muda na arquitetura
O GLM-5.3-Flash parte de um modelo-base recém-treinado em um corpus multimodal de 30 trilhões de tokens. Três mudanças merecem destaque:
- Atenção híbrida: pela primeira vez na série GLM, a Z.ai combina atenção linear e esparsa. O modelo de linguagem de 45 camadas intercala camadas de atenção linear KDA com camadas MLA esparsas NoPE, roteia cada token por 8 de 288 especialistas e envia pesos nativos FP8 mais uma camada de rascunho MTP.
- IndexPool: em contexto de um milhão de tokens, a própria recuperação vira o gargalo. O IndexPool comprime grupos de vetores de chave do indexador via pooling ponderado, reduzindo cerca de 3× a computação de atenção e deixando o cache KV 4,4× menor em relação ao GLM-5.3.
- mHC: o modelo adota Hyper-Connections com restrição de variedade para melhorar a eficiência de escalonamento, reduzindo pela metade os parâmetros ativados e a contagem de camadas em comparação ao GLM-4.5.
Benchmarks
A maioria dos números é reportada pela própria Z.ai, e as configurações variam por teste — vale tratar comparações entre modelos como dependentes de cada ambiente. Ainda assim, os resultados impressionam:
| Benchmark | GLM-5.3-Flash | Referência |
|---|---|---|
| Terminal-Bench 2.1 | 84,3 | Opus 4.8: 85,0 · GPT-5.6 Terra: 87,4 |
| DeepSWE v1.1 | 63,4 | GLM-5.2: 46,2 |
| AutomationBench | 48,8 | GLM-5.2: 26,2 |
| HLE | 55,3 | — |
| Z.ai Code Bench v1.0 (máx) | 29,0 | Opus 4.8: 29,5 |
De forma independente, a Artificial Analysis atribui ao modelo 57 no Intelligence Index, com 48,7 tokens por segundo de saída e 1,52s de tempo até o primeiro token na API da Z.ai — forte inteligência por dólar, mas com geração lenta e verbosa. A visão é o flanco mais fraco: fica atrás do Gemini 3.7 Flash no BabyVision e no MVBench.
Preço e acesso
O preço padrão da API é de US$ 0,15 por milhão de tokens de entrada, US$ 0,03 por milhão de tokens em cache e US$ 0,50 por milhão de tokens de saída. O modelo está disponível para todos os planos do GLM Coding — Lite (US$ 18/mês), Pro (US$ 80) e Max (US$ 168) — com 3× a cota útil do GLM-5.3. O self-hosting exige cerca de 306 GiB de pesos FP8 em GPUs Hopper ou mais recentes; quem está abaixo disso consome via API.
Por que isso importa
O GLM-5.3-Flash reforça uma tendência clara de 2026: modelos de código com pesos abertos e licença permissiva estão fechando a distância para os modelos fechados de ponta por uma fração do preço. Para desenvolvedores e empresas brasileiras, isso significa acesso a capacidades de codificação de nível quase-Opus por valores drasticamente menores — especialmente relevante em um cenário de câmbio desfavorável, onde cada dólar por token conta.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



