Inteligência artificial, sem ruído.
Modelos e LLMs2 min

Z.ai lança GLM-5.3-Flash: o modelo aberto “Ox Alpha” com 320B de parâmetros e 1M de contexto

Modelo multimodal nativo roda em chips chineses e chega com licença MIT, custo de US$ 0,09 por tarefa e desempenho competitivo em código.

Z.ai lança GLM-5.3-Flash: o modelo aberto “Ox Alpha” com 320B de parâmetros e 1M de contexto

A Z.ai, divisão de IA da chinesa Zhipu, lançou oficialmente o GLM-5.3-Flash — revelando que o modelo até então conhecido pelo codinome “Ox Alpha” é a sua identidade pública. Trata-se de um modelo multimodal nativo com 320 bilhões de parâmetros totais e 18 bilhões ativos, janela de contexto de 1 milhão de tokens e licença MIT.

Um modelo aberto rodando em chips chineses

O detalhe que mais chamou atenção da comunidade não foi só o tamanho, mas a infraestrutura: a Z.ai afirma que o GLM-5.3-Flash roda inteiramente em chips de IA chineses. A SemiAnalysis destacou que a empresa afirma servir 100 trilhões de tokens por dia nessa infraestrutura — um marco que, se confirmado, sugere uma frota doméstica de aceleradores na casa das centenas de milhares de unidades.

Desempenho e preço

Nos números da Artificial Analysis, o GLM-5.3-Flash alcança 57 pontos no Intelligence Index, empatando com o GPT-5.6 Terra e o Muse Spark 1.2, mas com custo por tarefa de US$ 0,09 — cerca de 7,5 vezes menor que o GLM-5.3 e 5,7 vezes mais barato que o GPT-5.6 Terra. O preço de API é de US$ 0,15 por milhão de tokens de entrada e US$ 0,50 por milhão de saída.

Em tarefas de agente, o modelo registra 84,3% no Terminal-Bench v2.1 e Elo 1770 no GDPval-AA v2, atrás apenas do Claude Opus 5 em configurações máximas. A Z.ai também afirma que o modelo “claramente supera o GLM-5.2 em todos os níveis de esforço e se equipara ao Claude Opus 4.8” em programação — uma métrica própria que deve ser lida com cautela.

Adoção imediata

A resposta foi rápida: o Cline informou que o GLM-5.3-Flash virou o modelo de crescimento mais veloz da sua história, respondendo por 11% de todo o tráfego em menos de uma semana. CoreWeave, Baseten e AutoClaw anunciaram suporte no primeiro dia. Do lado das ressalvas, a Artificial Analysis chegou a publicar uma janela de contexto incorreta de 400 mil tokens antes de corrigir para 1 milhão, e um analista independente questionou o desempenho do modelo em tarefas de visão.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.