Três laboratórios chineses agora dominam o topo do ranking de modelos open-weight. O Kimi K3 da Moonshot AI, o DeepSeek V4 Pro e o GLM-5.2 da Zhipu AI são modelos sparse Mixture-of-Experts (MoE) com janelas de contexto de um milhão de tokens, mirando cargas de trabalho de código e agentes. A comparação completa — benchmarks, licenças e custo de serving — revela escolhas estratégicas bem diferentes.
Os três concorrentes
O Kimi K3 é um modelo de 2,8 trilhões de parâmetros com arquitetura Stable LatentMoE, ativando 16 de 896 especialistas por token. Adiciona visão nativa, janela de 1M tokens e raciocínio always-on. É o primeiro modelo aberto na classe de 3T parâmetros, lançado em 16 de julho de 2026.
O DeepSeek V4 Pro tem 1,6 trilhão de parâmetros totais com 49 bilhões ativos, usando 384 especialistas roteados mais um especialista compartilhado. Contexto de 1M tokens com saída máxima de 384K. Pesos disponíveis no Hugging Face desde o lançamento em abril de 2026, sob licença MIT.
O GLM-5.2 é o menor dos três com 744 bilhões de parâmetros totais e aproximadamente 40 bilhões ativos. Liderou o campo open-weight antes do K3 chegar. Disponível com modos de raciocínio High e Max, com acesso via API.
| Especificação | Kimi K3 | DeepSeek V4 Pro | GLM-5.2 |
|---|---|---|---|
| Parâmetros totais | 2,8T | 1,6T | 744B |
| Parâmetros ativos | Não divulgado | 49B | ~40B |
| Janela de contexto | 1M | 1M (384K saída) | 1M (131K saída) |
| Modalidade | Texto + visão + vídeo | Texto | Texto |
| Lançamento | 16 jul 2026 | 24 abr 2026 | 13 jun 2026 |
Benchmarks: quem lidera?
No índice Artificial Analysis Intelligence Index — o comparador neutro que avalia todos na mesma suíte — o Kimi K3 marca aproximadamente 57 pontos, ficando em 3º lugar geral, atrás apenas do Claude Fable 5 e GPT-5.6 Sol. O GLM-5.2 marca 51, e o DeepSeek V4 Pro (modo Max reasoning) marca 44.
Em benchmarks de código com harness pareado pela Moonshot, o K3 lidera com folga:
| Benchmark | Kimi K3 | GLM-5.2 |
|---|---|---|
| DeepSWE | 67,5 | 46,2 |
| Program Bench | 77,8 | 63,7 |
| Terminal Bench 2.1 | 88,3 | 82,7 |
| FrontierSWE | 81,2 | 67,3 |
| SWE Marathon | 42,0 | 13,0 |
| GPQA-Diamond | 93,5 | 91,2 |
O DeepSeek V4 Pro (Max) marca 80,6% no SWE-bench Verified — o melhor resultado open-weight em seu lançamento, empatado com Gemini 3.1 Pro — e 83,5 no MRCR 1M, confirmando capacidade real de contexto longo.
Licenças: quem você pode usar hoje
DeepSeek V4 Pro e GLM-5.2 já têm pesos completos no Hugging Face sob licença MIT, permitindo uso comercial, fine-tuning e self-hosting agora. O Kimi K3 é a exceção: a Moonshot se comprometeu a publicar os pesos até 27 de julho de 2026, sob uma licença Modified MIT que adiciona uma cláusula de atribuição — acionada apenas acima de 100 milhões de usuários ativos mensais. Até lá, o K3 só funciona via API.
Custo de serving: o abismo de preços
| Modelo | Input ($/MTok) | Output ($/MTok) | Input cache |
|---|---|---|---|
| Kimi K3 | 3,00 | 15,00 | 0,30 |
| DeepSeek V4 Pro | 0,435 | 0,87 | ~0,0036 |
| GLM-5.2 | 1,40 | 4,40 | 0,26 |
O DeepSeek V4 Pro é o líder de custo por larga margem. Com US$ 1 você obtém aproximadamente 1,15 milhão de tokens de saída do V4 Pro, contra 227 mil do GLM-5.2 e apenas 67 mil do K3. No custo por tarefa (Artificial Analysis), o DeepSeek sai a US$ 0,04, o GLM-5.2 a US$ 0,32 e o K3 a US$ 0,94.
Em velocidade, o GLM-5.2 lidera com ~168 tokens/segundo, bem à frente do DeepSeek V4 Pro e Kimi K3 (~62 t/s cada). A Moonshot reporta mais de 90% de cache hits em cargas de código, o que reduz o custo efetivo de input do K3 para US$ 0,30 por milhão.
Qual modelo para qual uso?
Menor custo com qualidade sólida de código: DeepSeek V4 Pro. Pesos disponíveis, licença limpa e preço imbatível.
Máxima capacidade medida: Kimi K3 lidera, mas a 5-17x o preço de output e sem pesos até 27 de julho.
Equilíbrio: GLM-5.2 é mais barato que o K3, mais rápido que ambos e self-hostable hoje. Surpreende pela capacidade relativa ao tamanho.
Para self-hosting, o GLM-5.2 (744B) precisa de mais de 1 TB de VRAM em BF16 — aproximadamente 8x H200 em FP8. O K3 é o mais pesado: a Moonshot recomenda 64 ou mais aceleradores.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



