O release note do GLM-5.3, lançado pela chinesa Zhipu (também conhecida como Z.ai) em 14 de agosto, contém uma frase que escapou à maior parte da cobertura. Ao descrever seus próprios resultados em cibersegurança, a empresa de Pequim escreve que a capacidade “cresce mais rápido exatamente onde estamos mais atrás”. É a chave para ler o número que dominou as manchetes.
O dado que viajou o mundo: o GLM-5.3 teria ficado inesperadamente bom em encontrar vulnerabilidades de software, marcando 84,5% no benchmark CyberGym — contra 83,8% do Mythos 5 (Anthropic) e 83,6% do GPT-5.6 Sol (OpenAI). As manchetes concluíram que um modelo chinês agora supera os americanos na caça a bugs.
O motivo do impacto: a descoberta de vulnerabilidades deixou de ser teoria. Um modelo que lê uma base de código e localiza falhas exploráveis serve tanto a quem audita o próprio software quanto a quem faz o mesmo no sistema dos outros. A Anthropic mantém seu trabalho equivalente sob acesso restrito; a Zhipu pretende publicar os pesos do GLM-5.3 para download.
Três benchmarks, três retratos diferentes
O número do CyberGym é real e está no paper. Mas é o mais estreito dos três resultados de cibersegurança publicados — e a Zhipu é transparente ao mostrar que os outros dois contam uma história inversa.
| Benchmark | O que mede | GLM-5.3 | Mythos 5 (Anthropic) | GPT-5.6 Sol (OpenAI) |
|---|---|---|---|---|
| CyberGym | Encontrar e confirmar vulnerabilidade no código-fonte | 84,5% | 83,8% | 83,6% |
| ExploitBench | Raciocinar sobre a exploração real da falha | 54,4% | 78,0% | 76,5% |
| ExploitGym | Completar tarefas de exploração em tempo fixo | 105 (2h) / 130 (6h) | 181 / 247 | — |
No ExploitBench, que exige raciocinar sobre como uma falha seria explorada, o GLM-5.3 marca 54,4% — mais que o dobro do predecessor (24,4%), mas atrás dos 78,0% do Mythos 5 e 76,5% do GPT-5.6 Sol. No ExploitGym, que conta quantas tarefas de exploração o modelo conclui num tempo determinado, o GLM-5.3 faz 105 em duas horas e 130 em seis; o Mythos 5 faz 181 e 247. Encontrar uma falha e construir um exploit funcional são trabalhos diferentes — e a leitura da própria Zhipu é que, quanto mais adiante na cadeia o teste avança, mais atrás seu modelo fica.
Comparações que confundem
Parte da confusão vem do fato de a Zhipu comparar três modelos diferentes da Anthropic em três lugares distintos: a tabela principal usa o Opus 4.8, os gráficos de desempenho usam o Fable 5 e a seção de cibersegurança usa o Mythos 5. Quem lê rápido sai com uma comparação única que, na prática, não existe.
Dois detalhes metodológicos merecem atenção antes de tratar o resultado do CyberGym como resolvido. O score é uma execução única (pass@1 em 1.507 tarefas), sem números de variância — e uma diferença de 0,7 ponto entre duas execuções isoladas não é algo em que se deva apoiar. Além disso, os orçamentos de tempo do ExploitGym foram normalizados com taxas de throughput da Artificial Analysis, com fatores de reescala listados para GLM-5.3, Kimi K3 e Qwen3.8 Max — mas não para o Mythos 5.
O número que falta
Fora dos benchmarks, a Zhipu afirma ter trabalhado com equipes de segurança chinesas para rodar seus modelos contra bases de código reais, identificando 2.436 vulnerabilidades em 269 projetos open-source (107 críticas, 990 altas, 1.286 médias e 53 baixas). A falha mais antiga data de 1981, e a idade média das vulnerabilidades encontradas era de 26,6 anos.
Uma discrepância, porém, pede cuidado: o painel de resumo rotula 1.097 achados como “críticos e altos”, enquanto o corpo do texto descreve os mesmos 1.097 como “médios a altos”. O número chega depois de revisão por especialistas, triagem e deduplicação — ou seja, não reflete a saída bruta do modelo. Das 2.436 descobertas, 53 foram divulgadas publicamente e 2.383 permanecem sob embargo. O release não informa quantas eram desconhecidas nem quantas foram reproduzidas de forma independente — justamente os dois números que transformariam uma alegação de volume em uma alegação de capacidade.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



