A Zhipu AI liberou o GLM-5.3 em 14 de agosto de 2026. A atualização GLM-5.3 mantém a mesma base de 743 bilhões de parâmetros do GLM-5.2 e concentra todo o esforço em pós-treinamento intensivo. O resultado é um modelo de IA open-source que lidera em programação, com um salto de 6x no Terminal Bench 3.0 e uma capacidade de segurança cibernética que a própria equipe considerou inesperada. O modelo já está acessível no ZCode e no AutoClaw, e os pesos abertos chegam em duas semanas.
Atualização GLM-5.3: Resumo das Mudanças
A tabela abaixo organiza os principais dados do GLM-5.3 vs GLM-5.2 nos benchmarks públicos e internos.
| Categoria | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Terminal Bench 3.0 | 4.6 | 28.3 |
| DeepSWE v1.1 | 46.2 | 66.9 |
| Agents' Last Exam | 23.8 | 28.5 |
| CyberGym | 77.2% | 84.5% |
| ExploitBench | 24.4% | 54.4% |
| Z.ai Code Bench (High) | Não divulgado | 31.4% |
| Pesos open-source | Sim | Em 2 semanas |
Programação GLM: O Maior Salto da Série
O modelo de programação GLM registrou 50% de melhoria na avaliação interna Z.ai Code Bench em relação ao GLM-5.2. Nos benchmarks públicos, os números são mais expressivos.
No Terminal Bench 3.0, que mede a capacidade de completar tarefas complexas em terminais reais, a pontuação saltou de 4.6 para 28.3. Esse resultado coloca o GLM-5.3 como o modelo de IA open-source mais bem colocado em programação, superando o Kimi K3 da Moonshot AI. No DeepSWE v1.1, focado em engenharia de software de longa duração e modificação contínua de código, a pontuação passou de 46.2 para 66.9, a menos de 3 pontos do Claude Fable 5 da Anthropic.
A eficiência de tokens é onde o GLM-5.3 vs GLM-5.2 mostra a diferença mais prática. No modo High da Z.ai Code Bench, o GLM-5.3 atingiu 31.4% de acurácia consumindo cerca de 50 mil tokens por tarefa. O Claude Opus 4.8 marcou 29.5% com aproximadamente 120 mil tokens. Menos da metade do processamento. Resultado melhor.
No modo máximo, o GLM-5.3 alcança 34.5% com 75 mil tokens. O Claude Fable 5 ainda lidera com 39.5%. A diferença existe. Mas está encolhendo.
O que isso significa na prática para quem usa agentes de programação? A eficiência de tokens afeta diretamente o custo e o tempo de cada tarefa. O GLM-5.3 consome menos recursos para entregar resultados comparáveis. Isso muda a conta no fim do mês.
Segurança Cibernética GLM: A Capacidade Inesperada
A segurança cibernética GLM não estava no centro do planejamento. Ela surgiu como efeito colateral do pós-treinamento intensivo em programação. Análise de código é análise de código. Seja para escrever ou para encontrar falhas.
No CyberGym, que avalia auditoria de código-fonte em white-box, o GLM-5.3 marcou 84.5%, superando o Mythos 5 da Anthropic (83.8%) e o GPT-5.6 Sol (83.6%). No ExploitBench, que exige compreensão mais profunda de vulnerabilidades reais, o GLM-5.3 dobrou o GLM-5.2: 54.4% contra 24.4%. Ainda fica atrás do Mythos 5 (78.0%). O progresso, porém, é real. E grande.
Os números ganham peso quando se olha para os resultados práticos. A Zhipu AI, em parceria com a Universidade de Tsinghua, a Universidade de Nankai e várias equipes de segurança, encontrou 2.436 vulnerabilidades em 269 projetos. Dessas, 1.097 foram classificadas como média ou alta gravidade. A mais antiga remonta a cerca de 45 anos. Algo impressionante.
Entre os achados mais impactantes: uma vulnerabilidade em um aplicativo de mensagens com centenas de milhões de usuários ativos diários, que poderia ser explorada sem que a vítima clicasse em qualquer link. Um problema de 43 anos no protocolo DNS, capaz de amplificar a carga do servidor em até 80.000 vezes com poucos pedidos. Três vulnerabilidades na Microsoft que, combinadas, formavam uma cadeia de ataque completa, do e-mail à intrusão no servidor. A Microsoft reconheceu a contribuição, agradecendo à equipe "Kunlun Lab e GLM" no relatório oficial de correção.
A Zhipu AI lançou junto com o modelo o programa "Escudo Open Source", que oferece créditos gratuitos para que mantenedores de projetos open-source realizem auditorias de segurança. A lógica é direta. Quando as capacidades de ataque ficam concentradas em poucos modelos fechados, a defesa precisa ser aberta.
Pós-treinamento GLM-5.3: O Método Por Trás dos Números
A atualização GLM-5.3 tem uma particularidade técnica. A Zhipu AI não mudou um único parâmetro da base. Toda a melhoria veio do que a equipe chama de escalonamento de pós-treinamento.
Três dimensões foram escaladas: o tamanho dos ambientes de tarefa (dezenas de vezes maior), a variedade de tipos de ambiente (de programação a segurança, de engenharia de software a tarefas profissionais), e o tempo total de treinamento. A equipe usou três frameworks próprios: IndexShare para contexto longo, SAO para reforço de tarefas de longa duração, e uma nova versão do Slime para treinamento assíncrono em larga escala.
A implicação é interessante. Se o pós-treinamento sozinho gera saltos desse tamanho, o limite do modelo base pode estar mais alto do que se imaginava. A própria Zhipu AI admite que provavelmente ainda está longe de explorar o teto de inteligência dessa base. Sem trocar a arquitetura. Pode haver mais GLM-5.x pela frente.
Disponibilidade e Preço do GLM-5.3
O GLM-5.3 já está disponível no ZCode (ferramenta de programação oficial da Zhipu AI) e no AutoClaw, para todos os assinantes do GLM Coding Plan. Plataformas parceiras como TraeWork, WorkBuddy, Qoder e OpenCode já têm acesso antecipado. A API está chegando em breve.
Os pesos completos do modelo serão abertos em duas semanas após o lançamento, após a conclusão da avaliação de segurança e do endurecimento do modelo. A Zhipu AI adia a abertura para limitar o potencial de ataque do modelo enquanto preserva seu valor defensivo. Dado o volume de vulnerabilidades encontradas, a precaução faz sentido.
O preço da API ainda não foi divulgado. O GLM Coding Plan redefine os limites de uso para todos os usuários existentes em 14 de agosto.
Limitações do GLM-5.3
O GLM-5.3 não é perfeito. Três pontos merecem atenção.
Primeiro, os dados de benchmark são auto-relatados pela Zhipu AI. Ainda não houve reprodução independente por terceiros. Os números do Z.ai Code Bench, em particular, vêm de uma avaliação interna, o que limita a comparabilidade.
Segundo, em tarefas de segurança ofensiva, o GLM-5.3 ainda fica significativamente atrás do Mythos 5 e do GPT-5.6 Sol. O CyberGym mostra força em identificar e verificar falhas. O ExploitBench e o ExploitGym mostram que a capacidade de explorar essas falhas em profundidade ainda é limitada. A vantagem do GLM-5.3 está na defesa, não no ataque.
Terceiro, o modelo é puramente textual. Não tem capacidade de visão. Para tarefas que envolvem análise de imagens, capturas de tela ou design, o GLM-5.3 não consegue ajudar. A Zhipu AI tem modelos separados para isso, como o GLM-5V-Turbo, mas o GLM-5.3 é texto apenas.
Conclusão
A atualização GLM-5.3 marca um momento significativo para a comunidade open-source. Para desenvolvedores que usam agentes de programação, vale testar o modelo através do ZCode ou esperar a abertura dos pesos para integrar no próprio fluxo. Para equipes de segurança, o programa Escudo Open Source oferece um ponto de partida prático. Se o pós-treinamento entregou esse salto sem trocar a base, o próximo GLM pode estar mais perto do que se imagina.

