Zhipu AI publicó GLM-5.3 el 14 de agosto de 2026. El modelo mantiene la misma base de 743 mil millones de parámetros que GLM-5.2, pero el post-entrenamiento lo transformó: la puntuación en Terminal Bench 3.0 saltó de 4.6 a 28.3, y la capacidad de detectar vulnerabilidades igualó a Mythos 5 de Anthropic. Zhipu AI lo describe como el modelo de IA open-source más fuerte en programación hasta la fecha, con un rendimiento que se acerca a Claude Fable 5.
La actualización GLM-5.3 no cambia ni un parámetro del modelo base. Todo viene del post-entrenamiento: más entornos de tareas, más tipos de entornos y más tiempo de entrenamiento. Funcionó mejor de lo que la propia empresa esperaba, sobre todo en ciberseguridad GLM.
GLM-5.3: Resumen de cambios clave
La siguiente tabla resume los principales cambios de GLM-5.3 respecto a GLM-5.2, organizados por categoría de mejora.
| Categoría | Cambio principal |
|---|---|
| Programación | Terminal Bench 3.0: 4.6 a 28.3 (líder open-source) |
| Ingeniería de software | DeepSWE v1.1: 46.2 a 66.9 |
| Tareas de agente | Agents' Last Exam: 23.8 a 28.5 |
| Ciberseguridad | CyberGym: 77.2% a 84.5% |
| Vulnerabilidades | 2.436 encontradas, 1.097 de riesgo medio-alto |
| Disponibilidad | ZCode, AutoClaw, GLM Coding Plan |
| Open-source | Pesos disponibles en aproximadamente 2 semanas |
GLM-5.3 vs GLM-5.2: Salto en programación
La diferencia entre GLM-5.3 y GLM-5.2 en programación es grande. No me refiero a un ajuste fino. El modelo de programación GLM pasó de ser competente a liderar el espacio de código abierto en varias pruebas de referencia.
¿Qué significa esto en la práctica? En Terminal Bench 3.0, que mide la capacidad de un modelo para completar tareas complejas en un entorno de terminal real, GLM-5.3 pasó de 4.6 a 28.3. Un salto de más de seis veces. En DeepSWE v1.1, centrado en ingeniería de software de larga duración, el modelo subió de 46.2 a 66.9. Agents' Last Exam, que evalúa colaboración entre herramientas y tareas extendidas, subió de 23.8 a 28.5. Poco ruido. Mucho resultado.
Zhipu AI también publicó resultados de su prueba interna, Z.ai Code Bench, que simula un entorno de desarrollo local. En el nivel High, GLM-5.3 alcanzó 31.4% de precisión, superando el 29.5% de Claude Opus 4.8 en su nivel máximo. Y lo hizo con menos tokens: unos 50.000 por tarea frente a los 120.000 de Opus 4.8.
Más eficiente. Menos consumo para el mismo trabajo.
El modelo ofrece tres niveles de razonamiento: Low, High y Max. Zhipu AI recomienda el nivel Max para tareas de programación, donde el modelo puede dedicar más esfuerzo a planificación, implementación y verificación. A diferencia de GLM-5.2, GLM-5.3 no permite desactivar el razonamiento por completo.
Ciberseguridad GLM: Capacidad que nadie esperaba
Aquí es donde la actualización GLM-5.3 se vuelve interesante. Zhipu AI incluyó datos de descubrimiento de vulnerabilidades en el post-entrenamiento, esperando mejorar la capacidad del modelo para encontrar fallos. Lo que obtuvieron fue más de lo previsto.
En CyberGym, que evalúa la capacidad de un modelo para identificar vulnerabilidades a partir de código fuente, GLM-5.3 alcanzó 84.5%. Supera a GLM-5.2 (77.2%), a Mythos 5 de Anthropic (83.8%) y a GPT-5.6 Sol (83.6%).
En ExploitBench, que exige entender la causa real de vulnerabilidades y completar su explotación, GLM-5.3 subió de 24.4% a 54.4%. Más del doble. Pero Mythos 5 sigue por delante con 78.0%. La brecha se cierra. No desaparece.
ExploitGym mide cuántas tareas de explotación puede completar el modelo en un tiempo límite. GLM-5.3 completó 105 tareas en dos horas y 130 en seis. GLM-5.2 solo logró 29 y 39 respectivamente. Un avance enorme, pero Mythos 5 completó 181 y 247.
La tendencia es clara: cuanto más cerca del inicio de la cadena de explotación, más competitivo es GLM-5.3. Cuanto más profundo, más ventaja mantienen los modelos cerrados. Y la diferencia no es pequeña.
2.436 Vulnerabilidades: Lo que GLM-5.3 encontró antes del lanzamiento
Entre la publicación de GLM-5.2 y el lanzamiento de GLM-5.3, Zhipu AI colaboró con equipos de seguridad de la Universidad de Tsinghua, Nankai y varios laboratorios chinos. El resultado: 2.436 vulnerabilidades encontradas en 269 proyectos. 1.097 clasificadas como riesgo medio o alto.
Un hallazgo destacado: una vulnerabilidad en el protocolo DNS, que existe desde 1983, podría amplificar la presión computacional de un servidor hasta 80.000 veces con solo unas pocas peticiones especiales. Se estima que podría afectar al 90% de los sistemas DNS globales, más de 10 millones de servicios públicos.
Otros hallazgos incluyen una vulnerabilidad de cero clics en una aplicación de mensajería con cientos de millones de usuarios diarios, tres vulnerabilidades en los sistemas de correo y oficina de Microsoft, y un riesgo de control remoto en robots de una empresa líder. Todos reportados. Todos en reparación.
Zhipu AI calcula que estas vulnerabilidades tendrían un valor de mercado de 30 millones de yuanes (unos 4,1 millones de dólares) según precios públicos de programas de recompensas como los de Apple, Zerodium y Pwn2Own. La empresa también lanzó el plan "Escudo Open-Source", que ofrece créditos gratuitos del modelo a mantenedores de proyectos open-source para auditorías de seguridad.
Precio y disponibilidad de GLM-5.3
GLM-5.3 ya está disponible a través de varias plataformas. ZCode, la herramienta de programación oficial de Zhipu AI, y AutoClaw, su herramienta de productividad, recibieron el modelo el día del lanzamiento. El GLM Coding Plan, antes de acceso limitado, se abrió a todos los usuarios.
El API general llegará pronto, según la empresa. Plataformas de terceros como TraeWork, TraeCode, WorkBuddy, CodeBuddy, Qoder, CatPaw, JoyCode y OpenCode también ofrecen acceso anticipado.
Los pesos completos del modelo se publicarán dos semanas después del lanzamiento, una vez que Zhipu AI complete la evaluación de seguridad y el refuerzo del modelo. El retraso es intencional: la empresa quiere limitar las capacidades ofensivas del modelo mientras preserva su valor defensivo.
Limitaciones de GLM-5.3
GLM-5.3 no es perfecto. Varios detalles merecen atención.
- Todos los resultados de las pruebas de referencia son auto-reportados por Zhipu AI. Ninguna tercera parte independiente ha verificado las cifras. Es un patrón común en la industria. Pero conviene tenerlo en cuenta.
- En explotación profunda de vulnerabilidades, el modelo aún queda detrás de Mythos 5 y GPT-5.6 Sol. En ExploitBench, GLM-5.3 obtuvo 54.4% frente al 78.0% de Mythos 5. La mejora respecto a GLM-5.2 es grande, pero la distancia con los modelos cerrados sigue siendo real.
- El modelo no permite desactivar el razonamiento, lo que significa que cada tarea consume más tokens que GLM-5.2 en su configuración más ligera. Para casos de uso simples, esto puede aumentar costos sin beneficio claro.
Y aunque Zhipu AI describe el modelo como open-source, los pesos no están disponibles de inmediato. Las capacidades de ciberseguridad más sensibles solo estarán disponibles a través de un programa de acceso confiable para usuarios verificados.
Conclusión: GLM-5.3 y el Futuro del Código Abierto
La actualización GLM-5.3 demuestra que el post-entrenamiento puede lograr más de lo esperado sin tocar el modelo base. Para desarrolladores que buscan un modelo de IA open-source con capacidad de programación competitiva, GLM-5.3 es una opción sólida. Si te interesa la ciberseguridad GLM como herramienta de defensa, el plan de acceso confiable vale la pena explorar.
Los pesos del modelo se publicarán pronto. Si quieres probar GLM-5.3 antes, ZCode y el GLM Coding Plan ya están abiertos a todos los usuarios.


