TL;DR Z.ai lanzó GLM-5.3 el 14 de agosto de 2026, sobre el mismo modelo base Mixture-of-Experts de ~743–753B parámetros que GLM-5.2. Todas las mejoras provinieron de post-entrenamiento escalado en entornos de largo horizonte. El resultado es una mejora relativa de ~50% en el Code Bench interno de Z.ai, SOTA de código abierto en Terminal-Bench 3.0 (4.6 → 28.3) y Agents’ Last Exam, puntuaciones de agentes mucho mejores y un rendimiento emergente de ciberseguridad de estado del arte (CyberGym 84.5%). La eficiencia de tokens también mejoró.
Se esperan los pesos aproximadamente dos semanas después del lanzamiento tras el endurecimiento de seguridad. Los desarrolladores ya pueden acceder a modelos GLM relacionados y probar flujos de trabajo eficientemente a través de plataformas unificadas como CometAPI.
Puntos clave
- Mismo modelo base que GLM-5.2; todos los avances del post-entrenamiento (IndexShare, SAO, framework slime + más entornos y cómputo).
- Programación: Terminal-Bench 3.0 4.6 → 28.3; DeepSWE v1.1 46.2 → 66.9; Code Bench interno de Z.ai ~50% mejor con menos tokens de salida.
- Agentes: AutomationBench 26.2 → 48.2; Agents’ Last Exam 23.8 → 28.5; GDPval-AA v2 1508 → 1769.
- Ciber: CyberGym 77.2 → 84.5 (SOTA, por delante de Mythos 5 y GPT-5.6 Sol); ExploitBench más que duplicado (24.4 → 54.4). Hallazgos reales: 2,436 vulnerabilidades en 269 proyectos.
- Especificaciones sin cambios en la arquitectura central: 1M de contexto, hasta 128K tokens de salida, pensamiento siempre activo con esfuerzos low/high/max.
- Acceso: Disponible vía GLM Coding Plan y ZCode; API general y pesos abiertos (estilo MIT esperado) tras la revisión de seguridad. CometAPI ofrece acceso compatible con OpenAI a la familia GLM para pruebas comparativas y enrutamiento en producción.
GLM-5.3 vs GLM-5.2 de un vistazo
| Dimensión | GLM-5.3 | GLM-5.2 | Ganador / Notas |
|---|---|---|---|
| Modelo base | Mismo ~743–753B MoE | Mismo | Idéntico |
| Post-entrenamiento | Entornos fuertemente escalados | Stack anterior | 5.3 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 5.3 (gran) |
| DeepSWE v1.1 | 66.9 | 46.2 | 5.3 |
| Code Bench interno (Max) | 34.5% @ ~75K tokens | 23.4% @ ~96K tokens | 5.3 (perf + eficiencia) |
| Agents’ Last Exam | 28.5 | 23.8 | 5.3 |
| AutomationBench | 48.2 | 26.2 | 5.3 |
| CyberGym | 84.5 (SOTA) | 77.2 | 5.3 |
| ExploitBench | 54.4 | 24.4 | 5.3 |
| GDPval-AA v2 | 1769 | 1508 | 5.3 |
| Contexto / salida máxima | 1M / 128K | 1M / similar | Igual |
| Pensamiento | Siempre activo (low/high/max) | Más flexible previamente | 5.3 (siempre activo) |
| Pesos abiertos | ~2 semanas tras lanzamiento | Disponibles (MIT) | 5.2 actualmente |
| Acceso principal ahora | Coding Plan / ZCode | API + weights + Coding Plan | 5.2 más maduro |
Introducción: el post-entrenamiento ofrece un salto generacional
A mediados de agosto de 2026, la comunidad observó otra iteración rápida en la carrera de pesos abiertos. Z.ai (la cara internacional del antiguo equipo Zhipu AI / ChatGLM) lanzó GLM-5.3 apenas 59 días después de GLM-5.2. El anuncio fue inusualmente claro: el modelo base subyacente se mantuvo idéntico. “La ampliación del post-entrenamiento es todo lo que hicimos para GLM-5.3,” afirmó la empresa.
Esa afirmación es importante. Durante años ha dominado la narrativa “los modelos más grandes ganan”. GLM-5.3 demuestra que el escalado agresivo de entornos de aprendizaje por refuerzo, la diversidad de tareas de largo horizonte y la infraestructura de sistemas pueden producir ganancias desproporcionadas en cargas de trabajo difíciles de programación, agentes e incluso ciberseguridad sin una nueva corrida de pre-entrenamiento. Las cifras son lo suficientemente grandes en varios benchmarks difíciles como para que observadores independientes describan el salto como cualitativamente diferente más que incremental. Resumen de funciones, benchmarks y notas de acceso de GLM-5.3.
GLM-5.3 vs GLM-5.2: ¿Qué cambió realmente?
La mayor idea equivocada sería pensar que GLM-5.3 es simplemente “GLM-5.2 pero más grande”.
No lo es.
El modelo base permanece esencialmente igual, según Z.ai. La gran innovación es el escalado del post-entrenamiento. Z.ai enfatiza tres pilares:
- Mejoras de sistemas dentro de slime — Mejor entrenamiento
- Escalado de entornos — Pipelines que sintetizan entornos ejecutables, verificables y de largo horizonte a partir de flujos de trabajo profesionales reales. Agentes de investigación extraen patrones de tareas; agentes jueces verifican la solvibilidad; los verificadores se construyen sin acceso a soluciones de referencia para reducir el reward hacking.
- Uso continuado de SAO + compactación — Ayuda a que las ganancias persistan en trayectorias largas en lugar de colapsar en cortas. —consistencia de rollout (diferencias de log-prob controladas a ~1e-7), caché jerárquica, soporte multi-teacher, planificación consciente de la carga y reportados >2.3× de mejora en throughput de extremo a extremo en tareas de RL de programación de largo horizonte.
Estos cambios produjeron mejoras medibles en suites de programación, agentes y ciberseguridad. Importante: las mayores ganancias relativas aparecen en las pruebas más difíciles y de menor línea base, exactamente el patrón esperado cuando se empuja un modelo a regímenes que antes no manejaba de manera confiable.
El resultado es una actualización de modelo principalmente sobre comportamiento y capacidad, más que simplemente arquitectura.
GLM-5.3 vs GLM-5.2: Comparación de características
1. Post-entrenamiento escalado en lugar de un nuevo modelo base
Z.ai describe el post-entrenamiento escalado como toda la receta para GLM-5.3. Agentes de investigación convierten patrones del trabajo real en tareas ejecutables con estado oculto y dependencias de múltiples pasos. Un agente juez verifica que cada tarea sea resoluble. Los verificadores se crean sin ver la solución de referencia y luego se prueban contra estados oráculo, no-op y no resueltos para reducir atajos de recompensa.
El sistema aún requiere revisión humana, y Z.ai dice explícitamente que la generación y verificación de entornos más autónoma sigue siendo trabajo futuro. Esa salvedad aumenta la credibilidad de la afirmación: esto es una gran canalización de entrenamiento, no un reclamo de que los entornos sintéticos se hayan vuelto completamente auto-gobernados.
2. Programación de largo horizonte más fuerte
GLM-5.3 mejora en trabajo de repositorios, tareas de terminal, infraestructura de aprendizaje automático, optimización de rendimiento y entrega de software de múltiples pasos. En Z.ai Code Bench, la evaluación interna privada destinada a reflejar escenarios realistas de usuario, Z.ai reporta aproximadamente 50% mejor rendimiento en programación que GLM-5.2.
El resultado de eficiencia es tan importante como la puntuación. En Max effort, GLM-5.3 logró 34.5% con unos 75K tokens de salida por tarea, frente a 23.4% de GLM-5.2 con 96K. Es una ganancia de 11.1 puntos de calidad produciendo ~22% menos tokens de salida. En High effort, GLM-5.3 alcanzó 31.4% usando ~50K tokens, por delante de Claude Opus 4.8 con 29.5% y 120K en el mismo gráfico de primera parte. Claude Fable 5 se mantuvo más alto en 39.5% bajo Max effort.
3. Capacidad emergente de ciberseguridad
Z.ai añadió entornos de descubrimiento de vulnerabilidades durante el post-entrenamiento. Según el informe de lanzamiento, la capacidad creció más allá de encontrar fallos aislados: el modelo comenzó a razonar a través de múltiples etapas de una cadena de explotación.
Las puntuaciones públicas muestran progreso y límites. GLM-5.3 lidera la tabla de comparación de Z.ai en CyberGym con 84.5, frente a 77.2 de GLM-5.2. En ExploitBench más que duplica a GLM-5.2, alcanzando 54.4 frente a 24.4, pero sigue muy por detrás de Fable 5 en 78.0 y GPT-5.6 Sol en 76.5. En ExploitGym completa 105 tareas en un presupuesto normalizado de dos horas y 130 en seis horas, comparado con 29 y 39 de GLM-5.2; GPT-5.6 Sol y Fable 5 permanecen sustancialmente por delante.
Estas capacidades son de doble uso. Las organizaciones deben limitar el acceso al modelo, aislar herramientas, registrar acciones, exigir autorización para escaneos y mantener a un humano en el circuito para la validación y divulgación de vulnerabilidades.
4. Pensamiento siempre activo con tres niveles de esfuerzo
GLM-5.3 soporta esfuerzos de razonamiento low, high y max. A diferencia de GLM-5.2, no soporta el pensamiento deshabilitado. Integraciones existentes que envían thinking.type: "disabled" deben cambiar el valor a enabled antes de cambiar el ID del modelo, o Z.ai dice que la solicitud fallará.
Use low para ediciones interactivas y transformaciones de bajo riesgo, high para tareas sustanciales de repositorios y max para programación difícil o análisis de seguridad. Esfuerzos más altos deben evaluarse por latencia y costo porque una respuesta más fuerte no es automáticamente la más económica.
5. Mejor throughput de entrenamiento a través de slime
GLM-5.3 continúa usando slime, el framework de código abierto de Z.ai con Megatron en el lado de entrenamiento y SGLang en el lado de rollout. Z.ai reporta adiciones para enmascarado top-p, destilación on-policy de top-k y de vocabulario completo, cambio de maestro, caching y alineación numérica más estrecha entre entrenamiento y rollout. El informe de lanzamiento dice que las diferencias de probabilidad logarítmica promedio se controlaron a nivel 1e-7, más de 99.99% más bajas que configuraciones anteriores.
La planificación consciente de cargas y el balanceo reportedly mejoraron el throughput de aprendizaje por refuerzo de extremo a extremo en más de 2.3 veces en tareas de programación de largo horizonte. Estas son mejoras de infraestructura de entrenamiento más que garantías de inferencia para el usuario final, pero explican cómo Z.ai escaló trayectorias más largas y variadas en un mes.
6. Pesos abiertos retrasados por revisión de seguridad
Z.ai llama a GLM-5.3 un modelo de pesos abiertos, pero los pesos no estaban descargables el día del lanzamiento. La empresa dice que se publicarán dos semanas después del lanzamiento tras evaluación y endurecimiento de seguridad. Esto es una diferencia material con GLM-5.2, cuyos pesos con licencia MIT ya están en Hugging Face.
Para la mayoría de los equipos, las pruebas con API hospedada siguen siendo el primer paso práctico. El modelo es grande, y los pesos abiertos no eliminan el costo de hardware de inferencia, cuantización, servicio, monitoreo o controles de seguridad.
GLM-5.3 vs GLM-5.2: Mejoras en benchmarks
La siguiente tabla usa los datos oficiales de lanzamiento de Z.ai. “Cambio” es un cálculo sencillo a partir de las puntuaciones reportadas. Los porcentajes relativos pueden parecer dramáticos cuando la línea base de GLM-5.2 es baja, por lo que también se muestra el cambio absoluto.
| Benchmark | GLM-5.2 | GLM-5.3 | Cambio absoluto | Cambio relativo |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 81.0 | 88.2 | +7.2 | +8.9% |
| Terminal-Bench 3.0 | 4.6 | 28.3 | +23.7 | +515.2% |
| DeepSWE v1.1 | 46.2 | 66.9 | +20.7 | +44.8% |
| NL2Repo | 48.9 | 58.0 | +9.1 | +18.6% |
| ProgramBench Almost Solved | 9.5 | 19.0 | +9.5 | +100.0% |
| FrontierSWE | 67.5 | 78.1 | +10.6 | +15.7% |
| SWE-Marathon v1.1 | 19.4 | 42.5 | +23.1 | +119.1% |
| PostTrainBench | 31.7 | 39.8 | +8.1 | +25.6% |
| CyberGym | 77.2 | 84.5 | +7.3 | +9.5% |
| ExploitBench | 24.4 | 54.4 | +30.0 | +123.0% |
| ExploitGym, tareas 2 horas | 29 | 105 | +76 | +262.1% |
| ExploitGym, tareas 6 horas | 39 | 130 | +91 | +233.3% |
| Toolathlon Verified | 59.9 | 73.0 | +13.1 | +21.9% |
| AutomationBench v1.0.6 | 26.2 | 48.2 | +22.0 | +84.0% |
| Agents' Last Exam CLI | 23.8 | 28.5 | +4.7 | +19.7% |
| HLE con herramientas | 54.7 | 62.5 | +7.8 | +14.3% |
| GDPval-AA v2, Elo | 1508 | 1769 | +261 | +17.3% |
Mejora en benchmarks: GLM-5.3 vs GLM-5.2 y competidores
Todos los números a continuación son reportados por el proveedor desde el blog oficial de Z.ai (con notas de metodología sobre arneses, longitudes de contexto y muestreo). La verificación independiente seguirá una vez que haya pesos y acceso más amplio.
Benchmarks de programación
| Benchmark | GLM-5.3 | GLM-5.2 | Notas / Competidores |
|---|---|---|---|
| Terminal Bench 2.1 | 88.2 | 81.0 | Competitivo con modelos cerrados top |
| Terminal Bench 3.0 | 28.3 | 4.6 | SOTA de código abierto; vs Fable 5 ~33.7, GPT-5.6 Sol ~34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | Salto fuerte |
| NL2Repo | 58.0 | 48.9 | — |
| ProgramBench Almost Solved | 19.0 | 9.5 | — |
| FrontierSWE | 78.1 | 67.5 | — |
| SWE-Marathon v1.1 | 42.5 | 19.4 | — |
| Z.ai Code Bench (interno, Max effort) | ~34.5% de completado @ ~75K tokens | ~23.4% @ ~96K tokens | ~50% mejora general en programación; mayor eficiencia |
En High effort, GLM-5.3 alcanzó 31.4% de completado con ~50K tokens, superando a Claude Opus 4.8 (29.5% con 120K tokens) en el bench interno, aunque aún detrás de Claude Fable 5 (39.5% en Max).
Benchmarks de ciberseguridad
| Benchmark | GLM-5.3 | GLM-5.2 | Competidores (aprox.) |
|---|---|---|---|
| CyberGym | 84.5% | 77.2% | Mythos 5: 83.8%, GPT-5.6 Sol: 83.6% (SOTA) |
| ExploitBench | 54.4% | 24.4% | Más que duplica al anterior; modelos cerrados más altos (Mythos 5 ~78%, GPT-5.6 Sol ~76.5%) |
| ExploitGym (2h/6h) | 105 / 130 | 29 / 39 | Mythos 5 todavía por delante (181/247) |
Las ganancias son mayores más arriba en la cadena de explotación. En pruebas reales con equipos de seguridad chinos, el modelo (construyendo sobre el trabajo de GLM-5.2) identificó 2,436 vulnerabilidades en 269 proyectos, incluyendo 1,097 de severidad media-alta. Algunas fallas se remontan a ~40 años (la más antigua ~1981). Los hallazgos se rastrean en el público Z.ai Security Disclosure Ledger.
Benchmarks de agentes y otros
| Benchmark | GLM-5.3 | GLM-5.2 | Notas |
|---|---|---|---|
| Toolathlon Verified | 73.0 | 59.9 | — |
| AutomationBench v1.0.6 | 48.2 | 26.2 | Gran ganancia |
| Agents’ Last Exam (ALE-CLI) | 28.5 | 23.8 | Competitivo de código abierto |
| HLE con herramientas | 62.5 | 54.7 | — |
| GDPval-AA v2 | 1769 | 1508 | Cubre 44 profesiones |
Estos resultados demuestran un progreso claro en tareas profesionales de largo horizonte y múltiples pasos.
Eficiencia de tokens, modos de pensamiento y comportamiento práctico
Una mejora silenciosa pero importante es la eficiencia de tokens. En el Code Bench interno, mayores tasas de completado llegan con menos tokens de salida. Esto importa para costo y latencia en bucles de agentes en producción.
GLM-5.3 habilita siempre el pensamiento. Se soportan tres niveles de esfuerzo: low, high y max (por defecto y recomendado para programación es max). Deshabilitar el pensamiento ya no está soportado; aplicaciones que antes establecían thinking.type: "disabled" deben migrar.
El contexto sigue siendo sólido en 1M tokens con salida máxima de hasta 128K. La arquitectura no cambió respecto a GLM-5.2, por lo que el dimensionamiento de hardware para futura auto-gestión puede estimarse a partir de la experiencia existente con GLM-5.2 (huellas cuantizadas aún grandes dado el recuento total de parámetros).
Para desarrolladores que quieran experimentar de inmediato o mantener flexibilidad entre modelos, los gateways unificados son útiles. CometAPI lista modelos de la serie GLM (incluido GLM-5.3 bajo el ID de modelo glm-5.3 a medida que esté disponible) con endpoints compatibles con OpenAI, tarifas competitivas, facturación por uso y la capacidad de alternar entre GLM-5.2, GLM-5.3 y docenas de otros modelos frontera y abiertos sin reescribir el código de integración. Esto es particularmente práctico para pruebas A/B de agentes de programación, medir costo real por tarea exitosa y enrutar tráfico según la carga de trabajo.
Quién debe pasar a GLM-5.3 y cómo evaluar
Equipos que construyen agentes de programación, automatización de largo horizonte, flujos de trabajo de ingeniería a escala de repositorios o herramientas defensivas de seguridad deben priorizar la evaluación. La combinación de mayores tasas de completado, mejor eficiencia de tokens en tareas complejas y agencia multi-paso más fuerte es material.
Ruta de evaluación recomendada:
- Ejecute las mismas tareas internas (o un arnés fijo) en GLM-5.2 y GLM-5.3 (o vía Coding Plan) con niveles de esfuerzo igualados.
- Mida no solo la tasa de aprobación sino tokens, tiempo de pared y tasa de intervención humana.
- Use una capa de API unificada como CometAPI para mantener la comparación sin fricción y conservar la opción de retroceder o enrutar selectivamente.
- Para cargas sensibles a seguridad, espere los pesos abiertos totalmente endurecidos y revise prácticas de divulgación.
La auto-gestión se volverá atractiva una vez que se publiquen los pesos, especialmente para organizaciones que ya ejecutan infraestructura GLM-5.2.
Conclusión: el post-entrenamiento como la nueva frontera del escalado
GLM-5.3 es una de las demostraciones más claras recientes de que escalar el post-entrenamiento —entornos más realistas, mejor infraestructura de RL y cómputo sostenido en trayectorias largas— puede producir saltos de capacidad que antes parecían requerir nuevos modelos base. Las ganancias en programación y agencia son grandes; los resultados de ciber fueron en gran medida emergentes y ya competitivos o líderes en benchmarks orientados al descubrimiento.
Para los profesionales, la conclusión práctica es sencilla: pruebe el modelo en sus cargas reales, mida el costo por resultado exitoso más que la posición bruta en rankings, y mantenga la integración flexible. Plataformas como CometAPI simplifican ese proceso al ofrecer una sola llave, interfaz compatible con OpenAI y cambio fácil entre la serie GLM y modelos competidores mientras decide cuán agresivamente adoptar las nuevas capacidades.
