FLUX 3 and Gemini 3.7 Flash are now live on CometAPI →
ai-comparisons/Investigación de CometAPI

GLM-5.3 vs GLM-5.2: Los benchmarks y las pruebas nos indican qué ha cambiado

GLM-5.3 vs GLM-5.2: Mismo modelo base, el posentrenamiento puro logra un salto de ~50% en programación (Terminal-Bench 3.0 4.6→28.3) & un 84.5% SOTA emergente en CyberGym.

CometAPI
AnnaEquipo de investigación de modelos de IA y API
Actualizado Aug 16, 2026 14 min de lectura
GLM-5.3 vs GLM-5.2: Los benchmarks y las pruebas nos indican qué ha cambiado
Usa este patrón

Haz la primera llamada a la API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Z.ai lanzó GLM-5.3 el 14 de agosto de 2026, sobre el mismo modelo base Mixture-of-Experts de ~743–753B parámetros que GLM-5.2. Todas las mejoras provinieron de post-entrenamiento escalado en entornos de largo horizonte. El resultado es una mejora relativa de ~50% en el Code Bench interno de Z.ai, SOTA de código abierto en Terminal-Bench 3.0 (4.6 → 28.3) y Agents’ Last Exam, puntuaciones de agentes mucho mejores y un rendimiento emergente de ciberseguridad de estado del arte (CyberGym 84.5%). La eficiencia de tokens también mejoró.

Se esperan los pesos aproximadamente dos semanas después del lanzamiento tras el endurecimiento de seguridad. Los desarrolladores ya pueden acceder a modelos GLM relacionados y probar flujos de trabajo eficientemente a través de plataformas unificadas como CometAPI.

Puntos clave

  • Mismo modelo base que GLM-5.2; todos los avances del post-entrenamiento (IndexShare, SAO, framework slime + más entornos y cómputo).
  • Programación: Terminal-Bench 3.0 4.6 → 28.3; DeepSWE v1.1 46.2 → 66.9; Code Bench interno de Z.ai ~50% mejor con menos tokens de salida.
  • Agentes: AutomationBench 26.2 → 48.2; Agents’ Last Exam 23.8 → 28.5; GDPval-AA v2 1508 → 1769.
  • Ciber: CyberGym 77.2 → 84.5 (SOTA, por delante de Mythos 5 y GPT-5.6 Sol); ExploitBench más que duplicado (24.4 → 54.4). Hallazgos reales: 2,436 vulnerabilidades en 269 proyectos.
  • Especificaciones sin cambios en la arquitectura central: 1M de contexto, hasta 128K tokens de salida, pensamiento siempre activo con esfuerzos low/high/max.
  • Acceso: Disponible vía GLM Coding Plan y ZCode; API general y pesos abiertos (estilo MIT esperado) tras la revisión de seguridad. CometAPI ofrece acceso compatible con OpenAI a la familia GLM para pruebas comparativas y enrutamiento en producción.

GLM-5.3 vs GLM-5.2 de un vistazo

DimensiónGLM-5.3GLM-5.2Ganador / Notas
Modelo baseMismo ~743–753B MoEMismoIdéntico
Post-entrenamientoEntornos fuertemente escaladosStack anterior5.3
Terminal-Bench 3.028.34.65.3 (gran)
DeepSWE v1.166.946.25.3
Code Bench interno (Max)34.5% @ ~75K tokens23.4% @ ~96K tokens5.3 (perf + eficiencia)
Agents’ Last Exam28.523.85.3
AutomationBench48.226.25.3
CyberGym84.5 (SOTA)77.25.3
ExploitBench54.424.45.3
GDPval-AA v2176915085.3
Contexto / salida máxima1M / 128K1M / similarIgual
PensamientoSiempre activo (low/high/max)Más flexible previamente5.3 (siempre activo)
Pesos abiertos~2 semanas tras lanzamientoDisponibles (MIT)5.2 actualmente
Acceso principal ahoraCoding Plan / ZCodeAPI + weights + Coding Plan5.2 más maduro

Introducción: el post-entrenamiento ofrece un salto generacional

A mediados de agosto de 2026, la comunidad observó otra iteración rápida en la carrera de pesos abiertos. Z.ai (la cara internacional del antiguo equipo Zhipu AI / ChatGLM) lanzó GLM-5.3 apenas 59 días después de GLM-5.2. El anuncio fue inusualmente claro: el modelo base subyacente se mantuvo idéntico. “La ampliación del post-entrenamiento es todo lo que hicimos para GLM-5.3,” afirmó la empresa.

Esa afirmación es importante. Durante años ha dominado la narrativa “los modelos más grandes ganan”. GLM-5.3 demuestra que el escalado agresivo de entornos de aprendizaje por refuerzo, la diversidad de tareas de largo horizonte y la infraestructura de sistemas pueden producir ganancias desproporcionadas en cargas de trabajo difíciles de programación, agentes e incluso ciberseguridad sin una nueva corrida de pre-entrenamiento. Las cifras son lo suficientemente grandes en varios benchmarks difíciles como para que observadores independientes describan el salto como cualitativamente diferente más que incremental. Resumen de funciones, benchmarks y notas de acceso de GLM-5.3.

GLM-5.3 vs GLM-5.2: ¿Qué cambió realmente?

La mayor idea equivocada sería pensar que GLM-5.3 es simplemente “GLM-5.2 pero más grande”.

No lo es.

El modelo base permanece esencialmente igual, según Z.ai. La gran innovación es el escalado del post-entrenamiento. Z.ai enfatiza tres pilares:

  1. Mejoras de sistemas dentro de slime — Mejor entrenamiento
  2. Escalado de entornos — Pipelines que sintetizan entornos ejecutables, verificables y de largo horizonte a partir de flujos de trabajo profesionales reales. Agentes de investigación extraen patrones de tareas; agentes jueces verifican la solvibilidad; los verificadores se construyen sin acceso a soluciones de referencia para reducir el reward hacking.
  3. Uso continuado de SAO + compactación — Ayuda a que las ganancias persistan en trayectorias largas en lugar de colapsar en cortas. —consistencia de rollout (diferencias de log-prob controladas a ~1e-7), caché jerárquica, soporte multi-teacher, planificación consciente de la carga y reportados >2.3× de mejora en throughput de extremo a extremo en tareas de RL de programación de largo horizonte.

Estos cambios produjeron mejoras medibles en suites de programación, agentes y ciberseguridad. Importante: las mayores ganancias relativas aparecen en las pruebas más difíciles y de menor línea base, exactamente el patrón esperado cuando se empuja un modelo a regímenes que antes no manejaba de manera confiable.

El resultado es una actualización de modelo principalmente sobre comportamiento y capacidad, más que simplemente arquitectura.

GLM-5.3 vs GLM-5.2: Comparación de características

1. Post-entrenamiento escalado en lugar de un nuevo modelo base

Z.ai describe el post-entrenamiento escalado como toda la receta para GLM-5.3. Agentes de investigación convierten patrones del trabajo real en tareas ejecutables con estado oculto y dependencias de múltiples pasos. Un agente juez verifica que cada tarea sea resoluble. Los verificadores se crean sin ver la solución de referencia y luego se prueban contra estados oráculo, no-op y no resueltos para reducir atajos de recompensa.

El sistema aún requiere revisión humana, y Z.ai dice explícitamente que la generación y verificación de entornos más autónoma sigue siendo trabajo futuro. Esa salvedad aumenta la credibilidad de la afirmación: esto es una gran canalización de entrenamiento, no un reclamo de que los entornos sintéticos se hayan vuelto completamente auto-gobernados.

2. Programación de largo horizonte más fuerte

GLM-5.3 mejora en trabajo de repositorios, tareas de terminal, infraestructura de aprendizaje automático, optimización de rendimiento y entrega de software de múltiples pasos. En Z.ai Code Bench, la evaluación interna privada destinada a reflejar escenarios realistas de usuario, Z.ai reporta aproximadamente 50% mejor rendimiento en programación que GLM-5.2.

El resultado de eficiencia es tan importante como la puntuación. En Max effort, GLM-5.3 logró 34.5% con unos 75K tokens de salida por tarea, frente a 23.4% de GLM-5.2 con 96K. Es una ganancia de 11.1 puntos de calidad produciendo ~22% menos tokens de salida. En High effort, GLM-5.3 alcanzó 31.4% usando ~50K tokens, por delante de Claude Opus 4.8 con 29.5% y 120K en el mismo gráfico de primera parte. Claude Fable 5 se mantuvo más alto en 39.5% bajo Max effort.

3. Capacidad emergente de ciberseguridad

Z.ai añadió entornos de descubrimiento de vulnerabilidades durante el post-entrenamiento. Según el informe de lanzamiento, la capacidad creció más allá de encontrar fallos aislados: el modelo comenzó a razonar a través de múltiples etapas de una cadena de explotación.

Las puntuaciones públicas muestran progreso y límites. GLM-5.3 lidera la tabla de comparación de Z.ai en CyberGym con 84.5, frente a 77.2 de GLM-5.2. En ExploitBench más que duplica a GLM-5.2, alcanzando 54.4 frente a 24.4, pero sigue muy por detrás de Fable 5 en 78.0 y GPT-5.6 Sol en 76.5. En ExploitGym completa 105 tareas en un presupuesto normalizado de dos horas y 130 en seis horas, comparado con 29 y 39 de GLM-5.2; GPT-5.6 Sol y Fable 5 permanecen sustancialmente por delante.

Estas capacidades son de doble uso. Las organizaciones deben limitar el acceso al modelo, aislar herramientas, registrar acciones, exigir autorización para escaneos y mantener a un humano en el circuito para la validación y divulgación de vulnerabilidades.

4. Pensamiento siempre activo con tres niveles de esfuerzo

GLM-5.3 soporta esfuerzos de razonamiento low, high y max. A diferencia de GLM-5.2, no soporta el pensamiento deshabilitado. Integraciones existentes que envían thinking.type: "disabled" deben cambiar el valor a enabled antes de cambiar el ID del modelo, o Z.ai dice que la solicitud fallará.

Use low para ediciones interactivas y transformaciones de bajo riesgo, high para tareas sustanciales de repositorios y max para programación difícil o análisis de seguridad. Esfuerzos más altos deben evaluarse por latencia y costo porque una respuesta más fuerte no es automáticamente la más económica.

5. Mejor throughput de entrenamiento a través de slime

GLM-5.3 continúa usando slime, el framework de código abierto de Z.ai con Megatron en el lado de entrenamiento y SGLang en el lado de rollout. Z.ai reporta adiciones para enmascarado top-p, destilación on-policy de top-k y de vocabulario completo, cambio de maestro, caching y alineación numérica más estrecha entre entrenamiento y rollout. El informe de lanzamiento dice que las diferencias de probabilidad logarítmica promedio se controlaron a nivel 1e-7, más de 99.99% más bajas que configuraciones anteriores.

La planificación consciente de cargas y el balanceo reportedly mejoraron el throughput de aprendizaje por refuerzo de extremo a extremo en más de 2.3 veces en tareas de programación de largo horizonte. Estas son mejoras de infraestructura de entrenamiento más que garantías de inferencia para el usuario final, pero explican cómo Z.ai escaló trayectorias más largas y variadas en un mes.

6. Pesos abiertos retrasados por revisión de seguridad

Z.ai llama a GLM-5.3 un modelo de pesos abiertos, pero los pesos no estaban descargables el día del lanzamiento. La empresa dice que se publicarán dos semanas después del lanzamiento tras evaluación y endurecimiento de seguridad. Esto es una diferencia material con GLM-5.2, cuyos pesos con licencia MIT ya están en Hugging Face.

Para la mayoría de los equipos, las pruebas con API hospedada siguen siendo el primer paso práctico. El modelo es grande, y los pesos abiertos no eliminan el costo de hardware de inferencia, cuantización, servicio, monitoreo o controles de seguridad.

GLM-5.3 vs GLM-5.2: Mejoras en benchmarks

La siguiente tabla usa los datos oficiales de lanzamiento de Z.ai. “Cambio” es un cálculo sencillo a partir de las puntuaciones reportadas. Los porcentajes relativos pueden parecer dramáticos cuando la línea base de GLM-5.2 es baja, por lo que también se muestra el cambio absoluto.

BenchmarkGLM-5.2GLM-5.3Cambio absolutoCambio relativo
Terminal-Bench 2.181.088.2+7.2+8.9%
Terminal-Bench 3.04.628.3+23.7+515.2%
DeepSWE v1.146.266.9+20.7+44.8%
NL2Repo48.958.0+9.1+18.6%
ProgramBench Almost Solved9.519.0+9.5+100.0%
FrontierSWE67.578.1+10.6+15.7%
SWE-Marathon v1.119.442.5+23.1+119.1%
PostTrainBench31.739.8+8.1+25.6%
CyberGym77.284.5+7.3+9.5%
ExploitBench24.454.4+30.0+123.0%
ExploitGym, tareas 2 horas29105+76+262.1%
ExploitGym, tareas 6 horas39130+91+233.3%
Toolathlon Verified59.973.0+13.1+21.9%
AutomationBench v1.0.626.248.2+22.0+84.0%
Agents' Last Exam CLI23.828.5+4.7+19.7%
HLE con herramientas54.762.5+7.8+14.3%
GDPval-AA v2, Elo15081769+261+17.3%

Mejora en benchmarks: GLM-5.3 vs GLM-5.2 y competidores

Todos los números a continuación son reportados por el proveedor desde el blog oficial de Z.ai (con notas de metodología sobre arneses, longitudes de contexto y muestreo). La verificación independiente seguirá una vez que haya pesos y acceso más amplio.

Benchmarks de programación

BenchmarkGLM-5.3GLM-5.2Notas / Competidores
Terminal Bench 2.188.281.0Competitivo con modelos cerrados top
Terminal Bench 3.028.34.6SOTA de código abierto; vs Fable 5 ~33.7, GPT-5.6 Sol ~34.6
DeepSWE v1.166.946.2Salto fuerte
NL2Repo58.048.9
ProgramBench Almost Solved19.09.5
FrontierSWE78.167.5
SWE-Marathon v1.142.519.4
Z.ai Code Bench (interno, Max effort)~34.5% de completado @ ~75K tokens~23.4% @ ~96K tokens~50% mejora general en programación; mayor eficiencia

En High effort, GLM-5.3 alcanzó 31.4% de completado con ~50K tokens, superando a Claude Opus 4.8 (29.5% con 120K tokens) en el bench interno, aunque aún detrás de Claude Fable 5 (39.5% en Max).

Benchmarks de ciberseguridad

BenchmarkGLM-5.3GLM-5.2Competidores (aprox.)
CyberGym84.5%77.2%Mythos 5: 83.8%, GPT-5.6 Sol: 83.6% (SOTA)
ExploitBench54.4%24.4%Más que duplica al anterior; modelos cerrados más altos (Mythos 5 ~78%, GPT-5.6 Sol ~76.5%)
ExploitGym (2h/6h)105 / 13029 / 39Mythos 5 todavía por delante (181/247)

Las ganancias son mayores más arriba en la cadena de explotación. En pruebas reales con equipos de seguridad chinos, el modelo (construyendo sobre el trabajo de GLM-5.2) identificó 2,436 vulnerabilidades en 269 proyectos, incluyendo 1,097 de severidad media-alta. Algunas fallas se remontan a ~40 años (la más antigua ~1981). Los hallazgos se rastrean en el público Z.ai Security Disclosure Ledger.

Benchmarks de agentes y otros

BenchmarkGLM-5.3GLM-5.2Notas
Toolathlon Verified73.059.9
AutomationBench v1.0.648.226.2Gran ganancia
Agents’ Last Exam (ALE-CLI)28.523.8Competitivo de código abierto
HLE con herramientas62.554.7
GDPval-AA v217691508Cubre 44 profesiones

Estos resultados demuestran un progreso claro en tareas profesionales de largo horizonte y múltiples pasos.

Eficiencia de tokens, modos de pensamiento y comportamiento práctico

Una mejora silenciosa pero importante es la eficiencia de tokens. En el Code Bench interno, mayores tasas de completado llegan con menos tokens de salida. Esto importa para costo y latencia en bucles de agentes en producción.

GLM-5.3 habilita siempre el pensamiento. Se soportan tres niveles de esfuerzo: low, high y max (por defecto y recomendado para programación es max). Deshabilitar el pensamiento ya no está soportado; aplicaciones que antes establecían thinking.type: "disabled" deben migrar.

El contexto sigue siendo sólido en 1M tokens con salida máxima de hasta 128K. La arquitectura no cambió respecto a GLM-5.2, por lo que el dimensionamiento de hardware para futura auto-gestión puede estimarse a partir de la experiencia existente con GLM-5.2 (huellas cuantizadas aún grandes dado el recuento total de parámetros).

Para desarrolladores que quieran experimentar de inmediato o mantener flexibilidad entre modelos, los gateways unificados son útiles. CometAPI lista modelos de la serie GLM (incluido GLM-5.3 bajo el ID de modelo glm-5.3 a medida que esté disponible) con endpoints compatibles con OpenAI, tarifas competitivas, facturación por uso y la capacidad de alternar entre GLM-5.2, GLM-5.3 y docenas de otros modelos frontera y abiertos sin reescribir el código de integración. Esto es particularmente práctico para pruebas A/B de agentes de programación, medir costo real por tarea exitosa y enrutar tráfico según la carga de trabajo.

Quién debe pasar a GLM-5.3 y cómo evaluar

Equipos que construyen agentes de programación, automatización de largo horizonte, flujos de trabajo de ingeniería a escala de repositorios o herramientas defensivas de seguridad deben priorizar la evaluación. La combinación de mayores tasas de completado, mejor eficiencia de tokens en tareas complejas y agencia multi-paso más fuerte es material.

Ruta de evaluación recomendada:

  1. Ejecute las mismas tareas internas (o un arnés fijo) en GLM-5.2 y GLM-5.3 (o vía Coding Plan) con niveles de esfuerzo igualados.
  2. Mida no solo la tasa de aprobación sino tokens, tiempo de pared y tasa de intervención humana.
  3. Use una capa de API unificada como CometAPI para mantener la comparación sin fricción y conservar la opción de retroceder o enrutar selectivamente.
  4. Para cargas sensibles a seguridad, espere los pesos abiertos totalmente endurecidos y revise prácticas de divulgación.

La auto-gestión se volverá atractiva una vez que se publiquen los pesos, especialmente para organizaciones que ya ejecutan infraestructura GLM-5.2.

Conclusión: el post-entrenamiento como la nueva frontera del escalado

GLM-5.3 es una de las demostraciones más claras recientes de que escalar el post-entrenamiento —entornos más realistas, mejor infraestructura de RL y cómputo sostenido en trayectorias largas— puede producir saltos de capacidad que antes parecían requerir nuevos modelos base. Las ganancias en programación y agencia son grandes; los resultados de ciber fueron en gran medida emergentes y ya competitivos o líderes en benchmarks orientados al descubrimiento.

Para los profesionales, la conclusión práctica es sencilla: pruebe el modelo en sus cargas reales, mida el costo por resultado exitoso más que la posición bruta en rankings, y mantenga la integración flexible. Plataformas como CometAPI simplifican ese proceso al ofrecer una sola llave, interfaz compatible con OpenAI y cambio fácil entre la serie GLM y modelos competidores mientras decide cuán agresivamente adoptar las nuevas capacidades.

Seguir aprendiendo

Conecta este artículo con la siguiente decisión.

Ver todos los temas
Publicado el Aug 15, 2026
Última actualización Aug 16, 2026
0 visitas
Revisado para mayor claridad, atribución de fuentes y terminología API actual.

¿Listo para reducir los costos de desarrollo de IA en un 20%?

Comienza gratis en minutos. Créditos de prueba gratuitos incluidos. No se requiere tarjeta de crédito.

Leer Más