GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
ai-model/Investigación de CometAPI

¿Qué es GLM-5.3-FlashX? Especificaciones, velocidad, precios, pruebas de referencia y características

¿Qué es GLM-5.3-FlashX, incluyendo la velocidad de 200 tokens, la base de capacidades de GLM-5.3-Flash, contexto de 1M, benchmarks, precios, limitaciones y acceso a CometAPI?

CometAPI
Mia MarenEquipo de investigación de modelos de IA y API
Actualizado Sep 20, 2026 14 min de lectura
¿Qué es GLM-5.3-FlashX? Especificaciones, velocidad, precios, pruebas de referencia y características
Usa este patrón

Haz la primera llamada a la API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

GLM-5.3-FlashX es la variante de alta velocidad de servicio de GLM-5.3-Flash de Z.ai. Lanzada el 18 de septiembre de 2026, apunta a velocidades máximas de generación de hasta 200 tokens por segundo —un pico reportado por el proveedor, no un múltiplo garantizado ni verificado de forma independiente—, manteniendo la base de capacidades de GLM-5.3-Flash. GLM-5.3-FlashX ya está disponible en CometAPI a través de un endpoint de chat-completions compatible con OpenAI.

La distinción importante es que FlashX es principalmente una mejora de servicio e inferencia, no un checkpoint de inteligencia documentado por separado. Su base de capacidades es el modelo GLM-5.3-Flash de 320B totales / 18B activos, con entrada multimodal nativa, una ventana de contexto de 1M tokens, atención híbrida dispersa + lineal, uso de herramientas y flujos de trabajo agénticos de largo horizonte.

Los multiplicadores de velocidad y precio reportados son afirmaciones de lanzamiento, no garantías para cada proveedor o solicitud. La evaluación en producción debe comparar el tiempo hasta el primer token, el rendimiento sostenido, la latencia p95, el tiempo de finalización de la tarea y los precios actuales del proveedor.

Última verificación: 20 de septiembre de 2026

Puntos clave

  • Velocidad: Z.ai reporta una generación pico de hasta 200 tokens/s; no se declara una medición base oficial ni un multiplicador universal, por lo que los equipos deben hacer su propio benchmark por ruta y carga.
  • Base de capacidades: FlashX hereda el diseño MoE de 320B totales / 18B activos, la multimodalidad nativa, la atención híbrida dispersa + lineal y el contexto de 1M de GLM-5.3-Flash.
  • Benchmarks: Los puntajes de inteligencia publicados pertenecen a GLM-5.3-Flash; no son ejecuciones de benchmark separadas de FlashX.
  • Mejor encaje: Agentes de codificación interactivos, bucles de uso de navegador/PC, codificación visual, asistentes empresariales y otros flujos multi‑paso donde la latencia se acumula.
  • Disponibilidad en CometAPI: GLM-5.3-FlashX está activo en CometAPI con el ID de modelo glm-5.3-flashx y el endpoint /v1/chat/completions.

¿Qué es GLM-5.3-FlashX?

GLM-5.3-FlashX se entiende mejor como una capa de entrega optimizada para latencia de GLM-5.3-Flash. Los mensajes de lanzamiento de Z.ai se centran en una inferencia más rápida y fluida, mientras que el modelo Flash subyacente sigue siendo la base de capacidades. Por lo tanto, FlashX difiere de una nueva generación de modelo, un checkpoint destilado o un conjunto de pesos publicado por separado.

El modelo base GLM-5.3-Flash fue diseñado para una inferencia eficiente. Z.ai afirma que se entrenó desde una nueva base multimodal, usa un corpus multimodal de 30 billones de tokens y combina enrutamiento Mixture-of-Experts con atención híbrida. FlashX lleva más lejos el lado del servicio, sobre la base de la infraestructura de inferencia desarrollada para GLM-5.3-Flash.

Para los desarrolladores, “¿Qué es GLM-5.3-FlashX?” tiene una respuesta práctica: es la opción de servicio de alto rendimiento de GLM-5.3-Flash disponible de Z.ai y ahora también a través de la API unificada de CometAPI. La propuesta de valor es menor latencia de interacción, no un salto recién reclamado en inteligencia del modelo.

Según las declaraciones de lanzamiento de Zhipu informadas por IT Home, GLM-5.3-Flash apareció por primera vez para desarrolladores en el extranjero bajo el nombre anónimo “Ox Alpha” y vio un crecimiento continuo de uso. Para atender esa demanda, Zhipu incrementó la inversión en infraestructura y la optimización de inferencia sobre una base de producción de aproximadamente 100,000 aceleradores domésticos, y luego introdujo FlashX. El servicio mantiene la base de capacidades de GLM-5.3-Flash mientras eleva la salida pico reportada por el proveedor a 200 tokens/s. Zhipu posiciona el lanzamiento en torno a inteligencia, precio y velocidad; para cargas empresariales y de desarrolladores, esto se traduce en una opción de alta capacidad y baja latencia cuyo valor comercial debe validarse con rendimiento sostenido, latencia p95, calidad de tarea y costo bajo concurrencia realista.

Especificaciones de GLM-5.3-FlashX

Dado que FlashX es una variante de servicio de alta velocidad, su hoja de especificaciones debe separar las características heredadas del modelo de las características específicas de servicio de FlashX.

EspecificaciónGLM-5.3-FlashX
ProveedorZ.ai / Zhipu AI
Posicionamiento del productoOpción de servicio de alta velocidad para GLM-5.3-Flash
Parámetros totales/activosAproximadamente 320B / 18B por token, heredados del modelo base
ArquitecturaMixture-of-Experts; atención híbrida dispersa + lineal; mHC
Ventana de contextoHasta 1,048,576 tokens
Entradas/salidaLa compatibilidad exacta de modalidades, límites de archivos, restricciones de video y parámetros específicos de la ruta deben verificarse en el endpoint del proveedor antes del despliegue en producción.
RazonamientoCompatible a través del modelo GLM-5.3-Flash subyacente
Esfuerzo de razonamientolow / high / max en rutas compatibles
ThinkingDependiente de la ruta/API
Herramientas/llamadas a funcionesCompatible
Pesos abiertosGLM-5.3-Flash subyacente: con licencia MIT; FlashX se presenta como una opción de servicio alojada
Velocidad pico reportadaHasta 200 tokens/s
Velocidad relativa reportadaSin línea base oficial ni multiplicador garantizado; haga benchmark de la ruta del proveedor seleccionada
Precio en CometAPI$60 / 1M tokens de entrada y $60 / 1M tokens de salida, verificado el 20 de septiembre de 2026; vuelva a comprobar el precio en vivo
Fecha de lanzamiento18 de septiembre de 2026
Clave de modelo de Z.aiGLM-5.3-FlashX / glm-5.3-flashx
ID de modelo en CometAPIglm-5.3-flashx
Endpoint de CometAPIPOST /v1/chat/completions

¿Por qué GLM-5.3-FlashX es más rápido que GLM-5.3-Flash?

Dos capas de optimización están detrás de la historia de velocidad: la arquitectura eficiente heredada de GLM-5.3-Flash y la infraestructura de servicio optimizada a su alrededor.

Atención híbrida dispersa + lineal

GLM-5.3-Flash combina atención lineal para dependencias locales con atención dispersa para recuperar información relevante del contexto amplio. Z.ai también describe IndexPool, que comprime cuatro vectores de claves indexadoras en caché en uno mediante un agrupamiento ponderado. En la comparación publicada por Z.ai, estos cambios reducen el cómputo de atención aproximadamente 3.0× y el tamaño de la caché KV aproximadamente 4.4× frente a GLM-5.3 en contextos largos.

¿Qué es GLM-5.3-FlashX? Especificaciones, velocidad, precios, pruebas de referencia y características

Sección oficial de arquitectura de GLM-5.3-Flash de Z.ai.

Infraestructura de inferencia

Z.ai afirma que el tráfico de GLM-5.3-Flash en producción se ejecuta en un clúster de más de 100,000 aceleradores de IA fabricados en China. Su stack de servicio incluye paralelismo de tensores, ReplaySSM, cuantización W8A8, cuantización mixta de caché INT8/FP8/BF16, Layer Split, y una arquitectura desagregada Encode–Prefill–Decode. La empresa reporta aproximadamente una mejora 3× de extremo a extremo en servicio respecto a su línea base inicial en el mismo hardware.

Por lo tanto, FlashX debe leerse como la productización de una optimización de inferencia continua: el modelo reduce el cómputo y los costos de caché, mientras que FlashX añade una capa de servicio más agresiva de baja latencia.

¿Qué tan rápido es GLM-5.3-FlashX?

Z.ai reporta una velocidad máxima de generación de hasta 200 tokens/s. Trátelo como una cifra máxima de servicio, no como una tasa sostenida garantizada: valide el tiempo hasta el primer token, la velocidad de salida sostenida, la latencia p95, la finalización de la tarea y la tasa de errores en la ruta de producción.

“Hasta 200 tokens/s” es una cifra pico de servicio, no una garantía para cada solicitud. El rendimiento real depende de la longitud del prompt, el esfuerzo de razonamiento, la longitud de la salida, el preprocesamiento multimodal, la concurrencia, las llamadas a herramientas, la región y la carga del proveedor.

Las métricas útiles en producción incluyen el tiempo hasta el primer token, los tokens de salida por segundo sostenidos, la latencia p95 y el tiempo de finalización de la tarea de extremo a extremo. El tiempo de finalización de la tarea importa especialmente para los agentes porque un flujo de 20 pasos puede pagar el retraso de generación 20 veces.

¿Cómo se desempeña GLM-5.3-FlashX en benchmarks?

No se publicó en el lanzamiento un conjunto de benchmarks de inteligencia específico de FlashX. FlashX se documenta como una optimización de inferencia y servicio, por lo que su diferenciador validado es el rendimiento, no una nueva puntuación de calidad de tarea.

Esos resultados pertenecen al modelo subyacente GLM-5.3-Flash y pueden consultarse solo como contexto de capacidades; no son mediciones de FlashX porque no se reportaron por separado el checkpoint, el arnés de evaluación ni la ejecución de calidad de tareas para FlashX.

Para decisiones de despliegue, pruebe FlashX y Flash con los mismos prompts, esfuerzo de razonamiento y configuración de herramientas, y luego compare el éxito de tareas, el tiempo hasta el primer token, el rendimiento sostenido, la latencia p95 y el costo total por flujo de trabajo completado.

GLM-5.3-FlashX vs GLM-5.3-Flash vs GLM-5.3

DimensiónGLM-5.3-FlashXGLM-5.3-FlashGLM-5.3
PosicionamientoCapa de servicio de alta velocidadModelo multimodal con foco en eficienciaCapa insignia de capacidades
ContextoHasta 1M1MClase 1M en rutas compatibles
Parámetros totales/activosBase heredada 320B / 18B320B / 18BConfiguración insignia mayor
Velocidad de salida picoHasta 200 tokens/s reportadosLínea base dependiente del proveedorDependiente del proveedor
Precio relativo vs FlashAproximadamente 2.5× reportadoSuperior a Flash
Pesos abiertosCapa de servicio; los pesos base son abiertosSí, MITDependiente del lanzamiento
Razonamiento y herramientasHeredados de Flash; verifique controles por rutaCompatibleCapa insignia de razonamiento
Disponibilidad en CometAPIDisponibleDisponibleDisponible
Mejor encajeAgentes interactivos de baja latenciaTrabajo multimodal de alto volumen y sensible a costosCargas GLM de máxima capacidad

CometAPI ahora proporciona la API de GLM-5.3-FlashX, junto con la API de GLM-5.3-Flash y la API de GLM-5.3. Esto hace posible comparar latencia, costo y calidad de tareas a través de una sola integración.

Comparación basada en cargas de trabajo

EscenarioFlashFlashX
Procesamiento por lotes
Cargas sensibles a costo
Chat interactivo
Agentes de codificación
Agentes de navegador
Humano en el bucle
Trabajos automatizados de larga duraciónDepende
API sensible a latencia
Alto volumen de salida
Máxima capacidad de respuesta

¿Cuánto cuesta GLM-5.3-FlashX?

CometAPI lista GLM-5.3-FlashX a $60 por 1M de tokens de entrada y $60 por 1M de tokens de salida. Su tabla comparativa muestra un precio de referencia oficial de $75 por 1M de tokens de entrada y $75 por 1M de tokens de salida. Los precios pueden cambiar, así que confirme la página del modelo en vivo antes de presupuestar.

UsoPrecio en CometAPIPrecio de referencia oficial
Entrada$60 / 1M tokens$75 / 1M tokens
Salida$60 / 1M tokens$75 / 1M tokens

Ejemplo de coste calculado

Para una carga que usa 100M tokens de entrada y 20M tokens de salida, la estimación actual de CometAPI es: 100 × $60 + 20 × $60 = $7,200. A la tasa de referencia oficial, la misma carga es 100 × $75 + 20 × $75 = $9,000.

A estas tarifas mostradas, FlashX debe reservarse para flujos donde la latencia afecta materialmente los ingresos, la experiencia de usuario o el tiempo de finalización de agentes secuenciales. El procesamiento por lotes y los trabajos de alto volumen sensibles a costos deben compararse con la ruta Flash menos costosa.

Los tokens de razonamiento también pueden contribuir al uso facturado de salida, según la política del proveedor; estime el costo a partir de los registros reales de uso en lugar de la longitud visible de la respuesta.

¿Cuáles son los mejores casos de uso para GLM-5.3-FlashX?

Agentes de codificación en tiempo real

Los agentes de codificación generan texto repetidamente, llaman herramientas, inspeccionan resultados, modifican archivos, ejecutan pruebas y hacen bucles. Una generación más rápida reduce el tiempo ocioso entre acciones.

Agentes de uso de navegador y computadora

La entrada multimodal permite que el modelo use capturas de pantalla y el estado de la interfaz en el bucle de razonamiento. La baja latencia es importante porque la automatización del navegador alterna rápidamente entre observar, decidir, actuar y observar de nuevo.

Codificación visual e iteración de interfaces

Un modelo puede inspeccionar interfaces renderizadas, compararlas con requisitos, editar código e inspeccionar el resultado otra vez. Una inferencia más rápida acorta el bucle de retroalimentación visual.

Asistentes empresariales interactivos

Asistentes de cara al cliente, copilotos internos, agentes de investigación y de documentos a menudo tienen a una persona esperando cada turno. Una prima de latencia es más fácil de justificar aquí que en el procesamiento nocturno por lotes.

Trabajo interactivo de contexto largo

La ventana de contexto de 1M tokens es útil para repositorios grandes, informes extensos e historiales prolongados de agentes cuando esos contextos aún requieren interacción sensible.

¿Está GLM-5.3-FlashX disponible en CometAPI?

Sí. GLM-5.3-FlashX está activo en CometAPI. La página del modelo lo lista como disponible a través del endpoint de producción /v1/chat/completions, y el ID de modelo documentado es glm-5.3-flashx. Los desarrolladores pueden usar el mismo patrón de integración compatible con OpenAI que en otros modelos de texto de CometAPI.

Los detalles de acceso, precios, límites y modalidades compatibles pueden cambiar. La página en vivo del modelo en CometAPI es la fuente autorizada para la ruta actual.

Cuándo puede no valer la pena FlashX

  • Trabajos offline o por lotes: cuando nadie está esperando la respuesta, el servicio Flash de menor costo puede ofrecer mejor economía.
  • Generación de alto volumen sensible a costos: el precio por token de FlashX mostrado puede dominar el costo total del flujo incluso cuando los trabajos terminan antes.
  • Tareas limitadas por calidad del modelo en lugar de latencia: FlashX no tiene un conjunto de benchmarks de inteligencia separado, por lo que no debe adquirirse como una mejora de capacidades comprobada.
  • Flujos con cuellos de botella en otro lugar: recuperación, herramientas, navegadores, bases de datos y aprobaciones humanas pueden dominar la latencia de extremo a extremo, reduciendo el valor de una generación más rápida de tokens.
  • Requisitos de auto‑hosting o pesos abiertos: FlashX se presenta como una capa de servicio alojada; use los pesos subyacentes de GLM-5.3-Flash cuando importe el control de despliegue.
  • Garantías estrictas de rendimiento:

¿Cuáles son las limitaciones de GLM-5.3-FlashX?

  • La cifra de 200 tokens/s es una velocidad máxima anunciada, no una tasa sostenida garantizada.
  • El precio reportado es más alto que Flash y varía entre proveedores.
  • Aún no hay un conjunto de benchmarks de inteligencia separado para FlashX.
  • La salida estándar es texto en lugar de generación nativa de imágenes o video.
  • Un límite de 1M tokens no elimina la necesidad de recuperación, selección de contexto y gestión de latencia.
  • Los límites de tasa, límites de salida, modalidades y rendimiento real específicos del proveedor pueden diferir del servicio de Z.ai.

¿Debería usar GLM-5.3-FlashX?

GLM-5.3-FlashX es más convincente cuando GLM-5.3-Flash es suficientemente capaz pero demasiado lento para un flujo interactivo. El lanzamiento cambia la economía de latencia más que la historia de capacidad central.

Elija GLM-5.3-Flash cuando el costo por token domine y se acepte una generación más lenta. Elija FlashX cuando el tiempo de espera humano o la latencia del bucle del agente sea más costoso que la prima de servicio. Considere GLM-5.3 cuando la capa insignia de capacidades importe más que el costo o la latencia.

Para equipos que ya usan un gateway unificado, el siguiente paso práctico es ejecutar la misma carga representativa a través de GLM-5.3-FlashX y GLM-5.3-Flash en CometAPI, y luego comparar la latencia p95, el éxito de tareas y el costo total por flujo de trabajo completado.

Preguntas frecuentes sobre GLM-5.3-FlashX

¿Qué es GLM-5.3-FlashX?

GLM-5.3-FlashX es la opción de servicio de alta velocidad para la base de capacidades GLM-5.3-Flash de Z.ai. Apunta a menor latencia y mayor rendimiento de salida en lugar de un salto anunciado por separado en inteligencia del modelo.

¿GLM-5.3-FlashX es un checkpoint nuevo?

Los materiales públicos de lanzamiento de Z.ai enfatizan la optimización de inferencia e infraestructura. No se han publicado un conteo de parámetros separado, una liberación de pesos ni un conjunto de benchmarks de inteligencia para FlashX.

¿GLM-5.3-FlashX admite entrada multimodal?

La base de capacidades GLM-5.3-Flash subyacente es multimodal. Las modalidades específicas del proveedor y la ruta deben confirmarse antes del despliegue.

¿Los pesos de GLM-5.3-FlashX son de código abierto?

Los pesos subyacentes de GLM-5.3-Flash están disponibles bajo licencia MIT. FlashX se presenta como una opción de servicio alojada de alta velocidad en lugar de un checkpoint de pesos publicado por separado.

¿Hay puntajes de benchmarks separados para GLM-5.3-FlashX?

No se publicó un conjunto de benchmarks de inteligencia separado en el lanzamiento. Los benchmarks actuales de calidad de tareas pertenecen a GLM-5.3-Flash.

Seguir aprendiendo

Conecta este artículo con la siguiente decisión.

Ver todos los temas
Publicado el Sep 20, 2026
Última actualización Sep 20, 2026
1 visitas
Revisado para mayor claridad, atribución de fuentes y terminología API actual.

¿Listo para reducir los costos de desarrollo de IA en un 20%?

Comienza gratis en minutos. Créditos de prueba gratuitos incluidos. No se requiere tarjeta de crédito.

Leer Más