TL;DR
GLM-5.3-FlashX es la variante de alta velocidad de servicio de GLM-5.3-Flash de Z.ai. Lanzada el 18 de septiembre de 2026, apunta a velocidades máximas de generación de hasta 200 tokens por segundo —un pico reportado por el proveedor, no un múltiplo garantizado ni verificado de forma independiente—, manteniendo la base de capacidades de GLM-5.3-Flash. GLM-5.3-FlashX ya está disponible en CometAPI a través de un endpoint de chat-completions compatible con OpenAI.
La distinción importante es que FlashX es principalmente una mejora de servicio e inferencia, no un checkpoint de inteligencia documentado por separado. Su base de capacidades es el modelo GLM-5.3-Flash de 320B totales / 18B activos, con entrada multimodal nativa, una ventana de contexto de 1M tokens, atención híbrida dispersa + lineal, uso de herramientas y flujos de trabajo agénticos de largo horizonte.
Los multiplicadores de velocidad y precio reportados son afirmaciones de lanzamiento, no garantías para cada proveedor o solicitud. La evaluación en producción debe comparar el tiempo hasta el primer token, el rendimiento sostenido, la latencia p95, el tiempo de finalización de la tarea y los precios actuales del proveedor.
Última verificación: 20 de septiembre de 2026
Puntos clave
- Velocidad: Z.ai reporta una generación pico de hasta 200 tokens/s; no se declara una medición base oficial ni un multiplicador universal, por lo que los equipos deben hacer su propio benchmark por ruta y carga.
- Base de capacidades: FlashX hereda el diseño MoE de 320B totales / 18B activos, la multimodalidad nativa, la atención híbrida dispersa + lineal y el contexto de 1M de GLM-5.3-Flash.
- Benchmarks: Los puntajes de inteligencia publicados pertenecen a GLM-5.3-Flash; no son ejecuciones de benchmark separadas de FlashX.
- Mejor encaje: Agentes de codificación interactivos, bucles de uso de navegador/PC, codificación visual, asistentes empresariales y otros flujos multi‑paso donde la latencia se acumula.
- Disponibilidad en CometAPI: GLM-5.3-FlashX está activo en CometAPI con el ID de modelo
glm-5.3-flashxy el endpoint/v1/chat/completions.
¿Qué es GLM-5.3-FlashX?
GLM-5.3-FlashX se entiende mejor como una capa de entrega optimizada para latencia de GLM-5.3-Flash. Los mensajes de lanzamiento de Z.ai se centran en una inferencia más rápida y fluida, mientras que el modelo Flash subyacente sigue siendo la base de capacidades. Por lo tanto, FlashX difiere de una nueva generación de modelo, un checkpoint destilado o un conjunto de pesos publicado por separado.
El modelo base GLM-5.3-Flash fue diseñado para una inferencia eficiente. Z.ai afirma que se entrenó desde una nueva base multimodal, usa un corpus multimodal de 30 billones de tokens y combina enrutamiento Mixture-of-Experts con atención híbrida. FlashX lleva más lejos el lado del servicio, sobre la base de la infraestructura de inferencia desarrollada para GLM-5.3-Flash.
Para los desarrolladores, “¿Qué es GLM-5.3-FlashX?” tiene una respuesta práctica: es la opción de servicio de alto rendimiento de GLM-5.3-Flash disponible de Z.ai y ahora también a través de la API unificada de CometAPI. La propuesta de valor es menor latencia de interacción, no un salto recién reclamado en inteligencia del modelo.
Según las declaraciones de lanzamiento de Zhipu informadas por IT Home, GLM-5.3-Flash apareció por primera vez para desarrolladores en el extranjero bajo el nombre anónimo “Ox Alpha” y vio un crecimiento continuo de uso. Para atender esa demanda, Zhipu incrementó la inversión en infraestructura y la optimización de inferencia sobre una base de producción de aproximadamente 100,000 aceleradores domésticos, y luego introdujo FlashX. El servicio mantiene la base de capacidades de GLM-5.3-Flash mientras eleva la salida pico reportada por el proveedor a 200 tokens/s. Zhipu posiciona el lanzamiento en torno a inteligencia, precio y velocidad; para cargas empresariales y de desarrolladores, esto se traduce en una opción de alta capacidad y baja latencia cuyo valor comercial debe validarse con rendimiento sostenido, latencia p95, calidad de tarea y costo bajo concurrencia realista.
Especificaciones de GLM-5.3-FlashX
Dado que FlashX es una variante de servicio de alta velocidad, su hoja de especificaciones debe separar las características heredadas del modelo de las características específicas de servicio de FlashX.
| Especificación | GLM-5.3-FlashX |
|---|---|
| Proveedor | Z.ai / Zhipu AI |
| Posicionamiento del producto | Opción de servicio de alta velocidad para GLM-5.3-Flash |
| Parámetros totales/activos | Aproximadamente 320B / 18B por token, heredados del modelo base |
| Arquitectura | Mixture-of-Experts; atención híbrida dispersa + lineal; mHC |
| Ventana de contexto | Hasta 1,048,576 tokens |
| Entradas/salida | La compatibilidad exacta de modalidades, límites de archivos, restricciones de video y parámetros específicos de la ruta deben verificarse en el endpoint del proveedor antes del despliegue en producción. |
| Razonamiento | Compatible a través del modelo GLM-5.3-Flash subyacente |
| Esfuerzo de razonamiento | low / high / max en rutas compatibles |
| Thinking | Dependiente de la ruta/API |
| Herramientas/llamadas a funciones | Compatible |
| Pesos abiertos | GLM-5.3-Flash subyacente: con licencia MIT; FlashX se presenta como una opción de servicio alojada |
| Velocidad pico reportada | Hasta 200 tokens/s |
| Velocidad relativa reportada | Sin línea base oficial ni multiplicador garantizado; haga benchmark de la ruta del proveedor seleccionada |
| Precio en CometAPI | $60 / 1M tokens de entrada y $60 / 1M tokens de salida, verificado el 20 de septiembre de 2026; vuelva a comprobar el precio en vivo |
| Fecha de lanzamiento | 18 de septiembre de 2026 |
| Clave de modelo de Z.ai | GLM-5.3-FlashX / glm-5.3-flashx |
| ID de modelo en CometAPI | glm-5.3-flashx |
| Endpoint de CometAPI | POST /v1/chat/completions |
¿Por qué GLM-5.3-FlashX es más rápido que GLM-5.3-Flash?
Dos capas de optimización están detrás de la historia de velocidad: la arquitectura eficiente heredada de GLM-5.3-Flash y la infraestructura de servicio optimizada a su alrededor.
Atención híbrida dispersa + lineal
GLM-5.3-Flash combina atención lineal para dependencias locales con atención dispersa para recuperar información relevante del contexto amplio. Z.ai también describe IndexPool, que comprime cuatro vectores de claves indexadoras en caché en uno mediante un agrupamiento ponderado. En la comparación publicada por Z.ai, estos cambios reducen el cómputo de atención aproximadamente 3.0× y el tamaño de la caché KV aproximadamente 4.4× frente a GLM-5.3 en contextos largos.
Sección oficial de arquitectura de GLM-5.3-Flash de Z.ai.
Infraestructura de inferencia
Z.ai afirma que el tráfico de GLM-5.3-Flash en producción se ejecuta en un clúster de más de 100,000 aceleradores de IA fabricados en China. Su stack de servicio incluye paralelismo de tensores, ReplaySSM, cuantización W8A8, cuantización mixta de caché INT8/FP8/BF16, Layer Split, y una arquitectura desagregada Encode–Prefill–Decode. La empresa reporta aproximadamente una mejora 3× de extremo a extremo en servicio respecto a su línea base inicial en el mismo hardware.
Por lo tanto, FlashX debe leerse como la productización de una optimización de inferencia continua: el modelo reduce el cómputo y los costos de caché, mientras que FlashX añade una capa de servicio más agresiva de baja latencia.
¿Qué tan rápido es GLM-5.3-FlashX?
Z.ai reporta una velocidad máxima de generación de hasta 200 tokens/s. Trátelo como una cifra máxima de servicio, no como una tasa sostenida garantizada: valide el tiempo hasta el primer token, la velocidad de salida sostenida, la latencia p95, la finalización de la tarea y la tasa de errores en la ruta de producción.
“Hasta 200 tokens/s” es una cifra pico de servicio, no una garantía para cada solicitud. El rendimiento real depende de la longitud del prompt, el esfuerzo de razonamiento, la longitud de la salida, el preprocesamiento multimodal, la concurrencia, las llamadas a herramientas, la región y la carga del proveedor.
Las métricas útiles en producción incluyen el tiempo hasta el primer token, los tokens de salida por segundo sostenidos, la latencia p95 y el tiempo de finalización de la tarea de extremo a extremo. El tiempo de finalización de la tarea importa especialmente para los agentes porque un flujo de 20 pasos puede pagar el retraso de generación 20 veces.
¿Cómo se desempeña GLM-5.3-FlashX en benchmarks?
No se publicó en el lanzamiento un conjunto de benchmarks de inteligencia específico de FlashX. FlashX se documenta como una optimización de inferencia y servicio, por lo que su diferenciador validado es el rendimiento, no una nueva puntuación de calidad de tarea.
Esos resultados pertenecen al modelo subyacente GLM-5.3-Flash y pueden consultarse solo como contexto de capacidades; no son mediciones de FlashX porque no se reportaron por separado el checkpoint, el arnés de evaluación ni la ejecución de calidad de tareas para FlashX.
Para decisiones de despliegue, pruebe FlashX y Flash con los mismos prompts, esfuerzo de razonamiento y configuración de herramientas, y luego compare el éxito de tareas, el tiempo hasta el primer token, el rendimiento sostenido, la latencia p95 y el costo total por flujo de trabajo completado.
GLM-5.3-FlashX vs GLM-5.3-Flash vs GLM-5.3
| Dimensión | GLM-5.3-FlashX | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|---|
| Posicionamiento | Capa de servicio de alta velocidad | Modelo multimodal con foco en eficiencia | Capa insignia de capacidades |
| Contexto | Hasta 1M | 1M | Clase 1M en rutas compatibles |
| Parámetros totales/activos | Base heredada 320B / 18B | 320B / 18B | Configuración insignia mayor |
| Velocidad de salida pico | Hasta 200 tokens/s reportados | Línea base dependiente del proveedor | Dependiente del proveedor |
| Precio relativo vs Flash | Aproximadamente 2.5× reportado | 1× | Superior a Flash |
| Pesos abiertos | Capa de servicio; los pesos base son abiertos | Sí, MIT | Dependiente del lanzamiento |
| Razonamiento y herramientas | Heredados de Flash; verifique controles por ruta | Compatible | Capa insignia de razonamiento |
| Disponibilidad en CometAPI | Disponible | Disponible | Disponible |
| Mejor encaje | Agentes interactivos de baja latencia | Trabajo multimodal de alto volumen y sensible a costos | Cargas GLM de máxima capacidad |
CometAPI ahora proporciona la API de GLM-5.3-FlashX, junto con la API de GLM-5.3-Flash y la API de GLM-5.3. Esto hace posible comparar latencia, costo y calidad de tareas a través de una sola integración.
Comparación basada en cargas de trabajo
| Escenario | Flash | FlashX |
|---|---|---|
| Procesamiento por lotes | ✓ | |
| Cargas sensibles a costo | ✓ | |
| Chat interactivo | ✓ | |
| Agentes de codificación | ✓ | |
| Agentes de navegador | ✓ | |
| Humano en el bucle | ✓ | |
| Trabajos automatizados de larga duración | ✓ | Depende |
| API sensible a latencia | ✓ | |
| Alto volumen de salida | ✓ | |
| Máxima capacidad de respuesta | ✓ |
¿Cuánto cuesta GLM-5.3-FlashX?
CometAPI lista GLM-5.3-FlashX a $60 por 1M de tokens de entrada y $60 por 1M de tokens de salida. Su tabla comparativa muestra un precio de referencia oficial de $75 por 1M de tokens de entrada y $75 por 1M de tokens de salida. Los precios pueden cambiar, así que confirme la página del modelo en vivo antes de presupuestar.
| Uso | Precio en CometAPI | Precio de referencia oficial |
|---|---|---|
| Entrada | $60 / 1M tokens | $75 / 1M tokens |
| Salida | $60 / 1M tokens | $75 / 1M tokens |
Ejemplo de coste calculado
Para una carga que usa 100M tokens de entrada y 20M tokens de salida, la estimación actual de CometAPI es: 100 × $60 + 20 × $60 = $7,200. A la tasa de referencia oficial, la misma carga es 100 × $75 + 20 × $75 = $9,000.
A estas tarifas mostradas, FlashX debe reservarse para flujos donde la latencia afecta materialmente los ingresos, la experiencia de usuario o el tiempo de finalización de agentes secuenciales. El procesamiento por lotes y los trabajos de alto volumen sensibles a costos deben compararse con la ruta Flash menos costosa.
Los tokens de razonamiento también pueden contribuir al uso facturado de salida, según la política del proveedor; estime el costo a partir de los registros reales de uso en lugar de la longitud visible de la respuesta.
¿Cuáles son los mejores casos de uso para GLM-5.3-FlashX?
Agentes de codificación en tiempo real
Los agentes de codificación generan texto repetidamente, llaman herramientas, inspeccionan resultados, modifican archivos, ejecutan pruebas y hacen bucles. Una generación más rápida reduce el tiempo ocioso entre acciones.
Agentes de uso de navegador y computadora
La entrada multimodal permite que el modelo use capturas de pantalla y el estado de la interfaz en el bucle de razonamiento. La baja latencia es importante porque la automatización del navegador alterna rápidamente entre observar, decidir, actuar y observar de nuevo.
Codificación visual e iteración de interfaces
Un modelo puede inspeccionar interfaces renderizadas, compararlas con requisitos, editar código e inspeccionar el resultado otra vez. Una inferencia más rápida acorta el bucle de retroalimentación visual.
Asistentes empresariales interactivos
Asistentes de cara al cliente, copilotos internos, agentes de investigación y de documentos a menudo tienen a una persona esperando cada turno. Una prima de latencia es más fácil de justificar aquí que en el procesamiento nocturno por lotes.
Trabajo interactivo de contexto largo
La ventana de contexto de 1M tokens es útil para repositorios grandes, informes extensos e historiales prolongados de agentes cuando esos contextos aún requieren interacción sensible.
¿Está GLM-5.3-FlashX disponible en CometAPI?
Sí. GLM-5.3-FlashX está activo en CometAPI. La página del modelo lo lista como disponible a través del endpoint de producción /v1/chat/completions, y el ID de modelo documentado es glm-5.3-flashx. Los desarrolladores pueden usar el mismo patrón de integración compatible con OpenAI que en otros modelos de texto de CometAPI.
Los detalles de acceso, precios, límites y modalidades compatibles pueden cambiar. La página en vivo del modelo en CometAPI es la fuente autorizada para la ruta actual.
Cuándo puede no valer la pena FlashX
- Trabajos offline o por lotes: cuando nadie está esperando la respuesta, el servicio Flash de menor costo puede ofrecer mejor economía.
- Generación de alto volumen sensible a costos: el precio por token de FlashX mostrado puede dominar el costo total del flujo incluso cuando los trabajos terminan antes.
- Tareas limitadas por calidad del modelo en lugar de latencia: FlashX no tiene un conjunto de benchmarks de inteligencia separado, por lo que no debe adquirirse como una mejora de capacidades comprobada.
- Flujos con cuellos de botella en otro lugar: recuperación, herramientas, navegadores, bases de datos y aprobaciones humanas pueden dominar la latencia de extremo a extremo, reduciendo el valor de una generación más rápida de tokens.
- Requisitos de auto‑hosting o pesos abiertos: FlashX se presenta como una capa de servicio alojada; use los pesos subyacentes de GLM-5.3-Flash cuando importe el control de despliegue.
- Garantías estrictas de rendimiento:
¿Cuáles son las limitaciones de GLM-5.3-FlashX?
- La cifra de 200 tokens/s es una velocidad máxima anunciada, no una tasa sostenida garantizada.
- El precio reportado es más alto que Flash y varía entre proveedores.
- Aún no hay un conjunto de benchmarks de inteligencia separado para FlashX.
- La salida estándar es texto en lugar de generación nativa de imágenes o video.
- Un límite de 1M tokens no elimina la necesidad de recuperación, selección de contexto y gestión de latencia.
- Los límites de tasa, límites de salida, modalidades y rendimiento real específicos del proveedor pueden diferir del servicio de Z.ai.
¿Debería usar GLM-5.3-FlashX?
GLM-5.3-FlashX es más convincente cuando GLM-5.3-Flash es suficientemente capaz pero demasiado lento para un flujo interactivo. El lanzamiento cambia la economía de latencia más que la historia de capacidad central.
Elija GLM-5.3-Flash cuando el costo por token domine y se acepte una generación más lenta. Elija FlashX cuando el tiempo de espera humano o la latencia del bucle del agente sea más costoso que la prima de servicio. Considere GLM-5.3 cuando la capa insignia de capacidades importe más que el costo o la latencia.
Para equipos que ya usan un gateway unificado, el siguiente paso práctico es ejecutar la misma carga representativa a través de GLM-5.3-FlashX y GLM-5.3-Flash en CometAPI, y luego comparar la latencia p95, el éxito de tareas y el costo total por flujo de trabajo completado.
Preguntas frecuentes sobre GLM-5.3-FlashX
¿Qué es GLM-5.3-FlashX?
GLM-5.3-FlashX es la opción de servicio de alta velocidad para la base de capacidades GLM-5.3-Flash de Z.ai. Apunta a menor latencia y mayor rendimiento de salida en lugar de un salto anunciado por separado en inteligencia del modelo.
¿GLM-5.3-FlashX es un checkpoint nuevo?
Los materiales públicos de lanzamiento de Z.ai enfatizan la optimización de inferencia e infraestructura. No se han publicado un conteo de parámetros separado, una liberación de pesos ni un conjunto de benchmarks de inteligencia para FlashX.
¿GLM-5.3-FlashX admite entrada multimodal?
La base de capacidades GLM-5.3-Flash subyacente es multimodal. Las modalidades específicas del proveedor y la ruta deben confirmarse antes del despliegue.
¿Los pesos de GLM-5.3-FlashX son de código abierto?
Los pesos subyacentes de GLM-5.3-Flash están disponibles bajo licencia MIT. FlashX se presenta como una opción de servicio alojada de alta velocidad en lugar de un checkpoint de pesos publicado por separado.
¿Hay puntajes de benchmarks separados para GLM-5.3-FlashX?
No se publicó un conjunto de benchmarks de inteligencia separado en el lanzamiento. Los benchmarks actuales de calidad de tareas pertenecen a GLM-5.3-Flash.
