Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →
technology/Investigación de CometAPI

¿Qué es Qwen3.8-Flash-Next?

Explore Qwen3.8-Flash-Next: arquitectura MoE de 125B, 6B parámetros activos, QSA, contexto ampliado de 1M tokens, benchmarks multimodales, características, precios.

CometAPI
Mia MarenEquipo de investigación de modelos de IA y API
Actualizado Aug 29, 2026 19 min de lectura
¿Qué es Qwen3.8-Flash-Next?
Usa este patrón

Haz la primera llamada a la API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Qwen3.8-Flash-Next no es simplemente un miembro más pequeño o más rápido de la familia Qwen3.8. Qwen lo describe como un modelo MoE multimodal de pesos abiertos y una vista previa temprana de la arquitectura utilizada en Qwen4. Su diseño cambia al mismo tiempo la atención, las conexiones residuales, la capacidad de embedding y la optimización, con el objetivo de mejorar la capacidad mientras reduce drásticamente la cantidad de cómputo requerido por token.

TL;DR

Qwen3.8-Flash-Next combina un modelo principal de 125B parámetros con una tabla de embedding de N-gramas adicional de 51B, mientras activa solo 6B parámetros por token. Gestiona de forma nativa 262,144 tokens y puede ampliarse a 1,000,000 tokens con YaRN. La arquitectura se basa en una mezcla 3:1 de Gated DeltaNet y Qwen Sparse Attention, conexiones residuales con compuertas de cuatro ramas, N-gram Embedding, un amplio conjunto de expertos MoE ultra-disperso, Multi-Token Prediction y entrenamiento basado en Muon.

El punto más importante es la eficiencia más que el recuento bruto de parámetros. Qwen informa que entrenar el modelo requiere aproximadamente una novena parte del costo de Qwen3.7-Plus, y aun así su evaluación de lanzamiento sitúa al modelo por delante de los anteriores baselines de Qwen en muchas tareas de programación, agentes de oficina y multimodales. Estos son resultados reportados por el proveedor y deben leerse como evidencia de lanzamiento más que como validación independiente.

Para los desarrolladores, los pesos abiertos están disponibles a través de los canales de Qwen, mientras que la versión gestionada de producción se llama Qwen3.8-Flash en QwenCloud. CometAPI lista Qwen3.8-Flash-Next con el ID de modelo qwen3.8-flash-next, ofreciendo a los desarrolladores una ruta unificada junto a otros modelos de frontera.

Puntos clave

¿Qué es Qwen3.8-Flash-Next?

Qwen3.8-Flash-Next es un modelo de lenguaje multimodal causal con un codificador de visión y una columna vertebral de lenguaje con Mixture-of-Experts ultra-dispersa. La tarjeta de modelo oficial describe una arquitectura de 48 capas con 512 expertos, 10 expertos enrutados más un experto compartido, y una disposición oculta que repite tres capas Gated DeltaNet seguidas de una capa Qwen Sparse Attention.

El lanzamiento cumple un papel similar al de Qwen3-Next: expone cambios arquitectónicos antes de escalarse a la siguiente familia completa. Qwen califica explícitamente el modelo como una vista previa experimental de la arquitectura que sustentará Qwen4. Eso hace que el modelo resulte especialmente interesante para ingenieros que se preocupan por la eficiencia de servicio, el contexto largo y la dirección de la investigación de arquitectura de modelos abiertos.

4 componentes centrales de Qwen3.8-Flash-Next

El modelo cambia cuatro componentes centrales a la vez: la atención, el flujo residual, la capacidad de embedding y la optimización. Ese codiseño importa porque las ganancias de eficiencia en un componente pueden perderse si otro componente se convierte en el cuello de botella con contextos largos o a gran escala.

Atención híbrida: GDN + Qwen Sparse Attention

La mayoría de las capas no realizan atención global. En su lugar, tres de cada cuatro capas usan Gated DeltaNet para comprimir la información histórica en un estado de tamaño fijo. La cuarta capa usa atención global para recuperación exacta, pero esa atención global se rediseña como Qwen Sparse Attention (QSA).

QSA evita buscar cada token de manera independiente. Un indexador liviano primero agrupa la secuencia en microbloques, estima qué bloques importan y luego atiende solo a regiones seleccionadas. Según la descripción de Qwen, esto reduce tanto el cómputo de la atención como la sobrecarga de indexación necesaria para encontrar el contexto relevante. El diseño es especialmente compatible con una red híbrida porque el índice disperso se construye de forma independiente dentro de cada capa de atención, en lugar de depender de la similitud entre capas de atención adyacentes.

Los números de eficiencia son sustanciales. Con un contexto de 1M tokens, Qwen reporta hasta 7.6x más rápido en prefill y 4.9x más rápido en decode para el kernel de atención QSA. En un experimento de servicio con alta reutilización de caché y una tasa de aciertos del 90% en la caché de prefijo, el modelo completo alcanza 8.6x el rendimiento de prefill de Qwen3.7-Plus a 1M de contexto.

Residual con compuertas: cuatro rutas en lugar de una

Un Transformer convencional lee y escribe repetidamente en un único flujo residual. Qwen3.8-Flash-Next, en cambio, utiliza Gated Residual para ampliar ese flujo en cuatro ramas paralelas. Las compuertas de lectura elemento a elemento deciden cuánta información tomar de cada rama, mientras que las compuertas de escritura a nivel de rama determinan qué se escribe de vuelta.

Se pretende preservar características útiles a lo largo de la profundidad sin forzar cada característica a pasar por el mismo canal continuamente mezclado. Qwen también reporta que la compuerta suprime valores atípicos de activación y que el estado residual puede almacenarse en FP8, reduciendo el tráfico de memoria. La idea clave no es simplemente más capacidad residual; es el encaminamiento controlado de la información a través de las capas.

N-gram Embedding: más capacidad sin cómputo proporcional

El modelo añade 51B parámetros de N-gram Embedding además de los 125B de la columna vertebral principal. A diferencia del embedding ordinario que indexa desde un único token, N-gram Embedding utiliza patrones locales de tokens como bigramas y trigramas. Esto le da al modelo una gran memoria estilo consulta para patrones locales recurrentes.

Lo inusual es dónde reside esa capacidad. Debido a que la dirección de consulta puede conocerse antes de que se necesite el embedding, la tabla puede mantenerse en memoria de host y precargarse de forma asíncrona mientras continúa el cómputo en GPU. Esto significa que los 51B parámetros adicionales no se comportan como 51B parámetros adicionales de multiplicación de matrices densas. La arquitectura está escalando efectivamente dos recursos diferentes: parámetros de modelo intensivos en cómputo y memoria de consulta de bajo cómputo.

Muon y optimización del entrenamiento

Qwen entrena la arquitectura con el optimizador Muon para mapeos lineales bidimensionales, como los pesos principales en atención, GDN y expertos MoE, mientras que los embeddings, el enrutador y los parámetros de baja dimensión del Gated Residual continúan usando AdamW. Las matrices fusionadas, como QKV y las proyecciones SwiGLU, se dividen en sus transformaciones lineales independientes antes de la ortogonalización.

El equipo también reajustó su ley de escalado para la nueva arquitectura e informa que el convencional Batch Size Warmup no fue necesario. Aumentar gradualmente el tamaño de lote no mejoró el resultado final y, en cambio, requirió 18.8% más pasos del optimizador. Por tanto, la receta final comienza directamente en el tamaño de lote objetivo.

MoE ultra-dispersa y predicción multi‑token

La tarjeta de modelo oficial lista 512 expertos con 10 expertos enrutados y un experto compartido activos por token. El gran conjunto de expertos aumenta la capacidad almacenada sin activar todo el modelo para cada token. Un módulo de predicción multi‑token (MTP) de una capa se entrena con múltiples pasos para mejorar la aceptación del decoding especulativo y, a la vez, apoyar a la columna vertebral principal.

Rendimiento en benchmarks de Qwen3.8-Flash-Next

Qwen publica evaluaciones amplias de lenguaje, programación, agentes y visión-lenguaje. Estos números son útiles porque muchos modelos de comparación se volvieron a ejecutar en el entorno de evaluación de Qwen, pero siguen siendo evaluaciones de lanzamiento reportadas por el proveedor, no reproducciones independientes de benchmarks. Varias filas también usan arneses o jueces específicos del benchmark, por lo que la interpretación más segura es direccional: muestran dónde Qwen3.8-Flash-Next es más fuerte y dónde los competidores todavía lideran.

Rendimiento en programación y agentes

BenchmarkQwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusDeepSeek V4 FlashClaude Opus 4.6
DeepSWE 1.158.742.216.554.4--
SWE-bench Pro62.561.755.856.053.4
SWE-bench Multilingual81.073.875.8--77.5
NL2Repo-Bench48.142.341.154.247.6
CoWorkBench73.970.765.145.168.2
JobBench55.733.427.641.336.6
Toolathlon Verified73.567.150.670.3--
IFBench81.379.579.179.262.5
GPQA Diamond91.789.290.390.891.3
HLE35.930.834.733.840.0
LiveCodeBench v691.990.389.690.688.8

La historia en programación es sólida pero matizada. Qwen3.8-Flash-Next lidera el conjunto de comparación listado en SWE-bench Pro, SWE-bench Multilingual, CoWorkBench, JobBench, Toolathlon Verified y LiveCodeBench v6. Sin embargo, DeepSeek V4 Flash va por delante en NL2Repo-Bench, mientras que Claude Opus 4.6 lidera HLE. Esto convierte a la eficiencia en el titular más defendible que un dominio universal de benchmarks.

Los avances más notables sobre los baselines anteriores de Qwen aparecen en trabajos de horizonte largo. CoWorkBench sube de 65.1 en Qwen3.7-Plus a 73.9, mientras que JobBench pasa de 27.6 a 55.7. Debido a que CoWorkBench es un benchmark interno de Qwen, esas ganancias merecen replicación independiente, pero se alinean con el enfoque declarado de la arquitectura en agentes y flujos de trabajo de oficina rentables.

Rendimiento multimodal

BenchmarkQwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusClaude Opus 4.6
ClawEval-MM (Pass@3 / Avg)64.4 / 60.457.4 / 56.957.4 / 60.152.5 / 54.7
RecreationBench49.947.130.2--
AndroidWorld84.581.981.062.0
OSWorld 2.0 (Binary / Partial)19.4 / 52.319.4 / 48.02.8 / 21.5--
Vision2Web64.062.942.1--
ERQA72.365.569.840.8
LVBench76.672.476.263.0
RealWorldQA88.585.986.973.9
MathVision (without / with CI)90.6 / 95.790.0 / 94.690.3 / 88.765.5 / --
CharXiv RQ (without / with CI)84.6 / 90.683.7 / 90.285.8 / 85.966.0 / --

Fuente de los datos: evaluación de lanzamiento oficial de Qwen**.

Los resultados multimodales apoyan la idea de que no se trata simplemente de un modelo Flash centrado en programación. Qwen3.8-Flash-Next obtiene 84.5 en AndroidWorld, 64.0 en Vision2Web, 76.6 en LVBench y 88.5 en RealWorldQA en la tabla de Qwen. La tarjeta de modelo también proporciona ejemplos de entrada de imágenes y videos, incluidas recomendaciones para muestreo de mayor tasa de cuadros en cargas de trabajo de video de escala de horas. cargas de trabajo de video.

Qwen3.8-Flash-Next frente a otros modelos

Una comparación útil debería separar tres preguntas: cuánta computación se activa por token, cuán amplias son las modalidades y el contexto del modelo, y qué tan bien se desempeña en flujos de trabajo representativos. El recuento total bruto de parámetros por sí solo no responde a esas preguntas.

Qwen3.8-Flash-Next vs Qwen3.8-27B vs Qwen3.7-Plus

DimensiónQwen3.8-Flash-NextQwen3.8-27BQwen3.7-Plus
Parámetros del modelo125B + 51B embedding de N-gramas27B397B
Parámetros activados6B27B17B
Contexto nativo262K262K en el entorno de comparación de QwenModelo de contexto largo de la generación anterior
DeepSWE 1.158.742.216.5
CoWorkBench73.970.765.1
JobBench55.733.427.6
AndroidWorld84.581.981.0

El resultado clave es la capacidad por parámetro activado. Qwen3.8-Flash-Next activa 6B parámetros por token frente a 27B para Qwen3.8-27B y 17B para Qwen3.7-Plus, y aun así va por delante en los puntajes listados de DeepSWE, CoWorkBench, JobBench y AndroidWorld. La contrapartida es la huella de memoria: la dispersión reduce el cómputo activo, no la cantidad de capacidad del modelo que debe almacenarse finalmente en algún lugar.

Qwen3.8-Flash-Next vs DeepSeek V4 Flash vs Claude Opus 4.6

DimensiónQwen3.8-Flash-NextDeepSeek V4 FlashClaude Opus 4.6
PesosPesos abiertosPesos abiertosCerrado
Perfil de parámetros reportado125B principal + 51B N-gram; 6B activos284B total; 13B activosNo divulgado públicamente
Historia principal de eficienciaQSA + GDN + MoE de 6B activos + memoria de consultaMoE disperso de alto rendimientoRazonamiento gestionado de frontera y pila de agentes
Multimodalidad nativaTexto, imagen, video -> textoFamilia Flash orientada a texto; ruta de visión disponible por separado en CometAPITexto + visión/archivos a través de APIs alojadas
SWE-bench Pro*62.556.053.4
CoWorkBench*73.945.168.2
NL2Repo-Bench*48.154.247.6
HLE*35.933.840.0

DeepSeek V4 Flash sigue siendo más fuerte en NL2Repo-Bench en la comparación de Qwen, lo cual importa para la generación de código a nivel de repositorio. Claude Opus 4.6 es más fuerte en HLE en la misma tabla y representa un modelo cerrado gestionado en lugar de un objetivo de despliegue abierto. Qwen3.8-Flash-Next se diferencia sobre todo por la combinación de pesos abiertos, multimodalidad nativa, ingeniería de contexto largo y un presupuesto de parámetros activos muy pequeño.

Qwen3.8-Flash-Next vs Qwen3.8-Max

DimensiónQwen3.8-Flash-NextQwen3.8-Max
RolVista previa arquitectónica abierta centrada en la eficienciaInsignia de Qwen3.8
Escala principal/total125B principal + 51B N-gram; 6B activos2.4T total; unos 95B activos en la página del modelo de CometAPI
Énfasis arquitectónicoQSA, GDN, Gated Residual, N-gram Embedding, MuonMáxima capacidad de frontera a una escala mucho mayor
Mejor encajeAgentes de alto volumen, asistentes de código, automatización multimodal, autoservicioRazonamiento más difícil, grandes agentes empresariales, cargas orientadas a capacidad
Contexto262K nativo; hasta 1M con YaRNContexto de clase 1M alojado en las rutas actuales insignia de Qwen3.8

Las especificaciones de Qwen3.8-Max se basan en la lista actual del modelo en CometAPI.

La distinción es simple: Qwen3.8-Max es la insignia centrada en la capacidad, mientras que Qwen3.8-Flash-Next es el experimento de arquitectura y eficiencia. Los desarrolladores que elijan entre ellos deberían preguntarse si el cuello de botella es la capacidad absoluta del modelo o el costo de ejecutar muchas tareas de contexto largo con uso de herramientas a escala.

Precios y disponibilidad de Qwen3.8-Flash-Next

Los pesos abiertos de Qwen3.8-Flash-Next se publican a través de Hugging Face y ModelScope. Para el servicio gestionado, Qwen indica que la versión de producción se llama Qwen3.8-Flash en QwenCloud, con 1M de contexto habilitado por defecto y herramientas oficiales integradas.

Qwen lista el precio de producción gestionado en $0.16 por millón de tokens de entrada y $0.47 por millón de tokens de salida. Ese precio se refiere al modelo de producción Qwen3.8-Flash en QwenCloud, no al autoservicio de los pesos abiertos.

RutaEntradaSalida
Modelo de producción en QwenCloud (Qwen3.8-Flash)$0.16 / 1M tokens$0.47 / 1M tokens
Autoservicio de pesos abiertosDependiente de la infraestructuraDependiente de la infraestructura
Ruta de CometAPIConsultar la página del modelo en vivoConsultar la página del modelo en vivo

Los precios de QwenCloud provienen del artículo oficial de lanzamiento de Qwen; la facturación de CometAPI debe consultarse en la página del modelo en vivo.

Para usuarios de CometAPI, el modelo dedicado Qwen3.8-Flash-Next identifica la ruta como qwen3.8-flash-next. Debido a que el encaminamiento, la disponibilidad upstream y la facturación pueden cambiar independientemente del lanzamiento de pesos abiertos, las integraciones de producción deberían leer el catálogo en vivo de CometAPI antes de fijar supuestos de precio en el código.

Recomendación de CometAPI

Se espera que Qwen3.8-Flash-Next esté disponible a través de CometAPI pronto. CometAPI ofrece un único endpoint compatible con OpenAI (https://api.cometapi.com/v1) que agrega más de 500 modelos de proveedores líderes, incluidos los de la serie Qwen. Este enfoque reduce el lock-in del proveedor, simplifica la experimentación con Qwen3.8-Flash (una vez disponible en la plataforma o rutas relacionadas de Qwen) y agiliza despliegues de producción que pueden mezclar modelos para distintas tareas (p. ej., Qwen para agentes de código rentables + otro modelo para razonamiento especializado). La documentación y guías rápidas están disponibles en apidoc.cometapi.com y el sitio principal de CometAPI.

Ya sea que autosirvas los pesos abiertos, uses QwenCloud o enrutes a través de una plataforma unificada como CometAPI, Qwen3.8-Flash-Next reduce la barrera para agentes multimodales de alto rendimiento y contexto largo.

¿Qué puede hacer Qwen3.8-Flash-Next?

1. Agentes de programación de alto volumen

Un presupuesto de 6B parámetros activos combinado con un puntaje de 62.5 en SWE-bench Pro en la evaluación de Qwen hace que Qwen3.8-Flash-Next sea especialmente interesante para sistemas de programación que ejecutan muchas sesiones en paralelo. Los ejemplos incluyen revisión de código, triaje de issues, navegación por repositorios, generación de tests y parcheo iterativo donde el rendimiento importa casi tanto como la inteligencia de una sola ejecución.

2. Trabajo de oficina y del conocimiento de horizonte largo

CoWorkBench y JobBench son centrales en el posicionamiento del modelo. La arquitectura está diseñada para bucles de agentes que repiten leer contexto, llamar herramientas, actualizar estado y continuar trabajando en lugar de responder una sola vez. Esto se ajusta de forma natural a flujos de documentos, análisis de hojas de cálculo, ensamblaje de informes, síntesis de investigación y automatización de procesos de negocio.

3. Agentes multimodales para computadora y móvil

Las entradas de imagen y video, el rendimiento en AndroidWorld, la evaluación en OSWorld y los resultados en Vision2Web hacen que el modelo sea relevante para agentes de GUI. Puede servir como la capa de razonamiento detrás de sistemas que interpretan capturas de pantalla, operan interfaces móviles, reproducen diseños de aplicaciones o combinan estado visual con llamadas a herramientas.

4. Video largo y razonamiento visual

La tarjeta de modelo oficial incluye ejemplos explícitos de entrada de video y guía para preprocesamiento de video a escala de horas. Eso hace que el modelo sea útil para preguntas y respuestas sobre video, búsqueda en videos largos, extracción de eventos visuales y flujos que combinan comprensión de video con herramientas downstream.

5. Investigación y flujos de trabajo en repositorios con un millón de tokens

El modelo abierto es nativo a 262,144 tokens y extensible a 1,000,000 con YaRN. Esa distinción importa: 1M es una extensión, no el contexto nativo del modelo abierto. Para repositorios grandes o corpus de investigación, QSA está diseñada para hacer más práctico el costo de recuperación de esos contextos largos que la atención global densa.

¿Cómo pueden los desarrolladores ejecutar Qwen3.8-Flash-Next?

Los desarrolladores pueden descargar los pesos abiertos de Hugging Face y ejecutar el modelo con Transformers, vLLM, SGLang o TokenSpeed. Qwen ofrece ejemplos de Chat Completions compatibles con OpenAI tanto para entrada de texto como multimodal.

Por ejemplo, la tarjeta de modelo oficial demuestra servir Qwen/Qwen3.8-Flash-Next con vLLM y llamarlo a través de /v1/chat/completions. Las entradas de imagen y video también se demuestran mediante la interfaz compatible con OpenAI.

Qwen3.8-Flash-Next opera en modo de pensamiento por defecto. Los desarrolladores pueden controlar el comportamiento de pensamiento mediante enable_thinking, preserve_thinking y reasoning_effort; los niveles de esfuerzo de razonamiento documentados son xhigh, medium y low.

¿Cuáles son las limitaciones de Qwen3.8-Flash-Next?

La mayor limitación práctica es el costo de hardware. Aunque solo se activan 6B parámetros del modelo de lenguaje, el checkpoint contiene 125B parámetros de lenguaje más el componente de embedding de n-gramas de 51B y 4B parámetros de MTP. El repositorio actual es aproximadamente de 360 GB, por lo que el despliegue local sigue siendo una tarea con alta demanda de infraestructura.

La segunda limitación es que 262K es la longitud de contexto nativa, no 1M. El modelo puede ampliarse a 1M tokens, pero una ruta de CometAPI o la página del modelo no deberían simplemente listar "1M de contexto nativo". La redacción correcta es 262K de contexto nativo, extensible a 1M.

Por último, el rendimiento en benchmarks es desigual. Qwen3.8-Flash-Next es altamente competitivo en tareas de programación y agentes, pero no lidera todos los benchmarks. Por ejemplo, Claude Opus 4.6 obtiene 40.0 en HLE frente a 35.9 de Flash-Next, mientras que DeepSeek-V4-Flash-0731 lidera los modelos listados en NL2Repo-Bench.

Qwen3.8-Flash-Next: lo que anticipa para Qwen4

La importancia más amplia de este lanzamiento es su papel como vista previa temprana de la arquitectura que se espera que sustente Qwen4. Qwen3.8-Flash-Next reúne Qwen Sparse Attention, Gated DeltaNet, conexiones residuales con compuertas de cuatro ramas, N-gram Embedding, un conjunto de expertos MoE ultra-disperso y Multi-Token Prediction. Estas elecciones muestran cómo Qwen explora mayor capacidad, contextos más largos y un rendimiento multimodal y de agentes más fuerte sin aumentar la computación activa al mismo ritmo.

Veredicto final

Qwen3.8-Flash-Next es importante porque cambia la forma del problema de la eficiencia. En lugar de tratar todos los parámetros como equivalentes, combina una ruta MoE activa relativamente pequeña con una memoria estilo consulta muy grande y un mecanismo de recuperación dispersa diseñado para contextos largos. Eso le da a Qwen varias palancas independientes para aumentar la capacidad sin incrementar al mismo ritmo la computación de matrices por token.

Para los desarrolladores, esto hace que el modelo sea una opción convincente para asistentes de código de alto volumen, agentes de contexto largo, automatización multimodal y experimentación autoservida. Para la hoja de ruta más amplia de Qwen, es aún más significativo: Qwen usa explícitamente este lanzamiento para exponer la dirección arquitectónica que planea refinar hacia Qwen4.

Seguir aprendiendo

Conecta este artículo con la siguiente decisión.

Ver todos los temas
Publicado el Aug 28, 2026
Última actualización Aug 29, 2026
15 visitas
Revisado para mayor claridad, atribución de fuentes y terminología API actual.

¿Listo para reducir los costos de desarrollo de IA en un 20%?

Comienza gratis en minutos. Créditos de prueba gratuitos incluidos. No se requiere tarjeta de crédito.

Leer Más