Especificaciones técnicas de Qwen3.8-Flash-Next
| Especificación | Qwen3.8-Flash-Next |
|---|---|
| Desarrollador | Qwen Team, Alibaba Group |
| Tipo de modelo | Modelo de lenguaje causal multimodal con codificador de visión; MoE ultra esparso |
| Parámetros del modelo principal | 125B |
| Parámetros activados | 6B por token |
| Parámetros de embeddings de n-gramas | 51B adicionales |
| Parámetros MTP | 4B |
| Capas | 48 |
| Patrón de atención híbrida | 12 x [3 capas Gated DeltaNet + 1 capa Qwen Sparse Attention] |
| Expertos MoE | 512 en total; 10 enrutados + 1 compartido por token |
| Residual con compuerta | 4 ramas; rango de cuello de botella 320 |
| Ventana de contexto nativa | 262,144 tokens |
| Contexto ampliado | Hasta 1,000,000 tokens con YaRN |
| Modalidades | Entrada de texto, imagen y video; salida de texto |
| Controles de pensamiento | Controles de pensar/no pensar y de esfuerzo de razonamiento en las API compatibles |
| Despliegue | Transformers, vLLM, SGLang, TokenSpeed y otros frameworks compatibles |
| Pesos abiertos | Sí |
| ID de modelo en CometAPI | qwen3.8-flash-next |
¿Qué es Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next es un próximo modelo MoE multimodal con pesos abiertos del equipo Qwen de Alibaba. Más importante aún, se posiciona como una vista previa temprana de la arquitectura destinada a impulsar la futura familia de modelos Qwen4, en lugar de ser simplemente otro checkpoint incremental de Qwen3.8.
Qwen está utilizando este lanzamiento para exponer su dirección arquitectónica de nueva generación al ecosistema de código abierto antes de la llegada de la familia Qwen4. Esto brinda a los desarrolladores de motores de inferencia, proyectos de cuantización, frameworks de serving de modelos y desarrolladores de aplicaciones la oportunidad de prepararse con antelación para los cambios arquitectónicos.
La arquitectura divulgada actualmente introduce dos componentes importantes: una arquitectura híbrida basada en GDN y Qwen Sparse Attention (QSA). GDN se refiere a un enfoque de atención lineal al estilo DeltaNet con compuertas que sigue la dirección de atención híbrida explorada previamente en Qwen3-Next. QSA se presenta como un nuevo mecanismo de atención dispersa, aunque su especificación técnica completa aún no se ha documentado públicamente.
Principales características de Qwen3.8-Flash-Next
- Vista previa de la arquitectura Qwen4: Qwen3.8-Flash-Next se posiciona explícitamente como una implementación temprana de la dirección arquitectónica que impulsará la próxima familia Qwen4.
- Diseño MoE multimodal: El modelo se describe como un Mixture-of-Experts multimodal, extendiendo la estrategia de modelos esparsos eficiente de Qwen hacia una nueva generación de arquitectura.
- Arquitectura híbrida GDN: El modelo continúa la línea de investigación de atención híbrida introducida con Qwen3-Next, combinando mecanismos de atención lineal eficientes con atención convencional donde la recuperación precisa es importante. Qwen3-Next demostró que este enfoque puede mejorar sustancialmente la eficiencia de inferencia en contextos largos.
- Qwen Sparse Attention: QSA es uno de los dos cambios arquitectónicos destacados públicamente para Flash-Next. Su implementación detallada y los beneficios cuantitativos aún deben ser documentados por Qwen.
- Orientación al ecosistema de pesos abiertos: El objetivo del lanzamiento es dar a la comunidad de código abierto acceso temprano a los cambios arquitectónicos para que los entornos de ejecución y las herramientas aguas abajo puedan adaptarse antes de la llegada de Qwen4.
- Rendimiento en programación y agentes de Qwen3.8-Flash-Next
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
Qwen3.8-Flash-Next vs Qwen3.8-Max vs Qwen3.8-27B
| Modelo | Posicionamiento | Arquitectura / escala | Multimodal | Estado actual |
|---|---|---|---|---|
| Qwen3.8-Flash-Next | Vista previa de la arquitectura Qwen4 / modelo abierto orientado a la eficiencia | MoE multimodal; especificaciones completas pendientes | Sí | Próximo |
| Qwen3.8-Max | Modelo insignia alojado de Qwen3.8 | MoE a gran escala | Sí | Disponible |
| Qwen3.8-27B | Modelo de Qwen3.8 con pesos abiertos | Modelo denso | Capacidades específicas del modelo | Disponible |
Qwen3.8-Max ya está disponible a través del ecosistema en la nube de Alibaba y se posiciona para cargas de trabajo de razonamiento avanzado, comprensión visual, programación y agentes. La documentación actual de Qwen lista a Qwen3.8-Max con una ventana de contexto de 1M tokens, mientras que CometAPI ya expone qwen3.8-max.
Por lo tanto, Flash-Next debe verse de manera diferente: su importancia principal en esta etapa es arquitectónica más que basada en benchmarks. Presenta la dirección técnica de Qwen4 y ofrece al ecosistema de código abierto un objetivo adelantado para la optimización de tiempo de ejecución y despliegue.