Qwen3.8-Flash-Next no es simplemente un miembro más pequeño o más rápido de la familia Qwen3.8. Qwen lo describe como un modelo MoE multimodal de pesos abiertos y una vista previa temprana de la arquitectura utilizada en Qwen4. Su diseño cambia al mismo tiempo la atención, las conexiones residuales, la capacidad de embedding y la optimización, con el objetivo de mejorar la capacidad mientras reduce drásticamente la cantidad de cómputo requerido por token.
TL;DR
Qwen3.8-Flash-Next combina un modelo principal de 125B parámetros con una tabla de embedding de N-gramas adicional de 51B, mientras activa solo 6B parámetros por token. Gestiona de forma nativa 262,144 tokens y puede ampliarse a 1,000,000 tokens con YaRN. La arquitectura se basa en una mezcla 3:1 de Gated DeltaNet y Qwen Sparse Attention, conexiones residuales con compuertas de cuatro ramas, N-gram Embedding, un amplio conjunto de expertos MoE ultra-disperso, Multi-Token Prediction y entrenamiento basado en Muon.
El punto más importante es la eficiencia más que el recuento bruto de parámetros. Qwen informa que entrenar el modelo requiere aproximadamente una novena parte del costo de Qwen3.7-Plus, y aun así su evaluación de lanzamiento sitúa al modelo por delante de los anteriores baselines de Qwen en muchas tareas de programación, agentes de oficina y multimodales. Estos son resultados reportados por el proveedor y deben leerse como evidencia de lanzamiento más que como validación independiente.
Para los desarrolladores, los pesos abiertos están disponibles a través de los canales de Qwen, mientras que la versión gestionada de producción se llama Qwen3.8-Flash en QwenCloud. CometAPI lista Qwen3.8-Flash-Next con el ID de modelo qwen3.8-flash-next, ofreciendo a los desarrolladores una ruta unificada junto a otros modelos de frontera.
Puntos clave
- 125B parámetros del modelo principal + 51B de embedding de N-gramas, con 6B parámetros activos por token.
- Un patrón de atención híbrida 3 GDN : 1 QSA diseñado para combinar memoria eficiente con recuperación precisa de largo alcance.
- Contexto nativo de 262,144 tokens y hasta 1M de tokens mediante YaRN.
- Qwen reporta hasta 7.6x en prefill y 4.9x en decode para los kernels a 1M de contexto en QSA.
- El flujo residual se amplía en cuatro ramas con compuertas, mejorando el flujo de información entre capas y la estabilidad del entrenamiento.
- La tabla de lanzamiento oficial muestra resultados sólidos en SWE-bench Pro, CoWorkBench, JobBench, Toolathlon, AndroidWorld y RealWorldQA, pero no un triunfo limpio en todos los benchmarks.
- Qwen presenta el lanzamiento como una vista previa de la arquitectura, por lo que su importancia radica en parte en lo que señala para Qwen4 más que solo en su rango actual en benchmarks.
¿Qué es Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next es un modelo de lenguaje multimodal causal con un codificador de visión y una columna vertebral de lenguaje con Mixture-of-Experts ultra-dispersa. La tarjeta de modelo oficial describe una arquitectura de 48 capas con 512 expertos, 10 expertos enrutados más un experto compartido, y una disposición oculta que repite tres capas Gated DeltaNet seguidas de una capa Qwen Sparse Attention.
El lanzamiento cumple un papel similar al de Qwen3-Next: expone cambios arquitectónicos antes de escalarse a la siguiente familia completa. Qwen califica explícitamente el modelo como una vista previa experimental de la arquitectura que sustentará Qwen4. Eso hace que el modelo resulte especialmente interesante para ingenieros que se preocupan por la eficiencia de servicio, el contexto largo y la dirección de la investigación de arquitectura de modelos abiertos.
4 componentes centrales de Qwen3.8-Flash-Next
El modelo cambia cuatro componentes centrales a la vez: la atención, el flujo residual, la capacidad de embedding y la optimización. Ese codiseño importa porque las ganancias de eficiencia en un componente pueden perderse si otro componente se convierte en el cuello de botella con contextos largos o a gran escala.
Atención híbrida: GDN + Qwen Sparse Attention
La mayoría de las capas no realizan atención global. En su lugar, tres de cada cuatro capas usan Gated DeltaNet para comprimir la información histórica en un estado de tamaño fijo. La cuarta capa usa atención global para recuperación exacta, pero esa atención global se rediseña como Qwen Sparse Attention (QSA).
QSA evita buscar cada token de manera independiente. Un indexador liviano primero agrupa la secuencia en microbloques, estima qué bloques importan y luego atiende solo a regiones seleccionadas. Según la descripción de Qwen, esto reduce tanto el cómputo de la atención como la sobrecarga de indexación necesaria para encontrar el contexto relevante. El diseño es especialmente compatible con una red híbrida porque el índice disperso se construye de forma independiente dentro de cada capa de atención, en lugar de depender de la similitud entre capas de atención adyacentes.
Los números de eficiencia son sustanciales. Con un contexto de 1M tokens, Qwen reporta hasta 7.6x más rápido en prefill y 4.9x más rápido en decode para el kernel de atención QSA. En un experimento de servicio con alta reutilización de caché y una tasa de aciertos del 90% en la caché de prefijo, el modelo completo alcanza 8.6x el rendimiento de prefill de Qwen3.7-Plus a 1M de contexto.
Residual con compuertas: cuatro rutas en lugar de una
Un Transformer convencional lee y escribe repetidamente en un único flujo residual. Qwen3.8-Flash-Next, en cambio, utiliza Gated Residual para ampliar ese flujo en cuatro ramas paralelas. Las compuertas de lectura elemento a elemento deciden cuánta información tomar de cada rama, mientras que las compuertas de escritura a nivel de rama determinan qué se escribe de vuelta.
Se pretende preservar características útiles a lo largo de la profundidad sin forzar cada característica a pasar por el mismo canal continuamente mezclado. Qwen también reporta que la compuerta suprime valores atípicos de activación y que el estado residual puede almacenarse en FP8, reduciendo el tráfico de memoria. La idea clave no es simplemente más capacidad residual; es el encaminamiento controlado de la información a través de las capas.
N-gram Embedding: más capacidad sin cómputo proporcional
El modelo añade 51B parámetros de N-gram Embedding además de los 125B de la columna vertebral principal. A diferencia del embedding ordinario que indexa desde un único token, N-gram Embedding utiliza patrones locales de tokens como bigramas y trigramas. Esto le da al modelo una gran memoria estilo consulta para patrones locales recurrentes.
Lo inusual es dónde reside esa capacidad. Debido a que la dirección de consulta puede conocerse antes de que se necesite el embedding, la tabla puede mantenerse en memoria de host y precargarse de forma asíncrona mientras continúa el cómputo en GPU. Esto significa que los 51B parámetros adicionales no se comportan como 51B parámetros adicionales de multiplicación de matrices densas. La arquitectura está escalando efectivamente dos recursos diferentes: parámetros de modelo intensivos en cómputo y memoria de consulta de bajo cómputo.
Muon y optimización del entrenamiento
Qwen entrena la arquitectura con el optimizador Muon para mapeos lineales bidimensionales, como los pesos principales en atención, GDN y expertos MoE, mientras que los embeddings, el enrutador y los parámetros de baja dimensión del Gated Residual continúan usando AdamW. Las matrices fusionadas, como QKV y las proyecciones SwiGLU, se dividen en sus transformaciones lineales independientes antes de la ortogonalización.
El equipo también reajustó su ley de escalado para la nueva arquitectura e informa que el convencional Batch Size Warmup no fue necesario. Aumentar gradualmente el tamaño de lote no mejoró el resultado final y, en cambio, requirió 18.8% más pasos del optimizador. Por tanto, la receta final comienza directamente en el tamaño de lote objetivo.
MoE ultra-dispersa y predicción multi‑token
La tarjeta de modelo oficial lista 512 expertos con 10 expertos enrutados y un experto compartido activos por token. El gran conjunto de expertos aumenta la capacidad almacenada sin activar todo el modelo para cada token. Un módulo de predicción multi‑token (MTP) de una capa se entrena con múltiples pasos para mejorar la aceptación del decoding especulativo y, a la vez, apoyar a la columna vertebral principal.
Rendimiento en benchmarks de Qwen3.8-Flash-Next
Qwen publica evaluaciones amplias de lenguaje, programación, agentes y visión-lenguaje. Estos números son útiles porque muchos modelos de comparación se volvieron a ejecutar en el entorno de evaluación de Qwen, pero siguen siendo evaluaciones de lanzamiento reportadas por el proveedor, no reproducciones independientes de benchmarks. Varias filas también usan arneses o jueces específicos del benchmark, por lo que la interpretación más segura es direccional: muestran dónde Qwen3.8-Flash-Next es más fuerte y dónde los competidores todavía lideran.
Rendimiento en programación y agentes
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
La historia en programación es sólida pero matizada. Qwen3.8-Flash-Next lidera el conjunto de comparación listado en SWE-bench Pro, SWE-bench Multilingual, CoWorkBench, JobBench, Toolathlon Verified y LiveCodeBench v6. Sin embargo, DeepSeek V4 Flash va por delante en NL2Repo-Bench, mientras que Claude Opus 4.6 lidera HLE. Esto convierte a la eficiencia en el titular más defendible que un dominio universal de benchmarks.
Los avances más notables sobre los baselines anteriores de Qwen aparecen en trabajos de horizonte largo. CoWorkBench sube de 65.1 en Qwen3.7-Plus a 73.9, mientras que JobBench pasa de 27.6 a 55.7. Debido a que CoWorkBench es un benchmark interno de Qwen, esas ganancias merecen replicación independiente, pero se alinean con el enfoque declarado de la arquitectura en agentes y flujos de trabajo de oficina rentables.
Rendimiento multimodal
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | Claude Opus 4.6 |
|---|---|---|---|---|
| ClawEval-MM (Pass@3 / Avg) | 64.4 / 60.4 | 57.4 / 56.9 | 57.4 / 60.1 | 52.5 / 54.7 |
| RecreationBench | 49.9 | 47.1 | 30.2 | -- |
| AndroidWorld | 84.5 | 81.9 | 81.0 | 62.0 |
| OSWorld 2.0 (Binary / Partial) | 19.4 / 52.3 | 19.4 / 48.0 | 2.8 / 21.5 | -- |
| Vision2Web | 64.0 | 62.9 | 42.1 | -- |
| ERQA | 72.3 | 65.5 | 69.8 | 40.8 |
| LVBench | 76.6 | 72.4 | 76.2 | 63.0 |
| RealWorldQA | 88.5 | 85.9 | 86.9 | 73.9 |
| MathVision (without / with CI) | 90.6 / 95.7 | 90.0 / 94.6 | 90.3 / 88.7 | 65.5 / -- |
| CharXiv RQ (without / with CI) | 84.6 / 90.6 | 83.7 / 90.2 | 85.8 / 85.9 | 66.0 / -- |
Fuente de los datos: evaluación de lanzamiento oficial de Qwen**.
Los resultados multimodales apoyan la idea de que no se trata simplemente de un modelo Flash centrado en programación. Qwen3.8-Flash-Next obtiene 84.5 en AndroidWorld, 64.0 en Vision2Web, 76.6 en LVBench y 88.5 en RealWorldQA en la tabla de Qwen. La tarjeta de modelo también proporciona ejemplos de entrada de imágenes y videos, incluidas recomendaciones para muestreo de mayor tasa de cuadros en cargas de trabajo de video de escala de horas. cargas de trabajo de video.
Qwen3.8-Flash-Next frente a otros modelos
Una comparación útil debería separar tres preguntas: cuánta computación se activa por token, cuán amplias son las modalidades y el contexto del modelo, y qué tan bien se desempeña en flujos de trabajo representativos. El recuento total bruto de parámetros por sí solo no responde a esas preguntas.
Qwen3.8-Flash-Next vs Qwen3.8-27B vs Qwen3.7-Plus
| Dimensión | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus |
|---|---|---|---|
| Parámetros del modelo | 125B + 51B embedding de N-gramas | 27B | 397B |
| Parámetros activados | 6B | 27B | 17B |
| Contexto nativo | 262K | 262K en el entorno de comparación de Qwen | Modelo de contexto largo de la generación anterior |
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 |
| CoWorkBench | 73.9 | 70.7 | 65.1 |
| JobBench | 55.7 | 33.4 | 27.6 |
| AndroidWorld | 84.5 | 81.9 | 81.0 |
El resultado clave es la capacidad por parámetro activado. Qwen3.8-Flash-Next activa 6B parámetros por token frente a 27B para Qwen3.8-27B y 17B para Qwen3.7-Plus, y aun así va por delante en los puntajes listados de DeepSWE, CoWorkBench, JobBench y AndroidWorld. La contrapartida es la huella de memoria: la dispersión reduce el cómputo activo, no la cantidad de capacidad del modelo que debe almacenarse finalmente en algún lugar.
Qwen3.8-Flash-Next vs DeepSeek V4 Flash vs Claude Opus 4.6
| Dimensión | Qwen3.8-Flash-Next | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|
| Pesos | Pesos abiertos | Pesos abiertos | Cerrado |
| Perfil de parámetros reportado | 125B principal + 51B N-gram; 6B activos | 284B total; 13B activos | No divulgado públicamente |
| Historia principal de eficiencia | QSA + GDN + MoE de 6B activos + memoria de consulta | MoE disperso de alto rendimiento | Razonamiento gestionado de frontera y pila de agentes |
| Multimodalidad nativa | Texto, imagen, video -> texto | Familia Flash orientada a texto; ruta de visión disponible por separado en CometAPI | Texto + visión/archivos a través de APIs alojadas |
| SWE-bench Pro* | 62.5 | 56.0 | 53.4 |
| CoWorkBench* | 73.9 | 45.1 | 68.2 |
| NL2Repo-Bench* | 48.1 | 54.2 | 47.6 |
| HLE* | 35.9 | 33.8 | 40.0 |
DeepSeek V4 Flash sigue siendo más fuerte en NL2Repo-Bench en la comparación de Qwen, lo cual importa para la generación de código a nivel de repositorio. Claude Opus 4.6 es más fuerte en HLE en la misma tabla y representa un modelo cerrado gestionado en lugar de un objetivo de despliegue abierto. Qwen3.8-Flash-Next se diferencia sobre todo por la combinación de pesos abiertos, multimodalidad nativa, ingeniería de contexto largo y un presupuesto de parámetros activos muy pequeño.
Qwen3.8-Flash-Next vs Qwen3.8-Max
| Dimensión | Qwen3.8-Flash-Next | Qwen3.8-Max |
|---|---|---|
| Rol | Vista previa arquitectónica abierta centrada en la eficiencia | Insignia de Qwen3.8 |
| Escala principal/total | 125B principal + 51B N-gram; 6B activos | 2.4T total; unos 95B activos en la página del modelo de CometAPI |
| Énfasis arquitectónico | QSA, GDN, Gated Residual, N-gram Embedding, Muon | Máxima capacidad de frontera a una escala mucho mayor |
| Mejor encaje | Agentes de alto volumen, asistentes de código, automatización multimodal, autoservicio | Razonamiento más difícil, grandes agentes empresariales, cargas orientadas a capacidad |
| Contexto | 262K nativo; hasta 1M con YaRN | Contexto de clase 1M alojado en las rutas actuales insignia de Qwen3.8 |
Las especificaciones de Qwen3.8-Max se basan en la lista actual del modelo en CometAPI.
La distinción es simple: Qwen3.8-Max es la insignia centrada en la capacidad, mientras que Qwen3.8-Flash-Next es el experimento de arquitectura y eficiencia. Los desarrolladores que elijan entre ellos deberían preguntarse si el cuello de botella es la capacidad absoluta del modelo o el costo de ejecutar muchas tareas de contexto largo con uso de herramientas a escala.
Precios y disponibilidad de Qwen3.8-Flash-Next
Los pesos abiertos de Qwen3.8-Flash-Next se publican a través de Hugging Face y ModelScope. Para el servicio gestionado, Qwen indica que la versión de producción se llama Qwen3.8-Flash en QwenCloud, con 1M de contexto habilitado por defecto y herramientas oficiales integradas.
Qwen lista el precio de producción gestionado en $0.16 por millón de tokens de entrada y $0.47 por millón de tokens de salida. Ese precio se refiere al modelo de producción Qwen3.8-Flash en QwenCloud, no al autoservicio de los pesos abiertos.
| Ruta | Entrada | Salida |
|---|---|---|
| Modelo de producción en QwenCloud (Qwen3.8-Flash) | $0.16 / 1M tokens | $0.47 / 1M tokens |
| Autoservicio de pesos abiertos | Dependiente de la infraestructura | Dependiente de la infraestructura |
| Ruta de CometAPI | Consultar la página del modelo en vivo | Consultar la página del modelo en vivo |
Los precios de QwenCloud provienen del artículo oficial de lanzamiento de Qwen; la facturación de CometAPI debe consultarse en la página del modelo en vivo.
Para usuarios de CometAPI, el modelo dedicado Qwen3.8-Flash-Next identifica la ruta como qwen3.8-flash-next. Debido a que el encaminamiento, la disponibilidad upstream y la facturación pueden cambiar independientemente del lanzamiento de pesos abiertos, las integraciones de producción deberían leer el catálogo en vivo de CometAPI antes de fijar supuestos de precio en el código.
Recomendación de CometAPI
Se espera que Qwen3.8-Flash-Next esté disponible a través de CometAPI pronto. CometAPI ofrece un único endpoint compatible con OpenAI (https://api.cometapi.com/v1) que agrega más de 500 modelos de proveedores líderes, incluidos los de la serie Qwen. Este enfoque reduce el lock-in del proveedor, simplifica la experimentación con Qwen3.8-Flash (una vez disponible en la plataforma o rutas relacionadas de Qwen) y agiliza despliegues de producción que pueden mezclar modelos para distintas tareas (p. ej., Qwen para agentes de código rentables + otro modelo para razonamiento especializado). La documentación y guías rápidas están disponibles en apidoc.cometapi.com y el sitio principal de CometAPI.
Ya sea que autosirvas los pesos abiertos, uses QwenCloud o enrutes a través de una plataforma unificada como CometAPI, Qwen3.8-Flash-Next reduce la barrera para agentes multimodales de alto rendimiento y contexto largo.
¿Qué puede hacer Qwen3.8-Flash-Next?
1. Agentes de programación de alto volumen
Un presupuesto de 6B parámetros activos combinado con un puntaje de 62.5 en SWE-bench Pro en la evaluación de Qwen hace que Qwen3.8-Flash-Next sea especialmente interesante para sistemas de programación que ejecutan muchas sesiones en paralelo. Los ejemplos incluyen revisión de código, triaje de issues, navegación por repositorios, generación de tests y parcheo iterativo donde el rendimiento importa casi tanto como la inteligencia de una sola ejecución.
2. Trabajo de oficina y del conocimiento de horizonte largo
CoWorkBench y JobBench son centrales en el posicionamiento del modelo. La arquitectura está diseñada para bucles de agentes que repiten leer contexto, llamar herramientas, actualizar estado y continuar trabajando en lugar de responder una sola vez. Esto se ajusta de forma natural a flujos de documentos, análisis de hojas de cálculo, ensamblaje de informes, síntesis de investigación y automatización de procesos de negocio.
3. Agentes multimodales para computadora y móvil
Las entradas de imagen y video, el rendimiento en AndroidWorld, la evaluación en OSWorld y los resultados en Vision2Web hacen que el modelo sea relevante para agentes de GUI. Puede servir como la capa de razonamiento detrás de sistemas que interpretan capturas de pantalla, operan interfaces móviles, reproducen diseños de aplicaciones o combinan estado visual con llamadas a herramientas.
4. Video largo y razonamiento visual
La tarjeta de modelo oficial incluye ejemplos explícitos de entrada de video y guía para preprocesamiento de video a escala de horas. Eso hace que el modelo sea útil para preguntas y respuestas sobre video, búsqueda en videos largos, extracción de eventos visuales y flujos que combinan comprensión de video con herramientas downstream.
5. Investigación y flujos de trabajo en repositorios con un millón de tokens
El modelo abierto es nativo a 262,144 tokens y extensible a 1,000,000 con YaRN. Esa distinción importa: 1M es una extensión, no el contexto nativo del modelo abierto. Para repositorios grandes o corpus de investigación, QSA está diseñada para hacer más práctico el costo de recuperación de esos contextos largos que la atención global densa.
¿Cómo pueden los desarrolladores ejecutar Qwen3.8-Flash-Next?
Los desarrolladores pueden descargar los pesos abiertos de Hugging Face y ejecutar el modelo con Transformers, vLLM, SGLang o TokenSpeed. Qwen ofrece ejemplos de Chat Completions compatibles con OpenAI tanto para entrada de texto como multimodal.
Por ejemplo, la tarjeta de modelo oficial demuestra servir Qwen/Qwen3.8-Flash-Next con vLLM y llamarlo a través de /v1/chat/completions. Las entradas de imagen y video también se demuestran mediante la interfaz compatible con OpenAI.
Qwen3.8-Flash-Next opera en modo de pensamiento por defecto. Los desarrolladores pueden controlar el comportamiento de pensamiento mediante enable_thinking, preserve_thinking y reasoning_effort; los niveles de esfuerzo de razonamiento documentados son xhigh, medium y low.
¿Cuáles son las limitaciones de Qwen3.8-Flash-Next?
La mayor limitación práctica es el costo de hardware. Aunque solo se activan 6B parámetros del modelo de lenguaje, el checkpoint contiene 125B parámetros de lenguaje más el componente de embedding de n-gramas de 51B y 4B parámetros de MTP. El repositorio actual es aproximadamente de 360 GB, por lo que el despliegue local sigue siendo una tarea con alta demanda de infraestructura.
La segunda limitación es que 262K es la longitud de contexto nativa, no 1M. El modelo puede ampliarse a 1M tokens, pero una ruta de CometAPI o la página del modelo no deberían simplemente listar "1M de contexto nativo". La redacción correcta es 262K de contexto nativo, extensible a 1M.
Por último, el rendimiento en benchmarks es desigual. Qwen3.8-Flash-Next es altamente competitivo en tareas de programación y agentes, pero no lidera todos los benchmarks. Por ejemplo, Claude Opus 4.6 obtiene 40.0 en HLE frente a 35.9 de Flash-Next, mientras que DeepSeek-V4-Flash-0731 lidera los modelos listados en NL2Repo-Bench.
Qwen3.8-Flash-Next: lo que anticipa para Qwen4
La importancia más amplia de este lanzamiento es su papel como vista previa temprana de la arquitectura que se espera que sustente Qwen4. Qwen3.8-Flash-Next reúne Qwen Sparse Attention, Gated DeltaNet, conexiones residuales con compuertas de cuatro ramas, N-gram Embedding, un conjunto de expertos MoE ultra-disperso y Multi-Token Prediction. Estas elecciones muestran cómo Qwen explora mayor capacidad, contextos más largos y un rendimiento multimodal y de agentes más fuerte sin aumentar la computación activa al mismo ritmo.
Veredicto final
Qwen3.8-Flash-Next es importante porque cambia la forma del problema de la eficiencia. En lugar de tratar todos los parámetros como equivalentes, combina una ruta MoE activa relativamente pequeña con una memoria estilo consulta muy grande y un mecanismo de recuperación dispersa diseñado para contextos largos. Eso le da a Qwen varias palancas independientes para aumentar la capacidad sin incrementar al mismo ritmo la computación de matrices por token.
Para los desarrolladores, esto hace que el modelo sea una opción convincente para asistentes de código de alto volumen, agentes de contexto largo, automatización multimodal y experimentación autoservida. Para la hoja de ruta más amplia de Qwen, es aún más significativo: Qwen usa explícitamente este lanzamiento para exponer la dirección arquitectónica que planea refinar hacia Qwen4.
