TL;DR
Qwen3.8-Omni-Flash es el modelo nativo omnimodal de Alibaba Qwen para comprensión de texto, imagen, audio y video, con texto como modalidad de salida. Anunciado el 18 de septiembre de 2026, combina una ventana de contexto de 1M tokens, razonamiento nativo sobre audio y video, pensamiento ajustable, llamadas a funciones, búsqueda web, comprensión de audio espacial y uso de herramientas.
El cambio más importante no es simplemente una mejor comprensión de video. Qwen describe el modelo como su primer modelo omnimodal construido alrededor de capacidades agénticas: puede entender lo que ve y oye, planear qué hacer después, invocar herramientas y trabajar en tareas más largas como edición de vlogs, traducción de video, producción de resúmenes de películas, análisis de reuniones e investigación multimedia.
En el lanzamiento, Qwen reportó una mejora promedio de más del 25% en 29 evaluaciones respecto a Qwen3.5-Omni-Plus. Estos son resultados de lanzamiento informados por el proveedor, no evaluaciones independientes.
Puntos clave
- Entrada omnimodal nativa: Qwen3.8-Omni-Flash acepta texto, imagen, audio y video, mientras que actualmente devuelve texto.
- Flujos de trabajo de medios agénticos: puede combinar comprensión de medios con planificación, llamadas a funciones y búsqueda web.
- Contexto largo y profundidad de audio: el modelo alojado ofrece una ventana de contexto de 1M tokens y admite audio multilingüe, estéreo y ambisónico de primer orden.
- Ganancias en benchmarks informadas por el proveedor: las mayores mejoras aparecen en agentes multimodales, comprensión de audio largo, diarización de locutores y grounding de audio.
- Disponibilidad alojada: el modelo está disponible a través de APIs alojadas; Qwen-MM-Plugins es de código abierto por separado para flujos de trabajo de agentes multimodales.
Los desarrolladores pueden acceder a la API de Qwen3.8-Omni-Flash en CometAPI mediante un flujo de trabajo API unificado.
¿Qué es Qwen3.8-Omni-Flash?
Qwen3.8-Omni-Flash es la próxima generación de modelos nativos omnimodales de Qwen. En lugar de tratar audio o video solo como artefactos de preprocesamiento, razona sobre texto, cuadros visuales, voz, sonido ambiental y relaciones temporales dentro de un mismo flujo. Sus entradas admitidas son texto, imágenes, audio y video; su salida actual es texto.
Esa distinción de salida importa. La documentación oficial de Alibaba Cloud posiciona Qwen3.8-Omni-Flash para comprensión multimodal y ejecución de agentes, mientras que los casos de uso con salida de voz siguen estando mejor alineados con variantes Omni de Qwen que admiten explícitamente generación de audio.
El marco del lanzamiento pasa de “percibir los medios” a “entender, planificar, ejecutar y entregar”. Eso hace que el modelo sea relevante para edición de video, investigación multimedia, análisis de reuniones, procesamiento de videos instructivos y otros flujos donde el modelo debe hacer algo con los medios en lugar de simplemente resumirlos.
Especificaciones de Qwen3.8-Omni-Flash
La tabla de especificaciones a continuación se basa en las páginas oficiales del modelo en Alibaba Cloud y QwenCloud; los límites y precios pueden variar por región y deben volverse a verificar antes de su publicación o despliegue.
| Especificación | Qwen3.8-Omni-Flash — página oficial del modelo |
|---|---|
| Desarrollador | Alibaba Qwen |
| Lanzamiento | 18 de septiembre de 2026 |
| Tipo de modelo | Modelo nativo omnimodal |
| Entrada / salida | Texto, imagen, audio, video / texto |
| Ventana de contexto | 1,000,000 tokens |
| Entrada máxima | 991,808 tokens normal; 983,616 tokens en modo de pensamiento |
| Salida máxima | 131,072 tokens |
| Asignación máx. de razonamiento | Hasta 262K tokens en QwenCloud |
| Pensamiento | Habilitado por defecto; esfuerzo de razonamiento configurable |
| Herramientas y caché | Llamadas a funciones, búsqueda web, caché implícita y caché de sesión |
| Audio | 113 idiomas y dialectos; estéreo y FOA de cuatro canales |
| Estilos de API | Chat Completions and Responses |
| Precio en QwenCloud | $0.15 entrada, $0.47 salida y $0.016 entrada de caché implícita por 1M tokens |
| Pesos abiertos | No anunciados para este modelo en el lanzamiento |
¿Cómo funciona Qwen3.8-Omni-Flash?
QwenCloud afirma que Qwen3.8-Omni-Flash se basa en la arquitectura Qwen3.8-Flash-Next. Eso aporta contexto arquitectónico, pero los recuentos de parámetros publicados para Flash-Next no deben presentarse automáticamente como la especificación exacta de parámetros del modelo Omni a menos que Qwen confirme ese mapeo.
Gated DeltaNet + Qwen Sparse Attention
La base de Flash-Next combina Gated DeltaNet con Qwen Sparse Attention. En términos simplificados, el componente recurrente comprime la información histórica en un estado compacto, mientras que la atención dispersa recupera contexto de largo alcance seleccionado en lugar de aplicar atención densa completa a cada par de tokens. Esto es especialmente relevante para secuencias de audio y video largas, donde la longitud de secuencia puede dominar el costo computacional.
Percepción agéntica en lugar de percepción estática
El cambio más grande es a nivel de sistema. Qwen dice que el modelo puede explorar activamente videos largos y centrarse en momentos relevantes en lugar de gastar el mismo cómputo en cada segmento. Conceptualmente, el agente identifica dónde es probable que esté la evidencia, inspecciona esos momentos más profundamente, razona sobre ellos y luego decide qué herramienta u operación debería ocurrir a continuación.
¿Cuáles son las principales funciones de Qwen3.8-Omni-Flash?
Razonamiento audiovisual nativo
Qwen3.8-Omni-Flash razona conjuntamente sobre los flujos visual y de audio de un video. Eso importa cuando la respuesta depende de ambas modalidades: identificar quién dijo algo, decidir si un sonido ocurrió antes o después de una acción, interpretar música o audio ambiental, o conectar instrucciones habladas con lo que aparece en pantalla.
Comprensión multihablante y de audio espacial
La API admite audio multicanal, incluyendo estéreo de dos canales y ambisónico de primer orden de cuatro canales. Preservar la información direccional puede ayudar en análisis de reuniones, agentes encarnados, eventos grabados, entornos con múltiples hablantes y grounding de audio.
Esfuerzo de razonamiento ajustable
El pensamiento está habilitado por defecto. Los desarrolladores pueden configurar el esfuerzo de razonamiento para equilibrar latencia y consumo de tokens frente a un razonamiento más profundo en tareas multimedia complejas.
Llamadas a funciones y búsqueda web
Las llamadas a funciones y la búsqueda web son centrales para el posicionamiento agéntico. Tras entender un video, imagen o archivo de audio, el modelo puede pasar argumentos estructurados a una herramienta externa, recuperar información adicional o continuar un flujo de trabajo fuera del modelo.
Qwen-MM-Plugins
Qwen también publicó Qwen-MM-Plugins, un conjunto de herramientas Apache-2.0 para arneses de agentes nativamente multimodales. Sus flujos incluyen producción de video, conversión de video a notas, aprendizaje de habilidades reutilizables a partir de videos de demostración y memoria audiovisual.
¿Qué tan bueno es Qwen3.8-Omni-Flash en benchmarks?
¿Sigue siendo bueno Qwen3.8-Omni-Flash en texto y programación?
Los resultados del lanzamiento de Qwen indican que el modelo Omni se mantiene cerca del modelo de texto Flash relacionado en varias evaluaciones de programación y razonamiento. Qwen reporta 92.6 en LiveCodeBench v6, 63.3 en SWE-bench Pro y 91.0 en GPQA Diamond. Son resultados informados por el proveedor bajo la configuración de lanzamiento de Qwen y deben validarse contra las tareas de programación y el arnés de agente usados en producción.
Qwen reporta más de un 25% de mejora promedio en 29 evaluaciones en comparación con Qwen3.5-Omni-Plus. Las siguientes tablas resumen los resultados oficiales de lanzamiento en benchmarks. Son resultados de primera parte y aún no se habían reproducido de forma independiente al momento de la publicación.
Condiciones de evaluación: Las filas estáticas miden una sola ejecución del modelo bajo la configuración de lanzamiento de Qwen. Las filas etiquetadas “+ agente” incluyen un arnés de agente circundante, recuperación o inspección iterativa de medios. Los materiales oficiales de lanzamiento deben consultarse para plantillas de prompts, ajustes de muestreo, preprocesamiento de medios y versiones del arnés; cuando esos detalles no se divulgan, el resultado debe tratarse como informado por el proveedor en lugar de reproducible de forma independiente.
La mayor relevancia es el cambio de comprensión multimodal a ejecución multimodal. Los flujos anteriores a menudo transcribían audio, muestreaban cuadros de video, enviaban esos artefactos a un LLM, producían una respuesta y luego dependían de lógica de aplicación separada para la tarea real. Qwen3.8-Omni-Flash está diseñado para comprimir más de ese ciclo en un único sistema de agente.
Un agente de producción de medios puede inspeccionar metraje y audio antes de planificar ediciones. Un agente de reuniones puede combinar la identidad del hablante con contenido hablado y visuales de presentación. Un agente de investigación puede localizar momentos relevantes en horas de material audiovisual y luego buscar contexto externo. En este marco, el audio y el video se convierten en contexto de trabajo para un agente en lugar de adjuntos pasivos.
Agentes de audio y video
| Benchmark — fuente oficial de lanzamiento | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| WildClawBench-MM | 71.0 | 34.5 | 58.9 |
| UniClawBench | 69.6 | 67.1 | 69.0 |
| AgenticVBench | 36.8 | 14.5 | 45.0 |
| OmniGAIA | 74.0 | — | 78.6 |
| StreamingBench | 80.8 | 57.1 | 79.9 |
El mayor salto generacional es WildClawBench-MM, donde Qwen reporta un aumento de 34.5 a 71.0. AgenticVBench también mejora notablemente, mientras que Gemini 3.8 Flash sigue por delante en ese benchmark. El patrón, por tanto, no es un resultado universal de “un modelo gana todo”.
Comprensión y razonamiento de audio y video
| Benchmark | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| OmniVideoBench | 63.4 | 53.8 | 65.2 |
| OmniVideoBench + Qwen Code agent | 67.8 | — | 65.2 |
| Video-MME-v2 | 65.0 | — | 71.0 |
| Video-MME-v2 + agente | 71.3 | — | 71.0 |
| LVOmniBench | 63.3 | — | 70.7 |
| LVOmniBench + agente | 73.6 | — | 70.7 |
| JointAVBench | 75.9 | — | 70.4 |
Las filas estáticas son mixtas. Gemini lidera varias pruebas convencionales de razonamiento en video, pero el resultado de Qwen a menudo sube dentro de un bucle de agente. Esa distinción solo importa cuando la aplicación en producción usa recuperación, herramientas o inspección iterativa comparables.
Comprensión de audio y de múltiples hablantes
| Benchmark | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| LongAudioSpan | 82.7 | 74.4 | 79.3 |
| AliMeeting DER ↓ | 3.4 | 88.1 | 72.6 |
| AliMeeting cpWER ↓ | 17.2 | 89.6 | 53.1 |
| FLEURS-ASR WER ↓ | 9.3 | 7.2 | 7.9 |
| VoiceBench | 91.6 | 92.9 | 92.3 |
Las filas de reuniones son las más destacadas, mientras que FLEURS-ASR y VoiceBench no mejoran sobre el predecesor. Los resultados del lanzamiento apuntan, por tanto, a una comprensión de audio multihablante, espacial y de contexto largo más rica, en lugar de una victoria uniforme en reconocimiento de voz.
Qwen3.8-Omni-Flash vs Qwen3.5-Omni-Plus vs Gemini 3.8 Flash
La tabla combina la información oficial del producto de Qwen con la especificación oficial de Gemini 3.8 Flash de Google. Las comparaciones de benchmarks siguen siendo realizadas por Qwen y no deben tratarse como clasificaciones neutrales de terceros.
| Dimensión | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| Arquitectura | Base Qwen3.8-Flash-Next; mapeo exacto de parámetros de Omni no revelado | Generación Omni previa de Qwen | Arquitectura propietaria Gemini de Google |
| Ventana de contexto | 1M tokens | Límites de despliegue más pequeños | 1,048,576 input tokens |
| Razonamiento | Esfuerzo de razonamiento ajustable; pensamiento habilitado por defecto | Sin modo de razonamiento activado por defecto equivalente en el despliegue citado | Niveles de pensamiento bajo, medio y alto |
| Entrada multimodal | Texto, imagen, audio, video | Texto, imagen, audio, video | Texto, imagen, video, audio y PDF |
| Salida | Texto | Texto y flujos de trabajo con salida de voz admitidos | Texto |
| Programación | Sólidos puntajes de programación reportados por el proveedor; no su principal diferenciador | No es el principal posicionamiento | Diseñado para ingeniería de software de largo horizonte y agentes |
| Disponibilidad de API | Chat Completions and Responses; API alojada | APIs alojadas de Qwen | Gemini API; disponibilidad general |
| Herramientas | Llamadas a funciones y búsqueda web | Llamadas a funciones y búsqueda web | Llamadas a funciones, grounding de búsqueda, ejecución de código y otras herramientas integradas |
| Precio de API publicado | QwenCloud: $0.15 entrada / $0.47 salida por 1M tokens | Dependiente de región y endpoint | Precio introductorio de Google: $0.75 entrada / $3.75 salida por 1M tokens hasta el 31 de diciembre de 2026 |
| Mejor ajuste | Agentes y análisis de medios | Conversación Omni y salida de voz | Flujos multimodales, de programación y de agentes autónomos amplios |
Qwen3.5-Omni-Plus sigue siendo relevante cuando se requiere voz generada. Qwen3.8-Omni-Flash está más claramente optimizado en torno a comprensión eficiente de audio y video más ejecución orientada a herramientas.
Frente a Gemini 3.8 Flash, la evaluación de Qwen es mixta: Qwen3.8-Omni-Flash es competitivo en audio, procesamiento multihablante, grounding y varios flujos de trabajo con agentes, mientras que Gemini lidera algunas pruebas estáticas de razonamiento en video. La comparación sensata es específica del trabajo.
Los desarrolladores que evalúan acceso unificado pueden comparar la API de Gemini 3.8 Flash en CometAPI, la API de Qwen3.8-Flash en CometAPI y la API de Qwen3.8-Flash-Next en CometAPI fuera de la tabla, de modo que los enlaces a fuentes técnicas y a acceso a producto permanezcan distintos.
Limitaciones de Qwen3.8-Omni-Flash
- Salida solo de texto: entiende audio y video pero no genera voz como modalidad de respuesta.
- Despliegue alojado: no se anunciaron pesos abiertos para Qwen3.8-Omni-Flash en el lanzamiento.
- Benchmarks recientes: las comparaciones principales son principalmente resultados de primera parte y necesitan replicación independiente.
- Efectos del arnés de agente: algunas puntuaciones incluyen recuperación, entornos de herramientas o inspección iterativa y no deben confundirse con resultados de solo modelo.
- Costo dependiente del flujo de trabajo: los videos largos aún pueden volverse costosos si la aplicación reprocesa repetidamente segmentos grandes en lugar de usar recuperación, caché o inspección dirigida.
¿Quién debería usar Qwen3.8-Omni-Flash?
Qwen3.8-Omni-Flash es más interesante cuando el audio o el video forman parte de la tarea en sí, en lugar de un adjunto que solo necesita resumirse. Los casos de uso adecuados incluyen inteligencia para reuniones, búsqueda de medios de larga duración, canalizaciones de traducción de video, flujos de trabajo de tutorial-a-notas, agentes de producción de medios y archivos audiovisuales.
Para chat de texto convencional, un modelo Flash de texto dedicado puede seguir siendo más simple. Para aplicaciones con salida de voz, un modelo Omni con generación de audio explícita puede ser mejor opción. Para flujos que combinan ver, oír, razonar y actuar, Qwen3.8-Omni-Flash es la opción más distintiva en la línea de Qwen.
Conclusión
Qwen3.8-Omni-Flash se entiende mejor como un modelo agéntico de audio y video, no simplemente otro lanzamiento multimodal de la serie Flash. Su contexto de 1M, razonamiento nativo audiovisual, capacidades multihablante y de audio espacial, razonamiento ajustable, llamadas a funciones, búsqueda y el ecosistema Qwen-MM-Plugins apuntan a la misma transición: permitir que un sistema de IA pase de entender multimedia a hacer trabajo con multimedia.
Los datos del lanzamiento indican una mejora generacional sustancial sobre Qwen3.5-Omni-Plus, particularmente en flujos de trabajo agénticos y escenarios de audio complejos. Frente a Gemini 3.8 Flash, las cifras de Qwen son más equilibradas. La pregunta importante no es qué modelo gana una tabla, sino qué combinación de modelo y arnés completa el flujo de trabajo objetivo con precisión y economía.
