GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
ai-model/Recherche CometAPI

Qu'est-ce que Qwen3.8-Omni-Flash et comment y accéder ?

未检测到可翻译文本。请提供需要翻译的原文(可为纯文本、HTML、Markdown、JSON、XML或代码片段),我将在严格保留结构与技术元素的前提下将其译为法语。

CometAPI
Mia MarenÉquipe de recherche sur les modèles IA et API
Mis à jour Sep 21, 2026 13 min de lecture
Qu'est-ce que Qwen3.8-Omni-Flash et comment y accéder ?
Utiliser ce modèle

Passez le premier appel API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Qwen3.8-Omni-Flash est le modèle natif omnimodal de Qwen d’Alibaba pour la compréhension de texte, d’image, d’audio et de vidéo, avec le texte comme modalité de sortie. Annoncé le 18 septembre 2026, il combine une fenêtre de contexte de 1M tokens, un raisonnement audio‑vidéo natif, un raisonnement ajustable, l’appel de fonctions, la recherche sur le web, la compréhension de l’audio spatial et l’utilisation d’outils.

Le changement le plus important n’est pas simplement une meilleure compréhension vidéo. Qwen décrit le modèle comme son premier modèle omnimodal construit autour de capacités agentiques : il peut comprendre ce qu’il voit et entend, planifier la suite, invoquer des outils et mener à bien des tâches plus longues telles que le montage de vlogs, la traduction vidéo, la production de résumés de films, l’analyse de réunions et la recherche multimédia.

Au lancement, Qwen a indiqué une amélioration moyenne de plus de 25 % sur 29 évaluations par rapport à Qwen3.5-Omni-Plus. Ce sont des résultats de lancement rapportés par le fournisseur, et non des évaluations indépendantes.

Key Takeaways

  • Entrée omnimodale native : Qwen3.8-Omni-Flash accepte texte, image, audio et vidéo, tout en renvoyant actuellement du texte.
  • Flux média agentiques : il peut combiner la compréhension des médias avec la planification, l’appel de fonctions et la recherche sur le web.
  • Long contexte et profondeur audio : le modèle hébergé offre une fenêtre de contexte de 1M tokens et prend en charge l’audio multilingue, stéréo et ambisonique de premier ordre.
  • Gains de benchmarks rapportés par le fournisseur : les plus fortes améliorations apparaissent dans les agents multimodaux, la compréhension d’audios longs, la diarisation des locuteurs et l’ancrage audio.
  • Disponibilité hébergée : le modèle est accessible via des API hébergées ; Qwen-MM-Plugins est séparément open source pour les flux d’agents multimodaux.

Les développeurs peuvent accéder à l’API Qwen3.8-Omni-Flash dans CometAPI via un flux API unifié.

What Is Qwen3.8-Omni-Flash?

Qwen3.8-Omni-Flash est le modèle natif omnimodal de nouvelle génération de Qwen. Au lieu de traiter l’audio ou la vidéo comme de simples artefacts de prétraitement, il raisonne sur le texte, les frames visuelles, la parole, les sons d’environnement et les relations temporelles au sein d’un même flux. Les entrées prises en charge sont le texte, les images, l’audio et la vidéo ; sa sortie actuelle est le texte.

Cette distinction de sortie est importante. La documentation officielle Alibaba Cloud positionne Qwen3.8-Omni-Flash pour la compréhension multimodale et l’exécution agentique, tandis que les cas d’usage de sortie vocale restent mieux servis par des variantes Omni qui prennent explicitement en charge l’audio généré.

Le cadrage du lancement passe de « percevoir les médias » à « comprendre, planifier, exécuter et livrer ». Cela rend le modèle pertinent pour le montage vidéo, la recherche multimédia, l’analyse de réunions, le traitement de vidéos pédagogiques et d’autres flux où le modèle doit faire quelque chose avec les médias, plutôt que simplement les résumer.

Qwen3.8-Omni-Flash specifications

Le tableau de spécifications ci‑dessous est basé sur les pages officielles du modèle sur Alibaba Cloud et QwenCloud ; les limites et les prix peuvent varier selon les régions et doivent être revus avant publication ou déploiement.

SpécificationQwen3.8-Omni-Flash — page officielle du modèle
DéveloppeurAlibaba Qwen
Date de sortieSeptember 18, 2026
Type de modèleModèle natif omnimodal
Entrée / sortieTexte, image, audio, vidéo / texte
Fenêtre de contexte1,000,000 tokens
Entrée maximale991,808 tokens normal ; 983,616 tokens en mode de raisonnement
Sortie maximale131,072 tokens
Allocation maximale de raisonnementUp to 262K tokens on QwenCloud
RaisonnementActivé par défaut ; effort de raisonnement configurable
Outils et mise en cacheAppel de fonctions, recherche sur le web, cache implicite et cache de session
Audio113 langues et dialectes ; stéréo et FOA à quatre canaux
Styles d’APIChat Completions and Responses
Prix QwenCloud$0.15 input, $0.47 output, and $0.016 implicit-cache input per 1M tokens
Poids ouvertsNon annoncés pour ce modèle au lancement

How Does Qwen3.8-Omni-Flash Work?

QwenCloud indique que Qwen3.8-Omni-Flash est construit sur l’architecture Qwen3.8-Flash-Next. Cela donne un contexte architectural, mais les nombres de paramètres publiés pour Flash‑Next ne doivent pas être automatiquement présentés comme la spécification exacte des paramètres de l’Omni, sauf confirmation de Qwen.

Gated DeltaNet + Qwen Sparse Attention

La base Flash‑Next combine Gated DeltaNet avec Qwen Sparse Attention. En termes simplifiés, la composante récurrente compresse l’information historique dans un état compact, tandis que l’attention clairsemée récupère un contexte long‑portée sélectionné au lieu d’appliquer une attention dense et complète à chaque paire de tokens. C’est particulièrement pertinent pour les longs flux audio et vidéo, où la longueur de séquence peut dominer le coût computationnel.

Perception agentique plutôt que perception statique

Le changement majeur se situe au niveau système. Qwen affirme que le modèle peut explorer activement de longues vidéos et se concentrer sur les moments pertinents plutôt que de consacrer un calcul égal à chaque segment. Conceptuellement, l’agent identifie où les preuves sont susceptibles de se trouver, inspecte ces moments plus en profondeur, raisonne à leur sujet, puis décide quel outil ou quelle opération doit suivre.

What Are the Main Qwen3.8-Omni-Flash Features?

Raisonnement audio‑vidéo natif

Qwen3.8-Omni-Flash raisonne conjointement sur les flux visuel et audio d’une vidéo. Cela importe lorsque la réponse dépend des deux modalités : identifier qui a dit quelque chose, déterminer si un son est survenu avant ou après une action, interpréter la musique ou l’ambiance sonore, ou relier des instructions parlées à ce qui apparaît à l’écran.

Compréhension multi‑locuteurs et audio spatial

L’API prend en charge l’audio multicanal, y compris la stéréo deux canaux et l’ambisonique de premier ordre à quatre canaux (FOA). Préserver l’information directionnelle peut aider pour l’analyse de réunions, les agents incarnés, les événements enregistrés, les environnements multi‑locuteurs et l’ancrage audio.

Effort de raisonnement ajustable

Le raisonnement est activé par défaut. Les développeurs peuvent configurer l’effort de raisonnement pour échanger latence et consommation de tokens contre un raisonnement plus profond pour des tâches multimédias complexes.

Appel de fonctions et recherche sur le web

L’appel de fonctions et la recherche sur le web sont centraux dans le positionnement agentique. Après avoir compris une vidéo, une image ou un fichier audio, le modèle peut transmettre des arguments structurés à un outil externe, récupérer des informations supplémentaires ou poursuivre un flux de travail en dehors du modèle.

Qwen-MM-Plugins

Qwen a également publié Qwen-MM-Plugins, une boîte à outils Apache‑2.0 pour des harnais d’agents natifs multimodaux. Ses flux incluent la production vidéo, la conversion vidéo‑vers‑notes, l’apprentissage de compétences réutilisables à partir de vidéos de démonstration et la mémoire audiovisuelle.

How Good Is Qwen3.8-Omni-Flash on Benchmarks?

Qwen3.8-Omni-Flash reste‑t‑il performant en texte et en code ?

Les résultats de lancement de Qwen indiquent que le modèle Omni reste proche du modèle texte Flash apparenté sur plusieurs évaluations de programmation et de raisonnement. Qwen rapporte 92.6 sur LiveCodeBench v6, 63.3 sur SWE‑bench Pro et 91.0 sur GPQA Diamond. Ce sont des résultats rapportés par le fournisseur dans le cadre du lancement de Qwen et doivent être validés par rapport aux tâches de programmation et au harnais agentique utilisé en production.

Qwen indique plus de 25 % d’amélioration moyenne sur 29 évaluations par rapport à Qwen3.5‑Omni‑Plus. Les tableaux suivants résument les résultats officiels de lancement. Ce sont des résultats de première partie et n’avaient pas encore été reproduits indépendamment au moment de la publication.

Conditions d’évaluation : Les lignes statiques mesurent une seule exécution du modèle selon le cadrage de lancement de Qwen. Les lignes « + agent » incluent un harnais agentique, de la récupération ou une inspection itérative des médias. Les documents officiels de lancement doivent être consultés pour les modèles de prompt, les paramètres d’échantillonnage, le prétraitement des médias et les versions de harnais ; lorsque ces détails ne sont pas divulgués, le résultat doit être considéré comme rapporté par le fournisseur plutôt que reproductible de façon indépendante.

La signification plus large est le passage de la compréhension multimodale à l’exécution multimodale. Les pipelines antérieurs transcrivaient souvent l’audio, échantillonnaient des frames vidéo, envoyaient ces artefacts à un LLM, produisaient une réponse, puis s’appuyaient sur une logique applicative séparée pour la tâche réelle. Qwen3.8‑Omni‑Flash est conçu pour compresser davantage cette boucle dans un même système agentique.

Un agent de production média peut inspecter les séquences et l’audio avant de planifier les montages. Un agent de réunion peut combiner l’identité des intervenants avec le contenu parlé et les visuels de présentation. Un agent de recherche peut repérer des moments pertinents dans des heures de matériel audiovisuel puis rechercher un contexte externe. Dans ce cadrage, l’audio et la vidéo deviennent un contexte de travail pour un agent plutôt que des pièces jointes passives.

Agents audio‑vidéo

Benchmark — source officielle de lancementQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
WildClawBench-MM71.034.558.9
UniClawBench69.667.169.0
AgenticVBench36.814.545.0
OmniGAIA74.078.6
StreamingBench80.857.179.9

Le saut générationnel le plus important est WildClawBench‑MM, où Qwen rapporte une hausse de 34.5 à 71.0. AgenticVBench s’améliore également nettement, tandis que Gemini 3.8 Flash reste en tête sur ce benchmark. Le schéma n’est donc pas un résultat universel « un modèle gagne tout ».

Compréhension et raisonnement audio‑vidéo

BenchmarkQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
OmniVideoBench63.453.865.2
OmniVideoBench + Qwen Code agent67.865.2
Video-MME-v265.071.0
Video-MME-v2 + agent71.371.0
LVOmniBench63.370.7
LVOmniBench + agent73.670.7
JointAVBench75.970.4

Les lignes statiques sont mitigées. Gemini mène plusieurs tests conventionnels de raisonnement vidéo, mais le résultat de Qwen s’améliore souvent au sein d’une boucle agentique. Cette distinction n’a d’importance que si l’application de production utilise une récupération, des outils ou une inspection itérative comparables.

Audio et compréhension multi‑locuteurs

BenchmarkQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
LongAudioSpan82.774.479.3
AliMeeting DER ↓3.488.172.6
AliMeeting cpWER ↓17.289.653.1
FLEURS-ASR WER ↓9.37.27.9
VoiceBench91.692.992.3

Les lignes relatives aux réunions se distinguent, tandis que FLEURS‑ASR et VoiceBench n’améliorent pas le prédécesseur. Les résultats de lancement pointent donc vers une compréhension audio plus riche en contexte long, multi‑locuteurs et spatial, plutôt qu’un gain uniforme de reconnaissance vocale.

Qwen3.8-Omni-Flash vs Qwen3.5-Omni-Plus vs Gemini 3.8 Flash

Le tableau combine les informations produits officielles de Qwen avec la spécification officielle de Gemini 3.8 Flash de Google. Les comparaisons de benchmarks restent réalisées par Qwen et ne doivent pas être traitées comme des classements neutres de tierce partie.

DimensionQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
ArchitectureBase Qwen3.8-Flash-Next ; le mappage exact des paramètres de l’Omni n’est pas divulguéGénération précédente de Qwen OmniArchitecture Gemini propriétaire de Google
Fenêtre de contexte1M tokensLimites de déploiement plus petites1,048,576 input tokens
RaisonnementEffort de raisonnement ajustable ; raisonnement activé par défautPas de mode de raisonnement activé par défaut équivalent dans le déploiement citéNiveaux de raisonnement faible, moyen et élevé
Entrée multimodaleTexte, image, audio, vidéoTexte, image, audio, vidéoTexte, image, vidéo, audio et PDF
SortieTexteTexte et flux de sortie vocale pris en chargeTexte
ProgrammationSolides scores de programmation rapportés par le fournisseur ; ce n’est pas son principal différenciateurPositionnement non principalConçu pour l’ingénierie logicielle à long horizon et les agents
Disponibilité APIChat Completions and Responses ; API hébergéeAPI Qwen hébergéesAPI Gemini ; généralement disponible
OutilsAppel de fonctions et recherche sur le webAppel de fonctions et recherche sur le webAppel de fonctions, ancrage de recherche, exécution de code et autres outils intégrés
Tarification API publiéeQwenCloud : $0.15 entrée / $0.47 sortie par 1M tokensDépend de la région et du point de terminaisonPrix introductif Google : $0.75 entrée / $3.75 sortie par 1M tokens jusqu’au 31 décembre 2026
Meilleur usageAgents média et analyseConversation Omni et sortie vocaleLarge éventail de flux multimodaux, de programmation et d’agents autonomes

Qwen3.5-Omni-Plus reste pertinent lorsque de la parole générée est requise. Qwen3.8‑Omni‑Flash est plus clairement optimisé pour une compréhension audio‑vidéo efficace et une exécution orientée outils.

Face à Gemini 3.8 Flash, l’évaluation de Qwen est mixte : Qwen3.8‑Omni‑Flash est compétitif en audio, traitement multi‑locuteurs, ancrage et plusieurs flux agentiques, tandis que Gemini mène certains tests statiques de raisonnement vidéo. La comparaison sensée est donc spécifique à la charge de travail.

Les développeurs évaluant un accès unifié peuvent comparer l’API Gemini 3.8 Flash dans CometAPI, l’API Qwen3.8-Flash dans CometAPI et l’API Qwen3.8-Flash-Next dans CometAPI en dehors du tableau afin que les liens sources techniques et d’accès produit restent distincts.

Limitations of Qwen3.8-Omni-Flash

  • Sortie texte uniquement : il comprend l’audio et la vidéo mais ne génère pas de parole comme modalité de réponse.
  • Déploiement hébergé : aucun poids ouvert n’a été annoncé pour Qwen3.8‑Omni‑Flash au lancement.
  • Benchmarks récents : les comparaisons mises en avant sont principalement des résultats de première partie et doivent être reproduites indépendamment.
  • Effets de harnais agentique : certains scores incluent de la récupération, des environnements d’outils ou une inspection itérative et ne doivent pas être confondus avec des résultats modèle‑nu.
  • Coût dépendant du flux : de longues vidéos peuvent rester coûteuses si l’application retraitre à plusieurs reprises de larges segments au lieu d’utiliser récupération, cache ou inspection ciblée.

Who Should Use Qwen3.8-Omni-Flash?

Qwen3.8-Omni-Flash est particulièrement intéressant lorsque l’audio ou la vidéo fait partie de la tâche elle‑même plutôt qu’une pièce jointe à simplement résumer. Les cas d’usage adaptés incluent l’intelligence de réunions, la recherche média longue durée, les pipelines de traduction vidéo, les flux tutoriels‑vers‑notes, les agents de production média et les archives audiovisuelles.

Pour le chat texte conventionnel, un modèle Flash dédié peut rester plus simple. Pour les applications de sortie vocale, un modèle Omni avec génération audio explicite peut être mieux adapté. Pour les flux combinant vision, écoute, raisonnement et action, Qwen3.8‑Omni‑Flash est l’option la plus distinctive dans la gamme Qwen.

Conclusion

Qwen3.8-Omni-Flash doit être compris comme un modèle audio‑vidéo agentique, pas simplement une autre version Flash multimodale. Sa fenêtre de contexte de 1M, son raisonnement audio‑vidéo natif, ses capacités multi‑locuteurs et audio spatial, son raisonnement ajustable, l’appel de fonctions, la recherche et l’écosystème Qwen‑MM‑Plugins visent la même transition : permettre à un système d’IA de passer de la compréhension des médias à la réalisation de travail avec les médias.

Les données de lancement indiquent une amélioration générationnelle substantielle par rapport à Qwen3.5‑Omni‑Plus, en particulier dans les flux agentiques et les scénarios audio complexes. Face à Gemini 3.8 Flash, les propres chiffres de Qwen sont plus équilibrés. La question importante n’est donc pas quel modèle gagne un tableau, mais quelle combinaison modèle‑et‑harnais accomplit le flux cible avec précision et de manière économique.

Continuer à apprendre

Reliez cet article à la décision suivante.

Voir tous les sujets
Publié le Sep 21, 2026
Dernière mise à jour Sep 21, 2026
3 vues
Revu pour la clarté, l'attribution des sources et la terminologie API actuelle.

Prêt à réduire vos coûts de développement IA de 20 % ?

Démarrez gratuitement en quelques minutes. Crédits d'essai offerts. Aucune carte bancaire requise.

En savoir plus