Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →
technology/Recherche CometAPI

Qu’est-ce que Qwen3.8-Flash-Next ?

Explorez Qwen3.8-Flash-Next : architecture MoE de 125B, 6B de paramètres actifs, QSA, contexte étendu à 1M-token, benchmarks multimodaux, fonctionnalités, tarification.

CometAPI
Mia MarenÉquipe de recherche sur les modèles IA et API
Mis à jour Aug 29, 2026 19 min de lecture
Qu’est-ce que Qwen3.8-Flash-Next ?
Utiliser ce modèle

Passez le premier appel API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Qwen3.8-Flash-Next n’est pas simplement un membre plus petit ou plus rapide de la famille Qwen3.8. Qwen le décrit comme un modèle MoE multimodal à poids ouverts et un aperçu précoce de l’architecture utilisée dans Qwen4. Sa conception modifie simultanément l’attention, les connexions résiduelles, la capacité d’embedding et l’optimisation, avec pour objectif d’améliorer les capacités tout en réduisant fortement la quantité de calcul requise par jeton.

TL;DR

Qwen3.8-Flash-Next combine un modèle principal de 125B paramètres avec une table d’embedding N-gram supplémentaire de 51B, tout en n’activant que 6B paramètres par jeton. Il gère nativement 262,144 jetons et peut être étendu à 1,000,000 de jetons avec YaRN. L’architecture est construite autour d’un mélange 3:1 de Gated DeltaNet et Qwen Sparse Attention, de connexions résiduelles à quatre branches avec portes (Gated Residual), de N-gram Embedding, d’un large pool d’experts MoE ultra clairsemé, de Multi-Token Prediction et d’un entraînement basé sur Muon.

Le point le plus important est l’efficacité plutôt que le simple nombre de paramètres. Qwen indique que l’entraînement du modèle nécessite environ un neuvième du coût de Qwen3.7-Plus, et son évaluation de lancement place le modèle devant les précédents baselines Qwen sur de nombreuses tâches de codage, d’agents de bureau et multimodales. Il s’agit de résultats annoncés par le fournisseur et à considérer comme des éléments de lancement plutôt qu’une validation indépendante.

Pour les développeurs, les poids ouverts sont disponibles via les canaux Qwen, tandis que la version managée de production s’appelle Qwen3.8-Flash sur QwenCloud. CometAPI répertorie Qwen3.8-Flash-Next avec l’ID de modèle qwen3.8-flash-next, offrant aux développeurs une voie unifiée aux côtés d’autres modèles de pointe.

Points clés

Qu’est-ce que Qwen3.8-Flash-Next ?

Qwen3.8-Flash-Next est un modèle de langage multimodal causal avec un encodeur de vision et une ossature linguistique MoE ultra clairsemée. La fiche du modèle officielle décrit une architecture à 48 couches avec 512 experts, 10 experts routés plus un expert partagé, et une disposition interne qui répète trois couches Gated DeltaNet suivies d’une couche Qwen Sparse Attention.

Cette sortie joue un rôle similaire à Qwen3-Next : elle expose des changements architecturaux avant qu’ils ne soient étendus à la prochaine famille complète. Qwen qualifie explicitement le modèle d’aperçu expérimental de l’architecture qui sous-tendra Qwen4. Cela le rend particulièrement intéressant pour les ingénieurs qui se soucient de l’efficacité du serving, du long contexte et de l’orientation de la recherche sur les architectures de modèles ouverts.

4 composants centraux de Qwen3.8-Flash-Next

Le modèle modifie conjointement quatre composants clés : l’attention, le flux résiduel, la capacité d’embedding et l’optimisation. Cette co-conception est importante car les gains d’efficacité dans un composant peuvent être perdus si un autre devient le goulot d’étranglement à long contexte ou à grande échelle.

Attention hybride : GDN + Qwen Sparse Attention

La plupart des couches n’effectuent pas d’attention globale. À la place, trois couches sur quatre utilisent Gated DeltaNet pour compresser l’historique dans un état de taille fixe. La quatrième couche utilise une attention globale pour une récupération exacte, mais cette attention globale est repensée en Qwen Sparse Attention (QSA).

QSA évite de rechercher chaque jeton indépendamment. Un indexeur léger regroupe d’abord la séquence en micro-blocs, estime quels blocs comptent, puis n’applique l’attention qu’aux régions sélectionnées. Dans la description de Qwen, cela réduit à la fois le calcul d’attention et la surcharge d’indexation nécessaire pour trouver le contexte pertinent. La conception s’accorde particulièrement bien avec un réseau hybride, car l’index clairsemé est construit indépendamment dans chaque couche d’attention plutôt que de reposer sur la similarité entre couches adjacentes.

Les gains d’efficacité sont substantiels. À un contexte de 1M de jetons, Qwen rapporte jusqu’à 7,6× plus rapide en préremplissage et 4,9× plus rapide en décodage pour le kernel d’attention QSA. Dans une expérience de serving à forte réutilisation de cache avec un taux de hits du cache de préfixe de 90 %, le modèle complet atteint 8,6× le débit de préremplissage de Qwen3.7-Plus à 1M de contexte.

Gated Residual : quatre branches plutôt qu’une

Un Transformer classique lit et écrit de manière répétée dans un unique flux résiduel. Qwen3.8-Flash-Next utilise au contraire Gated Residual pour élargir ce flux en quatre branches parallèles. Des portes de lecture élémentaires décident de la quantité d’information à prendre de chaque branche, tandis que des portes d’écriture au niveau des branches déterminent ce qui est réécrit.

L’objectif est de préserver les caractéristiques utiles en profondeur sans forcer chaque caractéristique à travers le même canal en mélange continu. Qwen indique aussi que la porte supprime les valeurs aberrantes d’activation et que l’état résiduel peut être stocké en FP8, réduisant le trafic mémoire. L’idée clé n’est pas simplement d’ajouter de la capacité résiduelle ; c’est un routage contrôlé de l’information à travers les couches.

N-gram Embedding : plus de capacité sans calcul proportionnel

Le modèle ajoute 51B de paramètres d’embedding N-gram au-delà des 125B de l’ossature principale. Contrairement à un embedding ordinaire indexé par un seul jeton, N-gram Embedding utilise des motifs locaux comme des bigrammes et trigrammes. Cela offre au modèle une grande mémoire de type lookup pour les motifs locaux récurrents.

La particularité réside dans l’emplacement de cette capacité. Comme l’adresse de lookup peut être connue avant que l’embedding ne soit nécessaire, la table peut être conservée en mémoire hôte et préchargée de manière asynchrone pendant que le GPU poursuit le calcul. Ainsi, les 51B paramètres supplémentaires ne se comportent pas comme 51B de paramètres supplémentaires de multiplications matrices denses. L’architecture met effectivement à l’échelle deux ressources différentes : des paramètres de modèle gourmands en calcul et une mémoire de lookup peu coûteuse en calcul.

Muon et optimisation de l’entraînement

Qwen entraîne l’architecture avec l’optimiseur Muon pour les applications linéaires bidimensionnelles telles que les poids principaux dans l’attention, GDN et les experts MoE, tandis que les embeddings, le routeur et les paramètres à faible rang de Gated Residual continuent d’utiliser AdamW. Les matrices fusionnées comme les projections QKV et SwiGLU sont scindées en leurs transformations linéaires indépendantes avant orthogonalisation.

L’équipe a également réajusté sa loi de scaling pour la nouvelle architecture et rapporte que le Batch Size Warmup conventionnel était inutile. Augmenter progressivement la taille de lot n’a pas amélioré le résultat final et a au contraire nécessité 18,8 % d’étapes d’optimiseur supplémentaires. La recette finale commence donc directement à la taille de lot cible.

MoE ultra clairsemé et Multi-Token Prediction

La fiche du modèle officielle mentionne 512 experts avec 10 experts routés et un expert partagé actifs par jeton. Le grand pool d’experts augmente la capacité stockée sans activer l’intégralité du modèle pour chaque jeton. Un module Multi-Token Prediction (MTP) d’une couche est entraîné avec plusieurs pas pour améliorer l’acceptation du décodage spéculatif tout en soutenant l’ossature principale.

Performances de Qwen3.8-Flash-Next aux benchmarks

Qwen publie de larges évaluations de langage, de codage, d’agents et vision-langage. Ces chiffres sont utiles parce que de nombreux modèles comparés ont été relancés dans l’infrastructure d’évaluation de Qwen, mais ils restent des évaluations de lancement rapportées par le fournisseur, pas des reproductions indépendantes. Plusieurs lignes utilisent aussi des harnais ou juges spécifiques au benchmark, donc l’interprétation la plus prudente est directionnelle : elles montrent où Qwen3.8-Flash-Next est le plus fort et où des concurrents conservent l’avantage.

Performances en codage et agents

BenchmarkQwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusDeepSeek V4 FlashClaude Opus 4.6
DeepSWE 1.158.742.216.554.4--
SWE-bench Pro62.561.755.856.053.4
SWE-bench Multilingual81.073.875.8--77.5
NL2Repo-Bench48.142.341.154.247.6
CoWorkBench73.970.765.145.168.2
JobBench55.733.427.641.336.6
Toolathlon Verified73.567.150.670.3--
IFBench81.379.579.179.262.5
GPQA Diamond91.789.290.390.891.3
HLE35.930.834.733.840.0
LiveCodeBench v691.990.389.690.688.8

Le panorama du codage est solide mais nuancé. Qwen3.8-Flash-Next mène l’ensemble de comparaison listé sur SWE-bench Pro, SWE-bench Multilingual, CoWorkBench, JobBench, Toolathlon Verified et LiveCodeBench v6. Cependant, DeepSeek V4 Flash est devant sur NL2Repo-Bench, tandis que Claude Opus 4.6 mène HLE. L’efficacité constitue donc un titre plus défendable qu’une domination universelle des benchmarks.

Les gains les plus notables par rapport aux baselines Qwen précédents apparaissent sur les travaux à long horizon. CoWorkBench passe de 65.1 sur Qwen3.7-Plus à 73.9, tandis que JobBench passe de 27.6 à 55.7. Étant donné que CoWorkBench est un benchmark interne à Qwen, ces gains méritent une réplication indépendante, mais ils s’alignent avec l’orientation déclarée de l’architecture sur des workflows d’agents et de bureautique rentables.

Performances multimodales

BenchmarkQwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusClaude Opus 4.6
ClawEval-MM (Pass@3 / Avg)64.4 / 60.457.4 / 56.957.4 / 60.152.5 / 54.7
RecreationBench49.947.130.2--
AndroidWorld84.581.981.062.0
OSWorld 2.0 (Binary / Partial)19.4 / 52.319.4 / 48.02.8 / 21.5--
Vision2Web64.062.942.1--
ERQA72.365.569.840.8
LVBench76.672.476.263.0
RealWorldQA88.585.986.973.9
MathVision (without / with CI)90.6 / 95.790.0 / 94.690.3 / 88.765.5 / --
CharXiv RQ (without / with CI)84.6 / 90.683.7 / 90.285.8 / 85.966.0 / --

Source des données : évaluation de lancement officielle de Qwen**.

Les résultats multimodaux confirment qu’il ne s’agit pas seulement d’un modèle Flash axé sur le codage. Qwen3.8-Flash-Next obtient 84.5 sur AndroidWorld, 64.0 sur Vision2Web, 76.6 sur LVBench et 88.5 sur RealWorldQA dans le tableau de Qwen. La fiche du modèle fournit également des exemples d’entrée image et vidéo, avec des recommandations pour un échantillonnage à cadence plus élevée sur des charges vidéo à l’échelle de l’heure. charges vidéo.

Qwen3.8-Flash-Next vs autres modèles

Une comparaison utile doit dissocier trois questions : combien de calcul est activé par jeton, quelle est l’étendue des modalités et du contexte du modèle, et quelles performances sur des workflows représentatifs. Le simple nombre total de paramètres n’apporte pas ces réponses.

Qwen3.8-Flash-Next vs Qwen3.8-27B vs Qwen3.7-Plus

DimensionQwen3.8-Flash-NextQwen3.8-27BQwen3.7-Plus
Paramètres du modèle125B + 51B d’embedding N-gram27B397B
Paramètres activés6B27B17B
Contexte natif262K262K dans la configuration QwenModèle de génération précédente à long contexte
DeepSWE 1.158.742.216.5
CoWorkBench73.970.765.1
JobBench55.733.427.6
AndroidWorld84.581.981.0

Le résultat clé est la capacité par paramètre activé. Qwen3.8-Flash-Next active 6B paramètres par jeton contre 27B pour Qwen3.8-27B et 17B pour Qwen3.7-Plus, tout en étant devant sur les scores listés DeepSWE, CoWorkBench, JobBench et AndroidWorld. Le compromis se situe sur l’empreinte mémoire : la parcimonie réduit le calcul actif, pas la quantité de capacité modèle qui doit au final être stockée quelque part.

Qwen3.8-Flash-Next vs DeepSeek V4 Flash vs Claude Opus 4.6

DimensionQwen3.8-Flash-NextDeepSeek V4 FlashClaude Opus 4.6
PoidsPoids ouvertsPoids ouvertsFermé
Profil de paramètres annoncé125B principal + 51B N-gram ; 6B actifs284B au total ; 13B actifsNon divulgué publiquement
Principale histoire d’efficacitéQSA + GDN + MoE 6B actifs + mémoire de lookupMoE clairsemé à haut débitPile gérée pour raisonnement et agents
Multimodalité nativeTexte, image, vidéo -> texteFamille Flash orientée texte ; voie vision disponible séparément sur CometAPITexte + vision/fichiers via API hébergées
SWE-bench Pro*62.556.053.4
CoWorkBench*73.945.168.2
NL2Repo-Bench*48.154.247.6
HLE*35.933.840.0

DeepSeek V4 Flash reste plus fort sur NL2Repo-Bench dans la comparaison de Qwen, ce qui compte pour la génération de code au niveau des dépôts. Claude Opus 4.6 est plus fort sur HLE dans le même tableau et représente un modèle fermé managé plutôt qu’une cible de déploiement ouverte. Qwen3.8-Flash-Next se distingue surtout par la combinaison de poids ouverts, multimodalité native, ingénierie long-contexte et un budget de paramètres actifs très réduit.

Qwen3.8-Flash-Next vs Qwen3.8-Max

DimensionQwen3.8-Flash-NextQwen3.8-Max
RôleAperçu architectural ouvert axé sur l’efficacitéVaisseau amiral Qwen3.8
Échelle principale/totale125B principal + 51B N-gram ; 6B actifs2.4T au total ; environ 95B actifs sur la page modèle CometAPI
Accent d’architectureQSA, GDN, Gated Residual, N-gram Embedding, MuonCapacité maximale de pointe à une échelle bien plus grande
Meilleur usageAgents à grand volume, assistants de codage, automatisation multimodale, auto-hébergementRaisonnement le plus difficile, grands agents d’entreprise, workloads centrés sur la capacité
Contexte262K natif ; jusqu’à 1M avec YaRNContexte de classe 1M hébergé sur les routes phares Qwen3.8 actuelles

Les spécifications de Qwen3.8-Max sont basées sur la fiche modèle actuelle sur CometAPI.

La distinction est simple : Qwen3.8-Max est le vaisseau amiral centré sur la capacité, tandis que Qwen3.8-Flash-Next est l’expérience d’architecture et d’efficacité. Les développeurs qui hésitent entre les deux doivent se demander si le goulot d’étranglement est la capacité absolue du modèle ou le coût d’exécuter à grande échelle de nombreuses tâches à long contexte et à outils.

Tarification et disponibilité de Qwen3.8-Flash-Next

Les poids ouverts de Qwen3.8-Flash-Next sont publiés via Hugging Face et ModelScope. Pour le service managé, Qwen indique que la version de production s’appelle Qwen3.8-Flash sur QwenCloud, avec un contexte 1M activé par défaut et des outils officiels intégrés.

Qwen liste le prix de la version managée à $0.16 par million de jetons en entrée et $0.47 par million de jetons en sortie. Ce prix se réfère au modèle de production QwenCloud Qwen3.8-Flash, et non à l’auto-hébergement des poids ouverts.

RouteEntréeSortie
Modèle de production QwenCloud (Qwen3.8-Flash)$0.16 / 1M jetons$0.47 / 1M jetons
Auto-hébergement à poids ouvertsDépend de l’infrastructureDépend de l’infrastructure
Route CometAPIConsulter la page du modèle en ligneConsulter la page du modèle en ligne

Les prix QwenCloud proviennent de l’ article de lancement officiel de Qwen* ; la facturation CometAPI doit être vérifiée sur la page modèle en ligne.*

Pour les utilisateurs de CometAPI, le modèle dédié Qwen3.8-Flash-Next identifie la route comme qwen3.8-flash-next. Étant donné que le routage, la disponibilité amont et la facturation peuvent évoluer indépendamment de la sortie à poids ouverts, les intégrations de production doivent consulter le catalogue en ligne de CometAPI avant de figer des hypothèses de prix.

Recommandation CometAPI

Qwen3.8-Flash-Next devrait bientôt être disponible via CometAPI. CometAPI fournit un endpoint unique compatible OpenAI (https://api.cometapi.com/v1) qui agrège plus de 500 modèles de fournisseurs majeurs, y compris la série Qwen. Cette approche réduit la dépendance à un fournisseur, simplifie l’expérimentation avec Qwen3.8-Flash (une fois disponible via la plateforme ou les endpoints Qwen associés) et rationalise les déploiements de production qui peuvent mixer des modèles selon les tâches (par ex., Qwen pour des agents de codage rentables + un autre modèle pour du raisonnement spécialisé). La documentation et les guides de démarrage rapide sont disponibles sur apidoc.cometapi.com et le site principal de CometAPI.

Que vous auto-hébergiez les poids ouverts, utilisiez QwenCloud ou passiez par une plateforme unifiée comme CometAPI, Qwen3.8-Flash-Next abaisse la barrière pour des agents multimodaux à long contexte et hautes performances.

Que peut faire Qwen3.8-Flash-Next ?

1. Agents de codage à grand volume

Un budget de 6B de paramètres actifs combiné à un score SWE-bench Pro de 62.5 dans l’évaluation de Qwen rend Qwen3.8-Flash-Next particulièrement intéressant pour des systèmes de codage qui exécutent de nombreuses sessions en parallèle. Exemples : revue de code, triage des tickets, navigation dans les dépôts, génération de tests et patching itératif où le débit compte presque autant que l’intelligence d’une seule exécution.

2. Travail de bureau et de connaissances à long horizon

CoWorkBench et JobBench sont centraux dans le positionnement du modèle. L’architecture est conçue pour des boucles d’agents qui lisent à répétition le contexte, appellent des outils, mettent à jour l’état et poursuivent le travail plutôt que de répondre une seule fois. Cela s’aligne naturellement avec des workflows de documents, analyse de feuilles de calcul, assemblage de rapports, synthèse de recherche et automatisation de processus métier.

3. Agents multimodaux pour ordinateur et mobile

Les entrées image et vidéo, les performances sur AndroidWorld, l’évaluation OSWorld et les résultats Vision2Web rendent le modèle pertinent pour des agents d’interface graphique. Il peut servir de couche de raisonnement derrière des systèmes qui interprètent des captures d’écran, manipulent des interfaces mobiles, reproduisent des mises en page d’applications ou combinent l’état visuel avec des appels d’outils.

4. Raisonnement visuel et vidéo longue durée

La fiche du modèle inclut des exemples explicites d’entrée vidéo et des conseils pour le prétraitement de vidéo à l’échelle de l’heure. Cela rend le modèle utile pour la réponse à des questions vidéo, la recherche dans des vidéos longues, l’extraction d’événements visuels et des workflows combinant compréhension vidéo et outils en aval.

5. Workflows de recherche et dépôts à un million de jetons

Le modèle ouvert est natif à 262,144 jetons et extensible à 1,000,000 avec YaRN. Cette distinction est importante : 1M est une extension, non le contexte natif du modèle ouvert. Pour de grands dépôts ou corpus de recherche, QSA vise à rendre le coût de récupération de ces longs contextes plus pratique qu’une attention globale dense.

Comment les développeurs peuvent-ils exécuter Qwen3.8-Flash-Next ?

Les développeurs peuvent télécharger les poids ouverts depuis Hugging Face et exécuter le modèle avec Transformers, vLLM, SGLang ou TokenSpeed. Qwen fournit des exemples OpenAI-compatibles de Chat Completions pour l’entrée texte et multimodale.

Par exemple, la fiche du modèle officielle démontre le service de Qwen/Qwen3.8-Flash-Next avec vLLM et des appels via /v1/chat/completions. Les entrées image et vidéo sont également démontrées via l’interface compatible OpenAI.

Qwen3.8-Flash-Next fonctionne en mode de réflexion par défaut. Les développeurs peuvent contrôler ce comportement via enable_thinking, preserve_thinking et reasoning_effort ; les niveaux documentés de reasoning-effort sont xhigh, medium et low.

Quelles sont les limites de Qwen3.8-Flash-Next ?

La plus grande limite pratique est le coût matériel. Bien que seuls 6B paramètres du modèle de langage soient activés, le checkpoint contient 125B paramètres de langage plus le composant d’embedding n-gram de 51B et 4B de paramètres MTP. Le dépôt actuel fait environ 360 GB, de sorte que le déploiement local reste une tâche lourde en infrastructure.

La deuxième limite est que 262K est la longueur de contexte native, pas 1M. Le modèle peut être étendu à 1M de jetons, mais une page CometAPI ou modèle ne devrait pas simplement indiquer « contexte natif 1M ». La formulation correcte est contexte natif 262K, extensible à 1M.

Enfin, les performances aux benchmarks sont hétérogènes. Qwen3.8-Flash-Next est très compétitif sur les tâches de codage et agent, mais ne mène pas tous les benchmarks. Par exemple, Claude Opus 4.6 obtient 40.0 sur HLE contre 35.9 pour Flash-Next, tandis que DeepSeek-V4-Flash-0731 mène les modèles listés sur NL2Repo-Bench.

Qwen3.8-Flash-Next : ce que cela annonce pour Qwen4

La portée plus large de cette sortie tient à son rôle d’aperçu précoce de l’architecture appelée à sous-tendre Qwen4. Qwen3.8-Flash-Next réunit Qwen Sparse Attention, Gated DeltaNet, des connexions résiduelles à quatre branches avec portes, N-gram Embedding, un pool d’experts MoE ultra clairsemé et Multi-Token Prediction. Ces choix montrent comment Qwen explore plus de capacité, un plus long contexte, et de meilleures performances multimodales et d’agents sans augmenter au même rythme le calcul actif.

Verdict final

Qwen3.8-Flash-Next est important car il change la nature du problème d’efficacité. Au lieu de traiter tous les paramètres comme équivalents, il combine un chemin MoE actif relativement petit avec une très grande mémoire de type lookup et un mécanisme de récupération clairsemé conçu pour le long contexte. Cela offre à Qwen plusieurs leviers indépendants pour augmenter la capacité sans accroître au même rythme le calcul matriciel par jeton.

Pour les développeurs, cela en fait une option convaincante pour des assistants de codage à grand volume, des agents à long contexte, l’automatisation multimodale et l’expérimentation auto-hébergée. Pour la feuille de route plus large de Qwen, c’est encore plus significatif : Qwen utilise explicitement cette sortie pour exposer la direction architecturale qu’il prévoit d’affiner vers Qwen4.

Continuer à apprendre

Reliez cet article à la décision suivante.

Voir tous les sujets
Publié le Aug 28, 2026
Dernière mise à jour Aug 29, 2026
1 vues
Revu pour la clarté, l'attribution des sources et la terminologie API actuelle.

Prêt à réduire vos coûts de développement IA de 20 % ?

Démarrez gratuitement en quelques minutes. Crédits d'essai offerts. Aucune carte bancaire requise.

En savoir plus