Qwen3.8-Flash-Next n’est pas simplement un membre plus petit ou plus rapide de la famille Qwen3.8. Qwen le décrit comme un modèle MoE multimodal à poids ouverts et un aperçu précoce de l’architecture utilisée dans Qwen4. Sa conception modifie simultanément l’attention, les connexions résiduelles, la capacité d’embedding et l’optimisation, avec pour objectif d’améliorer les capacités tout en réduisant fortement la quantité de calcul requise par jeton.
TL;DR
Qwen3.8-Flash-Next combine un modèle principal de 125B paramètres avec une table d’embedding N-gram supplémentaire de 51B, tout en n’activant que 6B paramètres par jeton. Il gère nativement 262,144 jetons et peut être étendu à 1,000,000 de jetons avec YaRN. L’architecture est construite autour d’un mélange 3:1 de Gated DeltaNet et Qwen Sparse Attention, de connexions résiduelles à quatre branches avec portes (Gated Residual), de N-gram Embedding, d’un large pool d’experts MoE ultra clairsemé, de Multi-Token Prediction et d’un entraînement basé sur Muon.
Le point le plus important est l’efficacité plutôt que le simple nombre de paramètres. Qwen indique que l’entraînement du modèle nécessite environ un neuvième du coût de Qwen3.7-Plus, et son évaluation de lancement place le modèle devant les précédents baselines Qwen sur de nombreuses tâches de codage, d’agents de bureau et multimodales. Il s’agit de résultats annoncés par le fournisseur et à considérer comme des éléments de lancement plutôt qu’une validation indépendante.
Pour les développeurs, les poids ouverts sont disponibles via les canaux Qwen, tandis que la version managée de production s’appelle Qwen3.8-Flash sur QwenCloud. CometAPI répertorie Qwen3.8-Flash-Next avec l’ID de modèle qwen3.8-flash-next, offrant aux développeurs une voie unifiée aux côtés d’autres modèles de pointe.
Points clés
- 125B paramètres du modèle principal + 51B d’embedding N-gram, avec 6B de paramètres actifs par jeton.
- Un schéma d’attention hybride 3 GDN : 1 QSA conçu pour combiner une mémoire efficace avec une récupération précise à longue portée.
- Contexte natif de 262,144 jetons et jusqu’à 1M de jetons via YaRN.
- Qwen rapporte jusqu’à 7,6× en préremplissage et 4,9× en décodage pour le kernel à 1M de contexte avec QSA.
- Le flux résiduel est élargi en quatre branches avec portes, améliorant le flux d’information inter-couches et la stabilité de l’entraînement.
- Le tableau de lancement officiel montre de bons résultats sur SWE-bench Pro, CoWorkBench, JobBench, Toolathlon, AndroidWorld et RealWorldQA, sans pour autant dominer tous les benchmarks.
- Qwen positionne cette sortie comme un aperçu d’architecture, donc son importance tient autant à ce qu’elle annonce pour Qwen4 qu’à son rang actuel sur les benchmarks.
Qu’est-ce que Qwen3.8-Flash-Next ?
Qwen3.8-Flash-Next est un modèle de langage multimodal causal avec un encodeur de vision et une ossature linguistique MoE ultra clairsemée. La fiche du modèle officielle décrit une architecture à 48 couches avec 512 experts, 10 experts routés plus un expert partagé, et une disposition interne qui répète trois couches Gated DeltaNet suivies d’une couche Qwen Sparse Attention.
Cette sortie joue un rôle similaire à Qwen3-Next : elle expose des changements architecturaux avant qu’ils ne soient étendus à la prochaine famille complète. Qwen qualifie explicitement le modèle d’aperçu expérimental de l’architecture qui sous-tendra Qwen4. Cela le rend particulièrement intéressant pour les ingénieurs qui se soucient de l’efficacité du serving, du long contexte et de l’orientation de la recherche sur les architectures de modèles ouverts.
4 composants centraux de Qwen3.8-Flash-Next
Le modèle modifie conjointement quatre composants clés : l’attention, le flux résiduel, la capacité d’embedding et l’optimisation. Cette co-conception est importante car les gains d’efficacité dans un composant peuvent être perdus si un autre devient le goulot d’étranglement à long contexte ou à grande échelle.
Attention hybride : GDN + Qwen Sparse Attention
La plupart des couches n’effectuent pas d’attention globale. À la place, trois couches sur quatre utilisent Gated DeltaNet pour compresser l’historique dans un état de taille fixe. La quatrième couche utilise une attention globale pour une récupération exacte, mais cette attention globale est repensée en Qwen Sparse Attention (QSA).
QSA évite de rechercher chaque jeton indépendamment. Un indexeur léger regroupe d’abord la séquence en micro-blocs, estime quels blocs comptent, puis n’applique l’attention qu’aux régions sélectionnées. Dans la description de Qwen, cela réduit à la fois le calcul d’attention et la surcharge d’indexation nécessaire pour trouver le contexte pertinent. La conception s’accorde particulièrement bien avec un réseau hybride, car l’index clairsemé est construit indépendamment dans chaque couche d’attention plutôt que de reposer sur la similarité entre couches adjacentes.
Les gains d’efficacité sont substantiels. À un contexte de 1M de jetons, Qwen rapporte jusqu’à 7,6× plus rapide en préremplissage et 4,9× plus rapide en décodage pour le kernel d’attention QSA. Dans une expérience de serving à forte réutilisation de cache avec un taux de hits du cache de préfixe de 90 %, le modèle complet atteint 8,6× le débit de préremplissage de Qwen3.7-Plus à 1M de contexte.
Gated Residual : quatre branches plutôt qu’une
Un Transformer classique lit et écrit de manière répétée dans un unique flux résiduel. Qwen3.8-Flash-Next utilise au contraire Gated Residual pour élargir ce flux en quatre branches parallèles. Des portes de lecture élémentaires décident de la quantité d’information à prendre de chaque branche, tandis que des portes d’écriture au niveau des branches déterminent ce qui est réécrit.
L’objectif est de préserver les caractéristiques utiles en profondeur sans forcer chaque caractéristique à travers le même canal en mélange continu. Qwen indique aussi que la porte supprime les valeurs aberrantes d’activation et que l’état résiduel peut être stocké en FP8, réduisant le trafic mémoire. L’idée clé n’est pas simplement d’ajouter de la capacité résiduelle ; c’est un routage contrôlé de l’information à travers les couches.
N-gram Embedding : plus de capacité sans calcul proportionnel
Le modèle ajoute 51B de paramètres d’embedding N-gram au-delà des 125B de l’ossature principale. Contrairement à un embedding ordinaire indexé par un seul jeton, N-gram Embedding utilise des motifs locaux comme des bigrammes et trigrammes. Cela offre au modèle une grande mémoire de type lookup pour les motifs locaux récurrents.
La particularité réside dans l’emplacement de cette capacité. Comme l’adresse de lookup peut être connue avant que l’embedding ne soit nécessaire, la table peut être conservée en mémoire hôte et préchargée de manière asynchrone pendant que le GPU poursuit le calcul. Ainsi, les 51B paramètres supplémentaires ne se comportent pas comme 51B de paramètres supplémentaires de multiplications matrices denses. L’architecture met effectivement à l’échelle deux ressources différentes : des paramètres de modèle gourmands en calcul et une mémoire de lookup peu coûteuse en calcul.
Muon et optimisation de l’entraînement
Qwen entraîne l’architecture avec l’optimiseur Muon pour les applications linéaires bidimensionnelles telles que les poids principaux dans l’attention, GDN et les experts MoE, tandis que les embeddings, le routeur et les paramètres à faible rang de Gated Residual continuent d’utiliser AdamW. Les matrices fusionnées comme les projections QKV et SwiGLU sont scindées en leurs transformations linéaires indépendantes avant orthogonalisation.
L’équipe a également réajusté sa loi de scaling pour la nouvelle architecture et rapporte que le Batch Size Warmup conventionnel était inutile. Augmenter progressivement la taille de lot n’a pas amélioré le résultat final et a au contraire nécessité 18,8 % d’étapes d’optimiseur supplémentaires. La recette finale commence donc directement à la taille de lot cible.
MoE ultra clairsemé et Multi-Token Prediction
La fiche du modèle officielle mentionne 512 experts avec 10 experts routés et un expert partagé actifs par jeton. Le grand pool d’experts augmente la capacité stockée sans activer l’intégralité du modèle pour chaque jeton. Un module Multi-Token Prediction (MTP) d’une couche est entraîné avec plusieurs pas pour améliorer l’acceptation du décodage spéculatif tout en soutenant l’ossature principale.
Performances de Qwen3.8-Flash-Next aux benchmarks
Qwen publie de larges évaluations de langage, de codage, d’agents et vision-langage. Ces chiffres sont utiles parce que de nombreux modèles comparés ont été relancés dans l’infrastructure d’évaluation de Qwen, mais ils restent des évaluations de lancement rapportées par le fournisseur, pas des reproductions indépendantes. Plusieurs lignes utilisent aussi des harnais ou juges spécifiques au benchmark, donc l’interprétation la plus prudente est directionnelle : elles montrent où Qwen3.8-Flash-Next est le plus fort et où des concurrents conservent l’avantage.
Performances en codage et agents
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
Le panorama du codage est solide mais nuancé. Qwen3.8-Flash-Next mène l’ensemble de comparaison listé sur SWE-bench Pro, SWE-bench Multilingual, CoWorkBench, JobBench, Toolathlon Verified et LiveCodeBench v6. Cependant, DeepSeek V4 Flash est devant sur NL2Repo-Bench, tandis que Claude Opus 4.6 mène HLE. L’efficacité constitue donc un titre plus défendable qu’une domination universelle des benchmarks.
Les gains les plus notables par rapport aux baselines Qwen précédents apparaissent sur les travaux à long horizon. CoWorkBench passe de 65.1 sur Qwen3.7-Plus à 73.9, tandis que JobBench passe de 27.6 à 55.7. Étant donné que CoWorkBench est un benchmark interne à Qwen, ces gains méritent une réplication indépendante, mais ils s’alignent avec l’orientation déclarée de l’architecture sur des workflows d’agents et de bureautique rentables.
Performances multimodales
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | Claude Opus 4.6 |
|---|---|---|---|---|
| ClawEval-MM (Pass@3 / Avg) | 64.4 / 60.4 | 57.4 / 56.9 | 57.4 / 60.1 | 52.5 / 54.7 |
| RecreationBench | 49.9 | 47.1 | 30.2 | -- |
| AndroidWorld | 84.5 | 81.9 | 81.0 | 62.0 |
| OSWorld 2.0 (Binary / Partial) | 19.4 / 52.3 | 19.4 / 48.0 | 2.8 / 21.5 | -- |
| Vision2Web | 64.0 | 62.9 | 42.1 | -- |
| ERQA | 72.3 | 65.5 | 69.8 | 40.8 |
| LVBench | 76.6 | 72.4 | 76.2 | 63.0 |
| RealWorldQA | 88.5 | 85.9 | 86.9 | 73.9 |
| MathVision (without / with CI) | 90.6 / 95.7 | 90.0 / 94.6 | 90.3 / 88.7 | 65.5 / -- |
| CharXiv RQ (without / with CI) | 84.6 / 90.6 | 83.7 / 90.2 | 85.8 / 85.9 | 66.0 / -- |
Source des données : évaluation de lancement officielle de Qwen**.
Les résultats multimodaux confirment qu’il ne s’agit pas seulement d’un modèle Flash axé sur le codage. Qwen3.8-Flash-Next obtient 84.5 sur AndroidWorld, 64.0 sur Vision2Web, 76.6 sur LVBench et 88.5 sur RealWorldQA dans le tableau de Qwen. La fiche du modèle fournit également des exemples d’entrée image et vidéo, avec des recommandations pour un échantillonnage à cadence plus élevée sur des charges vidéo à l’échelle de l’heure. charges vidéo.
Qwen3.8-Flash-Next vs autres modèles
Une comparaison utile doit dissocier trois questions : combien de calcul est activé par jeton, quelle est l’étendue des modalités et du contexte du modèle, et quelles performances sur des workflows représentatifs. Le simple nombre total de paramètres n’apporte pas ces réponses.
Qwen3.8-Flash-Next vs Qwen3.8-27B vs Qwen3.7-Plus
| Dimension | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus |
|---|---|---|---|
| Paramètres du modèle | 125B + 51B d’embedding N-gram | 27B | 397B |
| Paramètres activés | 6B | 27B | 17B |
| Contexte natif | 262K | 262K dans la configuration Qwen | Modèle de génération précédente à long contexte |
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 |
| CoWorkBench | 73.9 | 70.7 | 65.1 |
| JobBench | 55.7 | 33.4 | 27.6 |
| AndroidWorld | 84.5 | 81.9 | 81.0 |
Le résultat clé est la capacité par paramètre activé. Qwen3.8-Flash-Next active 6B paramètres par jeton contre 27B pour Qwen3.8-27B et 17B pour Qwen3.7-Plus, tout en étant devant sur les scores listés DeepSWE, CoWorkBench, JobBench et AndroidWorld. Le compromis se situe sur l’empreinte mémoire : la parcimonie réduit le calcul actif, pas la quantité de capacité modèle qui doit au final être stockée quelque part.
Qwen3.8-Flash-Next vs DeepSeek V4 Flash vs Claude Opus 4.6
| Dimension | Qwen3.8-Flash-Next | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|
| Poids | Poids ouverts | Poids ouverts | Fermé |
| Profil de paramètres annoncé | 125B principal + 51B N-gram ; 6B actifs | 284B au total ; 13B actifs | Non divulgué publiquement |
| Principale histoire d’efficacité | QSA + GDN + MoE 6B actifs + mémoire de lookup | MoE clairsemé à haut débit | Pile gérée pour raisonnement et agents |
| Multimodalité native | Texte, image, vidéo -> texte | Famille Flash orientée texte ; voie vision disponible séparément sur CometAPI | Texte + vision/fichiers via API hébergées |
| SWE-bench Pro* | 62.5 | 56.0 | 53.4 |
| CoWorkBench* | 73.9 | 45.1 | 68.2 |
| NL2Repo-Bench* | 48.1 | 54.2 | 47.6 |
| HLE* | 35.9 | 33.8 | 40.0 |
DeepSeek V4 Flash reste plus fort sur NL2Repo-Bench dans la comparaison de Qwen, ce qui compte pour la génération de code au niveau des dépôts. Claude Opus 4.6 est plus fort sur HLE dans le même tableau et représente un modèle fermé managé plutôt qu’une cible de déploiement ouverte. Qwen3.8-Flash-Next se distingue surtout par la combinaison de poids ouverts, multimodalité native, ingénierie long-contexte et un budget de paramètres actifs très réduit.
Qwen3.8-Flash-Next vs Qwen3.8-Max
| Dimension | Qwen3.8-Flash-Next | Qwen3.8-Max |
|---|---|---|
| Rôle | Aperçu architectural ouvert axé sur l’efficacité | Vaisseau amiral Qwen3.8 |
| Échelle principale/totale | 125B principal + 51B N-gram ; 6B actifs | 2.4T au total ; environ 95B actifs sur la page modèle CometAPI |
| Accent d’architecture | QSA, GDN, Gated Residual, N-gram Embedding, Muon | Capacité maximale de pointe à une échelle bien plus grande |
| Meilleur usage | Agents à grand volume, assistants de codage, automatisation multimodale, auto-hébergement | Raisonnement le plus difficile, grands agents d’entreprise, workloads centrés sur la capacité |
| Contexte | 262K natif ; jusqu’à 1M avec YaRN | Contexte de classe 1M hébergé sur les routes phares Qwen3.8 actuelles |
Les spécifications de Qwen3.8-Max sont basées sur la fiche modèle actuelle sur CometAPI.
La distinction est simple : Qwen3.8-Max est le vaisseau amiral centré sur la capacité, tandis que Qwen3.8-Flash-Next est l’expérience d’architecture et d’efficacité. Les développeurs qui hésitent entre les deux doivent se demander si le goulot d’étranglement est la capacité absolue du modèle ou le coût d’exécuter à grande échelle de nombreuses tâches à long contexte et à outils.
Tarification et disponibilité de Qwen3.8-Flash-Next
Les poids ouverts de Qwen3.8-Flash-Next sont publiés via Hugging Face et ModelScope. Pour le service managé, Qwen indique que la version de production s’appelle Qwen3.8-Flash sur QwenCloud, avec un contexte 1M activé par défaut et des outils officiels intégrés.
Qwen liste le prix de la version managée à $0.16 par million de jetons en entrée et $0.47 par million de jetons en sortie. Ce prix se réfère au modèle de production QwenCloud Qwen3.8-Flash, et non à l’auto-hébergement des poids ouverts.
| Route | Entrée | Sortie |
|---|---|---|
| Modèle de production QwenCloud (Qwen3.8-Flash) | $0.16 / 1M jetons | $0.47 / 1M jetons |
| Auto-hébergement à poids ouverts | Dépend de l’infrastructure | Dépend de l’infrastructure |
| Route CometAPI | Consulter la page du modèle en ligne | Consulter la page du modèle en ligne |
Les prix QwenCloud proviennent de l’ article de lancement officiel de Qwen* ; la facturation CometAPI doit être vérifiée sur la page modèle en ligne.*
Pour les utilisateurs de CometAPI, le modèle dédié Qwen3.8-Flash-Next identifie la route comme qwen3.8-flash-next. Étant donné que le routage, la disponibilité amont et la facturation peuvent évoluer indépendamment de la sortie à poids ouverts, les intégrations de production doivent consulter le catalogue en ligne de CometAPI avant de figer des hypothèses de prix.
Recommandation CometAPI
Qwen3.8-Flash-Next devrait bientôt être disponible via CometAPI. CometAPI fournit un endpoint unique compatible OpenAI (https://api.cometapi.com/v1) qui agrège plus de 500 modèles de fournisseurs majeurs, y compris la série Qwen. Cette approche réduit la dépendance à un fournisseur, simplifie l’expérimentation avec Qwen3.8-Flash (une fois disponible via la plateforme ou les endpoints Qwen associés) et rationalise les déploiements de production qui peuvent mixer des modèles selon les tâches (par ex., Qwen pour des agents de codage rentables + un autre modèle pour du raisonnement spécialisé). La documentation et les guides de démarrage rapide sont disponibles sur apidoc.cometapi.com et le site principal de CometAPI.
Que vous auto-hébergiez les poids ouverts, utilisiez QwenCloud ou passiez par une plateforme unifiée comme CometAPI, Qwen3.8-Flash-Next abaisse la barrière pour des agents multimodaux à long contexte et hautes performances.
Que peut faire Qwen3.8-Flash-Next ?
1. Agents de codage à grand volume
Un budget de 6B de paramètres actifs combiné à un score SWE-bench Pro de 62.5 dans l’évaluation de Qwen rend Qwen3.8-Flash-Next particulièrement intéressant pour des systèmes de codage qui exécutent de nombreuses sessions en parallèle. Exemples : revue de code, triage des tickets, navigation dans les dépôts, génération de tests et patching itératif où le débit compte presque autant que l’intelligence d’une seule exécution.
2. Travail de bureau et de connaissances à long horizon
CoWorkBench et JobBench sont centraux dans le positionnement du modèle. L’architecture est conçue pour des boucles d’agents qui lisent à répétition le contexte, appellent des outils, mettent à jour l’état et poursuivent le travail plutôt que de répondre une seule fois. Cela s’aligne naturellement avec des workflows de documents, analyse de feuilles de calcul, assemblage de rapports, synthèse de recherche et automatisation de processus métier.
3. Agents multimodaux pour ordinateur et mobile
Les entrées image et vidéo, les performances sur AndroidWorld, l’évaluation OSWorld et les résultats Vision2Web rendent le modèle pertinent pour des agents d’interface graphique. Il peut servir de couche de raisonnement derrière des systèmes qui interprètent des captures d’écran, manipulent des interfaces mobiles, reproduisent des mises en page d’applications ou combinent l’état visuel avec des appels d’outils.
4. Raisonnement visuel et vidéo longue durée
La fiche du modèle inclut des exemples explicites d’entrée vidéo et des conseils pour le prétraitement de vidéo à l’échelle de l’heure. Cela rend le modèle utile pour la réponse à des questions vidéo, la recherche dans des vidéos longues, l’extraction d’événements visuels et des workflows combinant compréhension vidéo et outils en aval.
5. Workflows de recherche et dépôts à un million de jetons
Le modèle ouvert est natif à 262,144 jetons et extensible à 1,000,000 avec YaRN. Cette distinction est importante : 1M est une extension, non le contexte natif du modèle ouvert. Pour de grands dépôts ou corpus de recherche, QSA vise à rendre le coût de récupération de ces longs contextes plus pratique qu’une attention globale dense.
Comment les développeurs peuvent-ils exécuter Qwen3.8-Flash-Next ?
Les développeurs peuvent télécharger les poids ouverts depuis Hugging Face et exécuter le modèle avec Transformers, vLLM, SGLang ou TokenSpeed. Qwen fournit des exemples OpenAI-compatibles de Chat Completions pour l’entrée texte et multimodale.
Par exemple, la fiche du modèle officielle démontre le service de Qwen/Qwen3.8-Flash-Next avec vLLM et des appels via /v1/chat/completions. Les entrées image et vidéo sont également démontrées via l’interface compatible OpenAI.
Qwen3.8-Flash-Next fonctionne en mode de réflexion par défaut. Les développeurs peuvent contrôler ce comportement via enable_thinking, preserve_thinking et reasoning_effort ; les niveaux documentés de reasoning-effort sont xhigh, medium et low.
Quelles sont les limites de Qwen3.8-Flash-Next ?
La plus grande limite pratique est le coût matériel. Bien que seuls 6B paramètres du modèle de langage soient activés, le checkpoint contient 125B paramètres de langage plus le composant d’embedding n-gram de 51B et 4B de paramètres MTP. Le dépôt actuel fait environ 360 GB, de sorte que le déploiement local reste une tâche lourde en infrastructure.
La deuxième limite est que 262K est la longueur de contexte native, pas 1M. Le modèle peut être étendu à 1M de jetons, mais une page CometAPI ou modèle ne devrait pas simplement indiquer « contexte natif 1M ». La formulation correcte est contexte natif 262K, extensible à 1M.
Enfin, les performances aux benchmarks sont hétérogènes. Qwen3.8-Flash-Next est très compétitif sur les tâches de codage et agent, mais ne mène pas tous les benchmarks. Par exemple, Claude Opus 4.6 obtient 40.0 sur HLE contre 35.9 pour Flash-Next, tandis que DeepSeek-V4-Flash-0731 mène les modèles listés sur NL2Repo-Bench.
Qwen3.8-Flash-Next : ce que cela annonce pour Qwen4
La portée plus large de cette sortie tient à son rôle d’aperçu précoce de l’architecture appelée à sous-tendre Qwen4. Qwen3.8-Flash-Next réunit Qwen Sparse Attention, Gated DeltaNet, des connexions résiduelles à quatre branches avec portes, N-gram Embedding, un pool d’experts MoE ultra clairsemé et Multi-Token Prediction. Ces choix montrent comment Qwen explore plus de capacité, un plus long contexte, et de meilleures performances multimodales et d’agents sans augmenter au même rythme le calcul actif.
Verdict final
Qwen3.8-Flash-Next est important car il change la nature du problème d’efficacité. Au lieu de traiter tous les paramètres comme équivalents, il combine un chemin MoE actif relativement petit avec une très grande mémoire de type lookup et un mécanisme de récupération clairsemé conçu pour le long contexte. Cela offre à Qwen plusieurs leviers indépendants pour augmenter la capacité sans accroître au même rythme le calcul matriciel par jeton.
Pour les développeurs, cela en fait une option convaincante pour des assistants de codage à grand volume, des agents à long contexte, l’automatisation multimodale et l’expérimentation auto-hébergée. Pour la feuille de route plus large de Qwen, c’est encore plus significatif : Qwen utilise explicitement cette sortie pour exposer la direction architecturale qu’il prévoit d’affiner vers Qwen4.
