Spécifications techniques de Qwen3.8-Flash-Next
| Spécification | Qwen3.8-Flash-Next |
|---|---|
| Développeur | Qwen Team, Alibaba Group |
| Type de modèle | Modèle de langage causal multimodal avec encodeur de vision ; MoE ultra clairsemé |
| Paramètres du modèle principal | 125B |
| Paramètres activés | 6B par jeton |
| Paramètres d'intégration des n-grammes | 51B supplémentaires |
| Paramètres MTP | 4B |
| Couches | 48 |
| Schéma d'attention hybride | 12 x [3 couches Gated DeltaNet + 1 couche Qwen Sparse Attention] |
| Experts MoE | 512 au total ; 10 acheminés + 1 partagé par jeton |
| Résidu à portes | 4 branches ; rang de goulot d'étranglement 320 |
| Fenêtre de contexte native | 262,144 jetons |
| Contexte étendu | Jusqu'à 1,000,000 jetons avec YaRN |
| Modalités | Entrée texte, image, vidéo ; sortie texte |
| Contrôles de réflexion | Modes pensée/sans pensée et contrôles de l'effort de raisonnement dans les API prises en charge |
| Déploiement | Transformers, vLLM, SGLang, TokenSpeed et autres frameworks pris en charge |
| Poids ouverts | Oui |
| ID de modèle CometAPI | qwen3.8-flash-next |
Qu'est-ce que Qwen3.8-Flash-Next ?
Qwen3.8-Flash-Next est un prochain modèle MoE multimodal à poids ouverts de l'équipe Qwen d'Alibaba. Plus important encore, il est présenté comme un aperçu précoce de l'architecture destinée à propulser la future famille de modèles Qwen4, plutôt que comme un simple checkpoint Qwen3.8 supplémentaire.
Qwen utilise cette version pour exposer sa direction architecturale de nouvelle génération à l'écosystème open source avant l'arrivée de la famille Qwen4 plus large. Cela offre aux développeurs de moteurs d'inférence, aux projets de quantification, aux frameworks de service de modèles et aux développeurs d'applications l'occasion de se préparer à l'avance aux changements architecturaux.
L'architecture actuellement dévoilée introduit deux composants importants : une architecture hybride basée sur GDN et Qwen Sparse Attention (QSA). GDN renvoie à une approche d'attention linéaire de style DeltaNet avec portes, qui s'inscrit dans l'orientation d'attention hybride précédemment explorée dans Qwen3-Next. QSA est présenté comme un nouveau mécanisme d'attention clairsemée, bien que sa spécification technique complète n'ait pas encore été rendue publique.
Principales caractéristiques de Qwen3.8-Flash-Next
- Aperçu de l'architecture Qwen4 : Qwen3.8-Flash-Next est explicitement présenté comme une implémentation précoce de la direction architecturale qui alimentera la future famille Qwen4.
- Conception MoE multimodale : le modèle est décrit comme un modèle Mixture-of-Experts multimodal, prolongeant la stratégie de modèle parcimonieux efficace de Qwen vers une nouvelle génération d'architecture.
- Architecture hybride GDN : le modèle poursuit la direction de recherche en attention hybride introduite avec Qwen3-Next, combinant des mécanismes d'attention linéaire efficaces avec une attention conventionnelle là où une récupération précise est importante. Qwen3-Next a montré que cette approche peut améliorer sensiblement l'efficacité de l'inférence sur long contexte.
- Qwen Sparse Attention : QSA est l'un des deux changements architecturaux publiquement mis en avant pour Flash-Next. Sa mise en œuvre détaillée et ses bénéfices quantitatifs restent à documenter par Qwen.
- Orientation vers l'écosystème à poids ouverts : cette version vise à donner à la communauté open source un accès anticipé aux changements architecturaux afin que les environnements d'inférence et les outils en aval puissent s'adapter avant l'arrivée de Qwen4.
- Performances en codage et en agents de Qwen3.8-Flash-Next
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
Qwen3.8-Flash-Next vs Qwen3.8-Max vs Qwen3.8-27B
| Modèle | Positionnement | Architecture / Échelle | Multimodal | Statut actuel |
|---|---|---|---|---|
| Qwen3.8-Flash-Next | Aperçu de l'architecture Qwen4 / modèle ouvert orienté efficacité | MoE multimodal ; spécifications complètes en attente | Oui | À venir |
| Qwen3.8-Max | Modèle Qwen3.8 phare hébergé | MoE à grande échelle | Oui | Disponible |
| Qwen3.8-27B | Modèle Qwen3.8 à poids ouverts | Modèle dense 27B | Capacités spécifiques au modèle | Disponible |
Qwen3.8-Max est déjà disponible via l'écosystème cloud d'Alibaba et est positionné pour le raisonnement avancé, la compréhension visuelle, le codage et les charges agentiques. La documentation actuelle de Qwen répertorie Qwen3.8-Max avec une fenêtre de contexte de 1M de jetons, tandis que CometAPI expose déjà qwen3.8-max.
Flash-Next doit donc être considéré différemment : son importance principale à ce stade est architecturale plutôt que fondée sur les benchmarks. Il préfigure la direction technique de Qwen4 et offre à l'écosystème open source une cible anticipée pour l'optimisation des environnements d'exécution et du déploiement.