Qwen3.8-Flash-Next Technische Spezifikationen
| Spezifikation | Qwen3.8-Flash-Next |
|---|---|
| Entwickler | Qwen Team, Alibaba Group |
| Modelltyp | Multimodales kausales Sprachmodell mit Vision-Encoder; ultrasparsames MoE |
| Parameter des Hauptmodells | 125B |
| Aktivierte Parameter | 6B pro Token |
| N-Gramm-Embedding-Parameter | 51B zusätzlich |
| MTP-Parameter | 4B |
| Schichten | 48 |
| Hybrid-Attentionsmuster | 12 x [3 Gated-DeltaNet-Schichten + 1 Qwen Sparse Attention-Schicht] |
| MoE-Experten | insgesamt 512; 10 geroutet + 1 gemeinsam pro Token |
| Gated-Residual | 4 Zweige; Bottleneck-Rang 320 |
| Natives Kontextfenster | 262,144 Tokens |
| Erweiterter Kontext | Bis zu 1,000,000 Tokens mit YaRN |
| Modalitäten | Text, Bild, Videoeingabe; Textausgabe |
| Denksteuerungen | Thinking/Nicht-Thinking sowie Steuerungen des Reasoning-Aufwands in unterstützten APIs |
| Bereitstellung | Transformers, vLLM, SGLang, TokenSpeed und andere unterstützte Frameworks |
| Offene Gewichte | Ja |
| CometAPI-Modell-ID | qwen3.8-flash-next |
Was ist Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next ist ein bevorstehendes multimodales MoE-Modell mit offenen Gewichten vom Qwen-Team von Alibaba. Wichtiger noch: Es ist als eine frühe Vorschau auf die Architektur positioniert, die die zukünftige Qwen4-Modellfamilie antreiben soll, und nicht lediglich als ein weiterer inkrementeller Qwen3.8-Checkpoint.
Qwen nutzt diese Veröffentlichung, um die nächste Generation seiner Architektur dem Open-Source-Ökosystem vor dem breiteren Erscheinen der Qwen4-Familie zugänglich zu machen. Dies gibt Entwicklern von Inferenz-Engines, Quantisierungsprojekten, Model-Serving-Frameworks und Anwendungsentwicklern die Möglichkeit, sich im Voraus auf die Architekturänderungen vorzubereiten.
Die derzeit offengelegte Architektur führt zwei wichtige Komponenten ein: eine GDN-basierte Hybridarchitektur und Qwen Sparse Attention (QSA). GDN bezeichnet einen Gated-DeltaNet-Stil-Ansatz für lineare Aufmerksamkeit, der der in Qwen3-Next zuvor verfolgten Hybrid-Attention-Richtung folgt. QSA wird als neuer Sparse-Attention-Mechanismus vorgestellt, dessen vollständige technische Spezifikation jedoch noch nicht öffentlich dokumentiert ist.
Hauptmerkmale von Qwen3.8-Flash-Next
- Vorschau auf die Qwen4-Architektur: Qwen3.8-Flash-Next ist ausdrücklich als frühe Implementierung der Architekturrichtung positioniert, die die kommende Qwen4-Familie antreiben wird.
- Multimodales MoE-Design: Das Modell wird als multimodales Mixture-of-Experts-Modell beschrieben und erweitert Qwens Strategie effizienter sparsamer Modelle hin zu einer neuen Architekturgeneration.
- GDN-Hybridarchitektur: Das Modell führt die mit Qwen3-Next eingeführte Hybrid-Attention-Forschung fort, indem es effiziente Mechanismen für lineare Aufmerksamkeit mit konventioneller Aufmerksamkeit kombiniert, wo präzises Retrieval wichtig ist. Qwen3-Next zeigte, dass dieser Ansatz die Effizienz bei Inferenz mit langen Kontexten erheblich verbessern kann.
- Qwen Sparse Attention: QSA ist eine der zwei öffentlich hervorgehobenen Architekturänderungen für Flash-Next. Detaillierte Implementierung und quantitative Vorteile müssen von Qwen noch dokumentiert werden.
- Ausrichtung auf das Open-Weight-Ökosystem: Die Veröffentlichung soll der Open-Source-Community frühzeitig Zugang zu den Architekturänderungen geben, damit Inferenz-Runtimes und nachgelagerte Tools sich anpassen können, bevor Qwen4 erscheint.
- Coding- und Agentenleistung von Qwen3.8-Flash-Next
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
Qwen3.8-Flash-Next vs. Qwen3.8-Max vs. Qwen3.8-27B
| Modell | Positionierung | Architektur / Skalierung | Multimodal | Aktueller Status |
|---|---|---|---|---|
| Qwen3.8-Flash-Next | Qwen4-Architekturvorschau / effizienzorientiertes Open-Modell | Multimodales MoE; vollständige Spezifikationen ausstehend | Ja | Bevorstehend |
| Qwen3.8-Max | Flaggschiff-gehostetes Qwen3.8-Modell | Großskaliges MoE | Ja | Verfügbar |
| Qwen3.8-27B | Open-Weight-Qwen3.8-Modell | 27B dichtes Modell | Modellspezifische Fähigkeiten | Verfügbar |
Qwen3.8-Max ist bereits über Alibabas Cloud-Ökosystem verfügbar und ist für fortgeschrittenes Reasoning, visuelles Verständnis, Coding und agentische Workloads positioniert. Die aktuelle Dokumentation von Qwen führt Qwen3.8-Max mit einem Kontextfenster von 1M Tokens auf, während CometAPI bereits qwen3.8-max bereitstellt.
Flash-Next sollte daher anders betrachtet werden: Seine primäre Bedeutung ist in diesem Stadium eher architektonisch als benchmarkbasiert. Es zeigt die technische Richtung von Qwen4 vor und bietet dem Open-Source-Ökosystem ein früheres Ziel für Laufzeit- und Bereitstellungsoptimierung.