Specyfikacja techniczna Qwen3.8-Flash-Next
| Specyfikacja | Qwen3.8-Flash-Next |
|---|---|
| Twórca | Zespół Qwen, Alibaba Group |
| Typ modelu | Multimodalny przyczynowy model językowy z enkoderem wizji; ultra-rzadkie MoE |
| Parametry głównego modelu | 125B |
| Aktywowane parametry | 6B na token |
| Parametry osadzeń n-gramów | 51B dodatkowe |
| Parametry MTP | 4B |
| Warstwy | 48 |
| Wzorzec hybrydowej uwagi | 12 x [3 warstwy Gated DeltaNet + 1 warstwa Qwen Sparse Attention] |
| Eksperci MoE | 512 łącznie; 10 routowanych + 1 współdzielony na token |
| Gated Residual | 4 gałęzie; rząd wąskiego gardła 320 |
| Natywne okno kontekstu | 262,144 tokenów |
| Rozszerzony kontekst | Do 1,000,000 tokenów z YaRN |
| Modalności | Tekst, obraz, wideo jako wejście; tekst jako wyjście |
| Sterowanie trybem myślenia | Tryb myślenia/brak myślenia oraz sterowanie nakładem rozumowania w obsługiwanych API |
| Wdrożenie | Transformers, vLLM, SGLang, TokenSpeed i inne obsługiwane frameworki |
| Otwarte wagi | Tak |
| ID modelu w CometAPI | qwen3.8-flash-next |
Czym jest Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next to nadchodzący multimodalny model MoE o otwartych wagach od zespołu Qwen firmy Alibaba. Co ważniejsze, jest pozycjonowany jako wczesna zapowiedź architektury przeznaczonej do zasilenia przyszłej rodziny modeli Qwen4, a nie po prostu kolejny przyrostowy checkpoint Qwen3.8.
Qwen wykorzystuje to wydanie, aby zaprezentować społeczności open-source kierunek swojej następnej generacji architektury, zanim pojawi się szersza rodzina Qwen4. Daje to twórcom silników wnioskowania, projektom kwantyzacji, frameworkom do serwowania modeli oraz twórcom aplikacji możliwość wcześniejszego przygotowania się na zmiany architektoniczne.
Ujawniona dotąd architektura wprowadza dwa istotne komponenty: hybrydową architekturę opartą na GDN oraz Qwen Sparse Attention (QSA). GDN odnosi się do podejścia liniowej uwagi w stylu DeltaNet z bramkowaniem, które kontynuuje kierunek hybrydowej uwagi wcześniej eksplorowany w Qwen3-Next. QSA jest przedstawiane jako nowy mechanizm rzadkiej uwagi, choć jego pełna specyfikacja techniczna nie została jeszcze publicznie udokumentowana.
Najważniejsze cechy Qwen3.8-Flash-Next
- Zapowiedź architektury Qwen4: Qwen3.8-Flash-Next jest wyraźnie pozycjonowany jako wczesna implementacja kierunku architektonicznego, który zasili nadchodzącą rodzinę Qwen4.
- Multimodalny projekt MoE: Model jest opisywany jako multimodalny Mixture-of-Experts, rozszerzający skuteczną strategię rzadkich modeli Qwen w kierunku nowej generacji architektury.
- Hybrydowa architektura GDN: Model kontynuuje kierunek badań nad hybrydową uwagą zapoczątkowany w Qwen3-Next, łącząc wydajne mechanizmy liniowej uwagi z konwencjonalną uwagą tam, gdzie kluczowe jest precyzyjne wyszukiwanie. Qwen3-Next pokazał, że takie podejście może znacząco poprawić efektywność wnioskowania w długim kontekście.
- Qwen Sparse Attention: QSA to jedna z dwóch zmian architektonicznych publicznie wyróżnionych w Flash-Next. Jej szczegółowa implementacja i korzyści ilościowe pozostają do udokumentowania przez Qwen.
- Ukierunkowanie na ekosystem otwartych wag: Wydanie ma na celu zapewnić społeczności open-source wczesny dostęp do zmian architektonicznych, aby środowiska uruchomieniowe wnioskowania i narzędzia downstream mogły dostosować się przed nadejściem Qwen4.
- Wydajność w zadaniach kodowania i agentowych modelu Qwen3.8-Flash-Next
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
Qwen3.8-Flash-Next vs Qwen3.8-Max vs Qwen3.8-27B
| Model | Pozycjonowanie | Architektura / skala | Multimodalność | Aktualny status |
|---|---|---|---|---|
| Qwen3.8-Flash-Next | Zapowiedź architektury Qwen4 / otwarty model ukierunkowany na efektywność | Multimodalny MoE; pełne specyfikacje w przygotowaniu | Tak | Nadchodzący |
| Qwen3.8-Max | Flagowy hostowany model Qwen3.8 | Duża skala MoE | Tak | Dostępny |
| Qwen3.8-27B | Model Qwen3.8 o otwartych wagach | Gęsty model 27B | Możliwości specyficzne dla modelu | Dostępny |
Qwen3.8-Max jest już dostępny w ekosystemie chmurowym Alibaby i jest pozycjonowany pod zaawansowane rozumowanie, rozumienie wizualne, kodowanie oraz obciążenia agentskie. Obecna dokumentacja Qwena podaje, że Qwen3.8-Max ma okno kontekstu 1M tokenów, a CometAPI już udostępnia qwen3.8-max.
Flash-Next należy zatem postrzegać inaczej: jego główne znaczenie na tym etapie ma charakter architektoniczny, a nie benchmarkowy. Zapowiada on kierunek techniczny Qwen4 i daje ekosystemowi open-source wcześniejszy cel dla optymalizacji środowisk uruchomieniowych i wdrożeń.