Qwen3.8-Flash-Next nie jest po prostu mniejszym ani szybszym członkiem rodziny Qwen3.8. Qwen opisuje go jako wielomodowy model MoE o otwartych wagach i wczesną zapowiedź architektury użytej w Qwen4. Projekt jednocześnie zmienia mechanizmy uwagi, połączenia resztkowe, pojemność osadzeń i optymalizację, aby poprawić zdolności przy jednoczesnym ostrym ograniczeniu kosztu obliczeń na token.
TL;DR
Qwen3.8-Flash-Next łączy główny model o 125B parametrach z dodatkowymi 51B w tablicy osadzeń N-gramów, przy aktywacji jedynie 6B parametrów na token. Natywnie obsługuje 262,144 tokeny i może zostać rozszerzony do 1,000,000 tokenów dzięki YaRN. Architektura opiera się na mieszance 3:1 Gated DeltaNet i Qwen Sparse Attention, czterogałęziowych połączeniach Gated Residual, N-gram Embedding, dużej ultrarzadkiej puli ekspertów MoE, Multi-Token Prediction oraz treningu opartym na Muon.
Najważniejszy jest nacisk na wydajność, a nie na samą liczbę parametrów. Qwen podaje, że trening modelu wymaga około jednej dziewiątej kosztu Qwen3.7-Plus, a jego wyniki startowe plasują model przed poprzednimi bazami Qwen w wielu zadaniach z zakresu kodowania, agentów biurowych i multimodalności. Są to wyniki raportowane przez dostawcę i należy je traktować jako dane z premiery, a nie niezależną walidację.
Dla deweloperów wagi są dostępne w kanałach Qwen, a zarządzana wersja produkcyjna nazywa się Qwen3.8-Flash w QwenCloud. CometAPI wymienia Qwen3.8-Flash-Next z identyfikatorem modelu qwen3.8-flash-next, zapewniając jednolitą ścieżkę obok innych modeli klasy frontier.
Najważniejsze wnioski
- 125B parametrów głównego modelu + 51B w osadzeniach N-gramów, z 6B aktywnymi parametrami na token.
- Hybrydowy wzorzec uwagi 3 GDN : 1 QSA zaprojektowany tak, by łączyć efektywne zarządzanie pamięcią z precyzyjnym wyszukiwaniem odległego kontekstu.
- Natywny kontekst 262,144 tokeny i do 1M tokenów dzięki YaRN.
- Qwen raportuje do 7.6x przyspieszenia prefill i 4.9x decode dla jądra przy 1M kontekstu w QSA.
- Strumień resztkowy jest poszerzony do czterech bramkowanych gałęzi, co poprawia przepływ informacji między warstwami i stabilność treningu.
- Oficjalna tabela premiery pokazuje mocne wyniki w SWE-bench Pro, CoWorkBench, JobBench, Toolathlon, AndroidWorld i RealWorldQA, ale bez pełnej dominacji we wszystkich benchmarkach.
- Qwen pozycjonuje wydanie jako zapowiedź architektury, więc jego znaczenie dotyczy także tego, co sygnalizuje dla Qwen4, a nie tylko obecnej pozycji w rankingach.
Czym jest Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next to przyczynowy wielomodowy model językowy z enkoderem wizji i ultrarzadkim językowym kręgosłupem Mixture-of-Experts. Oficjalna karta modelu opisuje architekturę 48-warstwową z 512 ekspertami, 10 trasowanymi ekspertami plus jednym współdzielonym oraz układ ukryty, w którym powtarzają się trzy warstwy Gated DeltaNet, po których następuje jedna warstwa Qwen Sparse Attention.
Wydanie pełni rolę podobną do Qwen3-Next: ujawnia zmiany architektoniczne, zanim zostaną przeskalowane do kolejnej pełnej rodziny. Qwen wprost nazywa model eksperymentalną zapowiedzią architektury, która będzie podstawą Qwen4. To czyni go wyjątkowo interesującym dla inżynierów, którym zależy na efektywnym serwowaniu, długim kontekście i kierunku badań nad architekturą otwartych modeli.
4 kluczowe komponenty Qwen3.8-Flash-Next
Model zmienia jednocześnie cztery kluczowe komponenty: uwagę, przepływ resztkowy, pojemność osadzeń i optymalizację. Taki współprojekt ma znaczenie, bo zyski efektywności w jednym komponencie mogą zostać utracone, jeśli inny stanie się wąskim gardłem przy długim kontekście lub dużej skali.
Hybrydowa uwaga: GDN + Qwen Sparse Attention
Większość warstw nie wykonuje globalnej uwagi. Zamiast tego trzy na cztery warstwy używają Gated DeltaNet do kompresowania informacji historycznych w stan o stałym rozmiarze. Czwarta warstwa używa globalnej uwagi do dokładnego wyszukiwania, ale jest ona przeprojektowana jako Qwen Sparse Attention (QSA).
QSA unika niezależnego przeszukiwania każdego tokena. Lekki indeksator najpierw grupuje sekwencję w mikrobloki, szacuje, które bloki są istotne, a następnie kieruje uwagę tylko na wybrane regiony. Według opisu Qwen redukuje to zarówno koszt obliczeń uwagi, jak i narzut indeksowania potrzebny do znalezienia relewantnego kontekstu. Projekt szczególnie dobrze współgra z siecią hybrydową, ponieważ rzadki indeks jest budowany niezależnie w każdej warstwie uwagi, zamiast polegać na podobieństwie między sąsiednimi warstwami uwagi.
Liczby efektywności są znaczące. Przy kontekście 1M tokenów Qwen raportuje do 7.6x szybszy prefill i 4.9x szybszy decode dla jądra uwagi QSA. W eksperymencie serwowania o wysokiej ponowności cache z 90% trafień cache prefiksu pełny model osiąga 8.6x przepustowość prefill względem Qwen3.7-Plus przy kontekście 1M.
Gated Residual: cztery ścieżki zamiast jednej
Konwencjonalny Transformer wielokrotnie odczytuje i zapisuje jeden strumień resztkowy. Qwen3.8-Flash-Next zamiast tego używa Gated Residual, aby poszerzyć ten strumień do czterech równoległych gałęzi. Bramki odczytu element-po-elemencie decydują, ile informacji pobrać z każdej gałęzi, a bramki zapisu na poziomie gałęzi określają, co jest zapisywane z powrotem.
Celem jest zachowanie użytecznych cech w głębi bez zmuszania każdej cechy do przechodzenia przez ten sam, ciągle mieszany kanał. Qwen raportuje również, że bramkowanie tłumi skrajne wartości aktywacji i że stan resztkowy można przechowywać w FP8, zmniejszając ruch pamięci. Kluczową ideą nie jest po prostu większa pojemność resztkowa, lecz kontrolowane trasowanie informacji między warstwami.
N-gram Embedding: większa pojemność bez proporcjonalnego kosztu obliczeń
Model dodaje 51B parametrów osadzeń N-gramów poza 125B w głównym trzonie. W odróżnieniu od zwykłych osadzeń indeksowanych pojedynczym tokenem, N-gram Embedding używa lokalnych wzorców tokenów, takich jak bigramy i trigramy. Daje to modelowi dużą pamięć w stylu tablicy wyszukiwań dla powtarzających się lokalnych wzorców.
Nietypowe jest miejsce umieszczenia tej pojemności. Ponieważ adres odczytu można znać przed potrzebą osadzenia, tablica może być trzymana w pamięci hosta i asynchronicznie prefetczowana podczas trwania obliczeń na GPU. Oznacza to, że dodatkowe 51B parametrów nie zachowuje się jak 51B dodatkowych gęstych parametrów macierzowych. Architektura efektywnie skaluje dwa różne zasoby: parametry obliczeniowo ciężkie oraz pamięć odczytową o niskim koszcie obliczeń.
Muon i optymalizacja treningu
Qwen trenuje architekturę z użyciem optymalizatora Muon dla dwuwymiarowych odwzorowań liniowych, takich jak główne wagi w uwadze, GDN i ekspertach MoE, podczas gdy osadzenia, router i niskowymiarowe parametry Gated Residual nadal używają AdamW. Zunifikowane macierze, takie jak QKV i projekcje SwiGLU, są dzielone na niezależne przekształcenia liniowe przed ortogonalizacją.
Zespół dopasował również na nowo prawo skalowania do tej architektury i raportuje, że konwencjonalny Batch Size Warmup nie był konieczny. Stopniowe zwiększanie rozmiaru partii nie poprawiło wyniku końcowego, a zamiast tego wymagało 18.8% więcej kroków optymalizatora. Ostateczna receptura startuje więc bezpośrednio od docelowego rozmiaru partii.
Ultra-rare MoE i Multi-Token Prediction
Oficjalna karta modelu wymienia 512 ekspertów, z czego 10 trasowanych i jednego współdzielonego aktywnych na token. Duża pula ekspertów zwiększa pojemność pamięci bez aktywowania całego modelu dla każdego tokena. Jednowarstwowy moduł Multi-Token Prediction (MTP) jest trenowany wielostopniowo, by poprawić akceptację spekulatywnego dekodowania, jednocześnie wspierając główny trzon.
Wyniki benchmarków Qwen3.8-Flash-Next
Qwen publikuje szerokie ewaluacje językowe, kodowe, agentowe i wizyjno-językowe. Te liczby są użyteczne, ponieważ wiele modeli porównawczych uruchomiono ponownie w środowisku Qwen, ale nadal są to raportowane przez dostawcę wyniki premierowe, a nie niezależne reprodukcje benchmarków. Kilka wierszy używa też specyficznych dla benchmarku narzędzi lub sędziów, więc najbezpieczniejsza interpretacja jest kierunkowa: pokazują, gdzie Qwen3.8-Flash-Next jest najsilniejszy, a gdzie konkurenci wciąż prowadzą.
Wydajność w kodowaniu i zadaniach agentowych
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
Historia kodowania jest mocna, ale z niuansami. Qwen3.8-Flash-Next prowadzi w zestawie porównań na SWE-bench Pro, SWE-bench Multilingual, CoWorkBench, JobBench, Toolathlon Verified i LiveCodeBench v6. Jednak DeepSeek V4 Flash wyprzedza na NL2Repo-Bench, a Claude Opus 4.6 prowadzi na HLE. To sprawia, że wydajność jest bardziej obronnym nagłówkiem niż uniwersalna dominacja benchmarków.
Najbardziej godne uwagi zyski względem poprzednich baz Qwen pojawiają się w pracy długohoryzontowej. CoWorkBench rośnie z 65.1 na Qwen3.7-Plus do 73.9, a JobBench z 27.6 do 55.7. Ponieważ CoWorkBench to wewnętrzny benchmark Qwen, te zyski wymagają niezależnej replikacji, ale są zgodne z deklarowanym przez architekturę naciskiem na ekonomiczne kosztowo przepływy pracy agentów i biura.
Wydajność multimodalna
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | Claude Opus 4.6 |
|---|---|---|---|---|
| ClawEval-MM (Pass@3 / Avg) | 64.4 / 60.4 | 57.4 / 56.9 | 57.4 / 60.1 | 52.5 / 54.7 |
| RecreationBench | 49.9 | 47.1 | 30.2 | -- |
| AndroidWorld | 84.5 | 81.9 | 81.0 | 62.0 |
| OSWorld 2.0 (Binary / Partial) | 19.4 / 52.3 | 19.4 / 48.0 | 2.8 / 21.5 | -- |
| Vision2Web | 64.0 | 62.9 | 42.1 | -- |
| ERQA | 72.3 | 65.5 | 69.8 | 40.8 |
| LVBench | 76.6 | 72.4 | 76.2 | 63.0 |
| RealWorldQA | 88.5 | 85.9 | 86.9 | 73.9 |
| MathVision (without / with CI) | 90.6 / 95.7 | 90.0 / 94.6 | 90.3 / 88.7 | 65.5 / -- |
| CharXiv RQ (without / with CI) | 84.6 / 90.6 | 83.7 / 90.2 | 85.8 / 85.9 | 66.0 / -- |
Źródło danych: oficjalna ewaluacja premierowa Qwen**.
Wyniki multimodalne potwierdzają, że nie jest to jedynie model Flash skupiony na kodowaniu. Qwen3.8-Flash-Next zdobywa 84.5 na AndroidWorld, 64.0 na Vision2Web, 76.6 na LVBench i 88.5 na RealWorldQA w tabeli Qwen. Karta modelu zawiera też przykłady wejść obrazów i wideo, w tym rekomendacje wyższego próbkowania klatek przy zadaniach wideo w skali godzin. obciążenia wideo. obciążenia wideo.
Qwen3.8-Flash-Next a inne modele
Użyteczne porównanie powinno rozdzielić trzy pytania: ile obliczeń jest aktywowanych na token, jak szerokie są modalności i kontekst modelu oraz jak dobrze działa w reprezentatywnych przepływach pracy. Sama łączna liczba parametrów nie odpowiada na te pytania.
Qwen3.8-Flash-Next vs Qwen3.8-27B vs Qwen3.7-Plus
| Wymiar | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus |
|---|---|---|---|
| Parametry modelu | 125B + 51B N-gram embedding | 27B | 397B |
| Aktywowane parametry | 6B | 27B | 17B |
| Natywny kontekst | 262K | 262K w zestawie porównawczym Qwen | Model długiego kontekstu poprzedniej generacji |
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 |
| CoWorkBench | 73.9 | 70.7 | 65.1 |
| JobBench | 55.7 | 33.4 | 27.6 |
| AndroidWorld | 84.5 | 81.9 | 81.0 |
Kluczowym wynikiem jest zdolność na aktywowany parametr. Qwen3.8-Flash-Next aktywuje 6B parametrów na token wobec 27B dla Qwen3.8-27B i 17B dla Qwen3.7-Plus, a mimo to jest z przodu w wymienionych wynikach DeepSWE, CoWorkBench, JobBench i AndroidWorld. Kompromisem jest ślad pamięciowy: rzadkość zmniejsza aktywne obliczenia, nie zaś ilość pojemności modelu, którą ostatecznie trzeba gdzieś przechowywać.
Qwen3.8-Flash-Next vs DeepSeek V4 Flash vs Claude Opus 4.6
| Wymiar | Qwen3.8-Flash-Next | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|
| Wagi | Otwarte | Otwarte | Zamknięte |
| Profil parametrów (rap.) | 125B główny + 51B N-gram; 6B aktywne | 284B łącznie; 13B aktywne | Nieujawnione publicznie |
| Główna historia efektyw. | QSA + GDN + 6B aktywne MoE + pamięć lookup | Wysokoprzepustowy rzadki MoE | Zarządzany stos rozumowania i agentów |
| Natywna multimodalność | Tekst, obraz, wideo -> tekst | Rodzina Flash ukierunkowana na tekst; ścieżka wizji dostępna osobno w CometAPI | Tekst + wizja/pliki przez hostowane API |
| SWE-bench Pro* | 62.5 | 56.0 | 53.4 |
| CoWorkBench* | 73.9 | 45.1 | 68.2 |
| NL2Repo-Bench* | 48.1 | 54.2 | 47.6 |
| HLE* | 35.9 | 33.8 | 40.0 |
DeepSeek V4 Flash pozostaje mocniejszy na NL2Repo-Bench w porównaniu Qwen, co ma znaczenie dla generowania kodu na poziomie repozytorium. Claude Opus 4.6 jest silniejszy na HLE w tej samej tabeli i reprezentuje zamknięty model zarządzany, a nie otwarty cel wdrożenia. Qwen3.8-Flash-Next wyróżnia się połączeniem otwartych wag, natywnej multimodalności, inżynierii długiego kontekstu i bardzo małego budżetu aktywnych parametrów.
Qwen3.8-Flash-Next vs Qwen3.8-Max
| Wymiar | Qwen3.8-Flash-Next | Qwen3.8-Max |
|---|---|---|
| Rola | Efektywność przede wszystkim; otwarta zapowiedź architektury | Flagowiec Qwen3.8 |
| Skala gł./łączna | 125B główny + 51B N-gram; 6B aktywne | 2.4T łącznie; około 95B aktywnych na stronie modelu CometAPI |
| Nacisk architekton. | QSA, GDN, Gated Residual, N-gram Embedding, Muon | Maksymalna zdolność frontier przy znacznie większej skali |
| Najlepsze zastos. | Agenci o dużym wolumenie, asystenci kodowania, automatyzacja multimodalna, self-hosting | Najtrudniejsze rozumowanie, duże agenty korporacyjne, zadania capability-first |
| Kontekst | 262K natywnie; do 1M z YaRN | Kontekst klasy 1M w hostowanych trasach na obecnych ścieżkach Qwen3.8 |
Specyfikacje Qwen3.8-Max oparto na bieżącym wpisie modelu w CometAPI.
Różnica jest prosta: Qwen3.8-Max to flagowiec stawiający na zdolności, a Qwen3.8-Flash-Next to eksperyment architektoniczno-wydajnościowy. Deweloperzy wybierający między nimi powinni zapytać, czy wąskim gardłem jest absolutna zdolność modelu, czy koszt uruchamiania wielu długokontekstowych, korzystających z narzędzi zadań na skalę.
Cennik i dostępność Qwen3.8-Flash-Next
Otwarte wagi Qwen3.8-Flash-Next są opublikowane przez Hugging Face i ModelScope. Dla serwowania zarządzanego Qwen podaje, że wersja produkcyjna nazywa się Qwen3.8-Flash w QwenCloud, z kontekstem 1M włączonym domyślnie i oficjalnymi wbudowanymi narzędziami.
Qwen wymienia cenę zarządzanego modelu produkcyjnego na poziomie $0.16 za milion tokenów wejściowych i $0.47 za milion tokenów wyjściowych. Ta cena dotyczy produkcyjnego modelu QwenCloud Qwen3.8-Flash, a nie samodzielnego hostowania otwartych wag.
| Trasa | Wejście | Wyjście |
|---|---|---|
| Model produkcyjny QwenCloud (Qwen3.8-Flash) | $0.16 / 1M tokenów | $0.47 / 1M tokenów |
| Samodzielny hosting otwartych wag | Zależne od infrastruktury | Zależne od infrastruktury |
| Trasa CometAPI | Sprawdź stronę modelu | Sprawdź stronę modelu |
Ceny QwenCloud pochodzą z oficjalnego artykułu Qwen o premierze; rozliczenia CometAPI należy sprawdzić na aktualnej stronie modelu.
Dla użytkowników CometAPI dedykowany model Qwen3.8-Flash-Next identyfikuje ścieżkę jako qwen3.8-flash-next. Ponieważ trasowanie, dostępność upstream i rozliczenia mogą zmieniać się niezależnie od wydania wag otwartych, integracje produkcyjne powinny sprawdzać aktualny katalog CometAPI, zanim na stałe założą ceny.
Rekomendacja CometAPI
Qwen3.8-Flash-Next jest spodziewany wkrótce w CometAPI. CometAPI dostarcza pojedynczy endpoint kompatybilny z OpenAI (https://api.cometapi.com/v1), który agreguje 500+ modeli od wiodących dostawców, w tym modele serii Qwen. To podejście ogranicza uzależnienie od jednego dostawcy, upraszcza eksperymenty z Qwen3.8-Flash (gdy będzie dostępny przez platformę lub powiązane endpointy Qwen) oraz usprawnia wdrożenia produkcyjne, które mogą mieszać modele do różnych zadań (np. Qwen do ekonomicznych kosztowo agentów kodujących + inny model do wyspecjalizowanego rozumowania). Dokumentacja i przewodniki quick-start są dostępne na apidoc.cometapi.com i głównej stronie CometAPI.
Niezależnie od tego, czy samodzielnie hostujesz wagi, używasz QwenCloud, czy korzystasz z ujednoliconej platformy takiej jak CometAPI, Qwen3.8-Flash-Next obniża barierę dla wydajnych, długokontekstowych, multimodalnych agentów.
Co potrafi Qwen3.8-Flash-Next?
1. Agenci kodujący o dużym wolumenie
Budżet 6B aktywnych parametrów połączony z wynikiem 62.5 na SWE-bench Pro w ewaluacji Qwen czyni Qwen3.8-Flash-Next szczególnie interesującym dla systemów kodujących uruchamiających wiele równoległych sesji. Przykłady obejmują przegląd kodu, triaż zgłoszeń, nawigację po repozytorium, generowanie testów i iteracyjne wprowadzanie poprawek, gdzie przepustowość jest niemal równie ważna co inteligencja pojedynczego przebiegu.
2. Długohoryzontowa praca biurowa i z wiedzą
CoWorkBench i JobBench są centralne dla pozycjonowania modelu. Architektura jest zaprojektowana pod pętle agentów, które wielokrotnie czytają kontekst, wywołują narzędzia, aktualizują stan i kontynuują pracę, zamiast odpowiadać raz. To naturalnie mapuje się na przepływy dokumentowe, analizę arkuszy, składanie raportów, syntezę badań i automatyzację procesów biznesowych.
3. Multimodalni agenci komputerowi i mobilni
Wejścia obrazów i wideo, wyniki AndroidWorld, ewaluacja OSWorld oraz Vision2Web czynią model relewantnym dla agentów GUI. Może służyć jako warstwa rozumowania za systemami interpretującymi zrzuty ekranu, obsługującymi interfejsy mobilne, odtwarzającymi układy aplikacji lub łączącymi stan wizualny z wywołaniami narzędzi.
4. Długie wideo i rozumowanie wizualne
Oficjalna karta modelu zawiera jawne przykłady wejść wideo i wskazówki do przetwarzania wideo w skali godzin. To czyni model użytecznym do odpowiadania na pytania o wideo, wyszukiwania w długich materiałach, ekstrakcji zdarzeń wizualnych i przepływów łączących rozumienie wideo z narzędziami downstream.
5. Przepływy badawcze i repozytoryjne na milion tokenów
Otwarty model natywnie obsługuje 262,144 tokeny i jest rozszerzalny do 1,000,000 z YaRN. To rozróżnienie ma znaczenie: 1M to rozszerzenie, a nie natywny kontekst otwartego modelu. Dla dużych repozytoriów lub korpusów badawczych QSA ma sprawić, że koszt wyszukiwania w tak długich kontekstach będzie bardziej praktyczny niż w gęstej globalnej uwadze.
Jak deweloperzy mogą uruchomić Qwen3.8-Flash-Next?
Deweloperzy mogą pobrać otwarte wagi z Hugging Face i uruchomić model z Transformers, vLLM, SGLang lub TokenSpeed. Qwen dostarcza przykłady Chat Completions kompatybilne z OpenAI zarówno dla tekstu, jak i wejść multimodalnych.
Na przykład oficjalna karta modelu demonstruje serwowanie Qwen/Qwen3.8-Flash-Next z vLLM i wywoływanie przez /v1/chat/completions. Wejścia obrazów i wideo są również pokazane przez interfejs kompatybilny z OpenAI.
Qwen3.8-Flash-Next działa domyślnie w trybie myślenia. Deweloperzy mogą kontrolować zachowanie myślenia przez enable_thinking, preserve_thinking i reasoning_effort; udokumentowane poziomy reasoning-effort to xhigh, medium i low.
Jakie są ograniczenia Qwen3.8-Flash-Next?
Największym praktycznym ograniczeniem jest koszt sprzętowy. Chociaż aktywowanych jest tylko 6B parametrów modelu językowego, checkpoint zawiera 125B parametrów językowych plus komponent osadzeń n-gramowych 51B i 4B parametrów MTP. Bieżące repozytorium ma około 360 GB, więc lokalne wdrożenie nadal jest zadaniem wymagającym infrastruktury.
Drugim ograniczeniem jest to, że 262K to natywna długość kontekstu, a nie 1M. Model można rozszerzyć do 1M tokenów, ale strona CometAPI lub modelu nie powinna po prostu wymieniać „1M native context”. Poprawne sformułowanie to natywny kontekst 262K, rozszerzalny do 1M.
Wreszcie, wydajność w benchmarkach jest nierówna. Qwen3.8-Flash-Next jest bardzo konkurencyjny w zadaniach kodowania i agentowych, ale nie prowadzi we wszystkim. Na przykład Claude Opus 4.6 osiąga 40.0 na HLE wobec 35.9 dla Flash-Next, a DeepSeek-V4-Flash-0731 prowadzi w wymienionych modelach na NL2Repo-Bench.
Qwen3.8-Flash-Next: co to sygnalizuje dla Qwen4
Szersze znaczenie tego wydania polega na roli wczesnej zapowiedzi architektury, która prawdopodobnie będzie podstawą Qwen4. Qwen3.8-Flash-Next łączy Qwen Sparse Attention, Gated DeltaNet, czterogałęziowe połączenia Gated Residual, N-gram Embedding, ultrarzadką pulę ekspertów MoE i Multi-Token Prediction. Te wybory pokazują, jak Qwen eksploruje większą pojemność, dłuższy kontekst i mocniejszą multimodalność oraz wydajność agentów bez proporcjonalnego zwiększania aktywnych obliczeń na token.
Ostateczny werdykt
Qwen3.8-Flash-Next jest ważny, ponieważ zmienia sposób postrzegania problemu efektywności. Zamiast traktować wszystkie parametry jednakowo, łączy relatywnie małą aktywną ścieżkę MoE z bardzo dużą pamięcią w stylu tablicy wyszukiwań i rzadkim mechanizmem retrievalu zaprojektowanym pod długi kontekst. Daje to Qwen kilka niezależnych dźwigni do zwiększania pojemności bez równomiernego zwiększania obliczeń macierzowych na token.
Dla deweloperów czyni to model atrakcyjną opcją dla ekonomicznych kosztowo asystentów kodowania, agentów długiego kontekstu, automatyzacji multimodalnej i samodzielnych eksperymentów. Dla szerszej mapy drogowej Qwen jest to jeszcze istotniejsze: Qwen jawnie używa tego wydania, aby ujawnić kierunek architektoniczny, który planuje doskonalić w kierunku Qwen4.
