Najpierw odpowiedź: Qwen4 nie jest już wyłącznie nazwą spekulacyjną. Qwen opisuje teraz Qwen3.8-Flash-Next jako wielomodowy model MoE i eksperymentalny podgląd architektury, która stanie się podstawą Qwen4. Potwierdza to kierunek „efficiency-first” w architekturze, ale nie stanowi premiery produktu Qwen4. Końcowa linia modeli, skala parametrów, karta wyników benchmarków, identyfikator API, licencja, ceny i harmonogram wydania pozostają nieujawnione.
Czym jest Qwen4?
Qwen4 to następna główna architektura Qwen uznana obecnie przez zespół Qwen, choć nie uruchomiono żadnego samodzielnego modelu ani rodziny produktów Qwen4. Oficjalne materiały o Qwen3.8-Flash-Next nazywają ją eksperymentalnym podglądem architektury dla Qwen4. Nie ujawniają ostatecznej liczby parametrów, linii produktów, karty wyników benchmarków, cen, identyfikatora API, licencji ani daty wydania. Dokładne wartości, których nie można prześledzić do Qwen lub Alibaba Cloud, nadal należy traktować jako niezweryfikowane.
Najbardziej użytecznym sposobem omawiania Qwen4 jest wciąż rozdzielenie trzech warstw dowodów. Potwierdzone informacje obejmują aktualne modele Qwen, opublikowaną dokumentację oraz podgląd architektury Qwen3.8-Flash-Next. Oczekiwane kierunki to wnioski oparte na tych sygnałach. Niewiadome to końcowe szczegóły produktu, których nie można odpowiedzialnie uzupełnić szacunkami. To rozróżnienie jest istotne, ponieważ podgląd potwierdza zamiar architektoniczny bez definiowania produkcyjnej rodziny Qwen4.
| Poziom dowodu | Jak należy go używać | Przykłady w tym artykule |
|---|---|---|
| Potwierdzone | Przedstawiać jako fakt z bezpośrednim linkiem źródłowym | Podgląd architektury Qwen3.8-Flash-Next; skala i benchmarki Qwen3.8-Max |
| Oczekiwane | Używać ostrożnego języka i wyjaśniać wnioskowanie | Jak architektura z podglądu może się skalować do finalnych modeli Qwen4 |
| Niewiadome | Nie wymyślać wartości ani zobowiązań wydawniczych | Końcowa linia modeli, parametry, karta wyników, cena, licencja i identyfikator API |
Dlaczego Qwen4 to logiczny następny krok
Generacja Qwen3 ustanowiła hybrydowe podejście do rozumowania. Jej oficjalne wprowadzenie opisuje tryby thinking i non-thinking, które pozwalają deweloperom wymieniać szybkość odpowiedzi na głębsze rozumowanie. Ta sama generacja rozszerzyła też wsparcie wielojęzyczne i wzmocniła użycie narzędzi, w tym przepływy pracy agentów zorientowane na MCP.
Mapa drogowa Qwen wskazała następnie kierunek skalowania danych, wydłużania kontekstu, poszerzania modalności i RL z informacją zwrotną z otoczenia. Ta mapa jest ważniejsza niż przewidywania oparte na plotkach: przedstawia kolejną generację jako przejście od trenowania modeli do trenowania agentów, którzy potrafią wchodzić w interakcję ze środowiskami i realizować pracę o długim horyzoncie.
Linia Qwen3.8 dostarcza teraz dwóch różnych punktów odniesienia. Qwen3.8-Max pozostaje obecnym flagowym punktem odniesienia, z hostowanym systemem MoE o 2,4 biliona parametrów do kodowania, pracy biurowej, rozumienia obrazu, długich dokumentów, długich wideo i autonomicznego planowania. Qwen3.8-Flash-Next pełni inną rolę: Qwen jawnie pozycjonuje go jako podgląd architektury Qwen4. Przyszłe Qwen4 musi połączyć szeroki zakres możliwości flagowca z ukierunkowanym na wydajność projektem podglądu.
Czego Qwen3.8-Flash-Next ujawnia o Qwen4
Qwen3.8-Flash-Next to pierwszy konkretny publiczny dowód dotyczący fundamentów Qwen4. Qwen nazywa go pierwszym wydaniem z otwartymi wagami w nowej architekturze i deklaruje, że ten projekt będzie podstawą Qwen4. Podgląd jest więc silniejszy niż wnioskowanie z mapy drogowej, choć wciąż pozostawia otwartą skalę i konfigurację modelu produkcyjnego.
Model jest wielomodowym autoregresyjnym modelem językowym z enkoderem wizji. Jego model językowy zawiera 125B parametrów z 6B aktywowanymi, plus 51B parametrów osadzeń n-gramowych i 4B parametrów MTP. Ma 48 warstw, 512 ekspertów z 10 kierowanymi i jednym współdzielonym ekspertem aktywnym na token, natywny kontekst 262 144 tokenów i wsparcie rozszerzenia do 1 000 000 tokenów.
| Sygnał architektoniczny | Potwierdzone w Qwen3.8-Flash-Next | Co to sugeruje dla Qwen4 |
|---|---|---|
| Ultra-rzadkie MoE | 125B głównych parametrów; 6B aktywnych na token; 512 ekspertów | Zdolność na jednostkę aktywnej mocy obliczeniowej może być kluczowym celem |
| Hybrydowy mechanizm uwagi | Trzy warstwy Gated DeltaNet na każdą warstwę Qwen Sparse Attention | Opóźnienie w długim kontekście i efektywność KV-cache mogą liczyć się bardziej niż sam rozmiar okna |
| Bramkowane rezydua | Cztery poszerzone gałęzie rezydualne z bramkowaniem zależnym od danych | Qwen testuje bardziej ekspresyjne głębokie skalowanie z kontrolowanym narzutem |
| Osadzenia n-gramowe | 51B parametrów bigramów i trigramów | Pojemność łatwa do offloadu może uzupełniać kosztowne obliczeniowo skalowanie MoE |
| Natywna multimodalność | Autoregresyjny model językowy z enkoderem wizji | Tekst i wizja to prawdopodobnie fundamenty architektury, a nie dołączane warianty |
| Długi kontekst | 262K natywnie; rozszerzalne do 1M | Qwen4 prawdopodobnie położy nacisk na wydajnych agentów długohoryzontowych |
Raportowane przez dostawcę wyniki benchmarków pokazują także, dlaczego architektura ma znaczenie. Mimo że aktywuje tylko 6B parametrów na token, poprawia wyniki względem gęstego Qwen3.8-27B w wybranych ewaluacjach kodowania, pracy biurowej, użycia narzędzi i agentów multimodalnych poniżej. Te wyniki nie są wynikami Qwen4; to dowód, że nowa architektura jest projektowana tak, by podnosić zdolność na aktywny parametr.
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B |
|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 |
| SWE-bench Pro | 62.5 | 61.7 |
| CoWorkBench | 73.9 | 70.7 |
| Toolathlon Verified | 73.5 | 67.1 |
| ClawEval-MM (Pass@3) | 64.4 | 57.4 |
| AndroidWorld | 84.5 | 81.9 |
Interpretacja: Flash-Next zamienia trzy oczekiwania wobec Qwen4 w silniejsze sygnały: ultra-rzadką aktywację, hybrydową uwagę zoptymalizowaną pod długi kontekst oraz natywną multimodalność. Nie ujawnia ostatecznej liczby parametrów Qwen4, dokładnej konfiguracji kontekstu, poziomów produktowych ani harmonogramu wydania.
Oczekiwane specyfikacje Qwen4
Ponieważ nie istnieje finalna specyfikacja Qwen4, tabela poniżej używa Qwen3.8-Max jako potwierdzonej produkcyjnej bazy oraz Qwen3.8-Flash-Next jako potwierdzonego sygnału architektury. Podgląd zwiększa pewność co do kilku kierunków, ale każde pole końcowego Qwen4 pozostaje oczekiwane lub nieznane, dopóki Qwen nie opublikuje modelu.
| Specyfikacja | Potwierdzona baza Qwen3.8-Max | Oczekiwanie dla Qwen4 | Pewność |
|---|---|---|---|
| Status | Wydany | Potwierdzony podgląd architektury; model nie uruchomiony | Potwierdzone |
| Architektura | Rzadkie MoE z hybrydowym fundamentem uwagi | Oczekiwane rozwinięcie GDN + QSA, bramkowanych rezyduów i osadzeń n-gramowych | Wysoka |
| Łączna liczba parametrów | 2,4T | Nieznane; może nie wymagać przekroczenia 2,4T | Niska |
| Aktywne parametry | Około 95B na krok w modelu z otwartymi wagami | Prawdopodobne ultra-rzadkie trasowanie; dokładny aktywny koszt nieznany | Średnio-wysoka |
| Okno kontekstu | 1 000 000 tokenów | Zoptymalizowane pod długi kontekst; natywne i domyślne limity nieznane | Wysoka |
| Maksymalne wyjście | 131 072 tokeny | Prawdopodobnie utrzymane lub rozszerzone | Średnia |
| Wejścia hostowane | Tekst, obraz i wideo | Kierunek multimodalny potwierdzony; dokładne wsparcie audio nieznane | Wysoka |
| Modalność wyjściowa | Tekst | Najpewniej tekst; natywne media wyjściowe niepotwierdzone | Średnia |
| Rozumowanie | Tryby thinking i szybszego wnioskowania | Sterowanie rozumowaniem prawdopodobne; finalne zachowanie API nieznane | Średnio-wysoka |
| Obsługa narzędzi | Wywołania funkcji i strukturalne wyjście | Oczekiwany silniejszy dobór narzędzi, zachowanie stanu i odzyskiwanie po błędach | Wysoka |
| Wagi i licencja | Istnieje flagowy checkpoint z otwartymi wagami | Podgląd ma otwarte wagi; finalna licencja i checkpointy Qwen4 nieznane | Średnia |
| ID modelu API | qwen3.8-max | Niedostępne | Potwierdzone |
Interpretacja: Flash-Next podnosi pewność wobec ultra-rzadkiego trasowania MoE, hybrydowej uwagi dla długiego kontekstu, bramkowanych rezyduów, osadzeń n-gramowych i natywnej multimodalności. Nie dowodzi jednak, że finalny model Qwen4 użyje 125B parametrów, aktywuje 6B na token lub będzie miał te same limity kontekstu.
Na jakiej architekturze oczekuje się, że Qwen4 będzie bazować?
Ultra-rzadkie MoE to teraz najsilniejszy sygnał
Pytanie o architekturę jest teraz mniej spekulatywne. Karta modelu Qwen3.8-Flash-Next dokumentuje 125B głównych parametrów z jedynie 6B aktywowanymi na token oraz 51B osadzeń n-gramowych. Ten ultra-rzadki projekt sugeruje, że Qwen4 może priorytetyzować całkowitą zdolność zadaniową na jednostkę aktywnej mocy obliczeniowej zamiast zwiększać aktywną liczbę parametrów proporcjonalnie do przechowywanej pojemności.
Ważne pytanie nie brzmi, czy Qwen4 zawiera więcej ekspertów, lecz czy trasowanie, dostęp do pamięci i specjalizacja ekspertów pozostają stabilne w długich zadaniach. Osadzenia n-gramowe w Flash-Next pokazują również, że Qwen bada pojemność tańszą obliczeniowo i łatwiejszą do offloadu niż konwencjonalne skalowanie MoE.
Hybrydowa uwaga celuje w efektywność długiego kontekstu
Flash-Next zastępuje wcześniejsze parowanie Gated DeltaNet i pełnej uwagi połączeniem Gated DeltaNet oraz Qwen Sparse Attention działającą na poziomie mikrobloków. Jego 48 warstw powtarza trzy bloki Gated DeltaNet, po których następuje jeden blok rzadkiej uwagi. To najjaśniejszy sygnał, że Qwen4 może być projektowane w celu redukcji opóźnień w długim kontekście i presji na KV-cache, zamiast polegać na większym oknie pełnej uwagi.
Długi kontekst powinien stać się pamięcią agenta, a nie tylko większym promptem
Milion-tokenowe okno jest użyteczne tylko wtedy, gdy model potrafi wydobyć właściwe dowody, zachować cele i unikać kumulowania sprzecznych stanów. Qwen4 należy więc oceniać pod kątem użycia długiego kontekstu w kolejnych wywołaniach narzędzi, zmianach w plikach, wynikach pośrednich i odzyskiwaniu po błędach. Sama długość kontekstu mówi mniej niż trafność wyszukiwania i ukończenie zadań na długiej trajektorii.
Sterowanie rozumowaniem może stać się bardziej granularne
Hybrydowy projekt thinking w Qwen3 już pozwalał na szybkie i rozważne zachowanie. Flash-Next wzmacnia ten sygnał, wspierając ustawienia enable_thinking, preserve_thinking i reasoning_effort. Istotne ulepszenie Qwen4 mogłoby dynamicznie alokować rozumowanie i zachowywać tylko ten stan, który poprawia spójność wieloetapową, obniżając całkowity koszt przepływu pracy zamiast po prostu produkować dłuższe widoczne rozumowanie.
Multimodalność może zbliżyć się do użycia komputera
Multimodalność to teraz silniejsze oczekiwanie, ponieważ zarówno hostowana usługa Qwen3.8-Max, jak i otwartowagowy podgląd Flash-Next obsługują wejście wizualne. Qwen4 może połączyć tę percepcję z bardziej niezawodną akcją: zrozumieć zrzut ekranu, wybrać kontrolkę UI, sprawdzić wynik i skorygować plan. Natywne audio, generowanie obrazów, mowa i generowanie wideo pozostają niepotwierdzone.
Oczekiwane funkcje Qwen4
- Bardziej niezawodni agenci długohoryzontowi. Niższe wskaźniki błędów wywołań narzędzi, silniejsze utrzymanie celów, lepsze odzyskiwanie i bardziej spójne rezultaty po setkach akcji.
- Inżynieria oprogramowania w skali repozytorium. Ulepszone planowanie w dużych bazach kodu, testach, terminalach, trackerach zgłoszeń i środowiskach wdrożeniowych.
- Praca wiedzochłonna end-to-end. Silniejsza ścieżka od badań i analizy dokumentów do arkuszy, prezentacji, raportów i wyników gotowych do decyzji.
- Multimodalne użycie narzędzi. Zrozumienie wizualne wspierające interakcję z UI, operacje na dokumentach i rozumowanie zakotwiczone w środowisku.
- Adaptacyjne budżety rozumowania. Automatyczna eskalacja od szybkich odpowiedzi do głębszego rozumowania, gdy rośnie niepewność lub złożoność zadania.
- Wyższa zdolność na aktywny parametr. Lepsze trasowanie ekspertów, pojemność n-gramowa, rzadka uwaga, cache i post-trenowanie zamiast skalowania dla samego skalowania.
- Szersza rodzina modeli. Możliwe warianty Max, Plus, Coder, małe MoE, VL lub Omni, choć żadne z tych nazw nie są potwierdzone.
Perspektywa benchmarków Qwen4: co pokazuje baza Qwen3.8-Max
Nie ma wyników benchmarków Qwen4. Flash-Next i Max odpowiadają na różne pytania: tabela wyników Flash-Next testuje zorientowaną na wydajność zdolność nowej architektury, podczas gdy oficjalna tabela wyników Qwen3.8-Max pozostaje silniejszą produkcyjną bazą możliwości w zakresie agentów kodujących, replikacji badań, profesjonalnej współpracy, rozumowania wizualnego, użycia mobilnego i obsługi komputera. Qwen4 będzie musiało połączyć oba kierunki przy dopasowanych ewaluacjach.
| Benchmark | Zgłoszony wynik Qwen3.8-Max | Co Qwen4 musiałby udowodnić |
|---|---|---|
| SWE-Pro | 67.7 | Zmniejszyć lukę w profesjonalnym rozwiązywaniu problemów w repozytoriach |
| TerminalBench 2.1 | 86.6 | Poprawić niezawodność agenta terminalowego pod tym samym harnessem |
| PaperBench | 93.0 | Utrzymać siłę w badaniach z niezależną replikacją |
| FrontierSWE | 73.5 | Przekuć długohoryzontowe rozumowanie w więcej ukończonej pracy inżynieryjnej |
| CoWorkBench | 74.8 | Dostarczać bardziej niezawodne wyniki profesjonalne |
| OSWorld-Verified | 86.1 | Zredukować błędy akcji wizualnych w przepływach „computer-use” |
Dwa punkty odniesienia wskazują na podwójny wymóg. Flash-Next pokazuje, że niski aktywny koszt obliczeń może nadal zapewniać silne wyniki agentów i multimodalności; Max pokazuje wyższy sufit możliwości, który nowy flagowiec musi przekroczyć. Qwen4 należy więc oceniać zarówno po sukcesie w dopasowanych zadaniach, jak i całkowitym koszcie przepływu pracy, a wyniki zgłaszane przez dostawcę utrzymywać oddzielnie od niezależnej weryfikacji.
Oficjalne wyniki benchmarków Qwen3.8-Max. Źródło: Oficjalne wydanie Qwen3.8-Max**.
Qwen4 kontra obecne modele czołowe: potwierdzone bazy i niewiadome
Najbardziej użyteczne porównanie to nie tylko Qwen4 względem Qwen3.8-Max. To Qwen4 względem wyborów projektowych już widocznych w Kimi K3, DeepSeek V4 Pro i GLM-5.3. Poniższa tabela porównuje potwierdzone atrybuty bieżących modeli z wciąż nieznaną kolumną Qwen4.
| Wymiar | Qwen4 | Qwen3.8-Max | Kimi K3 | DeepSeek V4 Pro | GLM-5.3 |
|---|---|---|---|---|---|
| Status | Potwierdzony podgląd architektury; model niewydany | Wydany | Wydany | Wydany | Wydany |
| Skala | Nieznana | 2,4T / około 95B aktywnych | 2,8T / 16 z 896 ekspertów | 1,6T / 49B aktywnych | Nie ujawniono w tym wydaniu |
| Kontekst | Oczekiwane 1M+ | 1M | 1M | 1M | 1M |
| Wejście | Potwierdzony kierunek multimodalny; finalny interfejs nieznany | Tekst, obraz, wideo | Tekst i natywna wizja | Zorientowany na tekst | Tylko tekst |
| Rozumowanie | Nieznane | Tryby thinking i szybkie | Wysiłek low / high / max | Thinking / non-thinking | Zawsze włączone; low / high / max |
| Ekosystem open | Finalne wagi i licencja niepotwierdzone | Istnieje flagowiec z otwartymi wagami | Pozycjonowanie open-source | Otwarte wagi | Pozycjonowanie open-source |
| Główny fokus | Oczekiwany wydajny multimodalny agent | Kodowanie, cowork, agenci wizualni | Kodowanie i praca wiedzy | Wydajne rozumowanie i kodowanie agentyczne | Kodowanie i cyberbezpieczeństwo |
Skala modeli i efektywność inferencji
Dokumentacja Kimi opisuje 2,8T parametrów i 16 aktywowanych ekspertów z 896. DeepSeek V4 Pro wybiera inną ścieżkę z 1,6T łącznie i 49B aktywnymi parametrami. Qwen4 nie musi być największym modelem, by wygrać to porównanie; musi przekuć aktywne obliczenia w bardziej niezawodnie ukończoną pracę.
Kontekst i multimodalność
Milion tokenów stał się wspólnym flagowym punktem odniesienia, więc sama długość kontekstu nie odróżni Qwen4. Silniejszą szansą Qwen jest multimodalne wykorzystanie kontekstu: znalezienie właściwych dowodów w dokumentach, kodzie, zrzutach ekranów i wideo, a następnie podjęcie właściwej akcji. Kimi K3 ma również natywne rozumienie wizualne, podczas gdy bieżący interfejs GLM-5.3 to tylko tekst z kontekstem 1M i maksymalnym wyjściem 128K.
Kodowanie, agenci i wyspecjalizowane mocne strony
Qwen3.8-Max wnosi szeroki profil w kodowaniu, badaniach, współpracy i agentach wizualnych. Qwen3.8-Flash-Next dodaje zorientowaną na wydajność architekturę multimodalną z wyższą zdolnością na aktywny parametr. Kimi K3 akcentuje długohoryzontowe kodowanie i pracę wiedzochłonną, DeepSeek V4 Pro — wydajne rozumowanie i agentyczne kodowanie, a GLM-5.3 — wyróżniający się fokus na cyberbezpieczeństwie. Wiarygodna premiera Qwen4 musiałaby połączyć szeroką niezawodność agentów z eksperckim poziomem w inżynierii oprogramowania i wizualnym użyciu komputera.
Otwarte wagi to nie cały obraz wdrożeniowy
Otwarte wagi mogą poprawić kontrolę, dostosowanie i wybór dostawcy, ale praktyczne porównanie obejmuje także warunki licencyjne, wymagania sprzętowe, jakość kwantyzacji, wsparcie dla fine-tuningu oraz dostępność zoptymalizowanych stosów serwujących. Słowa „open” nie należy używać jako substytutu sprawdzenia dokładnej licencji i warunków wdrożenia każdego wydania.
Wynik porównania: Najsilniejszą potencjalną pozycją Qwen4 jest szeroki multimodalny agent, który łączy mocne strony wizualne i cowork Qwen3.8-Max z ukierunkowaną na niski koszt aktywny architekturą Flash-Next oraz lepszą niezawodnością w inżynierii oprogramowania. Nie można go ogłosić zwycięzcą, dopóki nie będą dostępne dopasowane ewaluacje i zachowanie produkcyjne.
Potencjalne zastosowania Qwen4
Autonomiczna inżynieria oprogramowania
Silniejszy agent Qwen mógłby przejrzeć repozytorium, odtworzyć problem, edytować wiele plików, uruchomić testy, przeanalizować awarie i przygotować zmianę gotową do PR. Ważną metryką byłby odsetek zadań ukończonych bez ratunku ze strony człowieka, a nie ilość wygenerowanego kodu.
Praca wiedzochłonna w przedsiębiorstwie
Długi kontekst i rozumienie multimodalne mogłyby wspierać przepływy zaczynające się od umów, PDF-ów, arkuszy, diagramów i nagrań ze spotkań, a kończące notą decyzyjną, analizą lub ustrukturyzowanym planem działania. Przedsiębiorstwa nadal potrzebowałyby kontroli wyszukiwania, dzienników audytu i weryfikacji źródeł wokół modelu.
Multimodalni agenci „computer-use”
Qwen4 może być użyteczny tam, gdzie agent musi interpretować zrzuty ekranu, nawigować po aplikacjach, weryfikować stan UI i odzyskiwać po nieoczekiwanym wyniku kliknięcia lub wysłania formularza. To naturalne rozszerzenie silnej bazy wizualnej i stylu OSWorld w Qwen3.8-Max, ale natywne wsparcie sterowania komputerem nie zostało ogłoszone.
Badania naukowe i inżynieryjne
Przepływy badawcze łączą przegląd literatury, kod, symulacje, analizę danych i pisanie raportów. Przyszły model Qwen mógłby orkiestrwać te kroki i utrzymywać dłuższą historię eksperymentów. Wyniki PaperBench czynią to wiarygodnym kierunkiem, ale kluczowe pozostaną powtarzalność i niezależna weryfikacja.
Czego jeszcze nie wiemy
Mimo że Qwen potwierdził architekturę poprzez Flash-Next, następujące szczegóły produkcyjne pozostają niedostępne i powinny pozostać wyraźnie nierozstrzygnięte, dopóki nie pojawi się oficjalne ogłoszenie Qwen4:
- Dokładne nazwy produktów i to, czy Qwen4 wystartuje jako jeden model czy rodzina.
- Data wydania lub harmonogram podglądu.
- Czy finalne modele zachowają dokładny stosunek GDN/QSA, projekt bramkowanych rezyduów, skalę osadzeń n-gramowych i trasowanie ekspertów z Flash-Next.
- Łączna liczba parametrów, aktywne parametry, liczba ekspertów i skala danych treningowych dla każdego modelu Qwen4.
- Natywna długość kontekstu, domyślny kontekst, maksymalne wyjście i obsługiwane modalności dla każdej ścieżki.
- Natywne możliwości audio, generowania obrazów, mowy lub generowania wideo.
- Oficjalne wyniki benchmarków i harnas ewaluacyjny użyty dla każdego wyniku.
- Dostępność otwartych wag, warunki licencji i zasady użycia komercyjnego.
- Ceny API, dostępność regionalna, limity szybkości i finalny identyfikator modelu.
Zasada weryfikacji: Traktuj wszelkie dokładne specyfikacje Qwen4, wykresy benchmarków, tabele cen lub identyfikatory API jako niezweryfikowane, chyba że można je prześledzić bezpośrednio do Qwen, Alibaba Cloud lub oficjalnego repozytorium modelu.
Kiedy Qwen4 zostanie wydany?
Nie ma obronnej publicznej daty wydania. Qwen3.8-Flash-Next potwierdza, że Qwen testuje architekturę, która stanie się podstawą Qwen4, ale publiczne materiały nie dostarczają harmonogramu dla produkcyjnego modelu Qwen4. Zakończenie trenowania, efektywność serwowania, ocena bezpieczeństwa, licencjonowanie wag i integracja produktowa mogą wszystkie wpłynąć na timing i kształt wydania.
Najbezpieczniejszym podejściem publikacyjnym jest unikanie przewidywania miesiąca lub kwartału. Warto obserwować oficjalną stronę Qwen, dokumentację Alibaba Cloud Model Studio, zweryfikowane repozytoria modeli i katalog modeli CometAPI. Strona modelu Qwen4 powinna zostać dodana dopiero po faktycznym umieszczeniu modelu na liście.
Jak deweloperzy mogą przygotować się na Qwen4
- Ustal dwa punkty odniesienia. Użyj Qwen3.8-Flash-Next do pomiaru efektywności architektury i Qwen3.8-Max do pomiaru bieżących możliwości flagowca.
- Oddziel identyfikatory modeli od logiki biznesowej. Trzymaj trasowanie i konfigurację poza kodem aplikacji, aby móc bezpiecznie podmieniać modele.
- Buduj ewaluacje na poziomie zadań. Mierz ukończone poprawki w oprogramowaniu, poprawne wyniki badań, udane łańcuchy narzędzi i użyteczne rezultaty.
- Loguj całkowity koszt przepływu pracy. Śledź opóźnienia, tokeny wejścia i wyjścia, użycie cache, ponowienia, nieudane akcje i potrzebę pracy człowieka.
- Zachowaj trasy awaryjne. Używaj trasowania modeli i dostawców zapasowych zamiast robić z jednego, niewydanego modelu pojedynczy punkt awarii.
- Nie wymyślaj identyfikatora modelu. Poczekaj na oficjalny identyfikator, zanim dodasz qwen4 lub qwen4-max do konfiguracji produkcyjnej.
Wypróbuj Qwen3.8-Flash-Next i Qwen3.8-Max przez CometAPI
Deweloperzy mogą teraz testować Qwen3.8-Flash-Next przez CometAPI i utrzymać Qwen3.8-Max jako flagowe porównanie. Utwórz klucz API, przechowuj go w zmiennej środowiskowej i wywołuj istniejący model za pomocą klienta kompatybilnego z OpenAI. Przykład celowo używa qwen3.8-flash-next; nie zakłada przyszłego identyfikatora Qwen4.
Wniosek
Qwen4 to już coś więcej niż plotka: Qwen wyraźnie wskazał Qwen3.8-Flash-Next jako eksperymentalny podgląd architektury, która będzie jego podstawą. Podgląd potwierdza wielomodowy, ultra-rzadki kierunek MoE oparty na Gated DeltaNet, Qwen Sparse Attention, bramkowanych rezyduach i osadzeniach n-gramowych. Qwen3.8-Max pozostaje silniejszą obecną bazą możliwości.
Prawdziwym testem dla Qwen4 nie będzie to, czy jego liczba parametrów jest większa. Będzie nim to, czy finalny model potrafi połączyć wydajność Flash-Next z możliwościami poziomu Max, ukończyć dłuższą pracę z mniejszą liczbą błędów i bardziej niezawodnie używać multimodalnych dowodów. Kierunek architektury jest już publiczny, ale finalne specyfikacje, benchmarki, licencja, cena, identyfikator API i data wydania pozostają nieznane.
