Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →
technology/Badania CometAPI

Czym jest Qwen3.8-Flash-Next?

Poznaj Qwen3.8-Flash-Next: architektura MoE 125B, 6B aktywnych parametrów, QSA, rozszerzony kontekst 1M tokenów, wielomodalne benchmarki, funkcje, cennik.

CometAPI
Mia MarenZespół badań AI modeli i API
Zaktualizowano Aug 29, 2026 16 min czyt.
Czym jest Qwen3.8-Flash-Next?
Użyj tego wzorca

Wykonaj pierwsze wywołanie API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Qwen3.8-Flash-Next nie jest po prostu mniejszym ani szybszym członkiem rodziny Qwen3.8. Qwen opisuje go jako wielomodowy model MoE o otwartych wagach i wczesną zapowiedź architektury użytej w Qwen4. Projekt jednocześnie zmienia mechanizmy uwagi, połączenia resztkowe, pojemność osadzeń i optymalizację, aby poprawić zdolności przy jednoczesnym ostrym ograniczeniu kosztu obliczeń na token.

TL;DR

Qwen3.8-Flash-Next łączy główny model o 125B parametrach z dodatkowymi 51B w tablicy osadzeń N-gramów, przy aktywacji jedynie 6B parametrów na token. Natywnie obsługuje 262,144 tokeny i może zostać rozszerzony do 1,000,000 tokenów dzięki YaRN. Architektura opiera się na mieszance 3:1 Gated DeltaNet i Qwen Sparse Attention, czterogałęziowych połączeniach Gated Residual, N-gram Embedding, dużej ultrarzadkiej puli ekspertów MoE, Multi-Token Prediction oraz treningu opartym na Muon.

Najważniejszy jest nacisk na wydajność, a nie na samą liczbę parametrów. Qwen podaje, że trening modelu wymaga około jednej dziewiątej kosztu Qwen3.7-Plus, a jego wyniki startowe plasują model przed poprzednimi bazami Qwen w wielu zadaniach z zakresu kodowania, agentów biurowych i multimodalności. Są to wyniki raportowane przez dostawcę i należy je traktować jako dane z premiery, a nie niezależną walidację.

Dla deweloperów wagi są dostępne w kanałach Qwen, a zarządzana wersja produkcyjna nazywa się Qwen3.8-Flash w QwenCloud. CometAPI wymienia Qwen3.8-Flash-Next z identyfikatorem modelu qwen3.8-flash-next, zapewniając jednolitą ścieżkę obok innych modeli klasy frontier.

Najważniejsze wnioski

Czym jest Qwen3.8-Flash-Next?

Qwen3.8-Flash-Next to przyczynowy wielomodowy model językowy z enkoderem wizji i ultrarzadkim językowym kręgosłupem Mixture-of-Experts. Oficjalna karta modelu opisuje architekturę 48-warstwową z 512 ekspertami, 10 trasowanymi ekspertami plus jednym współdzielonym oraz układ ukryty, w którym powtarzają się trzy warstwy Gated DeltaNet, po których następuje jedna warstwa Qwen Sparse Attention.

Wydanie pełni rolę podobną do Qwen3-Next: ujawnia zmiany architektoniczne, zanim zostaną przeskalowane do kolejnej pełnej rodziny. Qwen wprost nazywa model eksperymentalną zapowiedzią architektury, która będzie podstawą Qwen4. To czyni go wyjątkowo interesującym dla inżynierów, którym zależy na efektywnym serwowaniu, długim kontekście i kierunku badań nad architekturą otwartych modeli.

4 kluczowe komponenty Qwen3.8-Flash-Next

Model zmienia jednocześnie cztery kluczowe komponenty: uwagę, przepływ resztkowy, pojemność osadzeń i optymalizację. Taki współprojekt ma znaczenie, bo zyski efektywności w jednym komponencie mogą zostać utracone, jeśli inny stanie się wąskim gardłem przy długim kontekście lub dużej skali.

Hybrydowa uwaga: GDN + Qwen Sparse Attention

Większość warstw nie wykonuje globalnej uwagi. Zamiast tego trzy na cztery warstwy używają Gated DeltaNet do kompresowania informacji historycznych w stan o stałym rozmiarze. Czwarta warstwa używa globalnej uwagi do dokładnego wyszukiwania, ale jest ona przeprojektowana jako Qwen Sparse Attention (QSA).

QSA unika niezależnego przeszukiwania każdego tokena. Lekki indeksator najpierw grupuje sekwencję w mikrobloki, szacuje, które bloki są istotne, a następnie kieruje uwagę tylko na wybrane regiony. Według opisu Qwen redukuje to zarówno koszt obliczeń uwagi, jak i narzut indeksowania potrzebny do znalezienia relewantnego kontekstu. Projekt szczególnie dobrze współgra z siecią hybrydową, ponieważ rzadki indeks jest budowany niezależnie w każdej warstwie uwagi, zamiast polegać na podobieństwie między sąsiednimi warstwami uwagi.

Liczby efektywności są znaczące. Przy kontekście 1M tokenów Qwen raportuje do 7.6x szybszy prefill i 4.9x szybszy decode dla jądra uwagi QSA. W eksperymencie serwowania o wysokiej ponowności cache z 90% trafień cache prefiksu pełny model osiąga 8.6x przepustowość prefill względem Qwen3.7-Plus przy kontekście 1M.

Gated Residual: cztery ścieżki zamiast jednej

Konwencjonalny Transformer wielokrotnie odczytuje i zapisuje jeden strumień resztkowy. Qwen3.8-Flash-Next zamiast tego używa Gated Residual, aby poszerzyć ten strumień do czterech równoległych gałęzi. Bramki odczytu element-po-elemencie decydują, ile informacji pobrać z każdej gałęzi, a bramki zapisu na poziomie gałęzi określają, co jest zapisywane z powrotem.

Celem jest zachowanie użytecznych cech w głębi bez zmuszania każdej cechy do przechodzenia przez ten sam, ciągle mieszany kanał. Qwen raportuje również, że bramkowanie tłumi skrajne wartości aktywacji i że stan resztkowy można przechowywać w FP8, zmniejszając ruch pamięci. Kluczową ideą nie jest po prostu większa pojemność resztkowa, lecz kontrolowane trasowanie informacji między warstwami.

N-gram Embedding: większa pojemność bez proporcjonalnego kosztu obliczeń

Model dodaje 51B parametrów osadzeń N-gramów poza 125B w głównym trzonie. W odróżnieniu od zwykłych osadzeń indeksowanych pojedynczym tokenem, N-gram Embedding używa lokalnych wzorców tokenów, takich jak bigramy i trigramy. Daje to modelowi dużą pamięć w stylu tablicy wyszukiwań dla powtarzających się lokalnych wzorców.

Nietypowe jest miejsce umieszczenia tej pojemności. Ponieważ adres odczytu można znać przed potrzebą osadzenia, tablica może być trzymana w pamięci hosta i asynchronicznie prefetczowana podczas trwania obliczeń na GPU. Oznacza to, że dodatkowe 51B parametrów nie zachowuje się jak 51B dodatkowych gęstych parametrów macierzowych. Architektura efektywnie skaluje dwa różne zasoby: parametry obliczeniowo ciężkie oraz pamięć odczytową o niskim koszcie obliczeń.

Muon i optymalizacja treningu

Qwen trenuje architekturę z użyciem optymalizatora Muon dla dwuwymiarowych odwzorowań liniowych, takich jak główne wagi w uwadze, GDN i ekspertach MoE, podczas gdy osadzenia, router i niskowymiarowe parametry Gated Residual nadal używają AdamW. Zunifikowane macierze, takie jak QKV i projekcje SwiGLU, są dzielone na niezależne przekształcenia liniowe przed ortogonalizacją.

Zespół dopasował również na nowo prawo skalowania do tej architektury i raportuje, że konwencjonalny Batch Size Warmup nie był konieczny. Stopniowe zwiększanie rozmiaru partii nie poprawiło wyniku końcowego, a zamiast tego wymagało 18.8% więcej kroków optymalizatora. Ostateczna receptura startuje więc bezpośrednio od docelowego rozmiaru partii.

Ultra-rare MoE i Multi-Token Prediction

Oficjalna karta modelu wymienia 512 ekspertów, z czego 10 trasowanych i jednego współdzielonego aktywnych na token. Duża pula ekspertów zwiększa pojemność pamięci bez aktywowania całego modelu dla każdego tokena. Jednowarstwowy moduł Multi-Token Prediction (MTP) jest trenowany wielostopniowo, by poprawić akceptację spekulatywnego dekodowania, jednocześnie wspierając główny trzon.

Wyniki benchmarków Qwen3.8-Flash-Next

Qwen publikuje szerokie ewaluacje językowe, kodowe, agentowe i wizyjno-językowe. Te liczby są użyteczne, ponieważ wiele modeli porównawczych uruchomiono ponownie w środowisku Qwen, ale nadal są to raportowane przez dostawcę wyniki premierowe, a nie niezależne reprodukcje benchmarków. Kilka wierszy używa też specyficznych dla benchmarku narzędzi lub sędziów, więc najbezpieczniejsza interpretacja jest kierunkowa: pokazują, gdzie Qwen3.8-Flash-Next jest najsilniejszy, a gdzie konkurenci wciąż prowadzą.

Wydajność w kodowaniu i zadaniach agentowych

BenchmarkQwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusDeepSeek V4 FlashClaude Opus 4.6
DeepSWE 1.158.742.216.554.4--
SWE-bench Pro62.561.755.856.053.4
SWE-bench Multilingual81.073.875.8--77.5
NL2Repo-Bench48.142.341.154.247.6
CoWorkBench73.970.765.145.168.2
JobBench55.733.427.641.336.6
Toolathlon Verified73.567.150.670.3--
IFBench81.379.579.179.262.5
GPQA Diamond91.789.290.390.891.3
HLE35.930.834.733.840.0
LiveCodeBench v691.990.389.690.688.8

Historia kodowania jest mocna, ale z niuansami. Qwen3.8-Flash-Next prowadzi w zestawie porównań na SWE-bench Pro, SWE-bench Multilingual, CoWorkBench, JobBench, Toolathlon Verified i LiveCodeBench v6. Jednak DeepSeek V4 Flash wyprzedza na NL2Repo-Bench, a Claude Opus 4.6 prowadzi na HLE. To sprawia, że wydajność jest bardziej obronnym nagłówkiem niż uniwersalna dominacja benchmarków.

Najbardziej godne uwagi zyski względem poprzednich baz Qwen pojawiają się w pracy długohoryzontowej. CoWorkBench rośnie z 65.1 na Qwen3.7-Plus do 73.9, a JobBench z 27.6 do 55.7. Ponieważ CoWorkBench to wewnętrzny benchmark Qwen, te zyski wymagają niezależnej replikacji, ale są zgodne z deklarowanym przez architekturę naciskiem na ekonomiczne kosztowo przepływy pracy agentów i biura.

Wydajność multimodalna

BenchmarkQwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusClaude Opus 4.6
ClawEval-MM (Pass@3 / Avg)64.4 / 60.457.4 / 56.957.4 / 60.152.5 / 54.7
RecreationBench49.947.130.2--
AndroidWorld84.581.981.062.0
OSWorld 2.0 (Binary / Partial)19.4 / 52.319.4 / 48.02.8 / 21.5--
Vision2Web64.062.942.1--
ERQA72.365.569.840.8
LVBench76.672.476.263.0
RealWorldQA88.585.986.973.9
MathVision (without / with CI)90.6 / 95.790.0 / 94.690.3 / 88.765.5 / --
CharXiv RQ (without / with CI)84.6 / 90.683.7 / 90.285.8 / 85.966.0 / --

Źródło danych: oficjalna ewaluacja premierowa Qwen**.

Wyniki multimodalne potwierdzają, że nie jest to jedynie model Flash skupiony na kodowaniu. Qwen3.8-Flash-Next zdobywa 84.5 na AndroidWorld, 64.0 na Vision2Web, 76.6 na LVBench i 88.5 na RealWorldQA w tabeli Qwen. Karta modelu zawiera też przykłady wejść obrazów i wideo, w tym rekomendacje wyższego próbkowania klatek przy zadaniach wideo w skali godzin. obciążenia wideo. obciążenia wideo.

Qwen3.8-Flash-Next a inne modele

Użyteczne porównanie powinno rozdzielić trzy pytania: ile obliczeń jest aktywowanych na token, jak szerokie są modalności i kontekst modelu oraz jak dobrze działa w reprezentatywnych przepływach pracy. Sama łączna liczba parametrów nie odpowiada na te pytania.

Qwen3.8-Flash-Next vs Qwen3.8-27B vs Qwen3.7-Plus

WymiarQwen3.8-Flash-NextQwen3.8-27BQwen3.7-Plus
Parametry modelu125B + 51B N-gram embedding27B397B
Aktywowane parametry6B27B17B
Natywny kontekst262K262K w zestawie porównawczym QwenModel długiego kontekstu poprzedniej generacji
DeepSWE 1.158.742.216.5
CoWorkBench73.970.765.1
JobBench55.733.427.6
AndroidWorld84.581.981.0

Kluczowym wynikiem jest zdolność na aktywowany parametr. Qwen3.8-Flash-Next aktywuje 6B parametrów na token wobec 27B dla Qwen3.8-27B i 17B dla Qwen3.7-Plus, a mimo to jest z przodu w wymienionych wynikach DeepSWE, CoWorkBench, JobBench i AndroidWorld. Kompromisem jest ślad pamięciowy: rzadkość zmniejsza aktywne obliczenia, nie zaś ilość pojemności modelu, którą ostatecznie trzeba gdzieś przechowywać.

Qwen3.8-Flash-Next vs DeepSeek V4 Flash vs Claude Opus 4.6

WymiarQwen3.8-Flash-NextDeepSeek V4 FlashClaude Opus 4.6
WagiOtwarteOtwarteZamknięte
Profil parametrów (rap.)125B główny + 51B N-gram; 6B aktywne284B łącznie; 13B aktywneNieujawnione publicznie
Główna historia efektyw.QSA + GDN + 6B aktywne MoE + pamięć lookupWysokoprzepustowy rzadki MoEZarządzany stos rozumowania i agentów
Natywna multimodalnośćTekst, obraz, wideo -> tekstRodzina Flash ukierunkowana na tekst; ścieżka wizji dostępna osobno w CometAPITekst + wizja/pliki przez hostowane API
SWE-bench Pro*62.556.053.4
CoWorkBench*73.945.168.2
NL2Repo-Bench*48.154.247.6
HLE*35.933.840.0

DeepSeek V4 Flash pozostaje mocniejszy na NL2Repo-Bench w porównaniu Qwen, co ma znaczenie dla generowania kodu na poziomie repozytorium. Claude Opus 4.6 jest silniejszy na HLE w tej samej tabeli i reprezentuje zamknięty model zarządzany, a nie otwarty cel wdrożenia. Qwen3.8-Flash-Next wyróżnia się połączeniem otwartych wag, natywnej multimodalności, inżynierii długiego kontekstu i bardzo małego budżetu aktywnych parametrów.

Qwen3.8-Flash-Next vs Qwen3.8-Max

WymiarQwen3.8-Flash-NextQwen3.8-Max
RolaEfektywność przede wszystkim; otwarta zapowiedź architekturyFlagowiec Qwen3.8
Skala gł./łączna125B główny + 51B N-gram; 6B aktywne2.4T łącznie; około 95B aktywnych na stronie modelu CometAPI
Nacisk architekton.QSA, GDN, Gated Residual, N-gram Embedding, MuonMaksymalna zdolność frontier przy znacznie większej skali
Najlepsze zastos.Agenci o dużym wolumenie, asystenci kodowania, automatyzacja multimodalna, self-hostingNajtrudniejsze rozumowanie, duże agenty korporacyjne, zadania capability-first
Kontekst262K natywnie; do 1M z YaRNKontekst klasy 1M w hostowanych trasach na obecnych ścieżkach Qwen3.8

Specyfikacje Qwen3.8-Max oparto na bieżącym wpisie modelu w CometAPI.

Różnica jest prosta: Qwen3.8-Max to flagowiec stawiający na zdolności, a Qwen3.8-Flash-Next to eksperyment architektoniczno-wydajnościowy. Deweloperzy wybierający między nimi powinni zapytać, czy wąskim gardłem jest absolutna zdolność modelu, czy koszt uruchamiania wielu długokontekstowych, korzystających z narzędzi zadań na skalę.

Cennik i dostępność Qwen3.8-Flash-Next

Otwarte wagi Qwen3.8-Flash-Next są opublikowane przez Hugging Face i ModelScope. Dla serwowania zarządzanego Qwen podaje, że wersja produkcyjna nazywa się Qwen3.8-Flash w QwenCloud, z kontekstem 1M włączonym domyślnie i oficjalnymi wbudowanymi narzędziami.

Qwen wymienia cenę zarządzanego modelu produkcyjnego na poziomie $0.16 za milion tokenów wejściowych i $0.47 za milion tokenów wyjściowych. Ta cena dotyczy produkcyjnego modelu QwenCloud Qwen3.8-Flash, a nie samodzielnego hostowania otwartych wag.

TrasaWejścieWyjście
Model produkcyjny QwenCloud (Qwen3.8-Flash)$0.16 / 1M tokenów$0.47 / 1M tokenów
Samodzielny hosting otwartych wagZależne od infrastrukturyZależne od infrastruktury
Trasa CometAPISprawdź stronę modeluSprawdź stronę modelu

Ceny QwenCloud pochodzą z oficjalnego artykułu Qwen o premierze; rozliczenia CometAPI należy sprawdzić na aktualnej stronie modelu.

Dla użytkowników CometAPI dedykowany model Qwen3.8-Flash-Next identyfikuje ścieżkę jako qwen3.8-flash-next. Ponieważ trasowanie, dostępność upstream i rozliczenia mogą zmieniać się niezależnie od wydania wag otwartych, integracje produkcyjne powinny sprawdzać aktualny katalog CometAPI, zanim na stałe założą ceny.

Rekomendacja CometAPI

Qwen3.8-Flash-Next jest spodziewany wkrótce w CometAPI. CometAPI dostarcza pojedynczy endpoint kompatybilny z OpenAI (https://api.cometapi.com/v1), który agreguje 500+ modeli od wiodących dostawców, w tym modele serii Qwen. To podejście ogranicza uzależnienie od jednego dostawcy, upraszcza eksperymenty z Qwen3.8-Flash (gdy będzie dostępny przez platformę lub powiązane endpointy Qwen) oraz usprawnia wdrożenia produkcyjne, które mogą mieszać modele do różnych zadań (np. Qwen do ekonomicznych kosztowo agentów kodujących + inny model do wyspecjalizowanego rozumowania). Dokumentacja i przewodniki quick-start są dostępne na apidoc.cometapi.com i głównej stronie CometAPI.

Niezależnie od tego, czy samodzielnie hostujesz wagi, używasz QwenCloud, czy korzystasz z ujednoliconej platformy takiej jak CometAPI, Qwen3.8-Flash-Next obniża barierę dla wydajnych, długokontekstowych, multimodalnych agentów.

Co potrafi Qwen3.8-Flash-Next?

1. Agenci kodujący o dużym wolumenie

Budżet 6B aktywnych parametrów połączony z wynikiem 62.5 na SWE-bench Pro w ewaluacji Qwen czyni Qwen3.8-Flash-Next szczególnie interesującym dla systemów kodujących uruchamiających wiele równoległych sesji. Przykłady obejmują przegląd kodu, triaż zgłoszeń, nawigację po repozytorium, generowanie testów i iteracyjne wprowadzanie poprawek, gdzie przepustowość jest niemal równie ważna co inteligencja pojedynczego przebiegu.

2. Długohoryzontowa praca biurowa i z wiedzą

CoWorkBench i JobBench są centralne dla pozycjonowania modelu. Architektura jest zaprojektowana pod pętle agentów, które wielokrotnie czytają kontekst, wywołują narzędzia, aktualizują stan i kontynuują pracę, zamiast odpowiadać raz. To naturalnie mapuje się na przepływy dokumentowe, analizę arkuszy, składanie raportów, syntezę badań i automatyzację procesów biznesowych.

3. Multimodalni agenci komputerowi i mobilni

Wejścia obrazów i wideo, wyniki AndroidWorld, ewaluacja OSWorld oraz Vision2Web czynią model relewantnym dla agentów GUI. Może służyć jako warstwa rozumowania za systemami interpretującymi zrzuty ekranu, obsługującymi interfejsy mobilne, odtwarzającymi układy aplikacji lub łączącymi stan wizualny z wywołaniami narzędzi.

4. Długie wideo i rozumowanie wizualne

Oficjalna karta modelu zawiera jawne przykłady wejść wideo i wskazówki do przetwarzania wideo w skali godzin. To czyni model użytecznym do odpowiadania na pytania o wideo, wyszukiwania w długich materiałach, ekstrakcji zdarzeń wizualnych i przepływów łączących rozumienie wideo z narzędziami downstream.

5. Przepływy badawcze i repozytoryjne na milion tokenów

Otwarty model natywnie obsługuje 262,144 tokeny i jest rozszerzalny do 1,000,000 z YaRN. To rozróżnienie ma znaczenie: 1M to rozszerzenie, a nie natywny kontekst otwartego modelu. Dla dużych repozytoriów lub korpusów badawczych QSA ma sprawić, że koszt wyszukiwania w tak długich kontekstach będzie bardziej praktyczny niż w gęstej globalnej uwadze.

Jak deweloperzy mogą uruchomić Qwen3.8-Flash-Next?

Deweloperzy mogą pobrać otwarte wagi z Hugging Face i uruchomić model z Transformers, vLLM, SGLang lub TokenSpeed. Qwen dostarcza przykłady Chat Completions kompatybilne z OpenAI zarówno dla tekstu, jak i wejść multimodalnych.

Na przykład oficjalna karta modelu demonstruje serwowanie Qwen/Qwen3.8-Flash-Next z vLLM i wywoływanie przez /v1/chat/completions. Wejścia obrazów i wideo są również pokazane przez interfejs kompatybilny z OpenAI.

Qwen3.8-Flash-Next działa domyślnie w trybie myślenia. Deweloperzy mogą kontrolować zachowanie myślenia przez enable_thinking, preserve_thinking i reasoning_effort; udokumentowane poziomy reasoning-effort to xhigh, medium i low.

Jakie są ograniczenia Qwen3.8-Flash-Next?

Największym praktycznym ograniczeniem jest koszt sprzętowy. Chociaż aktywowanych jest tylko 6B parametrów modelu językowego, checkpoint zawiera 125B parametrów językowych plus komponent osadzeń n-gramowych 51B i 4B parametrów MTP. Bieżące repozytorium ma około 360 GB, więc lokalne wdrożenie nadal jest zadaniem wymagającym infrastruktury.

Drugim ograniczeniem jest to, że 262K to natywna długość kontekstu, a nie 1M. Model można rozszerzyć do 1M tokenów, ale strona CometAPI lub modelu nie powinna po prostu wymieniać „1M native context”. Poprawne sformułowanie to natywny kontekst 262K, rozszerzalny do 1M.

Wreszcie, wydajność w benchmarkach jest nierówna. Qwen3.8-Flash-Next jest bardzo konkurencyjny w zadaniach kodowania i agentowych, ale nie prowadzi we wszystkim. Na przykład Claude Opus 4.6 osiąga 40.0 na HLE wobec 35.9 dla Flash-Next, a DeepSeek-V4-Flash-0731 prowadzi w wymienionych modelach na NL2Repo-Bench.

Qwen3.8-Flash-Next: co to sygnalizuje dla Qwen4

Szersze znaczenie tego wydania polega na roli wczesnej zapowiedzi architektury, która prawdopodobnie będzie podstawą Qwen4. Qwen3.8-Flash-Next łączy Qwen Sparse Attention, Gated DeltaNet, czterogałęziowe połączenia Gated Residual, N-gram Embedding, ultrarzadką pulę ekspertów MoE i Multi-Token Prediction. Te wybory pokazują, jak Qwen eksploruje większą pojemność, dłuższy kontekst i mocniejszą multimodalność oraz wydajność agentów bez proporcjonalnego zwiększania aktywnych obliczeń na token.

Ostateczny werdykt

Qwen3.8-Flash-Next jest ważny, ponieważ zmienia sposób postrzegania problemu efektywności. Zamiast traktować wszystkie parametry jednakowo, łączy relatywnie małą aktywną ścieżkę MoE z bardzo dużą pamięcią w stylu tablicy wyszukiwań i rzadkim mechanizmem retrievalu zaprojektowanym pod długi kontekst. Daje to Qwen kilka niezależnych dźwigni do zwiększania pojemności bez równomiernego zwiększania obliczeń macierzowych na token.

Dla deweloperów czyni to model atrakcyjną opcją dla ekonomicznych kosztowo asystentów kodowania, agentów długiego kontekstu, automatyzacji multimodalnej i samodzielnych eksperymentów. Dla szerszej mapy drogowej Qwen jest to jeszcze istotniejsze: Qwen jawnie używa tego wydania, aby ujawnić kierunek architektoniczny, który planuje doskonalić w kierunku Qwen4.

Kontynuuj naukę

Połącz ten artykuł z następną decyzją.

Zobacz wszystkie tematy
Opublikowano Aug 28, 2026
Ostatnia aktualizacja Aug 29, 2026
13 wyświetleń
Sprawdzone pod kątem przejrzystości, atrybucji źródeł i aktualnej terminologii API.

Gotowy na obniżenie kosztów rozwoju AI o 20%?

Zacznij za darmo w kilka minut. Dołączone kredyty na bezpłatny okres próbny. Karta kredytowa nie jest wymagana.

Czytaj więcej