TLDR Zespół Qwen w Alibaba oficjalnie wprowadził 3 sierpnia 2026 r. model Qwen3.8-Max — rzadką architekturę Mixture-of-Experts o łącznej liczbie 2,4 bln parametrów (95 mld aktywnych), oknie kontekstu 1 miliona tokenów i natywnej obsłudze multimodalności (tekst + obraz + wideo).
To pierwszy model klasy Max w Qwen zaplanowany do publikacji z otwartymi wagami (oczekiwany w następnym tygodniu). Agresywnie wyceniony na $2 za milion tokenów wejściowych i $6 za milion tokenów wyjściowych, zapewnia mocne wyniki w zadaniach agentowych o długim horyzoncie, autonomicznym inżynierowaniu oprogramowania (w tym udokumentowany 16‑dniowy, samorozwijający się projekt kodowy), reprodukcji badań i benchmarkach multimodalnych. Konkuruje bezpośrednio z modelami takimi jak Kimi K3 i plasuje się powyżej lżejszych opcji, np. DeepSeek V4 Flash, pod względem możliwości, pozostając jednocześnie znacznie bardziej opłacalny kosztowo niż czołowe zachodnie modele „frontier” przy obciążeniach z dużą liczbą tokenów wyjściowych. Deweloperzy mogą uzyskać do niego dostęp już dziś poprzez QwenCloud / Alibaba Cloud Model Studio oraz jednolite platformy takie jak CometAPI.
Kluczowe informacje
- Skala i efektywność: 2,4T łącznie / 95B aktywnych, architektura MoE zbudowana na fundamentach Qwen 3.5 zapewnia osiągi na poziomie czołowym przy praktycznym koszcie inferencji.
- Siła na długim horyzoncie: Udokumentowane wielodniowe autonomiczne kodowanie (265 commitów, 127 PR w ~16 dni bez interwencji człowieka), reprodukcja + ulepszenie badań oraz roczna symulacja operacji e‑commerce.
- Najważniejsze wyniki benchmarków: PaperBench 93,0 (czołowo), Terminal Bench 2.1 86,6, mocne wyniki multimodalne i dokumentowe; konkurencyjny, choć nie dominujący na każdym stricte koderskim leaderboardzie względem Claude Fable 5 czy GPT‑5.6 Sol.
- Przewaga cenowa: Stałe $2 / $6 za 1M tokenów w całym 1M kontekście (buforowane wejście ~$0.25), taniej niż Kimi K3 na wyjściu i wiele modeli zachodnich.
- Dostępność: Dostępny na żywo w QwenCloud i Alibaba Cloud Model Studio (API kompatybilne z OpenAI i Anthropic); planowane otwarte wagi; już widoczny na CometAPI jako
qwen3.8-maxdla ujednoliconego dostępu do 500+ modeli. Otwarte wagi wkrótce; planowany także mniejszy wariant Qwen3.8‑27B do praktycznych wdrożeń lokalnych/brzegowych. - Przewaga praktyczna: Wyróżnia się w produkcji kompletnych rezultatów end‑to‑end, a nie jednowierszowych odpowiedzi — idealny dla agentów kodujących, pipeline’ów badawczych, przepływów biurowych i długotrwałych pętli agentowych.
Czym jest Qwen3.8-Max?
Qwen3.8-Max to najnowszy i najbardziej zaawansowany flagowiec w serii Qwen, oficjalnie wydany 3 sierpnia 2026 r. (po zapowiedzi w połowie lipca na World AI Conference w Szanghaju). Reprezentuje świadome przesunięcie w stronę modeli, które potrafią domykać złożone, wielodniowe zadania end‑to‑end przy minimalnym nadzorze i dostarczać gotowe do wdrożenia rezultaty.
Architektonicznie jest to rzadka Mixture‑of‑Experts (MoE), skalująca się do 2,4 bln łącznych parametrów, z czego na token jest aktywowanych około 95 mld. Ta konstrukcja, oparta na Qwen 3.5, łączy ogromną pojemność z efektywnością inferencji. Model obsługuje okno kontekstu 1 miliona tokenów (udokumentowane maks. wejście około 991K tokenów i maks. wyjście około 131K tokenów), natywne wejścia multimodalne (tekst, obrazy i wideo) oraz wyjście tekstowe. Oferuje sterowanie nakładem rozumowania (xhigh / medium / low) i obsługuje protokoły zgodne z OpenAI Chat Completions oraz Anthropic, dzięki czemu można go „podmienić” w popularnych frameworkach agentowych, takich jak Claude Code, Codex, Qoder CLI, Qwen Code i OpenClaw.
W przeciwieństwie do wcześniejszych modeli klasy Max, które pozostały zamknięte, Alibaba zobowiązała się do wydania wag Qwen3.8‑Max (oraz mniejszego wariantu Qwen3.8‑27B) w tydzień po premierze poprzez Hugging Face i ModelScope — po raz pierwszy wagi modelu Qwen klasy Max będą publicznie dostępne.
Model jest pozycjonowany pod kątem agentów kodujących, realnej pracy zawodowej („cowork”), badań, długohoryzontalnego planowania i multimodalnych pętli agentowych. Oficjalne dema podkreślają zachowanie samorozwojowe: model tworzy zgłoszenia, sam je sobie przypisuje, pisze i testuje kod, iteruje na feedbacku i przez dłuższy czas ulepsza własne narzędzia.
Źródła: Oficjalny blog Qwen oraz ogłoszenia Alibaba Cloud (sierpień 2026); karta modelu Artificial Analysis; niezależne recenzje podsumowujące wydanie GA.
Co nowego w Qwen3.8-Max?
W porównaniu z poprzednikiem Qwen3.7‑Max generacja 3.8 przynosi znaczące zyski w agentowym kodowaniu, niezawodności na długim horyzoncie, rozumowaniu multimodalnym oraz pracy na dokumentach/biurze. Kluczowe innowacje obejmują:
Prawdziwa autonomia długiego horyzontu:
Model potrafi utrzymywać adaptacyjne uczenie w pętli zamkniętej przez setki tur lub wiele dni. Udokumentowane przykłady to 16‑dniowy autonomiczny projekt inżynierii oprogramowania, który stworzył samorozwijające się narzędzie CLI (oh‑my‑cli) z 265 commitami, 127 pull requestami i 151 zgłoszeniami, w całości bez interwencji człowieka; reprodukcja i ulepszenie metodologii pracy naukowej (w tym pętle treningowe na GPU i mierzalne zyski w benchmarkach); oraz pełny symulowany rok operacji e‑commerce, znacząco przewyższający baseline’y.
Multimodalność jako ciągła pętla sprzężenia zwrotnego:
Wizja nie jest jedynie modalnością wejściową. Model wykorzystuje rozumienie wizualne do planowania, monitorowania wykonania i autokorekty — umożliwiając zadania takie jak odtwarzanie interfejsu „screenshot‑to‑code”, interaktywne generowanie gier/animacji czy wizualizację 2D‑do‑3D.
Model zajmuje wysokie pozycje na Text Arena (piąte raportowane) i Vision Arena (drugie raportowane) we wczesnych danych po wydaniu.


Skupienie na rezultatach end‑to‑end:
Akcent na dostarczanie produkcyjnej jakości wyników w setkach zawodów, a nie izolowanych odpowiedzi.
Tryby Myślenia i Szybkiej Inferencji
Dwa tryby: tryb myślenia i tryb szybkiej inferencji. Tryb myślenia służy do głębszego rozumowania i złożonego planowania. Tryb szybki jest przeznaczony do odpowiedzi o niższych opóźnieniach, gdy zadanie jest proste. Dokumentacja Alibaba Cloud OpenCode pokazuje thinking włączony dla tras Qwen3.8 i wymienia kontrolę rozumowania dla trasy podglądowej, w tym xhigh, medium i low.
Ten podział ma wartość z perspektywy projektowania produktu. Zespoły nie powinny używać najcięższego trybu rozumowania dla każdego żądania. Bot wsparcia może tanio sklasyfikować prosty ticket, podsumować go szybszym modelem i eskalować do trybu thinking Qwen3.8‑Max tylko wtedy, gdy użytkownik prosi o skomplikowaną decyzję polityczną, analizę przyczyn źródłowych, przegląd umowy lub plan migracji kodu.
Te możliwości zostały zweryfikowane poprzez wewnętrzne, długotrwałe eksperymenty oraz kompleksowy zestaw benchmarków obejmujący agentów kodujących, agentów ogólnych, rozumowanie multimodalne, rozumienie dokumentów oraz zadania percepcji/uzasadniania.
Benchmarking: wydajność kwantyzacji danych
Alibaba opublikowała przy GA rozbudowany wewnętrzny zestaw benchmarków. Niezależne weryfikacje (Artificial Analysis Intelligence Index, LMArena itd.) nadrabiały zaległości w pierwszych dniach po wydaniu; wczesne dane Artificial Analysis umieściły Qwen3.8‑Max na poziomie Intelligence Index 53 (pozycja ~16/186 w śledzonym zbiorze), z odnotowaną wysoką rozwlekłością i relatywnie niższą szybkością.
Wybrane oficjalne/raportowane wyniki (Qwen3.8‑Max vs wybrani konkurenci):
| Benchmark | Qwen3.8-Max | Claude Fable 5 / Opus 4.8 | GPT-5.6 Sol (max) | Qwen3.7-Max |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 86.6 | 84.6 | 88.8 | 74.5 |
| PaperBench | 93.0 | 88.8 / 80.3 | 90.5 | 64.8 |
| SWE-bench Pro | 67.7 | 80.0 / 69.2 | 64.6 | 60.6 |
| FrontierSWE | 73.5 | 88.8 | — | 40.7 |
| DeepSWE 1.1 | 56.6 | 70.0 | 73.0 | 21.6 |
| IFBench | 82.8 | ~63.5 | — | 79.1 |
| GPQA Diamond | 92.6 | 92.6 | 94.1 | 92.4 |
| OmniDocBench 1.5 | 92.1 | — | — | — |
| OSWorld-Verified | 86.1 | — | — | — |
Qwen3.8‑Max często prowadzi lub plasuje się blisko czołówki w rozumowaniu multimodalnym, zadaniach dokumentowo‑biurowych i wybranych metrykach agentowego kodowania/badań, ustępując na niektórych czysto inżynieryjnych zestawach agentowych najmocniejszym, zamkniętym modelom. Szczególnie godny uwagi jest skok generacyjny na FrontierSWE i DeepSWE. Traktuj liczby dostawcy jako orientacyjne; niezależne uruchomienia i ocena pod konkretny workload pozostają kluczowe.
Cennik API Qwen3.8-Max
Oficjalny cennik Alibaba Cloud Model Studio / QwenCloud dla Qwen3.8‑Max (stawki GA na początku sierpnia 2026):
- Wejście: $2,00 za 1 milion tokenów
- Wyjście: $6,00 za 1 milion tokenów (wliczając tokeny rozumowania)
- Buforowane wejście: około $0,25 za 1 milion tokenów (znaczne oszczędności przy powtarzanych długich kontekstach)
Cennik jest stały w całym oknie 1M tokenów — co stanowi zauważalną przewagę względem wielu konkurentów doliczających dopłaty za długi kontekst. Rabaty hurtowe i inne mogą obowiązywać w zależności od regionu wdrożenia i planu.
Kontekst porównawczy (przybliżone ceny katalogowe w zbliżonym okresie):
- Kimi K3: ~$3 / $15
- Wyższe modele Claude / GPT „frontier”: często $5+ / $15–25+
- Warianty DeepSeek V4 Flash: znacząco niższe (często poniżej $0.50 łącznie dla wielu zastosowań)
Dla zespołów już korzystających z wielu dostawców, zintegrowane bramki takie jak CometAPI zazwyczaj oferują ~20% rabatu względem stawek oficjalnych, pojedynczy endpoint kompatybilny z OpenAI, zunifikowane rozliczenia oraz łatwe przełączanie modeli lub failover. Ułatwia to eksperymenty z Qwen3.8‑Max (oraz równoległe porównania z DeepSeek V4 Flash, Kimi i innymi) operacyjnie i często taniej. Sprawdź aktualne strony cen CometAPI i oferty darmowych kredytów dla najnowszych skutecznych stawek.
Jak Qwen3.8-Max wypada na tle Kimi K3 i DeepSeek V4 Flash
| Wymiar | Qwen3.8-Max | Kimi K3 | DeepSeek V4 Flash |
|---|---|---|---|
| Parametry łącznie / aktywne | 2.4T / ~95B | ~2.8T / ~104B | 284B / 13B |
| Kontekst | 1M | 1M | 1M |
| Multimodalny | Tekst + Obraz + Wideo | Tekst + Obraz + Wideo | Tylko tekst |
| Cennik (wej./wyj.) | $2 / $6 | $3 / $15 | ~$0.14 / $0.28 (znacznie taniej) |
| Otwarte wagi | Planowane (następny tydzień) | Już wydane | MIT, dostępny |
| Mocne strony | Autonomia długiego horyzontu, multimodalność, PaperBench, cena wyjścia | Mocne niezależne wyniki, lider na arenach frontendu | Skrajna opłacalność, solidne agentowe kodowanie jak na rozmiar |
| Pozycja względna | Konkurencyjny / wiodący na kilku ławkach agentowych i multimodalnych | Lekka przewaga na niektórych audytowanych indeksach inteligencji | Świetna wartość; niższa absolutna zdolność |
Qwen3.8‑Max generalnie dorównuje lub przewyższa Kimi K3 pod kątem opłacalności przy pracach z dużą liczbą tokenów wyjściowych i zadań multimodalnych, podczas gdy DeepSeek V4 Flash pozostaje królem budżetu dla masowych zadań tekstowych, gdzie szczytowe możliwości są drugorzędne. Wiele zespołów użyje wszystkich trzech przez ujednoliconą bramkę, kierując proste obciążenia do modeli klasy Flash, a złożone sesje agentowe do Qwen3.8‑Max lub Kimi K3.
Czy Qwen3.8-Max dorównuje Kimi K3?
Pod pewnymi względami tak. Zgadza się warstwa 1M‑kontekstu, model ma mocną pozycję w multimodalności i jest tańszy w oficjalnym cenniku na wejściu/wyjściu. Nie dorównuje liczbie 2,8T parametrów łącznych Kimi K3, a publiczna dokumentacja Kimi obecnie zapewnia wyjątkowo szczegółowe wytyczne dotyczące narzędzi, cache’owania kontekstu, strukturalnego wyjścia i wizji.
Czy Qwen3.8-Max dorównuje DeepSeek V4 Flash?
Konkuruje w 1M‑kontekście i architekturze MoE, ale produkty mają inne cele. DeepSeek V4 Flash to ekonomiczna, szybka ścieżka. Qwen3.8‑Max to większa, wysokozdolna trasa do zadań, gdzie rozumienie multimodalne, zaawansowane wnioskowanie i produktywność enterprise są ważniejsze niż najniższa cena tokena.
Co potrafi Qwen3.8-Max?
Kodowanie i inżynieria oprogramowania
Qwen3.8‑Max to mocny kandydat do zadań full‑stack, code review, rozumienia repozytoriów, planowania migracji, projektowania API, debugowania, rozumowania testów i architektury oprogramowania. Długi kontekst pomaga, gdy model musi mieć na widoku wiele plików, logów i wymagań. Używaj go do trudnych zadań kodowych, nie do każdego autouzupełniania czy prostej interpretacji lint.
Praca biurowa i wiedza
Pozycjonowanie „Cowork” ma znaczenie. Pracownicy enterprise nie tylko zadają pytania na czacie. Porównują PDF‑y, podsumowują spotkania, przeglądają slajdy, interpretują arkusze, sprawdzają umowy, piszą raporty i przygotowują decyzje z chaotycznych danych. Projekt multimodalny i długiego kontekstu w Qwen3.8‑Max czyni go odpowiednim do przepływów biurowych, gdzie tekst, dokumenty, zrzuty ekranu i dane strukturalne muszą być rozumowane razem.
Przepływy agentowe
Qwen3.8‑Max jest użyteczny w planowaniu agentów: rozbijaniu celu na kroki, decydowaniu, które narzędzie wywołać, ocenie wyników i rewizji planu. W CometAPI jest to praktyczniejsze, ponieważ ta sama aplikacja może kierować proste kroki do tańszych modeli, a Qwen3.8‑Max rezerwować do planowania lub weryfikacji.
Pierwsze kroki i wskazówki integracji z CometAPI
- Dostęp bezpośredni: Użyj QwenCloud lub Alibaba Cloud Model Studio z identyfikatorem modelu
qwen3.8-max. Obsługiwane są endpointy zgodne z OpenAI i Anthropic. - Ujednolicony dostęp przez CometAPI: Zarejestruj się na CometAPI.com, uzyskaj klucz API, ustaw
base_urlnahttps://api.cometapi.com/v1i wywołajmodel="qwen3.8-max". Ten sam klucz działa dla DeepSeek V4 Flash, Kimi K3, Claude, GPT i setek innych modeli — idealne do eksperymentów, kontroli kosztów i routingu produkcyjnego. CometAPI kładzie nacisk na konkurencyjne ceny, niskie opóźnienia i szybkie dodawanie nowych modeli (Qwen3.8‑Max pojawił się krótko po premierze). - Frameworki agentowe: Podłącz bezpośrednio do Claude Code, OpenClaw lub własnych harnessów. Włącz wyższy nakład rozumowania dla złożonych, długohoryzontalnych zadań.
- Otwarte wagi: Monitoruj Hugging Face / ModelScope pod kątem nadchodzącego wydania, jeśli potrzebujesz wdrożeń on‑premises lub fine‑tuningu.
