GPT-5.6 Luna price down 80%, Terra down 20% →

Qwen 3.8 Max Cennik API: $2 wejście, $6 wyjście, kontekst 1M

CometAPI
Mia MarenAug 4, 2026
Qwen 3.8 Max Cennik API: $2 wejście, $6 wyjście, kontekst 1M

Cennik API Qwen 3.8 Max: $2 za wejście, $6 za wyjście, kontekst 1M

TL;DR

Qwen 3.8 Max kosztuje na QwenCloud $2 za 1 milion tokenów wejściowych oraz $6 za 1 milion tokenów wyjściowych. Stawki pamięci podręcznej specyficzne dla modelu wynoszą $0.25/M za niejawnie zbuforowane wejście, $2.50/M za jawne utworzenie bufora oraz $0.17/M za jawny odczyt bufora.

Te same standardowe stawki tokenowe obowiązują w całym obsługiwanym przez model oknie kontekstu 1M tokenów. Większe prompty kosztują więcej, ponieważ zawierają więcej tokenów, a nie dlatego, że wchodzą w wyższy próg cenowy dla długiego kontekstu.

W cenie katalogowej Qwen 3.8 Max jest tańszy o 20% niż Qwen 3.7 Max. Jednak Qwen 3.7 Max jest tańszy, dopóki obowiązuje jego bieżąca promocja -50%. Lepszy wybór produkcyjny zależy od kosztu na zaakceptowane zadanie, uwzględniającego rozumowanie, trafienia w bufor, narzędzia, ponowienia, opóźnienia i weryfikację przez człowieka.

Cennik API Qwen 3.8 Max w skrócie

PozycjaAktualna oficjalna wartość
Produkcyjny identyfikatorqwen3.8-max
Oficjalna data wydania3 sierpnia 2026
Architektura2.4T parametrów łącznie; 95B aktywnych
Standardowa cena wejścia$2 / 1M tokenów
Standardowa cena wyjścia$6 / 1M tokenów
Niejawne zbuforowane wejście$0.25 / 1M tokenów
Jawne utworzenie bufora$2.50 / 1M tokenów
Jawny odczyt bufora$0.17 / 1M tokenów
Okno kontekstu1M tokenów
Maksymalne wejście991K bez rozumowania; 983K z rozumowaniem
Maksymalne wyjście131K
Maksymalne rozumowanie262K
Modalności wejścioweTekst, obraz i wideo
Modalność wyjściowaTekst
Limity referencyjne QwenCloud2M TPM i 15K RPM

Strona modelu QwenCloud jest najbardziej bezpośrednim źródłem aktualnego identyfikatora modelu, cen, stawek bufora, limitów kontekstu i modalności. Limity zależne od konta i regionu mogą się różnić, więc przy ustawianiu produkcyjnej współbieżności korzystaj z limitów wyświetlanych w Twojej konsoli.

Wydanie produkcyjne zastępuje również identyfikator podglądu na qwen3.8-max i dodaje kompletną kartę stawek specyficzną dla modelu. Materiały startowe Qwen opisują ustawienia wysiłku rozumowania low, medium i xhigh, ale zachowanie produkcyjne należy weryfikować względem używanego punktu końcowego i dokumentacji API.

Uwaga wrażliwa na czas: Qwen zapowiedział, że po wydaniu API pojawią się otwarte wagi. Na dzień 4 sierpnia 2026 r. nie opisuj Qwen 3.8 Max jako możliwego do pobrania ani do samodzielnego hostowania, dopóki nie zostaną opublikowane oficjalny checkpoint i licencja.

Jak działa cennik Qwen 3.8 Max

QwenCloud obecnie podaje płaską stawkę standardową $2 za 1M tokenów wejściowych i $6 za 1M tokenów wyjściowych w całym obsługiwanym oknie kontekstu 1M tokenów dla Qwen 3.8 Max. Poniższy oficjalny zrzut cen pochodzi z 4 sierpnia 2026; zawsze sprawdzaj bieżącą stronę modelu przed podjęciem produkcyjnych decyzji budżetowych.

Qwen 3.8 Max Cennik API: $2 wejście, $6 wyjście, kontekst 1M

Źródło***:*** QwenCloud, „Qwen3.8-Max” official

Pozycja rozliczeniowaCena za 1M tokenówKiedy dotyczy
Standardowe wejście$2.00Nowa treść promptu, definicje narzędzi i niebuforowany kontekst
Standardowe wyjście$6.00Wygenerowane wyjście i rozliczane użycie rozumowania
Trafienie bufora niejawnego$0.25Automatycznie ponownie użyte prefiksy promptu; trafienia nie są gwarantowane
Utworzenie bufora jawnego$2.50Tworzenie oznaczonego wielokrotnego użytku prefiksu promptu
Odczyt bufora jawnego$0.17Ponowne użycie ważnego bloku jawnego bufora

Żądanie na 900K tokenów kosztuje zatem więcej niż na 100K tokenów, ponieważ przetwarza dziewięciokrotnie więcej tokenów wejściowych — nie dlatego, że przekracza wyższy próg cenowy.

Rozumowanie może zwiększyć koszt wyjścia

Krótka widoczna odpowiedź nie zawsze jest niskokosztowa. Wywołania z włączonym rozumowaniem mogą generować dodatkowe tokeny rozumowania, więc szacunki produkcyjne powinny wykorzystywać pola użycia zwracane przez API, a nie długość widocznej odpowiedzi.

Tam, gdzie Twój punkt końcowy obsługuje sterowanie rozumowaniem dla qwen3.8-max, porównaj dostępne ustawienia na tym samym zbiorze ewaluacyjnym. Nie zakładaj, że domyślne ustawienia wersji podglądowej przenoszą się na model GA.

Oszczędności z bufora zależą od stabilności promptu

Strona modelu Qwen 3.8 Max publikuje stawki bufora specyficzne dla modelu. Używaj tych stawek — nie ogólnych wskaźników bufora — przy szacowaniu wydatków.

Wpisy bufora jawnego mają pięć minut ważności, a udane trafienie resetuje ten okres. Buforowanie jest automatyczne w trybie niejawnym, ale trafienie nie jest gwarantowane. Bufor jest najkorzystniejszy, gdy prompty systemowe, definicje narzędzi, kontekst repozytorium lub duże dokumenty pozostają stabilne przy częstych wywołaniach.

Wbudowane narzędzia generują osobne opłaty

QwenCloud obecnie podaje następujące opłaty za narzędzia, oprócz użycia tokenów:

Wbudowane narzędzieBieżąca opłata
Web Search$10 / 1K wywołań
Image Search$8 / 1K wywołań
Web ExtractorBezpłatnie przez ograniczony czas
Code InterpreterBezpłatnie przez ograniczony czas

Wywołania funkcji i MCP nie mają osobnych opłat narzędziowych, ale opisy narzędzi nadal liczą się jako tokeny wejściowe. Promocje na bezpłatne narzędzia mogą się zmieniać, więc przed finalizacją budżetu produkcyjnego sprawdź przewodnik cenowy QwenCloud.

Na przykład żądanie z 20K tokenów wejściowych, 2K tokenów wyjściowych i dwoma wywołaniami Web Search kosztuje w przybliżeniu:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

W tym przykładzie dwa wywołania wyszukiwania stanowią około 27.8% całkowitego kosztu żądania.

Rzeczywiste przykłady kosztów Qwen 3.8 Max

Te przykłady używają bieżących stawek specyficznych dla modelu QwenCloud. Nie obejmują podatków, ponowień, rezerw i narzutów dostawców.

Przykład 1: Średnie żądanie agenta

Assume 50K input tokens and 5K output tokens:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

Udana pierwsza próba kosztuje około $0.13. Jedno pełne ponowienie podniesie koszt modelu do około $0.26.

Przykład 2: Analiza długiego dokumentu

Assume 800K input tokens and 20K output tokens:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

Model nie stosuje oddzielnej dopłaty za długi kontekst w swoim bieżącym cenniku, ale duże prompty i tak generują istotny koszt bezwzględny.

Przykład 3: Buforowana sesja agenta

Załóżmy wielokrotnego użytku prefiks 100K tokenów, 10K nowych tokenów wejściowych, 5K tokenów wyjściowych i 50 wywołań, podczas gdy bufor jawny pozostaje ważny:

First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M     = $0.017
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

Oszacowana oszczędność = $8.917, czyli 71.3%

Oszczędność zależy od trafień w bufor i stabilnego prefiksu. Długie przerwy lub częste zmiany promptów systemowych i schematów narzędzi zmniejszą korzyść.

Qwen 3.8 Max vs Qwen 3.7 Max: porównanie cen

Qwen 3.8 Max jest o 20% tańszy niż Qwen 3.7 Max w cenie katalogowej, ale Qwen 3.7 Max jest o 37.5% tańszy, gdy obowiązuje jego bieżąca promocja -50%.

Model i status cenowyWejście / 1MWyjście / 1MKontekst
qwen3.8-max cena standardowa$2.00$6.001M
qwen3.7-max cena katalogowa$2.50$7.501M
qwen3.7-max bieżąca promocja$1.25$3.751M

Trzymaj pod ręką stronę modelu CometAPI Qwen3.7 Max jako rezerwę podczas testowania nowego modelu.

Cena za token to tylko jedna część decyzji. Qwen 3.8 Max może nadal być bardziej ekonomiczny, jeśli zwiększa skuteczność w pierwszym podejściu, pewniej korzysta z narzędzi, ogranicza ponowienia lub wymaga mniej poprawek ręcznych.

Użyj tego wskaźnika produkcyjnego:

Koszt na zaakceptowane zadanie =

(tokeny modelu + wywołania narzędzi + ponowienia + koszt rezerwy + koszt weryfikacji)

÷ zaakceptowane wyjścia

Wyniki benchmarków od dostawcy to powód, by ponownie przetestować wymagające przepływy kodowania i pracy profesjonalnej, a nie dowód, że każdy workload Qwen 3.7 powinien migrować.

Jak migrować do Qwen 3.8 Max

Zmiana łańcucha modelu jest konieczna, ale nie stanowi kompletnej migracji produkcyjnej.

1. Przetestuj produkcyjny identyfikator modelu

Zastąp identyfikator podglądu qwen3.8-max w środowisku testowym. Nie zakładaj, że aliasy podglądowe, domyślne ustawienia, opóźnienia czy zachowanie odpowiedzi pozostaną bez zmian.

Minimalne żądanie zgodne z OpenAI może wyglądać tak:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

Zacznij od minimalnego udokumentowanego żądania. Dodaj kontrolę rozumowania tylko wtedy, gdy aktualna dokumentacja API dla Twojego punktu końcowego wprost to wspiera.

2. Ustal na nowo punkt odniesienia dla telemetrii kosztów i wydajności

Zapisz co najmniej:

  • tokeny wejścia, wyjścia i rozumowania
  • trafienia bufora i tokeny tworzenia bufora
  • czas do pierwszego tokena i całkowite opóźnienie
  • wywołania narzędzi, ponowienia i rezerwy
  • wyjścia zaakceptowane vs odrzucone
  • czas korekty ręcznej

3. Przetestuj interfejs używany przez Twoją aplikację

Zwaliduj zdarzenia streamingu, ładunki multimodalne, schematy narzędzi, strukturalne wyjście, powody zakończenia, pola użycia, obsługę błędów i zachowanie w wielu turach. Strona modelu produkcyjnego dokumentuje dostęp przez DashScope i zgodność z OpenAI; zweryfikuj każdą dodatkową warstwę kompatybilności, zanim na niej polegniesz.

4. Uwzględnij praktyczne ograniczenia kontekstu

Okno kontekstu 1M to nie to samo co prompt użytkownika na 1M tokenów. QwenCloud podaje maksymalne wejście 991K bez rozumowania i 983K z rozumowaniem. Dodaj margines bezpieczeństwa, aby żądanie miało miejsce na wyjście i rozumowanie.

5. Uruchom Qwen 3.7 i Qwen 3.8 równolegle

Użyj identycznych promptów, narzędzi, walidatorów, zasad ponowień i zbiorów danych. Porównuj koszt na zaakceptowane zadanie i opóźnienie, zamiast oceniać odosobnione odpowiedzi „na oko”.

Jak oceniać i kierować Qwen 3.8 Max

Używaj rzeczywistych obciążeń, a nie szerokich średnich benchmarkowych.

WorkloadSugerowane zadaniaGłówny sygnał akceptacji
Kodowanie repozytorium4Testy przechodzą bez poprawek ręcznych
Analiza długich tekstów3Tezy są poparte dostarczonymi dowodami
Analiza multimodalna2Właściwe użycie istotnych szczegółów obrazu lub wideo
Agenci korzystający z narzędzi3Prawidłowy wybór narzędzia i poprawne argumenty
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

Używaj Qwen 3.8 Max do trudnych prac w repozytoriach, agentów długohoryzontowych, analizy multimodalnej i tam, gdzie Qwen 3.7 nie przechodzi testów akceptacyjnych. Pozostań przy Qwen 3.7 Max, gdy promocja istotnie obniża koszt, a dotychczasowy model spełnia Twoje cele jakościowe.

Sprawdź stronę cenową CometAPI i bieżące informacje o routingu przed „zamrożeniem” progów, ponieważ dostępność dostawców i ceny routingu mogą zmieniać się niezależnie od bezpośredniej ceny katalogowej QwenCloud. CometAPI Cookbook pomoże Ci zbudować powtarzalne żądania i spójny harness ewaluacyjny.

FAQ

Ile kosztuje API Qwen 3.8 Max?

QwenCloud obecnie wycenia Qwen 3.8 Max na $2 za 1 milion tokenów wejściowych oraz $6 za 1 milion tokenów wyjściowych. Użycie bufora i wbudowanych narzędzi ma osobne stawki.

Czy Qwen 3.8 Max kosztuje więcej powyżej 128K tokenów?

Na bieżącej karcie stawek specyficznej dla modelu nie ma oddzielnego progu dla długiego kontekstu. Długie żądania kosztują więcej, ponieważ zawierają więcej tokenów, a nie dlatego, że przekraczają wyższy próg ceny jednostkowej.

Czy tokeny rozumowania Qwen 3.8 Max są rozliczane?

Rozumowanie może zwiększyć generowane użycie i całkowity koszt. Używaj pól tokenów rozumowania i wyjścia zwracanych przez punkt końcowy, zamiast szacować na podstawie widocznej odpowiedzi.

Czy Qwen 3.8 Max jest open source?

Qwen zapowiedział, że po wydaniu API pojawią się otwarte wagi. Nie opisuj modelu jako możliwego do pobrania lub samodzielnego hostowania, dopóki nie będą dostępne oficjalny checkpoint i licencja.

Czy użytkownicy Qwen 3.7 Max powinni migrować od razu?

Niekoniecznie. Qwen 3.8 Max ma niższą standardową cenę katalogową, podczas gdy Qwen 3.7 Max jest tańszy w trakcie obecnej promocji. Migruj, gdy Twoje własne dane o jakości, opóźnieniach, zachowaniu bufora i koszcie na zaakceptowane zadanie uzasadniają zmianę.

Przetestuj Qwen 3.8 Max z CometAPI

Użyj CometAPI Quickstart, aby skonfigurować klienta zgodnego z OpenAI. Zanim wyślesz ruch produkcyjny, potwierdź, że qwen3.8-max jest aktywny na Twoim koncie i zweryfikuj wyświetlaną tam cenę routingu.

Porównaj go z bazą Qwen 3.7, używając identycznych promptów, walidatorów, zasad ponowień i telemetrii. Dzięki temu ewaluacja koncentruje się na modelu, a nie na zmianach w harnessie testowym.

Gotowy na obniżenie kosztów rozwoju AI o 20%?

Zacznij za darmo w kilka minut. Dołączone kredyty na bezpłatny okres próbny. Karta kredytowa nie jest wymagana.

Czytaj więcej