Cennik API Qwen 3.8 Max: $2 za wejście, $6 za wyjście, kontekst 1M
TL;DR
Qwen 3.8 Max kosztuje na QwenCloud $2 za 1 milion tokenów wejściowych oraz $6 za 1 milion tokenów wyjściowych. Stawki pamięci podręcznej specyficzne dla modelu wynoszą $0.25/M za niejawnie zbuforowane wejście, $2.50/M za jawne utworzenie bufora oraz $0.17/M za jawny odczyt bufora.
Te same standardowe stawki tokenowe obowiązują w całym obsługiwanym przez model oknie kontekstu 1M tokenów. Większe prompty kosztują więcej, ponieważ zawierają więcej tokenów, a nie dlatego, że wchodzą w wyższy próg cenowy dla długiego kontekstu.
W cenie katalogowej Qwen 3.8 Max jest tańszy o 20% niż Qwen 3.7 Max. Jednak Qwen 3.7 Max jest tańszy, dopóki obowiązuje jego bieżąca promocja -50%. Lepszy wybór produkcyjny zależy od kosztu na zaakceptowane zadanie, uwzględniającego rozumowanie, trafienia w bufor, narzędzia, ponowienia, opóźnienia i weryfikację przez człowieka.
Cennik API Qwen 3.8 Max w skrócie
| Pozycja | Aktualna oficjalna wartość |
|---|---|
| Produkcyjny identyfikator | qwen3.8-max |
| Oficjalna data wydania | 3 sierpnia 2026 |
| Architektura | 2.4T parametrów łącznie; 95B aktywnych |
| Standardowa cena wejścia | $2 / 1M tokenów |
| Standardowa cena wyjścia | $6 / 1M tokenów |
| Niejawne zbuforowane wejście | $0.25 / 1M tokenów |
| Jawne utworzenie bufora | $2.50 / 1M tokenów |
| Jawny odczyt bufora | $0.17 / 1M tokenów |
| Okno kontekstu | 1M tokenów |
| Maksymalne wejście | 991K bez rozumowania; 983K z rozumowaniem |
| Maksymalne wyjście | 131K |
| Maksymalne rozumowanie | 262K |
| Modalności wejściowe | Tekst, obraz i wideo |
| Modalność wyjściowa | Tekst |
| Limity referencyjne QwenCloud | 2M TPM i 15K RPM |
Strona modelu QwenCloud jest najbardziej bezpośrednim źródłem aktualnego identyfikatora modelu, cen, stawek bufora, limitów kontekstu i modalności. Limity zależne od konta i regionu mogą się różnić, więc przy ustawianiu produkcyjnej współbieżności korzystaj z limitów wyświetlanych w Twojej konsoli.
Wydanie produkcyjne zastępuje również identyfikator podglądu na qwen3.8-max i dodaje kompletną kartę stawek specyficzną dla modelu. Materiały startowe Qwen opisują ustawienia wysiłku rozumowania low, medium i xhigh, ale zachowanie produkcyjne należy weryfikować względem używanego punktu końcowego i dokumentacji API.
Uwaga wrażliwa na czas: Qwen zapowiedział, że po wydaniu API pojawią się otwarte wagi. Na dzień 4 sierpnia 2026 r. nie opisuj Qwen 3.8 Max jako możliwego do pobrania ani do samodzielnego hostowania, dopóki nie zostaną opublikowane oficjalny checkpoint i licencja.
Jak działa cennik Qwen 3.8 Max
QwenCloud obecnie podaje płaską stawkę standardową $2 za 1M tokenów wejściowych i $6 za 1M tokenów wyjściowych w całym obsługiwanym oknie kontekstu 1M tokenów dla Qwen 3.8 Max. Poniższy oficjalny zrzut cen pochodzi z 4 sierpnia 2026; zawsze sprawdzaj bieżącą stronę modelu przed podjęciem produkcyjnych decyzji budżetowych.

Źródło***:*** QwenCloud, „Qwen3.8-Max” official
| Pozycja rozliczeniowa | Cena za 1M tokenów | Kiedy dotyczy |
|---|---|---|
| Standardowe wejście | $2.00 | Nowa treść promptu, definicje narzędzi i niebuforowany kontekst |
| Standardowe wyjście | $6.00 | Wygenerowane wyjście i rozliczane użycie rozumowania |
| Trafienie bufora niejawnego | $0.25 | Automatycznie ponownie użyte prefiksy promptu; trafienia nie są gwarantowane |
| Utworzenie bufora jawnego | $2.50 | Tworzenie oznaczonego wielokrotnego użytku prefiksu promptu |
| Odczyt bufora jawnego | $0.17 | Ponowne użycie ważnego bloku jawnego bufora |
Żądanie na 900K tokenów kosztuje zatem więcej niż na 100K tokenów, ponieważ przetwarza dziewięciokrotnie więcej tokenów wejściowych — nie dlatego, że przekracza wyższy próg cenowy.
Rozumowanie może zwiększyć koszt wyjścia
Krótka widoczna odpowiedź nie zawsze jest niskokosztowa. Wywołania z włączonym rozumowaniem mogą generować dodatkowe tokeny rozumowania, więc szacunki produkcyjne powinny wykorzystywać pola użycia zwracane przez API, a nie długość widocznej odpowiedzi.
Tam, gdzie Twój punkt końcowy obsługuje sterowanie rozumowaniem dla qwen3.8-max, porównaj dostępne ustawienia na tym samym zbiorze ewaluacyjnym. Nie zakładaj, że domyślne ustawienia wersji podglądowej przenoszą się na model GA.
Oszczędności z bufora zależą od stabilności promptu
Strona modelu Qwen 3.8 Max publikuje stawki bufora specyficzne dla modelu. Używaj tych stawek — nie ogólnych wskaźników bufora — przy szacowaniu wydatków.
Wpisy bufora jawnego mają pięć minut ważności, a udane trafienie resetuje ten okres. Buforowanie jest automatyczne w trybie niejawnym, ale trafienie nie jest gwarantowane. Bufor jest najkorzystniejszy, gdy prompty systemowe, definicje narzędzi, kontekst repozytorium lub duże dokumenty pozostają stabilne przy częstych wywołaniach.
Wbudowane narzędzia generują osobne opłaty
QwenCloud obecnie podaje następujące opłaty za narzędzia, oprócz użycia tokenów:
| Wbudowane narzędzie | Bieżąca opłata |
|---|---|
| Web Search | $10 / 1K wywołań |
| Image Search | $8 / 1K wywołań |
| Web Extractor | Bezpłatnie przez ograniczony czas |
| Code Interpreter | Bezpłatnie przez ograniczony czas |
Wywołania funkcji i MCP nie mają osobnych opłat narzędziowych, ale opisy narzędzi nadal liczą się jako tokeny wejściowe. Promocje na bezpłatne narzędzia mogą się zmieniać, więc przed finalizacją budżetu produkcyjnego sprawdź przewodnik cenowy QwenCloud.
Na przykład żądanie z 20K tokenów wejściowych, 2K tokenów wyjściowych i dwoma wywołaniami Web Search kosztuje w przybliżeniu:
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
W tym przykładzie dwa wywołania wyszukiwania stanowią około 27.8% całkowitego kosztu żądania.
Rzeczywiste przykłady kosztów Qwen 3.8 Max
Te przykłady używają bieżących stawek specyficznych dla modelu QwenCloud. Nie obejmują podatków, ponowień, rezerw i narzutów dostawców.
Przykład 1: Średnie żądanie agenta
Assume 50K input tokens and 5K output tokens:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
Udana pierwsza próba kosztuje około $0.13. Jedno pełne ponowienie podniesie koszt modelu do około $0.26.
Przykład 2: Analiza długiego dokumentu
Assume 800K input tokens and 20K output tokens:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
Model nie stosuje oddzielnej dopłaty za długi kontekst w swoim bieżącym cenniku, ale duże prompty i tak generują istotny koszt bezwzględny.
Przykład 3: Buforowana sesja agenta
Załóżmy wielokrotnego użytku prefiks 100K tokenów, 10K nowych tokenów wejściowych, 5K tokenów wyjściowych i 50 wywołań, podczas gdy bufor jawny pozostaje ważny:
First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M = $0.017
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
Oszacowana oszczędność = $8.917, czyli 71.3%
Oszczędność zależy od trafień w bufor i stabilnego prefiksu. Długie przerwy lub częste zmiany promptów systemowych i schematów narzędzi zmniejszą korzyść.
Qwen 3.8 Max vs Qwen 3.7 Max: porównanie cen
Qwen 3.8 Max jest o 20% tańszy niż Qwen 3.7 Max w cenie katalogowej, ale Qwen 3.7 Max jest o 37.5% tańszy, gdy obowiązuje jego bieżąca promocja -50%.
| Model i status cenowy | Wejście / 1M | Wyjście / 1M | Kontekst |
|---|---|---|---|
| qwen3.8-max cena standardowa | $2.00 | $6.00 | 1M |
| qwen3.7-max cena katalogowa | $2.50 | $7.50 | 1M |
| qwen3.7-max bieżąca promocja | $1.25 | $3.75 | 1M |
Trzymaj pod ręką stronę modelu CometAPI Qwen3.7 Max jako rezerwę podczas testowania nowego modelu.
Cena za token to tylko jedna część decyzji. Qwen 3.8 Max może nadal być bardziej ekonomiczny, jeśli zwiększa skuteczność w pierwszym podejściu, pewniej korzysta z narzędzi, ogranicza ponowienia lub wymaga mniej poprawek ręcznych.
Użyj tego wskaźnika produkcyjnego:
Koszt na zaakceptowane zadanie =
(tokeny modelu + wywołania narzędzi + ponowienia + koszt rezerwy + koszt weryfikacji)
÷ zaakceptowane wyjścia
Wyniki benchmarków od dostawcy to powód, by ponownie przetestować wymagające przepływy kodowania i pracy profesjonalnej, a nie dowód, że każdy workload Qwen 3.7 powinien migrować.
Jak migrować do Qwen 3.8 Max
Zmiana łańcucha modelu jest konieczna, ale nie stanowi kompletnej migracji produkcyjnej.
1. Przetestuj produkcyjny identyfikator modelu
Zastąp identyfikator podglądu qwen3.8-max w środowisku testowym. Nie zakładaj, że aliasy podglądowe, domyślne ustawienia, opóźnienia czy zachowanie odpowiedzi pozostaną bez zmian.
Minimalne żądanie zgodne z OpenAI może wyglądać tak:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
Zacznij od minimalnego udokumentowanego żądania. Dodaj kontrolę rozumowania tylko wtedy, gdy aktualna dokumentacja API dla Twojego punktu końcowego wprost to wspiera.
2. Ustal na nowo punkt odniesienia dla telemetrii kosztów i wydajności
Zapisz co najmniej:
- tokeny wejścia, wyjścia i rozumowania
- trafienia bufora i tokeny tworzenia bufora
- czas do pierwszego tokena i całkowite opóźnienie
- wywołania narzędzi, ponowienia i rezerwy
- wyjścia zaakceptowane vs odrzucone
- czas korekty ręcznej
3. Przetestuj interfejs używany przez Twoją aplikację
Zwaliduj zdarzenia streamingu, ładunki multimodalne, schematy narzędzi, strukturalne wyjście, powody zakończenia, pola użycia, obsługę błędów i zachowanie w wielu turach. Strona modelu produkcyjnego dokumentuje dostęp przez DashScope i zgodność z OpenAI; zweryfikuj każdą dodatkową warstwę kompatybilności, zanim na niej polegniesz.
4. Uwzględnij praktyczne ograniczenia kontekstu
Okno kontekstu 1M to nie to samo co prompt użytkownika na 1M tokenów. QwenCloud podaje maksymalne wejście 991K bez rozumowania i 983K z rozumowaniem. Dodaj margines bezpieczeństwa, aby żądanie miało miejsce na wyjście i rozumowanie.
5. Uruchom Qwen 3.7 i Qwen 3.8 równolegle
Użyj identycznych promptów, narzędzi, walidatorów, zasad ponowień i zbiorów danych. Porównuj koszt na zaakceptowane zadanie i opóźnienie, zamiast oceniać odosobnione odpowiedzi „na oko”.
Jak oceniać i kierować Qwen 3.8 Max
Używaj rzeczywistych obciążeń, a nie szerokich średnich benchmarkowych.
| Workload | Sugerowane zadania | Główny sygnał akceptacji |
|---|---|---|
| Kodowanie repozytorium | 4 | Testy przechodzą bez poprawek ręcznych |
| Analiza długich tekstów | 3 | Tezy są poparte dostarczonymi dowodami |
| Analiza multimodalna | 2 | Właściwe użycie istotnych szczegółów obrazu lub wideo |
| Agenci korzystający z narzędzi | 3 | Prawidłowy wybór narzędzia i poprawne argumenty |
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback
Używaj Qwen 3.8 Max do trudnych prac w repozytoriach, agentów długohoryzontowych, analizy multimodalnej i tam, gdzie Qwen 3.7 nie przechodzi testów akceptacyjnych. Pozostań przy Qwen 3.7 Max, gdy promocja istotnie obniża koszt, a dotychczasowy model spełnia Twoje cele jakościowe.
Sprawdź stronę cenową CometAPI i bieżące informacje o routingu przed „zamrożeniem” progów, ponieważ dostępność dostawców i ceny routingu mogą zmieniać się niezależnie od bezpośredniej ceny katalogowej QwenCloud. CometAPI Cookbook pomoże Ci zbudować powtarzalne żądania i spójny harness ewaluacyjny.
FAQ
Ile kosztuje API Qwen 3.8 Max?
QwenCloud obecnie wycenia Qwen 3.8 Max na $2 za 1 milion tokenów wejściowych oraz $6 za 1 milion tokenów wyjściowych. Użycie bufora i wbudowanych narzędzi ma osobne stawki.
Czy Qwen 3.8 Max kosztuje więcej powyżej 128K tokenów?
Na bieżącej karcie stawek specyficznej dla modelu nie ma oddzielnego progu dla długiego kontekstu. Długie żądania kosztują więcej, ponieważ zawierają więcej tokenów, a nie dlatego, że przekraczają wyższy próg ceny jednostkowej.
Czy tokeny rozumowania Qwen 3.8 Max są rozliczane?
Rozumowanie może zwiększyć generowane użycie i całkowity koszt. Używaj pól tokenów rozumowania i wyjścia zwracanych przez punkt końcowy, zamiast szacować na podstawie widocznej odpowiedzi.
Czy Qwen 3.8 Max jest open source?
Qwen zapowiedział, że po wydaniu API pojawią się otwarte wagi. Nie opisuj modelu jako możliwego do pobrania lub samodzielnego hostowania, dopóki nie będą dostępne oficjalny checkpoint i licencja.
Czy użytkownicy Qwen 3.7 Max powinni migrować od razu?
Niekoniecznie. Qwen 3.8 Max ma niższą standardową cenę katalogową, podczas gdy Qwen 3.7 Max jest tańszy w trakcie obecnej promocji. Migruj, gdy Twoje własne dane o jakości, opóźnieniach, zachowaniu bufora i koszcie na zaakceptowane zadanie uzasadniają zmianę.
Przetestuj Qwen 3.8 Max z CometAPI
Użyj CometAPI Quickstart, aby skonfigurować klienta zgodnego z OpenAI. Zanim wyślesz ruch produkcyjny, potwierdź, że qwen3.8-max jest aktywny na Twoim koncie i zweryfikuj wyświetlaną tam cenę routingu.
Porównaj go z bazą Qwen 3.7, używając identycznych promptów, walidatorów, zasad ponowień i telemetrii. Dzięki temu ewaluacja koncentruje się na modelu, a nie na zmianach w harnessie testowym.
