TL;DR Qwen 3.8 Max kosztuje w QwenCloud $2 za 1 milion tokenów wejściowych oraz $6 za 1 milion tokenów wyjściowych. Stawki pamięci podręcznej specyficzne dla modelu to $0.25/M za niejawnie zbuforowane wejście, $2.50/M za utworzenie jawnej pamięci podręcznej oraz $0.17/M za odczyty z jawnej pamięci podręcznej.
Te same standardowe stawki za tokeny obowiązują w całym obsługiwanym przez model oknie kontekstu 1M tokenów. Większe prompty kosztują więcej, ponieważ zawierają więcej tokenów, a nie dlatego, że wchodzą w wyższą taryfę cenową dla długiego kontekstu.
W cenie katalogowej Qwen 3.8 Max jest o 20% tańszy niż Qwen 3.7 Max. Jednak Qwen 3.7 Max jest tańszy, dopóki obowiązuje jego bieżąca promocja -50%. Lepszy wybór produkcyjny zależy od kosztu na zaakceptowane zadanie, uwzględniającego rozumowanie, trafienia pamięci podręcznej, narzędzia, ponowienia, latencję i weryfikację przez człowieka.
Cennik API Qwen 3.8 Max w skrócie
| Pozycja | Aktualna wartość oficjalna |
|---|---|
| Identyfikator modelu prod. | qwen3.8-max |
| Oficjalna data wydania | August 3, 2026 |
| Architektura | 2.4T łącznych parametrów; 95B aktywnych |
| Standardowa cena wejścia | $2 / 1M tokens |
| Standardowa cena wyjścia | $6 / 1M tokens |
| Niejawnie zbuf. wejście | $0.25 / 1M tokens |
| Utworzenie jawnej cache | $2.50 / 1M tokens |
| Odczyt z jawnej cache | $0.17 / 1M tokens |
| Okno kontekstu | 1M tokens |
| Maksymalne wejście | 991K bez rozumowania; 983K z rozumowaniem |
| Maksymalne wyjście | 131K |
| Maks. liczba tokenów roz. | 262K |
| Modalności wejściowe | Text, image, and video |
| Modalność wyjściowa | Text |
| Limity referencyjne | 2M TPM and 15K RPM |
Strona modelu QwenCloud to najbardziej bezpośrednie źródło aktualnego identyfikatora modelu, cen, stawek cache, limitów kontekstu i modalności. Limity konta i regionu mogą się różnić, więc przy ustawianiu produkcyjnej współbieżności korzystaj z limitów widocznych w swojej konsoli.
Wydanie produkcyjne zastępuje także identyfikator preview nazwą qwen3.8-max i dodaje kompletną kartę stawek specyficznych dla modelu. Materiały premierowe Qwen opisują ustawienia wysiłku rozumowania low, medium i xhigh, ale zachowanie produkcyjne należy weryfikować względem endpointu i dokumentacji API, z których faktycznie korzystasz.
Uwaga zależna od czasu: Qwen zapowiedział, że otwarte wagi pojawią się po udostępnieniu API. Na dzień August 4, 2026 nie opisuj Qwen 3.8 Max jako modelu do pobrania lub hostowania we własnym zakresie, dopóki nie zostaną opublikowane oficjalny checkpoint i licencja.
Jak działa cennik Qwen 3.8 Max
QwenCloud obecnie podaje płaską stawkę standardową $2 za 1M tokenów wejściowych i $6 za 1M tokenów wyjściowych w całym obsługiwanym przez Qwen 3.8 Max oknie kontekstu 1M tokenów. Poniższy zrzut cennika został wykonany August 4, 2026; przed decyzjami budżetowymi zawsze sprawdzaj aktualną stronę modelu.

Źródło***:*** QwenCloud, “Qwen3.8-Max” official
| Pozycja rozliczeniowa | Cena za 1M tokenów | Kiedy ma zastosowanie |
|---|---|---|
| Wejście standardowe | $2.00 | Nowa treść promptu, definicje narzędzi i niebuforowany kontekst |
| Wyjście standardowe | $6.00 | Wygenerowane wyjście i rozliczone użycie rozumowania |
| Trafienie cache niejawnej | $0.25 | Automatycznie ponownie używane prefiksy promptu; trafienia nie są gwarantowane |
| Utworzenie cache jawnej | $2.50 | Utworzenie oznaczonego, wielokrotnego użytku prefiksu promptu |
| Odczyt cache jawnej | $0.17 | Ponowne użycie ważnego jawnego bloku pamięci podręcznej |
Żądanie 900K tokenów kosztuje zatem więcej niż żądanie 100K tokenów, ponieważ przetwarza dziewięć razy więcej tokenów wejściowych — nie dlatego, że przekracza wyższą taryfę długiego kontekstu.
Rozumowanie może zwiększyć koszt wyjścia
Krótka widoczna odpowiedź nie zawsze oznacza niski koszt. Wywołania z rozumowaniem mogą generować dodatkowe tokeny rozumowania, więc w produkcji należy opierać się na polach usage zwracanych przez API, a nie na długości widocznej odpowiedzi.
Jeśli Twój endpoint obsługuje sterowanie rozumowaniem dla qwen3.8-max, porównaj dostępne ustawienia na tym samym zbiorze ewaluacyjnym. Nie zakładaj, że domyślne ustawienia z wersji preview przechodzą do modelu GA.
Oszczędności z pamięci podręcznej zależą od stabilności promptu
Strona modelu Qwen 3.8 Max publikuje stawki cache specyficzne dla modelu. Przy szacowaniu wydatków używaj tych stawek — nie ogólnych proporcji cache.
Wpisy cache jawnej mają ważność pięciu minut, a udane trafienie resetuje ten okres. Buforowanie niejawne jest automatyczne, ale trafienie nie jest gwarantowane. Cache jest najbardziej użyteczna, gdy prompty systemowe, definicje narzędzi, kontekst repozytorium lub duże dokumenty pozostają stabilne w wielu wywołaniach.
Wbudowane narzędzia generują oddzielne opłaty
QwenCloud obecnie podaje następujące opłaty za wbudowane narzędzia, dodatkowo względem zużycia tokenów:
| Wbudowane narzędzie | Aktualna opłata |
|---|---|
| Web Search | $10 / 1K calls |
| Image Search | $8 / 1K calls |
| Web Extractor | Free for a limited time |
| Code Interpreter | Free for a limited time |
Wywoływanie funkcji i MCP nie mają oddzielnych opłat narzędziowych, ale opisy narzędzi nadal liczą się jako tokeny wejściowe. Promocje bezpłatnych narzędzi mogą się zmieniać, więc przed finalizacją budżetu produkcyjnego sprawdź QwenCloud pricing guide.
Na przykład, żądanie z 20K tokenów wejściowych, 2K tokenów wyjściowych i dwoma wywołaniami Web Search kosztuje w przybliżeniu:
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
W tym przykładzie dwa wywołania wyszukiwania stanowią około 27.8% całkowitego kosztu żądania.
Rzeczywiste przykłady kosztów Qwen 3.8 Max
Te przykłady wykorzystują bieżące stawki specyficzne dla modelu QwenCloud. Nie obejmują podatków, ponowień, fallbacków ani narzutów dostawcy.
Przykład 1: Średnie żądanie agenta
Assume 50K input tokens and 5K output tokens:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
Udana pierwsza próba kosztuje około $0.13. Jedno pełne ponowienie podniosłoby koszt modelu do około $0.26.
Przykład 2: Analiza długiego dokumentu
Assume 800K input tokens and 20K output tokens:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
Model nie stosuje osobnej dopłaty za długi kontekst w swoim bieżącym cenniku, ale duże prompty generują znaczący koszt bezwzględny.
Przykład 3: Buforowana sesja agenta
Załóżmy wielokrotnego użytku prefiks 100K tokenów, 10K nowych tokenów wejściowych, 5K tokenów wyjściowych i 50 wywołań, podczas gdy cache jawna pozostaje ważna:
First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M = $0.017
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
Szacunkowa oszczędność = $8.917, czyli 71.3%
Szacowana oszczędność zależy od udanych trafień cache i stabilnego prefiksu. Długie przerwy lub częste zmiany promptów systemowych i schematów narzędzi zmniejszą korzyści.
Qwen 3.8 Max vs Qwen 3.7 Max:Porównanie cen
Qwen 3.8 Max jest o 20% tańszy od Qwen 3.7 Max w cenie katalogowej, ale Qwen 3.7 Max jest o 37.5% tańszy, gdy obowiązuje jego bieżąca promocja -50%.
| Model i status cenowy | Wejście / 1M | Wyjście / 1M | Kontekst |
|---|---|---|---|
| qwen3.8-max cena standardowa | $2.00 | $6.00 | 1M |
| qwen3.7-max cena katalogowa | $2.50 | $7.50 | 1M |
| qwen3.7-max aktualna promocja | $1.25 | $3.75 | 1M |
Trzymaj pod ręką stronę modelu CometAPI Qwen3.7 Max jako fallback podczas testowania nowego modelu.
Cena za token to tylko część decyzji. Qwen 3.8 Max może być bardziej ekonomiczny, jeśli poprawia skuteczność pierwszej próby, pewniej korzysta z narzędzi, zmniejsza liczbę ponowień lub wymaga mniej poprawek ludzkich.
Użyj tej metryki produkcyjnej:
Koszt na zaakceptowane zadanie =
(tokeny modelu + wywołania narzędzi + ponowienia + koszt fallbacku + koszt weryfikacji)
÷ zaakceptowane wyjścia
Zgłaszane przez dostawcę poprawy w benchmarkach to powód, by ponownie przetestować wymagające zadania kodowania i pracy profesjonalnej, a nie dowód, że każdy workload Qwen 3.7 powinien migrować.
Jak migrować do Qwen 3.8 Max
Zmiana nazwy modelu jest konieczna, ale to nie jest kompletna migracja produkcyjna.
1. Przetestuj identyfikator modelu produkcyjnego
Zastąp identyfikator preview ciągiem qwen3.8-max w środowisku testowym. Nie zakładaj, że aliasy preview, domyślne ustawienia, latencja lub zachowanie odpowiedzi pozostaną niezmienione.
Minimalne żądanie zgodne z OpenAI może wyglądać tak:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
Zacznij od minimalnego, udokumentowanego żądania. Dodawaj sterowanie rozumowaniem tylko wtedy, gdy bieżąca dokumentacja API dla Twojego endpointu wyraźnie je obsługuje.
2. Ustal nową bazę pomiarową kosztów i wydajności
Rejestruj co najmniej:
- tokeny wejściowe, wyjściowe i rozumowania
- trafienia cache i tokeny tworzenia cache
- czas do pierwszego tokena i łączną latencję
- wywołania narzędzi, ponowienia i fallbacki
- wyjścia zaakceptowane versus odrzucone
- czas poprawek przez człowieka
3. Przetestuj ponownie interfejs używany przez Twoją aplikację
Zwaliduj zdarzenia streamingu, ładunki multimodalne, schematy narzędzi, strukturalne wyjście, powody zakończenia, pola usage, obsługę błędów i zachowanie w wielu turach. Strona modelu produkcyjnego dokumentuje dostęp przez DashScope i zgodny z OpenAI; zweryfikuj każdą dodatkową warstwę zgodności, zanim na niej polegniesz.
4. Przestrzegaj praktycznych ograniczeń kontekstu
Okno kontekstu 1M to nie to samo, co prompt użytkownika o długości 1M tokenów. QwenCloud podaje maksymalne wejście 991K bez rozumowania i 983K z rozumowaniem. Dodaj margines bezpieczeństwa, aby w żądaniu pozostało miejsce na wyjście i rozumowanie.
5. Uruchom Qwen 3.7 i Qwen 3.8 równolegle
Użyj identycznych promptów, narzędzi, walidatorów, zasad ponowień i zbiorów danych. Porównuj koszt na zaakceptowane zadanie i latencję, zamiast oceniać pojedyncze odpowiedzi „na oko”.
Jak oceniać i kierować Qwen 3.8 Max
Używaj rzeczywistych obciążeń zamiast szerokich średnich z benchmarków.
| Obciążenie/Przypadek użycia | Sugerowane zadania | Główny sygnał akceptacji |
|---|---|---|
| Kodowanie w repozytorium | 4 | Testy przechodzą bez ręcznej poprawy |
| Analiza długich dokumentów | 3 | Tezy są poparte dostarczonymi dowodami |
| Analiza multimodalna | 2 | Istotne szczegóły obrazu lub wideo użyte poprawnie |
| Agenci korzystający z narzędzi | 3 | Poprawny wybór narzędzia i prawidłowe argumenty |
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback
Używaj Qwen 3.8 Max do trudnej pracy w repozytoriach, agentów o długim horyzoncie, analizy multimodalnej i workflowów, w których Qwen 3.7 nie przechodzi kryteriów akceptacji. Zostaw Qwen 3.7 Max, gdy promocja znacząco obniża koszt, a dotychczasowy model już spełnia Twoje cele jakościowe.
Sprawdź CometAPI pricing page i bieżące informacje routingu przed zablokowaniem progów, ponieważ dostępność dostawcy i ceny routingu mogą zmieniać się niezależnie od cen bezpośrednich QwenCloud. CometAPI Cookbook może pomóc zbudować powtarzalne żądania i spójny harness ewaluacyjny.
FAQ
Ile kosztuje API Qwen 3.8 Max?
QwenCloud obecnie wycenia Qwen 3.8 Max na $2 za 1 milion tokenów wejściowych i $6 za 1 milion tokenów wyjściowych. Użycie pamięci podręcznej i wbudowanych narzędzi ma oddzielne stawki.
Czy Qwen 3.8 Max kosztuje więcej powyżej 128K tokenów?
Na bieżącej karcie stawek specyficznych dla modelu nie ma osobnej taryfy dla długiego kontekstu. Długie żądania kosztują więcej, ponieważ zawierają więcej tokenów, a nie dlatego, że przekraczają wyższy próg ceny jednostkowej.
Czy tokeny rozumowania Qwen 3.8 Max są rozliczane?
Rozumowanie może zwiększyć wygenerowane zużycie i całkowity koszt. Korzystaj z pól tokenów rozumowania i wyjścia zwracanych przez endpoint, zamiast szacować na podstawie widocznej odpowiedzi.
Czy Qwen 3.8 Max jest open source?
Qwen zapowiedział, że otwarte wagi pojawią się po wydaniu API. Nie opisuj modelu jako możliwego do pobrania lub hostowania we własnym zakresie, dopóki nie zostaną opublikowane oficjalny checkpoint i licencja.
Czy użytkownicy Qwen 3.7 Max powinni migrować od razu?
Nie automatycznie. Qwen 3.8 Max ma niższą standardową cenę katalogową, podczas gdy Qwen 3.7 Max jest tańszy w trakcie obecnej promocji. Migruj, gdy Twoje własne dane o jakości, latencji, zachowaniu cache i koszcie na zaakceptowane zadanie to uzasadniają.
Przetestuj Qwen 3.8 Max z CometAPI
Użyj CometAPI Quickstart, aby skonfigurować klienta zgodnego z OpenAI. Przed wysyłką ruchu produkcyjnego upewnij się, że qwen3.8-max jest aktywny na Twoim koncie i zweryfikuj cenę routingu wyświetlaną tam.
Porównaj go z bazą Qwen 3.7 przy użyciu identycznych promptów, walidatorów, zasad ponowień i telemetrii. Dzięki temu ewaluacja skupia się na modelu, a nie na zmianach w harnessie testowym.
