GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
new/Badania CometAPI

Qwen 3.8 Max API Cennik: $2 Wejście, $6 Wyjście, 1M Kontekst

Qwen 3.8 Max kosztuje $2/M za wejście i $6/M za wyjście. Porównaj opłaty za pamięć podręczną, koszty narzędzi, rzeczywiste przykłady, limity oraz zalecenia dotyczące migracji z Qwen 3.7.

CometAPI
Mia MarenZespół badań AI modeli i API
Zaktualizowano Sep 3, 2026 10 min czyt.
Qwen 3.8 Max API Cennik: $2 Wejście, $6 Wyjście, 1M Kontekst
Użyj tego wzorca

Wykonaj pierwsze wywołanie API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Qwen 3.8 Max kosztuje w QwenCloud $2 za 1 milion tokenów wejściowych oraz $6 za 1 milion tokenów wyjściowych. Stawki pamięci podręcznej specyficzne dla modelu to $0.25/M za niejawnie zbuforowane wejście, $2.50/M za utworzenie jawnej pamięci podręcznej oraz $0.17/M za odczyty z jawnej pamięci podręcznej.

Te same standardowe stawki za tokeny obowiązują w całym obsługiwanym przez model oknie kontekstu 1M tokenów. Większe prompty kosztują więcej, ponieważ zawierają więcej tokenów, a nie dlatego, że wchodzą w wyższą taryfę cenową dla długiego kontekstu.

W cenie katalogowej Qwen 3.8 Max jest o 20% tańszy niż Qwen 3.7 Max. Jednak Qwen 3.7 Max jest tańszy, dopóki obowiązuje jego bieżąca promocja -50%. Lepszy wybór produkcyjny zależy od kosztu na zaakceptowane zadanie, uwzględniającego rozumowanie, trafienia pamięci podręcznej, narzędzia, ponowienia, latencję i weryfikację przez człowieka.

Cennik API Qwen 3.8 Max w skrócie

PozycjaAktualna wartość oficjalna
Identyfikator modelu prod.qwen3.8-max
Oficjalna data wydaniaAugust 3, 2026
Architektura2.4T łącznych parametrów; 95B aktywnych
Standardowa cena wejścia$2 / 1M tokens
Standardowa cena wyjścia$6 / 1M tokens
Niejawnie zbuf. wejście$0.25 / 1M tokens
Utworzenie jawnej cache$2.50 / 1M tokens
Odczyt z jawnej cache$0.17 / 1M tokens
Okno kontekstu1M tokens
Maksymalne wejście991K bez rozumowania; 983K z rozumowaniem
Maksymalne wyjście131K
Maks. liczba tokenów roz.262K
Modalności wejścioweText, image, and video
Modalność wyjściowaText
Limity referencyjne2M TPM and 15K RPM

Strona modelu QwenCloud to najbardziej bezpośrednie źródło aktualnego identyfikatora modelu, cen, stawek cache, limitów kontekstu i modalności. Limity konta i regionu mogą się różnić, więc przy ustawianiu produkcyjnej współbieżności korzystaj z limitów widocznych w swojej konsoli.

Wydanie produkcyjne zastępuje także identyfikator preview nazwą qwen3.8-max i dodaje kompletną kartę stawek specyficznych dla modelu. Materiały premierowe Qwen opisują ustawienia wysiłku rozumowania low, medium i xhigh, ale zachowanie produkcyjne należy weryfikować względem endpointu i dokumentacji API, z których faktycznie korzystasz.

Uwaga zależna od czasu: Qwen zapowiedział, że otwarte wagi pojawią się po udostępnieniu API. Na dzień August 4, 2026 nie opisuj Qwen 3.8 Max jako modelu do pobrania lub hostowania we własnym zakresie, dopóki nie zostaną opublikowane oficjalny checkpoint i licencja.

Jak działa cennik Qwen 3.8 Max

QwenCloud obecnie podaje płaską stawkę standardową $2 za 1M tokenów wejściowych i $6 za 1M tokenów wyjściowych w całym obsługiwanym przez Qwen 3.8 Max oknie kontekstu 1M tokenów. Poniższy zrzut cennika został wykonany August 4, 2026; przed decyzjami budżetowymi zawsze sprawdzaj aktualną stronę modelu.

Qwen 3.8 Max API Cennik: $2 Wejście, $6 Wyjście, 1M Kontekst

Źródło***:*** QwenCloud, “Qwen3.8-Max” official

Pozycja rozliczeniowaCena za 1M tokenówKiedy ma zastosowanie
Wejście standardowe$2.00Nowa treść promptu, definicje narzędzi i niebuforowany kontekst
Wyjście standardowe$6.00Wygenerowane wyjście i rozliczone użycie rozumowania
Trafienie cache niejawnej$0.25Automatycznie ponownie używane prefiksy promptu; trafienia nie są gwarantowane
Utworzenie cache jawnej$2.50Utworzenie oznaczonego, wielokrotnego użytku prefiksu promptu
Odczyt cache jawnej$0.17Ponowne użycie ważnego jawnego bloku pamięci podręcznej

Żądanie 900K tokenów kosztuje zatem więcej niż żądanie 100K tokenów, ponieważ przetwarza dziewięć razy więcej tokenów wejściowych — nie dlatego, że przekracza wyższą taryfę długiego kontekstu.

Rozumowanie może zwiększyć koszt wyjścia

Krótka widoczna odpowiedź nie zawsze oznacza niski koszt. Wywołania z rozumowaniem mogą generować dodatkowe tokeny rozumowania, więc w produkcji należy opierać się na polach usage zwracanych przez API, a nie na długości widocznej odpowiedzi.

Jeśli Twój endpoint obsługuje sterowanie rozumowaniem dla qwen3.8-max, porównaj dostępne ustawienia na tym samym zbiorze ewaluacyjnym. Nie zakładaj, że domyślne ustawienia z wersji preview przechodzą do modelu GA.

Oszczędności z pamięci podręcznej zależą od stabilności promptu

Strona modelu Qwen 3.8 Max publikuje stawki cache specyficzne dla modelu. Przy szacowaniu wydatków używaj tych stawek — nie ogólnych proporcji cache.

Wpisy cache jawnej mają ważność pięciu minut, a udane trafienie resetuje ten okres. Buforowanie niejawne jest automatyczne, ale trafienie nie jest gwarantowane. Cache jest najbardziej użyteczna, gdy prompty systemowe, definicje narzędzi, kontekst repozytorium lub duże dokumenty pozostają stabilne w wielu wywołaniach.

Wbudowane narzędzia generują oddzielne opłaty

QwenCloud obecnie podaje następujące opłaty za wbudowane narzędzia, dodatkowo względem zużycia tokenów:

Wbudowane narzędzieAktualna opłata
Web Search$10 / 1K calls
Image Search$8 / 1K calls
Web ExtractorFree for a limited time
Code InterpreterFree for a limited time

Wywoływanie funkcji i MCP nie mają oddzielnych opłat narzędziowych, ale opisy narzędzi nadal liczą się jako tokeny wejściowe. Promocje bezpłatnych narzędzi mogą się zmieniać, więc przed finalizacją budżetu produkcyjnego sprawdź QwenCloud pricing guide.

Na przykład, żądanie z 20K tokenów wejściowych, 2K tokenów wyjściowych i dwoma wywołaniami Web Search kosztuje w przybliżeniu:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

W tym przykładzie dwa wywołania wyszukiwania stanowią około 27.8% całkowitego kosztu żądania.

Rzeczywiste przykłady kosztów Qwen 3.8 Max

Te przykłady wykorzystują bieżące stawki specyficzne dla modelu QwenCloud. Nie obejmują podatków, ponowień, fallbacków ani narzutów dostawcy.

Przykład 1: Średnie żądanie agenta

Assume 50K input tokens and 5K output tokens:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

Udana pierwsza próba kosztuje około $0.13. Jedno pełne ponowienie podniosłoby koszt modelu do około $0.26.

Przykład 2: Analiza długiego dokumentu

Assume 800K input tokens and 20K output tokens:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

Model nie stosuje osobnej dopłaty za długi kontekst w swoim bieżącym cenniku, ale duże prompty generują znaczący koszt bezwzględny.

Przykład 3: Buforowana sesja agenta

Załóżmy wielokrotnego użytku prefiks 100K tokenów, 10K nowych tokenów wejściowych, 5K tokenów wyjściowych i 50 wywołań, podczas gdy cache jawna pozostaje ważna:

First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M     = $0.017
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

Szacunkowa oszczędność = $8.917, czyli 71.3%

Szacowana oszczędność zależy od udanych trafień cache i stabilnego prefiksu. Długie przerwy lub częste zmiany promptów systemowych i schematów narzędzi zmniejszą korzyści.

Qwen 3.8 Max vs Qwen 3.7 Max:Porównanie cen

Qwen 3.8 Max jest o 20% tańszy od Qwen 3.7 Max w cenie katalogowej, ale Qwen 3.7 Max jest o 37.5% tańszy, gdy obowiązuje jego bieżąca promocja -50%.

Model i status cenowyWejście / 1MWyjście / 1MKontekst
qwen3.8-max cena standardowa$2.00$6.001M
qwen3.7-max cena katalogowa$2.50$7.501M
qwen3.7-max aktualna promocja$1.25$3.751M

Trzymaj pod ręką stronę modelu CometAPI Qwen3.7 Max jako fallback podczas testowania nowego modelu.

Cena za token to tylko część decyzji. Qwen 3.8 Max może być bardziej ekonomiczny, jeśli poprawia skuteczność pierwszej próby, pewniej korzysta z narzędzi, zmniejsza liczbę ponowień lub wymaga mniej poprawek ludzkich.

Użyj tej metryki produkcyjnej:

Koszt na zaakceptowane zadanie =

(tokeny modelu + wywołania narzędzi + ponowienia + koszt fallbacku + koszt weryfikacji)

÷ zaakceptowane wyjścia

Zgłaszane przez dostawcę poprawy w benchmarkach to powód, by ponownie przetestować wymagające zadania kodowania i pracy profesjonalnej, a nie dowód, że każdy workload Qwen 3.7 powinien migrować.

Jak migrować do Qwen 3.8 Max

Zmiana nazwy modelu jest konieczna, ale to nie jest kompletna migracja produkcyjna.

1. Przetestuj identyfikator modelu produkcyjnego

Zastąp identyfikator preview ciągiem qwen3.8-max w środowisku testowym. Nie zakładaj, że aliasy preview, domyślne ustawienia, latencja lub zachowanie odpowiedzi pozostaną niezmienione.

Minimalne żądanie zgodne z OpenAI może wyglądać tak:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

Zacznij od minimalnego, udokumentowanego żądania. Dodawaj sterowanie rozumowaniem tylko wtedy, gdy bieżąca dokumentacja API dla Twojego endpointu wyraźnie je obsługuje.

2. Ustal nową bazę pomiarową kosztów i wydajności

Rejestruj co najmniej:

  • tokeny wejściowe, wyjściowe i rozumowania
  • trafienia cache i tokeny tworzenia cache
  • czas do pierwszego tokena i łączną latencję
  • wywołania narzędzi, ponowienia i fallbacki
  • wyjścia zaakceptowane versus odrzucone
  • czas poprawek przez człowieka

3. Przetestuj ponownie interfejs używany przez Twoją aplikację

Zwaliduj zdarzenia streamingu, ładunki multimodalne, schematy narzędzi, strukturalne wyjście, powody zakończenia, pola usage, obsługę błędów i zachowanie w wielu turach. Strona modelu produkcyjnego dokumentuje dostęp przez DashScope i zgodny z OpenAI; zweryfikuj każdą dodatkową warstwę zgodności, zanim na niej polegniesz.

4. Przestrzegaj praktycznych ograniczeń kontekstu

Okno kontekstu 1M to nie to samo, co prompt użytkownika o długości 1M tokenów. QwenCloud podaje maksymalne wejście 991K bez rozumowania i 983K z rozumowaniem. Dodaj margines bezpieczeństwa, aby w żądaniu pozostało miejsce na wyjście i rozumowanie.

5. Uruchom Qwen 3.7 i Qwen 3.8 równolegle

Użyj identycznych promptów, narzędzi, walidatorów, zasad ponowień i zbiorów danych. Porównuj koszt na zaakceptowane zadanie i latencję, zamiast oceniać pojedyncze odpowiedzi „na oko”.

Jak oceniać i kierować Qwen 3.8 Max

Używaj rzeczywistych obciążeń zamiast szerokich średnich z benchmarków.

Obciążenie/Przypadek użyciaSugerowane zadaniaGłówny sygnał akceptacji
Kodowanie w repozytorium4Testy przechodzą bez ręcznej poprawy
Analiza długich dokumentów3Tezy są poparte dostarczonymi dowodami
Analiza multimodalna2Istotne szczegóły obrazu lub wideo użyte poprawnie
Agenci korzystający z narzędzi3Poprawny wybór narzędzia i prawidłowe argumenty
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

Używaj Qwen 3.8 Max do trudnej pracy w repozytoriach, agentów o długim horyzoncie, analizy multimodalnej i workflowów, w których Qwen 3.7 nie przechodzi kryteriów akceptacji. Zostaw Qwen 3.7 Max, gdy promocja znacząco obniża koszt, a dotychczasowy model już spełnia Twoje cele jakościowe.

Sprawdź CometAPI pricing page i bieżące informacje routingu przed zablokowaniem progów, ponieważ dostępność dostawcy i ceny routingu mogą zmieniać się niezależnie od cen bezpośrednich QwenCloud. CometAPI Cookbook może pomóc zbudować powtarzalne żądania i spójny harness ewaluacyjny.

FAQ

Ile kosztuje API Qwen 3.8 Max?

QwenCloud obecnie wycenia Qwen 3.8 Max na $2 za 1 milion tokenów wejściowych i $6 za 1 milion tokenów wyjściowych. Użycie pamięci podręcznej i wbudowanych narzędzi ma oddzielne stawki.

Czy Qwen 3.8 Max kosztuje więcej powyżej 128K tokenów?

Na bieżącej karcie stawek specyficznych dla modelu nie ma osobnej taryfy dla długiego kontekstu. Długie żądania kosztują więcej, ponieważ zawierają więcej tokenów, a nie dlatego, że przekraczają wyższy próg ceny jednostkowej.

Czy tokeny rozumowania Qwen 3.8 Max są rozliczane?

Rozumowanie może zwiększyć wygenerowane zużycie i całkowity koszt. Korzystaj z pól tokenów rozumowania i wyjścia zwracanych przez endpoint, zamiast szacować na podstawie widocznej odpowiedzi.

Czy Qwen 3.8 Max jest open source?

Qwen zapowiedział, że otwarte wagi pojawią się po wydaniu API. Nie opisuj modelu jako możliwego do pobrania lub hostowania we własnym zakresie, dopóki nie zostaną opublikowane oficjalny checkpoint i licencja.

Czy użytkownicy Qwen 3.7 Max powinni migrować od razu?

Nie automatycznie. Qwen 3.8 Max ma niższą standardową cenę katalogową, podczas gdy Qwen 3.7 Max jest tańszy w trakcie obecnej promocji. Migruj, gdy Twoje własne dane o jakości, latencji, zachowaniu cache i koszcie na zaakceptowane zadanie to uzasadniają.

Przetestuj Qwen 3.8 Max z CometAPI

Użyj CometAPI Quickstart, aby skonfigurować klienta zgodnego z OpenAI. Przed wysyłką ruchu produkcyjnego upewnij się, że qwen3.8-max jest aktywny na Twoim koncie i zweryfikuj cenę routingu wyświetlaną tam.

Porównaj go z bazą Qwen 3.7 przy użyciu identycznych promptów, walidatorów, zasad ponowień i telemetrii. Dzięki temu ewaluacja skupia się na modelu, a nie na zmianach w harnessie testowym.

Kontynuuj naukę

Połącz ten artykuł z następną decyzją.

Zobacz wszystkie tematy
Opublikowano Aug 4, 2026
Ostatnia aktualizacja Sep 3, 2026
199 wyświetleń
Sprawdzone pod kątem przejrzystości, atrybucji źródeł i aktualnej terminologii API.

Gotowy na obniżenie kosztów rozwoju AI o 20%?

Zacznij za darmo w kilka minut. Dołączone kredyty na bezpłatny okres próbny. Karta kredytowa nie jest wymagana.

Czytaj więcej