GPT-5.6 Luna price down 80%, Terra down 20% →

Blog qwen 3.8 Max

Qwen 3.8 Max Cennik API: $2 wejście, $6 wyjście, kontekst 1M
Aug 4, 2026
qwen 3.8 Max

Qwen 3.8 Max Cennik API: $2 wejście, $6 wyjście, kontekst 1M

Poniżej zwięzłe porównanie i wskazówki, przy założeniu stawek Qwen 3.8 Max: $2/1M tokenów wejściowych i $6/1M tokenów wyjściowych. - Opłaty bazowe - Wejście: $2 za 1 000 000 tokenów (≈ $0,002 za 1k). - Wyjście: $6 za 1 000 000 tokenów (≈ $0,006 za 1k). - Rozliczanie dotyczy wszystkich tokenów wchodzących do modelu i wychodzących z modelu, w tym kontynuacji po wywołaniach narzędzi. - Cache (prompt caching) – porównanie i praktyka - Model nie definiuje własnego cennika cache; decyduje platforma (np. DashScope, Bedrock, OpenRouter itd.). - Najczęstsze modele rozliczeń cache: - Rozliczanie zapisu cache po stawce wejściowej; trafienia (cache hits) są darmowe lub z istotną zniżką. - Alternatywnie: brak osobnej opłaty za cache, a platforma jedynie skraca opóźnienie (płacisz standardowo za tokeny). - Na co zwrócić uwagę przy porównaniu 3.7 vs 3.8: - Czy zmieniły się: stawka za zapis, zniżka za odczyt, TTL, maks. rozmiar wpisu, kluczowanie (case sensitivity, system prompt w kluczu). - Czy zmiana modelu unieważnia istniejące wpisy cache. - Narzędzia (tool calling / function calling) – koszty - Z reguły brak „dopłaty modelowej” za samo użycie narzędzi; płacisz za tokeny: - Wyjście modelu z poleceniem tool_call (tokeny wyjściowe). - Odpowiedź narzędzia wprowadzana jako kontekst do modelu (tokeny wejściowe). - Odpowiedź końcowa modelu (tokeny wyjściowe). - Dodatkowe koszty mogą wynikać z usług zewnętrznych (np. wyszukiwarka, wektorowy RAG, API stron trzecich) – rozliczane poza modelem. - W praktyce łączny koszt rośnie wraz z liczbą rund tool-call, nawet przy krótkiej wypowiedzi końcowej. - Przykłady kosztów (bez cache; obliczenia tylko z podanych stawek) - 3k tokenów wejścia + 1k tokenów wyjścia: - Wejście: 3k × $0,002 = $0,006; Wyjście: 1k × $0,006 = $0,006; Razem ≈ $0,012. - 10k wejścia + 5k wyjścia: - Wejście: $0,020; Wyjście: $0,030; Razem ≈ $0,050. - 100k wejścia + 20k wyjścia: - Wejście: $0,200; Wyjście: $0,120; Razem ≈ $0,320. - Jedna runda tool-call (przykład szacunkowy): - Model generuje 300 tokenów zlecenia narzędzia (wyjście): 0,3k × $0,006 = $0,0018. - Narzędzie zwraca 2k tokenów (wejście do kolejnej rundy): 2k × $0,002 = $0,004. - Model generuje 800 tokenów finalnej odpowiedzi (wyjście): 0,8k × $0,006 = $0,0048. - Dodatkowo pierwotny prompt wejściowy (zależny od użycia). Sumaryczny koszt tych trzech kroków ≈ $0,011 bez kosztu początkowego promptu. - Limity – co sprawdzić dla 3.8 Max vs 3.7 - Maksymalne okno kontekstu (tokeny) i maks. liczba tokenów wyjściowych na żądanie. - Limity wydajności: żądania/min (RPM), tokeny/min (TPM), równoległość (concurrency). - Limity tool-call: maks. liczba rund/„głębokość”, maks. rozmiar payloadu na krok. - Limity rozmiarów: maks. rozmiar załączników/pliku (jeśli używasz), długość pojedynczego dokumentu, klucze cache. - Timeouty i zasady retry; czy zmienił się format zdarzeń streamingu. - Wpływ długiego kontekstu na latencję i ewentualne throttlingi. - Migracja z Qwen 3.7 do Qwen 3.8 – praktyczne wskazówki - Identyfikator modelu i kompatybilność API: - Zmień nazwę modelu w parametrach; upewnij się, że endpoint i wersjonowanie są zgodne z platformą. - Sprawdź pola response_format, tool_choice, czy nazwy są identyczne lub wymagają aktualizacji. - Różnice w domyślnych ustawieniach generacji: - temperature/top_p, długość wyjścia (max_tokens) – przywróć poprzednią „tonację” przez jawne parametry. - Structured/JSON output: - Wymuś tryb strukturalny (np. strict JSON) jeśli 3.8 jest bardziej restrykcyjny; dostosuj schematy funkcji (JSON Schema: typy, wymagane pola, enum). - Tool calling: - Zweryfikuj zgodność nazw funkcji i kształtu parametrów; zaktualizuj walidację błędów i retry na poziomie narzędzia. - Zmierz narzut tokenów z odpowiedzi narzędzi; może wzrosnąć przy bogatszym formacie treści. - Tokenizacja i budżet: - Sprawdź długości tokenów dla Twoich danych; przelicz budżety promptów, stop-sekwencje, chunking w RAG. - Cache: - Przegrzej nowy cache na 3.8 (zmiana modelu często unieważnia wpisy); ujednolić klucze (system prompt, wersje instrukcji). - Jakość i bezpieczeństwo: - A/B testy na Twoich zestawach; monitoruj zmiany w stylu/odmowach; dopracuj prompt systemowy. - Finetuning i kompatybilność: - Modele/fine-tune’y 3.7 zwykle nie są przenośne 1:1 na 3.8; rozważ retraining lub prompt-based alignment. - Operacyjnie: - Zaktualizuj limity RPM/TPM, alerty, backoff i buforowanie; upewnij się, że biling rozpoznaje nowy model. - Porównanie kosztów 3.8 vs 3.7 – jak policzyć - Użyj tej formuły dla jednego wywołania: koszt = (tokeny_wej/1e6) × cena_wej + (tokeny_wyj/1e6) × cena_wyj. - Podstaw stawki 3.8 (2 i 6 USD) oraz stawki 3.7 z Twojego dostawcy; policz średni koszt na przypadek użycia (np. średnio 4k wejścia i 1k wyjścia na żądanie, x żądań/dzień). - Jeśli używasz narzędzi, dolicz każdą rundę: tool_call (wyjście) + odpowiedź narzędzia (wejście) + kontynuacja modelu (wyjście). Jeśli podasz, z którego dostawcy korzystasz (np. DashScope, Bedrock, OpenRouter) i znane Ci stawki/limity dla Qwen 3.7, przygotuję dokładną tabelę porównawczą cache, narzędzi, limitów i precyzyjne wyliczenia kosztów dla Twoich realistycznych scenariuszy.