Qwen 3.8 Max Cennik API: $2 wejście, $6 wyjście, kontekst 1M
Poniżej zwięzłe porównanie i wskazówki, przy założeniu stawek Qwen 3.8 Max: $2/1M tokenów wejściowych i $6/1M tokenów wyjściowych.
- Opłaty bazowe
- Wejście: $2 za 1 000 000 tokenów (≈ $0,002 za 1k).
- Wyjście: $6 za 1 000 000 tokenów (≈ $0,006 za 1k).
- Rozliczanie dotyczy wszystkich tokenów wchodzących do modelu i wychodzących z modelu, w tym kontynuacji po wywołaniach narzędzi.
- Cache (prompt caching) – porównanie i praktyka
- Model nie definiuje własnego cennika cache; decyduje platforma (np. DashScope, Bedrock, OpenRouter itd.).
- Najczęstsze modele rozliczeń cache:
- Rozliczanie zapisu cache po stawce wejściowej; trafienia (cache hits) są darmowe lub z istotną zniżką.
- Alternatywnie: brak osobnej opłaty za cache, a platforma jedynie skraca opóźnienie (płacisz standardowo za tokeny).
- Na co zwrócić uwagę przy porównaniu 3.7 vs 3.8:
- Czy zmieniły się: stawka za zapis, zniżka za odczyt, TTL, maks. rozmiar wpisu, kluczowanie (case sensitivity, system prompt w kluczu).
- Czy zmiana modelu unieważnia istniejące wpisy cache.
- Narzędzia (tool calling / function calling) – koszty
- Z reguły brak „dopłaty modelowej” za samo użycie narzędzi; płacisz za tokeny:
- Wyjście modelu z poleceniem tool_call (tokeny wyjściowe).
- Odpowiedź narzędzia wprowadzana jako kontekst do modelu (tokeny wejściowe).
- Odpowiedź końcowa modelu (tokeny wyjściowe).
- Dodatkowe koszty mogą wynikać z usług zewnętrznych (np. wyszukiwarka, wektorowy RAG, API stron trzecich) – rozliczane poza modelem.
- W praktyce łączny koszt rośnie wraz z liczbą rund tool-call, nawet przy krótkiej wypowiedzi końcowej.
- Przykłady kosztów (bez cache; obliczenia tylko z podanych stawek)
- 3k tokenów wejścia + 1k tokenów wyjścia:
- Wejście: 3k × $0,002 = $0,006; Wyjście: 1k × $0,006 = $0,006; Razem ≈ $0,012.
- 10k wejścia + 5k wyjścia:
- Wejście: $0,020; Wyjście: $0,030; Razem ≈ $0,050.
- 100k wejścia + 20k wyjścia:
- Wejście: $0,200; Wyjście: $0,120; Razem ≈ $0,320.
- Jedna runda tool-call (przykład szacunkowy):
- Model generuje 300 tokenów zlecenia narzędzia (wyjście): 0,3k × $0,006 = $0,0018.
- Narzędzie zwraca 2k tokenów (wejście do kolejnej rundy): 2k × $0,002 = $0,004.
- Model generuje 800 tokenów finalnej odpowiedzi (wyjście): 0,8k × $0,006 = $0,0048.
- Dodatkowo pierwotny prompt wejściowy (zależny od użycia). Sumaryczny koszt tych trzech kroków ≈ $0,011 bez kosztu początkowego promptu.
- Limity – co sprawdzić dla 3.8 Max vs 3.7
- Maksymalne okno kontekstu (tokeny) i maks. liczba tokenów wyjściowych na żądanie.
- Limity wydajności: żądania/min (RPM), tokeny/min (TPM), równoległość (concurrency).
- Limity tool-call: maks. liczba rund/„głębokość”, maks. rozmiar payloadu na krok.
- Limity rozmiarów: maks. rozmiar załączników/pliku (jeśli używasz), długość pojedynczego dokumentu, klucze cache.
- Timeouty i zasady retry; czy zmienił się format zdarzeń streamingu.
- Wpływ długiego kontekstu na latencję i ewentualne throttlingi.
- Migracja z Qwen 3.7 do Qwen 3.8 – praktyczne wskazówki
- Identyfikator modelu i kompatybilność API:
- Zmień nazwę modelu w parametrach; upewnij się, że endpoint i wersjonowanie są zgodne z platformą.
- Sprawdź pola response_format, tool_choice, czy nazwy są identyczne lub wymagają aktualizacji.
- Różnice w domyślnych ustawieniach generacji:
- temperature/top_p, długość wyjścia (max_tokens) – przywróć poprzednią „tonację” przez jawne parametry.
- Structured/JSON output:
- Wymuś tryb strukturalny (np. strict JSON) jeśli 3.8 jest bardziej restrykcyjny; dostosuj schematy funkcji (JSON Schema: typy, wymagane pola, enum).
- Tool calling:
- Zweryfikuj zgodność nazw funkcji i kształtu parametrów; zaktualizuj walidację błędów i retry na poziomie narzędzia.
- Zmierz narzut tokenów z odpowiedzi narzędzi; może wzrosnąć przy bogatszym formacie treści.
- Tokenizacja i budżet:
- Sprawdź długości tokenów dla Twoich danych; przelicz budżety promptów, stop-sekwencje, chunking w RAG.
- Cache:
- Przegrzej nowy cache na 3.8 (zmiana modelu często unieważnia wpisy); ujednolić klucze (system prompt, wersje instrukcji).
- Jakość i bezpieczeństwo:
- A/B testy na Twoich zestawach; monitoruj zmiany w stylu/odmowach; dopracuj prompt systemowy.
- Finetuning i kompatybilność:
- Modele/fine-tune’y 3.7 zwykle nie są przenośne 1:1 na 3.8; rozważ retraining lub prompt-based alignment.
- Operacyjnie:
- Zaktualizuj limity RPM/TPM, alerty, backoff i buforowanie; upewnij się, że biling rozpoznaje nowy model.
- Porównanie kosztów 3.8 vs 3.7 – jak policzyć
- Użyj tej formuły dla jednego wywołania: koszt = (tokeny_wej/1e6) × cena_wej + (tokeny_wyj/1e6) × cena_wyj.
- Podstaw stawki 3.8 (2 i 6 USD) oraz stawki 3.7 z Twojego dostawcy; policz średni koszt na przypadek użycia (np. średnio 4k wejścia i 1k wyjścia na żądanie, x żądań/dzień).
- Jeśli używasz narzędzi, dolicz każdą rundę: tool_call (wyjście) + odpowiedź narzędzia (wejście) + kontynuacja modelu (wyjście).
Jeśli podasz, z którego dostawcy korzystasz (np. DashScope, Bedrock, OpenRouter) i znane Ci stawki/limity dla Qwen 3.7, przygotuję dokładną tabelę porównawczą cache, narzędzi, limitów i precyzyjne wyliczenia kosztów dla Twoich realistycznych scenariuszy.