xAI opisuje Grok 4.7 jako swój wiodący model do programowania, zadań agentowych i pracy z wiedzą, z oknem kontekstu 500K tokenów. Zgodnie z aktualną stroną cennika xAI, bezpośrednie stawki API poniżej 200 000 tokenów w prompcie wynoszą $2.00 za milion tokenów wejściowych, $0.50 za milion tokenów z pamięci podręcznej oraz $6.00 za milion tokenów wyjściowych. Gdy prompt osiąga 200 000 tokenów lub więcej, xAI podaje odpowiednio $4.00, $1.00 i $12.00. Są to stawki bezpośrednie xAI, a nie uniwersalne ceny obowiązujące na platformach zewnętrznych.
Rzeczywisty koszt zależy od więcej niż tylko stawki za wejście. Nowe wejście, wejście z pamięci podręcznej, wyjście, ponowienia, wywołania narzędzi i liczba wywołań modelu w przepływie pracy agenta — wszystko to może zmienić rachunek. Próg 200K w prompcie ma szczególne znaczenie, ponieważ zarówno xAI, jak i CometAPI publikują wyższe stawki dla długiego kontekstu po przekroczeniu tej granicy.
Ten przewodnik najpierw ustala bazę cenową xAI, a następnie porównuje bieżącą listę CometAPI dla Grok 4.7. Na dzień 28 września 2026 r. CometAPI podaje $1.60 / $0.40 / $4.80 za milion tokenów nowego wejścia, wejścia z pamięci podręcznej i wyjścia w taryfie standardowej oraz $3.20 / $0.80 / $9.60 w taryfie długiego kontekstu — 20% poniżej odpowiadających im stawek bezpośrednich xAI. W kolejnych sekcjach wyjaśniono, jak obliczać koszt pracy, ograniczać straty i uzyskiwać dostęp do modelu przez CometAPI. Wszystkie ceny są migawkami z określonej daty i należy je ponownie sprawdzić przed użyciem produkcyjnym.
xAI Direct vs. CometAPI Grok 4.7 Pricing
Stawki bezpośrednie xAI (USD za 1M tokenów)
| Kategoria tokenów | Poniżej 200K tokenów w prompcie | Długi kontekst (≥200K) |
|---|---|---|
| Nowe wejście | $2.00 | $4.00 |
| Wejście z pamięci podręcznej | $0.50 | $1.00 |
| Wyjście | $6.00 | $12.00 |
Stawki CometAPI (USD za 1M tokenów)
| Kategoria tokenów | CometAPI: poniżej 200K tokenów w prompcie | CometAPI: taryfa długiego kontekstu |
|---|---|---|
| Nowe wejście | $1.60 / 1M tokens | $3.20 / 1M tokens |
| Wejście z pamięci podręcznej | $0.40 / 1M tokens | $0.80 / 1M tokens |
| Wyjście | $4.80 / 1M tokens | $9.60 / 1M tokens |
Próg 200K w prompcie ma znaczenie, ponieważ obie platformy obecnie podają stawki dla długiego kontekstu równe dwukrotności stawek w taryfie standardowej dla Grok 4.7. To zasady cenowe ustalane przez każdą platformę API, a nie zmiana możliwości modelu. Żądanie staje się droższe, gdy aplikacja wielokrotnie wysyła duże prompty lub pozwala, by historia agenta rosła bez kontroli — nie dlatego, że Grok 4.7 obsługuje okno kontekstu 500K.
Na potrzeby budżetowania traktuj każde żądanie, które może osiągnąć ten próg, jako długi kontekst, dopóki aktywne zachowanie rozliczeń nie zostanie zweryfikowane. Dostępność modelu i ceny mogą się zmieniać, dlatego kalkulatory produkcyjne powinny ponownie sprawdzać zarówno ceny bezpośrednie xAI, jak i bieżącą stronę modelu CometAPI, zamiast na stałe wpisywać wartości.
The Formula for Estimating Grok 4.7 Cost
Oszacuj jedno żądanie, wyceniając osobno każdą kategorię tokenów:
request cost = (fresh input tokens × input rate + cached input tokens × cached rate + output tokens × output rate) ÷ 1,000,000
Następnie przelicz oszacowanie żądania na oszacowanie obciążenia:
monthly cost = request cost × requests per user × active users × days in billing period
Użyj realistycznego percentyla zamiast jednej średniej. Szacunek p50 opisuje normalne żądanie, ale długości wejścia i wyjścia p95 ujawniają drogi „ogon”, który często napędza rachunek. W przypadku przepływów agenta pomnóż przez oczekiwaną liczbę wywołań modelu na ukończone zadanie. Pięcioetapowy przepływ to pięć płatnych wywołań, a nie jedno.
Worked Example 1: A Support Copilot
Załóżmy, że jedno zgłoszenie wsparcia wysyła 6 000 nowych tokenów wejściowych i generuje 800 tokenów wyjściowych. Pozostaje poniżej progu 200K i nie otrzymuje zniżki za cache.
- Wejście: 6,000 × $1.60 ÷ 1,000,000 = $0.00960
- Wyjście: 800 × $4.80 ÷ 1,000,000 = $0.00384
- Suma: $0.01344 na żądanie
Przy 100 000 żądań miesięcznie szacowany koszt tokenów wynosi $1,344. Jeśli ewaluacja pokaże, że odpowiedź o długości 400 tokenów sprawdza się równie dobrze jak 800-tokenowa, szacunek spada do $0.01152 na żądanie, czyli $1,152 miesięcznie. Sam ten limit wyjścia oszczędza około $192 miesięcznie, czyli 14.3%, bez zmiany modelu.
Dlatego warto zwracać uwagę na kontrolę wyjścia. Przy podanej stawce CometAPI tokeny wyjściowe kosztują trzykrotnie więcej niż nowe tokeny wejściowe w tej samej taryfie.
Worked Example 2: Reusing a Stable 20K-Token Prefix
Załóżmy, że każde żądanie zawiera 20 000-tokenowy podręcznik produktu, 2 000 tokenów nowego kontekstu rozmowy i 600-tokenową odpowiedź.
Bez trafienia w cache szacunek wynosi:
- 22,000 nowych tokenów wejściowych: $0.03520
- 600 tokenów wyjściowych: $0.00288
- Suma: $0.03808 na żądanie
Jeśli stabilny prefiks 20 000 tokenów jest rozliczany jako wejście z pamięci podręcznej, a tylko 2 000 tokenów pozostaje nowymi, szacunek staje się:
- 20,000 tokenów wejściowych z pamięci podręcznej: $0.00800
- 2,000 nowych tokenów wejściowych: $0.00320
- 600 tokenów wyjściowych: $0.00288
- Suma: $0.01408 na żądanie
Przy 100 000 żądań to $1,408 zamiast $3,808 — szacowana oszczędność $2,400, czyli 63.0%. Oszczędność nie jest automatyczna: pierwsze żądanie, zmieniony prefiks albo trasa, która nie daje trafienia cache, wciąż mogą być rozliczane w stawce za nowe wejście. Zanim uznasz oszczędność za osiągniętą, potwierdź liczbę tokenów z cache w rzeczywistych danych użycia.
Worked Example 3: The Cost of Crossing 200K
Rozważ długotrwające żądanie agenta z 210 000 tokenów w prompcie i 2 000 tokenów wyjściowych. Przy podanych stawkach dla długiego kontekstu:
- 210,000 nowych tokenów wejściowych: $0.67200
- 2,000 tokenów wyjściowych: $0.01920
- Suma: $0.69120 na uruchomienie
Jeśli kompresja kontekstu, filtrowanie wyników wyszukiwania i punkty kontrolne podsumowań zredukują prompt do 180 000 tokenów przy zachowaniu tych samych 2 000 tokenów wyjściowych, szacunek w taryfie standardowej wynosi:
- 180,000 nowych tokenów wejściowych: $0.28800
- 2,000 tokenów wyjściowych: $0.00960
- Suma: $0.29760 na uruchomienie
Różnica to $0.39360 na uruchomienie, czyli około 56.9%. W skali 10 000 uruchomień szacowana oszczędność wynosi $3,936. Lekcja nie polega na usuwaniu użytecznego kontekstu. Chodzi o zachowanie tylko tego kontekstu, który zmienia odpowiedź, oraz podsumowanie lub pobranie reszty, zanim żądanie przekroczy granicę cenową.
A Python Calculator for Pre-Call Estimates
Poniższa funkcja wykorzystuje bieżące stawki Grok 4.7 podawane przez CometAPI. Zachowawczo stosuje taryfę długiego kontekstu, gdy łączny prompt osiąga 200 000 tokenów.
from dataclasses import dataclass
@dataclass(frozen=True)
class Rates:
input_per_million: float
cached_input_per_million: float
output_per_million: float
SHORT = Rates(1.60, 0.40, 4.80)
LONG = Rates(3.20, 0.80, 9.60)
def estimate_grok_47_cost(
fresh_input_tokens: int,
cached_input_tokens: int,
max_output_tokens: int,
) -> float:
prompt_tokens = fresh_input_tokens + cached_input_tokens
rates = LONG if prompt_tokens >= 200_000 else SHORT
return (
fresh_input_tokens * rates.input_per_million
+ cached_input_tokens * rates.cached_input_per_million
+ max_output_tokens * rates.output_per_million
) / 1_000_000
estimate = estimate_grok_47_cost(
fresh_input_tokens=2_000,
cached_input_tokens=20_000,
max_output_tokens=600,
)
print(f"Estimated upper bound: ${estimate:.5f}")
To narzędzie planistyczne, a nie faktura. Ostateczny koszt zależy od rzeczywistego wejścia, wejścia z pamięci podręcznej, wyjścia, ponowień, wywołań narzędzi oraz aktywnej ceny w momencie wykonania. Po każdej odpowiedzi zapisuj zwrócone zużycie tokenów, identyfikator modelu, status żądania i wynik zadania. Uzgadniaj te wartości z zapisami rozliczeniowymi dostawcy.
Five Grok 4.7 Cost Controls, Ranked by Likely Impact
1. Zapewnij na tyle stabilny powtarzany kontekst, aby można go było buforować
Umieszczaj statyczne instrukcje, dokumentację produktu, schematy i wielokrotnego użytku przykłady przed treścią specyficzną dla żądania. Unikaj zmiany znaczników czasu, identyfikatorów, białych znaków lub kolejności w dużym współdzielonym prefiksie, chyba że jest to konieczne. Wytyczne xAI dla Grok 4.7 zalecają stabilne identyfikatory trasowania cache dla konwersacji; korzystając z pośredniej trasy, zweryfikuj, które kontrolki pamięci podręcznej i pola użycia są obsługiwane, zanim na nich polegniesz.
Mierz liczbę tokenów z trafieniem cache i współczynnik trafień cache według typu obciążenia. Teoretyczna zniżka cache nie ma wartości, jeśli aplikacja stale modyfikuje prefiks.
2. Traktuj 200K jako budżet inżynieryjny, a nie cel
Zostaw margines poniżej progu na instrukcje systemowe, pobrane fragmenty, wyniki narzędzi i kolejną turę użytkownika. Dla agenta kompresuj stare tury do zweryfikowanego podsumowania i przechowuj surową transkrypcję poza kontekstem modelu. Dla wyszukiwania uszereguj i deduplikuj fragmenty przed wstawieniem zamiast wysyłać każdy trafiony wynik.
Śledź rozkłady długości promptów i alarmuj, zanim p95 zbliży się do progu. Zgodnie z oficjalnym cennikiem xAI, gdy prompt osiągnie 200K tokenów, stawki długiego kontekstu dotyczą wszystkich tokenów w tym żądaniu. CometAPI podobnie podaje osobną, wyższą taryfę długiego kontekstu dla Grok 4.7. To warunki cenowe platform, a nie możliwości modelu.
3. Ograniczaj wyjście i dostrajaj poziom rozumowania względem zestawu ewaluacyjnego
Ustaw limit wyjścia na poziomie aplikacji, odpowiedni do produktu. Wynik klasyfikacji może wymagać dziesiątek tokenów; odpowiedź wsparcia — kilkuset; raport badawczy — więcej. Ten limit to kontrola budżetu i doświadczenia użytkownika, a nie twarde ograniczenie modelu Grok 4.7. Notatki wydania xAI z 21 września stwierdzają, że Grok 4.7 nie ma limitu wyjścia tekstu; nie przeszkadza to jednak aplikacji lub konkretnej trasie API w egzekwowaniu własnego limitu żądania. Potwierdź każdy limit egzekwowany przez endpoint lub SDK dla trasy, której faktycznie używasz.
Grok 4.7 obsługuje wiele poziomów wysiłku rozumowania. Użyj najniższego poziomu, który przechodzi reprezentatywny zestaw ewaluacyjny, a wyższy zostaw dla zadań, gdzie daje mierzalną poprawę. Redukowanie rozumowania lub wyjścia bez weryfikacji jakości może generować ponowienia i niweczyć oszczędność.
4. Odrzucaj lub przekształcaj kosztowne żądania przed wywołaniem API
Oszacuj górną granicę na podstawie rozmiaru wejścia i skonfigurowanego limitu wyjścia. Jeśli żądanie przekracza budżet produktu, aplikacja może poprosić użytkownika o zawężenie zadania, podsumowanie przesłanych materiałów, redukcję pobranego kontekstu lub przeniesienie pracy do zatwierdzonego asynchronicznego przepływu. To bardziej przewidywalne niż odkrywanie kosztu po wygenerowaniu.
Zgrubne przybliżenie znaków do tokenów może być użytecznym wczesnym zabezpieczeniem, ale nie powinno zastępować tokenizera ani rzeczywistych danych użycia. Języki, kod, JSON i formatowanie mogą dawać bardzo różne gęstości tokenów.
5. Optymalizuj koszt na ukończone zadanie, nie koszt na wywołanie
Tańsze wywołanie, które dwa razy nie przechodzi walidacji, może kosztować więcej niż jedno udane. Śledź:
- koszt na zaakceptowaną odpowiedź;
- koszt na ukończone zadanie agenta;
- koszt ponowień i mechanizmu awaryjnego;
- współczynnik trafień cache i udział tokenów z cache;
- p50 i p95 liczby tokenów w prompcie i w wyjściu;
- wynik jakości, opóźnienie i odsetek eskalacji do człowieka.
Jeśli rutynowy ruch nie wymaga jakości lub pojemności kontekstu Grok 4.7, ujednolicony katalog modeli CometAPI może ułatwić przełączanie modeli zarządzane przez aplikację. Utrzymuj regułę trasowania wprost, oceniaj każdy model na tym samym zbiorze zadań i wysyłaj do tej trasy tylko te żądania, które korzystają z Grok 4.7.
A Practical Monthly Cost Review
Raz w tygodniu grupuj ruch według funkcji i porównuj szacowany koszt z rzeczywistym zużyciem. Zacznij od funkcji odpowiadających za najwięcej tokenów wyjścia, największe prompty i najniższy współczynnik trafień cache. Następnie przejrzyj kosztowne odstające przypadki, zamiast ślepo optymalizować medianę.
| Sygnał | Prawdopodobny problem | Pierwsze działanie |
|---|---|---|
| Niski udział tokenów z cache | Współdzielony prefiks zbyt często się zmienia | Ustabilizuj i wersjonuj kontekst wielokrotnego użytku |
| Prompty skupione blisko 200K | Historia lub wyszukiwanie są nieograniczone | Kompaktuj, szereguj i zostaw margines |
| Wyjście dominuje koszt | Odpowiedzi dłuższe niż wymaga produkt | Obniż limit i przetestuj jakość odpowiedzi |
| Wysoki koszt ponowień | Walidacja, timeouty lub niestabilne prompty | Napraw tryb awarii przy pierwszym wywołaniu |
| Niski koszt, ale słaba skuteczność zadań | Optymalizacja obniżyła użyteczną jakość | Mierz koszt na zaakceptowany wynik |
Where CometAPI Fits in the Grok 4.7 Cost Model
Rola CometAPI w tym przepływie to poziom platformy API: zapewnia dostęp do Grok 4.7, publikuje własne stawki tokenowe i dokumentuje punkt wejścia zgodny z OpenAI. Nie zmienia podstawowych możliwości modelu Grok 4.7. Zespoły już używające klienta w stylu OpenAI mogą często zachować ten sam wzorzec klienta, zmieniając klucz API, bazowy URL i identyfikator modelu, z zastrzeżeniem zgodności endpointu.
Na dzień 28 września 2026 r. podane stawki CometAPI dla Grok 4.7 są o 20% niższe niż odpowiadające im stawki bezpośrednie xAI zarówno w taryfie standardowej, jak i długiego kontekstu. To porównanie cen platform, a nie roszczenie co do jakości modelu. Przed wdrożeniem produkcyjnym zespoły powinny także zweryfikować aktywny identyfikator modelu, parametry endpointu, zachowanie cache, limity szybkości, niezawodność, wsparcie i warunki rozliczeń.
Aby przetestować model, przejrzyj bieżące ceny i szczegóły dostępu na stronie modelu Grok 4.7 w CometAPI. Trzymaj tabelę cen w konfiguracji, zapisuj rzeczywiste zużycie po każdym wywołaniu i przeliczaj szacunki obciążenia za każdym razem, gdy zmienia się model lub zachowanie produktu.
FAQ
Jaka jest cena za token Grok 4.7 w CometAPI?
Dla promptów poniżej 200K tokenów CometAPI obecnie podaje $1.60 za milion nowych tokenów wejściowych, $0.40 za milion tokenów wejściowych z pamięci podręcznej oraz $4.80 za milion tokenów wyjściowych. Podane stawki dla długiego kontekstu to odpowiednio $3.20, $0.80 i $9.60 za milion tokenów.
Ile kosztuje jedno wywołanie API Grok 4.7?
To zależy od nowych tokenów wejściowych, tokenów wejściowych z pamięci podręcznej, tokenów wyjściowych i aktywnej taryfy kontekstu. Pomnóż każdą liczbę tokenów przez odpowiednią stawkę za milion, zsumuj wyniki i podziel przez milion. Uwzględnij też ponowienia i każde wywołanie modelu w wieloetapowym przepływie.
Jaki jest najłatwiejszy sposób na obniżenie kosztu API Grok 4.7?
Zacznij od największego zmierzonego czynnika kosztowego. Powtarzające się długie instrukcje zwykle korzystają z cache; rosnące historie agentów — z kompakcji; rozwlekłe odpowiedzi — z niższego limitu wyjścia. Potwierdź, że jakość pozostaje akceptowalna po każdej zmianie.
Czy okno kontekstu 500K oznacza, że powinienem wysyłać 500K tokenów?
Nie. Okno kontekstu to limit pojemności, a nie rekomendacja. Zarówno ceny bezpośrednie xAI, jak i bieżąca lista CometAPI używają wyższych stawek dla długiego kontekstu przy progu 200K tokenów w prompcie, więc aplikacje powinny wysyłać tylko kontekst potrzebny do zadania.
Czy mogę oszacować koszt przed wywołaniem Grok 4.7?
Tak. Oszacuj tokeny wejściowe, wybierz właściwą taryfę kontekstu, dodaj realistyczny limit wyjścia i oblicz górną granicę. Po wywołaniu zastąp szacunek rzeczywistymi danymi użycia do raportowania i optymalizacji.