GPT-6 Sol, GPT-6 Luna, and Claude Opus 5.5 are now live on CometAPI →
technology/Badania CometAPI

Grok 4.7: Benchmarki, cennik, funkcje i dostęp do API

Dowiedz się, czym jest Grok 4.7, w tym jego okno kontekstu 500K, wyniki w benchmarkach, ceny, tryby rozumowania, możliwości agenta, porównanie z Grok 4.6 oraz dostęp.

CometAPI
Deon GoodwinZespół badań AI modeli i API
Zaktualizowano Sep 22, 2026 11 min czyt.
Grok 4.7: Benchmarki, cennik, funkcje i dostęp do API
Użyj tego wzorca

Wykonaj pierwsze wywołanie API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Grok 4.7 to flagowy model SpaceXAI do programowania, agentowych przepływów pracy i profesjonalnej pracy z wiedzą, wydany 21 września 2026. Łączy okno kontekstu 500,000 tokenów, wejście tekstowe i obrazowe, konfigurowalne rozumowanie, wywoływanie funkcji, wyszukiwanie w sieci i w X oraz wykonywanie kodu.

Dla promptów poniżej 200,000 tokenów oficjalne API xAI podaje stawki $2 za milion tokenów wejściowych, $0.50 za milion buforowanych (cached) tokenów wejściowych oraz $6 za milion tokenów wyjściowych. CometAPI obecnie podaje dla Grok 4.7 stawki $1.60 za wejście, $0.40 za buforowane wejście oraz $4.80 za wyjście za milion tokenów dla tego samego progu — o 20% niższe niż oficjalne stawki pokazane na stronie modelu.

Praktyczna propozycja wartości nie polega na liderowaniu we wszystkich benchmarkach. Grok 4.7 jest najbardziej przekonujący, gdy obciążenie łączy zadania inżynieryjne, długie pętle agentów, użycie narzędzi, duże konteksty robocze oraz wrażliwość na koszt tokenów wyjściowych. Zespoły powinny zweryfikować go na własnych repozytoriach i przepływach pracy, zanim skierują do niego ruch produkcyjny.

Najważniejsze wnioski

  • Grok 4.7 wykorzystuje większy model bazowy niż Grok 4.6, dłuższe uczenie ze wzmocnieniem na trudniejszych, wielogodzinnych zadaniach oraz silniejszą autoweryfikację.
  • API obsługuje okno kontekstu 500,000 tokenów, wejście tekstowe i obrazowe, wyjście tekstowe, cztery poziomy rozumowania, ustrukturyzowane wyjście, wywoływanie funkcji, wyszukiwanie w sieci i X oraz wykonywanie kodu.
  • SpaceXAI raportuje 46.3% na CursorBench 4.0, 71.0% na DeepSWE v1.1 oraz 38.0% na Terminal-Bench 4.0. To wyniki publikowane przez dostawcę, a nie dowód uniwersalnego liderowania.
  • CometAPI listuje Grok 4.7 jako dostępny, z kompatybilnym z OpenAI endpointem i cenami o 20% niższymi od oficjalnych stawek xAI pokazanych w jego aktualnym katalogu.
  • Wybierz Grok 4.7 dla kosztowrażliwych agentów inżynieryjnych i długotrwałego użycia narzędzi; wybierz alternatywy, gdy bardzo długi kontekst lub benchmark krytyczny dla domeny są ważniejsze niż cena jednostkowa.

Czym jest Grok 4.7?

Grok 4.7 to najnowszy model językowy klasy frontier firmy SpaceXAI, pozycjonowany do zadań z zakresu programowania, autonomicznych agentów i profesjonalnej pracy z wiedzą. Wydanie koncentruje się na zadaniach wymagających trwałej interakcji, użycia narzędzi, weryfikacji i iteracyjnych poprawek, a nie wyłącznie jednorazowych odpowiedzi.

SpaceXAI mówi, że Grok 4.7 został wytrenowany z dłuższym przebiegiem uczenia ze wzmocnieniem na trudniejszej mieszance zadań, z naciskiem na problemy, które mogą zajmować wiele godzin. Ten kierunek treningu czyni go szczególnie istotnym dla inżynierii oprogramowania na poziomie repozytoriów, debugowania, badań, tworzenia dokumentów, analiz inżynieryjnych i wieloetapowej automatyzacji.

Czym Grok 4.7 różni się od — i przewyższa — Grok 4.6?

Większy model bazowy

Grok 4.7 przechodzi na większy model bazowy niż Grok 4.6. SpaceXAI nie ujawniło ostatecznej publicznej liczby parametrów, więc obronnym wnioskiem jest zwiększona pojemność modelu bazowego — nie konkretny szacunek parametrów.

Dłuższe uczenie ze wzmocnieniem na trudniejszych zadaniach

Etap uczenia ze wzmocnieniem został wydłużony i przesunięty w stronę trudniejszych, dłuższych problemów. SpaceXAI akcentuje zadania mogące wymagać godzin pracy, co zgrywa się z autonomicznym kodowaniem, badaniami i profesjonalnymi przepływami agentów.

Silniejsza autoweryfikacja

Grok 4.7 jest trenowany do dokładniejszej inspekcji własnej pracy. Ma to znaczenie w inżynierii oprogramowania, ponieważ niezawodny agent musi wielokrotnie sprawdzać, modyfikować, testować, diagnozować błędy, poprawiać i weryfikować — a nie tylko wygenerować pierwszą odpowiedź.

Zmierzone ulepszenia względem Grok 4.6

DimensionGrok 4.6Grok 4.7Change
CursorBench 4.040.4%46.3%+5.9 pts
DeepSWE v1.165.2%71.0%+5.8 pts
EEBench53.0%64.0%+11.0 pts
AA Briefcase v1.11,5461,657+111
Terminal-Bench 4.020.3%38.0%+17.7 pts
Harvey Legal Agent Benchmark15.8%19.6%+3.8 pts
HealthBench Professional48.5%56.7%+8.2 pts

W całym opublikowanym zestawie startowym Grok 4.7 poprawia wyniki względem Grok 4.6 w każdym wymienionym rezultacie. Największy bezwzględny przyrost dotyczy Terminal-Bench 4.0, co spójne jest z naciskiem wydania na długotrwałe przepływy pracy w wierszu poleceń i użycie narzędzi. Te liczby pozostają danymi publikowanymi przez dostawcę i należy je przetestować na realnych zadaniach przed podjęciem decyzji migracyjnej.

Jak dobry jest Grok 4.7 w benchmarkach?

Ocena startowa SpaceXAI obejmuje inżynierię oprogramowania, pracę w terminalu, profesjonalne zadania biurowe, prawo, wnioskowanie kliniczne i elektrotechnikę. Są to wyniki publikowane przez dostawcę, które należy zweryfikować względem obciążeń produkcyjnych przed decyzjami zakupowymi lub routingu.

BenchmarkGrok 4.7 xHighGrok 4.6 HighGPT-5.6 Sol MaxFable 5.1 Max
CursorBench 4.046.3%40.4%41.7%51.8%
DeepSWE v1.171.0%*65.2%72.7%70.0%
EEBench64.0%53.0%39.4%56.4%
AA Briefcase v1.11,6571,5461,4871,678
Terminal-Bench 4.038.0%20.3%37.3%57.9%
Harvey Legal Agent Benchmark19.6%15.8%2.5%6.7%
HealthBench Professional56.7%48.5%60.5%62.1%

W swoich wynikach startowych Grok 4.7 SpaceXAI oznacza wynik 71.0% na DeepSWE v1.1 jako wysoki nakład rozumowania.

Ogłoszenie premiery nie ujawnia wszystkich harnessów per-benchmark, konfiguracji narzędzi, liczby przebiegów ani środowiska ewaluacji. Traktuj te wartości jako wyniki publikowane przez dostawcę i weryfikuj model na własnych repozytoriach, narzędziach, celach opóźnień i kryteriach błędów, zanim skierujesz do niego pracę produkcyjną.

Co pokazuje profil benchmarków Grok 4.7?

Inżynieria oprogramowania

CursorBench 4.0 rośnie z 40.4% na Grok 4.6 do 46.3% na Grok 4.7, podczas gdy DeepSWE v1.1 rośnie z 65.2% do 71.0%. Wspiera to pozycjonowanie Grok 4.7 jako modelu dla agentów programistycznych, a nie wyłącznie konwersacyjnej asysty w kodowaniu.

Długotrwała praca w terminalu

Terminal-Bench 4.0 pokazuje jedną z największych zmian generacyjnych: 20.3% dla Grok 4.6 versus 38.0% dla Grok 4.7. Bezwzględny przyrost o 17.7 punktu jest spójny z naciskiem SpaceXAI na dłuższe horyzonty RL i autoweryfikację.

Elektrotechnika

Na EEBench Grok 4.7 osiąga 64.0% w porównaniu do 53.0% dla Grok 4.6. Wśród opublikowanych porównań jest to jeden z najsilniejszych względnych wyników Grok 4.7.

Profesjonalna praca z wiedzą

AA Briefcase v1.1 rośnie z 1,546 do 1,657. Te zadania mają odzwierciedlać wielogodzinną pracę profesjonalną obejmującą artefakty takie jak dokumenty, prezentacje, analizy i inne ustrukturyzowane rezultaty.

Grok 4.7 vs GPT-5.6 Sol vs Fable 5.1: Jak się porównują?

Kontrole cenników u dostawców natywnych: OpenAI listuje GPT-5.6 Sol po $4 za milion tokenów wejściowych i $20 za milion tokenów wyjściowych, podczas gdy Anthropic listuje Claude Fable 5.1 po $10 za milion tokenów wejściowych i $50 za milion tokenów wyjściowych.

DimensionGrok 4.7GPT-5.6 SolClaude Fable 5.1
Primary positioningProgramowanie, zadania agentowe, praca z wiedząZłożone profesjonalne rozumowanie i programowanieDługotrwałe agenty, programowanie i praca z wiedzą
Context window500,000 tokens1,050,000 tokens1,000,000 tokens
ModalitiesWejście tekstowe i obrazowe; wyjście tekstoweWejście tekstowe i obrazowe; wyjście tekstoweWejście tekstowe i obrazowe; wyjście tekstowe
Reasoning controlLow, medium, high, xhighNone through maxAdaptive thinking with configurable effort
Provider API statusDostępny w publicznym API xAIDostępny przez OpenAI Chat Completions i ResponsesDostępny przez Claude API i wspierane marketplace’y w chmurze
Input price / 1M tokens$2$4$10
Output price / 1M tokens$6$20$50
CursorBench 4.046.3%41.7%51.8%
DeepSWE v1.171.0%72.7%70.0%
Best fitKosztowo wrażliwi agenci inżynieryjni i trwałe użycie narzędziSzerokie profesjonalne rozumowanie z bardzo długim kontekstemMaksymalna wydajność długotrwałych agentów i przepływów wiedzy

Który model wybrać?

  • Wybierz Grok 4.7, gdy priorytetem są obciążenia inżynieryjne, trwałe użycie narzędzi, konfigurowalne rozumowanie i niższy koszt tokenów wyjściowych. Jest szczególnie atrakcyjny dla agentów pracujących na repozytoriach, przepływów terminalowych i badań z dużym kontekstem, które mieszczą się poniżej progu cenowego 200K.
  • Wybierz GPT-5.6 Sol, gdy zadanie wymaga szerszego profesjonalnego rozumowania, okna kontekstu powyżej miliona tokenów lub gdy jego silniejszy wynik na krytycznej dla biznesu ocenie, takiej jak DeepSWE czy wnioskowanie kliniczne, został potwierdzony w Twoim własnym harnessie.
  • Wybierz Claude Fable 5.1, gdy maksymalna wydajność długotrwałych agentów, jakość kodu, wykonanie w terminalu lub wnioskowanie kliniczne uzasadniają wyższą cenę tokenów.
  • Stosuj trasowanie modeli, gdy obciążenia są zróżnicowane. Kieruj rutynowe zadania inżynieryjne i kroki o dużym wolumenie do najbardziej opłacalnego kwalifikowanego modelu, a droższy model rezerwuj do zadań, gdzie mierzone wskaźniki sukcesu uzasadniają premię.

Właściwy wybór zależy od sukcesu zadania end-to-end, opóźnień, retry, dokładności wywołań narzędzi i nakładu pracy ludzkiej — nie od pojedynczego benchmarku czy nagłówkowej stawki za token.

Ile kosztuje API Grok 4.7?

Poniższa tabela porównuje oficjalne stawki xAI z cenami wyświetlanymi na stronie modelu Grok 4.7 w CometAPI na 22 września 2026. CometAPI deklaruje 20% rabatu; przed produkcją zweryfikuj aktualne ceny, ponieważ ceny bramek i warunki promocyjne mogą się zmieniać.

Prompt tierPrice typexAI officialCometAPIDifference
Below 200K prompt tokensInput / 1M$2.00$1.6020% lower
Cached input / 1M$0.50$0.4020% lower
Output / 1M$6.00$4.8020% lower
Above 200K prompt tokensInput / 1M$4.00$3.2020% lower
Cached input / 1M$1.00$0.8020% lower
Output / 1M$12.00$9.6020% lower

Standardowe ceny kontekstu dla promptów do 200,000 tokenów

Dla żądań, których prompt nie przekracza 200,000 tokenów, Grok 4.7 kosztuje $2 za milion tokenów wejściowych, $0.50 za milion buforowanych tokenów wejściowych oraz $6 za milion tokenów wyjściowych. Buforowane wejście to najtańsza kategoria, więc aplikacje z powtarzanymi instrukcjami systemowymi lub wielokrotnie używanym kontekstem mogą obniżyć koszt, gdy te tokeny kwalifikują się do cache.

Prosty przykład: żądanie wykorzystujące 100,000 niebuforowanych tokenów wejściowych i generujące 10,000 tokenów wyjściowych kosztowałoby około $0.26 przed innymi opłatami platformowymi: $0.20 za wejście plus $0.06 za wyjście.

Cennik dla długiego kontekstu powyżej 200,000 tokenów promptu

Po przekroczeniu przez prompt 200,000 tokenów stawki podwajają się do $4 za milion tokenów wejściowych, $1 za milion buforowanych tokenów wejściowych oraz $12 za milion tokenów wyjściowych. Wyższy próg dotyczy z racji długości promptu, więc zespoły powinny monitorować skumulowaną historię rozmów, ślady narzędzi, pobierane dokumenty i kontekst repozytoriów przed wysłaniem każdego żądania.

Praktyczna decyzja kosztowa dotyczy więc nie tylko liczby tokenów, które zadanie zużywa, ale tego, czy prompt przekracza granicę 200,000 tokenów. Podsumowywanie zakończonej pracy, usuwanie przestarzałych wyników narzędzi i pobieranie tylko najbardziej istotnych plików może utrzymać odpowiednie obciążenia w standardowym progu bez poświęcania potrzebnego kontekstu.

Informacje o wydaniu SpaceXAI dokumentują ten próg. Budżety produkcyjne powinny także uwzględniać retry, pętle agentów, nieudane wywołania narzędzi oraz długość wyjścia, zamiast porównywać dostawców wyłącznie po nagłówkowej cenie tokenów wejściowych.

Co czyni Grok 4.7 użytecznym dla agentów AI?

  • Okno kontekstu 500K: Mieści znaczące fragmenty kodu źródłowego, specyfikacje, wyniki narzędzi, logi i historię rozmów w jednym kontekście roboczym. Jest to przydatne dla kodowania na skalę repozytorium i analizy wielodokumentowej, choć kontekst nadal wymaga aktywnego przycinania.
  • Konfigurowalne rozumowanie: Aplikacje mogą wybrać niski, średni, wysoki lub xhigh nakład, wymieniając opóźnienie i zasoby obliczeniowe na głębsze rozumowanie odpowiednio do trudności zadania.
  • Wywoływanie funkcji i ustrukturyzowane wyjście: Agenci mogą odpyt(y)wać bazy danych, uruchamiać testy, inspekcjonować dokumenty, wywoływać wewnętrzne API i zwracać wyniki w formie czytelnej dla maszyn.
  • Wyszukiwanie w sieci i w X: Narzędzia wyszukiwania mogą pobierać aktualne informacje, gdy danych z treningu modelu brakuje. Pobierane treści nadal należy traktować jako niezaufane wejście i weryfikować.
  • Wykonywanie kodu: Model może weryfikować obliczenia, przekształcać dane i testować generowane rozwiązania zamiast polegać wyłącznie na inferencji modelu językowego.
  • Skupienie na przepływach o długim horyzoncie: Nacisk treningu na wielogodzinne zadania, zarządzanie kontekstem i autoweryfikację celuje w pętle agentów, które akumulują ślady narzędzi i wymagają odzyskiwania po błędach.

Jak Grok 4.7 poprawia bezpieczeństwo?

SpaceXAI mówi, że Grok 4.7 wprowadza zupełnie nowy stos zabezpieczeń i raportuje silniejszą odporność na jailbreaki oraz bezpieczeństwo w zastosowaniach podwójnego przeznaczenia. W ogłoszeniu firma podaje 62.4% na benchmarku biosafety LatchBio i mówi, że tylko 3.3% ryzykownych promptów dual-use przeszło na HackerBench v0.3.

Te liczby to ewaluacje publikowane przez dostawcę. Są użyteczne do zrozumienia deklaracji wydania, ale nie należy ich traktować jako uniwersyjnej miary realnej wydajności bezpieczeństwa.

Jak deweloperzy mogą korzystać z API Grok 4.7?

Grok 4.7 jest obecnie dostępny przez CometAPI pod identyfikatorem modelu grok-4.7. CometAPI zapewnia kompatybilny z OpenAI endpoint, jeden klucz API i rozliczenia dla wielu dostawców modeli, łatwiejsze testy porównawcze i trasowanie modeli oraz obecnie listowane ceny tokenów o 20% niższe niż oficjalne stawki xAI. Przed użyciem produkcyjnym potwierdź aktualną stronę modelu, stan endpointu, wspierane parametry, ceny i wymagania dotyczące przetwarzania danych.

Przykład żądania CometAPI:

curl "https://api.cometapi.com/v1/responses" \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $COMETAPI_KEY" \
  -d '{
    "model": "grok-4.7",
    "input": "Explain how a distributed task queue handles worker failure."
  }'

Czy warto przejść na Grok 4.7?

Dla obecnych użytkowników Grok 4.6, którzy polegają na agentach programistycznych lub długotrwałych profesjonalnych przepływach pracy, Grok 4.7 jest istotnym kandydatem do aktualizacji, ponieważ opublikowany zestaw benchmarków poprawia się we wszystkich raportowanych wymiarach, podczas gdy standardowe ceny tokenów pozostają na poziomie $2/$6 poniżej progu długiego kontekstu.

Dla użytkowników innych modeli frontier decyzja zależy od obciążenia. Grok 4.7 jest szczególnie interesujący, gdy znaczenie mają koszt tokenów wyjściowych, obciążenia inżynieryjne, duże konteksty i trwałe użycie narzędzi. Tam, gdzie inny model jest silniejszy w krytycznej domenie, trasowanie modeli może być bardziej racjonalne niż zastępowanie wszystkich modeli jednym dostawcą.

Podsumowanie

Grok 4.7 to coś więcej niż rutynowa aktualizacja numeryczna Grok 4.6. Wydanie jest wyraźnie ukierunkowane na długotrwałą pracę wykonywaną przez narzędzia, wielokrotną weryfikację, duże konteksty i wiele kroków wykonawczych.

Najsilniejsze przyrosty generacyjne pojawiają się tam, gdzie ten kierunek treningu powinien mieć znaczenie: Terminal-Bench 4.0 rośnie z 20.3% do 38.0%, EEBench z 53.0% do 64.0%, a CursorBench 4.0 z 40.4% do 46.3%, podczas gdy standardowe ceny poniżej progu 200K dla promptu pozostają na poziomie $2/M za wejście i $6/M za wyjście.

Praktyczna propozycja wartości to zatem nie „Grok 4.7 wygrywa każdy benchmark”, lecz że Grok 4.7 zmniejsza lukę między możliwościami agentów klasy frontier a tańszą inferencją, co czyni go szczególnie istotnym dla agentów programistycznych, systemów badawczych i profesjonalnych przepływów pracy, które muszą działać przez wiele kroków, a nie tylko udzielić jednej odpowiedzi.

Kontynuuj naukę

Połącz ten artykuł z następną decyzją.

Zobacz wszystkie tematy
Opublikowano Sep 22, 2026
Ostatnia aktualizacja Sep 22, 2026
21 wyświetleń
Sprawdzone pod kątem przejrzystości, atrybucji źródeł i aktualnej terminologii API.

Gotowy na obniżenie kosztów rozwoju AI o 20%?

Zacznij za darmo w kilka minut. Dołączone kredyty na bezpłatny okres próbny. Karta kredytowa nie jest wymagana.

Czytaj więcej