DeepSeek V4 Pro 0813 is now live on CometAPI →

Grok 4.6 już jest: wyniki benchmarków na poziomie GPT-5.6 i wydajność w programowaniu

CometAPI
AnnaAug 13, 2026
Grok 4.6 już jest: wyniki benchmarków na poziomie GPT-5.6 i wydajność w programowaniu

TL; DR xAI oficjalnie wydało Grok 4.6 12 sierpnia 2026 r. i udostępniło go przez xAI API, Cursor oraz Grok Build. Ma okno kontekstu 500 000 tokenów, przyjmuje tekst i obrazy, oferuje cztery poziomy wysiłku rozumowania i ma granicę wiedzy na 1 lutego 2026 r. Zgodnie z oficjalnym ogłoszeniem xAI o Grok 4.6, dorównuje GPT-5.6 Sol w Artificial Analysis Intelligence Index, kompozycie z dziewięciu ewaluacji.

Cennik API zaczyna się od 2 USD za milion tokenów wejściowych, 0,50 USD za milion zbuforowanych tokenów wejściowych i 6 USD za milion tokenów wyjściowych dla promptów poniżej 200 000 tokenów. Po osiągnięciu przez prompt 200 000 tokenów całe żądanie jest rozliczane według stawek dla długiego kontekstu: 4 USD za wejście, 1 USD za zbuforowane wejście i 12 USD za wyjście za milion tokenów. Dla deweloperów poszukujących elastycznego dostępu wielomodelowego, platformy takie jak CometAPI ułatwiają integrację Grok 4.6 obok innych modeli klasy frontier, cena API to 80% ceny xAI.

Key Takeaways

  • xAI oficjalnie wydało Grok 4.6 12 sierpnia 2026 r.; wcześniejsze doniesienia o oknie wydania są teraz nieaktualne.
  • Identyfikator modelu API to , a model jest także dostępny w Cursor i Grok Build.grok-4.6
  • Jego okno kontekstu to 500K tokenów, z wejściem tekstowym i obrazowym oraz wyjściem wyłącznie tekstowym.
  • Standardowe ceny poniżej 200K tokenów w prompcie to 2 USD/M wejście, 0,50 USD/M zbuforowane wejście i 6 USD/M wyjście.
  • Prompt o 200K tokenów lub więcej uruchamia wyższe stawki dla wszystkich tokenów w tym żądaniu, a nie tylko dla tych powyżej progu.
  • Nakład rozumowania można ustawić na low, medium, high lub xhigh; jest domyślną wartością udokumentowaną.
  • Grok 4.6 dorównuje GPT-5.6 Sol w Artificial Analysis Intelligence Index (wynik 61) i pokazuje duże wzrosty względem Grok 4.5 w agentowym kodowaniu, pracy z wiedzą i zadaniach długohoryzontalnych.
  • Grok Imagine Image 2.0 to oddzielne API do generowania obrazów. Grok 4.6 rozumie obrazy, ale sam nie zwraca wygenerowanych obrazów.

Grok 4.6 Specifications and Price at a Glance

Poniższe specyfikacje są potwierdzone w dokumentacji modelu xAI oraz notatkach wydawniczych z 12 sierpnia.

SpecyfikacjaGrok 4.6
Oficjalna data wydaniaAugust 12, 2026
ID modelu APIgrok-4.6
PozycjonowanieFlagship model for coding, agents and general workloads
Okno kontekstu500,000 tokens
WejściaText and images
WyjścieText
Udokumentowany limit tekstuNo text-output limit stated by xAI
Sterowanie rozumowaniemLow, medium, high and xhigh
Domyślny wysiłek rozumowaniaHigh
Granica wiedzyFebruary 1, 2026
Natywny dostęp do APIAvailable
Dostęp w narzędziachCursor and Grok Build
Dostęp do bieżących wydarzeńRequires Web Search or X Search tools

Official xAI API pricing

Obecna tabela cen xAI API rozdziela żądania krótkokontekstowe i długokontekstowe.

Rozmiar promptuWejście za 1M tokenówZbuforowane wejście za 1M tokenówWyjście za 1M tokenów
Poniżej 200,000 tokenów$2.00$0.50$6.00
200,000 tokenów lub więcej$4.00$1.00$12.00

Próg jest szczególnie ważny dla agentów pracujących z bazami kodu. Gdy prompt żądania osiąga 200 000 tokenów, xAI nalicza stawkę dla długiego kontekstu dla wszystkich tokenów w tym żądaniu, a nie tylko części przekraczającej próg. Żądanie zawierające 199 000 tokenów w promcie może więc kosztować znacząco mniej niż zawierające 200 000, nawet jeśli ich rozmiary są niemal identyczne.

W obecnej dokumentacji cen xAI brak zniżki pakietowej dla Grok 4.6. Zespoły nie powinny zakładać, że zadania offline otrzymują zniżki dostępne dla niektórych innych modeli xAI.

What Is Grok 4.6?

Grok 4.6 to najnowszy flagowy duży model językowy SpaceXAI, wydany 12 sierpnia 2026 r. Buduje bezpośrednio na Grok 4.5 poprzez dłuższy uzupełniający przebieg szkoleniowy skoncentrowany na kuratowanych danych generowanych przez model dla zaawansowanego rozumowania i koncepcji technicznych, wysokiej jakości zbiorach inżynierskich, ulepszonym optymalizatorze oraz rozszerzonym RL dla scenariuszy kodowania i pracy z wiedzą.

Model zachowuje tę samą bazę o 1,5 biliona parametrów co poprzednik; zyski pochodzą głównie z post-treningu, a nie ze zwiększenia skali parametrów. Zaprojektowano go tak, by pozostawał skuteczny przez wiele kroków—niezależnie od tego, czy chodzi o badanie tematu, analizę dużych ilości informacji, nawigację i edycję nieznanej bazy kodu, czy przekształcenie ogólnego pomysłu w dopracowaną aplikację lub artefakt pracy. SpaceXAI podkreśla poprawione samosprawdzanie w projektach długohoryzontalnych i lepszą wydajność w pracy interaktywnej i wizualnej.

Różnica względem tradycyjnego chatbota jest istotna.

Konwencjonalny przepływ pracy LLM wygląda tak:

Prompt → Generate answer

Grok 4.6 jest projektowany pod przepływy pracy bliższe:

Goal → Plan → Research → Use tools → Modify code → Test → Evaluate → Continue

Obecne pozycjonowanie xAI podkreśla zdolność modelu do dłuższej pracy nad złożonymi projektami, działania w bazach kodu, badania nieznanych tematów, budowania aplikacji i weryfikacji własnej pracy.

To czyni Grok 4.6 szczególnie istotnym na szybko rosnącym rynku agentów kodujących i agentów autonomicznych.

What Are the Main Features of Grok 4.6?

Long-Running Agent Capability

Najważniejszą poprawą w Grok 4.6 jest koncentracja na zadaniach długotrwałych.

Zamiast optymalizować wyłącznie jednorazowe odpowiedzi, model jest zaprojektowany, by utrzymywać postęp przez wiele etapów projektu.

Typowe przykłady obejmują:

  • Budowę aplikacji
  • Debugowanie dużego repozytorium
  • Badanie nieznanego zagadnienia
  • Modyfikację kilku komponentów
  • Uruchamianie testów
  • Badanie awarii
  • Korektę implementacji
  • Sprawdzenie wyniku końcowego

To zasadniczo inny cel niż tradycyjne benchmarki poleceń.

Advanced Coding Performance

Kodowanie to jeden z najjaśniejszych obszarów poprawy w Grok 4.6.

Obecne raportowanie benchmarków daje:

  • 65,9% na DeepSWE 1.1
  • 69,9% na CursorBench 3.2
  • 61,3% na FrontierCode 1.1 Extended

Te ewaluacje są szczególnie istotne, ponieważ celują w zachowania agentów kodujących, a nie proste uzupełnianie kodu.

Poprawa z Grok 4.5 do Grok 4.6 na DeepSWE 1.1 jest szczególnie godna uwagi—wzrost z około 54% do 65,9% w raportowanym porównaniu.

Multimodal Input

Grok 4.6 obsługuje wejścia tekstowe i obrazowe, pozwalając deweloperom łączyć informacje wizualne z rozumowaniem.

Potencjalne zastosowania obejmują:

  • Debugowanie zrzutów ekranu
  • Analizę interfejsów użytkownika
  • Interpretację wykresów
  • Rozumienie dokumentów
  • Badania wizualne
  • Zadania kodowania oparte na obrazach

To czyni Grok 4.6 bardziej elastycznym niż czysto tekstowy model do kodowania.

Dostęp Groka do wyszukiwania to istotna część jego ekosystemu.

API obsługuje:

  • Wyszukiwanie w sieci
  • Wyszukiwanie w X
  • Wywoływanie funkcji
  • Wykonywanie kodu

Obecna dokumentacja API Grok 4.5 xAI potwierdza te możliwości narzędzi w środowisku Grok API.

Dla agentów badawczych oznacza to, że model może potencjalnie przejść od statycznej wiedzy wyuczonej do pozyskiwania aktualnych informacji plus rozumowanie.

Configurable Reasoning

API Grok udostępnia konfigurowalny nakład rozumowania.

Pozwala to deweloperom równoważyć:

szybkość / koszt ↔ głębokość rozumowania

W prostych zadaniach niższe rozumowanie może ograniczyć zbędne obliczenia.

W złożonych zadaniach kodowania lub badań wyższy poziom rozumowania może dać bardziej rozważne rozwiązywanie problemów.

Cost-Competitive Frontier Performance

Ceny Grok 4.6 to być może jedna z jego najsilniejszych przewag handlowych.

Raportowana standardowa cena API to:

  • 2 USD / 1M tokenów wejściowych
  • 6 USD / 1M tokenów wyjściowych

To te same ceny, co raportowano dla Grok 4.5, mimo istotnych wzrostów możliwości.

To tworzy wyjątkowo agresywną relację koszt/efektywność dla modelu klasy frontier.


How Does Grok 4.6 Perform on Benchmarks?

Najbardziej użyteczne obecne dane z benchmarków koncentrują się wokół inteligencji agentowej i kodowania.

BenchmarkGrok 4.6Co mierzy
Artificial Analysis Intelligence Index61Broad frontier-model intelligence
CursorBench 3.269.9%Wydajność agentów kodujących
DeepSWE 1.165.9%Agenci inżynierii oprogramowania
FrontierCode 1.1 Extended61.3%Zaawansowane kodowanie
GDPVal-AA v21,753 EloWydajność w zadaniach z pracy wiedzy

Wynik 61 w Artificial Analysis Intelligence Index rzekomo stawia Grok 4.6 na tym samym poziomie co GPT-5.6 Sol w tym indeksie.

Wynik 1 753 Elo w GDPVal-AA v2 jest także istotny, ponieważ GDPVal ocenia zadania profesjonalnej pracy z wiedzą, a nie tylko akademickie pytania i odpowiedzi.

The Important Benchmark Takeaway

Najmocniejszym dowodem dla Grok 4.6 nie jest pojedynczy wynik w stylu MMLU.

Profil benchmarków wskazuje na:

kodowanie + agenci + praca z wiedzą + długotrwałe wykonywanie

To dokładnie kierunek, w którym zmierza współczesny rozwój AI.

Dla serwisu takiego jak CometAPI to ważne rozróżnienie: Grok 4.6 powinien być promowany przede wszystkim jako agentowy model klasy frontier, a nie kolejny ogólny chatbot.

How does Grok 4.6 compare with its predecessor and competitors?

Grok 4.6 vs Grok 4.5

CechaGrok 4.5Grok 4.6
Główny fokusGeneral reasoning + agentsLong-running agents + coding
Kontekst500K-class deployment500K
WejścieText + imageText + image
Wyszukiwanie w sieciYesYes
Wyszukiwanie w XYesYes
Wykonywanie koduYesYes
Wywoływanie funkcjiYesYes
Cena wejścia$2/M$2/M
Cena wyjścia$6/M$6/M
DeepSWE 1.1~54%65.9%
Intelligence Index~5661

Ważne jest to, że Grok 4.6 nie wydaje się być prostym zamiennikiem poziomu cenowego dla Grok 4.5. To aktualizacja możliwości ukierunkowana mocniej na przepływy pracy agentów długohoryzontalnych.

Obecna dokumentacja Grok 4.5 xAI wymienia model w cenie 2/6 USD za milion tokenów, z konfigurowalnym rozumowaniem i obsługą narzędzi.

Comparison Table: Grok 4.6 vs Key Competitors

AspektGrok 4.6GPT-5.6 SolClaude Fable 5 / Opus 5Uwagi
AA Intelligence Index616162 / 63Wynik złożony
Wejście / Wyjście $/1M$2 / $6~$5 / $30~$5 / $25Grok dużo tańszy na wyjściu
Okno kontekstu500KUp to 1M+Often 1M
Mocne stronyAgents, coding efficiency, costBroad reasoning, codingLong-horizon, safety
Integracja z CursorNative, strongAvailableAvailableGrok zoptymalizowany pod Cursor
Efektywność turHigh (fewer steps)CompetitiveHigher step counts reportedWażne dla agentów
DostępnośćAPI + Cursor + partnersOfficial + partnersOfficial + partnersCometAPI ujednolica dostęp

Dane zaczerpnięte z ogłoszenia SpaceXAI, Artificial Analysis oraz publicznych kart modeli na 13 sierpnia 2026 r.

Obecne porównanie Artificial Analysis jest szczególnie interesujące.

Grok 4.6 rzekomo osiąga 61 w Intelligence Index, dorównując GPT-5.6 Sol. Ale ekonomia jest bardzo różna.

Dokładne ceny konkurencyjnych wariantów GPT należy sprawdzić w aktualnych cennikach dostawców przed publikacją, ale kluczowa obserwacja rynkowa jest jasna: Grok 4.6 konkuruje na poziomie benchmarków klasy frontier, utrzymując relatywnie agresywną cenę tokena.

To czyni Grok 4.6 szczególnie atrakcyjnym dla zastosowań, gdzie wykonywanie agentowe na dużą skalę uczyniłoby modele premium klasy frontier kosztownymi.

What Are the Limitations of Grok 4.6?

500K Context Is Smaller Than Some 1M-Context Competitors

Zgłoszone 500K kontekstu w Grok 4.6 jest duże, ale nie największe na rynku modeli klasy frontier.

Dla bardzo dużych repozytoriów lub ogromnych kolekcji dokumentów, model z 1M kontekstu może mieć przewagę.

Proprietary Model

W odróżnieniu od MiMo-V2.5-Pro, Grok 4.6 nie jest modelem z otwartymi wagami.

Deweloperzy nie mogą pobrać modelu i wdrożyć go niezależnie.

Benchmark Comparisons Need Care

Różne benchmarki kodowania używają różnych harnessów, promptów, narzędzi i procedur ewaluacji.

Na przykład SWE-Bench Pro jest zaprojektowany specjalnie wokół realistycznych, długohoryzontalnych problemów inżynierii oprogramowania, a wyniki mogą się znacznie różnić w zależności od szkieletu agenta.

Dlatego 69,9% na CursorBench nie należy interpretować jako „Grok 4.6 jest o 69,9% lepszy niż inny model.”

Prawidłowa interpretacja to: osiągnął ten wynik w określonej konfiguracji ewaluacji benchmarku.

Agent Cost Can Be Higher Than Token Pricing Suggests

Cena tokena 2/6 USD jest atrakcyjna, ale agent autonomiczny może zużywać ogromne liczby tokenów poprzez:

  • Wywołania narzędzi
  • Powtarzane wyszukiwania
  • Wykonywanie kodu
  • Nieudane próby
  • Długi kontekst
  • Samoweryfikację

Rzeczywista ekonomika jednostkowa zależy więc od kosztu na pomyślnie ukończone zadanie, a nie tylko kosztu za milion tokenów.

Price and Access

Oficjalne ceny (standardowy poziom, poniżej ~200K tokenów w promcie):

  • Wejście: 2,00 USD za 1M tokenów
  • Zbuforowane wejście: około 0,50 USD za 1M tokenów
  • Wyjście: 6,00 USD za 1M tokenów

Szybszy wariant jest wyceniony na dwukrotność tych stawek. Stawki mogą podwajać się dla bardzo długich kontekstów (≥200K). Silnie zalecane jest buforowanie promptów dla pętli agentów, aby utrzymać koszty na niskim poziomie.

Dostępność:

  • Cursor i Grok Build (2× wliczone użycie przez pierwszy tydzień)
  • SpaceXAI API (grok-4.6)
  • Partnerzy: OpenRouter, Vercel, Cloudflare i inni
  • SuperGrok chat/apps (przez wybór modelu)

CometAPI Recommendation: Dla deweloperów, którzy już używają (lub planują używać) wielu modeli klasy frontier, CometAPI zapewnia bezproblemowy dostęp do Grok 4.6 przez pojedynczy, zgodny z OpenAI endpoint (https://api.cometapi.com/v1). Otrzymujesz ujednolicone rozliczenia, analitykę użycia, konkurencyjne efektywne stawki w ponad 500 modelach (w tym GPT, Claude, Gemini, DeepSeek i warianty Grok) oraz możliwość przełączania modeli jedną linią kodu. Jest to szczególnie cenne przy A/B testowaniu Grok 4.6 względem innych modeli do kodowania lub agentów oraz przy budowie systemów produkcyjnych korzystających z routingu i fallbacku modeli. Zarejestruj się na cometapi.com, aby uzyskać bezpłatny klucz API i poznać katalog modeli na żywo.

Should You Switch to Grok 4.6?

Tak, jeśli:

  • Intensywnie pracujesz w Cursor lub budujesz długotrwałe agentów kodujących/pracy z wiedzą i chcesz silnej niezawodności wieloetapowej przy konkurencyjnym koszcie.
  • Ekonomia tokenów ma znaczenie—Grok 4.6 dostarcza inteligencję zbliżoną do GPT-5.6 Sol przy około jednej piątej ceny tokenów wyjściowych najdroższych opcji klasy frontier.
  • Cenisz efektywność tur (mniej kroków i tokenów do ukończenia złożonych zadań).
  • Chcesz natychmiastowego dostępu do modelu, który był explicite trenowany pod interaktywne, wizualne i agentowe przepływy pracy powszechne we współczesnym developmentcie.

Rozważ pozostanie przy innych modelach lub ich miks, jeśli:

  • Twoje główne obciążenie to czyste programowanie konkursowe lub specyficzne mocne strony zamkniętych modeli (np. niektóre scenariusze długiego kontekstu lub bezpieczeństwa Claude).
  • Wymagasz absolutnie najwyższych wyników na każdym indywidualnym benchmarku inżynierii oprogramowania, niezależnie od kosztu.
  • Potrzebujesz większych okien kontekstu niż 500K dla zadań w pojedynczym wywołaniu (niektórzy konkurenci oferują 1M+).

Większość zespołów skorzysta na ocenie Grok 4.6 obok ich obecnego stosu. Ponieważ jest dostępny przez agregatorów, takich jak CometAPI, koszt przełączenia jest niski—wystarczy zmienić nazwę modelu i zmierzyć w realnych warunkach wskaźniki ukończenia zadań, opóźnienia i koszt na własnych obciążeniach.

Conclusion

Grok 4.6 stanowi istotny krok naprzód dla SpaceXAI: inteligencja klasy frontier w kluczowych złożonych i agentowych benchmarkach, znaczące usprawnienia w długotrwałym kodowaniu i pracy z wiedzą oraz utrzymanie agresywnych cen, które podcinają wielu zamkniętych konkurentów. Jego natywna dostępność w Cursor, połączona z silną niezawodnością wieloetapową, czyni go szczególnie atrakcyjnym dla deweloperów budujących rzeczywiste agentów programistycznych i aplikacje interaktywne.

Niezależnie od tego, czy uzyskasz dostęp bezpośrednio, przez Cursor/Grok Build, czy poprzez ujednolicone bramki takie jak CometAPI, Grok 4.6 jest gotowy do produkcyjnej ewaluacji już dziś. Odwiedź oficjalne ogłoszenie pod adresem x.ai/news/grok-4-6, aby poznać pełne szczegóły i kartę modelu, przejrzyj katalog na żywo na cometapi.com, by porównać go z innymi wiodącymi modelami, i zacznij budować z nowymi możliwościami już teraz.

Primary Sources

Zawsze weryfikuj najnowsze ceny, limity stawek i wyniki benchmarków na oficjalnych stronach, ponieważ krajobraz AI szybko się zmienia.

0 wyświetleń
Sprawdzone pod kątem przejrzystości, atrybucji źródeł i aktualnej terminologii API.

Gotowy na obniżenie kosztów rozwoju AI o 20%?

Zacznij za darmo w kilka minut. Dołączone kredyty na bezpłatny okres próbny. Karta kredytowa nie jest wymagana.

Czytaj więcej