FLUX 3 and Gemini 3.7 Flash are now live on CometAPI →
ai-model/CometAPI research

Grok 4.6 is er: benchmarkresultaten op GPT-5.6-niveau & programmeerprestaties

xAI heeft Grok 4.6 uitgebracht met een contextvenster van 500,000 tokens, configureerbare redeneringsmogelijkheden, afbeeldinginvoer en API-tarieven van $2 / $6 per 1M input-/outputtokens.

CometAPI
AnnaOnderzoeksteam voor AI-modellen en API
Bijgewerkt Aug 19, 2026 13 min leestijd
Grok 4.6 is er: benchmarkresultaten op GPT-5.6-niveau & programmeerprestaties
Gebruik dit patroon

Doe de eerste API-aanroep.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL; DR xAI heeft op 12 augustus 2026 officieel Grok 4.6 uitgebracht en beschikbaar gemaakt via de xAI API, Cursor en Grok Build. Het model heeft een contextvenster van 500.000 tokens, accepteert tekst en afbeeldingen, biedt vier niveaus van redeneringsinspanning, en heeft een kennisafkapdatum van 1 februari 2026. Volgens xAI’s officiële Grok 4.6-aankondiging evenaart het model GPT-5.6 Sol op de Artificial Analysis Intelligence Index, een samengestelde score uit negen evaluaties.

API-prijzen beginnen bij $2 per miljoen invoertokens, $0.50 per miljoen gecachete invoertokens en $6 per miljoen uitvoertokens voor prompts onder 200.000 tokens. Zodra een prompt 200.000 tokens bereikt, wordt het hele verzoek gefactureerd tegen de lang-contexttarieven van $4 invoer, $1 gecachete invoer en $12 uitvoer per miljoen tokens. Voor ontwikkelaars die flexibele multi-modeltoegang zoeken, maken platforms zoals CometAPI het eenvoudig om Grok 4.6 naast andere frontier-modellen te integreren; de API-prijs is 80% van xAI’s prijs.

Key Takeaways

  • xAI bracht Grok 4.6 officieel uit op 12 augustus 2026; eerdere meldingen van het release-venster zijn nu achterhaald.
  • The API model ID is , and the model is also available in Cursor and Grok Build.grok-4.6
  • Het contextvenster is 500K tokens, met tekst- en afbeeldingsinvoer en alleen tekstuitvoer.
  • Standaardprijzen onder 200K prompttokens zijn $2/M invoer, $0.50/M gecachete invoer en $6/M uitvoer.
  • Een prompt van 200K tokens of meer activeert hogere tarieven voor alle tokens in dat verzoek, niet alleen boven de drempel.
  • De redeneringsinspanning kan worden ingesteld op low, medium, high of xhigh; is de gedocumenteerde standaard.
  • Grok 4.6 evenaart GPT-5.6 Sol op de Artificial Analysis Intelligence Index (score 61) en laat grote sprongen zien ten opzichte van Grok 4.5 in agentisch coderen, kenniswerk en langetermijntaken.
  • Grok Imagine Image 2.0 is een aparte API voor afbeeldingsgeneratie. Grok 4.6 kan afbeeldingen begrijpen maar genereert zelf geen afbeeldingen.

Grok 4.6 Specificaties en prijs in één oogopslag

De volgende specificaties zijn bevestigd in xAI’s modeldocumentatie en de release-opmerkingen van 12 augustus.

SpecificationGrok 4.6
Official release dateAugust 12, 2026
API model IDgrok-4.6
PositioningFlagship model for coding, agents and general workloads
Context window500,000 tokens
InputsText and images
OutputText
Documented text-output limitNo text-output limit stated by xAI
Reasoning controlsLow, medium, high and xhigh
Default reasoning effortHigh
Knowledge cutoffFebruary 1, 2026
Native API accessAvailable
Coding-tool accessCursor and Grok Build
Current-events accessRequires Web Search or X Search tools

Officiële xAI API-prijzen

xAI’s huidige prijzentabel voor de API scheidt short-context en long-context verzoeken.

Prompt sizeInput per 1M tokensCached input per 1M tokensOutput per 1M tokens
Below 200,000 tokens$2.00$0.50$6.00
200,000 tokens or more$4.00$1.00$12.00

De drempel is vooral belangrijk voor codebase-agents. Wanneer de prompt 200.000 tokens bereikt, rekent xAI het lang-contexttarief voor alle tokens in dat verzoek, niet alleen voor het deel boven de drempel. Een verzoek met 199.000 prompttokens kan daarom substantieel goedkoper zijn dan één met 200.000, zelfs als ze qua grootte vrijwel identiek zijn.

Er staat geen batchkorting vermeld voor Grok 4.6 in de huidige xAI-prijsdocumentatie. Teams moeten er niet van uitgaan dat offline jobs de kortingen krijgen die voor bepaalde andere xAI-modellen gelden.

Wat is Grok 4.6?

Grok 4.6 is SpaceXAI’s nieuwste vlaggenschip-groot taalmodel, uitgebracht op 12 augustus 2026. Het bouwt direct voort op Grok 4.5 door een langere aanvullende trainingsrun toe te passen die is gericht op zorgvuldig samengestelde, door het model gegenereerde data voor geavanceerde redenering en technische concepten, hoogwaardige engineeringdatasets, een verbeterde optimizer en uitgebreide reinforcement learning voor codeer- en kenniswerkscenario’s.

Het model behoudt dezelfde onderliggende basis met 1.5 biljoen parameters als zijn voorganger; de winst komt primair uit post-training en niet uit een toename van het aantal parameters. Het is specifiek ontworpen om effectief te blijven over veel stappen—of het nu gaat om onderzoek naar een onderwerp, het analyseren van grote hoeveelheden informatie, het navigeren en bewerken van een onbekende codebase, of het omzetten van een hoogover idee in een afgewerkte applicatie of werkproduct. SpaceXAI benadrukt verbeterd zelfcontrole-gedrag bij langetermijnprojecten en sterker presteren bij interactieve en visuele taken.

Het verschil met een traditionele chatbot is belangrijk.

Een conventionele LLM-workflow ziet er zo uit:

Prompt → Antwoord genereren

Grok 4.6 is ontworpen voor workflows die dichter liggen bij:

Doel → Plan → Onderzoek → Tools gebruiken → Code aanpassen → Testen → Evalueren → Doorgaan

xAI’s huidige positionering benadrukt het vermogen van het model om langer aan complexe projecten te blijven werken, over codebases heen te werken, onbekende onderwerpen te onderzoeken, applicaties te bouwen en het eigen werk te verifiëren.

Dit maakt Grok 4.6 bijzonder relevant voor de snel groeiende markt voor AI-codeagenten en autonome agenten.

Wat zijn de belangrijkste functies van Grok 4.6?

Langdurige agent-capabiliteit

De belangrijkste verbetering in Grok 4.6 is de focus op langdurige taken.

In plaats van alleen te optimaliseren voor one-shot antwoorden, is het model ontworpen om voortgang te behouden door meerdere fasen van een project.

Typische voorbeelden zijn:

  • Een applicatie bouwen
  • Een grote repository debuggen
  • Een onbekend onderwerp onderzoeken
  • Meerdere componenten aanpassen
  • Tests uitvoeren
  • Fouten onderzoeken
  • De implementatie herzien
  • Het eindresultaat controleren

Dit is een fundamenteel ander doel dan traditionele instruction-following benchmarks.

Geavanceerde codeerprestaties

Coderen is een van de duidelijkste verbeteringsgebieden van Grok 4.6.

Huidige benchmarkrapportage geeft:

  • 65,9% op DeepSWE 1.1
  • 69,9% op CursorBench 3.2
  • 61,3% op FrontierCode 1.1 Extended

Deze evaluaties zijn bijzonder relevant omdat ze zich richten op gedrag van codeagenten in plaats van eenvoudige codeaanvulling.

De verbetering van Grok 4.5 naar Grok 4.6 op DeepSWE 1.1 is vooral opmerkelijk, stijgend van ongeveer 54% naar 65,9% in de gerapporteerde vergelijking.

Multimodale invoer

Grok 4.6 ondersteunt tekst- en afbeeldingsinvoer, waardoor ontwikkelaars visuele informatie kunnen combineren met redenering.

Mogelijke toepassingen zijn:

  • Debuggen met screenshots
  • UI-analyse
  • Grafiekinterpretatie
  • Documentbegrip
  • Visueel onderzoek
  • Beeldgestuurde coderingstaken

Dit maakt Grok 4.6 flexibeler dan een puur tekstgebaseerd codeermodel.

Grok’s toegang tot zoeken is een belangrijk onderdeel van zijn ecosysteem.

De API ondersteunt:

  • Webzoekopdracht
  • X-zoekopdracht
  • Functieaanroepen
  • Code-uitvoering

xAI’s huidige Grok 4.5 API-documentatie bevestigt deze toolmogelijkheden in de Grok API-omgeving.

Voor onderzoeksagents betekent dit dat het model potentieel kan verschuiven van statische voorgetrainde kennis naar actuele-informatieopvraging plus redenering.

Configureerbare redenering

De API van Grok biedt instelbare redeneringsinspanning.

Dit laat ontwikkelaars afwegen tussen:

snelheid / kosten ↔ diepte van redenering

Voor eenvoudige taken kan lagere redenering onnodige berekening verminderen.

Voor complexe codeer- of onderzoekstaken kan hogere redenering meer doordachte probleemoplossing bieden.

Kostenefficiënte frontier-prestaties

De prijsstelling van Grok 4.6 is wellicht een van zijn sterkste commerciële voordelen.

De gerapporteerde standaard API-prijs is:

  • $2 / 1M invoertokens
  • $6 / 1M uitvoertokens

Dat is dezelfde prijs als gerapporteerd voor Grok 4.5, ondanks de aanzienlijke capaciteitsverbeteringen.

Dit creëert een ongewoon agressieve kosten/prestatie-propositie voor een frontier-model.


Hoe presteert Grok 4.6 op benchmarks?

De meest bruikbare huidige benchmarkdata zijn geconcentreerd rond agentische intelligentie en coderen.

BenchmarkGrok 4.6Wat het meet
Artificial Analysis Intelligence Index61Brede frontier-modelintelligentie
CursorBench 3.269.9%Prestaties van codeagenten
DeepSWE 1.165.9%Software-engineeringagenten
FrontierCode 1.1 Extended61.3%Geavanceerd coderen
GDPVal-AA v21,753 EloPrestaties op kenniswerktaken

De Artificial Analysis Intelligence Index-score van 61 plaatst Grok 4.6 naar verluidt op hetzelfde niveau als GPT-5.6 Sol op die index.

De GDPVal-AA v2-score van 1,753 Elo is ook significant omdat GDPVal professionele kenniswerktaken evalueert in plaats van louter academische vraag-antwoordsessies.

De belangrijkste benchmarkconclusie

Het sterkste bewijs voor Grok 4.6 is niet één enkele MMLU-achtige score.

Het benchmarkprofiel wijst op:

coderen + agents + kenniswerk + langdurige uitvoering

Precies dáárheen beweegt moderne AI-ontwikkeling.

Voor een website als CometAPI is dit een belangrijk onderscheid om te behouden: Grok 4.6 moet primair worden gepositioneerd als een agentisch frontier-model, niet als zomaar een generieke chatbot.

Hoe verhoudt Grok 4.6 zich tot zijn voorganger en concurrenten?

Grok 4.6 vs Grok 4.5

FeatureGrok 4.5Grok 4.6
Primary focusGeneral reasoning + agentsLong-running agents + coding
Context500K-class deployment500K
InputText + imageText + image
Web searchYesYes
X searchYesYes
Code executionYesYes
Function callingYesYes
Input price$2/M$2/M
Output price$6/M$6/M
DeepSWE 1.1~54%65.9%
Intelligence Index~5661

Belangrijk is dat Grok 4.6 niet lijkt op een eenvoudige prijstiernvervanging voor Grok 4.5. Het is een capaciteitsupgrade die sterker mikt op langetermijn agent-workflows.

xAI’s huidige documentatie voor Grok 4.5 vermeldt het model op $2/$6 per miljoen tokens, met instelbare redenering en toolondersteuning.

Vergelijkingstabel: Grok 4.6 vs belangrijke concurrenten

AspectGrok 4.6GPT-5.6 SolClaude Fable 5 / Opus 5Notes
AA Intelligence Index616162 / 63Composite score
Input / Output $/1M$2 / $6~$5 / $30~$5 / $25Grok far cheaper on output
Context Window500KUp to 1M+Often 1M
StrengthsAgents, coding efficiency, costBroad reasoning, codingLong-horizon, safety
Cursor IntegrationNative, strongAvailableAvailableGrok optimized for Cursor
Turn EfficiencyHigh (fewer steps)CompetitiveHigher step counts reportedImportant for agents
AvailabilityAPI + Cursor + partnersOfficial + partnersOfficial + partnersCometAPI unifies access

Gegevens afkomstig van de SpaceXAI-aankondiging, Artificial Analysis en publieke modelkaarten per 13 augustus 2026.

De huidige Artificial Analysis-vergelijking is bijzonder interessant.

Grok 4.6 scoort naar verluidt 61 op de Intelligence Index, gelijk aan GPT-5.6 Sol. Maar de economie is heel anders.

De exacte prijzen van concurrerende GPT-varianten moeten vóór publicatie worden geverifieerd aan de hand van hun huidige aanbiederstarieven, maar de kernobservatie voor de markt is duidelijk: Grok 4.6 concurreert op frontier-niveau qua benchmarks terwijl het een relatief agressieve tokenprijs handhaaft.

Dat maakt Grok 4.6 bijzonder aantrekkelijk voor toepassingen waar hoge volumes aan agentuitvoering premium frontier-modellen anders duur zouden maken.

Wat zijn de beperkingen van Grok 4.6?

500K context is kleiner dan sommige concurrenten met 1M-context

De gerapporteerde 500K-context van Grok 4.6 is groot, maar niet het grootste contextvenster op de frontier-modelmarkt.

Voor zeer grote repositories of enorme documentcollecties kan een 1M-contextmodel een voordeel hebben.

Propriëtair model

In tegenstelling tot MiMo-V2.5-Pro is Grok 4.6 geen open-weight model.

Ontwikkelaars kunnen het model niet downloaden en zelfstandig uitrollen.

Benchmarkvergelijkingen vergen zorg

Verschillende codeerbenchmarks gebruiken verschillende harnesses, prompts, tools en evaluatieprocedures.

SWE-Bench Pro is bijvoorbeeld specifiek ontworpen rond realistische langetermijn-software-engineeringproblemen, en benchmarkresultaten kunnen substantieel variëren afhankelijk van het agentframewerk.

Daarom moet 69,9% op CursorBench niet worden geïnterpreteerd als “Grok 4.6 is 69,9% beter dan een ander model.”

De juiste interpretatie is dat het die score behaalde onder de specifieke evaluatie-opzet van de benchmark.

Agentkosten kunnen hoger zijn dan de tokenprijs suggereert

De tokenprijs van $2/$6 is aantrekkelijk, maar een autonome agent kan enorme aantallen tokens verbruiken via:

  • Toolaanroepen
  • Herhaalde zoekopdrachten
  • Code-uitvoering
  • Mislukte pogingen
  • Lange context
  • Zelfverificatie

De werkelijke eenheidseconomie hangt daarom af van de kosten per succesvol voltooide taak, niet simpelweg van kosten per miljoen tokens.

Prijs en toegang

Officiële prijzen (standaardniveau, onder ~200K prompttokens):

  • Invoer: $2.00 per 1M tokens
  • Gecachete invoer: ongeveer $0.50 per 1M tokens
  • Uitvoer: $6.00 per 1M tokens

Een snellere variant is geprijsd op het dubbele van deze tarieven. Tarieven kunnen verdubbelen voor zeer lange contexten (≥200K). Promptcaching wordt sterk aanbevolen voor agentloops om kosten laag te houden.

Beschikbaarheid:

  • Cursor en Grok Build (2× inbegrepen gebruik voor de eerste week)
  • SpaceXAI API (grok-4.6)
  • Partners: OpenRouter, Vercel, Cloudflare en anderen
  • SuperGrok chat/apps (via modelkiezer)

CometAPI-aanbeveling: Voor ontwikkelaars die al meerdere frontier-modellen gebruiken (of willen gebruiken), biedt CometAPI naadloze toegang tot Grok 4.6 via één OpenAI-compatibel endpoint (https://api.cometapi.com/v1). Je krijgt uniforme facturering, gebruiksanalyses, concurrerende effectieve tarieven voor 500+ modellen (inclusief GPT, Claude, Gemini, DeepSeek en Grok-varianten) en de mogelijkheid om met één regelaanpassing van model te wisselen. Dit is vooral waardevol bij A/B-testen van Grok 4.6 tegenover andere codeer- of agentmodellen of bij het bouwen van productiesystemen die profiteren van modelroutering en fallback. Meld je aan op cometapi.com om een gratis API-sleutel te verkrijgen en de live modelcatalogus te verkennen.

Moet je overstappen op Grok 4.6?

Ja, als:

  • Je intensief in Cursor werkt of langdurige codeer-/kennisagents bouwt en sterke meerstapsbetrouwbaarheid tegen concurrerende kosten wilt.
  • Token-economie belangrijk is—Grok 4.6 levert bijna pariteit in intelligentie met GPT-5.6 Sol tegen ongeveer een vijfde van de uitvoertokenprijs van de duurste frontier-opties.
  • Je waarde hecht aan beurtenefficiëntie (minder stappen en tokens om complexe taken te voltooien).
  • Je direct toegang wilt tot een model dat expliciet is getraind voor de interactieve, visuele en agentische workflows die in moderne ontwikkeling gangbaar zijn.

Overweeg te blijven bij of te mixen met andere modellen als:

  • Je primaire workload pure competitieve programmering is of specifieke strengths van gesloten modellen (bijv. bepaalde Claude long-context- of safety-getunede scenario’s).
  • Je de absoluut hoogste scores op elke individuele software-engineeringbenchmark vereist, ongeacht de kosten.
  • Je grotere contextvensters dan 500K nodig hebt voor single-call workloads (sommige concurrenten bieden 1M+).

De meeste teams profiteren ervan om Grok 4.6 naast hun huidige stack te evalueren. Omdat het beschikbaar is via aggregators zoals CometAPI, zijn de overstapkosten laag—verander simpelweg de modelnaam en meet de voltooiingspercentages van real-world taken, latency en kosten op je eigen workloads.

Conclusie

Grok 4.6 vormt een aanzienlijke stap voorwaarts voor SpaceXAI: frontier-niveau intelligentie op belangrijke samengestelde en agentische benchmarks, betekenisvolle verbeteringen in langdurige codeer- en kenniswerkprestaties, en een voortzetting van agressieve prijsstelling die veel gesloten concurrenten onderbiedt. De native beschikbaarheid in Cursor, gecombineerd met sterke meerstapsbetrouwbaarheid, maakt het bijzonder aantrekkelijk voor ontwikkelaars die echte softwareagents en interactieve applicaties bouwen.

Of je er nu direct toegang toe hebt, via Cursor/Grok Build, of via een unified gateway zoals CometAPI: Grok 4.6 is vandaag klaar voor productie-evaluatie. Bezoek de officiële aankondiging op x.ai/news/grok-4-6 voor alle details en de modelkaart, verken de live catalogus op cometapi.com om het model naast andere toonaangevende modellen te vergelijken en begin direct te bouwen met de nieuwe mogelijkheden.

Primaire bronnen

Controleer altijd de nieuwste prijzen, tarieflimieten en benchmarkcijfers op de officiële pagina’s, aangezien het AI-landschap zich snel ontwikkelt.

Verder leren

Koppel dit artikel aan de volgende beslissing.

Alle onderwerpen bekijken
Gepubliceerd op Aug 13, 2026
Laatst bijgewerkt Aug 19, 2026
64 weergaven
Gecontroleerd op duidelijkheid, bronvermelding en actuele API-terminologie.

Klaar om de AI-ontwikkelingskosten met 20% te verlagen?

Start gratis in enkele minuten. Gratis proeftegoeden inbegrepen. Geen creditcard vereist.

Lees Meer