TL;DR
Grok 4.7 is SpaceXAI's frontier model voor codering, agent-werkstromen en professioneel kenniswerk, uitgebracht op 21 september 2026. Het combineert een contextvenster van 500.000 tokens, tekst- en beeldinput, configureerbaar redeneren, function calling, web- en X-zoekopdrachten en code-uitvoering.
Voor prompts onder 200.000 tokens vermeldt de officiële xAI API $2 per miljoen inputtokens, $0,50 per miljoen gecachede inputtokens en $6 per miljoen outputtokens. CometAPI vermeldt Grok 4.7 momenteel op $1,60 input, $0,40 gecachede input en $4,80 output per miljoen tokens voor dezelfde laag—een korting van 20% ten opzichte van de officiële tarieven op de modelpagina.
De praktische waardepropositie is niet universeel benchmarkleiderschap. Grok 4.7 is het meest overtuigend wanneer een workload engineeringtaken, lange agentloops, toolgebruik, grote werkcontexten en gevoeligheid voor outputtokenkosten combineert. Teams moeten het valideren op hun eigen repositories en werkstromen voordat ze productieverkeer routeren.
Belangrijkste punten
- Grok 4.7 gebruikt een groter basismodel dan Grok 4.6, langere reinforcement learning op moeilijkere multi-uur taken en sterkere zelfverificatie.
- De API ondersteunt een contextvenster van 500.000 tokens, tekst- en beeldinput, tekstoutput, vier redeneringsniveaus, gestructureerde output, function calling, web- en X-zoekopdrachten en code-uitvoering.
- SpaceXAI rapporteert 46,3% op CursorBench 4.0, 71,0% op DeepSWE v1.1 en 38,0% op Terminal-Bench 4.0. Dit zijn door de leverancier gepubliceerde resultaten, geen bewijs van universeel leiderschap.
- CometAPI vermeldt Grok 4.7 als beschikbaar, met een OpenAI-compatibele endpoint en prijzen die 20% lager liggen dan de officiële xAI-tarieven in de huidige catalogus.
- Kies Grok 4.7 voor kostengevoelige engineeringagents en aanhoudend toolgebruik; kies alternatieven wanneer zeer lange context of een benchmark-kritisch domein zwaarder weegt dan de stukprijs.
Wat is Grok 4.7?
Grok 4.7 is SpaceXAI's nieuwste frontier large language model, gepositioneerd voor codering, autonome agenttaken en professioneel kenniswerk. De release richt zich op taken die aanhoudende interactie, toolgebruik, verificatie en revisie vereisen, in plaats van alleen een eenmalig antwoord.
SpaceXAI zegt dat Grok 4.7 is getraind met een langere reinforcement-learningrun op een moeilijkere mix van taken, met de nadruk op problemen die vele uren kunnen duren. Deze trainingsrichting maakt het bijzonder relevant voor repository-niveau software-engineering, debugging, research, documentcreatie, engineeringanalyse en meerstapsautomatisering.
Hoe verschilt Grok 4.7 van—en is het beter dan—Grok 4.6?
Een groter basismodel
Grok 4.7 schakelt over naar een groter basismodel dan Grok 4.6. SpaceXAI heeft geen definitief openbaar aantal parameters bekendgemaakt, dus de verdedigbare conclusie is een grotere basiscapaciteit—geen specifiek parametergetal.
Langere reinforcement learning op moeilijkere taken
De reinforcement-learningfase is verlengd en verschoven naar moeilijkere, langetermijnproblemen. SpaceXAI benadrukt taken die uren werk kunnen vergen, in lijn met autonome codering, research en professionele agent-werkstromen.
Sterkere zelfverificatie
Grok 4.7 is getraind om eigen werk zorgvuldiger te inspecteren. Dat is belangrijk in software-engineering, omdat een betrouwbare agent herhaaldelijk moet inspecteren, aanpassen, testen, fouten diagnosticeren, herzien en valideren—niet alleen een eerste antwoord genereren.
Gemeten verbeteringen ten opzichte van Grok 4.6
| Dimension | Grok 4.6 | Grok 4.7 | Change |
|---|---|---|---|
| CursorBench 4.0 | 40,4% | 46,3% | +5,9 pts |
| DeepSWE v1.1 | 65,2% | 71,0% | +5,8 pts |
| EEBench | 53,0% | 64,0% | +11,0 pts |
| AA Briefcase v1.1 | 1,546 | 1,657 | +111 |
| Terminal-Bench 4.0 | 20,3% | 38,0% | +17,7 pts |
| Harvey Legal Agent Benchmark | 15,8% | 19,6% | +3,8 pts |
| HealthBench Professional | 48,5% | 56,7% | +8,2 pts |
Over de gepubliceerde launchesuite heen verbetert Grok 4.7 ten opzichte van Grok 4.6 in elk vermeld resultaat. De grootste absolute winst is op Terminal-Bench 4.0, consistent met de nadruk van de release op langlopende commandline- en toolgebaseerde workflows. Deze cijfers blijven door de leverancier gepubliceerd en moeten worden getest op echte taken voordat een migratiebeslissing wordt genomen.
Hoe goed is Grok 4.7 op benchmarks?
De lanceerevaluatie van SpaceXAI bestrijkt software-engineering, terminalwerk, professionele kantoortaken, juridisch werk, klinisch redeneren en elektrotechniek. Dit zijn door de leverancier gepubliceerde resultaten en moeten worden gevalideerd tegen productie-workloads voordat inkoop- of routeringsbeslissingen worden genomen.
| Benchmark | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| CursorBench 4.0 | 46,3% | 40,4% | 41,7% | 51,8% |
| DeepSWE v1.1 | 71,0%* | 65,2% | 72,7% | 70,0% |
| EEBench | 64,0% | 53,0% | 39,4% | 56,4% |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38,0% | 20,3% | 37,3% | 57,9% |
| Harvey Legal Agent Benchmark | 19,6% | 15,8% | 2,5% | 6,7% |
| HealthBench Professional | 56,7% | 48,5% | 60,5% | 62,1% |
In de Grok 4.7-lanceringsresultaten markeert SpaceXAI de 71,0% DeepSWE v1.1-score als hoge redeneersinspanning.
De lanceeraankondiging onthult niet elke per-benchmarkharnas, toolconfiguratie, run-count of evaluatieomgeving. Behandel deze waarden als door de leverancier gepubliceerde resultaten en valideer het model op je eigen repositories, tools, latentiedoelen en faalcriteria voordat je productiewerk routeert.
Wat laat het benchmarkprofiel van Grok 4.7 zien?
Software-engineering
CursorBench 4.0 stijgt van 40,4% op Grok 4.6 naar 46,3% op Grok 4.7, terwijl DeepSWE v1.1 stijgt van 65,2% naar 71,0%. Dit ondersteunt de positionering van Grok 4.7 als een model voor codeeragents in plaats van alleen conversatiële codeerassistentie.
Langlopend terminalwerk
Terminal-Bench 4.0 toont een van de grootste generatieveranderingen: 20,3% voor Grok 4.6 versus 38,0% voor Grok 4.7. De absolute winst van 17,7 punten is consistent met de nadruk van SpaceXAI op reinforcement learning met langere horizon en zelfverificatie.
Elektrotechniek
Op EEBench bereikt Grok 4.7 64,0%, vergeleken met 53,0% voor Grok 4.6. Onder de gepubliceerde vergelijkingen is dit een van de sterkste relatieve resultaten van Grok 4.7.
Professioneel kenniswerk
AA Briefcase v1.1 stijgt van 1,546 naar 1,657. Deze taken zijn ontworpen om meer-uur professioneel werk te weerspiegelen met artefacten zoals documenten, presentaties, analyses en andere gestructureerde deliverables.
Grok 4.7 vs GPT-5.6 Sol vs Fable 5.1: hoe vergelijken ze?
Prijscontroles bij de eigen providers: OpenAI vermeldt GPT-5.6 Sol op $4 per miljoen inputtokens en $20 per miljoen outputtokens, terwijl Anthropic Claude Fable 5.1 vermeldt op $10 per miljoen inputtokens en $50 per miljoen outputtokens.
| Dimension | Grok 4.7 | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Primary positioning | Codering, agenttaken, kenniswerk | Complex professioneel redeneren en codering | Langlopende agents, codering en kenniswerk |
| Context window | 500,000 tokens | 1,050,000 tokens | 1,000,000 tokens |
| Modalities | Tekst- en beeldinput; tekstoutput | Tekst- en beeldinput; tekstoutput | Tekst- en beeldinput; tekstoutput |
| Reasoning control | Low, medium, high, xhigh | None through max | Adaptive thinking met configureerbare inspanning |
| Provider API status | Beschikbaar op de publieke xAI API | Beschikbaar via OpenAI Chat Completions and Responses | Beschikbaar via de Claude API en ondersteunde cloudmarktplaatsen |
| Input price / 1M tokens | $2 | $4 | $10 |
| Output price / 1M tokens | $6 | $20 | $50 |
| CursorBench 4.0 | 46,3% | 41,7% | 51,8% |
| DeepSWE v1.1 | 71,0% | 72,7% | 70,0% |
| Best fit | Prijsgevoelige engineeringagents en aanhoudend toolgebruik | Breed professioneel redeneren met zeer lange context | Maximale-capaciteit langlopende agent- en kennisworkflows |
Welk model moet je kiezen?
- Kies Grok 4.7 wanneer engineeringworkloads, aanhoudend toolgebruik, configureerbaar redeneren en lagere outputtokenkosten prioriteit hebben. Het is bijzonder aantrekkelijk voor repositoryagents, terminalworkflows en onderzoek met grote context dat onder de 200K-prijsdrempel blijft.
- Kies GPT-5.6 Sol wanneer de taak breder professioneel redeneren vereist, een contextvenster boven één miljoen tokens, of wanneer het sterkere resultaat op een bedrijfskritische evaluatie zoals DeepSWE of klinisch redeneren in je eigen harnas is gevalideerd.
- Kies Claude Fable 5.1 wanneer maximale langlopende agentprestaties, codekwaliteit, terminaluitvoering of klinisch redeneren de hogere tokenprijs rechtvaardigen.
- Gebruik modelroutering wanneer workloads variëren. Routeer routinematige engineering en hoge-volume agentstappen naar het meest kostenefficiënte gekwalificeerde model, en reserveer een duurder model voor taken waar gemeten succescijfers de premie rechtvaardigen.
De juiste keuze hangt af van end-to-end taaksucces, latentie, retries, nauwkeurigheid van toolcalls en menselijke naverwerking—niet van één enkele benchmark of een headline tokenprijs.
Wat kost de Grok 4.7 API?
De onderstaande tabel vergelijkt de officiële xAI-tarieven met de prijzen die op 22 september 2026 op de Grok 4.7-modelpagina van CometAPI worden weergegeven. CometAPI vermeldt een korting van 20%; verifieer live prijzen vóór productie omdat gatewayprijzen en promotionele voorwaarden kunnen veranderen.
| Prompt tier | Price type | xAI official | CometAPI | Difference |
|---|---|---|---|---|
| Below 200K prompt tokens | Input / 1M | $2.00 | $1.60 | 20% lower |
| Cached input / 1M | $0.50 | $0.40 | 20% lower | |
| Output / 1M | $6.00 | $4.80 | 20% lower | |
| Above 200K prompt tokens | Input / 1M | $4.00 | $3.20 | 20% lower |
| Cached input / 1M | $1.00 | $0.80 | 20% lower | |
| Output / 1M | $12.00 | $9.60 | 20% lower |
Standaardcontext-prijzen voor prompts tot 200.000 tokens
Voor aanvragen waarvan de prompt niet meer dan 200.000 tokens bedraagt, kost Grok 4.7 $2 per miljoen inputtokens, $0,50 per miljoen gecachede inputtokens en $6 per miljoen outputtokens. Gecachede input is de goedkoopste categorie, dus applicaties met herhaalde systeeminstructies of herbruikbare context kunnen kosten verlagen wanneer die tokens voor caching in aanmerking komen.
Een eenvoudig voorbeeld: een aanvraag met 100.000 ongecachede inputtokens en 10.000 outputtokens kost ongeveer $0,26 vóór eventuele andere platformkosten: $0,20 voor input plus $0,06 voor output.
Lang-contextprijzen boven 200.000 prompttokens
Zodra de prompt 200.000 tokens overschrijdt, verdubbelen de tarieven naar $4 per miljoen inputtokens, $1 per miljoen gecachede inputtokens en $12 per miljoen outputtokens. De hogere laag is van toepassing vanwege de promptlengte, dus teams moeten de opgebouwde gespreksgeschiedenis, tooltraces, opgehaalde documenten en repositorycontext monitoren voordat ze elke aanvraag verzenden.
De praktische kostendecisie draait daarom niet alleen om hoeveel tokens een taak gebruikt, maar ook of de prompt de grens van 200.000 tokens overschrijdt. Het samenvatten van voltooid werk, het verwijderen van verouderde tooloutput en het alleen ophalen van de meest relevante bestanden kan geschikte workloads in de standaardlaag houden zonder noodzakelijke context op te offeren.
De SpaceXAI releasenotes documenteren deze drempel. Productiebudgetten moeten ook rekening houden met retries, agentloops, mislukte toolcalls en outputlengte, in plaats van providers alleen te vergelijken op hun headline inputtokenprijs.
Wat maakt Grok 4.7 nuttig voor AI-agents?
- 500K contextvenster: Bevat aanzienlijke broncode, specificaties, tooloutput, logs en gespreksgeschiedenis in één werkcontext. Dit is nuttig voor repository-schaalcodering en analyse van meerdere documenten, hoewel context nog steeds actief gesnoeid moet worden.
- Configureerbaar redeneren: Applicaties kunnen low, medium, high of xhigh inspanning kiezen, waarbij latentie en compute worden ingeruild voor dieper redeneren afhankelijk van de taakmoeilijkheid.
- Function calling en gestructureerde output: Agents kunnen databases bevragen, tests uitvoeren, documenten inspecteren, interne API’s aanroepen en machineleesbare resultaten retourneren.
- Web- en X-zoekopdrachten: Zoektools kunnen actuele informatie ophalen wanneer de trainingsdata van het model onvoldoende zijn. Opgehaalde inhoud moet nog steeds als niet-vertrouwde input worden behandeld en geverifieerd.
- Code-uitvoering: Het model kan berekeningen valideren, data transformeren en gegenereerde oplossingen testen in plaats van uitsluitend op taalmodel-inferentie te vertrouwen.
- Focus op langetermijnworkflows: De training met nadruk op multi-uur taken, contextbeheer en zelfverificatie richt zich op agentloops die tooltraces accumuleren en herstel na falen vereisen.
Hoe verbetert Grok 4.7 de veiligheid?
SpaceXAI zegt dat Grok 4.7 een volledig nieuwe safeguardstack introduceert en rapporteert sterkere jailbreakresistentie en dual-use-veiligheid. In de lanceeraankondiging rapporteert het bedrijf 62,4% op LatchBio’s biosafety-benchmark en zegt het dat slechts 3,3% van risicovolle dual-use-prompts werd doorgelaten op HackerBench v0.3.
Deze cijfers zijn door de leverancier gepubliceerde evaluaties. Ze zijn nuttig om de releaseclaims te begrijpen, maar moeten niet worden beschouwd als een universele maatstaf voor veiligheidsprestaties in de echte wereld.
Hoe kunnen ontwikkelaars de Grok 4.7 API gebruiken?
Grok 4.7 is momenteel beschikbaar via CometAPI onder het model-ID grok-4.7. CometAPI biedt een OpenAI-compatibele endpoint, één API-sleutel en factureringsworkflow over meerdere modelproviders, eenvoudiger side-by-side modeltesting en routering, en momenteel vermelde tokenprijzen die 20% lager zijn dan de officiële xAI-tarieven. Bevestig vóór productie het live modelpagina-adres, endpointgezondheid, ondersteunde parameters, prijzen en vereisten voor gegevensverwerking.
CometAPI request example:
curl "https://api.cometapi.com/v1/responses" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-d '{
"model": "grok-4.7",
"input": "Explain how a distributed task queue handles worker failure."
}'
Is Grok 4.7 het waard om naar over te stappen?
Voor bestaande Grok 4.6-gebruikers die afhankelijk zijn van codeeragents of langlopende professionele workflows, is Grok 4.7 een materiële upgradekandidaat omdat de gelanceerde benchmarkset in elke gerapporteerde dimensie verbetert, terwijl de standaard tokenprijzen op hetzelfde $2/$6-niveau blijven onder de lang-contextdrempel.
Voor gebruikers van andere frontiermodellen is de beslissing workload-specifiek. Grok 4.7 is vooral interessant wanneer outputtokenkosten, engineeringworkloads, grote contexten en aanhoudend toolgebruik belangrijk zijn. Waar een ander model sterker is op een kritisch domein, kan modelroutering rationeler zijn dan elk model door één provider te vervangen.
Conclusie
Grok 4.7 is meer dan een routinematige numerieke update van Grok 4.6. De release is expliciet georiënteerd op langlopend werk uitgevoerd via tools, herhaalde verificatie, grote contexten en meerdere uitvoeringsstappen.
De sterkste generatieverbeteringen verschijnen waar die trainingsrichting ertoe zou moeten doen: Terminal-Bench 4.0 stijgt van 20,3% naar 38,0%, EEBench van 53,0% naar 64,0% en CursorBench 4.0 van 40,4% naar 46,3%, terwijl de standaardprijzen onder de 200K-promptsdrempel op $2/M input en $6/M output blijven.
De praktische waardepropositie is dus niet “Grok 4.7 wint elke benchmark.” Het is dat Grok 4.7 de kloof verkleint tussen agentcapaciteit op frontier-niveau en goedkoper inferentiegebruik, waardoor het vooral relevant is voor codeeragents, onderzoekssystemen en professionele workflows die vele stappen moeten doorlopen in plaats van één keer te antwoorden.
