Claude Haiku 5.5 and Nano Banana 2.1 are now live on CometAPI →
technology/CometAPI research

Grok 4.7: Benchmarks, priser, funktioner og API-adgang

Lær, hvad Grok 4.7 er, herunder dets 500K kontekstvindue, benchmarks, priser, ræsonneringstilstande, agentkapaciteter, sammenligning med Grok 4.6 og adgang.

CometAPI
Deon GoodwinForskningshold for AI-modeller og API
Opdateret Sep 22, 2026 11 min. læsning
Grok 4.7: Benchmarks, priser, funktioner og API-adgang
Brug dette mønster

Lav det første API-kald.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Grok 4.7 er SpaceXAI’s frontier-model til kodning, agentiske workflows og professionelt vidensarbejde, udgivet den 21. september 2026. Den kombinerer et 500,000-token kontekstvindue, tekst- og billedinput, konfigurerbar ræsonnering, funktionskald, web- og X-søgning samt kodeeksekvering.

For prompts under 200,000 tokens angiver den officielle xAI API $2 pr. million inputtokens, $0.50 pr. million cachede inputtokens og $6 pr. million outputtokens. CometAPI viser i øjeblikket Grok 4.7 til $1.60 input, $0.40 cachet input og $4.80 output pr. million tokens for samme niveau—en 20% reduktion i forhold til de officielle satser vist på modelens side.

Den praktiske værdiforskel er ikke universelt benchmark-lederskab. Grok 4.7 er mest overbevisende, når en arbejdsbelastning kombinerer ingeniøropgaver, lange agentloops, værktøjsbrug, store arbejdskontekster og følsomhed over for outputtoken-omkostninger. Teams bør validere den på egne repositories og workflows før produktionsrouting.

Vigtigste pointer

  • Grok 4.7 bruger en større basismodel end Grok 4.6, længere reinforcement learning på sværere fler-timers opgaver og stærkere selvverificering.
  • API’et understøtter et 500,000-token kontekstvindue, tekst- og billedinput, tekstoutput, fire ræsonneringsniveauer, struktureret output, funktionskald, web- og X-søgning samt kodeeksekvering.
  • SpaceXAI rapporterer 46.3% på CursorBench 4.0, 71.0% på DeepSWE v1.1 og 38.0% på Terminal-Bench 4.0. Dette er leverandørpublicerede resultater, ikke bevis for universelt lederskab.
  • CometAPI viser Grok 4.7 som tilgængelig med en OpenAI-kompatibel endpoint og priser 20% under de officielle xAI-satser vist i den aktuelle katalog.
  • Vælg Grok 4.7 til omkostningsfølsomme ingeniøragenter og vedvarende værktøjsbrug; vælg alternativer, når meget lang kontekst eller et benchmark-kritisk domæne betyder mere end enhedspris.

Hvad er Grok 4.7?

Grok 4.7 er SpaceXAI’s nyeste frontier-stor sprogmodel, positioneret til kodning, autonome agentopgaver og professionelt vidensarbejde. Udgivelsen fokuserer på opgaver, der kræver vedvarende interaktion, værktøjsbrug, verifikation og revision frem for kun one-shot-svar.

SpaceXAI siger, at Grok 4.7 blev trænet med en længere reinforcement-learning-kørsel på en sværere blanding af opgaver, vægtet mod problemer, der kan tage mange timer at fuldføre. Denne træningsretning gør den særlig relevant for repository-niveau software engineering, debugging, research, dokumentskabelse, ingeniøranalyse og flertrins-automatisering.

Hvordan adskiller Grok 4.7 sig fra—og er bedre end—Grok 4.6?

En større basismodel

Grok 4.7 skifter til en større basismodel end Grok 4.6. SpaceXAI har ikke offentliggjort et endeligt offentligt parameterantal, så den forsvarlige konklusion er øget basismodelkapacitet—ikke et specifikt parameterestimat.

Længere reinforcement learning på sværere opgaver

Reinforcement-learning-stadiet blev forlænget og flyttet mod sværere, længere-horisont-problemer. SpaceXAI understreger opgaver, der kan kræve timers arbejde, i tråd med den autonome kodning, research og professionelle agentworkflows.

Stærkere selvverificering

Grok 4.7 er trænet til at inspicere sit eget arbejde mere omhyggeligt. Det er vigtigt i software engineering, fordi en pålidelig agent skal inspicere, ændre, teste, diagnosticere fejl, revidere og validere gentagne gange—ikke blot generere et første svar.

Målte forbedringer over Grok 4.6

DimensionGrok 4.6Grok 4.7Ændring
CursorBench 4.040.4%46.3%+5.9 pts
DeepSWE v1.165.2%71.0%+5.8 pts
EEBench53.0%64.0%+11.0 pts
AA Briefcase v1.11,5461,657+111
Terminal-Bench 4.020.3%38.0%+17.7 pts
Harvey Legal Agent Benchmark15.8%19.6%+3.8 pts
HealthBench Professional48.5%56.7%+8.2 pts

På tværs af den offentliggjorte launch-suite forbedrer Grok 4.7 sig over Grok 4.6 i hvert listet resultat. Den største absolutte gevinst er på Terminal-Bench 4.0, i tråd med udgivelsesfokus på langvarige kommandolinje- og værktøjsworkflows. Tallene er leverandørpublicerede og bør testes mod reelle opgaver før en migrationsbeslutning.

Hvor god er Grok 4.7 på benchmarks?

SpaceXAI’s launch-evaluering dækker software engineering, terminalarbejde, professionelle kontoropgaver, juridisk arbejde, klinisk ræsonnering og elektroteknik. Dette er leverandørpublicerede resultater og bør valideres mod produktionsarbejdsbelastninger før indkøb eller routingbeslutninger.

BenchmarkGrok 4.7 xHighGrok 4.6 HighGPT-5.6 Sol MaxFable 5.1 Max
CursorBench 4.046.3%40.4%41.7%51.8%
DeepSWE v1.171.0%*65.2%72.7%70.0%
EEBench64.0%53.0%39.4%56.4%
AA Briefcase v1.11,6571,5461,4871,678
Terminal-Bench 4.038.0%20.3%37.3%57.9%
Harvey Legal Agent Benchmark19.6%15.8%2.5%6.7%
HealthBench Professional56.7%48.5%60.5%62.1%

I sine Grok 4.7-lanceringsresultater markerer SpaceXAI 71.0% DeepSWE v1.1-scoren som høj ræsonneringsindsats.

Lanceringsmeddelelsen oplyser ikke hvert per-benchmark-harness, værktøjskonfiguration, antal kørsler eller evalueringsmiljø. Betragt disse værdier som leverandørpublicerede resultater, og valider modellen på jeres egne repositories, værktøjer, latenstargets og fejlkriterier før routing af produktionsarbejde.

Hvad viser Grok 4.7’s benchmarkprofil?

Software engineering

CursorBench 4.0 stiger fra 40.4% på Grok 4.6 til 46.3% på Grok 4.7, mens DeepSWE v1.1 stiger fra 65.2% til 71.0%. Dette understøtter Grok 4.7’s positionering som en model til kodningsagenter snarere end kun samtalebaseret kodningshjælp.

Langvarigt terminalarbejde

Terminal-Bench 4.0 viser en af de største generationsændringer: 20.3% for Grok 4.6 mod 38.0% for Grok 4.7. Den absolutte gevinst på 17.7 point er i tråd med SpaceXAI’s fokus på længere-horisont reinforcement learning og selvverificering.

Elektroteknik

På EEBench når Grok 4.7 64.0%, sammenlignet med 53.0% for Grok 4.6. Blandt de offentliggjorte sammenligninger er dette et af Grok 4.7’s stærkeste relative resultater.

Professionelt vidensarbejde

AA Briefcase v1.1 stiger fra 1,546 til 1,657. Disse opgaver er designet til at afspejle fler-timers professionelt arbejde med artefakter som dokumenter, præsentationer, analyser og andre strukturerede leverancer.

Grok 4.7 vs GPT-5.6 Sol vs Fable 5.1: Hvordan sammenlignes de?

Udbydernative prischecks: OpenAI angiver GPT-5.6 Sol til $4 pr. million inputtokens og $20 pr. million outputtokens, mens Anthropic angiver Claude Fable 5.1 til $10 pr. million inputtokens og $50 pr. million outputtokens.

DimensionGrok 4.7GPT-5.6 SolClaude Fable 5.1
Primær positioneringKodning, agentiske opgaver, vidensarbejdeKompleks professionel ræsonnering og kodningLangvarige agenter, kodning og vidensarbejde
Kontekstvindue500,000 tokens1,050,000 tokens1,000,000 tokens
ModaliteterTekst- og billedinput; tekstoutputTekst- og billedinput; tekstoutputTekst- og billedinput; tekstoutput
RæsonneringskontrolLav, mellem, høj, xhighIngen til maxAdaptiv tænkning med konfigurerbar indsats
Udbyder-API-statusTilgængelig på den offentlige xAI APITilgængelig via OpenAI Chat Completions og ResponsesTilgængelig via Claude API og understøttede cloud-markedspladser
Inputpris / 1M tokens$2$4$10
Outputpris / 1M tokens$6$20$50
CursorBench 4.046.3%41.7%51.8%
DeepSWE v1.171.0%72.7%70.0%
Bedst egnetPrissensitive ingeniøragenter og vedvarende værktøjsbrugBred professionel ræsonnering med meget lang kontekstMaksimal ydeevne for langvarige agenter og vidensworkflows

Hvilken model skal du vælge?

  • Vælg Grok 4.7 når ingeniørarbejdsbelastninger, vedvarende værktøjsbrug, konfigurerbar ræsonnering og lavere outputtoken-omkostning er prioriteten. Den er særligt attraktiv til repository-agenter, terminalworkflows og forskning med stor kontekst, der holder sig under 200K-pragten.
  • Vælg GPT-5.6 Sol når opgaven kræver bredere professionel ræsonnering, et kontekstvindue over én million tokens, eller når dens stærkere resultat på en forretningskritisk evaluering som DeepSWE eller klinisk ræsonnering er valideret i jeres eget setup.
  • Vælg Claude Fable 5.1 når maksimal ydeevne for langvarige agenter, kodekvalitet, terminaleksekvering eller klinisk ræsonnering retfærdiggør højere tokenpris.
  • Brug modelrouting når arbejdsbelastninger varierer. Rout rutineprægede ingeniøropgaver og højvolumen agenttrin til den mest omkostningseffektive kvalificerede model, og reserver en dyrere model til opgaver, hvor målte succesrater retfærdiggør præmien.

Det korrekte valg afhænger af end-to-end opgavesucces, latenstid, retrys, værktøjskaldnøjagtighed og menneskelig rework—ikke af et enkelt benchmark eller en overskrifts-tokenrate.

Hvad koster Grok 4.7 API’et?

Tabellen nedenfor sammenligner de officielle xAI-satser med priserne vist på CometAPI’s Grok 4.7-modelside den 22. september 2026. CometAPI angiver en 20% rabat; verificér live-priser før produktion, da gatewaypriser og kampagnevilkår kan ændre sig.

PromptniveauPristypexAI officielCometAPIForskel
Under 200K prompttokensInput / 1M$2.00$1.6020% lavere
Cachet input / 1M$0.50$0.4020% lavere
Output / 1M$6.00$4.8020% lavere
Over 200K prompttokensInput / 1M$4.00$3.2020% lavere
Cachet input / 1M$1.00$0.8020% lavere
Output / 1M$12.00$9.6020% lavere

Standardkontekstpriser for prompts op til 200,000 tokens

For forespørgsler, hvis prompt ikke overstiger 200,000 tokens, koster Grok 4.7 $2 pr. million inputtokens, $0.50 pr. million cachede inputtokens og $6 pr. million outputtokens. Cachet input er den billigste kategori, så applikationer med gentagne systeminstruktioner eller genbrugelig kontekst kan reducere omkostninger, når disse tokens kvalificerer til caching.

Som et simpelt eksempel vil en forespørgsel med 100,000 ikke-cachede inputtokens og 10,000 outputtokens koste ca. $0.26 før andre platformafgifter: $0.20 for input plus $0.06 for output.

Langkontekstpriser over 200,000 prompttokens

Når prompten overstiger 200,000 tokens, fordobles satserne til $4 pr. million inputtokens, $1 pr. million cachede inputtokens og $12 pr. million outputtokens. Det højere niveau gælder på grund af promptlængden, så teams bør overvåge akkumuleret samtalehistorik, værktøjsspor, hentede dokumenter og repository-kontekst før hver forespørgsel.

Den praktiske omkostningsbeslutning er derfor ikke kun, hvor mange tokens en opgave bruger, men om prompten krydser grænsen på 200,000 tokens. At opsummere afsluttet arbejde, fjerne forældet værktøjsoutput og kun hente de mest relevante filer kan holde passende arbejdsbelastninger i standardniveauet uden at ofre nødvendig kontekst.

SpaceXAI’s release notes dokumenterer denne tærskel. Produktionsbudgetter bør også tage højde for retrys, agentloops, mislykkede værktøjskald og outputlængde frem for kun at sammenligne udbydere på deres overskrifts-inputtokenpris.

Hvad gør Grok 4.7 nyttig for AI-agenter?

  • 500K kontekstvindue: Rummer betydelig kildekode, specifikationer, værktøjsoutput, logs og samtalehistorik i én arbejdskontekst. Dette er nyttigt til repository-skala kodning og multidokumentanalyse, selvom kontekst stadig kræver aktiv beskæring.
  • Konfigurerbar ræsonnering: Applikationer kan vælge lav, mellem, høj eller xhigh indsats, bytte latenstid og compute for dybere ræsonnering efter opgavens sværhedsgrad.
  • Funktionskald og struktureret output: Agenter kan forespørge databaser, køre tests, inspicere dokumenter, kalde interne API’er og returnere maskinlæsbare resultater.
  • Web- og X-søgning: Søgeværktøjer kan hente aktuel information, når modellens træningsdata er utilstrækkelige. Hentet indhold bør stadig behandles som uverificeret input og verificeres.
  • Kodeeksekvering: Modellen kan validere beregninger, transformere data og teste genererede løsninger i stedet for udelukkende at stole på sprogmodel-inferens.
  • Fokus på workflows med lang horisont: Træningsfokus på fler-timers opgaver, kontekststyring og selvverificering sigter mod agentloops, der akkumulerer værktøjsspor og kræver recovery efter fejl.

Hvordan forbedrer Grok 4.7 sikkerheden?

SpaceXAI siger, at Grok 4.7 introducerer en helt ny sikkerhedsstak og rapporterer stærkere jailbreak-modstand og dual-use-sikkerhed. I lanceringsmeddelelsen rapporterer virksomheden 62.4% på LatchBio’s biosikkerhedsbenchmark og siger, at kun 3.3% af risikable dual-use-prompts blev tilladt igennem på HackerBench v0.3.

Disse tal er leverandørpublicerede evalueringer. De er nyttige til at forstå udgivelseskravene, men bør ikke betragtes som et universelt mål for sikkerhedspræstation i den virkelige verden.

Hvordan kan udviklere bruge Grok 4.7 API’et?

Grok 4.7 er i øjeblikket tilgængelig via CometAPI under model-ID’et grok-4.7. CometAPI tilbyder en OpenAI-kompatibel endpoint, én API-nøgle og faktureringsworkflow på tværs af flere modeludbydere, lettere side-om-side modeltest og routing samt aktuelt viste tokenpriser, der er 20% under de officielle xAI-satser. Bekræft live-modelsiden, endpoint-sundhed, understøttede parametre, priser og datahåndteringskrav før produktionsbrug.

CometAPI-forespørgselseksempel:

curl "https://api.cometapi.com/v1/responses" \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $COMETAPI_KEY" \
  -d '{
    "model": "grok-4.7",
    "input": "Explain how a distributed task queue handles worker failure."
  }'

Er det værd at skifte til Grok 4.7?

For eksisterende Grok 4.6-brugere, der er afhængige af kodningsagenter eller langvarige professionelle workflows, er Grok 4.7 en væsentlig opgraderingskandidat, fordi launch-benchmarksettet forbedres på alle rapporterede dimensioner, mens standardtokenpriserne forbliver på samme $2/$6-niveau under langkonteksttærsklen.

For brugere af andre frontier-modeller er beslutningen arbejdsbelastningsspecifik. Grok 4.7 er især interessant, når outputtoken-omkostning, ingeniørarbejdsbelastninger, store kontekster og vedvarende værktøjsbrug betyder noget. Hvor en anden model er stærkere på et kritisk domæne, kan modelrouting være mere rationel end at erstatte hver model med én udbyder.

Konklusion

Grok 4.7 er mere end en rutinemæssig numerisk opdatering til Grok 4.6. Udgivelsen er eksplicit orienteret mod langvarigt arbejde udført via værktøjer, gentagen verifikation, store kontekster og flere eksekveringstrin.

De stærkeste generationsgevinster fremstår, hvor den træningsretning burde betyde mest: Terminal-Bench 4.0 stiger fra 20.3% til 38.0%, EEBench fra 53.0% til 64.0% og CursorBench 4.0 fra 40.4% til 46.3%, mens standardpriserne under 200K-prompttærsklen forbliver på $2/M input og $6/M output.

Den praktiske værdiforskel er derfor ikke “Grok 4.7 vinder hvert benchmark.” Det er, at Grok 4.7 mindsker afstanden mellem frontier-klasses agentkapabilitet og billigere inferens, hvilket gør den særlig relevant for kodningsagenter, forskningssystemer og professionelle workflows, der skal køre i mange trin frem for at svare én gang.

Fortsæt læring

Knyt denne artikel til den næste beslutning.

Se alle emner
Udgivet den Sep 22, 2026
Sidst opdateret Sep 22, 2026
152 visninger
Gennemgået for klarhed, kildeangivelse og aktuel API-terminologi.

Læs mere