TL;DR
Grok 4.7 er SpaceXAI sin frontier-modell for koding, agentbaserte arbeidsflyter og profesjonelt kunnskapsarbeid, lansert 21. september 2026. Den kombinerer et kontekstvindu på 500 000 token, tekst- og bildeinput, konfigurerbar resonnering, funksjonskall, web- og X-søk og kodekjøring.
For prompter under 200 000 token oppgir den offisielle xAI-API-en $2 per million input-token, $0.50 per million bufrede input-token og $6 per million output-token. CometAPI lister for øyeblikket Grok 4.7 til $1.60 input, $0.40 bufret input og $4.80 output per million token for samme nivå—20% reduksjon fra de offisielle satsene vist på modellens side.
Den praktiske verdiproposisjonen er ikke universelt benchmark-lederskap. Grok 4.7 er mest overbevisende når en arbeidslast kombinerer ingeniøroppgaver, lange agent-løkker, verktøybruk, store arbeidskontekster og følsomhet for kostnad på output-token. Team bør validere den på egne repositorier og arbeidsflyter før produksjonsruting.
Viktige punkter
- Grok 4.7 bruker en større basemodell enn Grok 4.6, lengre forsterkningslæring på vanskeligere fler-times oppgaver og sterkere selvverifisering.
- API-et støtter et kontekstvindu på 500 000 token, tekst- og bildeinput, tekstoutput, fire resonneringsnivåer, strukturert output, funksjonskall, web- og X-søk og kodekjøring.
- SpaceXAI rapporterer 46,3% på CursorBench 4.0, 71,0% på DeepSWE v1.1 og 38,0% på Terminal-Bench 4.0. Dette er leverandørpubliserte resultater, ikke bevis på universell ledelse.
- CometAPI lister Grok 4.7 som tilgjengelig, med et OpenAI-kompatibelt endepunkt og priser 20% under de offisielle xAI-satsene som vises i den nåværende katalogen.
- Velg Grok 4.7 for kostnadssensitive ingeniør-agenter og vedvarende verktøybruk; velg alternativer når svært lang kontekst eller et benchmark-kritisk domene betyr mer enn enhetsprisen.
Hva er Grok 4.7?
Grok 4.7 er SpaceXAI sin nyeste frontier store språkmodell, posisjonert for koding, autonome agentoppgaver og profesjonelt kunnskapsarbeid. Lanseringen fokuserer på oppgaver som krever vedvarende interaksjon, verktøybruk, verifisering og revisjon fremfor bare ett-svars løsninger.
SpaceXAI sier at Grok 4.7 ble trent med en lengre forsterkningslæringskjøring på en vanskeligere miks av oppgaver, vektet mot problemer som kan ta mange timer å fullføre. Denne treningsretningen gjør den spesielt relevant for repositorienivå programvareutvikling, debugging, forskning, dokumentproduksjon, ingeniøranalyse og flerstegs automatisering.
Hvordan er Grok 4.7 annerledes enn—og bedre enn—Grok 4.6?
En større basemodell
Grok 4.7 går over til en større basemodell enn Grok 4.6. SpaceXAI har ikke offentliggjort et endelig parameterantall, så den forsvarlige konklusjonen er økt basemodellkapasitet—ikke et spesifikt parameterestimat.
Lengre forsterkningslæring på vanskeligere oppgaver
Forsterkningslæringsfasen ble utvidet og flyttet mot vanskeligere, lengre-horisont problemer. SpaceXAI understreker oppgaver som kan kreve timer med arbeid, som stemmer overens med autonome kodings-, forsknings- og profesjonelle agentarbeidsflyter.
Sterkere selvverifisering
Grok 4.7 er trent til å inspisere sitt eget arbeid mer nøye. Det er viktig i programvareutvikling fordi en pålitelig agent må gjentatte ganger inspisere, modifisere, teste, diagnostisere feil, revidere og validere—ikke bare generere et første svar.
Målte forbedringer over Grok 4.6
| Dimensjon | Grok 4.6 | Grok 4.7 | Endring |
|---|---|---|---|
| CursorBench 4.0 | 40.4% | 46.3% | +5.9 pkt |
| DeepSWE v1.1 | 65.2% | 71.0% | +5.8 pkt |
| EEBench | 53.0% | 64.0% | +11.0 pkt |
| AA Briefcase v1.1 | 1,546 | 1,657 | +111 |
| Terminal-Bench 4.0 | 20.3% | 38.0% | +17.7 pkt |
| Harvey Legal Agent Benchmark | 15.8% | 19.6% | +3.8 pkt |
| HealthBench Professional | 48.5% | 56.7% | +8.2 pkt |
På tvers av den publiserte lanseringspakken forbedrer Grok 4.7 seg over Grok 4.6 i hver oppført måling. Den største absolutte økningen er på Terminal-Bench 4.0, i tråd med lanseringsfokuset på langvarige kommandolinje- og verktøybruksarbeidsflyter. Disse tallene er fortsatt leverandørpubliserte og bør testes mot reelle oppgaver før en migrasjonsbeslutning.
Hvor god er Grok 4.7 på benchmark?
SpaceXAI sin lanseringsevaluering dekker programvareutvikling, terminalarbeid, profesjonelle kontoroppgaver, juridisk arbeid, klinisk resonnering og elektroteknikk. Dette er leverandørpubliserte resultater og bør valideres mot produksjonsarbeidslaster før innkjøps- eller rutingsbeslutninger.
| Benchmark | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
I sine Grok 4.7-lanseringsresultater markerer SpaceXAI DeepSWE v1.1-scoren på 71,0% som høy resonneringsinnsats.
Lanseringskunngjøringen avslører ikke alle per-benchmark-harness, verktøykonfigurasjoner, antall kjøringer eller evalueringsmiljøer. Behandle disse verdiene som leverandørpubliserte resultater og valider modellen på egne repositorier, verktøy, latensmål og feil-kriterier før du ruter produksjonsarbeid.
Hva viser Grok 4.7s benchmark-profil?
Programvareutvikling
CursorBench 4.0 stiger fra 40,4% på Grok 4.6 til 46,3% på Grok 4.7, mens DeepSWE v1.1 stiger fra 65,2% til 71,0%. Dette støtter Grok 4.7s posisjonering som en modell for kodingsagenter fremfor bare samtalebasert kodeassistanse.
Langvarig terminalarbeid
Terminal-Bench 4.0 viser en av de største generasjonelle endringene: 20,3% for Grok 4.6 versus 38,0% for Grok 4.7. Den absolutte økningen på 17,7 poeng er i tråd med SpaceXAI sitt fokus på forsterkningslæring med lengre horisont og selvverifisering.
Elektroteknikk
På EEBench når Grok 4.7 64,0%, sammenlignet med 53,0% for Grok 4.6. Blant de publiserte sammenligningene er dette en av Grok 4.7s sterkeste relative resultater.
Profesjonelt kunnskapsarbeid
AA Briefcase v1.1 stiger fra 1 546 til 1 657. Disse oppgavene er designet for å reflektere fler-times profesjonelt arbeid som omfatter artefakter som dokumenter, presentasjoner, analyser og andre strukturerte leveranser.
Grok 4.7 vs GPT-5.6 Sol vs Fable 5.1: Hvordan sammenlignes de?
Leverandørs egne prissjekker: OpenAI lister GPT-5.6 Sol til $4 per million input-token og $20 per million output-token, mens Anthropic lister Claude Fable 5.1 til $10 per million input-token og $50 per million output-token.
| Dimensjon | Grok 4.7 | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Primær posisjonering | Koding, agentiske oppgaver, kunnskapsarbeid | Kompleks profesjonell resonnering og koding | Langvarige agenter, koding og kunnskapsarbeid |
| Kontekstvindu | 500,000 token | 1,050,000 token | 1,000,000 token |
| Modaliteter | Tekst- og bildeinput; tekstoutput | Tekst- og bildeinput; tekstoutput | Tekst- og bildeinput; tekstoutput |
| Kontroll av resonnering | Low, medium, high, xhigh | None through max | Adaptiv tenkning med konfigurerbar innsats |
| Leverandør-API-status | Tilgjengelig på offentlig xAI-API | Tilgjengelig via OpenAI Chat Completions og Responses | Tilgjengelig via Claude-API og støttede sky-markedsplasser |
| Inndata pris / 1M token | $2 | $4 | $10 |
| Utdata pris / 1M token | $6 | $20 | $50 |
| CursorBench 4.0 | 46.3% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0% | 72.7% | 70.0% |
| Best fit | Prisfølsomme ingeniør-agenter og vedvarende verktøybruk | Bred profesjonell resonnering med svært lang kontekst | Maksimal ytelse for langvarige agenter og kunnskapsarbeid |
Hvilken modell bør du velge?
- Velg Grok 4.7 når ingeniørarbeidslaster, vedvarende verktøybruk, konfigurerbar resonnering og lavere kostnad per output-token er prioritert. Den er særlig attraktiv for repo-agenter, terminalarbeidsflyter og forskning med stor kontekst som holder seg under 200K-prisgrensen.
- Velg GPT-5.6 Sol når oppgaven trenger bredere profesjonell resonnering, et kontekstvindu over én million token, eller når dens sterkere resultat på en forretningskritisk evaluering som DeepSWE eller klinisk resonnering er validert i din egen testharness.
- Velg Claude Fable 5.1 når maksimal ytelse for langvarige agenter, kodekvalitet, terminalutførelse eller klinisk resonnering rettferdiggjør den høyere token-prisen.
- Bruk modellruting når arbeidslaster varierer. Ruter rutinemessig ingeniørarbeid og høyvolums agentsteg til den mest kostnadseffektive kvalifiserte modellen, og reserver en dyrere modell for oppgaver der målte suksessrater rettferdiggjør premien.
Det riktige valget avhenger av end-to-end oppgavesuksess, latens, retries, nøyaktighet i verktøykall og menneskelig omarbeid—ikke av en enkelt benchmark eller en overskrifts-tokenrate.
Hvor mye koster Grok 4.7-API-et?
Tabellen under sammenligner de offisielle xAI-satsene med prisene som vises på CometAPI sin Grok 4.7-modellside 22. september 2026. CometAPI oppgir 20% rabatt; verifiser live-priser før produksjon fordi portpriser og kampanjevilkår kan endres.
| Prompt-nivå | Pristype | xAI official | CometAPI | Forskjell |
|---|---|---|---|---|
| Under 200K prompt-token | Input / 1M | $2.00 | $1.60 | 20% lavere |
| Bufret input / 1M | $0.50 | $0.40 | 20% lavere | |
| Output / 1M | $6.00 | $4.80 | 20% lavere | |
| Over 200K prompt-token | Input / 1M | $4.00 | $3.20 | 20% lavere |
| Bufret input / 1M | $1.00 | $0.80 | 20% lavere | |
| Output / 1M | $12.00 | $9.60 | 20% lavere |
Standard kontekstprising for prompter opp til 200,000 token
For forespørsler der prompten ikke overstiger 200,000 token, koster Grok 4.7 $2 per million input-token, $0.50 per million bufrede input-token og $6 per million output-token. Bufret input er den rimeligste kategorien, så applikasjoner med gjentatte systeminstruksjoner eller gjenbrukbar kontekst kan redusere kostnaden når disse token kvalifiserer for caching.
Som et enkelt eksempel vil en forespørsel som bruker 100,000 ubufrede input-token og produserer 10,000 output-token koste omtrent $0.26 før andre plattformavgifter: $0.20 for input pluss $0.06 for output.
Lang-kontekst-prising over 200,000 prompt-token
Når prompten overstiger 200,000 token, dobles satsene til $4 per million input-token, $1 per million bufrede input-token og $12 per million output-token. Det høyere nivået gjelder på grunn av prompt-lengden, så team bør overvåke akkumulert samtalehistorikk, verktøyspor, hentede dokumenter og repositoriekontekst før hver forespørsel.
Den praktiske kostnadsbeslutningen handler derfor ikke bare om hvor mange token en oppgave bruker, men om prompten krysser 200,000-token-grensen. Oppsummering av fullført arbeid, fjerning av utdatert verktøyoutput og henting av kun de mest relevante filene kan holde passende arbeidslaster i standardnivået uten å ofre nødvendig kontekst.
SpaceXAI release notes dokumenterer denne terskelen. Produksjonsbudsjetter bør også ta høyde for retries, agent-løkker, mislykkede verktøykall og output-lengde fremfor å sammenligne leverandører kun etter overskriftsprisen per input-token.
Hva gjør Grok 4.7 nyttig for AI-agenter?
- 500K kontekstvindu: Rommer betydelig kildekode, spesifikasjoner, verktøyoutput, logger og samtalehistorikk i én arbeidskontekst. Dette er nyttig for repositori-skala koding og multi-dokumentanalyse, selv om kontekst fortsatt krever aktiv trimming.
- Konfigurerbar resonnering: Applikasjoner kan velge low, medium, high eller xhigh innsats, og bytte latens og beregning mot dypere resonnering i henhold til oppgavens vanskelighetsgrad.
- Funksjonskall og strukturert output: Agenter kan spørre databaser, kjøre tester, inspisere dokumenter, kalle interne API-er og returnere maskinlesbare resultater.
- Web- og X-søk: Søkverktøy kan hente oppdatert informasjon når modellens treningsdata er utilstrekkelige. Hentet innhold bør fortsatt behandles som uverifisert input og verifiseres.
- Kodekjøring: Modellen kan validere beregninger, transformere data og teste genererte løsninger i stedet for å stole utelukkende på språkmodell-inferens.
- Fokus på arbeidsflyter med lang horisont: Treningsfokuset på fler-times oppgaver, konteksthåndtering og selvverifisering retter seg mot agent-løkker som akkumulerer verktøyspor og krever gjenoppretting etter feil.
Hvordan forbedrer Grok 4.7 sikkerheten?
SpaceXAI sier at Grok 4.7 introduserer en helt ny sikkerhetsstakk og rapporterer sterkere jailbreak-resistens og sikkerhet for dobbeltbruk. I lanseringskunngjøringen rapporterer selskapet 62,4% på LatchBio sin biosikkerhetsbenchmark og sier at bare 3,3% av risikable dobbeltbruks-prompt ble sluppet gjennom på HackerBench v0.3.
Disse tallene er leverandørpubliserte evalueringer. De er nyttige for å forstå lanseringspåstandene, men bør ikke behandles som et universelt mål på sikkerhetsytelse i virkeligheten.
Hvordan kan utviklere bruke Grok 4.7-API-et?
Grok 4.7 er for øyeblikket tilgjengelig via CometAPI under modell-ID grok-4.7. CometAPI tilbyr et OpenAI-kompatibelt endepunkt, én API-nøkkel og faktureringsarbeidsflyt på tvers av flere modellleverandører, enklere side-ved-side modelltesting og ruting, og for tiden oppførte token-priser som er 20% under de offisielle xAI-satsene. Før produksjonsbruk, bekreft den live modellsiden, endepunktets helse, støttede parametere, prising og krav til datahåndtering.
CometAPI-forespørseleksempel:
curl "https://api.cometapi.com/v1/responses" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-d '{
"model": "grok-4.7",
"input": "Explain how a distributed task queue handles worker failure."
}'
Er det verdt å bytte til Grok 4.7?
For eksisterende Grok 4.6-brukere som er avhengige av kodingsagenter eller langvarige profesjonelle arbeidsflyter, er Grok 4.7 et materiell oppgraderingskandidat fordi lanseringens benchmark-sett forbedres på alle rapporterte dimensjoner, mens standard token-prising forblir på samme $2/$6-nivå under lang-kontekst terskelen.
For brukere av andre frontier-modeller er beslutningen arbeidslastspesifikk. Grok 4.7 er spesielt interessant når kostnad per output-token, ingeniørarbeidslaster, store kontekster og vedvarende verktøybruk betyr mye. Der en annen modell er sterkere på et kritisk domene, kan modellruting være mer rasjonelt enn å erstatte enhver modell med én leverandør.
Konklusjon
Grok 4.7 er mer enn en rutinemessig numerisk oppdatering av Grok 4.6. Lanseringen er eksplisitt orientert mot langvarig arbeid utført gjennom verktøy, gjentatt verifisering, store kontekster og flere utføringssteg.
De sterkeste generasjonelle gevinstene fremstår der denne treningsretningen bør bety mest: Terminal-Bench 4.0 stiger fra 20,3% til 38,0%, EEBench fra 53,0% til 64,0%, og CursorBench 4.0 fra 40,4% til 46,3%, mens standard prising under 200K prompt-terskelen forblir på $2/M input og $6/M output.
Den praktiske verdiproposisjonen er derfor ikke «Grok 4.7 vinner hver benchmark». Den er at Grok 4.7 reduserer gapet mellom frontier-klasse agentkapabilitet og lavere kostnad for inferens, noe som gjør den spesielt relevant for kodingsagenter, forskningssystemer og profesjonelle arbeidsflyter som må operere over mange steg i stedet for å svare én gang.
