TL;DR Grok 4.7 ist SpaceXAIs Frontier-Modell für Coding, agentische Workflows und professionelle Wissensarbeit, veröffentlicht am 21. September 2026. Es kombiniert ein Kontextfenster von 500.000 Token, Text- und Bildeingabe, konfigurierbares Reasoning, Function Calling, Web- und X-Suche sowie Codeausführung.
Für Prompts unter 200.000 Token listet die offizielle xAI API $2 pro Million Eingabe-Token, $0,50 pro Million zwischengespeicherter Eingabe-Token und $6 pro Million Ausgabe-Token. CometAPI führt Grok 4.7 derzeit mit $1,60 für Eingabe, $0,40 für zwischengespeicherte Eingabe und $4,80 für Ausgabe pro Million Token – eine Reduktion um 20% gegenüber den offiziellen Sätzen auf der Modellseite.
Der praktische Wert liegt nicht in universeller Benchmark-Führung. Grok 4.7 ist am überzeugendsten, wenn ein Workload Engineering-Aufgaben, lange Agentenschleifen, Toolnutzung, große Arbeitskontexte und Sensibilität für Ausgabe-Token-Kosten kombiniert. Teams sollten es an eigenen Repositories und Workflows validieren, bevor sie produktiv routen.
Zentrale Erkenntnisse
- Grok 4.7 verwendet ein größeres Basismodell als Grok 4.6, längeres Reinforcement Learning bei schwierigeren mehrstündigen Aufgaben und stärkere Selbstverifikation.
- Die API unterstützt ein Kontextfenster von 500.000 Token, Text- und Bildeingabe, Textausgabe, vier Reasoning-Stufen, strukturierte Ausgaben, Function Calling, Web- und X-Suche sowie Codeausführung.
- SpaceXAI meldet 46,3% auf CursorBench 4.0, 71,0% auf DeepSWE v1.1 und 38,0% auf Terminal-Bench 4.0. Dies sind vom Anbieter veröffentlichte Ergebnisse, kein Beleg für universelle Spitzenleistung.
- CometAPI listet Grok 4.7 als verfügbar mit einem OpenAI-kompatiblen Endpunkt und Preisen, die 20% unter den offiziellen xAI-Sätzen in seinem aktuellen Katalog liegen.
- Wählen Sie Grok 4.7 für kostensensitive Engineering-Agenten und anhaltende Toolnutzung; wählen Sie Alternativen, wenn sehr langer Kontext oder ein benchmarkkritisches Fachgebiet wichtiger ist als der Stückpreis.
Was ist Grok 4.7?
Grok 4.7 ist SpaceXAIs neuestes Frontier-Sprachmodell, ausgerichtet auf Coding, autonome Agentenaufgaben und professionelle Wissensarbeit. Der Release fokussiert auf Aufgaben, die anhaltende Interaktion, Toolnutzung, Verifikation und Revision erfordern – nicht nur Einmalantworten.
SpaceXAI sagt, Grok 4.7 sei mit einem längeren Reinforcement-Learning-Lauf auf einer schwierigeren Mischung von Aufgaben trainiert worden, gewichtet auf Probleme, die viele Stunden dauern können. Diese Trainingsausrichtung macht es besonders relevant für Repository-Level-Softwareengineering, Debugging, Forschung, Dokumenterstellung, Ingenieursanalysen und mehrstufige Automatisierung.
Wie unterscheidet sich Grok 4.7 von – und verbessert es – Grok 4.6?
Ein größeres Basismodell
Grok 4.7 wechselt zu einem größeren Basismodell als Grok 4.6. SpaceXAI hat keine endgültige öffentliche Parameterzahl offengelegt; die belastbare Schlussfolgerung ist eine erhöhte Kapazität des Basismodells – keine spezifische Parameterschätzung.
Längeres Reinforcement Learning bei schwierigeren Aufgaben
Die Reinforcement-Learning-Phase wurde verlängert und auf schwierigere, längerfristige Probleme ausgerichtet. SpaceXAI betont Aufgaben, die Stunden dauern können, was das Modell mit autonomen Coding-, Forschungs- und professionellen Agenten-Workflows in Einklang bringt.
Stärkere Selbstverifikation
Grok 4.7 ist darauf trainiert, seine eigene Arbeit sorgfältiger zu inspizieren. Das ist im Softwareengineering wichtig, weil ein verlässlicher Agent wiederholt inspizieren, modifizieren, testen, Fehler diagnostizieren, revidieren und validieren muss – nicht nur eine erste Antwort generieren.
Gemessene Verbesserungen gegenüber Grok 4.6
| Dimension | Grok 4.6 | Grok 4.7 | Veränderung |
|---|---|---|---|
| CursorBench 4.0 | 40,4% | 46,3% | +5,9 Pkt |
| DeepSWE v1.1 | 65,2% | 71,0% | +5,8 Pkt |
| EEBench | 53,0% | 64,0% | +11,0 Pkt |
| AA Briefcase v1.1 | 1,546 | 1,657 | +111 |
| Terminal-Bench 4.0 | 20,3% | 38,0% | +17,7 Pkt |
| Harvey Legal Agent Benchmark | 15,8% | 19,6% | +3,8 Pkt |
| HealthBench Professional | 48,5% | 56,7% | +8,2 Pkt |
Über die veröffentlichte Launch-Suite hinweg verbessert Grok 4.7 Grok 4.6 in jedem gelisteten Ergebnis. Der größte absolute Zuwachs liegt bei Terminal-Bench 4.0 und passt zur Release-Betonung auf lang laufende Kommandozeilen- und Tool-Workflows. Diese Zahlen bleiben anbieterseitig publiziert und sollten vor einer Migrationsentscheidung an realen Aufgaben getestet werden.
Wie gut ist Grok 4.7 auf Benchmarks?
SpaceXAIs Launch-Evaluierung umfasst Softwareengineering, Terminalarbeit, professionelle Office-Aufgaben, juristische Arbeit, klinisches Reasoning und Elektrotechnik. Dies sind vom Anbieter veröffentlichte Ergebnisse und sollten vor Beschaffungs- oder Routing-Entscheidungen gegen Produktions-Workloads validiert werden.
| Benchmark | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| CursorBench 4.0 | 46,3% | 40,4% | 41,7% | 51,8% |
| DeepSWE v1.1 | 71,0%* | 65,2% | 72,7% | 70,0% |
| EEBench | 64,0% | 53,0% | 39,4% | 56,4% |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38,0% | 20,3% | 37,3% | 57,9% |
| Harvey Legal Agent Benchmark | 19,6% | 15,8% | 2,5% | 6,7% |
| HealthBench Professional | 56,7% | 48,5% | 60,5% | 62,1% |
In den Grok 4.7 Launch-Ergebnissen markiert SpaceXAI die 71,0% auf DeepSWE v1.1 als hohe Reasoning-Bemühung.
Die Launch-Ankündigung legt nicht jeden Benchmark-Harness, jede Toolkonfiguration, Run-Anzahl oder Evaluierungsumgebung offen. Behandeln Sie diese Werte als anbieterseitig veröffentlichte Ergebnisse und validieren Sie das Modell an Ihren eigenen Repositories, Tools, Latenzzielen und Fehlkriterien, bevor Sie produktive Arbeit routen.
Was zeigt das Benchmark-Profil von Grok 4.7?
Softwareengineering
CursorBench 4.0 steigt von 40,4% bei Grok 4.6 auf 46,3% bei Grok 4.7, während DeepSWE v1.1 von 65,2% auf 71,0% steigt. Das stützt die Positionierung von Grok 4.7 als Modell für Coding-Agenten statt nur für konversationale Coding-Unterstützung.
Lang laufende Terminalarbeit
Terminal-Bench 4.0 zeigt eine der größten generationalen Änderungen: 20,3% für Grok 4.6 gegenüber 38,0% für Grok 4.7. Der absolute Zugewinn von 17,7 Punkten entspricht SpaceXAIs Betonung auf längerfristigem Reinforcement Learning und Selbstverifikation.
Elektrotechnik
Auf EEBench erreicht Grok 4.7 64,0%, verglichen mit 53,0% für Grok 4.6. Unter den veröffentlichten Vergleichen ist dies eines der relativ stärksten Ergebnisse von Grok 4.7.
Professionelle Wissensarbeit
AA Briefcase v1.1 steigt von 1,546 auf 1,657. Diese Aufgaben sollen mehrstündige professionelle Arbeit mit Artefakten wie Dokumenten, Präsentationen, Analysen und anderen strukturierten Ergebnissen widerspiegeln.
Grok 4.7 vs GPT-5.6 Sol vs Fable 5.1: Wie schneiden sie im Vergleich ab?
Anbieter-native Preisprüfungen: OpenAI listet GPT-5.6 Sol mit $4 pro Million Eingabe-Token und $20 pro Million Ausgabe-Token, während Anthropic Claude Fable 5.1 mit $10 pro Million Eingabe-Token und $50 pro Million Ausgabe-Token listet.
| Dimension | Grok 4.7 | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Primäre Positionierung | Coding, agentische Aufgaben, Wissensarbeit | Komplexes professionelles Reasoning und Coding | Lang laufende Agenten, Coding und Wissensarbeit |
| Kontextfenster | 500.000 Token | 1.050.000 Token | 1.000.000 Token |
| Modalitäten | Text- und Bildeingabe; Textausgabe | Text- und Bildeingabe; Textausgabe | Text- und Bildeingabe; Textausgabe |
| Reasoning-Kontrolle | low, medium, high, xhigh | None through max | Adaptive Thinking mit konfigurierter Intensität |
| Provider-API-Status | Verfügbar über die öffentliche xAI API | Verfügbar über OpenAI Chat Completions und Responses | Verfügbar über die Claude API und unterstützte Cloud-Marktplätze |
| Eingabepreis / 1M Token | $2 | $4 | $10 |
| Ausgabepreis / 1M Token | $6 | $20 | $50 |
| CursorBench 4.0 | 46,3% | 41,7% | 51,8% |
| DeepSWE v1.1 | 71,0% | 72,7% | 70,0% |
| Best Fit | Preis-sensitive Engineering-Agenten und anhaltende Toolnutzung | Breites professionelles Reasoning mit sehr langem Kontext | Maximale Leistungsfähigkeit für lang laufende Agenten- und Wissens-Workflows |
Welches Modell sollten Sie wählen?
- Wählen Sie Grok 4.7, wenn Engineering-Workloads, anhaltende Toolnutzung, konfigurierbares Reasoning und niedrigere Ausgabe-Token-Kosten Priorität haben. Besonders attraktiv für Repository-Agenten, Terminal-Workflows und Forschung mit großem Kontext, die unter der 200K-Preisschwelle bleibt.
- Wählen Sie GPT-5.6 Sol, wenn die Aufgabe breiteres professionelles Reasoning, ein Kontextfenster über einer Million Token erfordert oder wenn dessen stärkeres Ergebnis auf einer geschäftskritischen Evaluation wie DeepSWE oder klinischem Reasoning in Ihrem eigenen Harness validiert wurde.
- Wählen Sie Claude Fable 5.1, wenn maximale Agentenleistung, Codequalität, Terminalausführung oder klinisches Reasoning den höheren Tokenpreis rechtfertigen.
- Nutzen Sie Modell-Routing, wenn Workloads variieren. Routen Sie Routine-Engineering und hochvolumige Agentenschritte zum kosteneffizientesten qualifizierten Modell und reservieren Sie ein teureres Modell für Aufgaben, bei denen gemessene Erfolgsraten den Aufpreis begründen.
Die richtige Wahl hängt von End-to-End-Aufgabenerfolg, Latenz, Retries, Genauigkeit von Tool-Aufrufen und menschlicher Nacharbeit ab – nicht von einem einzelnen Benchmark oder einem Tokenpreis in der Überschrift.
Wie viel kostet die Grok 4.7 API?
Die folgende Tabelle vergleicht die offiziellen xAI-Sätze mit den am 22. September 2026 auf CometAPIs Grok-4.7-Modellseite angezeigten Preisen. CometAPI gibt einen Rabatt von 20% an; prüfen Sie vor Produktionseinsatz die Live-Preise, da Gateway-Preise und Promotionen sich ändern können.
| Prompt-Tier | Preisart | xAI offiziell | CometAPI | Differenz |
|---|---|---|---|---|
| Unter 200K Prompt-Token | Eingabe/1M | $2,00 | $1,60 | 20% niedriger |
| Zwischengespeicherte Eingabe/1M | $0,50 | $0,40 | 20% niedriger | |
| Ausgabe/1M | $6,00 | $4,80 | 20% niedriger | |
| Über 200K Prompt-Token | Eingabe/1M | $4,00 | $3,20 | 20% niedriger |
| Zwischengespeicherte Eingabe/1M | $1,00 | $0,80 | 20% niedriger | |
| Ausgabe/1M | $12,00 | $9,60 | 20% niedriger |
Standard-Kontextpreise für Prompts bis 200.000 Token
Für Anfragen, deren Prompt 200.000 Token nicht überschreitet, kostet Grok 4.7 $2 pro Million Eingabe-Token, $0,50 pro Million zwischengespeicherter Eingabe-Token und $6 pro Million Ausgabe-Token. Zwischengespeicherte Eingabe ist die günstigste Kategorie, sodass Anwendungen mit wiederverwendeten Systeminstruktionen oder wiederverwendbarem Kontext Kosten senken können, wenn diese Token für Caching qualifizieren.
Ein einfaches Beispiel: Eine Anfrage mit 100.000 nicht zwischengespeicherten Eingabe-Token und 10.000 Ausgabe-Token würde etwa $0,26 kosten, bevor weitere Plattformgebühren anfallen: $0,20 für Eingabe plus $0,06 für Ausgabe.
Langkontextpreise über 200.000 Prompt-Token
Sobald der Prompt 200.000 Token überschreitet, verdoppeln sich die Sätze auf $4 pro Million Eingabe-Token, $1 pro Million zwischengespeicherter Eingabe-Token und $12 pro Million Ausgabe-Token. Der höhere Tier gilt aufgrund der Prompt-Länge, daher sollten Teams die angesammelte Konversationshistorie, Tool-Traces, abgerufene Dokumente und Repository-Kontext überwachen, bevor sie jede Anfrage senden.
Die praktische Kostenentscheidung betrifft daher nicht nur, wie viele Token eine Aufgabe nutzt, sondern ob der Prompt die 200.000-Token-Grenze überschreitet. Das Zusammenfassen abgeschlossener Arbeit, das Entfernen obsoleter Tool-Ausgaben und das Abrufen nur der relevantesten Dateien kann geeignete Workloads im Standard-Tier halten, ohne notwendigen Kontext zu opfern.
Die SpaceXAI Release Notes dokumentieren diese Schwelle. Produktionsbudgets sollten auch Retries, Agentenschleifen, fehlgeschlagene Tool-Aufrufe und Ausgabelänge berücksichtigen, statt Anbieter nur am Eingabe-Token-Preisschild zu vergleichen.
Was macht Grok 4.7 für AI-Agenten nützlich?
- 500K Kontextfenster: Hält umfangreichen Quellcode, Spezifikationen, Toolausgaben, Logs und Konversationshistorie in einem Arbeitskontext. Nützlich für Repository-Skalierungs-Coding und Multidokument-Analysen, wenngleich der Kontext weiterhin aktiv beschnitten werden muss.
- Konfigurierbares Reasoning: Anwendungen können low, medium, high oder xhigh wählen und Latenz sowie Rechenaufwand gegen tieferes Reasoning je nach Aufgabenschwierigkeit tauschen.
- Function Calling und strukturierte Ausgaben: Agenten können Datenbanken abfragen, Tests ausführen, Dokumente inspizieren, interne APIs aufrufen und maschinenlesbare Ergebnisse zurückgeben.
- Web- und X-Suche: Suchtools können aktuelle Informationen abrufen, wenn die Trainingsdaten des Modells unzureichend sind. Abgerufenes sollte weiterhin als unvertrauenswürdiger Input behandelt und verifiziert werden.
- Codeausführung: Das Modell kann Berechnungen validieren, Daten transformieren und generierte Lösungen testen, statt sich ausschließlich auf Sprachmodell-Inferenz zu verlassen.
- Fokus auf langhorizontige Workflows: Der Trainingsschwerpunkt auf mehrstündigen Aufgaben, Kontextmanagement und Selbstverifikation zielt auf Agentenschleifen, die Tool-Traces akkumulieren und nach Fehlern wiederherstellen müssen.
Wie verbessert Grok 4.7 die Sicherheit?
SpaceXAI sagt, Grok 4.7 führe einen vollständig neuen Schutz-Stack ein und berichtet von stärkerem Jailbreak-Widerstand und Dual-Use-Sicherheit. In der Launch-Ankündigung meldet das Unternehmen 62,4% auf LatchBios Biosafety-Benchmark und sagt, dass nur 3,3% riskanter Dual-Use-Prompts auf HackerBench v0.3 durchgelassen wurden.
Diese Zahlen sind anbieterseitig veröffentlichte Evaluierungen. Sie sind nützlich, um die Release-Claims zu verstehen, sollten aber nicht als universelles Maß für reale Sicherheitsleistung betrachtet werden.
Wie können Entwickler die Grok 4.7 API nutzen?
Grok 4.7 ist derzeit über CometAPI verfügbar unter der Modell-ID grok-4.7. CometAPI bietet einen OpenAI-kompatiblen Endpunkt, einen API-Schlüssel und ein Abrechnungsmodell über mehrere Provider, einfacheres Side-by-Side-Modelltesting und -Routing sowie aktuell gelistete Tokenpreise, die 20% unter den offiziellen xAI-Sätzen liegen. Bestätigen Sie vor Produktionseinsatz die Live-Modellseite, Endpunktverfügbarkeit, unterstützte Parameter, Preise und Anforderungen an die Datenverarbeitung.
CometAPI-Anfragebeispiel:
curl "https://api.cometapi.com/v1/responses" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-d '{
"model": "grok-4.7",
"input": "Explain how a distributed task queue handles worker failure."
}'
Lohnt sich der Wechsel zu Grok 4.7?
Für bestehende Grok-4.6-Nutzer, die auf Coding-Agenten oder lang laufende professionelle Workflows angewiesen sind, ist Grok 4.7 ein substantieller Upgrade-Kandidat, da das Launch-Benchmark-Set in jeder berichteten Dimension verbessert, während die Standard-Tokenpreise unter der Langkontext-Schwelle bei $2/$6 bleiben.
Für Nutzer anderer Frontier-Modelle ist die Entscheidung workload-spezifisch. Grok 4.7 ist besonders interessant, wenn Ausgabe-Token-Kosten, Engineering-Workloads, große Kontexte und anhaltende Toolnutzung wichtig sind. Wo ein anderes Modell in einem kritischen Bereich stärker ist, kann Modell-Routing rationaler sein, als jedes Modell durch einen Anbieter zu ersetzen.
Fazit
Grok 4.7 ist mehr als ein routinemäßiges numerisches Update zu Grok 4.6. Der Release ist explizit auf lang laufende Arbeit durch Tools, wiederholte Verifikation, große Kontexte und multiple Ausführungsschritte ausgerichtet.
Die stärksten generationalen Zuwächse erscheinen dort, wo diese Trainingsrichtung relevant sein sollte: Terminal-Bench 4.0 steigt von 20,3% auf 38,0%, EEBench von 53,0% auf 64,0% und CursorBench 4.0 von 40,4% auf 46,3%, während die Standardpreise unterhalb der 200K-Prompt-Schwelle bei $2/M Eingabe und $6/M Ausgabe bleiben.
Der praktische Wert liegt daher nicht in „Grok 4.7 gewinnt jeden Benchmark“. Vielmehr verengt Grok 4.7 die Lücke zwischen Agentenfähigkeit auf Frontier-Niveau und günstigerer Inferenz – besonders relevant für Coding-Agenten, Forschungssysteme und professionelle Workflows, die viele Schritte benötigen statt nur einmal zu antworten.
