TL; DR xAI hat Grok 4.6 am 12. August 2026 offiziell veröffentlicht und über die xAI API, Cursor und Grok Build verfügbar gemacht. Es verfügt über ein Kontextfenster von 500.000 Token, akzeptiert Text und Bilder, bietet vier Stufen des Reasoning-Aufwands und hat einen Wissensstichtag vom 1. Februar 2026. Laut xAIs offizieller Grok 4.6-Ankündigung entspricht es auf dem Artificial Analysis Intelligence Index, einem Komposit aus neun Bewertungen, dem Niveau von GPT-5.6 Sol.
Die API-Preise beginnen bei 2 $ pro Million Eingabetoken, 0,50 $ pro Million zwischengespeicherter Eingabetoken und 6 $ pro Million Ausgabetoken für Prompts unter 200.000 Token. Sobald ein Prompt 200.000 Token erreicht, wird die gesamte Anfrage zu den Long-Context-Tarifen von 4 $ Eingabe, 1 $ zwischengespeicherte Eingabe und 12 $ Ausgabe pro Million Token abgerechnet. Für Entwickler, die flexiblen Multi-Model-Zugriff suchen, erleichtern Plattformen wie CometAPI die Integration von Grok 4.6 neben anderen Frontier-Modellen; der API-Preis beträgt 80 % des xAI-Preises.
Wichtigste Erkenntnisse
- xAI hat Grok 4.6 am 12. August 2026 offiziell veröffentlicht; frühere Berichte zu Release-Fenstern sind damit hinfällig.
- Die API-Modell-ID ist , und das Modell ist auch in Cursor und Grok Build verfügbar.
grok-4.6 - Das Kontextfenster umfasst 500K Token, mit Text- und Bildinput und rein textbasierter Ausgabe.
- Standardpreise unter 200K Prompt-Token: 2 $/M Eingabe, 0,50 $/M zwischengespeicherte Eingabe und 6 $/M Ausgabe.
- Ein Prompt mit 200K Token oder mehr löst höhere Tarife für alle Token in dieser Anfrage aus, nicht nur für den Anteil über der Schwelle.
- Der Reasoning-Aufwand kann auf
low,medium,highoderxhighgesetzt werden; ist die dokumentierte Standardeinstellung. - Grok 4.6 entspricht GPT-5.6 Sol auf dem Artificial Analysis Intelligence Index (Score 61) und zeigt große Fortschritte gegenüber Grok 4.5 bei agentischem Coding, Wissensarbeit und Langzeitaufgaben.
- Grok Imagine Image 2.0 ist eine separate Bildgenerierungs-API. Grok 4.6 kann Bilder verstehen, generiert selbst jedoch keine Bilder.
Grok 4.6: Spezifikationen und Preis auf einen Blick
Die folgenden Spezifikationen sind in xAIs Modelldokumentation und den Release Notes vom 12. August bestätigt.
| Spezifikation | Grok 4.6 |
|---|---|
| Offizielles Veröffentlichungsdatum | August 12, 2026 |
| API-Modell-ID | grok-4.6 |
| Positionierung | Flaggschiffmodell für Coding, Agenten und allgemeine Workloads |
| Kontextfenster | 500,000 Token |
| Eingaben | Text und Bilder |
| Ausgabe | Text |
| Dokumentiertes Textausgabelimit | Kein Textausgabelimit von xAI angegeben |
| Reasoning-Steuerung | low, medium, high und xhigh |
| Standardmäßiger Reasoning-Aufwand | High |
| Wissensstichtag | February 1, 2026 |
| Nativer API-Zugang | Verfügbar |
| Zugriff über Coding-Tools | Cursor und Grok Build |
| Zugriff auf aktuelle Ereignisse | Erfordert Web Search oder X Search Tools |
Offizielle xAI-API-Preise
Die aktuelle xAI-Preistabelle unterscheidet zwischen Short-Context- und Long-Context-Anfragen.
| Prompt-Größe | Eingabe pro 1M Token | Zwischengespeicherte Eingabe pro 1M Token | Ausgabe pro 1M Token |
|---|---|---|---|
| Unter 200.000 Token | 2,00 $ | 0,50 $ | 6,00 $ |
| 200.000 Token oder mehr | 4,00 $ | 1,00 $ | 12,00 $ |
Die Schwelle ist besonders für Codebase-Agenten wichtig. Sobald der Prompt einer Anfrage 200.000 Token erreicht, berechnet xAI den Long-Context-Tarif für alle Token in dieser Anfrage, nicht nur für den Anteil oberhalb der Schwelle. Eine Anfrage mit 199.000 Prompt-Token kann daher deutlich günstiger sein als eine mit 200.000, selbst wenn ihre Größen nahezu identisch sind.
Für Grok 4.6 ist in der aktuellen xAI-Preisdokumentation kein Batch-Rabatt aufgeführt. Teams sollten nicht davon ausgehen, dass Offline-Jobs die für bestimmte andere xAI-Modelle verfügbaren Rabatte erhalten.
Was ist Grok 4.6?
Grok 4.6 ist SpaceXAI’s neuestes Flaggschiff-Sprachmodell, veröffentlicht am 12. August 2026. Es baut direkt auf Grok 4.5 auf, mit einem längeren ergänzenden Training, das auf kuratierte modellgenerierte Daten für fortgeschrittenes Reasoning und technische Konzepte, hochwertige Engineering-Datensätze, einen verbesserten Optimierer und erweitertes Reinforcement Learning für Coding- und Wissensarbeits-Szenarien fokussiert.
Das Modell behält dieselbe zugrunde liegende Basis mit 1,5 Billionen Parametern wie sein Vorgänger; die Fortschritte stammen primär aus dem Post-Training und nicht aus einer Erhöhung der Parameterzahl. Es ist speziell darauf ausgelegt, über viele Schritte hinweg effektiv zu bleiben—sei es bei der Recherche eines Themas, der Analyse großer Informationsmengen, dem Navigieren und Bearbeiten eines unbekannten Codebestands oder dem Umsetzen einer High-Level-Idee in eine ausgereifte Anwendung bzw. ein Arbeitsartefakt. SpaceXAI betont ein verbessertes Selbstprüfungsverhalten bei Langzeitprojekten sowie stärkere Leistung bei interaktiver und visueller Arbeit.
Der Unterschied zu einem herkömmlichen Chatbot ist wichtig.
Ein konventioneller LLM-Workflow sieht so aus:
Prompt → Antwort generieren
Grok 4.6 ist für Workflows gedacht, die eher so aussehen:
Ziel → Plan → Recherche → Tools nutzen → Code ändern → Testen → Evaluieren → Fortfahren
xAI's aktuelles Positioning betont die Fähigkeit des Modells, länger an komplexen Projekten zu arbeiten, über Codebasen hinweg zu agieren, unbekannte Themen zu recherchieren, Anwendungen zu bauen und die eigene Arbeit zu verifizieren.
Dies macht Grok 4.6 besonders relevant für den rasant wachsenden Markt der AI-Coding-Agenten und autonomen Agenten.
Was sind die Hauptfunktionen von Grok 4.6?
Langlaufende Agentenfähigkeit
Die wichtigste Verbesserung in Grok 4.6 ist der Fokus auf langlaufende Aufgaben.
Statt nur auf One-Shot-Antworten zu optimieren, ist das Modell darauf ausgelegt, den Fortschritt über mehrere Phasen eines Projekts hinweg aufrechtzuerhalten.
Typische Beispiele sind:
- Eine Anwendung entwickeln
- Ein großes Repository debuggen
- Ein unbekanntes Thema recherchieren
- Mehrere Komponenten ändern
- Tests ausführen
- Fehler untersuchen
- Die Implementierung überarbeiten
- Das Endergebnis prüfen
Dies ist ein grundlegend anderes Ziel als herkömmliche Instruction-Following-Benchmarks.
Erweiterte Coding-Leistung
Coding ist einer der klarsten Verbesserungsbereiche von Grok 4.6.
Aktuelle Benchmark-Berichte zeigen:
- 65,9 % auf DeepSWE 1.1
- 69,9 % auf CursorBench 3.2
- 61,3 % auf FrontierCode 1.1 Extended
Diese Bewertungen sind besonders relevant, weil sie das Verhalten von Coding-Agenten und nicht nur einfache Codevervollständigung messen.
Die Verbesserung von Grok 4.5 zu Grok 4.6 auf DeepSWE 1.1 ist besonders bemerkenswert: von etwa 54 % auf 65,9 % in dem berichteten Vergleich.
Multimodale Eingabe
Grok 4.6 unterstützt Text- und Bild-Eingaben und ermöglicht es Entwicklern, visuelle Informationen mit Reasoning zu kombinieren.
Mögliche Anwendungen umfassen:
- Debugging per Screenshot
- UI-Analyse
- Diagramminterpretation
- Dokumentenverständnis
- Visuelle Recherche
- Bildgestützte Coding-Aufgaben
Damit ist Grok 4.6 flexibler als ein reines textbasiertes Coding-Modell.
Web und X Search
Der Zugriff von Grok auf Suche ist ein wichtiger Teil seines Ökosystems.
Die API unterstützt:
- Web search
- X search
- Function calling
- Code execution
Die aktuelle Grok 4.5-API-Dokumentation von xAI bestätigt diese Tool-Funktionen in der Grok-API-Umgebung.
Für Research-Agenten bedeutet dies, dass das Modell potenziell von statischem, vortrainiertem Wissen zu aktueller Informationsbeschaffung plus Reasoning übergehen kann.
Konfigurierbares Reasoning
Die Grok-API bietet konfigurierbaren Reasoning-Aufwand.
So können Entwickler abwägen zwischen:
Geschwindigkeit/Kosten ↔ Reasoning-Tiefe
Für einfache Aufgaben kann geringerer Reasoning-Aufwand unnötige Berechnungen reduzieren.
Für komplexes Coding oder Rechercheaufgaben kann höherer Reasoning-Aufwand zu überlegterem Problemlösen führen.
Kostenwettbewerbsfähige Frontier-Performance
Das Pricing von Grok 4.6 ist wohl einer seiner größten kommerziellen Vorteile.
Der gemeldete Standard-API-Preis beträgt:
- 2 $ / 1M Eingabetoken
- 6 $ / 1M Ausgabetoken
Das entspricht den für Grok 4.5 gemeldeten Preisen, trotz der erheblichen Fähigkeitsverbesserungen.
Das ergibt ein ungewöhnlich aggressives Kosten-/Leistungsangebot für ein Frontier-Modell.
Wie performt Grok 4.6 in Benchmarks?
Die aussagekräftigsten aktuellen Benchmark-Daten konzentrieren sich auf agentische Intelligenz und Coding.
| Benchmark | Grok 4.6 | Was es misst |
|---|---|---|
| Artificial Analysis Intelligence Index | 61 | Breite Frontier-Modell-Intelligenz |
| CursorBench 3.2 | 69,9 % | Leistung von Coding-Agenten |
| DeepSWE 1.1 | 65,9 % | Software-Engineering-Agenten |
| FrontierCode 1.1 Extended | 61,3 % | Fortgeschrittenes Coding |
| GDPVal-AA v2 | 1.753 Elo | Leistung bei Wissensarbeitsaufgaben |
Der Artificial Analysis Intelligence Index Score von 61 platziert Grok 4.6 Berichten zufolge auf demselben Niveau wie GPT-5.6 Sol auf diesem Index.
Der GDPVal-AA v2 Score von 1.753 Elo ist ebenfalls bedeutsam, da GDPVal professionelle Wissensarbeitsaufgaben bewertet und nicht nur akademisches Frage-Antworten.
Die wichtigste Benchmark-Erkenntnis
Die stärksten Belege für Grok 4.6 sind nicht ein einzelner MMLU-ähnlicher Score.
Sein Benchmark-Profil weist auf:
Coding + Agenten + Wissensarbeit + langlaufende Ausführung
Genau dorthin bewegt sich die moderne KI-Entwicklung.
Für eine Website wie CometAPI ist das eine wichtige Unterscheidung: Grok 4.6 sollte primär als agentisches Frontier-Modell positioniert werden, nicht als weiterer generischer Chatbot.
Wie schneidet Grok 4.6 im Vergleich zu seinem Vorgänger und Wettbewerbern ab?
Grok 4.6 vs Grok 4.5
| Feature | Grok 4.5 | Grok 4.6 |
|---|---|---|
| Hauptfokus | Allgemeines Reasoning + Agenten | Langlaufende Agenten + Coding |
| Kontext | Bereitstellung der 500K-Klasse | 500K |
| Eingabe | Text + Bild | Text + Bild |
| Web search | Ja | Ja |
| X search | Ja | Ja |
| Code execution | Ja | Ja |
| Function calling | Ja | Ja |
| Input-Preis | 2 $/M | 2 $/M |
| Output-Preis | 6 $/M | 6 $/M |
| DeepSWE 1.1 | ~54 % | 65,9 % |
| Intelligence Index | ~56 | 61 |
Wichtig ist: Grok 4.6 scheint kein einfaches Preistier-Upgrade für Grok 4.5 zu sein. Es ist ein Fähigkeits-Upgrade, das stärker auf Langzeit-Agent-Workflows abzielt.
Die aktuelle Grok 4.5-Dokumentation von xAI listet das Modell mit 2 $/6 $ pro Million Token, mit konfigurierbarem Reasoning und Tool-Unterstützung.
Vergleichstabelle: Grok 4.6 vs. zentrale Wettbewerber
| Aspekt | Grok 4.6 | GPT-5.6 Sol | Claude Fable 5 / Opus 5 | Hinweise |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 61 | 62 / 63 | Komposit-Score |
| Eingabe/Ausgabe $/1M | 2 $ / 6 $ | ~5 $ / 30 $ | ~5 $ / 25 $ | Grok deutlich günstiger bei Ausgabe |
| Kontextfenster | 500K | Bis 1M+ | Oft 1M | — |
| Stärken | Agenten, Coding-Effizienz, Kosten | Breites Reasoning, Coding | Langhorizont, Safety | — |
| Cursor-Integration | Nativ, stark | Verfügbar | Verfügbar | Grok für Cursor optimiert |
| Turn-Effizienz | Hoch (weniger Schritte) | Wettbewerbsfähig | Höhere Schrittzahlen berichtet | Wichtig für Agenten |
| Verfügbarkeit | API + Cursor + Partner | Offiziell + Partner | Offiziell + Partner | CometAPI vereinheitlicht Zugriff |
Daten basieren auf SpaceXAI-Ankündigung, Artificial Analysis und öffentlichen Model Cards vom 13. August 2026.
Der aktuelle Artificial Analysis-Vergleich ist besonders interessant.
Grok 4.6 erzielt Berichten zufolge 61 auf dem Intelligence Index und entspricht damit GPT-5.6 Sol. Die Wirtschaftlichkeit ist jedoch sehr unterschiedlich.
Die genauen Preise konkurrierender GPT-Varianten sollten vor Veröffentlichung gegen deren aktuelle Anbieterpreise geprüft werden, aber die zentrale Marktbeobachtung ist klar: Grok 4.6 konkurriert auf Frontier-Benchmark-Niveau und hält zugleich ein vergleichsweise aggressives Token-Pricing.
Das macht Grok 4.6 besonders attraktiv für Anwendungen, bei denen hohe Ausführungsvolumina agentischer Systeme Premium-Frontier-Modelle sonst teuer machen würden.
Was sind die Einschränkungen von Grok 4.6?
500K-Kontext ist kleiner als einige Wettbewerber mit 1M-Kontext
Der gemeldete 500K-Kontext von Grok 4.6 ist groß, aber nicht das größte Kontextfenster im Frontier-Modellmarkt.
Für sehr große Repositories oder umfangreiche Dokumentensammlungen kann ein 1M-Kontextmodell im Vorteil sein.
Proprietäres Modell
Im Gegensatz zu MiMo-V2.5-Pro ist Grok 4.6 kein Open-Weight-Modell.
Entwickler können das Modell nicht herunterladen und eigenständig betreiben.
Benchmark-Vergleiche erfordern Sorgfalt
Unterschiedliche Coding-Benchmarks nutzen unterschiedliche Harnesses, Prompts, Tools und Auswertungsverfahren.
SWE-Bench Pro ist beispielsweise speziell auf realistische, langhorizontale Software-Engineering-Probleme ausgelegt, und die Benchmark-Ergebnisse können je nach Agenten-Gerüst erheblich variieren.
Daher sollte 69,9 % auf CursorBench nicht als „Grok 4.6 ist 69,9 % besser als ein anderes Modell“ interpretiert werden.
Die korrekte Interpretation ist, dass dieser Score unter dem jeweiligen Evaluations-Setup des Benchmarks erreicht wurde.
Agentenkosten können höher sein, als das Token-Pricing suggeriert
Der Token-Preis von 2 $/6 $ ist attraktiv, aber ein autonomer Agent kann enorme Tokenmengen verbrauchen durch:
- Tool-Aufrufe
- Wiederholte Suchen
- Codeausführung
- Fehlversuche
- Langen Kontext
- Selbstverifikation
Die realen Stückkosten hängen daher von Kosten pro erfolgreich abgeschlossenem Task ab, nicht einfach von Kosten pro Million Token.
Preis und Zugriff
Offizielle Preise (Standard-Tier, unter ~200K Prompt-Token):
- Eingabe: 2,00 $ pro 1M Token
- Zwischengespeicherte Eingabe: etwa 0,50 $ pro 1M Token
- Ausgabe: 6,00 $ pro 1M Token
Eine schnellere Variante kostet das Doppelte dieser Sätze. Die Sätze können sich bei sehr langen Kontexten (≥200K) verdoppeln. Prompt Caching wird für Agent-Loops dringend empfohlen, um die Kosten niedrig zu halten.
Verfügbarkeit:
- Cursor und Grok Build (2× enthaltene Nutzung in der ersten Woche)
- SpaceXAI API (grok-4.6)
- Partner: OpenRouter, Vercel, Cloudflare und andere
- SuperGrok Chat/Apps (über Model Picker)
CometAPI Empfehlung: Für Entwickler, die bereits mehrere Frontier-Modelle nutzen (oder dies planen), bietet CometAPI nahtlosen Zugriff auf Grok 4.6 über einen einzigen OpenAI-kompatiblen Endpunkt (https://api.cometapi.com/v1). Sie erhalten einheitliches Billing, Nutzungsanalysen, wettbewerbsfähige Effektivpreise für 500+ Modelle (einschließlich GPT, Claude, Gemini, DeepSeek und Grok-Varianten) und die Möglichkeit, mit einer Einzeilenänderung zwischen Modellen zu wechseln. Das ist besonders wertvoll beim A/B-Testing von Grok 4.6 gegenüber anderen Coding- oder Agentenmodellen oder beim Aufbau von Produktionssystemen, die von Model Routing und Fallback profitieren. Melden Sie sich unter cometapi.com an, um einen kostenlosen API-Schlüssel zu erhalten und den Live-Modelkatalog zu erkunden.
Sollten Sie auf Grok 4.6 umsteigen?
Ja, wenn:
- Sie stark mit Cursor arbeiten oder langlaufende Coding-/Wissens-Agenten bauen und eine hohe Mehrschritt-Zuverlässigkeit zu wettbewerbsfähigen Kosten möchten.
- Token-Ökonomie wichtig ist—Grok 4.6 liefert nahezu Parität mit GPT-5.6 Sol bei etwa einem Fünftel des Ausgabetoken-Preises der teuersten Frontier-Optionen.
- Sie Turn-Effizienz schätzen (weniger Schritte und Token zur Lösung komplexer Aufgaben).
- Sie sofortigen Zugriff auf ein Modell wollen, das explizit für die interaktiven, visuellen und agentischen Workflows der modernen Entwicklung trainiert wurde.
In Erwägung ziehen, bei anderen Modellen zu bleiben bzw. zu mischen, wenn:
- Ihr primärer Workload reines kompetitives Programmieren ist oder Sie spezifische Stärken geschlossener Modelle benötigen (z. B. bestimmte Claude-Langkontext- oder Safety-getunte Szenarien).
- Sie die absolut höchsten Scores auf jedem einzelnen Software-Engineering-Benchmark unabhängig von den Kosten verlangen.
- Sie größere Kontextfenster als 500K für Single-Call-Workloads benötigen (einige Wettbewerber bieten 1M+).
Die meisten Teams profitieren davon, Grok 4.6 parallel zum aktuellen Stack zu evaluieren. Da es über Aggregatoren wie CometAPI verfügbar ist, sind die Wechselkosten gering—ändern Sie einfach den Modellnamen und messen Sie Abschlussraten, Latenz und Kosten in Ihren eigenen Real-World-Workloads.
Fazit
Grok 4.6 ist für SpaceXAI ein bedeutender Schritt nach vorn: Frontier-Level-Intelligenz auf zentralen Komposit- und agentischen Benchmarks, spürbare Verbesserungen bei langlaufender Coding- und Wissensarbeit sowie weiterhin aggressives Pricing, das viele Closed-Source-Wettbewerber unterbietet. Die native Verfügbarkeit in Cursor, kombiniert mit hoher Mehrschritt-Zuverlässigkeit, macht es besonders attraktiv für Entwickler, die reale Software-Agenten und interaktive Anwendungen bauen.
Ob Sie direkt darauf zugreifen, über Cursor/Grok Build oder über ein einheitliches Gateway wie CometAPI—Grok 4.6 ist heute bereit für die Produktionsevaluierung. Besuchen Sie die offizielle Ankündigung unter x.ai/news/grok-4-6 für alle Details und die Model Card, vergleichen Sie es im Live-Katalog auf cometapi.com mit anderen führenden Modellen und beginnen Sie sofort mit den neuen Fähigkeiten.
Primärquellen
- Offizielle Ankündigung: https://x.ai/news/grok-4-6
- SpaceXAI-Dokumentation: https://docs.x.ai/developers/models/grok-4-6
- Artificial Analysis Evaluations und Artikel
- Cursor Blog: https://cursor.com/blog/grok-4-6
- Unabhängige Berichterstattung von SiliconANGLE, 9to5Mac, VentureBeat, The Decoder und anderen (12.–13. August 2026)
Überprüfen Sie stets die neuesten Preise, Ratenlimits und Benchmark-Zahlen auf den offiziellen Seiten, da sich die KI-Landschaft schnell entwickelt.
