DeepSeek V4 Pro 0813 is now live on CometAPI →

Grok 4.6 ist da: Benchmark-Ergebnisse auf GPT-5.6-Niveau & Programmierleistung

CometAPI
AnnaAug 13, 2026
Grok 4.6 ist da: Benchmark-Ergebnisse auf GPT-5.6-Niveau & Programmierleistung

TL; DR xAI hat Grok 4.6 am 12. August 2026 offiziell veröffentlicht und über die xAI API, Cursor und Grok Build verfügbar gemacht. Es verfügt über ein Kontextfenster von 500.000 Token, akzeptiert Text und Bilder, bietet vier Stufen des Reasoning-Aufwands und hat einen Wissensstichtag vom 1. Februar 2026. Laut xAIs offizieller Grok 4.6-Ankündigung entspricht es auf dem Artificial Analysis Intelligence Index, einem Komposit aus neun Bewertungen, dem Niveau von GPT-5.6 Sol.

Die API-Preise beginnen bei 2 $ pro Million Eingabetoken, 0,50 $ pro Million zwischengespeicherter Eingabetoken und 6 $ pro Million Ausgabetoken für Prompts unter 200.000 Token. Sobald ein Prompt 200.000 Token erreicht, wird die gesamte Anfrage zu den Long-Context-Tarifen von 4 $ Eingabe, 1 $ zwischengespeicherte Eingabe und 12 $ Ausgabe pro Million Token abgerechnet. Für Entwickler, die flexiblen Multi-Model-Zugriff suchen, erleichtern Plattformen wie CometAPI die Integration von Grok 4.6 neben anderen Frontier-Modellen; der API-Preis beträgt 80 % des xAI-Preises.

Wichtigste Erkenntnisse

  • xAI hat Grok 4.6 am 12. August 2026 offiziell veröffentlicht; frühere Berichte zu Release-Fenstern sind damit hinfällig.
  • Die API-Modell-ID ist , und das Modell ist auch in Cursor und Grok Build verfügbar.grok-4.6
  • Das Kontextfenster umfasst 500K Token, mit Text- und Bildinput und rein textbasierter Ausgabe.
  • Standardpreise unter 200K Prompt-Token: 2 $/M Eingabe, 0,50 $/M zwischengespeicherte Eingabe und 6 $/M Ausgabe.
  • Ein Prompt mit 200K Token oder mehr löst höhere Tarife für alle Token in dieser Anfrage aus, nicht nur für den Anteil über der Schwelle.
  • Der Reasoning-Aufwand kann auf low, medium, high oder xhigh gesetzt werden; ist die dokumentierte Standardeinstellung.
  • Grok 4.6 entspricht GPT-5.6 Sol auf dem Artificial Analysis Intelligence Index (Score 61) und zeigt große Fortschritte gegenüber Grok 4.5 bei agentischem Coding, Wissensarbeit und Langzeitaufgaben.
  • Grok Imagine Image 2.0 ist eine separate Bildgenerierungs-API. Grok 4.6 kann Bilder verstehen, generiert selbst jedoch keine Bilder.

Grok 4.6: Spezifikationen und Preis auf einen Blick

Die folgenden Spezifikationen sind in xAIs Modelldokumentation und den Release Notes vom 12. August bestätigt.

SpezifikationGrok 4.6
Offizielles VeröffentlichungsdatumAugust 12, 2026
API-Modell-IDgrok-4.6
PositionierungFlaggschiffmodell für Coding, Agenten und allgemeine Workloads
Kontextfenster500,000 Token
EingabenText und Bilder
AusgabeText
Dokumentiertes TextausgabelimitKein Textausgabelimit von xAI angegeben
Reasoning-Steuerunglow, medium, high und xhigh
Standardmäßiger Reasoning-AufwandHigh
WissensstichtagFebruary 1, 2026
Nativer API-ZugangVerfügbar
Zugriff über Coding-ToolsCursor und Grok Build
Zugriff auf aktuelle EreignisseErfordert Web Search oder X Search Tools

Offizielle xAI-API-Preise

Die aktuelle xAI-Preistabelle unterscheidet zwischen Short-Context- und Long-Context-Anfragen.

Prompt-GrößeEingabe pro 1M TokenZwischengespeicherte Eingabe pro 1M TokenAusgabe pro 1M Token
Unter 200.000 Token2,00 $0,50 $6,00 $
200.000 Token oder mehr4,00 $1,00 $12,00 $

Die Schwelle ist besonders für Codebase-Agenten wichtig. Sobald der Prompt einer Anfrage 200.000 Token erreicht, berechnet xAI den Long-Context-Tarif für alle Token in dieser Anfrage, nicht nur für den Anteil oberhalb der Schwelle. Eine Anfrage mit 199.000 Prompt-Token kann daher deutlich günstiger sein als eine mit 200.000, selbst wenn ihre Größen nahezu identisch sind.

Für Grok 4.6 ist in der aktuellen xAI-Preisdokumentation kein Batch-Rabatt aufgeführt. Teams sollten nicht davon ausgehen, dass Offline-Jobs die für bestimmte andere xAI-Modelle verfügbaren Rabatte erhalten.

Was ist Grok 4.6?

Grok 4.6 ist SpaceXAI’s neuestes Flaggschiff-Sprachmodell, veröffentlicht am 12. August 2026. Es baut direkt auf Grok 4.5 auf, mit einem längeren ergänzenden Training, das auf kuratierte modellgenerierte Daten für fortgeschrittenes Reasoning und technische Konzepte, hochwertige Engineering-Datensätze, einen verbesserten Optimierer und erweitertes Reinforcement Learning für Coding- und Wissensarbeits-Szenarien fokussiert.

Das Modell behält dieselbe zugrunde liegende Basis mit 1,5 Billionen Parametern wie sein Vorgänger; die Fortschritte stammen primär aus dem Post-Training und nicht aus einer Erhöhung der Parameterzahl. Es ist speziell darauf ausgelegt, über viele Schritte hinweg effektiv zu bleiben—sei es bei der Recherche eines Themas, der Analyse großer Informationsmengen, dem Navigieren und Bearbeiten eines unbekannten Codebestands oder dem Umsetzen einer High-Level-Idee in eine ausgereifte Anwendung bzw. ein Arbeitsartefakt. SpaceXAI betont ein verbessertes Selbstprüfungsverhalten bei Langzeitprojekten sowie stärkere Leistung bei interaktiver und visueller Arbeit.

Der Unterschied zu einem herkömmlichen Chatbot ist wichtig.

Ein konventioneller LLM-Workflow sieht so aus:

Prompt → Antwort generieren

Grok 4.6 ist für Workflows gedacht, die eher so aussehen:

Ziel → Plan → Recherche → Tools nutzen → Code ändern → Testen → Evaluieren → Fortfahren

xAI's aktuelles Positioning betont die Fähigkeit des Modells, länger an komplexen Projekten zu arbeiten, über Codebasen hinweg zu agieren, unbekannte Themen zu recherchieren, Anwendungen zu bauen und die eigene Arbeit zu verifizieren.

Dies macht Grok 4.6 besonders relevant für den rasant wachsenden Markt der AI-Coding-Agenten und autonomen Agenten.

Was sind die Hauptfunktionen von Grok 4.6?

Langlaufende Agentenfähigkeit

Die wichtigste Verbesserung in Grok 4.6 ist der Fokus auf langlaufende Aufgaben.

Statt nur auf One-Shot-Antworten zu optimieren, ist das Modell darauf ausgelegt, den Fortschritt über mehrere Phasen eines Projekts hinweg aufrechtzuerhalten.

Typische Beispiele sind:

  • Eine Anwendung entwickeln
  • Ein großes Repository debuggen
  • Ein unbekanntes Thema recherchieren
  • Mehrere Komponenten ändern
  • Tests ausführen
  • Fehler untersuchen
  • Die Implementierung überarbeiten
  • Das Endergebnis prüfen

Dies ist ein grundlegend anderes Ziel als herkömmliche Instruction-Following-Benchmarks.

Erweiterte Coding-Leistung

Coding ist einer der klarsten Verbesserungsbereiche von Grok 4.6.

Aktuelle Benchmark-Berichte zeigen:

  • 65,9 % auf DeepSWE 1.1
  • 69,9 % auf CursorBench 3.2
  • 61,3 % auf FrontierCode 1.1 Extended

Diese Bewertungen sind besonders relevant, weil sie das Verhalten von Coding-Agenten und nicht nur einfache Codevervollständigung messen.

Die Verbesserung von Grok 4.5 zu Grok 4.6 auf DeepSWE 1.1 ist besonders bemerkenswert: von etwa 54 % auf 65,9 % in dem berichteten Vergleich.

Multimodale Eingabe

Grok 4.6 unterstützt Text- und Bild-Eingaben und ermöglicht es Entwicklern, visuelle Informationen mit Reasoning zu kombinieren.

Mögliche Anwendungen umfassen:

  • Debugging per Screenshot
  • UI-Analyse
  • Diagramminterpretation
  • Dokumentenverständnis
  • Visuelle Recherche
  • Bildgestützte Coding-Aufgaben

Damit ist Grok 4.6 flexibler als ein reines textbasiertes Coding-Modell.

Der Zugriff von Grok auf Suche ist ein wichtiger Teil seines Ökosystems.

Die API unterstützt:

  • Web search
  • X search
  • Function calling
  • Code execution

Die aktuelle Grok 4.5-API-Dokumentation von xAI bestätigt diese Tool-Funktionen in der Grok-API-Umgebung.

Für Research-Agenten bedeutet dies, dass das Modell potenziell von statischem, vortrainiertem Wissen zu aktueller Informationsbeschaffung plus Reasoning übergehen kann.

Konfigurierbares Reasoning

Die Grok-API bietet konfigurierbaren Reasoning-Aufwand.

So können Entwickler abwägen zwischen:

Geschwindigkeit/Kosten ↔ Reasoning-Tiefe

Für einfache Aufgaben kann geringerer Reasoning-Aufwand unnötige Berechnungen reduzieren.

Für komplexes Coding oder Rechercheaufgaben kann höherer Reasoning-Aufwand zu überlegterem Problemlösen führen.

Kostenwettbewerbsfähige Frontier-Performance

Das Pricing von Grok 4.6 ist wohl einer seiner größten kommerziellen Vorteile.

Der gemeldete Standard-API-Preis beträgt:

  • 2 $ / 1M Eingabetoken
  • 6 $ / 1M Ausgabetoken

Das entspricht den für Grok 4.5 gemeldeten Preisen, trotz der erheblichen Fähigkeitsverbesserungen.

Das ergibt ein ungewöhnlich aggressives Kosten-/Leistungsangebot für ein Frontier-Modell.


Wie performt Grok 4.6 in Benchmarks?

Die aussagekräftigsten aktuellen Benchmark-Daten konzentrieren sich auf agentische Intelligenz und Coding.

BenchmarkGrok 4.6Was es misst
Artificial Analysis Intelligence Index61Breite Frontier-Modell-Intelligenz
CursorBench 3.269,9 %Leistung von Coding-Agenten
DeepSWE 1.165,9 %Software-Engineering-Agenten
FrontierCode 1.1 Extended61,3 %Fortgeschrittenes Coding
GDPVal-AA v21.753 EloLeistung bei Wissensarbeitsaufgaben

Der Artificial Analysis Intelligence Index Score von 61 platziert Grok 4.6 Berichten zufolge auf demselben Niveau wie GPT-5.6 Sol auf diesem Index.

Der GDPVal-AA v2 Score von 1.753 Elo ist ebenfalls bedeutsam, da GDPVal professionelle Wissensarbeitsaufgaben bewertet und nicht nur akademisches Frage-Antworten.

Die wichtigste Benchmark-Erkenntnis

Die stärksten Belege für Grok 4.6 sind nicht ein einzelner MMLU-ähnlicher Score.

Sein Benchmark-Profil weist auf:

Coding + Agenten + Wissensarbeit + langlaufende Ausführung

Genau dorthin bewegt sich die moderne KI-Entwicklung.

Für eine Website wie CometAPI ist das eine wichtige Unterscheidung: Grok 4.6 sollte primär als agentisches Frontier-Modell positioniert werden, nicht als weiterer generischer Chatbot.

Wie schneidet Grok 4.6 im Vergleich zu seinem Vorgänger und Wettbewerbern ab?

Grok 4.6 vs Grok 4.5

FeatureGrok 4.5Grok 4.6
HauptfokusAllgemeines Reasoning + AgentenLanglaufende Agenten + Coding
KontextBereitstellung der 500K-Klasse500K
EingabeText + BildText + Bild
Web searchJaJa
X searchJaJa
Code executionJaJa
Function callingJaJa
Input-Preis2 $/M2 $/M
Output-Preis6 $/M6 $/M
DeepSWE 1.1~54 %65,9 %
Intelligence Index~5661

Wichtig ist: Grok 4.6 scheint kein einfaches Preistier-Upgrade für Grok 4.5 zu sein. Es ist ein Fähigkeits-Upgrade, das stärker auf Langzeit-Agent-Workflows abzielt.

Die aktuelle Grok 4.5-Dokumentation von xAI listet das Modell mit 2 $/6 $ pro Million Token, mit konfigurierbarem Reasoning und Tool-Unterstützung.

Vergleichstabelle: Grok 4.6 vs. zentrale Wettbewerber

AspektGrok 4.6GPT-5.6 SolClaude Fable 5 / Opus 5Hinweise
AA Intelligence Index616162 / 63Komposit-Score
Eingabe/Ausgabe $/1M2 $ / 6 $~5 $ / 30 $~5 $ / 25 $Grok deutlich günstiger bei Ausgabe
Kontextfenster500KBis 1M+Oft 1M
StärkenAgenten, Coding-Effizienz, KostenBreites Reasoning, CodingLanghorizont, Safety
Cursor-IntegrationNativ, starkVerfügbarVerfügbarGrok für Cursor optimiert
Turn-EffizienzHoch (weniger Schritte)WettbewerbsfähigHöhere Schrittzahlen berichtetWichtig für Agenten
VerfügbarkeitAPI + Cursor + PartnerOffiziell + PartnerOffiziell + PartnerCometAPI vereinheitlicht Zugriff

Daten basieren auf SpaceXAI-Ankündigung, Artificial Analysis und öffentlichen Model Cards vom 13. August 2026.

Der aktuelle Artificial Analysis-Vergleich ist besonders interessant.

Grok 4.6 erzielt Berichten zufolge 61 auf dem Intelligence Index und entspricht damit GPT-5.6 Sol. Die Wirtschaftlichkeit ist jedoch sehr unterschiedlich.

Die genauen Preise konkurrierender GPT-Varianten sollten vor Veröffentlichung gegen deren aktuelle Anbieterpreise geprüft werden, aber die zentrale Marktbeobachtung ist klar: Grok 4.6 konkurriert auf Frontier-Benchmark-Niveau und hält zugleich ein vergleichsweise aggressives Token-Pricing.

Das macht Grok 4.6 besonders attraktiv für Anwendungen, bei denen hohe Ausführungsvolumina agentischer Systeme Premium-Frontier-Modelle sonst teuer machen würden.

Was sind die Einschränkungen von Grok 4.6?

500K-Kontext ist kleiner als einige Wettbewerber mit 1M-Kontext

Der gemeldete 500K-Kontext von Grok 4.6 ist groß, aber nicht das größte Kontextfenster im Frontier-Modellmarkt.

Für sehr große Repositories oder umfangreiche Dokumentensammlungen kann ein 1M-Kontextmodell im Vorteil sein.

Proprietäres Modell

Im Gegensatz zu MiMo-V2.5-Pro ist Grok 4.6 kein Open-Weight-Modell.

Entwickler können das Modell nicht herunterladen und eigenständig betreiben.

Benchmark-Vergleiche erfordern Sorgfalt

Unterschiedliche Coding-Benchmarks nutzen unterschiedliche Harnesses, Prompts, Tools und Auswertungsverfahren.

SWE-Bench Pro ist beispielsweise speziell auf realistische, langhorizontale Software-Engineering-Probleme ausgelegt, und die Benchmark-Ergebnisse können je nach Agenten-Gerüst erheblich variieren.

Daher sollte 69,9 % auf CursorBench nicht als „Grok 4.6 ist 69,9 % besser als ein anderes Modell“ interpretiert werden.

Die korrekte Interpretation ist, dass dieser Score unter dem jeweiligen Evaluations-Setup des Benchmarks erreicht wurde.

Agentenkosten können höher sein, als das Token-Pricing suggeriert

Der Token-Preis von 2 $/6 $ ist attraktiv, aber ein autonomer Agent kann enorme Tokenmengen verbrauchen durch:

  • Tool-Aufrufe
  • Wiederholte Suchen
  • Codeausführung
  • Fehlversuche
  • Langen Kontext
  • Selbstverifikation

Die realen Stückkosten hängen daher von Kosten pro erfolgreich abgeschlossenem Task ab, nicht einfach von Kosten pro Million Token.

Preis und Zugriff

Offizielle Preise (Standard-Tier, unter ~200K Prompt-Token):

  • Eingabe: 2,00 $ pro 1M Token
  • Zwischengespeicherte Eingabe: etwa 0,50 $ pro 1M Token
  • Ausgabe: 6,00 $ pro 1M Token

Eine schnellere Variante kostet das Doppelte dieser Sätze. Die Sätze können sich bei sehr langen Kontexten (≥200K) verdoppeln. Prompt Caching wird für Agent-Loops dringend empfohlen, um die Kosten niedrig zu halten.

Verfügbarkeit:

  • Cursor und Grok Build (2× enthaltene Nutzung in der ersten Woche)
  • SpaceXAI API (grok-4.6)
  • Partner: OpenRouter, Vercel, Cloudflare und andere
  • SuperGrok Chat/Apps (über Model Picker)

CometAPI Empfehlung: Für Entwickler, die bereits mehrere Frontier-Modelle nutzen (oder dies planen), bietet CometAPI nahtlosen Zugriff auf Grok 4.6 über einen einzigen OpenAI-kompatiblen Endpunkt (https://api.cometapi.com/v1). Sie erhalten einheitliches Billing, Nutzungsanalysen, wettbewerbsfähige Effektivpreise für 500+ Modelle (einschließlich GPT, Claude, Gemini, DeepSeek und Grok-Varianten) und die Möglichkeit, mit einer Einzeilenänderung zwischen Modellen zu wechseln. Das ist besonders wertvoll beim A/B-Testing von Grok 4.6 gegenüber anderen Coding- oder Agentenmodellen oder beim Aufbau von Produktionssystemen, die von Model Routing und Fallback profitieren. Melden Sie sich unter cometapi.com an, um einen kostenlosen API-Schlüssel zu erhalten und den Live-Modelkatalog zu erkunden.

Sollten Sie auf Grok 4.6 umsteigen?

Ja, wenn:

  • Sie stark mit Cursor arbeiten oder langlaufende Coding-/Wissens-Agenten bauen und eine hohe Mehrschritt-Zuverlässigkeit zu wettbewerbsfähigen Kosten möchten.
  • Token-Ökonomie wichtig ist—Grok 4.6 liefert nahezu Parität mit GPT-5.6 Sol bei etwa einem Fünftel des Ausgabetoken-Preises der teuersten Frontier-Optionen.
  • Sie Turn-Effizienz schätzen (weniger Schritte und Token zur Lösung komplexer Aufgaben).
  • Sie sofortigen Zugriff auf ein Modell wollen, das explizit für die interaktiven, visuellen und agentischen Workflows der modernen Entwicklung trainiert wurde.

In Erwägung ziehen, bei anderen Modellen zu bleiben bzw. zu mischen, wenn:

  • Ihr primärer Workload reines kompetitives Programmieren ist oder Sie spezifische Stärken geschlossener Modelle benötigen (z. B. bestimmte Claude-Langkontext- oder Safety-getunte Szenarien).
  • Sie die absolut höchsten Scores auf jedem einzelnen Software-Engineering-Benchmark unabhängig von den Kosten verlangen.
  • Sie größere Kontextfenster als 500K für Single-Call-Workloads benötigen (einige Wettbewerber bieten 1M+).

Die meisten Teams profitieren davon, Grok 4.6 parallel zum aktuellen Stack zu evaluieren. Da es über Aggregatoren wie CometAPI verfügbar ist, sind die Wechselkosten gering—ändern Sie einfach den Modellnamen und messen Sie Abschlussraten, Latenz und Kosten in Ihren eigenen Real-World-Workloads.

Fazit

Grok 4.6 ist für SpaceXAI ein bedeutender Schritt nach vorn: Frontier-Level-Intelligenz auf zentralen Komposit- und agentischen Benchmarks, spürbare Verbesserungen bei langlaufender Coding- und Wissensarbeit sowie weiterhin aggressives Pricing, das viele Closed-Source-Wettbewerber unterbietet. Die native Verfügbarkeit in Cursor, kombiniert mit hoher Mehrschritt-Zuverlässigkeit, macht es besonders attraktiv für Entwickler, die reale Software-Agenten und interaktive Anwendungen bauen.

Ob Sie direkt darauf zugreifen, über Cursor/Grok Build oder über ein einheitliches Gateway wie CometAPI—Grok 4.6 ist heute bereit für die Produktionsevaluierung. Besuchen Sie die offizielle Ankündigung unter x.ai/news/grok-4-6 für alle Details und die Model Card, vergleichen Sie es im Live-Katalog auf cometapi.com mit anderen führenden Modellen und beginnen Sie sofort mit den neuen Fähigkeiten.

Primärquellen

Überprüfen Sie stets die neuesten Preise, Ratenlimits und Benchmark-Zahlen auf den offiziellen Seiten, da sich die KI-Landschaft schnell entwickelt.

0 Aufrufe
Auf Klarheit, Quellenangabe und aktuelle API-Terminologie geprüft.

Bereit, die KI-Entwicklungskosten um 20 % zu senken?

In wenigen Minuten kostenlos starten. Inklusive kostenlosem Testguthaben. Keine Kreditkarte erforderlich.

Mehr lesen