DeepSeek V4 Pro 0813 is now live on CometAPI →

Grok 4.6 est là : résultats de benchmarks au niveau GPT-5.6 et performances en programmation

CometAPI
AnnaAug 13, 2026
Grok 4.6 est là : résultats de benchmarks au niveau GPT-5.6 et performances en programmation

TL; DR xAI a officiellement publié Grok 4.6 le 12 août 2026 et l’a rendu disponible via l’API xAI, Cursor et Grok Build. Il offre une fenêtre de contexte de 500,000 jetons, accepte le texte et les images, propose quatre niveaux d’effort de raisonnement et a une date de coupure des connaissances au 1er février 2026. Selon l’annonce officielle de Grok 4.6 par xAI, il égale GPT-5.6 Sol sur l’Artificial Analysis Intelligence Index, un composite de neuf évaluations.

La tarification API commence à $2 par million de jetons d’entrée, $0.50 par million de jetons d’entrée mis en cache et $6 par million de jetons de sortie pour les prompts en dessous de 200,000 jetons. Dès qu’un prompt atteint 200,000 jetons, l’ensemble de la requête est facturé aux tarifs long contexte, soit $4 en entrée, $1 en entrée mise en cache et $12 en sortie par million de jetons. Pour les développeurs recherchant un accès multi-modèles flexible, des plateformes comme CometAPI facilitent l’intégration de Grok 4.6 aux côtés d’autres modèles de pointe. Le prix de l’API est à 80% du prix de xAI.

Points clés à retenir

  • xAI a officiellement publié Grok 4.6 le 12 août 2026 ; les rapports antérieurs de fenêtre de sortie sont désormais obsolètes.
  • L’ID de modèle API est , et le modèle est également disponible dans Cursor et Grok Build.grok-4.6
  • Sa fenêtre de contexte est de 500K jetons, avec entrée texte et image et sortie texte uniquement.
  • La tarification standard en dessous de 200K jetons de prompt est de $2/M en entrée, $0.50/M en entrée mise en cache et $6/M en sortie.
  • Un prompt de 200K jetons ou plus déclenche des tarifs plus élevés pour tous les jetons de cette requête, pas seulement ceux au-dessus du seuil.
  • L’effort de raisonnement peut être réglé sur low, medium, high ou xhigh ; est la valeur par défaut documentée.
  • Grok 4.6 égale GPT-5.6 Sol sur l’Artificial Analysis Intelligence Index (score de 61) et affiche de forts gains par rapport à Grok 4.5 sur le codage agentique, le travail de connaissance et les tâches à long horizon.
  • Grok Imagine Image 2.0 est une API distincte de génération d’images. Grok 4.6 peut comprendre des images mais ne renvoie pas lui-même d’images générées.

Spécifications et prix de Grok 4.6 en un coup d’œil

Les spécifications suivantes sont confirmées dans la documentation des modèles xAI et les notes de version du 12 août.

SpécificationGrok 4.6
Date de sortie officielle12 août 2026
ID du modèle APIgrok-4.6
PositionnementModèle phare pour le codage, les agents et les charges générales
Fenêtre de contexte500,000 jetons
EntréesTexte et images
SortieTexte
Limite documentée de sortie texteAucune limite de sortie texte indiquée par xAI
Contrôles de raisonnementLow, medium, high et xhigh
Effort de raisonnement par défautHigh
Date de coupure des connaissances1er février 2026
Accès API natifDisponible
Accès aux outils de codageCursor et Grok Build
Accès à l’actualitéNécessite les outils Web Search ou X Search

Tarification officielle de l’API xAI

La grille de tarification actuelle de xAI sépare les requêtes à court contexte et à long contexte.

Taille du promptEntrée par 1M de jetonsEntrée mise en cache par 1M de jetonsSortie par 1M de jetons
En dessous de 200,000 jetons$2.00$0.50$6.00
200,000 jetons ou plus$4.00$1.00$12.00

Le seuil est particulièrement important pour les agents sur codebase. Lorsque le prompt de la requête atteint 200,000 jetons, xAI facture le tarif long contexte pour tous les jetons de cette requête, pas seulement la portion dépassant le seuil. Une requête contenant 199,000 jetons de prompt peut donc coûter sensiblement moins cher qu’une contenant 200,000, même si leurs tailles sont presque identiques.

Aucune remise par lot n’est indiquée pour Grok 4.6 dans la documentation de tarification actuelle de xAI. Les équipes ne doivent pas supposer que les travaux hors ligne bénéficient des remises disponibles pour certains autres modèles xAI.

Qu’est-ce que Grok 4.6 ?

Grok 4.6 est le dernier modèle linguistique de pointe de SpaceXAI, publié le 12 août 2026. Il s’appuie directement sur Grok 4.5 en appliquant une phase d’entraînement supplémentaire plus longue, centrée sur des données générées par modèle et soigneusement sélectionnées pour le raisonnement avancé et les concepts techniques, des jeux de données d’ingénierie de haute qualité, un optimiseur amélioré et un renforcement élargi pour les scénarios de codage et de travail de connaissance.

Le modèle conserve la même base sous-jacente à 1.5 trillion de paramètres que son prédécesseur ; les gains proviennent principalement de la post-formation plutôt que d’une augmentation de l’échelle des paramètres. Il est conçu spécifiquement pour rester efficace sur de nombreuses étapes — qu’il s’agisse de rechercher un sujet, d’analyser de grandes quantités d’informations, de naviguer et de modifier une base de code inconnue, ou de transformer une idée de haut niveau en application ou livrable abouti. SpaceXAI met l’accent sur un comportement d’auto-vérification amélioré sur les projets à long horizon et des performances renforcées sur les travaux interactifs et visuels.

La différence avec un chatbot traditionnel est importante.

Un flux de travail LLM classique ressemble à :

Prompt → Générer une réponse

Grok 4.6 est conçu pour des flux de travail plus proches de :

Objectif → Plan → Rechercher → Utiliser des outils → Modifier le code → Tester → Évaluer → Continuer

Le positionnement actuel de xAI met en avant la capacité du modèle à rester plus longtemps sur des projets complexes, à travailler sur des bases de code, à rechercher des sujets inconnus, à construire des applications et à vérifier son propre travail.

Cela rend Grok 4.6 particulièrement pertinent pour le marché en forte expansion des agents de codage IA et des agents autonomes.

Quelles sont les principales fonctionnalités de Grok 4.6 ?

Capacité d’agent longue durée

L’amélioration la plus importante de Grok 4.6 est son focus sur les tâches de longue durée.

Plutôt que d’optimiser uniquement pour des réponses en un coup, le modèle est conçu pour maintenir les progrès à travers plusieurs étapes d’un projet.

Exemples typiques :

  • Construire une application
  • Déboguer un dépôt volumineux
  • Rechercher un sujet inconnu
  • Modifier plusieurs composants
  • Exécuter des tests
  • Enquêter sur les échecs
  • Réviser l’implémentation
  • Vérifier le résultat final

C’est une cible fondamentalement différente des benchmarks de suivi d’instructions traditionnels.

Performances de codage avancées

Le codage est l’un des domaines d’amélioration les plus clairs de Grok 4.6.

Les rapports de benchmark actuels indiquent :

  • 65.9% sur DeepSWE 1.1
  • 69.9% sur CursorBench 3.2
  • 61.3% sur FrontierCode 1.1 Extended

Ces évaluations sont particulièrement pertinentes car elles ciblent le comportement d’agent de codage plutôt qu’un simple autocomplétion de code.

L’amélioration de Grok 4.5 à Grok 4.6 sur DeepSWE 1.1 est particulièrement notable, passant d’environ 54% à 65.9% dans la comparaison rapportée.

Entrée multimodale

Grok 4.6 prend en charge les entrées texte et image, permettant aux développeurs de combiner l’information visuelle avec le raisonnement.

Applications potentielles :

  • Débogage à partir de captures d’écran
  • Analyse d’interface utilisateur
  • Interprétation de graphiques
  • Compréhension de documents
  • Recherche visuelle
  • Tâches de codage basées sur l’image

Cela rend Grok 4.6 plus flexible qu’un modèle de codage purement textuel.

L’accès de Grok à la recherche est une partie significative de son écosystème.

L’API prend en charge :

  • Web search
  • X search
  • Appels de fonctions
  • Exécution de code

La documentation actuelle de l’API Grok 4.5 de xAI confirme ces capacités d’outillage dans l’environnement API de Grok.

Pour les agents de recherche, cela signifie que le modèle peut potentiellement passer d’une connaissance pré-entraînée statique à un rappel d’information à jour plus raisonnement.

Raisonnement configurable

L’API de Grok expose un effort de raisonnement configurable.

Cela permet aux développeurs d’arbitrer entre :

vitesse / coût ↔ profondeur de raisonnement

Pour les tâches simples, un niveau de raisonnement plus faible peut réduire le calcul inutile.

Pour les tâches complexes de codage ou de recherche, un raisonnement plus élevé peut fournir une résolution de problèmes plus délibérée.

Performance de pointe à coût compétitif

La tarification de Grok 4.6 est sans doute l’un de ses avantages commerciaux les plus forts.

Le prix standard de l’API rapporté est :

  • $2 / 1M de jetons d’entrée
  • $6 / 1M de jetons de sortie

Il s’agit du même prix que celui rapporté pour Grok 4.5, malgré les améliorations significatives de capacité.

Cela crée une proposition coût/performance exceptionnellement agressive pour un modèle de pointe.


Comment Grok 4.6 se comporte-t-il sur les benchmarks ?

Les données de benchmark les plus utiles se concentrent autour de l’intelligence agentique et du codage.

BenchmarkGrok 4.6Ce que cela mesure
Artificial Analysis Intelligence Index61Intelligence des modèles de pointe
CursorBench 3.269.9%Performances d’agent de codage
DeepSWE 1.165.9%Agents d’ingénierie logicielle
FrontierCode 1.1 Extended61.3%Codage avancé
GDPVal-AA v21,753 EloPerformances sur tâches de travail de connaissance

Le score de 61 à l’Artificial Analysis Intelligence Index place apparemment Grok 4.6 au même niveau que GPT-5.6 Sol sur cet index.

Le score 1,753 Elo sur GDPVal-AA v2 est également significatif car GDPVal évalue des tâches professionnelles de travail de connaissance plutôt qu’un simple questionnement académique.

La conclusion importante des benchmarks

La preuve la plus solide pour Grok 4.6 n’est pas un score isolé de type MMLU.

Son profil de benchmark s’oriente vers :

codage + agents + travail de connaissance + exécution longue

C’est exactement là où se dirige le développement moderne de l’IA.

Pour un site comme CometAPI, c’est une distinction importante à préserver : Grok 4.6 devrait être commercialisé principalement comme un modèle de frontière agentique, et non comme un autre chatbot générique.

Comment Grok 4.6 se compare-t-il à son prédécesseur et à ses concurrents ?

Grok 4.6 vs Grok 4.5

CaractéristiqueGrok 4.5Grok 4.6
Focus principalRaisonnement général + agentsAgents longue durée + codage
ContexteDéploiement classe 500K500K
EntréeTexte + imageTexte + image
Recherche WebOuiOui
Recherche XOuiOui
Exécution de codeOuiOui
Appels de fonctionsOuiOui
Prix entrée$2/M$2/M
Prix sortie$6/M$6/M
DeepSWE 1.1~54%65.9%
Intelligence Index~5661

Le point important est que Grok 4.6 ne semble pas être un simple remplacement par palier de prix pour Grok 4.5. C’est une mise à niveau de capacité davantage orientée vers les flux de travail d’agents à long horizon.

La documentation actuelle de Grok 4.5 chez xAI liste le modèle à $2/$6 par million de jetons, avec un raisonnement configurable et un support d’outils.

Tableau comparatif : Grok 4.6 vs principaux concurrents

AspectGrok 4.6GPT-5.6 SolClaude Fable 5 / Opus 5Notes
AA Intelligence Index616162 / 63Score composite
Entrée / Sortie $/1M$2 / $6~$5 / $30~$5 / $25Grok bien moins cher en sortie
Fenêtre de contexte500KJusqu’à 1M+Souvent 1M
AtoutsAgents, efficacité en codage, coûtRaisonnement large, codageLong horizon, sécurité
Intégration CursorNative, forteDisponibleDisponibleGrok optimisé pour Cursor
Efficacité par tourÉlevée (moins d’étapes)CompétitiveNombre d’étapes plus élevé rapportéImportant pour les agents
DisponibilitéAPI + Cursor + partenairesOfficiel + partenairesOfficiel + partenairesCometAPI unifie l’accès

Données tirées de l’annonce de SpaceXAI, d’Artificial Analysis et des fiches publiques des modèles au 13 août 2026.

La comparaison actuelle d’Artificial Analysis est particulièrement intéressante.

Grok 4.6 obtient apparemment 61 sur l’Intelligence Index, égalant GPT-5.6 Sol. Mais l’économie est très différente.

La tarification exacte des variantes GPT concurrentes doit être vérifiée sur la grille tarifaire actuelle de leur fournisseur avant publication, mais l’observation clé du marché est claire : Grok 4.6 concurrence au niveau des modèles de pointe tout en maintenant un prix par jeton relativement agressif.

Cela rend Grok 4.6 particulièrement attractif pour les applications où une exécution agentique à grand volume rendrait autrement les modèles de pointe haut de gamme coûteux.

Quelles sont les limites de Grok 4.6 ?

Un contexte 500K plus petit que certains concurrents à 1M

Le contexte de 500K de Grok 4.6 est important, mais ce n’est pas la fenêtre la plus grande du marché des modèles de pointe.

Pour des dépôts très volumineux ou des ensembles de documents énormes, un modèle à 1M de contexte peut avoir un avantage.

Modèle propriétaire

Contrairement à MiMo-V2.5-Pro, Grok 4.6 n’est pas un modèle à poids ouverts.

Les développeurs ne peuvent pas télécharger le modèle et le déployer de manière indépendante.

Les comparaisons de benchmarks demandent de la prudence

Les différents benchmarks de codage utilisent des harnais, des prompts, des outils et des procédures d’évaluation différents.

Par exemple, SWE-Bench Pro est spécifiquement conçu autour de problèmes réalistes d’ingénierie logicielle à long horizon, et les résultats peuvent varier substantiellement selon l’échafaudage d’agent.

Par conséquent, 69.9% sur CursorBench ne doit pas être interprété comme “Grok 4.6 est 69.9% meilleur qu’un autre modèle.”

L’interprétation correcte est qu’il a obtenu ce score dans le cadre de la configuration particulière du benchmark.

Le coût d’un agent peut être plus élevé que ne le suggère le prix par jeton

Le prix de $2/$6 est attractif, mais un agent autonome peut consommer un nombre énorme de jetons via :

  • Appels d’outils
  • Recherches répétées
  • Exécution de code
  • Tentatives échouées
  • Contexte long
  • Auto-vérification

L’économie unitaire réelle dépend donc du coût par tâche complétée avec succès, et non simplement du coût par million de jetons.

Prix et accès

Tarification officielle (palier standard, en dessous d’environ 200K jetons de prompt) :

  • Entrée : $2.00 par 1M de jetons
  • Entrée mise en cache : environ $0.50 par 1M de jetons
  • Sortie : $6.00 par 1M de jetons

Une variante plus rapide est facturée au double de ces tarifs. Les tarifs peuvent doubler pour les contextes très longs (≥200K). Le cache de prompts est fortement recommandé pour les boucles d’agent afin de maintenir les coûts bas.

Disponibilité :

  • Cursor et Grok Build (2× d’utilisation incluse la première semaine)
  • API SpaceXAI (grok-4.6)
  • Partenaires : OpenRouter, Vercel, Cloudflare, et autres
  • SuperGrok chat/apps (via le sélecteur de modèle)

Recommandation CometAPI : Pour les développeurs qui utilisent (ou prévoient d’utiliser) plusieurs modèles de pointe, CometAPI offre un accès fluide à Grok 4.6 via un point de terminaison compatible OpenAI (https://api.cometapi.com/v1). Vous bénéficiez d’une facturation unifiée, d’analyses d’usage, de tarifs effectifs compétitifs sur plus de 500 modèles (y compris GPT, Claude, Gemini, DeepSeek et variantes Grok), et de la possibilité de changer de modèle en une ligne. C’est particulièrement précieux pour l’A/B testing de Grok 4.6 face à d’autres modèles de codage ou d’agent, ou pour construire des systèmes de production tirant parti du routage et du repli de modèles. Inscrivez-vous sur cometapi.com pour obtenir une clé API gratuite et explorer le catalogue en direct.

Devriez-vous passer à Grok 4.6 ?

Oui, si :

  • Vous travaillez beaucoup dans Cursor ou construisez des agents de codage/travail de connaissance longue durée et souhaitez une fiabilité multi-étapes solide à coût compétitif.
  • L’économie de jetons compte — Grok 4.6 offre une intelligence quasi-paritaire avec GPT-5.6 Sol pour environ un cinquième du prix par jeton de sortie des options de pointe les plus chères.
  • Vous valorisez l’efficacité par tour (moins d’étapes et de jetons pour mener à bien des tâches complexes).
  • Vous voulez un accès immédiat à un modèle explicitement entraîné pour les flux de travail interactifs, visuels et agentiques courants dans le développement moderne.

Envisagez de rester avec ou de mixer d’autres modèles si :

  • Votre charge principale est de la programmation compétitive pure ou bénéficie de forces spécifiques de modèles fermés (par ex., certains scénarios long contexte ou de sécurité chez Claude).
  • Vous exigez les scores les plus élevés sur chaque benchmark individuel d’ingénierie logicielle, quel qu’en soit le coût.
  • Vous avez besoin de fenêtres de contexte plus grandes que 500K pour des appels uniques (certains concurrents offrent 1M+).

La plupart des équipes gagneront à évaluer Grok 4.6 côte à côte avec leur pile actuelle. Étant donné qu’il est disponible via des agrégateurs comme CometAPI, le coût de bascule est faible — changez simplement le nom du modèle et mesurez le taux de réussite, la latence et le coût sur vos propres charges.

Conclusion

Grok 4.6 représente une avancée significative pour SpaceXAI : une intelligence de niveau frontière sur des benchmarks composites et agentiques clés, des améliorations sensibles sur le codage longue durée et le travail de connaissance, et une tarification agressive qui sous-cut beaucoup de concurrents propriétaires. Sa disponibilité native dans Cursor, combinée à une fiabilité multi-étapes, le rend particulièrement attractif pour les développeurs construisant des agents logiciels et des applications interactives réelles.

Que vous y accédiez directement, via Cursor/Grok Build, ou via une passerelle unifiée comme CometAPI, Grok 4.6 est prêt pour une évaluation en production dès aujourd’hui. Visitez l’annonce officielle sur x.ai/news/grok-4-6 pour les détails complets et la fiche du modèle, explorez le catalogue en direct sur cometapi.com pour le comparer côte à côte avec d’autres modèles leaders, et commencez à bâtir avec ses nouvelles capacités immédiatement.

Sources principales

Vérifiez toujours les derniers prix, limites de taux et chiffres de benchmark sur les pages officielles, car le paysage de l’IA évolue rapidement.

0 vues
Revu pour la clarté, l'attribution des sources et la terminologie API actuelle.

Prêt à réduire vos coûts de développement IA de 20 % ?

Démarrez gratuitement en quelques minutes. Crédits d'essai offerts. Aucune carte bancaire requise.

En savoir plus