GPT-6 Sol, GPT-6 Luna, and Claude Opus 5.5 are now live on CometAPI →
technology/Recherche CometAPI

Grok 4.7 : Benchmarks, Tarification, Fonctionnalités et Accès à l'API

Découvrez ce qu'est Grok 4.7, y compris sa fenêtre de contexte de 500K, ses benchmarks, sa tarification, ses modes de raisonnement, ses capacités d'agent, la comparaison avec Grok 4.6 et l'accès

CometAPI
Deon GoodwinÉquipe de recherche sur les modèles IA et API
Mis à jour Sep 22, 2026 15 min de lecture
Grok 4.7 : Benchmarks, Tarification, Fonctionnalités et Accès à l'API
Utiliser ce modèle

Passez le premier appel API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Grok 4.7 est le modèle de pointe de SpaceXAI pour le codage, les workflows agents et le travail professionnel de connaissance, publié le 21 septembre 2026. Il combine une fenêtre de contexte de 500 000 tokens, des entrées texte et image, un raisonnement configurable, l’appel de fonctions, la recherche Web et sur X, et l’exécution de code.

Pour les prompts inférieurs à 200 000 tokens, l’API officielle xAI indique 2 $ par million de tokens d’entrée, 0,50 $ par million de tokens d’entrée mis en cache et 6 $ par million de tokens de sortie. CometAPI indique actuellement Grok 4.7 à 1,60 $ en entrée, 0,40 $ pour l’entrée mise en cache et 4,80 $ en sortie par million de tokens pour le même palier — soit une réduction de 20 % par rapport aux tarifs officiels affichés sur sa page modèle.

La proposition de valeur pratique n’est pas le leadership universel sur les benchmarks. Grok 4.7 est le plus convaincant lorsqu’une charge de travail combine des tâches d’ingénierie, de longues boucles d’agents, l’utilisation d’outils, de grands contextes de travail et une sensibilité au coût des tokens de sortie. Les équipes doivent le valider sur leurs propres dépôts et workflows avant un routage en production.

Points clés

  • Grok 4.7 utilise un modèle de base plus grand que Grok 4.6, un apprentissage par renforcement plus long sur des tâches plus difficiles et une auto-vérification renforcée.
  • L’API prend en charge une fenêtre de contexte de 500 000 tokens, des entrées texte et image, une sortie texte, quatre niveaux de raisonnement, une sortie structurée, l’appel de fonctions, la recherche Web et X, et l’exécution de code.
  • SpaceXAI rapporte 46,3 % sur CursorBench 4.0, 71,0 % sur DeepSWE v1.1 et 38,0 % sur Terminal-Bench 4.0. Ce sont des résultats publiés par le fournisseur, pas une preuve d’un leadership universel.
  • CometAPI liste Grok 4.7 comme disponible, avec un endpoint compatible OpenAI et des prix 20 % inférieurs aux tarifs xAI officiels affichés dans son catalogue actuel.
  • Choisissez Grok 4.7 pour des agents d’ingénierie sensibles au coût et un usage soutenu des outils ; choisissez des alternatives lorsque des contextes très longs ou un domaine critique pour les benchmarks comptent davantage que le prix unitaire.

Qu’est-ce que Grok 4.7 ?

Grok 4.7 est le dernier grand modèle de langage de pointe de SpaceXAI, positionné pour le codage, les tâches d’agents autonomes et le travail professionnel de connaissance. La version se concentre sur des tâches nécessitant une interaction soutenue, l’utilisation d’outils, la vérification et la révision plutôt que de simples réponses en one-shot.

SpaceXAI indique que Grok 4.7 a été entraîné avec un apprentissage par renforcement plus long sur un mix de tâches plus difficiles, pondéré vers des problèmes pouvant prendre de nombreuses heures à résoudre. Cette orientation rend le modèle particulièrement pertinent pour l’ingénierie logicielle au niveau des dépôts, le débogage, la recherche, la création de documents, l’analyse d’ingénierie et l’automatisation multi-étapes.

En quoi Grok 4.7 est-il différent de — et meilleur que — Grok 4.6 ?

Un modèle de base plus grand

Grok 4.7 adopte un modèle de base plus grand que Grok 4.6. SpaceXAI n’a pas divulgué de nombre de paramètres public finalisé ; la conclusion défendable est donc une capacité accrue du modèle de base — et non une estimation spécifique du nombre de paramètres.

Un apprentissage par renforcement plus long sur des tâches plus difficiles

La phase d’apprentissage par renforcement a été prolongée et orientée vers des problèmes plus difficiles et à plus long horizon. SpaceXAI met l’accent sur des tâches pouvant nécessiter des heures de travail, alignant le modèle avec le codage autonome, la recherche et les workflows d’agents professionnels.

Une auto-vérification renforcée

Grok 4.7 est entraîné à inspecter son propre travail plus soigneusement. Cela compte en ingénierie logicielle, car un agent fiable doit inspecter, modifier, tester, diagnostiquer les échecs, réviser et valider de manière répétée — pas seulement produire une première réponse.

Améliorations mesurées par rapport à Grok 4.6

DimensionGrok 4.6Grok 4.7Changement
CursorBench 4.040,4 %46,3 %+5,9 pts
DeepSWE v1.165,2 %71,0 %+5,8 pts
EEBench53,0 %64,0 %+11,0 pts
AA Briefcase v1.11 5461 657+111
Terminal-Bench 4.020,3 %38,0 %+17,7 pts
Harvey Legal Agent Benchmark15,8 %19,6 %+3,8 pts
HealthBench Professional48,5 %56,7 %+8,2 pts

Sur l’ensemble publié au lancement, Grok 4.7 progresse par rapport à Grok 4.6 sur chaque résultat listé. Le plus grand gain absolu est sur Terminal-Bench 4.0, cohérent avec l’accent de la version sur les workflows en ligne de commande et l’utilisation d’outils de longue durée. Ces chiffres restent publiés par le fournisseur et doivent être testés sur des tâches réelles avant une décision de migration.

Quel est le niveau de Grok 4.7 sur les benchmarks ?

L’évaluation de lancement de SpaceXAI couvre l’ingénierie logicielle, le travail en terminal, les tâches bureautiques professionnelles, le travail juridique, le raisonnement clinique et le génie électrique. Ce sont des résultats publiés par le fournisseur et doivent être validés par rapport aux charges de travail de production avant les décisions d’achat ou de routage.

BenchmarkGrok 4.7 xHighGrok 4.6 HighGPT-5.6 Sol MaxFable 5.1 Max
CursorBench 4.046,3 %40,4 %41,7 %51,8 %
DeepSWE v1.171,0 %*65,2 %72,7 %70,0 %
EEBench64,0 %53,0 %39,4 %56,4 %
AA Briefcase v1.11 6571 5461 4871 678
Terminal-Bench 4.038,0 %20,3 %37,3 %57,9 %
Harvey Legal Agent Benchmark19,6 %15,8 %2,5 %6,7 %
HealthBench Professional56,7 %48,5 %60,5 %62,1 %

Dans ses résultats de lancement de Grok 4.7, SpaceXAI signale le score DeepSWE v1.1 de 71,0 % comme un effort de raisonnement élevé.

L’annonce de lancement ne divulgue pas chaque harnais par benchmark, la configuration des outils, le nombre d’exécutions ou l’environnement d’évaluation. Considérez ces valeurs comme publiées par le fournisseur et validez le modèle sur vos propres dépôts, outils, objectifs de latence et critères d’échec avant de router du travail en production.

Que montre le profil de benchmarks de Grok 4.7 ?

Génie logiciel

CursorBench 4.0 passe de 40,4 % sur Grok 4.6 à 46,3 % sur Grok 4.7, tandis que DeepSWE v1.1 passe de 65,2 % à 71,0 %. Cela soutient le positionnement de Grok 4.7 comme un modèle pour des agents de codage plutôt que pour une simple assistance conversationnelle de code.

Travail en terminal de longue durée

Terminal-Bench 4.0 montre l’un des plus grands changements générationnels : 20,3 % pour Grok 4.6 contre 38,0 % pour Grok 4.7. Le gain absolu de 17,7 points est cohérent avec l’accent mis par SpaceXAI sur l’APR à plus long horizon et l’auto-vérification.

Génie électrique

Sur EEBench, Grok 4.7 atteint 64,0 %, contre 53,0 % pour Grok 4.6. Parmi les comparaisons publiées, c’est l’un des résultats relatifs les plus forts de Grok 4.7.

Travail professionnel de connaissance

AA Briefcase v1.1 passe de 1 546 à 1 657. Ces tâches sont conçues pour refléter un travail professionnel de plusieurs heures impliquant des livrables tels que des documents, des présentations, des analyses et d’autres artefacts structurés.

Grok 4.7 vs GPT-5.6 Sol vs Fable 5.1 : comment se comparent-ils ?

Vérification des tarifs natifs des fournisseurs : OpenAI indique GPT-5.6 Sol à 4 $ par million de tokens d’entrée et 20 $ par million de tokens de sortie, tandis qu’Anthropic indique Claude Fable 5.1 à 10 $ par million de tokens d’entrée et 50 $ par million de tokens de sortie.

DimensionGrok 4.7GPT-5.6 SolClaude Fable 5.1
Positionnement principalCodage, tâches agents et travail de connaissanceRaisonnement professionnel complexe et codageAgents longue durée, codage et travail de connaissance
Fenêtre de contexte500 000 tokens1 050 000 tokens1 000 000 tokens
ModalitésEntrée texte et image ; sortie texteEntrée texte et image ; sortie texteEntrée texte et image ; sortie texte
Contrôle du raisonnementLow, medium, high, xhighNone through maxAdaptive thinking avec effort configurable
Statut de l’API fournisseurDisponible sur l’API publique xAIDisponible via OpenAI Chat Completions and ResponsesDisponible via l’API Claude et les marketplaces cloud prises en charge
Prix d’entrée / 1M tokens2 $4 $10 $
Prix de sortie / 1M tokens6 $20 $50 $
CursorBench 4.046,3 %41,7 %51,8 %
DeepSWE v1.171,0 %72,7 %70,0 %
Meilleure adéquationAgents d’ingénierie sensibles au prix et usage soutenu des outilsRaisonnement pro large avec très long contextePerformance maximale d’agent longue durée, codage, ou raisonnement clinique

Quel modèle choisir ?

  • Choisissez Grok 4.7 lorsque les charges d’ingénierie, l’usage soutenu des outils, le raisonnement configurable et un coût plus faible des tokens de sortie sont prioritaires. Il est particulièrement attractif pour les agents de dépôt, les workflows terminal et la recherche à grand contexte qui reste sous le seuil de tarification de 200 000.
  • Choisissez GPT-5.6 Sol lorsque la tâche requiert un raisonnement professionnel plus large, une fenêtre de contexte au-dessus d’un million de tokens, ou lorsque sa meilleure performance sur une évaluation critique métier telle que DeepSWE ou le raisonnement clinique a été validée dans votre propre harnais.
  • Choisissez Claude Fable 5.1 lorsque la performance maximale d’agent longue durée, la qualité de codage, l’exécution en terminal ou le raisonnement clinique justifient son prix par token plus élevé.
  • Utilisez le routage de modèles lorsque les charges varient. Routez les étapes d’agent de routine et à fort volume vers le modèle qualifié le plus économique, et réservez un modèle plus coûteux pour les tâches où les taux de réussite mesurés justifient la prime.

Le bon choix dépend du succès de la tâche de bout en bout, de la latence, des réessais, de la précision des appels d’outils et du retravail humain — pas d’un seul benchmark ni d’un tarif d’entrée affiché.

Combien coûte l’API Grok 4.7 ?

Le tableau ci-dessous compare les tarifs officiels xAI avec les prix affichés sur la page modèle Grok 4.7 de CometAPI au 22 septembre 2026. CometAPI annonce une remise de 20 % ; vérifiez les prix en direct avant la production, car les prix des passerelles et les conditions promotionnelles peuvent changer.

Palier de promptType de prixxAI officielCometAPIDifférence
Moins de 200K tokensInput / 1M2,00 $1,60 $inférieur de 20 %
Cached input / 1M0,50 $0,40 $20 % inf.
Output / 1M6,00 $4,80 $20 % inf.
Plus de 200K tokensInput / 1M4,00 $3,20 $inférieur de 20 %
Cached input / 1M1,00 $0,80 $20 % inf.
Output / 1M12,00 $9,60 $20 % inf.

Tarification contexte standard pour des prompts jusqu’à 200 000 tokens

Pour les requêtes dont le prompt n’excède pas 200 000 tokens, Grok 4.7 coûte 2 $ par million de tokens d’entrée, 0,50 $ par million de tokens d’entrée mis en cache et 6 $ par million de tokens de sortie. L’entrée mise en cache est la catégorie la moins coûteuse ; ainsi, les applications avec des instructions système répétées ou un contexte réutilisable peuvent réduire le coût lorsque ces tokens sont éligibles au cache.

Par exemple, une requête utilisant 100 000 tokens d’entrée non mis en cache et produisant 10 000 tokens de sortie coûterait environ 0,26 $ avant tout autre frais de plateforme : 0,20 $ pour l’entrée plus 0,06 $ pour la sortie.

Tarification long contexte au-delà de 200 000 tokens de prompt

Une fois que le prompt dépasse 200 000 tokens, les tarifs doublent à 4 $ par million de tokens d’entrée, 1 $ par million de tokens d’entrée mis en cache et 12 $ par million de tokens de sortie. Le palier supérieur s’applique en raison de la longueur du prompt ; les équipes doivent donc surveiller l’historique de conversation accumulé, les traces d’outils, les documents récupérés et le contexte de dépôt avant d’envoyer chaque requête.

La décision de coût pratique n’est donc pas seulement le nombre de tokens utilisés par une tâche, mais aussi si le prompt franchit la barre des 200 000 tokens. Résumer le travail achevé, supprimer les sorties d’outils obsolètes et ne récupérer que les fichiers les plus pertinents peuvent maintenir des charges adaptées dans le palier standard sans sacrifier le contexte nécessaire.

Les notes de version SpaceXAI documentent ce seuil. Les budgets de production doivent aussi tenir compte des réessais, des boucles d’agent, des appels d’outils échoués et de la longueur de sortie, plutôt que de comparer les fournisseurs uniquement sur leur prix d’entrée affiché.

Qu’est-ce qui rend Grok 4.7 utile pour les agents IA ?

  • Fenêtre de contexte de 500K : contient un volume important de code source, spécifications, sorties d’outils, journaux et historique de conversation dans un même contexte de travail. Utile pour le codage à l’échelle d’un dépôt et l’analyse multi-document, bien que le contexte doive toujours être élagué activement.
  • Raisonnement configurable : les applications peuvent sélectionner un effort faible, moyen, élevé ou xhigh, en échangeant latence et calcul contre un raisonnement plus profond selon la difficulté de la tâche.
  • Appel de fonctions et sortie structurée : les agents peuvent interroger des bases de données, exécuter des tests, inspecter des documents, appeler des API internes et renvoyer des résultats lisibles par machine.
  • Recherche Web et sur X : les outils de recherche peuvent récupérer des informations à jour lorsque les données d’entraînement du modèle sont insuffisantes. Le contenu récupéré doit néanmoins être traité comme non fiable et vérifié.
  • Exécution de code : le modèle peut valider des calculs, transformer des données et tester des solutions générées au lieu de s’appuyer uniquement sur l’inférence du modèle linguistique.
  • Focalisation sur les workflows à long horizon : l’accent d’entraînement sur des tâches de plusieurs heures, la gestion du contexte et l’auto-vérification cible des boucles d’agent qui accumulent des traces d’outils et nécessitent une reprise après échec.

Comment Grok 4.7 améliore-t-il la sécurité ?

SpaceXAI indique que Grok 4.7 introduit une pile de protections entièrement nouvelle et rapporte une résistance plus forte aux jailbreaks et une sécurité dual-use accrue. Dans l’annonce de lancement, l’entreprise rapporte 62,4 % sur le benchmark biosécurité de LatchBio et affirme que seulement 3,3 % des prompts dual-use à risque ont été autorisés sur HackerBench v0.3.

Ces chiffres sont des évaluations publiées par le fournisseur. Ils sont utiles pour comprendre les revendications de la version mais ne doivent pas être considérés comme une mesure universelle des performances de sécurité en conditions réelles.

Comment les développeurs peuvent-ils utiliser l’API Grok 4.7 ?

Grok 4.7 est actuellement disponible via CometAPI sous l’identifiant de modèle grok-4.7. CometAPI fournit un endpoint compatible OpenAI, une clé API et une facturation uniques à travers plusieurs fournisseurs de modèles, des tests et un routage côte à côte plus faciles, et des prix actuellement listés 20 % en dessous des tarifs xAI officiels. Avant l’usage en production, confirmez la page modèle en direct, l’état du endpoint, les paramètres pris en charge, les prix et les exigences de traitement des données.

Exemple de requête CometAPI :

curl "https://api.cometapi.com/v1/responses" \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $COMETAPI_KEY" \
  -d '{
    "model": "grok-4.7",
    "input": "Explain how a distributed task queue handles worker failure."
  }'

Faut-il passer à Grok 4.7 ?

Pour les utilisateurs actuels de Grok 4.6 qui dépendent d’agents de codage ou de workflows professionnels de longue durée, Grok 4.7 est une candidature à mise à niveau significative, car l’ensemble de benchmarks de lancement s’améliore sur chaque dimension rapportée, tandis que la tarification standard des tokens reste au même niveau 2 $/6 $ en dessous du seuil long contexte.

Pour les utilisateurs d’autres modèles de pointe, la décision dépend de la charge de travail. Grok 4.7 est particulièrement intéressant lorsque le coût des tokens de sortie, les charges d’ingénierie, les grands contextes et l’usage soutenu des outils comptent. Là où un autre modèle est plus fort sur un domaine critique, le routage de modèles peut être plus rationnel que de remplacer tous les modèles par un seul fournisseur.

Conclusion

Grok 4.7 est plus qu’une simple mise à jour numérique de Grok 4.6. La version est explicitement orientée vers un travail de longue durée réalisé via des outils, des vérifications répétées, de grands contextes et plusieurs étapes d’exécution.

Les gains générationnels les plus forts apparaissent là où cette direction d’entraînement devrait compter : Terminal-Bench 4.0 passe de 20,3 % à 38,0 %, EEBench de 53,0 % à 64,0 %, et CursorBench 4.0 de 40,4 % à 46,3 %, tandis que la tarification standard en dessous du seuil de prompt à 200K reste à 2 $/M en entrée et 6 $/M en sortie.

La proposition de valeur pratique n’est donc pas “Grok 4.7 gagne tous les benchmarks.” C’est que Grok 4.7 réduit l’écart entre la capacité d’agent de classe frontière et une inférence moins coûteuse, le rendant particulièrement pertinent pour les agents de codage, les systèmes de recherche et les workflows professionnels qui doivent opérer pendant de nombreuses étapes plutôt que de répondre une seule fois.

Continuer à apprendre

Reliez cet article à la décision suivante.

Voir tous les sujets
Publié le Sep 22, 2026
Dernière mise à jour Sep 22, 2026
21 vues
Revu pour la clarté, l'attribution des sources et la terminologie API actuelle.

Prêt à réduire vos coûts de développement IA de 20 % ?

Démarrez gratuitement en quelques minutes. Crédits d'essai offerts. Aucune carte bancaire requise.

En savoir plus