Répondez d’abord
GPT-6 Astra est le nouveau modèle phare d’OpenAI pour les travaux difficiles de bout en bout. OpenAI a lancé GPT-6 Astra le 3 septembre 2026, en le positionnant sur le raisonnement complexe, l’utilisation d’ordinateurs, le codage, la recherche, le travail scientifique et la création d’artefacts professionnels. Le modèle d’API propose une fenêtre de contexte de 1.05M tokens et une sortie maximale de 128K, accepte des entrées texte et image, et prend en charge un effort de raisonnement allant de low à max. La tarification API standard commence à $10 input / $50 output par million de tokens. Le changement pratique le plus important n’est pas une hausse uniforme sur tous les benchmarks d’intelligence générale : les plus grands gains d’Astra apparaissent dans l’exécution agentique, l’utilisation d’ordinateurs, la récupération en contexte long, les workflows de codage, la science et la cybersécurité.
Cela compte parce que l’ancien article de CometAPI GPT-6 Is Coming Soon — What Will It Look Like? était nécessairement spéculatif. Maintenant qu’Astra est public, ce guide se concentre sur le comportement confirmé du modèle, les compromis de benchmarks, l’économie de l’API et les cas où le modèle est réellement un meilleur choix que des alternatives de pointe moins coûteuses.
Qu’est-ce que GPT-6 Astra ?
GPT-6 Astra est le successeur du modèle phare GPT-5.6 Sol d’OpenAI. OpenAI décrit Astra comme son modèle le plus performant pour les travaux de bout en bout les plus difficiles, avec un accent sur les workflows qui exigent que le modèle raisonne, utilise des outils, interagisse avec des logiciels, révise des travaux intermédiaires et mène une tâche de la demande initiale au résultat final. Ce positionnement est important : Astra n’est pas simplement un modèle de chat plus grand. Il est conçu pour agir comme le moteur de raisonnement au sein d’agents qui travaillent dans des navigateurs, des terminaux, des documents, des feuilles de calcul, des environnements de développement et des logiciels d’entreprise.
L’article de lancement met en avant des résultats à l’état de l’art en utilisation d’ordinateurs, navigation, ingénierie logicielle, cybersécurité, science et travail professionnel. Il rapporte 97.6% / 99.9% / 100% sur FrontierMath Tier 4, ARC-AGI-3 et ExploitBench respectivement. Ces scores phares sont frappants, mais ils ne doivent pas être interprétés comme « Astra gagne tous les benchmarks ». Sur l’Artificial Analysis Intelligence Index utilisé dans le tableau comparatif d’OpenAI, Astra obtient 61.2 tandis que Claude Fable 5.1 atteint 65.7. La sortie est donc mieux comprise comme un saut en exécution et en travail agentique que comme un grand chelem sur toutes les mesures d’intelligence.
Qu’est-ce qui a changé par rapport à GPT-5.6 Sol ?
L’utilisation d’ordinateurs devient une capacité de premier plan
Le gain générationnel le plus clair d’Astra est l’utilisation d’ordinateurs. Sur OSWorld 2.0, OpenAI rapporte 72.6% pour Astra contre 65.7% pour GPT-5.6 Sol. Dans la même simulation de latence, Astra a terminé des tâches en environ 40 minutes contre environ 75 minutes pour Sol, soit une réduction d’environ 47%. Combiné à un harnais Codex mis à jour, OpenAI rapporte une réalisation 1.9× plus rapide sur Mind2Web. Le point pratique n’est pas seulement qu’Astra peut voir un écran ; il peut maintenir la cohérence d’une tâche logicielle en plusieurs étapes plus longtemps tout en faisant moins de détours coûteux.
La création d’artefacts professionnels est plus délibérée
OpenAI a explicitement entraîné Astra pour des workflows professionnels qui aboutissent à des artefacts utilisables plutôt qu’à du texte brut. Les éléments de lancement décrivent de meilleures performances sur les documents, feuilles de calcul, présentations, analyses de données, travaux de design et respect des modèles. Astra est également meilleur pour rester orienté lorsque les exigences changent en cours de tâche, de sorte qu’un message de pilotage est moins susceptible d’écraser l’objectif initial. C’est particulièrement utile dans des agents d’entreprise de longue durée, où de nouvelles instructions arrivent souvent après le démarrage du workflow.
Les longues sessions conservent davantage de contexte de travail utile
Pour les longues sessions de codage, Astra introduit une nouvelle façon pour Codex de conserver et de récupérer des notes après que le contexte actif est rempli. Les approches antérieures reposaient fortement sur la compaction, qui peut omettre pourquoi une correction tentée a échoué ou quelles contraintes ont déjà été testées. OpenAI affirme qu’Astra peut conserver des notes au-delà des fenêtres de contexte, améliorant la continuité lors de grands refactorings et de sessions de débogage.
L’effort de raisonnement s’étend désormais jusqu’à max
Les développeurs peuvent choisir un effort de raisonnement low, medium, high, xhigh ou max. Cela crée une courbe qualité-coût plus large que de traiter Astra comme un unique point de fonctionnement fixe. Les recommandations officielles sur le modèle suggèrent de sélectionner l’effort le plus bas répondant à votre cible d’évaluation, car la meilleure économie du modèle provient souvent de l’efficacité en tokens plutôt que d’un fonctionnement systématique au maximum du raisonnement.
Performances de GPT-6 Astra sur les benchmarks
OpenAI a publié une large comparaison couvrant l’utilisation d’ordinateurs, le travail professionnel, le codage, le raisonnement académique, la santé, la cybersécurité, le long contexte et l’alignement. La façon la plus utile de lire le tableau est de séparer « intelligence générale » et « capacité à mener des travaux avec des outils ». Astra n’est que marginalement au-dessus de Sol sur l’Artificial Analysis Intelligence Index dans le tableau d’OpenAI, et pourtant il est nettement en avance sur plusieurs benchmarks agentiques et opérationnels.
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Ce que suggère l’écart |
|---|---|---|---|
| AutomationBench | 41.4% | 18.1% | Fort gain sur les workflows métiers de bout en bout |
| OSWorld 2.0 | 72.6% | 65.7% | Meilleure interaction ordinateur et achèvement des tâches |
| Terminal-Bench 4.0 | 57.9% | 37.3% | Grand gain en codage agentique via terminal |
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | Gain majeur sur les workflows scientifiques utilisant code/outils |
| FrontierMath Tier 4 v2 | 97.6% | 83.0% | Raisonnement mathématique de niveau frontière renforcé |
| ExploitBench | 100.0% | 78.5% | Capacité de cybersécurité de classe critique |
| SRE-Bench, one attempt | 88.0% | 55.9% | Travail d’ingénierie inverse / SRE bien plus robuste |
| MRCR v2, 512K-1M | 96.3% | 73.8% | Récupération sur très long contexte améliorée |
| AA Intelligence Index v4.1.1 | 61.2 | 60.9 | L’intelligence générale est quasi inchangée vs Sol |
Le motif est remarquablement clair. L’avantage d’Astra est maximal lorsqu’un benchmark exige une interaction soutenue avec un outil ou un environnement. AutomationBench passe de 18.1% à 41.4% ; Terminal-Bench Science monte de 22.4% à 64.6% ; et MRCR en contexte long s’améliore de 73.8% à 96.3% dans la plage 512K–1M. À l’inverse, l’Artificial Analysis Intelligence Index évolue de 60.9 à 61.2. C’est pourquoi décrire Astra comme « 2,5× plus cher mais un peu plus intelligent » passe à côté de la véritable proposition de valeur du produit.
Source : OpenAI AutomationBench chart (image originale, non redessinée)
Benchmarks indépendants : GPT-6 Astra est-il un saut générationnel ?
Les tests indépendants apportent une vérification importante. Artificial Analysis rapporte un score d’Intelligence Index de 61, égal à GPT-5.6 Sol à effort maximal. En parallèle, Astra progresse fortement sur le Coding Agent Index et consomme nettement moins de tokens en codage agentique. Artificial Analysis a mesuré environ une réduction par trois de la consommation de tokens par rapport à GPT-5.6 Sol à effort maximal dans son harnais Codex, permettant à Astra d’obtenir un score plus élevé à coût comparable par tâche de coding agent.
L’économie est moins favorable sur l’intelligence générale. Astra utilise environ 10% de tokens de sortie en moins que Sol sur l’Intelligence Index à effort maximal, mais la hausse de prix par token de 2,5× domine ce gain d’efficacité ; Artificial Analysis estime qu’Astra est environ 75% plus cher par tâche à effort maximal. Il rapporte également une réduction du taux d’hallucination de 92% à 51% sur AA-Omniscience tandis que la précision augmentait de quatre points.
La conclusion utile est spécifique aux charges de travail : GPT-6 Astra semble le plus générationnel lorsqu’un agent doit agir, itérer, utiliser des outils et terminer un travail compliqué. Pour un raisonnement ordinaire ou une génération de texte à grand volume, la prime de prix peut être bien plus difficile à compenser.
GPT-6 Astra vs GPT-5.6 Sol vs Claude Fable 5.1 vs Gemini 3.8 Flash
Une comparaison pratique de sélection de modèles doit inclure la capacité, la multimodalité, le contexte, l’exécution agentique et le prix. Les modèles ci-dessous ne sont pas interchangeables : Astra optimise l’exécution difficile de bout en bout, Claude Fable 5.1 mène certaines mesures d’intelligence générale, et Gemini 3.8 Flash offre un prix par token bien plus bas avec des modalités d’entrée natives plus larges.

| Metric | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Gemini 3.8 Flash |
|---|---|---|---|---|
| Context window | 1.05M | 1.05M | 1M | 1.048M |
| Max output | 128K | 128K | 128K | 65.5K |
| Input modalities | Text, image | Text, image | Text, image/PDF | Text, image, audio, video, PDF |
| AA Intelligence Index | 61.2 | 60.9 | 65.7 | 58.7 |
| AutomationBench | 41.4% | 18.1% | 31.4% | — |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 19.1% |
| DeepSWE 1.1 | 74.1% | 72.7% | 67.4% | 73.8% |
| FrontierMath Tier 4 v2 | 97.6% | 83.0% | 87.8% | — |
| HLE with tools | 57.2% | — | 65.0% | — |
| HealthBench Professional | 63.4% | 60.5% | 58.1% | 52.1% |
| Official standard input price | $10/M | $4/M | $10/M | $0.75/M |
| Official standard output price | $50/M | $20/M | $50/M | $3.75/M |
Quand GPT-6 Astra est le meilleur choix
Choisissez Astra lorsque la tâche est coûteuse parce que des humains doivent rattraper des exécutions d’agents échouées : grands changements de code, automatisation navigateur/bureau, recherche approfondie s’appuyant sur des outils, création d’artefacts techniques, ou workflows scientifiques et opérationnels complexes. Sa prime se justifie le plus facilement lorsque moins de relances, moins de corrections manuelles et une moindre utilisation de tokens de sortie comptent davantage que le prix par token brut.
Quand Claude Fable 5.1 est le meilleur choix
Claude Fable 5.1 reste un concurrent de pointe sérieux. Dans le tableau de lancement d’OpenAI, il obtient 65.7 sur l’Artificial Analysis Intelligence Index contre 61.2 pour Astra, et 65.0 sur Humanity’s Last Exam avec outils contre 57.2 pour Astra. Cela signifie qu’Astra ne doit pas être présenté comme un vainqueur universel en intelligence. Si votre jeu d’évaluation ressemble davantage à du raisonnement long format qu’à de l’exécution via l’utilisation d’ordinateurs, Claude Fable 5.1 peut rester le meilleur choix.
Quand Gemini 3.8 Flash est le meilleur choix
Gemini 3.8 Flash vise un autre point de la frontière. Il prend en charge les entrées texte, image, audio, vidéo et PDF avec une fenêtre de contexte d’environ 1M de tokens, tandis que la tarification officielle de lancement est bien inférieure à celle d’Astra. Pour l’extraction multimodale à grand volume, la compréhension vidéo/audio, des agents de routine, ou des charges où l’économie de tokens à $10/$50 est difficile à justifier, Gemini 3.8 Flash est souvent le choix de production le plus économique.
Pourquoi la note de cybersécurité de GPT-6 Astra est importante
Astra est le premier modèle largement déployé d’OpenAI à atteindre le seuil de capacité de cybersécurité Critique selon le Preparedness Framework de l’entreprise. OpenAI affirme que le modèle peut identifier des failles de sécurité jusque-là inconnues et développer des stratégies d’exploitation sur des systèmes durcis lorsqu’il dispose des bons outils et accès. Dans les évaluations de lancement, Astra a obtenu 100% sur ExploitBench, 42.4% sur ExploitGym, et 88.0% sur SRE-Bench en une tentative.
Cette capacité s’accompagne de contrôles de déploiement plus stricts. OpenAI indique que les garde-fous en production peuvent ralentir, mettre en pause ou arrêter un travail légitime, en particulier dans des contextes cyber plus risqués. ChatGPT ou Codex peuvent demander à un utilisateur de revoir une action avant de continuer, tandis qu’une tâche API peut s’arrêter. Le déploiement par défaut d’Astra refuse également des requêtes d’exploitation plus avancées ; le programme Daybreak fournit un accès séparé et vérifié pour certains workflows défensifs.
La fiche système documente un compromis de contrôlabilité : Astra est globalement mieux aligné que Sol, mais son raisonnement écrit peut être plus difficile à surveiller dans des conditions d’évaluation adversariales. OpenAI déploie donc une surveillance de mésalignement plus large autour des inférences d’Astra utilisant des outils. Les équipes d’entreprise devraient considérer les permissions d’agents, les frontières d’approbation, les journaux d’audit et l’accès aux outils au moindre privilège comme faisant partie de l’architecture du modèle plutôt que des ajouts optionnels.

Source : OpenAI official ExploitGym honeypot safety chart (image originale, non redessinée)
Tarification de GPT-6 Astra
La page de tarification API actuelle d’OpenAI sépare les requêtes à court contexte et à long contexte. Pour le traitement Standard, les tarifs court contexte sont de $10 en entrée, $1 en entrée mise en cache, $12.50 pour l’écriture en cache, et $50 en sortie par million de tokens. Les requêtes au-dessus de 272K tokens d’entrée utilisent le barème long contexte : $20 en entrée, $2 en entrée mise en cache, $25 pour l’écriture en cache, et $75 en sortie par million de tokens.
| Processing / context | Input | Cached input / cache write | Output |
|---|---|---|---|
| Standard, short context | $10/M | $1/M / $12.50/M | $50/M |
| Standard, long context (>272K input) | $20/M | $2/M / $25/M | $75/M |
| Batch / Flex, short context | $5/M | $0.50/M / $6.25/M | $25/M |
| Batch / Flex, long context | $10/M | $1/M / $12.50/M | $37.50/M |
| Fast mode, short context | $20/M | $2/M / $25/M | $100/M |
| Fast mode, long context | $40/M | $4/M / $50/M | $150/M |
Comparés à GPT-5.6 Sol, les prix Standard par token d’Astra en court contexte sont 2,5× plus élevés ($10/$50 contre $4/$20). Cette prime ne signifie pas automatiquement un coût par tâche complétée 2,5× plus élevé. En codage agentique, OpenAI et Artificial Analysis rapportent tous deux une utilisation de tokens de sortie plus faible pour Astra dans certaines configurations. La bonne unité d’évaluation est donc le coût par tâche réussie, et non le coût par token seul.
Comment accéder à GPT-6 Astra
OpenAI a entamé un déploiement progressif le 3 septembre 2026. Astra doit atteindre les utilisateurs de ChatGPT Plus, Pro, Business et Enterprise, l’API OpenAI et AWS dans les jours suivants. Les administrateurs d’entreprise peuvent activer Astra par espace de travail, et l’accès est désactivé par défaut au lancement.
Appeler GPT-6 Astra avec l’API Responses d’OpenAI
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6-astra",
reasoning={"effort": "high"},
input=(
"Review this repository architecture. Identify the highest-risk "
"design issue, explain the evidence, and propose a migration plan."
),
)
print(response.output_text)
L’ID du modèle est gpt-6-astra. Pour les workflows riches en outils, l’API Responses est le point de départ naturel car Astra prend en charge les appels de fonctions, les sorties structurées, la recherche web, la recherche de fichiers, le code interpreter, le shell hébergé, apply patch, l’utilisation d’ordinateurs, MCP et la recherche d’outils. Le fine-tuning n’est actuellement pas pris en charge.
Cas d’usage réels de GPT-6 Astra
Développement de jeux et workflows logiciels visuels
Playco a testé Astra dans Playbot, un IDE alimenté par l’IA qui fonctionne directement dans Unity et Godot. OpenAI rapporte 50% de corrections manuelles en moins qu’avec le modèle précédent, et trois prototypes thématiques construits à partir d’une seule base grey-box. Cet exemple est important car la tâche exige plus que la génération de code source : le modèle doit raisonner sur la disposition spatiale, jouer au jeu, tester les changements, identifier les bugs et itérer dans un environnement visuel.
Revue de documents juridiques et financiers
OpenAI positionne Astra pour des workflows professionnels en plusieurs étapes qui produisent des documents, feuilles de calcul et analyses soignés. En revue juridique et financière, sa valeur pratique est de maintenir l’état de la tâche à travers de nombreux fichiers, de recouper les preuves et de renvoyer un artefact final plutôt que de répondre à une question isolée. La validation par des experts, les contrôles d’approbation et l’accès aux données au moindre privilège restent nécessaires.
Agents d’ingénierie à long horizon
La combinaison de Terminal-Bench, DeepSWE, migration de bases de données, utilisation d’ordinateurs et résultats en contexte long rend Astra particulièrement pertinent pour l’ingénierie à l’échelle d’un dépôt. Un schéma de déploiement utile consiste à donner à Astra un environnement de développement contraint, un objectif d’issue ou de migration, des tests, et l’accès aux outils ; puis à évaluer le succès sur la qualité des tâches fusionnées, le nombre d’itérations échouées, le temps de revue humaine et le coût total. C’est une meilleure métrique de production qu’un score unique de benchmark de codage.
Limitations de GPT-6 Astra
- Prix par token premium. Astra coûte 2,5× GPT-5.6 Sol par token aux tarifs Standard court contexte, donc le chat de routine, la classification, l’extraction et la rédaction simple sont souvent peu économiques.
- Le long contexte entraîne une surtaxe. Les requêtes avec plus de 272K tokens en entrée basculent vers des tarifs plus élevés pour toute la requête, donc « 1.05M de contexte » ne doit pas être interprété comme une mémoire à prix uniforme.
- Pas d’entrée audio ou vidéo native sur le modèle. Astra accepte le texte et les images et produit du texte ; Gemini 3.8 Flash est plus flexible lorsque la compréhension audio/vidéo native est centrale pour la charge.
- Pas de fine-tuning. La page officielle du modèle liste actuellement le fine-tuning comme non pris en charge, donc la personnalisation repose sur le prompting, les outils, la récupération et la conception de workflow.
- Les garde-fous cyber peuvent interrompre les workflows. OpenAI avertit explicitement que des contrôles de sécurité supplémentaires peuvent mettre en pause ou arrêter un travail légitime dans des contextes plus risqués.
- Pas un gagnant universel de benchmarks. Claude Fable 5.1 devance Astra sur l’Artificial Analysis Intelligence Index et HLE-with-tools selon les chiffres inclus dans la comparaison publiée par OpenAI.
FAQ
GPT-6 Astra est-il officiellement lancé ?
Oui. OpenAI a commencé le déploiement le 3 septembre 2026. La disponibilité est échelonnée selon les organisations, les offres payantes de ChatGPT, l’accès API et AWS, plutôt que d’apparaître pour chaque compte au même moment.
Quelle est la fenêtre de contexte de GPT-6 Astra ?
La page officielle du modèle indique une fenêtre de contexte de 1.05M tokens et une sortie maximale de 128K tokens. Les requêtes au-delà de 272K tokens d’entrée utilisent la grille tarifaire long contexte.
Combien coûte GPT-6 Astra ?
La tarification Standard court contexte est de $10 input / $50 output par million de tokens, avec $1 pour l’entrée mise en cache et $12.50 pour l’écriture en cache. Les modes long contexte, Batch/Flex et Fast ont des tarifs différents, donc les estimations de production doivent utiliser le palier correspondant à la requête réelle.
GPT-6 Astra est-il meilleur que Claude Fable 5.1 ?
Cela dépend de la charge de travail. Astra mène sur plusieurs évaluations d’utilisation d’ordinateurs, d’agents de codage, de science, de cyber et de travail professionnel, tandis que Claude Fable 5.1 devance Astra sur l’Artificial Analysis Intelligence Index et HLE with tools dans la comparaison publiée par OpenAI. Utilisez vos propres évaluations d’agents/tâches plutôt que de supposer qu’un modèle domine chaque catégorie.
GPT-6 Astra est-il une AGI ?
Les pages produits officielles d’OpenAI décrivent Astra comme une nouvelle génération d’intelligence et son modèle largement déployé le plus performant, mais elles ne définissent pas le produit lui-même comme une « AGI ». La saturation des benchmarks sur certaines tâches n’est pas équivalente à une définition universelle, arrêtée, de l’AGI.
Conclusion
GPT-6 Astra doit être compris comme un modèle de frontière axé sur l’exécution. Sa preuve de progrès la plus solide n’est pas le minuscule mouvement de 60.9 à 61.2 par rapport à GPT-5.6 Sol sur l’Artificial Analysis Intelligence Index ; ce sont les améliorations bien plus vastes en utilisation d’ordinateurs, codage agentique, workflows scientifiques, récupération en contexte long, achèvement de tâches professionnelles et cybersécurité. La fenêtre de contexte de 1.05M et la pile d’outils riche offrent aux développeurs davantage d’espace pour construire des agents qui restent utiles au-delà d’une seule réponse.
Le compromis est le prix. La tarification Standard à $10/$50 est premium, les requêtes long contexte coûtent davantage, et des tests indépendants montrent qu’Astra peut être significativement plus cher que Sol sur des charges d’intelligence générale. Le modèle mérite cette prime lorsque de meilleurs taux d’achèvement et moins de corrections humaines l’emportent sur le coût en tokens. Pour des charges plus simples ou à grand volume, GPT-5.6, Claude Fable 5.1 et surtout Gemini 3.8 Flash restent des alternatives pertinentes plutôt que des prédécesseurs obsolètes.
