Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →
technology/Recherche CometAPI

Tarification GPT-5.6 2026 : coûts de l’API Sol, Terra & Luna

请提供需要翻译成法语的原始文本内容(可为纯文本/HTML/Markdown/JSON/XML/代码片段等),我将严格保留结构并仅翻译可读文本。

CometAPI
Mia MarenÉquipe de recherche sur les modèles IA et API
Mis à jour Sep 1, 2026 14 min de lecture
Tarification GPT-5.6 2026 : coûts de l’API Sol, Terra & Luna
Utiliser ce modèle

Passez le premier appel API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Tarifs mis à jour : Les tarifs Standard à contexte court de GPT-5.6 sont désormais de $5 en entrée / $30 en sortie pour Sol, $2 / $12 pour Terra, et $0.20 / $1.20 pour Luna par 1 million de jetons.

Le 30 juillet 2026, OpenAI a réduit les prix de GPT-5.6 Terra de 20% et ceux de Luna de 80%. Les tarifs de Sol restent inchangés.

Attention aux facteurs de coût cachés : l’alias générique gpt-5.6 oriente vers Sol, les requêtes au‑delà de 272K jetons d’entrée utilisent des tarifs de contexte long plus élevés, et les jetons de sortie coûtent toujours plus cher que les jetons d’entrée sur les trois paliers.

Pour les charges Sol sensibles à la latence, le nouveau Fast mode d’OpenAI offre jusqu’à 2.5× plus de rapidité pour le prix Standard.

Aperçu des tarifs de l’API OpenAI

Pour les utilisateurs qui cherchent globalement les tarifs de l’API OpenAI, la première question est souvent : quel modèle actuel suis‑je réellement en train de payer ? Le tableau ci‑dessous donne une vue compacte de plusieurs modèles texte OpenAI actuels avant d’examiner plus en détail GPT-5.6.

(> Mise à jour tarifaire — 30 juillet 2026 : OpenAI a réduit les tarifs API de GPT-5.6 Terra de 20% et ceux de Luna de 80%. Terra coûte désormais $2 par 1M de jetons d’entrée et $12 par 1M de jetons de sortie, tandis que Luna coûte $0.20 à l’entrée et $1.20 à la sortie. Les tarifs de Sol restent inchangés.)

ModèleEntrée / 1M de jetonsEntrée mise en cacheSortie / 1M de jetons
gpt-5.6-sol$5.00$0.50$30.00
gpt-5.6-terra$2.00$0.20$12.00
gpt-5.6-luna$0.20$0.02$1.20
gpt-5.5$5.00$0.50$30.00
gpt-5.4$2.50$0.25$15.00
gpt-5.4-mini$0.75$0.075$4.50
gpt-5.4-nano$0.20$0.02$1.25

Au nouveau prix, Luna égale le tarif d’entrée de GPT-5.4 nano à $0.20, tout en offrant un tarif de sortie légèrement inférieur de $1.20 contre $1.25.

Source*:* Tarifs de l’API OpenAI

Le schéma le plus important est facile à manquer : les jetons de sortie GPT-5.6 coûtent 6× les jetons d’entrée sur Sol, Terra et Luna. Les réponses longues, les agents verbeux et les flux de travail nécessitant beaucoup de raisonnement peuvent donc faire grimper les coûts plus vite que de petites modifications de la longueur de l’invite.

Pour une vue plus large de la famille GPT-5.6 — y compris les capacités du modèle, le positionnement, les benchmarks, l’accès API et les principales fonctionnalités de lancement — voir l’ annonce GPT-5.6 d’OpenAI ou le guide GPT-5.6 de CometAPI. Cet article se concentre spécifiquement sur la tarification, les calculs de coût et les facteurs qui peuvent affecter votre facture API réelle.

Tarifs GPT-5.6 : Sol vs Terra vs Luna

GPT-5.6 introduit trois paliers tarifaires. OpenAI positionne Sol comme la voie phare, Terra comme l’option équilibrée et Luna comme le palier à moindre coût pour des volumes élevés.

Pour un examen plus approfondi des capacités, de l’accès à l’API GPT-5.6 et des cas d’usage de chaque modèle,details to see the here about GPT-5.6 model .

Tarifs Standard GPT-5.6 pour les requêtes avec ≤272K jetons d’entrée

ModèleEntrée courteEntrée en cacheÉcriture de cacheSortie courteEntrée longueEntrée longue en cacheÉcriture de cache longueSortie longue
gpt-5.6-sol$5.00$0.50$6.25$30.00$10.00$1.00$12.50$45.00
gpt-5.6-terra$2.00$0.20$2.50$12.00$4.00$0.40$5.00$18.00
gpt-5.6-luna$0.20$0.02$0.25$1.20$0.40$0.04$0.50$1.80

Source*:* Tarifs de l’API OpenAI

Tarifs de contexte long : Les requêtes comptant plus de 272K jetons d’entrée utilisent des tarifs plus élevés. L’entrée, l’entrée en cache et les écritures de cache sont facturées le tarif standard, tandis que la sortie est facturée 1.5×. Les tarifs plus élevés s’appliquent à l’ensemble de la requête.

Un point de départ raisonnable est de tester Luna pour les tâches plus simples et à fort volume, Terra pour des charges applicatives équilibrées, et Sol pour les tâches les plus difficiles ou à fort impact. Ce ne sont pas des recommandations universelles : la précision, les réessaies, le comportement des outils et la relecture humaine peuvent l’emporter sur la différence de prix affichée.

Un détail important sur l’alias

Les recommandations de modèle d’OpenAI indiquent que l’alias générique gpt-5.6 oriente vers gpt-5.6-sol.

Cela signifie qu’une requête envoyée à gpt-5.6 utilise le palier de prix Sol. Si votre charge fonctionne bien sur Terra ou Luna, utilisez l’ID de modèle explicite plutôt que de supposer que l’alias générique sélectionne le palier le moins cher adapté.

Exemple 1 : Une requête API typique

Commencez avec une forme de requête courante :

  • 1,000 jetons d’entrée
  • 500 jetons de sortie
ModèleCoût mensuel d’entréeCoût mensuel de sortieTotal
gpt-5.6-sol$10,000$15,000$25,000
gpt-5.6-terra$4,000$6,000$10,000
gpt-5.6-luna$400$600$1,000

Dans ce scénario, le nouveau tarif de Luna réduit l’estimation mensuelle des jetons de $5,000 à $1,000, tandis que Terra passe de $12,500 à $10,000.

Calcul pour Sol :

(1,000 / 1,000,000 × $5) + (500 / 1,000,000 × $30) = $0.020

Cet exemple montre aussi pourquoi la longueur de la sortie compte. Même si la requête contient deux fois plus de jetons d’entrée que de sortie, la partie sortie représente 75% du coût en jetons Sol car la sortie est tarifée six fois l’entrée.

Pour le chat, les agents et la génération de code, contrôler la verbosité inutile peut parfois faire économiser davantage que de réduire légèrement une invite système.

Exemple 2 : Coût mensuel à l’échelle

Supposons maintenant qu’une application traite 1 million de requêtes par mois, avec en moyenne :

  • 2,000 jetons d’entrée par requête
  • 500 jetons de sortie par requête

Cela équivaut à 2 milliards de jetons d’entrée et 500 millions de jetons de sortie par mois.

ModèleCoût mensuel d’entréeCoût mensuel de sortieTotal
gpt-5.6-sol$10,000$15,000$25,000
gpt-5.6-terra$5,000$7,500$12,500
gpt-5.6-luna$2,000$3,000$5,000

L’écart est suffisamment important pour justifier des tests d’acheminement, mais la ligne la plus basse n’est pas automatiquement le meilleur choix en production. Si un modèle moins cher entraîne davantage de réessaies, d’échecs de tâches ou de relectures manuelles, le coût total du flux de travail peut être plus élevé.

Tarification du contexte long : que se passe‑t‑il au‑delà de 272K jetons ?

Les modèles GPT-5.6 prennent en charge une fenêtre de contexte de 1.05M jetons, mais OpenAI applique des tarifs plus élevés lorsqu’une requête contient plus de 272,000 jetons d’entrée.

Pour ces requêtes à contexte long :

  • l’entrée est facturée le tarif à contexte court
  • l’entrée mise en cache et les écritures de cache sont aussi facturées
  • la sortie est facturée 1.5×
  • Les tarifs plus élevés s’appliquent à toute la requête, pas seulement aux jetons au‑delà de 272K

Pour Sol, cela fait passer l’entrée de $5 à $10 par 1M de jetons et la sortie de $30 à $45. La même structure de multiplicateurs s’applique à Terra et Luna.

Cela crée une falaise de coûts près de 272K. Pour les charges proches du seuil, réduisez les fragments de récupération dupliqués, l’historique de conversation obsolète, les fichiers de dépôt inutiles ou les sorties d’outils trop verbeuses avant d’envoyer la requête. Voir le guide d’optimisation des coûts d’OpenAI pour des conseils supplémentaires de réduction des jetons.

Tarification Standard, Batch, Flex et Priority

Pour les charges texte GPT-5.6 admissibles, OpenAI propose plusieurs paliers de traitement.

PalierEntrée/sortie SolEntrée/sortie TerraEntrée/sortie LunaCas d’usage typique
Standard$5 / $30$2 / $12$0.20 / $1.20Trafic synchrone normal
Batch$2.50 / $15$1 / $6$0.10 / $0.60Tâches asynchrones hors ligne
Flex$2.50 / $15$1 / $6$0.10 / $0.60Charges sensibles au coût pouvant tolérer un traitement plus lent
Fast mode$10 / $60$4 / $24$0.40 / $2.40Trafic à contexte court sensible à la latence

Batch et Flex restent environ 50% moins chers que le tarif Standard. Priority Processing a été renommé Fast mode le 30 juillet 2026, bien que les requêtes existantes utilisant service_tier: "priority" restent compatibles.

Pour GPT-5.6 Sol, Fast mode offre jusqu’à 2.5× plus de rapidité que Standard pour 2× le prix en jetons Standard, sans changement d’intelligence du modèle. Il est surtout pertinent lorsque la latence côté utilisateur compte suffisamment pour justifier la prime.

Mise en cache d’invite : quand permet‑elle d’économiser avec GPT‑5.6 ?

Pour GPT-5.6, les écritures de cache coûtent 1.25× le tarif d’entrée normal, tandis que les lectures mises en cache bénéficient du tarif d’entrée en cache plus bas.

Considérez un préfixe réutilisable de 100,000 jetons sur Sol :

ActionCoût
Traiter une fois comme entrée non mise en cache normale$0.50
Écrire le préfixe dans le cache$0.63
Lire ultérieurement le préfixe mis en cache$0.05

Deux utilisations non mises en cache coûtent $1.00. Une écriture de cache plus une lecture mise en cache correspondante coûtent $0.675, soit une économie de $0.325 dans cet exemple simplifié.

Limites de cet exemple : Ce calcul compare uniquement le coût d’entrée du préfixe réutilisable. Il n’inclut pas les jetons de sortie, les autres entrées non mises en cache, les outils ou les réessaies. Les économies réelles dépendent du respect des exigences de cache par le préfixe et de sa réutilisation effective.

La mise en cache est donc la plus utile pour de longs préfixes d’invite stables qui reçoivent des requêtes répétées correspondantes. Une écriture de cache jamais réutilisée ajoute un coût au lieu d’en réduire.

Le guide de mise en cache d’invite d’OpenAI documente la tarification des écritures de cache, les lectures mises en cache, les points de rupture explicites et le comportement de TTL.

Autres coûts susceptibles de modifier votre facture API OpenAI

Jetons de raisonnement et mode Pro

Les jetons de raisonnement sont facturés comme des jetons de sortie même lorsqu’ils ne sont pas affichés dans le texte de réponse visible. Des réglages de raisonnement plus élevés peuvent donc augmenter l’utilisation totale des jetons de sortie et la latence.

Là où c’est pris en charge, reasoning.mode = "pro" doit être considéré comme une configuration à évaluer, et non comme une règle par défaut d’économie de coût ou de qualité. OpenAI n’indique pas de supplément Pro fixe distinct pour ce mode ; l’impact sur le coût provient de l’utilisation de jetons résultante. Un point de départ raisonnable est de tester Standard et Pro sur des tâches représentatives et de comparer la réussite des tâches, le total des jetons de sortie, la latence et les réessaies.

Recherche web et autres outils

OpenAI affiche actuellement la recherche web standard à $10 par 1,000 appels, plus les jetons de contenu de recherche facturés au tarif du modèle sélectionné. Deux recherches web sur une petite requête Luna peuvent donc coûter plus que les jetons du modèle pour la requête.

OpenAI indique également un prix distinct d’aperçu de la recherche web pour les modèles sans raisonnement à $25 par 1,000 appels, avec des jetons de contenu de recherche gratuits. Vérifiez la combinaison exacte outil/modèle sur la page officielle des tarifs plutôt que d’appliquer un seul tarif de recherche web à chaque endpoint.

Traitement régional

Les endpoints de traitement régional ou de résidence des données admissibles pour les modèles publiés à partir du 5 mars 2026 comportent une majoration de 10% selon la page des tarifs d’OpenAI. Les équipes Enterprise avec des exigences de résidence doivent inclure ce facteur dans leurs estimations budgétaires.

Comment calculer le coût de l’API OpenAI

Pour une requête de base :

Coût en jetons =

(jetons d’entrée / 1M × tarif d’entrée)

  • (jetons de sortie / 1M × tarif de sortie)

Pour la planification de production, étendez‑le pour inclure :

Coût total du flux de travail =

  • entrée non mise en cache
  • entrée mise en cache
  • écritures de cache
  • jetons de sortie et de raisonnement
  • frais d’outils
  • ajustements de palier de service
  • majoration régionale, le cas échéant
  • réessaies et requêtes de repli

L’indicateur le plus utile est souvent :

Coût par tâche réussie = coût total du flux de travail / tâches réussies

Cela évite qu’un tarif en jetons plus bas paraisse artificiellement attractif lorsqu’il entraîne aussi davantage d’échecs ou de travail de relecture.

Comment choisir le bon modèle sans surpayer

Utilisez le tableau des prix comme point de départ, puis testez sur des tâches réelles.

  1. Commencez par le modèle le moins cher qui semble capable de réaliser la tâche. Luna peut être un premier test pertinent pour un travail simple et à fort volume, mais ne supposez pas qu’il sera le meilleur pour chaque extraction ou synthèse.
  2. Mesurez la longueur de sortie. Les jetons de sortie GPT-5.6 coûtent 6× les jetons d’entrée, donc la verbosité mérite une attention particulière.
  3. Surveillez le seuil des 272K. Le franchir modifie les tarifs pour toute la requête.
  4. Utilisez Batch ou Flex pour le travail admissible non urgent. Testez les contraintes opérationnelles avant de basculer le trafic de production.
  5. Ne mettez en cache que les préfixes réutilisables. Mesurez les hits de cache réels plutôt que de supposer qu’une longue invite doit être mise en cache.
  6. Suivez les outils et les réessaies. Ils peuvent annuler les économies réalisées avec un modèle moins cher.

Pour les équipes comparant les routes entre fournisseurs, les tarifs CometAPI offrent une vue trans‑modèles en temps réel. Le Quickstart CometAPI et le Cookbook peuvent être utilisés pour exécuter le même jeu de tests sur plusieurs routes compatibles OpenAI.

FAQ

Combien coûte GPT-5.6 en 2026 ?

Le prix dépend du modèle. Les tarifs Standard à contexte court de GPT-5.6 vont de $1 en entrée / $6 en sortie par 1M de jetons pour Luna à $5 / $30 pour Sol. Des modèles moins chers comme GPT-5.4 mini et nano sont également disponibles. Vérifiez le modèle exact sur la page des tarifs en direct d’OpenAI.

La tarification de l’API ChatGPT est‑elle la même que celle de GPT-5.6 ?

« Tarification de l’API ChatGPT » est souvent utilisé de manière informelle pour désigner la tarification de l’API OpenAI pour les modèles compatibles chat, mais les abonnements ChatGPT et la facturation de l’API sont des produits distincts. L’utilisation de l’API est tarifée selon le modèle spécifique et le type d’usage.

Quel modèle GPT-5.6 est le moins cher ?

gpt-5.6-luna est le modèle GPT-5.6 le moins cher, à $0.20 par 1M de jetons d’entrée et $1.20 par 1M de jetons de sortie. OpenAI a réduit ces deux tarifs de 80% le 30 juillet, rendant Luna nettement plus économique pour les agents à grand volume, la classification, le traitement de documents et les flux d’outils bien définis.

Quel modèle utilise gpt-5.6 ?

Les recommandations de modèle d’OpenAI indiquent que l’alias gpt-5.6 oriente vers gpt-5.6-sol. Utilisez des IDs de modèle Terra ou Luna explicites lorsque vous souhaitez ces paliers.

Quand la tarification à contexte long de GPT-5.6 s’applique‑t‑elle ?

Lorsque l’entrée dépasse 272,000 jetons, GPT-5.6 applique des tarifs à contexte long à toute la requête : 2× pour les éléments liés à l’entrée et 1.5× pour la sortie.

Batch et Flex sont‑ils moins chers que Standard pour GPT-5.6 ?

Pour les charges GPT-5.6 admissibles, les tarifs en jetons listés pour Batch et Flex sont environ 50% plus bas que Standard. Leurs caractéristiques de traitement sont différentes ; confirmez que la charge peut tolérer ces contraintes.

Les écritures de cache coûtent‑elles plus cher pour GPT-5.6 ?

Oui. Les écritures de cache GPT-5.6 sont tarifées à 1.25× de l’entrée normale, tandis que les lectures correspondantes mises en cache utilisent le tarif d’entrée en cache réduit. Les économies dépendent de la réutilisation effective.

Comparez les coûts GPT-5.6 sur votre propre charge de travail

Les tableaux de prix sont un point de départ. Votre coût réel dépend des invites, de la longueur de sortie, du taux de hit de cache, des outils, des réessaies et de la réussite des tâches.

Avec CometAPI, vous pouvez tester GPT-5.6 Sol, Terra, Luna et d’autres modèles via une API compatible OpenAI unique en utilisant la même charge de travail.

Prochaines étapes : comparez les tarifs actuels des modèles, suivez le Quickstart CometAPI, ou utilisez le CometAPI Cookbook pour construire des évaluations de modèles reproductibles.

Choisissez la route la moins chère qui satisfait encore vos exigences de qualité, de latence et de fiabilité.

Continuer à apprendre

Reliez cet article à la décision suivante.

Voir tous les sujets
Publié le Jul 15, 2026
Dernière mise à jour Sep 1, 2026
605 vues
Revu pour la clarté, l'attribution des sources et la terminologie API actuelle.

Prêt à réduire vos coûts de développement IA de 20 % ?

Démarrez gratuitement en quelques minutes. Crédits d'essai offerts. Aucune carte bancaire requise.

En savoir plus