Claude Haiku 5.5 and Nano Banana 2.1 are now live on CometAPI →
ai-model/Recherche CometAPI

GPT-6.1 Sol Price : tarification de l'API, jetons mis en cache, contexte long et coût de CometAPI

Comparez les tarifs de l’API GPT-6.1 Sol, les lectures et écritures du cache, les tarifs pour le contexte long, les niveaux de traitement, les coûts de CometAPI et le coût par tâche acceptée.

CometAPI
Deon GoodwinÉquipe de recherche sur les modèles IA et API
Mis à jour Oct 10, 2026 17 min de lecture
GPT-6.1 Sol Price : tarification de l'API, jetons mis en cache, contexte long et coût de CometAPI
Utiliser ce modèle

Passez le premier appel API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

GPT-6.1 Sol est le modèle de raisonnement d’OpenAI pour le codage complexe, l’utilisation d’ordinateurs et les workflows professionnels. Il conserve les tarifs Standard officiels de GPT-6 Sol pour l’entrée fraîche et la sortie à $2/$10 par million de jetons, tout en réduisant les lectures de cache à contexte court de $0.20 à $0.10. Une réutilisation réussie du cache peut réduire les coûts de contexte répété. Une entrée supérieure à 272K jetons déclenche des tarifs plus élevés pour l’ensemble de la requête ; estimez chaque requête avant d’agréger une facture. CometAPI dispose d’un barème de passerelle distinct.

Key Takeaways

  • Séparer l’entrée fraîche, les lectures de cache, les écritures de cache et la sortie facturée ; la sortie inclut les jetons de raisonnement.
  • Utiliser le palier de contexte correct pour chaque requête. Une capacité de contexte de 1.05M n’implique pas une tarification de contexte court.
  • Comparer OpenAI et CometAPI en utilisant la même composition de jetons et les conditions de facturation du compte applicables.
  • Choisir le mode de traitement selon la latence, la disponibilité et la prise en charge de la route.
  • Évaluer l’économie d’agent par le coût total par tâche acceptée, tentatives infructueuses incluses.

What Is the GPT-6.1 Sol Price at a Glance?

Tous les prix par million de jetons ci-dessous sont en USD. Le barème officiel des prix par jeton fournit la référence OpenAI ; les lectures et écritures de cache sont des catégories de facturation séparées. Les paliers de contexte se réfèrent aux jetons d’entrée d’une requête individuelle.

OpenAI mode / input bandFresh inputCache readCache writeOutput
Standard: at most 272K$2.00$0.10$2.50$10.00
Standard: above 272K$4.00$0.20$5.00$15.00
Batch/Flex: at most 272K$1.00$0.05$1.25$5.00
Batch/Flex: above 272K$2.00$0.10$2.50$7.50
Fast: at most 272K$4.00$0.20$5.00$20.00
Fast: above 272K$8.00$0.40$10.00$30.00
Ultrafast: at most 272K$12.00$0.60$15.00$60.00
Ultrafast: above 272K$24.00$1.20$30.00$90.00

Tarifs des paliers de traitement OpenAI vérifiés le 9 octobre 2026 ; la comparaison CometAPI conserve le barème de passerelle de l’article source. Ce sont des tarifs de paliers de traitement OpenAI, sans garantie que chaque palier soit exposé via une passerelle. Le traitement régional ajoute 10 % le cas échéant. Confirmez le service choisi et les conditions de votre compte avant d’établir un budget.

Pour les développeurs qui accèdent à GPT-6.1 Sol via CometAPI, le tarif en contexte standard est inférieur au prix Standard direct d’OpenAI.

Token categoryCometAPIOpenAI StandardDifference
Input / 1M$1.60$2.0020% lower
Cached input / 1M$0.08$0.1020% lower
Cache write / 1M$2.00$2.5020% lower
Output / 1M$8.00$10.0020% lower

Pour les requêtes en contexte long, l’API GPT-6.1 Sol dans CometAPI utilise :

Long-context tokensCometAPIOpenAI
Input / 1M$3.20$4.00
Cached input / 1M$0.16$0.20
Cache write / 1M$4.00$5.00
Output / 1M$12.00$15.00

Cela préserve une différence d’environ 20 % sur les principales catégories de jetons. Pour la budgétisation, cela compte car une charge de production ne se compose rarement que d’entrées fraîches. Une fois les contextes mis en cache, la génération de sortie et les requêtes à contexte long inclus, comparer seulement le tarif d’entrée annoncé peut sous-estimer significativement la différence entre routes.

Le barème des prix par jeton de CometAPI fournit la référence de passerelle. À 100K d’entrée fraîche et 10K de sortie facturée, OpenAI Standard coûte $0.30 ; le barème correspondant de CometAPI coûte $0.24. À 10 000 requêtes identiques, les totaux des seuls jetons sont $3,000 et $2,400. Cette comparaison exclut les outils, les écritures de cache, les retentatives et les surcharges.

GPT-6.1 Sol est positionné pour le codage complexe, l’utilisation d’ordinateurs et les workflows professionnels. Sa fenêtre de contexte de 1,050,000 jetons et sa sortie maximale de 128,000 jetons sont des limites de capacité, pas une promesse de tarification à contexte court : les requêtes au-delà de 272K jetons d’entrée utilisent des tarifs plus élevés. Il accepte du texte et des images et produit du texte ; utilisez Responses API pour l’appel d’outils, tandis que Chat Completions prend en charge les requêtes sans outils. Vérifiez séparément la prise en charge des outils et les paliers de traitement de la passerelle lors du choix d’une route.

Additional GPT-6.1 Sol Agent Expenses

Le budget d’un agent inclut aussi les outils hébergés, les environnements d’exécution, le stockage et les frais de services externes. OpenAI liste les appels de recherche web à $10 pour 1,000 appels. Le contenu de recherche récupéré est facturé aux tarifs en jetons du modèle. Les appels de recherche de fichiers coûtent $2.50 pour 1,000 ; le stockage est à $0.10 par GB par jour après l’allocation gratuite de 1 GB.

Hosted Shell et Code Interpreter utilisent des frais de conteneur distincts selon le même barème OpenAI cité ci-dessus. Le tarif publié de 1 GB est de $0.03 par session de 20 minutes et par conteneur ; les sessions éligibles utilisent une facturation à la minute avec un minimum de cinq minutes. Utilisez les conditions réelles des outils et de l’exécution de la passerelle choisie, au lieu de supposer que ces frais de service direct s’appliquent inchangés.

Reasoning Effort and Total GPT-6.1 Sol Spend

L’effort de raisonnement n’est pas un tarif séparé dans le tableau des jetons, mais il peut modifier la sortie facturée, l’utilisation d’outils, la longueur de la trajectoire et les retentatives. Comparez les efforts pris en charge de faible à maximum sur le même ensemble de tâches. Enregistrez l’usage plutôt que d’estimer le coût de raisonnement à partir de la seule longueur de réponse visible.

How Does the 272K Threshold Change GPT-6.1 Sol Cost?

Lorsque l’entrée dépasse 272K jetons, OpenAI applique les tarifs contexte long à toute la requête : les tarifs d’entrée et de cache doublent, tandis que la sortie augmente de 50 %. Le seuil d’entrée s’applique même si une grande partie de l’entrée est servie depuis le cache.

WorkloadFresh inputBilled outputOpenAI StandardCometAPI catalog
Small analysis20K2K$0.06$0.048
Document review100K10K$0.30$0.24
Below threshold270K10K$0.64$0.512
Above threshold280K10K$1.27$1.016
Repository analysis300K20K$1.50$1.20
270K input: 0.27 x $2 + 0.01 x $10 = $0.64
280K input: 0.28 x $4 + 0.01 x $15 = $1.27
Input grows about 3.7%; token cost grows about 98.4%.

Ce sont des requêtes indépendantes sans frais de cache, d’outil, de retentative ni de prime. L’effet de seuil explique pourquoi la sélection du contexte est importante même lorsque le modèle a suffisamment de capacité pour l’ensemble du dépôt.

How Does Prompt Caching Change GPT-6.1 Sol Input Costs?

Les lectures de cache Standard en contexte court coûtent $0.10/M contre $2/M pour l’entrée fraîche. Une lecture réussie est donc 95 % moins chère pour cette catégorie de jetons. Une écriture de cache coûte $2.50/M. Les économies dépendent de la réutilisation réussie du préfixe mis en cache, pas simplement de la répétition d’un texte similaire.

Considérez dix requêtes partageant un même préfixe de 100K jetons. Chacune reste dans le palier contexte court. Le cas contrôlé avec cache écrit une fois l’intégralité du préfixe et le lit avec succès neuf fois, sans écritures supplémentaires. Le préfixe de 100K jetons de la première requête est facturé au seul tarif d’écriture de cache ; ces mêmes jetons ne sont pas également facturés au tarif d’entrée fraîche.

Repeated-prefix costNo cacheOne write + nine reads
Fresh prefix input10 x 0.1 x $2 = $2.00$0.00
Cache write$0.000.1 x $2.50 = $0.25
Cache reads$0.009 x 0.1 x $0.10 = $0.09
Prefix subtotal$2.00$0.34

La réduction de $1.66 représente 83 % de ce coût de préfixe répété. Ce n’est pas une réduction de 83 % d’une facture API typique. Si chaque requête génère aussi 2K jetons de sortie facturée, la sortie ajoute $0.20 sur les dix requêtes : les totaux deviennent $2.20 et $0.54, soit une réduction d’environ 75.5 %. Nouvelles entrées, échecs de cache, écritures supplémentaires, outils et paliers contexte long modifient le résultat.

Dans ces hypothèses simplifiées de contexte court, écrire une fois puis N-1 lectures coûte 0.25 + 0.01(N-1) dollars pour un préfixe de 100K, contre 0.20N sans mise en cache. Deux requêtes suffisent à rendre le cas avec cache moins cher, à condition que la seconde requête touche effectivement le cache et qu’aucun autre coût ne change.

How Does GPT-6.1 Sol Pricing Compare with GPT-6 Sol and GPT-6 Astra?

OpenAI documente les spécifications de GPT-6 Sol. La réduction de lecture de cache est une comparaison de tarifs, pas la preuve d’un coût total de tâche inférieur.

Official Standard short-context comparisonGPT-6.1 SolGPT-6 SolGPT-6 Astra
Fresh input / 1M tokens$2.00$2.00$10.00
Cache read / 1M tokens$0.10$0.20$1.00
Cache write / 1M tokens$2.50$2.50$12.50
Output / 1M tokens$10.00$10.00$50.00
Context window / maximum output1.05M / 128K1.05M / 128K1.05M / 128K

GPT-6.1 Sol réduit de moitié le tarif de lecture de cache en contexte court. Entrée fraîche, écritures et sortie sont inchangées. Le bénéfice maximum dépend de la part de votre facture constituée de lectures de cache réussies. Re-testez les niveaux d’effort, les boucles d’outils et les résultats de tâches lors de la migration.

Comparé à GPT-6 Sol, GPT-6.1 Sol conserve les mêmes tarifs d’entrée fraîche, d’écriture de cache et de sortie tout en divisant par deux les lectures de cache. Comparé à GPT-6 Astra, utilisez les tarifs ci-dessus conjointement avec la qualité mesurée des tâches et le coût total de trajectoire.

Le barème de GPT-6 Astra place Astra dans une tranche de prix par jeton plus élevée.

GPT-6.1 Sol est 80 % moins cher pour l’entrée fraîche, les écritures de cache et la sortie, et 90 % moins cher pour les lectures de cache dans ce palier. Ces ratios n’établissent pas une qualité équivalente. Astra peut valoir sa prime si de meilleurs résultats acceptés compensent la dépense supplémentaire ; GPT-6.1 Sol peut être préférable lorsqu’il atteint le même objectif d’acceptation à moindre coût.

Comparez séparément les correctifs de dépôt, l’analyse de documents et les tâches d’utilisation de l’ordinateur. Maintenez constants les invites, les autorisations d’outils, les niveaux d’effort, les limites de retentative et les contrôles d’acceptation. Enregistrez les échecs non résolus ainsi que les résultats réussis ; n’inférez pas un classement universel en codage ou en recherche à partir des prix par jeton.

What Does GPT-6.1 Sol Cost for Real API Workloads?

Calculez le coût par requête avec son palier et son mode de traitement réels, puis additionnez les résultats. L’entrée fraîche exclut les lectures de cache ; ne facturez pas les mêmes jetons d’entrée à la fois en frais d’entrée fraîche et de lecture de cache. Utilisez les relevés d’usage du fournisseur pour distinguer les écritures de cache des autres entrées. Dans la formule ci-dessous, fresh_input exclut à la fois cache_reads et cache_writes. Les jetons facturés au tarif d’écriture de cache ne doivent pas aussi être comptés comme entrée fraîche. Traitez ces trois quantités comme des catégories de facturation mutuellement exclusives et rapprochez-les des relevés d’usage du fournisseur.

request_token_cost =
  fresh_input / 1_000_000 * fresh_rate
+ cache_reads / 1_000_000 * read_rate
+ cache_writes / 1_000_000 * write_rate
+ billed_output / 1_000_000 * output_rate

period_total = sum(request_token_cost) + other_charges

Aggregate Usage Across Multiple Short Requests

Dix requêtes utilisant chacune 100K d’entrée fraîche et 20K de sortie facturée totalisent 1M d’entrée et 200K de sortie. Chaque requête individuelle reste sous 272K d’entrée et sous la limite de sortie de 128K. OpenAI Standard totalise $4.00 ; CometAPI totalise $3.20. La différence de 20 % s’applique uniquement à ces catégories de jetons modélisées. Ce n’est pas une seule requête avec 1M d’entrée et 200K de sortie.

A Cache-Heavy Period With Separately Billed Writes

Supposons qu’une période enregistre 1M d’entrée fraîche, 5M de lectures de cache, 500K de sortie facturée et 500K d’écritures de cache. Toutes les requêtes composantes restent dans le palier Standard contexte court. OpenAI coûte $2.00 + $0.50 + $5.00 + $1.25 = $8.75. CometAPI coûte $1.60 + $0.40 + $4.00 + $1.00 = $7.00. Ces catégories sont des quantités de facturation distinctes ; l’exemple ne suppose pas que toute l’entrée répétée soit un succès de cache.

One Long-Context Request

Une requête avec 400K d’entrée fraîche et 100K de sortie facturée utilise les tarifs contexte long. OpenAI Standard coûte 0.4 x $4 + 0.1 x $15 = $3.10. CometAPI coûte 0.4 x $3.20 + 0.1 x $12 = $2.48. Les deux excluent les nouvelles écritures de cache et les frais non liés aux jetons. La quantité de sortie de 100K inclut le raisonnement et doit respecter le budget de sortie du modèle.

How Do Standard, Batch, Flex, Fast, and Ultrafast Change GPT-6.1 Sol Cost?

Pour une requête avec 300K d’entrée fraîche et 20K de sortie facturée, utilisez le palier contexte long.

OpenAI modeInput costOutput costToken subtotal
Batch/Flex$0.60$0.15$0.75
Standard$1.20$0.30$1.50
Fast$2.40$0.60$3.00
Ultrafast$7.20$1.80$9.00

Calcul Ultrafast : 0.30M d’entrée fraîche x $24/M + 0.02M de sortie facturée x $90/M = $7.20 + $1.80 = $9.00. Cela utilise le palier contexte long et exclut les frais de cache, d’outils et régionaux.

Batch convient aux évaluations hors ligne, à l’enrichissement, aux remplissages et au traitement de documents en masse. Flex propose des tarifs plus bas pour les charges de travail éligibles tolérant une disponibilité et un traitement variables. Standard est la base pour les requêtes interactives. Fast double les tarifs de jetons applicables ; sélectionnez-le lorsque la réduction d’attente a une valeur mesurable.

Ultrafast privilégie la latence à un prix de jeton plus élevé. Pour GPT-6.1 Sol, définissez service_tier sur ultrafast dans les requêtes Responses. OpenAI recommande les WebSockets pour des boucles d’outils d’agent rapides ; vérifiez les limites spécifiques au palier et la prise en charge de la passerelle avant d’acheminer du trafic de production. Les tarifs proviennent du tableau de tarification officiel d’OpenAI.

Ces tarifs ne prouvent pas que chaque palier est activé pour votre compte passerelle. Vérifiez le routage pris en charge et les contraintes régionales avant le déploiement. Ne budgétez pas une option de traitement non tarifée ou indisponible comme si elle avait déjà le tarif Standard.

Why Is Cost per Successful GPT-6.1 Sol Task the Better Metric?

Divisez le total mesuré des dépenses modèle, outils et exécution sur un ensemble d’évaluation par les résultats acceptés. Incluez les tentatives échouées au numérateur. Indiquez séparément le temps de correction humaine et les échecs non résolus afin que le coût ne puisse pas s’améliorer simplement en abandonnant les tâches plus difficiles.

observed_cost_per_accepted_task =
  all_evaluation_model_tool_execution_cost / accepted_tasks

À titre d’illustration, une tentative à $0.40 avec une probabilité de succès de 60 % a un coût attendu de $0.40 / 0.60 ≈ $0.67 jusqu’à la réussite. Une tentative à $0.55 avec une probabilité de 85 % coûte environ $0.65 dans le même modèle. Ce sont des chiffres hypothétiques, pas des résultats de benchmark ni des affirmations sur un modèle particulier.

Cette estimation suppose des retentatives indépendantes avec un coût et une probabilité de succès inchangés, poursuivies jusqu’à la réussite. N’ajoutez pas une seconde allocation de retentative : la division tient déjà compte des répétitions. Des échecs corrélés, des retentatives plafonnées, une difficulté de tâche différente, des outils et une intervention humaine peuvent rendre ce modèle inadapté. Utilisez le coût observé par tâche acceptée pour les décisions de production.

How Can You Reduce GPT-6.1 Sol API Costs?

Maximisez les préfixes d’invite réutilisables. Placez des instructions système stables, des définitions d’outils, des schémas et du contexte de fond dans des préfixes réutilisables. Le prix de $0.10/M pour l’entrée mise en cache de GPT-6.1 Sol rend le contexte répété peu coûteux par rapport à l’entrée fraîche.

Maintenez les requêtes sous 272K lorsque le contexte complet est inutile. Franchir 272K jetons d’entrée change la tarification de toute la requête. La récupération, la compression de contexte et le chargement sélectif de fichiers peuvent donc réduire le coût même si le modèle prend techniquement en charge une fenêtre de contexte de 1.05M.

Utilisez Batch pour les workflows asynchrones en masse. Les évaluations hors ligne, l’enrichissement, les remplissages et le traitement de documents en masse peuvent utiliser Batch lorsque les résultats n’ont pas besoin de revenir immédiatement.

Utilisez Flex pour les requêtes de faible priorité qui tolèrent des réponses plus lentes et des indisponibilités ponctuelles des ressources. Prévoyez des retards et des retentatives ; vérifiez les charges de travail éligibles et la prise en charge de la route. Batch et Flex utilisent chacun les tarifs inférieurs ci-dessus, mais ils répondent à des besoins de traitement différents.

Mesurez le coût par tâche acceptée. Journalisez les jetons d’entrée fraîche, d’entrée mise en cache, les écritures de cache, les jetons de sortie, le mode de traitement, les frais d’outils, les retentatives et la réussite des tâches. Calculez ensuite le coût réel par réussite.

Acheminez les tâches plus simples vers des modèles moins coûteux. Toutes les requêtes n’exigent pas un raisonnement de niveau Sol. La classification, le routage, l’extraction simple et d’autres tâches hautement vérifiables peuvent convenir à un modèle moins cher, tandis que GPT-6.1 Sol traite les tâches où un raisonnement plus fort améliore matériellement le taux de réussite.

Ceci est particulièrement important pour les agents, car une exécution échouée à $0.50 suivie de deux retentatives peut coûter plus cher qu’une exécution réussie à $1.00.

Utilisez des limites explicites de complétion, des limites de boucles d’outils et des budgets de retentative. Passez en revue les relevés d’usage pour l’entrée fraîche, les lectures de cache, les écritures, la sortie de raisonnement, le palier, la bande de contexte et les frais d’outils. Comparez les économies à la qualité des tâches acceptées après chaque changement.

Conclusion

GPT-6.1 Sol est attrayant lorsqu’un workflow a besoin d’un raisonnement complexe à des tarifs de niveau Sol et peut réutiliser un contexte stable. Il conserve les tarifs Standard « $2/$10 » de GPT-6 Sol tout en abaissant les lectures de cache en contexte court à $0.10/M. Astra a des tarifs par jeton plus élevés, mais le choix doit suivre la qualité de la charge de travail et le coût par tâche acceptée.

Commencez par des estimations par requête, séparez les écritures de cache des lectures et surveillez la limite de 272K. Mesurez ensuite la trajectoire complète de l’agent et choisissez un palier de traitement adapté à la latence et à la disponibilité. CometAPI fournit un barème de prix distinct ; confirmez les conditions réelles du compte et des outils avant la montée en charge.

FAQ

How Should GPT-6.1 Sol Budgets Handle Failed or Cancelled Requests?

Suivez séparément l’usage du fournisseur pour les requêtes terminées, incomplètes, échouées et annulées. N’assumez pas que chaque requête infructueuse est gratuite ni que chaque annulation côté client empêche le travail côté serveur. Rapprochez les identifiants de requête et l’usage avec les relevés de facturation, puis incluez le travail infructueux facturé dans le calcul par tâche acceptée. Confirmez les règles spécifiques de facturation et de remboursement du fournisseur au lieu de les déduire d’un statut HTTP.

How Should Teams Forecast GPT-6.1 Sol Costs for Variable Traffic?

Segmentez le trafic par palier d’entrée, palier de traitement, composition de cache et charge de travail. Utilisez des distributions mesurées de jetons et de complétions plutôt qu’une invite moyenne. Élaborez une prévision de base et des scénarios pour des taux de succès de cache plus faibles, davantage de retentatives et des sorties plus longues ; surveillez aussi la part franchissant 272K. Mettez à jour la prévision à mesure que le mix de tâches évolue.

How Can Teams Reconcile GPT-6.1 Sol Forecasts With Invoices?

Choisissez une période de facturation terminée et regroupez les requêtes par route, palier de traitement et palier d’entrée. Rapprochez l’usage enregistré avec les catégories et crédits de la facture, y compris ajustements, frais d’outils et toute taxe ou conversion de devise applicable. Enquêtez sur les écarts en utilisant les identifiants de requête et les horodatages de facturation plutôt qu’en appliquant un facteur de correction inexpliqué. Confirmez les retards de rapport et les règles d’arrondi du fournisseur avant de modifier la prévision.

Continuer à apprendre

Reliez cet article à la décision suivante.

Voir tous les sujets
Publié le Oct 10, 2026
Dernière mise à jour Oct 10, 2026
1 vues
Revu pour la clarté, l'attribution des sources et la terminologie API actuelle.

En savoir plus