TL;DR
GPT-6.1 Sol は、複雑なコーディング、コンピュータ操作、プロフェッショナルなワークフロー向けの OpenAI の推論モデルです。GPT-6 Sol の公式 Standard における新規入力/出力の料金を100万トークンあたり $2/$10 に維持しつつ、短コンテキストのキャッシュ読み取りを $0.20 から $0.10 に引き下げています。キャッシュの再利用が成功すれば、繰り返しコンテキストのコストを低減できます。入力が272Kトークンを超えると、そのリクエスト全体に高い料金が適用されるため、集計前に各リクエストを見積もってください。CometAPI には別のゲートウェイ料金表があります。
Key Takeaways
- 新規入力、キャッシュ読み取り、キャッシュ書き込み、課金対象の出力を分けて考えること。出力には推論トークンが含まれます。
- 各リクエストで正しいコンテキスト帯を使用すること。1.05M のコンテキスト容量は短コンテキスト価格を意味しません。
- OpenAI と CometAPI を比較する際は、同じトークン構成と適用されるアカウントの課金条件を用いること。
- レイテンシ、可用性、ルート対応に応じて処理モードを選択すること。
- 受理されたタスクあたりの総コストでエージェントの経済性を評価すること。失敗した試行も含めること。
What Is the GPT-6.1 Sol Price at a Glance?
以下のトークン価格はすべて100万トークンあたりの USD です。公式トークン料金表は OpenAI の基準を示します。キャッシュ読み取りと書き込みは別の課金カテゴリです。コンテキスト帯は個々のリクエスト内の入力トークンを指します。
| OpenAI mode / input band | Fresh input | Cache read | Cache write | Output |
|---|---|---|---|---|
| Standard: at most 272K | $2.00 | $0.10 | $2.50 | $10.00 |
| Standard: above 272K | $4.00 | $0.20 | $5.00 | $15.00 |
| Batch/Flex: at most 272K | $1.00 | $0.05 | $1.25 | $5.00 |
| Batch/Flex: above 272K | $2.00 | $0.10 | $2.50 | $7.50 |
| Fast: at most 272K | $4.00 | $0.20 | $5.00 | $20.00 |
| Fast: above 272K | $8.00 | $0.40 | $10.00 | $30.00 |
| Ultrafast: at most 272K | $12.00 | $0.60 | $15.00 | $60.00 |
| Ultrafast: above 272K | $24.00 | $1.20 | $30.00 | $90.00 |
OpenAI の処理ティア料金は 2026年10月9日に確認したものです。CometAPI の比較は元記事のゲートウェイ料金表を保持しています。これらは OpenAI の処理ティア料金であり、各ティアがゲートウェイ経由で公開されていることを保証するものではありません。地域別処理が適用される場合は10%が加算されます。予算化の前に、選択したサービスとアカウント条件を確認してください。
CometAPI を通じて GPT-6.1 Sol にアクセスする開発者にとって、標準コンテキストのレートは OpenAI の直接 Standard 価格より低くなります。
| Token category | CometAPI | OpenAI Standard | Difference |
|---|---|---|---|
| Input / 1M | $1.60 | $2.00 | 20% lower |
| Cached input / 1M | $0.08 | $0.10 | 20% lower |
| Cache write / 1M | $2.00 | $2.50 | 20% lower |
| Output / 1M | $8.00 | $10.00 | 20% lower |
長コンテキストのリクエストでは、CometAPI の GPT-6.1 Sol API は以下を使用します:
| Long-context tokens | CometAPI | OpenAI |
|---|---|---|
| Input / 1M | $3.20 | $4.00 |
| Cached input / 1M | $0.16 | $0.20 |
| Cache write / 1M | $4.00 | $5.00 |
| Output / 1M | $12.00 | $15.00 |
これにより主要なトークンカテゴリ全体で約20%の価格差が維持されます。実運用の予算では、プロダクションのワークロードが新規入力トークンのみで構成されることはほぼないため、これは重要です。キャッシュされたコンテキスト、出力生成、長コンテキストのリクエストを含めると、広告されている入力レートだけの比較ではルート間の差を大幅に過小評価する可能性があります。
CometAPI のトークン料金表がゲートウェイの参照を提供します。新規入力100K、課金対象出力10Kの場合、OpenAI Standard は $0.30、対応する CometAPI の料金表では $0.24 です。同一のリクエストを10,000回行うと、トークンのみの合計は $3,000 と $2,400 になります。この比較にはツール、キャッシュ書き込み、再試行、プレミアムは含まれていません。
GPT-6.1 Sol は、複雑なコーディング、コンピュータ操作、プロフェッショナルなワークフロー向けに位置付けられています。1,050,000 トークンのコンテキストウィンドウと 128,000 トークンの最大出力は容量上限であり、短コンテキスト課金を約束するものではありません。入力が272Kトークンを超えるリクエストは高いレートを使用します。テキストと画像を受け取り、テキストを生成します。ツール呼び出しには Responses API を使用し、Chat Completions はツールを使用しないリクエストをサポートします。ルート選択時には、ゲートウェイのツール対応と処理ティアを別途確認してください。
Additional GPT-6.1 Sol Agent Expenses
エージェントの予算には、ホストされたツール、実行環境、ストレージ、および外部サービス料金も含まれます。OpenAI はウェブ検索呼び出しを 1,000 回あたり $10 と記載しています。取得された検索コンテンツはモデルのトークンレートで課金されます。ファイル検索呼び出しは 1,000 回あたり $2.50、ストレージは無料1 GBの後、1日あたり1 GBにつき $0.10 です。
Hosted Shell と Code Interpreter は、前述の OpenAI 料金表に基づく別のコンテナ料金を使用します。公開されている 1 GB レートは、コンテナ1件あたり20分セッションで $0.03 です。該当するセッションは最小5分の従量課金になります。選択したゲートウェイの実際のツールおよび実行条件を使用し、これらの直接サービスの料金がそのまま適用されると仮定しないでください。
Reasoning Effort and Total GPT-6.1 Sol Spend
推論の「努力度」はトークン表の別レートではありませんが、課金対象の出力、ツール使用、軌跡の長さ、再試行回数を変化させ得ます。同じタスクセットで低〜最大の努力度まで比較してください。見える回答の長さだけから推論コストを見積もらず、使用実績を記録してください。
How Does the 272K Threshold Change GPT-6.1 Sol Cost?
入力が272Kトークンを超えると、OpenAI はリクエスト全体に長コンテキストのレートを適用します。入力とキャッシュのレートは2倍になり、出力は50%増加します。多くの入力がキャッシュから提供される場合でも、入力しきい値が適用されます。
| Workload | Fresh input | Billed output | OpenAI Standard | CometAPI catalog |
|---|---|---|---|---|
| Small analysis | 20K | 2K | $0.06 | $0.048 |
| Document review | 100K | 10K | $0.30 | $0.24 |
| Below threshold | 270K | 10K | $0.64 | $0.512 |
| Above threshold | 280K | 10K | $1.27 | $1.016 |
| Repository analysis | 300K | 20K | $1.50 | $1.20 |
270K input: 0.27 x $2 + 0.01 x $10 = $0.64
280K input: 0.28 x $4 + 0.01 x $15 = $1.27
Input grows about 3.7%; token cost grows about 98.4%.
これらはキャッシュ、ツール、再試行、プレミアムのない独立したリクエストです。しきい値効果があるため、モデルがリポジトリ全体を収容できる場合でも、コンテキスト選択が重要になります。
How Does Prompt Caching Change GPT-6.1 Sol Input Costs?
短コンテキストの Standard におけるキャッシュ読み取りは $0.10/M で、新規入力の $2/M と比べて、そのトークンカテゴリで95%安価です。キャッシュ書き込みは $2.50/M のコストがかかります。節約は、単に類似テキストを繰り返すのではなく、キャッシュされたプレフィックスの再利用が成功するかに依存します。
100Kトークンのプレフィックスを共有する10件のリクエストを考えます。各リクエストは短コンテキスト帯に留まります。制御されたキャッシュ利用のケースでは、プレフィックス全体を一度だけ書き込み、その後の9回で読み取りに成功し、追加の書き込みはありません。最初のリクエストの100Kトークンのプレフィックスはキャッシュ書き込みレートのみで課金され、同じトークンが新規入力として二重課金されることはありません。
| Repeated-prefix cost | No cache | One write + nine reads |
|---|---|---|
| Fresh prefix input | 10 x 0.1 x $2 = $2.00 | $0.00 |
| Cache write | $0.00 | 0.1 x $2.50 = $0.25 |
| Cache reads | $0.00 | 9 x 0.1 x $0.10 = $0.09 |
| Prefix subtotal | $2.00 | $0.34 |
$1.66 の削減は、この繰り返しプレフィックスコストの83%に相当します。これは典型的な API 請求全体の83%削減という意味ではありません。各リクエストがさらに 2K の課金対象出力トークンを生成する場合、出力は10件合計で $0.20 加わります。合計は $2.20 と $0.54 になり、約 75.5% の削減です。新規入力、ミス、追加書き込み、ツール、長コンテキスト帯などにより結果は変わります。
この単純化した短コンテキストの仮定では、100K のプレフィックスに対し、一度書き込み+(N-1)回読み取りのコストは 0.25 + 0.01(N-1) ドルであり、キャッシュなしの 0.20N と比較されます。2件のリクエストでも、2件目が実際にヒットし、他のコストが変わらなければ、キャッシュ利用の方が安くなります。
How Does GPT-6.1 Sol Pricing Compare with GPT-6 Sol and GPT-6 Astra?
OpenAI は GPT-6 Sol specifications を文書化しています。キャッシュ読み取りの引き下げはレート比較であり、タスク全体のコスト低下を証明するものではありません。
| Official Standard short-context comparison | GPT-6.1 Sol | GPT-6 Sol | GPT-6 Astra |
|---|---|---|---|
| Fresh input / 1M tokens | $2.00 | $2.00 | $10.00 |
| Cache read / 1M tokens | $0.10 | $0.20 | $1.00 |
| Cache write / 1M tokens | $2.50 | $2.50 | $12.50 |
| Output / 1M tokens | $10.00 | $10.00 | $50.00 |
| Context window / maximum output | 1.05M / 128K | 1.05M / 128K | 1.05M / 128K |
GPT-6.1 Sol は短コンテキストのキャッシュ読み取りレートを半減しています。新規入力、書き込み、出力のレートは変更されていません。最大のメリットは、請求のどれだけがキャッシュ読み取りの成功に占められるかに依存します。移行時には努力度設定、ツールループ、タスク成果を再検証してください。
GPT-6 Sol と比較すると、GPT-6.1 Sol は新規入力、キャッシュ書き込み、出力のレートは同じで、キャッシュ読み取りのみ 50% 引き下げています。GPT-6 Astra と比較する場合は、上記のレートを、測定されたタスク品質および総軌跡コストと併せて用いてください。
GPT-6 Astra rate schedule は Astra をより高いトークン価格帯に位置付けています。
この帯において、GPT-6.1 Sol は新規入力、キャッシュ書き込み、出力が80%安く、キャッシュ読み取りは90%安価です。これらの比率は同等の品質を示すものではありません。Astra は、より良い受理結果が追加支出を相殺する場合に価値がありえます。一方、GPT-6.1 Sol は、同じ受理目標をより低コストで満たす場合に好ましい選択になり得ます。
リポジトリのパッチ、ドキュメント分析、コンピュータ操作タスクを個別に比較してください。プロンプト、ツール権限、努力度設定、再試行上限、受理チェックを固定し、未解決の失敗も成功結果と合わせて記録してください。トークン価格から、コーディングやリサーチの普遍的なランキングを推論しないでください。
What Does GPT-6.1 Sol Cost for Real API Workloads?
各リクエストの実際の帯と処理モードでコストを算出し、結果を合計してください。新規入力はキャッシュ読み取りを含みません。同じ入力トークンを新規入力とキャッシュの両方で課金しないでください。プロバイダの使用実績を用いて、書き込みと他の入力を区別します。以下の式では、fresh_input は cache_reads と cache_writes の両方を除外しています。キャッシュ書き込みレートで課金されたトークンを新規入力に二重計上しないでください。これら3つの数量は相互に排他的な課金カテゴリとして扱い、プロバイダの使用実績と照合してください。
request_token_cost =
fresh_input / 1_000_000 * fresh_rate
+ cache_reads / 1_000_000 * read_rate
+ cache_writes / 1_000_000 * write_rate
+ billed_output / 1_000_000 * output_rate
period_total = sum(request_token_cost) + other_charges
Aggregate Usage Across Multiple Short Requests
100K の新規入力と 20K の課金対象出力をそれぞれ使用する10件のリクエストは、合計で 1M の入力と 200K の出力になります。個々のリクエストはすべて、272K の入力および 128K の出力上限を下回ります。OpenAI Standard の合計は $4.00、CometAPI の合計は $3.20 です。20% の差は、ここでモデル化したトークンカテゴリにのみ適用されます。これは、1件のリクエストで 1M の入力と 200K の出力があるという意味ではありません。
A Cache-Heavy Period With Separately Billed Writes
ある期間に、1M の新規入力、5M のキャッシュ読み取り、500K の課金対象出力、500K のキャッシュ書き込みが記録されたとします。すべての構成リクエストは短コンテキストの Standard 帯に留まります。OpenAI のコストは $2.00 + $0.50 + $5.00 + $1.25 = $8.75。CometAPI は $1.60 + $0.40 + $4.00 + $1.00 = $7.00 です。これらのカテゴリは別個の課金数量であり、繰り返し入力のすべてがキャッシュヒットであると仮定していません。
One Long-Context Request
400K の新規入力と 100K の課金対象出力を持つリクエストは、長コンテキストのレートを使用します。OpenAI Standard は 0.4 x $4 + 0.1 x $15 = $3.10。CometAPI は 0.4 x $3.20 + 0.1 x $12 = $2.48。いずれも新規キャッシュ書き込みや非トークン課金を除外しています。100K の出力には推論が含まれ、モデルの出力予算内で収まる必要があります。
How Do Standard, Batch, Flex, Fast, and Ultrafast Change GPT-6.1 Sol Cost?
300K の新規入力と 20K の課金対象出力を持つリクエストでは、長コンテキスト帯を使用します。
| OpenAI mode | Input cost | Output cost | Token subtotal |
|---|---|---|---|
| Batch/Flex | $0.60 | $0.15 | $0.75 |
| Standard | $1.20 | $0.30 | $1.50 |
| Fast | $2.40 | $0.60 | $3.00 |
| Ultrafast | $7.20 | $1.80 | $9.00 |
Ultrafast の計算: 0.30M の新規入力 x $24/M + 0.02M の課金対象出力 x $90/M = $7.20 + $1.80 = $9.00。これは長コンテキスト帯を使用し、キャッシュ、ツール、地域別課金を除外しています。
Batch はオフライン評価、エンリッチメント、バックフィル、および大量ドキュメント処理に適しています。Flex は可変処理やリソースの非可用性を許容できる低優先度ワークロード向けに低レートを提供します。Standard は対話型リクエストの基準です。Fast は該当するトークンレートを2倍にします。待ち時間の短縮に測定可能な価値がある場合に選択してください。
Ultrafast は低レイテンシを優先し、より高いトークン価格になります。GPT-6.1 Sol では、Responses リクエストで service_tier を ultrafast に設定してください。OpenAI はエージェントのツールループを高速化するために WebSockets を推奨しています。生産トラフィックをルーティングする前に、ティア固有の制限とゲートウェイ対応を確認してください。レートは 公式の OpenAI 価格表 に基づきます。
これらのレートは、すべてのティアがあなたのゲートウェイアカウントで有効化されていることを証明するものではありません。サポートされるルーティングと地域制約を検証してから展開してください。Standard レートとして未価格・非対応の処理オプションを予算化しないでください。
Why Is Cost per Successful GPT-6.1 Sol Task the Better Metric?
評価セット全体のモデル、ツール、実行の総支出を受理結果で割ってください。失敗した試行も分子に含めます。人手による修正時間と未解決の失敗を別途報告し、難しいタスクを放棄するだけでコストが改善したように見えないようにします。
observed_cost_per_accepted_task =
all_evaluation_model_tool_execution_cost / accepted_tasks
例として、成功確率が60%の $0.40 の試行は、成功までの期待コストが $0.40 / 0.60 = 約 $0.67 です。同じモデルで、成功確率85%の $0.55 の試行は約 $0.65 です。これは仮定の数値であり、特定モデルのベンチマーク結果や主張ではありません。
この推定は、コストと成功確率が変わらない独立した再試行を、成功まで続けることを仮定します。二重に再試行枠を加算しないでください。除数がすでに繰り返しを考慮しています。相関する失敗、再試行上限、異なるタスク難易度、ツール、人手介入により、このモデルが不適切になる場合があります。プロダクションの意思決定には、観測された受理タスクあたりのコストを使用してください。
How Can You Reduce GPT-6.1 Sol API Costs?
再利用可能なプロンプトのプレフィックスを最大化する。 安定したシステム指示、ツール定義、スキーマ、背景コンテキストを再利用可能なプレフィックスに入れましょう。GPT-6.1 Sol の $0.10/M のキャッシュ入力価格により、繰り返しコンテキストは新規入力に比べて低コストになります。
不要な場合は272K未満に抑える。 272K の入力を超えると、リクエスト全体の価格帯が変わります。リトリーバル、コンテキスト圧縮、選択的ファイル読み込みにより、モデルが 1.05M のコンテキストを技術的にサポートしている場合でもコストを削減できることがあります。
バルク非同期ワークフローには Batch を使用する。 オフライン評価、エンリッチメント、バックフィル、大量ドキュメント処理には、結果が即時でなくてもよい場合に Batch を使用できます。
低優先度で遅延に耐えられるワークロードには Flex を使用する。 遅延と再試行を計画し、対象ワークロードとルート対応を確認してください。Batch と Flex は上記の低レートを使用しますが、異なる処理ニーズに対応します。
受理タスクあたりのコストを測定する。 新規入力トークン、キャッシュ入力トークン、キャッシュ書き込み、出力トークン、処理モード、ツール課金、再試行、タスク成功をログ化し、その後、実際の成功完了あたりのコストを算出してください。
単純なタスクはより安価なモデルにルーティングする。 すべてのリクエストが Sol レベルの推論を必要とするわけではありません。分類、ルーティング、単純な抽出、その他高検証性のタスクは低コストモデルで対応し、GPT-6.1 Sol は、より強い推論が完了率を実質的に改善するタスクに充ててください。
これは特にエージェントで重要です。$0.50 の失敗ランに2回の再試行が続くと、単一の $1.00 の成功ランより高くつく可能性があります。
明示的な完了上限、ツールループ上限、再試行予算を設定しましょう。新規入力、キャッシュ読み取り、書き込み、推論出力、ティア、コンテキスト帯、ツール課金の使用記録を見直してください。各変更後に、節約と受理タスク品質を比較しましょう。
Conclusion
GPT-6.1 Sol は、Sol ティアの価格で複雑な推論が必要で、安定したコンテキストを再利用できるワークフローに魅力的です。Standard の見出しレート $2/$10 を維持しつつ、短コンテキストのキャッシュ読み取りを $0.10/M に引き下げました。Astra はより高いトークンレートですが、選択はワークロード品質と受理タスクコストに従うべきです。
まずリクエスト単位の見積もりから始め、キャッシュ書き込みと読み取りを分離し、272K の境界に注意してください。その後、エージェントの全軌跡を測定し、レイテンシと可用性に合った処理ティアを選択します。CometAPI は別の価格表を提供します。スケール前に実際のアカウントおよびツール条件を確認してください。
FAQ
How Should GPT-6.1 Sol Budgets Handle Failed or Cancelled Requests?
完了、未完、失敗、キャンセルされたリクエストのプロバイダ使用状況を個別に追跡してください。すべての不成功リクエストが無料、またはすべてのクライアントキャンセルがサーバ側の作業を防ぐと仮定しないでください。リクエスト ID と使用状況を請求記録と照合し、課金された不成功の作業を受理タスク計算に含めます。HTTP ステータスから推測するのではなく、プロバイダ固有の課金および返金規則を確認してください。
How Should Teams Forecast GPT-6.1 Sol Costs for Variable Traffic?
トラフィックを入力帯、処理ティア、キャッシュ構成、ワークロード別にセグメント化してください。平均プロンプトひとつではなく、測定されたトークンと完了分布を使用します。ヒット率低下、再試行増加、出力増加のシナリオと基準予測を構築し、272K を超える比率も監視してください。タスク構成の変化に合わせて予測を更新してください。
How Can Teams Reconcile GPT-6.1 Sol Forecasts With Invoices?
完了した請求期間を選び、ルート、処理ティア、入力帯でリクエストをグループ化してください。調整、ツール課金、適用税や通貨換算を含む請求カテゴリとクレジットに対して、記録された使用状況を照合します。説明のない補正係数を適用するのではなく、リクエスト ID と請求タイムスタンプを用いて差異を調査してください。予測を変更する前に、報告遅延やプロバイダの丸め規則を確認してください。
