TL;DR
GPT-6.1 Sol 是 OpenAI 面向複雜程式開發、電腦操作與專業工作流程的推理模型。它在維持 GPT-6 Sol 官方 Standard 新輸入與輸出費率各為每百萬 tokens $2/$10 的同時,將短上下文快取讀取從 $0.20 降至 $0.10。成功的快取重用可降低重複上下文成本。單次請求的輸入超過 272K tokens 時,整個請求將套用較高費率,因此在彙總預算前先估算每個請求。CometAPI 具有獨立的閘道費率表。
Key Takeaways
- 將新輸入、快取讀取、快取寫入與計費輸出分開;輸出包含推理 tokens。
- 為每個請求選對上下文區間。1.05M 的上下文容量不代表可套用短上下文定價。
- 在相同的 token 組成與適用帳戶條款下比較 OpenAI 與 CometAPI。
- 依延遲、可用性與路由支援選擇處理模式。
- 以每個被接受任務的總成本評估代理,計入未成功嘗試。
What Is the GPT-6.1 Sol Price at a Glance?
以下所有 token 價格以每百萬 tokens 的美元計價。官方 token 價格表提供 OpenAI 基準;快取讀取與寫入為獨立計費類別。上下文區間指單次請求中的輸入 tokens。
| OpenAI mode / input band | Fresh input | Cache read | Cache write | Output |
|---|---|---|---|---|
| Standard: at most 272K | $2.00 | $0.10 | $2.50 | $10.00 |
| Standard: above 272K | $4.00 | $0.20 | $5.00 | $15.00 |
| Batch/Flex: at most 272K | $1.00 | $0.05 | $1.25 | $5.00 |
| Batch/Flex: above 272K | $2.00 | $0.10 | $2.50 | $7.50 |
| Fast: at most 272K | $4.00 | $0.20 | $5.00 | $20.00 |
| Fast: above 272K | $8.00 | $0.40 | $10.00 | $30.00 |
| Ultrafast: at most 272K | $12.00 | $0.60 | $15.00 | $60.00 |
| Ultrafast: above 272K | $24.00 | $1.20 | $30.00 | $90.00 |
OpenAI 處理分級費率查於 2026 年 10 月 9 日;CometAPI 的比較保留來源文章的閘道費率表。These are OpenAI processing-tier rates, not a guarantee that each tier is exposed through a gateway. 在適用時,區域化處理加收 10%。在編列預算前請確認所選服務與帳戶條款。
對透過 CometAPI 存取 GPT-6.1 Sol 的開發者而言,標準上下文費率低於直接使用 OpenAI 的 Standard 價格。
| Token category | CometAPI | OpenAI Standard | Difference |
|---|---|---|---|
| Input / 1M | $1.60 | $2.00 | 20% lower |
| Cached input / 1M | $0.08 | $0.10 | 20% lower |
| Cache write / 1M | $2.00 | $2.50 | 20% lower |
| Output / 1M | $8.00 | $10.00 | 20% lower |
對長上下文請求,CometAPI 中的 GPT-6.1 Sol API 使用:
| Long-context tokens | CometAPI | OpenAI |
|---|---|---|
| Input / 1M | $3.20 | $4.00 |
| Cached input / 1M | $0.16 | $0.20 |
| Cache write / 1M | $4.00 | $5.00 |
| Output / 1M | $12.00 | $15.00 |
這在主要 token 類別上大致維持約 20% 的價差。對預算來說,這很重要,因為實際生產工作負載很少只包含新輸入 tokens。一旦納入快取上下文、輸出生成與長上下文請求,只比較廣告中的輸入費率,可能會明顯低估不同路由之間的差異。
CometAPI token 價格表提供閘道參考。在 100K 新輸入與 10K 計費輸出時,OpenAI Standard 成本為 $0.30;相對的 CometAPI 費率為 $0.24。在 10,000 個相同請求下,僅 token 合計分別為 $3,000 與 $2,400。此比較不含工具、快取寫入、重試與溢價。
GPT-6.1 Sol 針對複雜程式開發、電腦操作與專業工作流程定位。其 1,050,000-token 的上下文視窗與 128,000-token 的最大輸出為容量上限,並非短上下文計價的保證:輸入超過 272K tokens 的請求將套用較高費率。它接受文字與影像並輸出文字;使用 Responses API 進行工具呼叫,而 Chat Completions 支援無工具的請求。選擇路由時,請分別檢查閘道工具支援與處理分級。
Additional GPT-6.1 Sol Agent Expenses
代理預算還包含受託管的工具、執行環境、儲存與外部服務費。OpenAI 列出的網路搜尋呼叫為每 1,000 次 $10。擷取的搜尋內容按模型 token 費率計費。檔案搜尋呼叫為每 1,000 次 $2.50;超過免費 1 GB 配額後,儲存費為每 GB 每日 $0.10。
Hosted Shell 與 Code Interpreter 在上述相同的 OpenAI 價格表下,使用獨立的容器計費。公布的 1 GB 費率為每個容器每 20 分鐘工作階段 $0.03;符合條件的會話按分鐘計費,最低五分鐘。請依所選閘道的實際工具與執行條款,而非假設這些直連服務費用不變適用。
Reasoning Effort and Total GPT-6.1 Sol Spend
推理強度並非 token 表中的獨立費率,但會影響計費輸出、工具使用、軌跡長度與重試次數。請在相同任務集合上比較從低到最高的支援推理強度。記錄實際使用量,而不是僅從可見答案長度估算推理成本。
How Does the 272K Threshold Change GPT-6.1 Sol Cost?
當輸入超過 272K tokens,OpenAI 會對整個請求套用長上下文費率:輸入與快取費率加倍,輸出增加 50%。即使大量輸入來自快取,只要觸發門檻,輸入門檻也一樣適用。
| Workload | Fresh input | Billed output | OpenAI Standard | CometAPI catalog |
|---|---|---|---|---|
| Small analysis | 20K | 2K | $0.06 | $0.048 |
| Document review | 100K | 10K | $0.30 | $0.24 |
| Below threshold | 270K | 10K | $0.64 | $0.512 |
| Above threshold | 280K | 10K | $1.27 | $1.016 |
| Repository analysis | 300K | 20K | $1.50 | $1.20 |
270K input: 0.27 x $2 + 0.01 x $10 = $0.64
280K input: 0.28 x $4 + 0.01 x $15 = $1.27
Input grows about 3.7%; token cost grows about 98.4%.
這些是沒有快取、工具、重試或溢價費的獨立請求。此門檻效應解釋了為何即使模型有足夠容量容納整個版本庫,選擇適合的上下文仍很重要。
How Does Prompt Caching Change GPT-6.1 Sol Input Costs?
短上下文 Standard 的快取讀取為 $0.10/M,相較新輸入 $2/M。在該 token 類別上,成功讀取因此便宜 95%。快取寫入成本為 $2.50/M。節省取決於成功重用已快取的前綴,而非僅僅重複相似文字。
考慮十個請求共用一段 100K-token 的前綴。各請求皆保持在短上下文區間。受控的快取案例將整個前綴寫入一次,並成功讀取九次,沒有額外寫入。第一個請求的 100K-token 前綴只按快取寫入費率計費;這些 tokens 不會同時按新輸入計費。
| Repeated-prefix cost | No cache | One write + nine reads |
|---|---|---|
| Fresh prefix input | 10 x 0.1 x $2 = $2.00 | $0.00 |
| Cache write | $0.00 | 0.1 x $2.50 = $0.25 |
| Cache reads | $0.00 | 9 x 0.1 x $0.10 = $0.09 |
| Prefix subtotal | $2.00 | $0.34 |
$1.66 的降幅占此重複前綴成本的 83%。這並非代表典型整體 API 帳單能減少 83%。若每個請求另產生 2K 計費輸出 tokens,輸出在十個請求間共增加 $0.20:總計變為 $2.20 與 $0.54,約減少 75.5%。新增輸入、未命中、額外寫入、工具與長上下文區間都會改變結果。
在這些簡化的短上下文假設下,寫入一次加上 N-1 次讀取,100K 前綴成本為 0.25 + 0.01(N-1) 美元;若不使用快取,成本為 0.20N。只要第二個請求確實命中且其他成本不變,兩個請求就足以讓快取案例更便宜。
How Does GPT-6.1 Sol Pricing Compare with GPT-6 Sol and GPT-6 Astra?
OpenAI 文件:GPT-6 Sol 規格。快取讀取的降低屬於費率比較,並不保證較低的任務總成本。
| Official Standard short-context comparison | GPT-6.1 Sol | GPT-6 Sol | GPT-6 Astra |
|---|---|---|---|
| Fresh input / 1M tokens | $2.00 | $2.00 | $10.00 |
| Cache read / 1M tokens | $0.10 | $0.20 | $1.00 |
| Cache write / 1M tokens | $2.50 | $2.50 | $12.50 |
| Output / 1M tokens | $10.00 | $10.00 | $50.00 |
| Context window / maximum output | 1.05M / 128K | 1.05M / 128K | 1.05M / 128K |
GPT-6.1 Sol 將短上下文的快取讀取費率減半。新輸入、寫入與輸出費率不變。最大效益取決於帳單中成功快取讀取所占比例。遷移時請重新測試推理強度設定、工具循環與任務結果。
與 GPT-6 Sol 相比,GPT-6.1 Sol 保持相同的新輸入、快取寫入與輸出費率,同時將快取讀取費率降低 50%。與 GPT-6 Astra 相比,請結合上述費率與量測到的任務品質與總軌跡成本來評估。
GPT-6 Astra 費率表顯示 Astra 屬於更高的 token 價格層級。
在此區間下,對新輸入、快取寫入與輸出,GPT-6.1 Sol 便宜 80%;對快取讀取則便宜 90%。這些比例不代表品質等效。若較高的接受率可抵銷額外支出,Astra 仍可能值得;若 GPT-6.1 Sol 能以更低成本達成同樣接受門檻,它會更合適。
請分別比較版本庫修補、文件分析與電腦使用任務。保持提示詞、工具權限、推理強度設定、重試上限與驗收準則一致。記錄未解決的失敗與成功結果;不要從 token 價格推論通用的程式或研究排名。
What Does GPT-6.1 Sol Cost for Real API Workloads?
依實際上下文區間與處理模式計算每個請求的成本,然後加總。新輸入不包含快取讀取;不要將相同輸入 tokens 同時計為新輸入與快取。使用供應商的使用紀錄來區分寫入與其他輸入。下列公式中,fresh_input 同時不包含 cache_reads 與 cache_writes。按快取寫入費率計費的 tokens 不得同時當作新輸入計費。將三者視為互斥計費類別,並與供應商使用紀錄對帳。
request_token_cost =
fresh_input / 1_000_000 * fresh_rate
+ cache_reads / 1_000_000 * read_rate
+ cache_writes / 1_000_000 * write_rate
+ billed_output / 1_000_000 * output_rate
period_total = sum(request_token_cost) + other_charges
Aggregate Usage Across Multiple Short Requests
十個請求各自使用 100K 新輸入與 20K 計費輸出,合計為 1M 輸入與 200K 輸出。每個獨立請求皆低於 272K 輸入與 128K 輸出上限。OpenAI Standard 總計 $4.00;CometAPI 總計 $3.20。此 20% 差異僅適用於這些建模後的 token 類別。這並非單一請求包含 1M 輸入與 200K 輸出。
A Cache-Heavy Period With Separately Billed Writes
假設某期間記錄了 1M 新輸入、5M 快取讀取、500K 計費輸出與 500K 快取寫入。所有組成請求皆維持在短上下文 Standard 區間。OpenAI 成本為 $2.00 + $0.50 + $5.00 + $1.25 = $8.75。CometAPI 成本為 $1.60 + $0.40 + $4.00 + $1.00 = $7.00。這些類別是獨立的計費數量;此範例未假設所有重複輸入都命中快取。
One Long-Context Request
一個包含 400K 新輸入與 100K 計費輸出的請求使用長上下文費率。OpenAI Standard 成本為 0.4 x $4 + 0.1 x $15 = $3.10。CometAPI 成本為 0.4 x $3.20 + 0.1 x $12 = $2.48。兩者皆不含新快取寫入與非 token 費用。100K 的輸出數量包含推理,且必須符合模型的輸出預算。
How Do Standard, Batch, Flex, Fast, and Ultrafast Change GPT-6.1 Sol Cost?
對 300K 新輸入與 20K 計費輸出的請求,請使用長上下文區間。
| OpenAI mode | Input cost | Output cost | Token subtotal |
|---|---|---|---|
| Batch/Flex | $0.60 | $0.15 | $0.75 |
| Standard | $1.20 | $0.30 | $1.50 |
| Fast | $2.40 | $0.60 | $3.00 |
| Ultrafast | $7.20 | $1.80 | $9.00 |
Ultrafast 計算:0.30M 新輸入 x $24/M + 0.02M 計費輸出 x $90/M = $7.20 + $1.80 = $9.00。此計算使用長上下文區間,且不含快取、工具與區域化費用。
Batch 適合離線評估、增 enrich、回填與批量文件處理。Flex 為可容忍資源彈性與較長等待的工作負載提供更低費率。Standard 為互動式請求的基準。Fast 會將適用的 token 費率加倍;當縮短等待時間有可衡量價值時選用。
Ultrafast 以更高 token 價格換取延遲優先。對 GPT-6.1 Sol,可在 Responses 請求中將 service_tier 設為 ultrafast。OpenAI 建議在快速代理工具循環中使用 WebSockets;在導入生產前請檢查特定分級限制與閘道支援。費率來源為官方 OpenAI 價格表。
這些費率不代表每個分級都已為你的閘道帳戶啟用。推出前請驗證支援的路由與區域限制。不要以 Standard 費率預算尚未標價或不可用的處理選項。
Why Is Cost per Successful GPT-6.1 Sol Task the Better Metric?
將評估集中的模型、工具與執行總支出除以被接受的結果數。分子需包含失敗嘗試。另行回報人工修正時間與未解決失敗,以避免僅透過放棄更難任務就「改善」成本。
observed_cost_per_accepted_task =
all_evaluation_model_tool_execution_cost / accepted_tasks
舉例而言,成本 $0.40 且成功機率 60% 的嘗試,其直到成功的期望成本為 $0.40 / 0.60 = 約 $0.67。成本 $0.55 且成功機率 85% 的嘗試,期望成本約為 $0.65。這些是示意數字,非基準結果或對特定模型的聲明。
此估算假設重試彼此獨立、成本與成功機率不變,並持續到成功為止。不要再加第二個重試額度:上述除法已計入重試。相關失敗、重試上限、任務難度差異、工具與人工介入都可能使此模型不適用。請以實測的每個被接受任務成本做生產決策。
How Can You Reduce GPT-6.1 Sol API Costs?
最大化可重用的提示前綴。 將穩定的系統指令、工具定義、模式與背景上下文置於可重用前綴中。GPT-6.1 Sol 的 $0.10/M 快取輸入價格使重複上下文相對便宜。
在不需要完整上下文時,將請求保持在 272K 以下。 跨過 272K 輸入 tokens 會改變整個請求的計價。檢索、上下文壓縮與選擇性載入檔案,即使在模型技術上支援 1.05M 上下文視窗的情況下,也能降低成本。
對批量非即時流程使用 Batch。 離線評估、增 enrich、回填與批量文件處理在無需立即回傳時可用 Batch。
對低優先序且可容忍較慢回應與偶發資源不可用的請求使用 Flex。 規劃延遲與重試;檢查符合條件的工作負載與路由支援。Batch 與 Flex 均採用上表較低費率,但服務不同的處理需求。
量測每個被接受任務成本。 記錄新輸入 tokens、快取輸入 tokens、快取寫入、輸出 tokens、處理模式、工具費用、重試與任務成功。然後計算實際每次成功完成的成本。
將較簡單任務路由至更便宜的模型。 並非每個請求都需要 Sol 等級推理。分類、路由、簡單抽取與其他高度可驗任務可使用更低成本的模型,將 GPT-6.1 Sol 用於強推理能實質提升完成率的任務。
這對代理尤為重要,因為一次 $0.50 的失敗嘗試加上兩次重試,可能比一次 $1.00 的成功嘗試更昂貴。
請使用明確的輸出上限、工具循環上限與重試預算。檢視使用紀錄中的新輸入、快取讀取與寫入、推理輸出、分級、上下文區間與工具費用。在每次變更後,將節省與被接受任務品質比較。
Conclusion
當工作流程需要在 Sol 階價格下進行複雜推理且可重用穩定上下文時,GPT-6.1 Sol 具吸引力。它維持 GPT-6 Sol 的 Standard 標題費率 $2/$10,同時將短上下文快取讀取降至 $0.10/M。Astra 的 token 費率更高,但選擇應以工作負載品質與每個被接受任務成本為準。
先從每個請求的估算開始,將快取寫入與讀取分開,並留意 272K 邊界。接著量測完整代理軌跡,選擇符合延遲與可用性的處理分級。CometAPI 提供獨立的價格表;擴大規模前請確認實際帳戶與工具條款。
FAQ
How Should GPT-6.1 Sol Budgets Handle Failed or Cancelled Requests?
分別追蹤已完成、未完成、失敗與取消的請求使用量。不要假設每個未成功的請求都免費,或每個用戶端取消都能避免伺服端工作。使用請求識別碼與使用紀錄對帳,並將已計費的未成功工作納入被接受任務成本計算。請確認供應商特定的收費與退費規則,而非由 HTTP 狀態碼推斷。
How Should Teams Forecast GPT-6.1 Sol Costs for Variable Traffic?
依輸入區間、處理分級、快取組成與工作負載分段流量。使用量測到的 token 與完成分佈,而非單一平均提示。建立基準預測與若干情境,涵蓋較低命中率、更多重試與更長輸出;同時監控跨越 272K 的占比。隨任務組合變化更新預測。
How Can Teams Reconcile GPT-6.1 Sol Forecasts With Invoices?
選擇一個已結算的計費期間,並依路由、處理分級與輸入區間對請求分組。將記錄的使用量與發票類別和折抵對帳,包括調整、工具費與任何適用稅費或幣別轉換。以請求識別碼與計費時間戳調查差異,而非套用無解釋的修正係數。在更改預測前請確認延遲回報與供應商進位規則。
