重點摘要
更新後的定價:GPT-5.6 Standard 的短上下文費率現為每 100 萬 tokens,Sol 為 $5(輸入)/$30(輸出),Terra 為 $2/$12,Luna 為 $0.20/$1.20。
2026 年 7 月 30 日,OpenAI 將 GPT-5.6 Terra 價格下調 20%,Luna 下調 80%。Sol 定價保持不變。
注意隱性成本驅動因素:通用別名 gpt-5.6 會路由至 Sol,超過 272K 輸入 tokens 的請求將使用較高的長上下文費率,且在三個等級中輸出 tokens 的價格仍是輸入的 6 倍。
對延遲敏感的 Sol 工作負載,OpenAI 新增的 Fast mode 以標準價格的 2 倍提供最高 2.5 倍的處理速度。
OpenAI API 定價一覽
對於廣泛搜索「OpenAI API 定價」的使用者,第一個問題通常是:我實際在為哪個當前模型付費?在深入了解 GPT-5.6 之前,下表提供了幾個當前 OpenAI 文字模型的簡要概覽。
(> 價格更新 — 2026 年 7 月 30 日:OpenAI 將 GPT-5.6 Terra API 價格下調 20%,Luna 下調 80%。Terra 現為每 100 萬 tokens 輸入 $2、輸出 $12;Luna 為輸入 $0.20、輸出 $1.20。Sol 定價保持不變。)
| Model | Input / 1M tokens | Cached input | Output / 1M tokens |
|---|---|---|---|
| gpt-5.6-sol | $5.00 | $0.50 | $30.00 |
| gpt-5.6-terra | $2.00 | $0.20 | $12.00 |
| gpt-5.6-luna | $0.20 | $0.02 | $1.20 |
| gpt-5.5 | $5.00 | $0.50 | $30.00 |
| gpt-5.4 | $2.50 | $0.25 | $15.00 |
| gpt-5.4-mini | $0.75 | $0.075 | $4.50 |
| gpt-5.4-nano | $0.20 | $0.02 | $1.25 |
以新價格計算,Luna 的輸入費率與 GPT-5.4 nano 的 $0.20 相當,且輸出費率略低($1.20 對比 $1.25)。
來源*:* OpenAI API 定價
最容易被忽略的關鍵模式是:在 Sol、Terra 與 Luna 三個層級中,GPT-5.6 的輸出 tokens 價格是輸入的 6 倍。因此,過長的回答、冗長的代理回覆與重推理流程,可能比提示詞長度的小幅變動更快地推高成本。
如需更廣泛的 GPT-5.6 系列概述——包括模型能力、定位、基準測試、API 存取與重點發佈特性——請參閱 OpenAI 的 GPT-5.6 announcement 或 CometAPI 的 GPT-5.6 guide. 本文將專注於定價、成本計算,以及會影響實際 API 帳單的因素。
GPT-5.6 定價:Sol vs Terra vs Luna
GPT-5.6 引入三個定價等級。OpenAI 將 Sol 定位為旗艦路由,Terra 為平衡選項,Luna 則是面向高流量工作負載的低成本層級。
如需深入了解各模型的能力、如何存取 GPT-5.6 API 與使用案例,請參見這裡的 GPT-5.6 model 詳細資訊。
對於輸入 tokens ≤272K 的請求之 GPT-5.6 Standard 定價
| Model | Short input | Cached input | Cache write | Short output | Long input | Long cached input | Long cache write | Long output |
|---|---|---|---|---|---|---|---|---|
| gpt-5.6-sol | $5.00 | $0.50 | $6.25 | $30.00 | $10.00 | $1.00 | $12.50 | $45.00 |
| gpt-5.6-terra | $2.00 | $0.20 | $2.50 | $12.00 | $4.00 | $0.40 | $5.00 | $18.00 |
| gpt-5.6-luna | $0.20 | $0.02 | $0.25 | $1.20 | $0.40 | $0.04 | $0.50 | $1.80 |
來源*:* OpenAI API 定價
長上下文定價:當輸入超過 272K tokens,將使用更高費率。輸入、已快取輸入與快取寫入按標準費率的 2 倍計費,輸出按 1.5 倍計費。較高費率適用於整個請求。
一個合理的起點是:對較簡單且高量的任務先測試 Luna;對平衡型應用工作負載測試 Terra;對最困難或最具影響的任務使用 Sol。這些並非通用建議:準確度、重試、工具行為與人工審查成本,可能超過標價差異。
一個重要的別名細節
OpenAI 的模型說明指出,通用別名 gpt-5.6 會路由至 gpt-5.6-sol。
這代表發往 gpt-5.6 的請求會使用 Sol 的價格等級。如果你的工作負載在 Terra 或 Luna 表現良好,請使用明確的模型 ID,而不要假設通用別名會選擇最便宜的合適等級。
範例 1:典型 API 請求
先從常見的請求形狀開始:
- 1,000 個輸入 tokens
- 500 個輸出 tokens
| Model | 每月輸入成本 | 每月輸出成本 | 總計 |
|---|---|---|---|
| gpt-5.6-sol | $10,000 | $15,000 | $25,000 |
| gpt-5.6-terra | $4,000 | $6,000 | $10,000 |
| gpt-5.6-luna | $400 | $600 | $1,000 |
在此工作負載下,Luna 的新定價把預估的每月 token 帳單從 $5,000 降至 $1,000,而 Terra 則從 $12,500 降至 $10,000。
Sol 的計算:
(1,000 / 1,000,000 × $5) + (500 / 1,000,000 × $30) = $0.020
這個例子也顯示為何輸出長度很重要。即使請求中的輸入 tokens 是輸出的兩倍,因為輸出按輸入的 6 倍計價,輸出部分仍佔了 Sol token 成本的 75%。
對於聊天、代理與程式碼生成,控制不必要的冗長,有時比縮短小幅的系統提示更能節省成本。
範例 2:規模化的每月成本
現在假設一個應用每月處理 100 萬個請求,平均:
- 每個請求 2,000 個輸入 tokens
- 每個請求 500 個輸出 tokens
這等於每月 20 億輸入 tokens 與 5 億輸出 tokens。
| Model | 每月輸入成本 | 每月輸出成本 | 總計 |
|---|---|---|---|
| gpt-5.6-sol | $10,000 | $15,000 | $25,000 |
| gpt-5.6-terra | $5,000 | $7,500 | $12,500 |
| gpt-5.6-luna | $2,000 | $3,000 | $5,000 |
差距足以支持路由測試,但最低那一行並不自動是最佳的生產選擇。如果較便宜的模型導致更多重試、任務失敗或人工審查,整體工作流程成本可能更高。
長上下文定價:超過 272K tokens 會發生什麼?
GPT-5.6 模型支援 105 萬 tokens 的上下文視窗,但當請求包含超過 272,000 個輸入 tokens 時,OpenAI 會套用更高費率。
對於這些長上下文請求:
- 輸入按短上下文費率的 2 倍計價
- 已快取輸入與快取寫入同樣按 2 倍計價
- 輸出按 1.5 倍計價
- 較高費率適用於整個請求,而不僅是超過 272K 的部分
以 Sol 為例,輸入從每 100 萬 tokens $5 變為 $10,輸出從 $30 變為 $45。相同的倍率結構也適用於 Terra 與 Luna。
這在 272K 附近形成了成本懸崖。對於接近門檻的工作負載,請在送出請求前,減少重複的檢索分塊、過時的對話歷史、不必要的儲存庫檔案或冗長的工具輸出。更多減少 tokens 的建議,請參見 OpenAI 的成本最佳化指南。
Standard、Batch、Flex 與 Priority 定價
對符合資格的 GPT-5.6 文字工作負載,OpenAI 提供多種處理等級。
| Tier | Sol input/output | Terra input/output | Luna input/output | Typical use |
|---|---|---|---|---|
| Standard | $5 / $30 | $2 / $12 | $0.20 / $1.20 | 一般同步流量 |
| Batch | $2.50 / $15 | $1 / $6 | $0.10 / $0.60 | 離線非同步作業 |
| Flex | $2.50 / $15 | $1 / $6 | $0.10 / $0.60 | 可容忍較慢處理、注重成本的工作負載 |
| Fast mode | $10 / $60 | $4 / $24 | $0.40 / $2.40 | 對延遲敏感的短上下文流量 |
Batch 與 Flex 仍約比 Standard 便宜 50%。Priority Processing 於 2026 年 7 月 30 日更名為 Fast mode,但使用 service_tier: "priority" 的既有請求仍相容。
對 GPT-5.6 Sol 而言,Fast mode 在不改變模型智能的情況下,提供最高 2.5 倍的處理速度,價格為 Standard 的 2 倍。當使用者端延遲足以支撐溢價時最為合適。
提示快取:何時能為 GPT-5.6 省錢?
對 GPT-5.6 而言,快取寫入的成本為一般輸入費率的 1.25 倍,而已快取輸入則享有較低的已快取輸入價格。
以 Sol 上可重用的 100,000-token 前綴為例:
| Action | Cost |
|---|---|
| Process once as normal uncached input | $0.50 |
| Write the prefix to cache | $0.63 |
| Read the cached prefix later | $0.05 |
兩次未快取使用的成本為 $1.00。一次快取寫入加一次相符的已快取讀取成本為 $0.675,在此簡化示例中可節省 $0.325。
本範例的邊界:此計算僅比較可重用前綴的輸入成本。它不包含輸出 tokens、其他未快取輸入、工具或重試。實際節省取決於前綴是否符合快取需求以及實際重用次數。
因此,快取最適用於長且穩定、會重複收到相符請求的提示前綴。從未被重用的快取寫入只會增加成本,而不會降低它。
OpenAI 的提示快取指南記載了快取寫入定價、已快取讀取、顯式斷點與 TTL 行為。
其他可能改變 OpenAI API 帳單的成本
推理 tokens 與 Pro 模式
推理 tokens 即使不顯示為可見回應文字,也會按輸出 tokens 計費。較高的推理設定可能因此增加總輸出 token 使用量與延遲。
在支援的情境中,reasoning.mode = "pro" 更適合作為需要「基準測試」的設定,而非預設的省錢或品質規則。OpenAI 並未列出此模式的固定 Pro 附加費;成本影響來自隨之而來的 token 使用量。合理基線是對代表性任務同時測試 Standard 與 Pro,並比較任務成功率、總輸出 tokens、延遲與重試。
網頁搜尋與其他工具
OpenAI 目前列出的標準網頁搜尋費率為每 1,000 次呼叫 $10,另外搜尋內容的 tokens 依所選模型費率計價。在小型的 Luna 請求中,兩次網頁搜尋的成本因此可能高於該請求的模型 tokens。
OpenAI 亦為非推理模型列出了單獨的「網頁搜尋預覽」價格:每 1,000 次呼叫 $25,且搜尋內容 tokens 免計費。請在官方定價頁確認精確的工具與模型組合,而非將單一網頁搜尋費率套用到所有端點。
區域性處理
對於 2026 年 3 月 5 日之後發布、具備資格的區域性處理或資料駐留端點,OpenAI 的定價頁顯示將收取 10% 的加價。具有駐留需求的企業團隊應將此因素納入預算估算。
如何計算 OpenAI API 成本
對於基本請求:
Token 成本 =
(輸入 tokens / 100 萬 × 輸入費率)
- (輸出 tokens / 100 萬 × 輸出費率)
用於生產規劃時,擴展為包含:
總工作流程成本 =
未快取輸入
- 已快取輸入
- 快取寫入
- 輸出與推理 tokens
- 工具費用
- 服務等級調整
- 若適用則包含區域性加價
- 重試與後備請求
最有用的 KPI 往往是:
每個成功任務的成本 = 總工作流程成本 / 成功任務數
這可避免在較便宜的 token 費率同時帶來更多失敗或審查工作時,出現虛假的吸引力。
如何在不多付費的情況下選對模型
以價格表為起點,接著在真實任務上測試。
- 先從看起來有能力完成任務的最低成本模型開始。Luna 可作為簡單、高量工作的合理首次測試,但不要假設它對每個抽取或摘要任務都是最佳選擇。
- 量測輸出長度。GPT-5.6 的輸出 tokens 成本是輸入的 6 倍,因此冗長回覆值得關注。
- 注意 272K 門檻。跨過它會改變整個請求的費率。
- 對非緊急且符合資格的工作使用 Batch 或 Flex。在導入生產流量前先測試作業條件。
- 只快取可重用的前綴。量測實際快取命中率,而非想當然地認為長提示就該快取。
- 追蹤工具與重試。它們可能抹去使用較便宜模型帶來的節省。
對於比較多家供應商路由的團隊,CometAPI pricing 提供即時的跨模型視圖。CometAPI Quickstart 與 Cookbook 可用於以相同工作負載測試多個與 OpenAI 相容的路由。
常見問題
2026 年 GPT-5.6 的費用是多少?
定價取決於模型。GPT-5.6 Standard 的短上下文費率從 Luna 的每 100 萬 tokens 輸入 $1 / 輸出 $6,到 Sol 的 $5 / $30 不等。也有 GPT-5.4 mini 與 nano 等較低成本模型可用。請在 OpenAI 的即時定價頁確認具體模型。
ChatGPT API 的定價是否與 GPT-5.6 相同?
「ChatGPT API 定價」常被非正式地用來指可聊天模型的 OpenAI API 定價,但 ChatGPT 訂閱與 API 計費是分開的產品。API 使用的價格由具體模型與使用類型決定。
哪個 GPT-5.6 模型最便宜?
gpt-5.6-luna 是最便宜的 GPT-5.6 模型,價格為每 100 萬 tokens 輸入 $0.20、輸出 $1.20。OpenAI 於 7 月 30 日將兩者均下調 80%,讓 Luna 對高量代理、分類、文件處理與明確工具工作流程更具成本效益。
gpt-5.6 使用哪個模型?
OpenAI 的模型說明指出,gpt-5.6 別名會路由至 gpt-5.6-sol。當你想使用 Terra 或 Luna 時,請使用明確的模型 ID。
何時會套用 GPT-5.6 的長上下文定價?
當輸入超過 272,000 個 tokens 時,GPT-5.6 會對整個請求使用較高的長上下文費率:輸入相關費率為 2 倍,輸出為 1.5 倍。
對 GPT-5.6 而言,Batch 與 Flex 是否比 Standard 更便宜?
對符合資格的 GPT-5.6 工作負載,Batch 與 Flex 的列示 token 費率約比 Standard 低 50%。它們具有不同的處理特性,請確認你的工作負載能容忍相關限制。
GPT-5.6 的快取寫入是否需要額外付費?
需要。GPT-5.6 的快取寫入按一般輸入費率的 1.25 倍計費,而符合條件的已快取讀取使用折扣後的已快取輸入價格。實際節省取決於實際重用情況。
在你的工作負載上自行比較 GPT-5.6 成本
定價表只是起點。你的實際成本取決於提示、輸出長度、快取命中率、工具、重試與任務成功率。
透過 CometAPI,你可以用同一個與 OpenAI 相容的 API,對 GPT-5.6 的 Sol、Terra、Luna 與其他模型執行相同的工作負載測試。
下一步:比較當前模型定價、參考 CometAPI Quickstart,或使用 CometAPI Cookbook 建立可重複的模型評測。
選擇在滿足品質、延遲與可靠性需求的前提下,成本最低的路由。
