GPT-5.6 Sol、Claude Sonnet 5 與 Gemini 3.7 Flash 要多少錢?
如何比較不同供應商的 AI 模型定價?請從相同的輸入/輸出比例、相同的貨幣,以及相同的「成功結果」定義開始。單一的「每 100 萬詞元價格」並不完整,因為輸入與輸出詞元的計費不同、長上下文請求可能進入更高的分層,且重試或被拒答案會讓實際成本更高。
截至 2026 年 8 月 26 日,在目前的 CometAPI 價格下,包含 800,000 個未快取的輸入詞元與 200,000 個輸出詞元的工作負載,使用 GPT-5.6 Sol 約為 $5.76、Claude Sonnet 5 約為 $2.88、Gemini 3.7 Flash 約為 $1.08。這些模型在速度與能力上所處位置不同,因此這是計費比較—不是聲稱它們提供相同品質。
如何跨供應商比較 AI API 定價
本文以每 100 萬可計費文字詞元的美元為單位。範例情境代表高量客服或知識工作流程,總計 800,000 個輸入詞元與 200,000 個輸出詞元,分布於多個請求。每個請求都低於 GPT-5.6 Terra 272,000 詞元的短上下文定價門檻。
基線不包含提示快取、批次折扣、工具費用、影像、音訊,以及失敗或重複呼叫。並假設其中一個生成答案被接受。公式為:
cost = (input tokens / 1M × input rate) + (output tokens / 1M × output rate)
請使用每次回應返回的實際詞元計數,而不是用字元估算。不同模型家族的分詞器不同,意味著相同文字不一定產生相同的可計費詞元數。
GPT-5.6 Sol、Claude Sonnet 5 與 Gemini 3.7 Flash API 價格
以下三個模型 ID 與費率已於 2026 年 8 月 26 日再次對照 CometAPI 的即時模型目錄。CometAPI 費率是本文演算所用數值。官方欄作為參考基準。
GPT-5.6 Sol API 定價
GPT-5.6 Terra: CometAPI 顯示每 100 萬輸入詞元 $1.60、每 100 萬輸出詞元 $9.60,相較於官方的 $2 / $12。價格更新註記: 即時費率反映 20% 的下調;CometAPI 的變更日誌記錄了 2026 年 7 月 31 日對 Terra 的降價,且在 8 月 22 日的價格檢視後再次核對。
已驗證更新(2026 年 8 月 26 日): 上述帶註解的說明保留,以維持其檢視錨點可見。本文計算請使用 GPT-5.6 Sol 每 100 萬輸入詞元 $3.20、每 100 萬輸出詞元 $16,相較於官方的 $4 / $20。CometAPI 於 2026 年 8 月 24 日公告此促銷,列示至 2026 年 11 月 21 日。
Claude Sonnet 5 API 定價
Claude Sonnet 5: 截至 2026 年 8 月 26 日,CometAPI 顯示每 100 萬輸入詞元 $1.60、每 100 萬輸出詞元 $8,對比 Anthropic 目前的 $2 / $10 標價。Anthropic 於 2026 年 8 月 10 日更新發佈貼文,將 $2 / $10 永久化;先前公告 9 月 1 日調整為 $3 / $15 已不再適用。
Gemini 3.7 Flash API 定價
Gemini 3.7 Flash: 截至 2026 年 8 月 26 日,CometAPI 顯示每 100 萬輸入詞元 $0.60、每 100 萬輸出詞元 $3,相較於 Google 2026 年 12 月 31 日前的導入價 $0.75 / $3.75。
| Model ID | CometAPI input / output | Official input / output | 800K in + 200K out |
|---|---|---|---|
| gpt-5.6-sol | $3.20 / $16 | $4 / $20 | $5.76 |
| claude-sonnet-5 | $1.60 / $8 | $2 / $10 | $2.88 |
| gemini-3.7-flash | $0.60 / $3 | $0.75 / $3.75 | $1.08 |
所有價格皆為每 100 萬詞元的美元。請參閱帶日期的模型頁面:GPT-5.6、Claude Sonnet 5、Gemini 3.7 Flash,以及 CometAPI 定價指南。Claude Sonnet 5:CometAPI 顯示每 100 萬輸入詞元 $1.60、每 100 萬輸出詞元 $8,對比 Anthropic 的目前 $2 / $10 標價。Anthropic 原先宣布 2026 年 9 月起標準價格為 $3 / $15,但於 2026 年 8 月 10 日更新定價並將 $2 / $10 永久化。GPT-5.6 Terra 亦有較高的長上下文分層,因此請勿將短上下文數值套用於超出已發佈門檻的請求。
在此情境下,Gemini 3.7 Flash 的詞元帳單最低,定位為高效率的 Flash 模型。Claude Sonnet 5 是平衡的生產模型,而 GPT-5.6 Sol 是針對較難推理與程式工作負載的旗艦選項。更有用的決策不只是「哪一列最便宜?」而是「哪個模型以最少的總詞元、重試與重跑,產生可接受的結果?」
GPT、Claude 與 Gemini 的每 100 萬詞元要多少錢?
對於 800K 輸入與 200K 輸出的基線,計算相當直接。GPT-5.6 Sol 成本為 0.8 × $3.20 + 0.2 × $16 = $5.76。Claude Sonnet 5 成本為 0.8 × $1.60 + 0.2 × $8 = $2.88。Gemini 3.7 Flash 成本為 0.8 × $0.60 + 0.2 × $3 = $1.08。
這樣的算術有助於預算編列,但「被接受的輸出成本」才是更好的生產指標。下表展示在相同工作負載下,常見營運額外開銷會帶來什麼影響。
| Model | Baseline | 5% retried | 10% rerun | 40% output |
|---|---|---|---|---|
| GPT-5.6 Sol | $5.76 | $6.05 | $6.34 | $8.32 |
| Claude Sonnet 5 | $2.88 | $3.02 | $3.17 | $4.16 |
| Gemini 3.7 Flash | $1.08 | $1.13 | $1.19 | $1.56 |
「5% retried」假設整體詞元工作負載有 5% 被再次送出。「10% rerun」假設每十個輸出就有一個未通過品質檢查,並以相同詞元組合重新生成。「40% output」維持總計 100 萬詞元不變,但將比例改為 600K 輸入與 400K 輸出。由於輸出詞元成本較高,冗長的輸出可能比流量成長更快地推高帳單。
重試與失敗輸出會增加多少成本?
API 重試與重跑要多少成本?
重試可能重複可計費工作。 在基線下,重試 5% 工作負載會將 GPT-5.6 Sol 從 $5.76 拉高到約 $6.05,而品質失敗後重跑 10% 則約為 $6.34。重試是因傳輸或服務失敗而重送請求;重跑則是對已送達但被拒的答案重新生成。僅對速率限制、逾時與暫時性伺服器失敗進行重試。CometAPI 的錯誤與重試指南建議使用帶抖動的指數退避,且不要自動重試格式錯誤或驗證失敗的請求。請設定上限,以免供應商故障事件引發重試風暴。
提示快取可以節省多少?
快取節省取決於重用率。 GPT-5.6 Sol 的短上下文 CometAPI 費率列示快取讀取為 $0.32/每百萬,快取寫入為 $4/每百萬。若 800K 輸入中有一半是可重用的快取前綴,首次執行約為 $6.08,因為寫入 400K 快取詞元相較於一般輸入多出 $0.32 的溢價。之後快取命中的執行約為 $4.61,而非 $5.76,約省下 $1.15。損益兩平: 成功重用一次就能回收初次寫入溢價;在前兩次執行合計下,使用快取的路徑約為 $10.69,相較於未使用快取的 $11.52 更低。其他模型有不同的快取規則與門檻,預算編列前請先確認。
輸出長度如何影響 AI API 成本?
長答案很昂貴。 三個模型的輸出費率皆為輸入費率的五倍。請設定符合任務的輸出上限,要求精簡格式,並在完成所需結構後立即停止輸出。
失敗的 AI 輸出要多少成本?
失敗任務仍可能消耗詞元。 返回不可用答案的請求在技術上可能是成功的,且已完整計費。請將格式違反、臆斷(hallucination)、工具失敗與人工拒絕,與 HTTP 錯誤分別追蹤。
詞元價格不等於工程成本。 供應商特定 SDK、分開的發票、重複的監控,以及遷移工作都會增加營運成本。透過 CometAPI 比較三個模型家族時,團隊可以使用相同的 OpenAI 相容基礎 URL—https://api.cometapi.com/v1—並僅更換 model ID,在維持單一計費與觀測層的同時進行測試。模型特定能力仍需驗證。
如何降低 GPT、Claude 與 Gemini 的 API 成本
Batch 與 Flex 可以降低多少成本?
Batch 與 Flex 是處理模式,而非每個請求自動折扣。CometAPI 的 GPT-5.6 定價指南指出,符合資格的 Batch 與 Flex 詞元費率約比 Standard 低 50%;Anthropic 亦列示批次處理最高可省 50%。將 50% 的敏感度套用至 GPT-5.6 Sol 的 $5.76 基線,約為 $2.88,但在相同模式與費率出現在你的 CometAPI 帳戶前,請將此視為示意。對非同步作業使用 Batch;僅在可接受變動延遲時使用 Flex。
GPT-5.6 Terra vs Claude Sonnet 5 vs Gemini 3.7 Flash:哪個最便宜?
以相同的 800K 輸入與 200K 輸出工作負載,依 2026 年 8 月 26 日檢視的 CometAPI 費率,Gemini 3.7 Flash 為 $1.08、Claude Sonnet 5 為 $2.88、GPT-5.6 Terra 為 $3.20。Gemini 在純詞元成本上最便宜。對較難任務而言,若 GPT-5.6 Terra 的能力可降低重試或人工校正,它仍可能更經濟,因此請比較「每個被接受結果的成本」後再選擇生產路徑。
按任務難度路由。 對分類、擷取與常規草稿使用低成本模型,僅在模糊或高價值請求時升級。後備模型應匹配所需的多模態、工具支援與輸出格式—而非僅僅有較低費率。
在呼叫前預算輸出。 設定合理的最大輸出,並記錄回應中的實際輸入、輸出與快取詞元。CometAPI 成本估算指南將呼叫前估算視為預算護欄,而以實際使用作為最終衡量。
快取穩定內容,而非變動上下文。 系統指令、產品政策與長參考文件在重複時是良好候選。衡量快取命中率並計入寫入成本;否則快取在理論上看似便宜,實際生產中卻省不了多少。
選擇性重試。 加入指數退避、抖動與最大嘗試次數。記錄 model ID、狀態、request ID、詞元,以及是否為重試。這能讓重複支出一目了然。
優化每個被接受結果的成本。 跑一組固定評測集,計算「總 API 支出 / 被接受輸出」。若較昂貴的模型需要更少重試、更短提示或更少人工校正,它在整體上可能更省。
上線前再次檢視。 模型可用性、導入價、分層門檻與折扣會變動。於發佈或核准預算當日,查詢 Models API 或檢視公開模型目錄。
常見問題(FAQ)
「每 100 萬詞元成本」究竟是什麼?
它是標準化費率,而非每個請求的價格。請將模型的輸入與輸出費率,乘上你的工作負載實際使用的詞元。將快取詞元、長上下文分層與任務計價分開計算。
哪個最便宜:GPT、Claude,還是 Gemini?
對本文於 2026 年 8 月 26 日檢視之特定模型與 800K 輸入/200K 輸出工作負載,Gemini 3.7 Flash 透過 CometAPI 的成本最低,為 $1.08,其次是 Claude Sonnet 5 的 $2.88,以及 GPT-5.6 Sol 的 $5.76。它並非自動成為每個任務的最佳選擇;請針對你的提示比較品質、延遲與「被接受輸出成本」。
應該比較官方價格還是聚合器價格?
比較你實際會支付的價格,並將官方價格保留為參考。對每一列使用相同的日期、貨幣、詞元比例、分層與折扣假設。
重試一定會計費嗎?
不要假設免費。傳輸失敗的請求可能未達推論層;而逾時或被拒的應用結果可能已消耗模型工作。請使用實際使用量與帳單,並防止對不可重試錯誤進行自動重試。
提示快取一定省錢嗎?
不一定。快取寫入可能比一般輸入更貴,且節省取決於重讀次數。從模型目前的寫入與讀取費率計算損益兩平,並監控實際快取命中率。
應該多久檢視一次定價?
在發佈價格說明、變更生產模型或核准預測前檢視。將模型 ID 與驗證日期與計算一起保存,以便日後再現估算。
結論:哪個 AI API 對你的工作負載最便宜?
公平的 GPT vs Claude vs Gemini 定價比較,需要同一日期來源、相同詞元比例與同一成功定義。每詞元費率形成基線;快取、重試、輸出長度與品質失敗決定實際帳單。CometAPI 透過一致的端點與計費層讓跨供應商測試更容易,但最便宜的模型仍是那個能以最少總工作量達到你的品質目標的模型。
