DR
快取輸入定價可以顯著降低在多次重送大型且不變的提示前綴時的工作負載成本,但實際節省取決於各模型特定的快取讀取、快取寫入、儲存、路由及保留規則。一個籠統的「支援快取」標籤不足以估算成本;應以針對該模型與路由當前公布的價格為準。
TL;DR
- GPT-5.6 Terra 在 OpenAI、CometAPI 與 OpenRouter 上都有明確的快取讀取與快取寫入價格,但閘道路由與長上下文分層可能改變實際數額。
- Google 對 Gemini 3.6 Flash 公布了每 1M-token $0.15 的 Standard 內容快取費率,另有儲存費用;CometAPI 目前發布該模型的標準輸入與輸出價格,尚無單列的快取輸入項。
- 有意義的比較不僅是標準輸入對比快取讀取,還包括首次寫入費用、任何儲存費、快取壽命、路由一致性,以及後續快取命中的次數。
Key messages
- 以模型與服務層級的價格為準,而非套用全閘道的一致乘數。
- 在成本計算中分別處理快取讀取、快取寫入、儲存與回應快取。
- 在依公布費率預測節省之前,先於 API 回應中繼資料驗證實際快取使用情況。
對於會重複一段大型且不變前綴的請求——例如系統提示、一組工具結構定義、或一份長參考文件——不必在每次呼叫都以完整輸入費率計費。多數現代引擎支援某種形式的快取輸入定價:對於提供者辨識為已處理過的提示部分,以較低費率計價。機制、折扣幅度以及揭露清晰度會因提供者與閘道而異,這些差異值得具體區分,而不是把「支援快取」當成同一種功能。
What cached input pricing is, and isn't
快取輸入定價是針對請求中符合之前已送出前綴的「輸入」詞元給予折扣。它不會折扣輸出詞元,也不同於某些閘道對兩個完全相同請求進行去重並免費回傳單一回應——那是另一種機制。快取輸入定價的重點是:對於提供者近期已看過的提示部分付較少的錢,而不是完全跳過生成。
建立快取也不是免費的。OpenAI 的 GPT-5.6 定價說明指出,快取寫入按未快取輸入費率的 1.25 倍計價,而快取讀取享有 90% 的折扣。這個首次寫入溢價會影響損益兩平點,若只看折扣後的讀取費率很容易忽略。其他提供者可能用基於儲存的費用替代相同的寫入模型,因此應分別檢查寫入與儲存成本。
在實務上,可計費的快取單位通常是可重用的提示前綴,而非任意重複句子的集合。提供者會按順序將內容詞元化並比對,因此可重用的材料必須位於請求特定尾端之前。穩定的系統指示、工具定義、政策與參考材料應該放在前面;變動的使用者訊息、時間戳、請求 ID 或檢索片段應當放在後面。即使是前段看似無害的變更,也可能改變詞元化結果或破壞後續內容的匹配。
適用規則也依模型而異。提供者可能要求最小提示長度、只辨識文件化的斷點,或暴露明確的快取控制欄位。快取項目可能在請求間過期,而閘道可能需要將相關請求維持在相容的上游路由上。因此,部署時應將快取命中視為觀察到的結果,而非僅憑提示相似度所做的假設。良好結構的提示能提高重用機率,但仍應以回應中繼資料與帳單作為是否實際套用折扣費率的依據。
What's actually published, by model and by gateway
下表為 2026-07-29 的定價快照。除非另有說明,價格單位為每 1 million tokens 的美元。各列比較 GPT-5.6 Terra 與 Gemini 3.6 Flash 在模型提供者、CometAPI 與 OpenRouter 的當前公開資訊;不應視為永久費率。
| Model | Gateway | Standard input | Cached input (read) | Cache write | Discount disclosed? |
|---|---|---|---|---|---|
| GPT-5.6 Terra | Official OpenAI rate | $2.50 / 1M | $0.25 / 1M | $3.13 / 1M | 是 — 直接聲明 90% 折扣 |
| GPT-5.6 Terra | CometAPI | $2.00 / 1M | $0.20 / 1M | $2.50 / 1M | 是 — 列於 CometAPI 自有定價頁面 |
| GPT-5.6 Terra | OpenRouter | $2.50 / 1M | Not listed as a specific rate | Not listed | 否 — 僅以「便宜 60–80%」的整體說法描述,未提供逐模型數值 |
| Gemini 3.6 Flash | Official Google rate | $1.50 / 1M | $0.15 / 1M (per Google's own announcement) | Not disclosed | 是,在發佈時 — 透過 Google 的模型文件 |
| Gemini 3.6 Flash | CometAPI | $1.20 / 1M | Not listed as a specific rate | Not disclosed | 否 — CometAPI 的頁面標註「Caching」為支援功能,但截至目前未對此特定模型公布折扣後的快取輸入費率 |
| Gemini 3.6 Flash | OpenRouter | $1.50 / 1M | Not listed as a specific rate | Not disclosed | 否 — OpenRouter 的文件僅以一般性方式描述 Google 的快取倍數(相對列示輸入 0.25x),而非確認此模型的具體費率 |
閱讀該表時,請將其視為模型與路由層級的即時快照。CometAPI 的 GPT-5.6 模型頁逐項列出 GPT-5.6 Terra 的每 1 million tokens $2.00 標準輸入、$0.20 快取輸入與 $2.50 快取寫入。其 Gemini 3.6 Flash 模型頁目前公布 $1.20 輸入與 $6.00 輸出,但未顯示單獨的快取輸入或快取儲存價格。Google 的 Gemini Developer API 定價列出 Standard 層為 $1.50 輸入、$0.15 內容快取,以及每 1 million tokens 每小時 $1.00 的儲存費。OpenRouter 目前透過其 Models API公開模型層級的快取欄位:GPT-5.6 Terra 的預設路由包含較低的促銷價,並在長上下文層級另有較高價格;而其 Gemini 3.6 Flash 項目則公開不同的 Standard、Flex 與 Priority 值。這比對所有模型套用單一通用快取乘數更為精確。
Why gateway and provider prices can diverge
閘道價格不一定是某個固定上游牌價的加成。它可能反映協議產能、臨時促銷、不同的服務層級,或特定路由的商業安排。單一模型名稱也可能對應多個上游變體,其價格會隨上下文長度或延遲保證而變動。以 OpenRouter 的 GPT-5.6 Terra 為例,其頁面公布一個預設路由,且在輸入達到長上下文門檻後提供較高價位的覆寫。Google 對 Gemini 3.6 Flash 則區分 Standard、Batch、Flex 與 Priority 的定價。因此,單一比較列需要包含日期、路由、層級與上下文假設,才具有意義。
反過來說:若某閘道頁面未單列快取讀取費用,也不應因此推論「不支援快取」或「提供者的直接折扣會自動套用」。閘道可能傳遞上游功能但不單獨列示,或僅在特定路由上暴露,或直接以一般輸入費率計費。較為穩健的做法是以閘道自身的當前模型頁面進行規劃,並再由使用紀錄或計費資料確認實際費率。提供者文件有助於理解機制,但本身不足以界定中介的商務條款。
Where the discount actually matters
此折扣在成本上真正有意義的情境,是大型、靜態前綴配上小型、可變請求——例如在代理循環中每次呼叫都重送的系統提示或工具結構定義、以不同問題反覆查詢的長參考文件、或在每次聊天輪次重送的會話歷史。對這類工作負載而言,對整個前綴每次都付標準輸入費與僅在首次支付寫入溢價、其後以折扣讀取費率計價的差距,會隨呼叫量而累積。對不重複前綴的工作負載則無效——一次性請求本就沒有可折扣的快取內容。
一個務實的損益兩平計算,會比較在所有呼叫中重複前綴的未快取成本,與快取寫入或儲存成本加上後續折扣讀取的合計。結果取決於前綴大小、成功快取命中的次數、快取到期,以及閘道是否能將請求維持在相容的提供者路由上。若這些條件不穩定,標稱折扣可能高估實際在生產中可實現的節省。
A simple cost model for a repeated prefix
令 P 為穩定前綴的詞元數,N 為重用此前綴的呼叫次數。若 U 是每詞元的未快取輸入價格,則在無快取時,前綴成本為 N × P × U。簡化的快取估算為 P × W + (N − 1) × P × R + S,其中 W 為快取寫入價、R 為快取讀取價、S 為期間內的任何儲存費。此公式假設第一次呼叫建立快取,之後每次皆成功命中;不包含每次請求的可變尾端、輸出詞元、重試,或因路由變更導致的未命中。
以官方 GPT-5.6 Terra 費率為例,假設一個 100,000 詞元的前綴被重用 20 次。在每 1 million 未快取輸入詞元 $2.50 的情況下,重複處理該前綴將花費 $5.00。採用公布的 1.25 倍寫入費與 90% 折扣的讀取費,一次 100,000 詞元的寫入約為 $0.3125,十九次讀取約為 $0.475,合計前綴成本約 $0.7875。差異約為 $4.21,未含可變輸入與輸出成本。此僅為示例,非報價:僅在後續十九次呼叫皆命中同一有效快取,且無額外儲存或路由費用時成立。
損益兩平點可由同一模型直接推得。只有在快取到期前發生足夠多次折扣讀取,首次寫入溢價才合理。對於短會話、頻繁提示編輯或路由黏著度弱的工作負載,快取可能比預期更常被重建。對於長期運行的代理循環或針對穩定前綴的重複文件分析,命中次數可能高得多。因此,預測時應使用觀察到的命中率區間,而非假設首呼後皆為完美序列。
Implementation patterns that improve cache reuse
提示構造對命中率的影響往往比許多定價試算表所暗示的更大。將最穩定的材料置於最前,並保持其序列化具決定性:系統指示、工具結構定義、政策文本與共享參考上下文應在相關呼叫間維持相同順序、空白與欄位表徵。將易變內容追加於其後。避免在可重用前綴中注入時間戳、隨機識別碼、連續變動的計數器或請求特定的檢索結果,除非它們確有必要存在於該處。
對穩定材料進行有意的版本化。若工具結構或政策變更,請一致地指定新版本,而非讓多個幾乎相同的變體流通。對於對話式或代理式工作負載,當 API 支援時重用穩定的會話識別碼或快取鍵,並避免在同一依賴快取的序列中切換提供者。OpenRouter 文件化了用於提示快取的提供者黏著路由,並暴露了 session_id 與 prompt_cache_key 等控制項;這些控制可改善連續性,但在上游快取為冷或已過期時不保證命中。
應確保在未命中時亦能平順降級。快取是成本與延遲的最佳化,而非正確性的依賴。當快取不可用時,請求仍必須產生相同且有效的結果;重試邏輯不應盲目地重複建立寫入。此區分讓比較不同路由更安全:團隊可在不改變應用語義行為的前提下調整快取政策或閘道配置。
How to verify cache economics in production
先從逐請求的遙測著手,而非月度帳單。記錄精確的模型識別碼、閘道路由或提供者(若有暴露)、服務層級、輸入詞元總數、快取讀取詞元、快取寫入詞元、輸出詞元、延遲與計費成本。OpenRouter 的使用物件包含 cached_tokens 與 cache_write_tokens;其他提供者也會以不同欄位名稱暴露等效細節。保留原始使用欄位,以免之後的定價變更抹去重建成本所需的證據。
按提示版本與工作負載聚合資料,而不僅是按模型。實用的指標包括:符合資格的請求中快取命中的占比、以讀取費率計費的輸入詞元占比、每次成功讀取所對應的寫入次數、從寫入到最後一次命中的時間,以及實際每請求成本。若快取前綴很小,即使請求層級的命中率很高,價值也可能有限;而在非常大的前綴下,較低的命中率反而可能節省更多。將這些指標與延遲百分位配對,因為若較便宜的路由反覆未命中或重路由,在營運上可能更差。
最後,請檢視異常,而非將其平滑處理。快取詞元的突然下降可能表示提示版本的發布、不穩定的序列化、快取到期、長上下文層級邊界或閘道路由變更。將受影響的請求與當前模型頁面與提供者文件比對,再驗證計費費率。如此便能縮小公布折扣與應用實際節省之間的差距。
What to check before assuming a rate applies
在將公布費率納入預算之前,請先確認五項內容:精確的模型與服務層級、最小可重用前綴或明確的快取斷點、首次寫入或儲存費用、快取壽命,以及請求確實命中快取的證據。OpenAI 目前對 GPT-5.6 表示最短 30 分鐘的快取壽命,但這不是通用的保留規則。Google 對 Gemini 3.6 Flash 公布了 Standard、Batch、Flex 與 Priority 不同的費率。閘道也可能在提供者或層級之間進行路由,因此所選路由很重要。OpenRouter 的提示快取文件建議檢查回應使用欄位,如 cached_tokens 與 cache_write_tokens。任何生產級估算,皆應比較當前模型頁面與實際計費與使用中繼資料,而非僅依賴泛泛的「支援快取」標籤。
