TL;DR 官方 API 費率起價為每百萬輸入 Token $10、每百萬輸出 Token $50,約為 GPT-5.6 Sol 標準 Token 價格的 2.5 倍。
GPT-6 Astra 旨在處理持續運行的編碼、瀏覽器、電腦使用、研究與代理型工作流程,其實際成本往往由重試、工具呼叫、上下文增長、快取使用與任務完成機率決定。OpenAI 將 Astra 定位在最困難的端到端工作,而非廉價的大量推理。
此外還有一個重要的價格斷點:一旦請求的輸入 Token 超過 272K,Astra 的費率會對整個請求提高。
我們需要注意:
- 注意上下文大小:一旦跨過 272K 輸入 Token,整個請求的費率會改變。
- 計入快取:當快取命中成功,重複的穩定前綴成本可顯著降低。
- 選擇處理層級:Batch/Flex 以延遲換取較低費率;Fast 會加價。
- 度量任務結果:比較時納入 Token、工具、失敗嘗試與人工校正時間。
GPT-6 Astra 價格一覽
下表把一般輸入、快取讀取、快取寫入與輸出分開。上下文區間以輸入 Token 數計;所有 Token 價格以每百萬 Token 計。
Batch 與 Flex 使用 Standard 價格的一半。Fast 使用對應 Standard 價格的兩倍。這些處理模式服務於不同的延遲與可用性需求。
| Pricing mode / context | Input / 1M | Cached input / 1M | Cache write / 1M | Output / 1M |
|---|---|---|---|---|
| Standard ≤272K | $10.00 | $1.00 | $12.50 | $50.00 |
| Standard >272K | $20.00 | $2.00 | $25.00 | $75.00 |
| Batch/Flex ≤272K | $5.00 | $0.50 | $6.25 | $25.00 |
| Batch/Flex >272K | $10.00 | $1.00 | $12.50 | $37.50 |
| Fast ≤272K | $20.00 | $2.00 | $25.00 | $100.00 |
| Fast >272K | $40.00 | $4.00 | $50.00 | $150.00 |
這張表中最重要的數字或許不是 $10 或 $50,而是 272K。
對於超過 272K 輸入 Token 的提示,OpenAI 對整個請求套用輸入/快取 2× 與輸出 1.5× 的費率。因此在臨界點附近的小幅增加,可能導致成本大幅上升。
什麼是 GPT-6 Astra?
GPT-6 Astra 將編碼、研究與電腦互動整合於一個模型。其上下文容量、輸出限制與支援的工作流程,說明了價格溢價可能影響的場景。
| Official API specifications | Value |
|---|---|
| Developer | OpenAI |
| Model ID | gpt-6-astra |
| Context window | 1,050,000 tokens |
| Maximum output | 128,000 tokens |
| Knowledge cutoff | April 30, 2026 |
| Input modalities | Text and images |
| Output modality | Text |
| Reasoning levels | Low, Medium, High, XHigh, Max |
| Recommended API | Responses API for tool-rich workflows |
| Fine-tuning | Not supported |
| Long-context pricing threshold | More than 272K input tokens |
這個 1.05M Token 的上下文視窗與價格特別相關。Astra 能夠攝入非常大的程式庫、文件、工具歷史與研究材料,但充分利用可用的上下文視窗並不代表在經濟上就是最佳。
非同步工具呼叫與中途調整能力支援更長的工作流程,以及電腦使用、提示快取、多代理協作與壓縮。模型支援不代表每個供應商都暴露所有工具或功能。
透過 CometAPI 使用 GPT-6 Astra 要花多少錢?
CometAPI 目前提供 GPT-6 Astra API 存取,其短/長上下文 Token 費率各較官方對應費率低 20%。
- 短上下文:CometAPI 列為 $8/M 輸入與 $40/M 輸出,相較於 OpenAI 的 $10/M 與 $50/M。
- 長上下文:CometAPI 列為 $16/M 輸入與 $60/M 輸出,相較於 OpenAI 的 $20/M 與 $75/M。
- 快取:短上下文讀/寫費率為 $0.80/M 與 $10/M;長上下文費率為 $1.60/M 與 $20/M。
- 差異:CometAPI 列示費率在各類別均較 OpenAI 相應費率低 20%。上線前請確認當前費率。
以先前 100K 輸入、10K 輸出的例子:
OpenAI: 100K × $10/M + 10K × $50/M = $1.50
CometAPI: 100K × $8/M + 10K × $40/M = $1.20
每次請求節省:$0.30
在 10,000 次等量請求下,簡化差額為 $3,000。
對於 300K 輸入、20K 輸出的長上下文工作負載:
OpenAI: 300K × $20/M + 20K × $75/M = $7.50
CometAPI: 300K × $16/M + 20K × $60/M = $6.00
每次請求節省:$1.50
API 價格與計費規則可能變動。生產預算應以當前 CometAPI 的活躍模型與工作負載費率為準。
百分比差異很直觀,但大型代理工作負載會放大絕對影響,因為單個請求就可能消耗數十萬輸入 Token。
模型 Token 之外的 GPT-6 Astra 成本是什麼?
傳統文字生成中,輸入與輸出 Token 主導成本計算。對 Astra 代理來說,它們可能只是帳單的一部分。
OpenAI 對網頁與檔案搜尋工具分別計費。網頁搜尋每 1,000 次呼叫 $10,且擷取內容也按模型 Token 費率計費。檔案搜尋每 1,000 次呼叫 $2.50,且超過 1 GB 的儲存以 $0.10/GB/日計費。
Hosted Shell 與 Code Interpreter 有獨立的容器計費:1 GB 的費率為每 20 分鐘每容器 $0.03。符合條件的會話採每分鐘計費,最低 5 分鐘。更大的記憶體配置費率更高。
工具產生的內容也會增加 Token 消耗。瀏覽器或電腦使用代理可能反覆把螢幕截圖、頁面、終端輸出、擷取文件與工具歷史加入上下文。即使每個動作本身成本不高,累積的歷史仍可能把下一次模型請求推過 Astra 的 272K 閾值。
因此生產預算至少應追蹤:模型 Token + 快取活動 + 工具呼叫 + 托管執行 + 重試 + 總步數 + 成功任務比率。
工作流程越自動化,單獨看每百萬 Token 價格就越不具意義。
推理努力會影響 GPT-6 Astra 成本嗎?
推理努力不是已發佈 Token 費率表中的獨立項目。但它仍可能間接改變總支出:更深入的推理可能產生更多輸出 Token、延長工具使用或拉長代理軌跡,而更好的決策可能減少重試與人工校正。請在相同任務集上比較推理設定,並回報總模型 Token、工具費用、完成率與校正時間。
你買到了多少效能?
沒有理解較高費率換來的效能,就無法完成價格比較。
OpenAI 報告在代理與技術評測上有顯著提升。以下百分比為供應商報告,非本文的獨立測量;「—」表示未報告結果。
| Official benchmark (%) | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Gemini 3.8 Flash |
|---|---|---|---|---|
| AutomationBench | 41.4 | 18.1 | 31.4 | — |
| Terminal-Bench 4.0 | 57.9 | 37.3 | 55.8 | 19.1 |
| Terminal-Bench Science 0.1 | 64.6 | 22.4 | 52.6 | — |
| FrontierMath Tier 4 (v2) | 97.6 | 83.0 | 87.8 | — |
| GPQA Diamond | 96.0 | 94.6 | 93.7 | 95.3 |
| ExploitBench | 100.0 | 78.5 | — | — |
在 OpenAI 的 OSWorld 2.0 離線評測中,Astra 得分 72.6%,對比 GPT-5.6 Sol 的 65.7%。延遲模擬估計每個任務約 40 分鐘 vs 75 分鐘。這些時間描述的是評測設定,非一般延遲保證。
這在經濟上很重要。
每 Token 價格高 2.5 倍的模型,並不必然代表每個完成任務的成本也高 2.5 倍;若其需要更少回合、較少重試、工作流程更快,或避免升級到人工作業,則未必更貴。
同時,Astra 也不會自動成為每項任務的最佳價值。當其代理能力的提升確實影響任務完成時,溢價更容易正當化。
272K 價格斷點改變了經濟性
GPT-6 Astra 定價中最容易被忽略的是當輸入跨過 272K Token 會發生什麼。
考慮幾個簡化的 Standard 階層請求,無快取與其他工具費用。
| Workload | Input | Output | Pricing range | Estimated OpenAI cost |
|---|---|---|---|---|
| Short coding request | 20K | 2K | ≤272K | $0.30 |
| Large analysis | 100K | 10K | ≤272K | $1.50 |
| Near-threshold agent | 270K | 10K | ≤272K | $3.20 |
| Slightly larger agent | 280K | 10K | >272K | $6.35 |
| Repository-scale task | 300K | 20K | >272K | $7.50 |
270K Token 的例子成本為:
270K × $10/M + 10K × $50/M = $3.20
輸入僅增加 10K Token,請求就進入長上下文定價:
280K × $20/M + 10K × $75/M = $6.35
輸入增長約 3.7%,但總成本幾乎增加 98%。
這使得上下文管理成為 Astra 代理的重要控費機制。與其持續附加每個工具結果、檔案、截圖與對話輪次,不如在生產系統中對舊狀態進行摘要、只檢索相關檔案、將穩定上下文隔離以便快取、並為獨立任務啟動新的子代理。
對 Astra 而言,Token 最佳化不僅是減少 Token 數,也包括維持在更便宜的定價邊界內。
提示快取如何改變 GPT-6 Astra 的輸入成本
在短上下文區間的 Standard 請求中,一般輸入為 $10/M,快取讀取為 $1/M,快取寫入為 $12.50/M。較低的讀取費率只在可重用前綴成功由快取提供時適用。
成功的快取讀取成本是一般輸入的十分之一,而寫入有其自身費率。重用取決於匹配的快取前綴是否仍可用。請分別衡量寫入與命中,而非把每次重複提示視為快取命中。
考慮十個假設請求,每個都包含相同的 100K Token 前綴,且總輸入 Token 保持在 272K 以內。比較兩種控制情境:無快取,對比一次完整前綴寫入快取,隨後九次完整前綴成功讀取,無額外寫入。
| Repeated-prefix cost across ten requests | No caching | One write + nine reads |
|---|---|---|
| Ordinary prefix input | 10 × 100K × $10/M = $10.00 | $0.00 |
| Prefix cache write | $0.00 | 100K × $12.50/M = $1.25 |
| Prefix cache reads | $0.00 | 9 × 100K × $1/M = $0.90 |
| Total for the repeated prefix only | $10.00 | $2.15 |
78.5% 數字的適用範圍:
從 $10.00 降至 $2.15 的減幅僅適用於上述「一次寫入 + 九次命中」範例中該重複前綴的輸入成本。它不是對
的典型節省估計,也不是整體 API 帳單 78.5% 的減幅。
加入輸出後,假設每個請求都額外產生 2,000 個計費輸出 Token。在 $50/M 下,輸出為每個情境的總成本增加 $1.00。若無其他輸入或費用,模型 Token 合計分別為「無快取 $11.00」與「有快取 $3.15」,約減少 71.4%。額外輸入、快取未命中或重寫、工具與不同處理層級會再次改變總成本。
請以實測的快取寫入與成功讀取與其餘費用一起估算節省。一個大型可重用前綴能降低輸入支出,但其對總成本的影響取決於該前綴在帳單中的比重。
GPT-6 Astra vs Claude Fable 5.1:同樣標題價格,不同快取經濟
Claude Fable 5.1 的每百萬輸入 $10、輸出 $50標題費率與 Astra 的 Standard 短上下文輸入/輸出價格一致。
標題價格相同,但快取不同。
| Cost dimension | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| Input / 1M | $10.00 | $10.00 |
| Output / 1M | $50.00 | $50.00 |
| Cache read / 1M | $1.00 | $0.25 |
| Cache write / 1M | $12.50 | $12.50 (5-minute cache) |
| Context window | 1.05M | 1M |
| Terminal-Bench 4.0 | 57.9 | 55.8 |
| AutomationBench | 41.4 | 31.4 |
Fable 的快取讀取 $0.25/M為 Astra 短上下文 $1/M 的四分之一。Fable 的 5 分鐘快取寫入與 Astra 相同為 $12.50/M;1 小時寫入選項為 $20/M。
對於極度重複、以快取前綴為主的工作負載,即使兩個模型的 $10/$50 標題價格相同,Fable 在輸入端經濟性可能更好。對於工具密集的軟體工程與自動化任務,Astra 在部分代理評測的更強結果可能抵消該快取劣勢。
因此,相同的輸入與輸出價格不代表工作負載成本相同。快取存續時間、命中率、產生的輸出與任務成功必須一起比較。
GPT-6 Astra vs GPT-5.6 Sol:Token 價格 2.5× 值不值得?
GPT-5.6 Sol costs $4/M input and $20/M output in the Standard short-context band, compared with Astra’s $10/M and $50/M. The table separates that rate difference from capability differences.
| Official model comparison | GPT-6 Astra | GPT-5.6 Sol | Difference |
|---|---|---|---|
| Input / 1M | $10 | $4 | Astra 2.5× |
| Output / 1M | $50 | $20 | Astra 2.5× |
| Cached input / 1M | $1 | $0.40 | Astra 2.5× |
| Context | 1.05M | 1.05M | Same |
| Max output | 128K | 128K | Same |
| AutomationBench | 41.4 | 18.1 | Astra +23.3 pts |
| Terminal-Bench 4.0 | 57.9 | 37.3 | Astra +20.6 pts |
| OSWorld | 72.6 | 65.7 | Astra +6.9 pts |
若兩個模型消耗的 Token 數完全相同且成功率一致,Sol 顯然更便宜。
單看 Token 價格,Astra 需要其工作流程消耗約 40% 的計費 Token 等效工作量,才能抵消 2.5× 的費率差。
但自動化工作流程不會如此整潔。一次失敗的 $1 嘗試再跟著另一個 $1 嘗試,成本會高於一次 $1.50 即成功的請求。當較弱的模型導致更多工具呼叫、更長軌跡、人工審核或重複程式碼執行時,亦然。
OpenAI 報告在多個評估中,儘管 Astra 的每 Token 費率較高,但其以較少輸出 Token 與較低的每任務估計 API 成本取得更強結果。
對於一般聊天、重述、抽取、分類等直截了當的工作負載,這種論點就弱得多。
GPT-6 Astra vs Gemini 3.8 Flash:截然不同的成本等級
Gemini 3.8 Flash 位於較低價格層。Google 的優惠價在 2026 年 12 月 31 日前為每百萬輸入 $0.75、輸出 $3.75。
這使 Astra 在 Standard 短上下文費率下,無論未快取輸入或輸出,都約貴 13.3×。
| Comparison dimensions | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Gemini 3.8 Flash (pricing) |
|---|---|---|---|---|
| Input / 1M | $10.00 | $4.00 | $10.00 | $0.75* |
| Output / 1M | $50.00 | $20.00 | $50.00 | $3.75* |
| Cached input / 1M | $1.00 | $0.40 | $0.25 | $0.075* |
| Context | 1.05M | 1.05M | 1M | 1,048,576 |
| Max output | 128K | 128K | 128K | 65,536 |
| Terminal-Bench 4.0 | 57.9 | 37.3 | 55.8 | 19.1 |
| GPQA Diamond | 96.0 | 94.6 | 93.7 | 95.3 |
表中的 Gemini 價格為
前的優惠價。自 2027 年 1 月 1 日起,輸入/輸出費率為每百萬 Token $1.50/$7.50,快取讀取為 $0.15/M。
於 2026 年為 $0.50/每百萬 Token/小時,2027 年起為 $1/每百萬 Token/小時。OpenAI 價格使用 Standard 短上下文區間。
此比較說明為何模型路由比為每個請求選一個單一模型更有效。將 Astra 用於最困難的程式庫級工程或自動化任務,並把常規高量工作負載路由到更便宜的模型,較之到處用 Astra 或完全不用 Astra,都能帶來更好的整體成本表現。
依處理層級計算的 GPT-6 Astra 成本:Standard、Batch、Flex 與 Fast
GPT-6 Astra 的處理層級可像模型選擇一樣改變帳單。
對於 300K 輸入、20K 輸出的請求,適用長上下文費率。
| Processing mode | Input cost | Output cost | Total |
|---|---|---|---|
| Batch/Flex | $3.00 | $0.75 | $3.75 |
| Standard | $6.00 | $1.50 | $7.50 |
| Fast | $12.00 | $3.00 | $15.00 |
因此 Batch/Flex 相對 Standard 可將簡化的 Token 帳單減半,而 Fast 會加倍。
Batch/Flex 適用於延遲可容忍的場景,如評測執行、資料增豐、離線程式庫分析、文件回填與非同步研究任務。
Standard 是互動式生產工作負載的自然基準,當最低成本或極速均非主導時適用。
Fast 可用於當經過時間具有可衡量商業價值時。OpenAI 表示 Astra 可達 2× 的處理加速,費率為對應的兩倍。Astra Fast 沒有延遲 SLA,且不適用 EU 資料駐留。
最佳層級是一個業務決策,而不僅僅是效能設定。
每個成功任務成本是更好的指標
考慮兩個假設的編碼代理。
假設代理 A 使用較便宜的模型,每次嘗試成本 $0.80,成功機率 55%;代理 B 使用 Astra,每次嘗試成本 $1.40,成功機率 90%。僅為此示例:嘗試相互獨立、每次重試的成本與成功機率相同、直到成功為止。
在這些假設下,每個成功任務的期望模型成本為嘗試成本除以成功機率:
代理 A:$0.80 / 0.55 ≈ $1.45
代理 B:$1.40 / 0.90 ≈ $1.56
精確比值使代理 B 約高出6.9%,約 7%。此示例並未顯示 Astra 省錢;而是說明 Token 費率倍數不等於每個成功任務成本的倍數。
該公式已計入重複嘗試,因此不需再加入第二個重試預備金。若分開量測,人工審核、工具與執行開銷可能改變比較。真實失敗也可能相關,使這個簡單模型不適合某些工作流程。
在實際評估中,請用測試集上的所有模型與工具支出除以被接受結果的數量,並另行回報校正時間與未解決失敗。用該觀測結果決定哪些任務值得使用 Astra。
如何降低 GPT-6 Astra API 成本
- 儘量讓常規請求保持在272K 輸入 Token 以下,以免小幅增長觸發整個請求的長上下文定價。
- 設計可快取的穩定提示前綴。系統指示、程式庫地圖、政策、綱要與靜態文件比反覆重建的提示更適合作為快取候選。
- 使用模型路由。將 GPT-6 Astra 保留給其複雜度確實受益的請求,同時把可預測的抽取、摘要、輕量編碼與分類導向更便宜的模型。
- 選擇合適的處理層級。Batch 或 Flex 可將 Token 費率減半,適用於不需即時結果的工作負載。
- 衡量完整代理軌跡。移除 20% Token 但導致更多失敗執行的優化,可能使系統更貴而非更便宜。
- 以摘要、檢索、限定範圍的子代理與選擇性保留工具結果主動管理歷史,避免上下文增長成為隱性的價格問題。
FAQ
Astra 會比其他模型更貴嗎?
其 Standard 短上下文 Token 費率是 Sol 的 2.5×,並與 Fable 的標題輸入/輸出費率相同。Gemini Flash 處於更低的定價層。上述比較顯示快取使用與接受任務成本能改變實際排序。
小請求會為整個上下文視窗付費嗎?
不會。帳單反映實際處理的 Token。當輸入超過 272,000 Token 時才適用長上下文區間;僅選擇具有大視窗的模型不會觸發該區間。
我該如何估算 CometAPI 的節省?
將供應商對應的輸入、輸出、快取讀取與快取寫入費率套到相同的 Token 組成。所列 20% 差異適用於這些類別;其他費用需另加後再比較總帳單。
最後的想法
當 Astra 的能力能充分改進困難工作流程、以抵消更高費率時,其價格最容易被正當化。從具有代表性的測試開始,衡量被接受的結果,並與合適的基準比較總支出與校正時間。
控制上下文增長、設計可重用前綴以進行快取,並選擇符合延遲需求的處理層級。當其公佈的費率與可用功能符合工作負載時,使用 GPT-6 Astra 於 CometAPI。
