先給答案
GPT-6 Astra 是 OpenAI 為高難度端到端工作推出的新旗艦模型。OpenAI 已於 2026 年 9 月 3 日 發布 GPT-6 Astra,主要定位於複雜推理、電腦使用、編碼、研究、科學工作與專業成品產出。此 API 模型具備 1.05M-token 的上下文視窗與 128K 的最大輸出,可接受文字與圖片輸入,並支援從低到最大等級的推理強度。標準 API 價格自每百萬 token $10 輸入 / $50 輸出 起。最重要的實務變化並非在所有通用智能基準上均勻提升;Astra 最大的躍升體現在代理式執行、電腦使用、長上下文檢索、編碼工作流程、科學與資安等領域。
這點很重要,因為過去 CometAPI 的文章 GPT-6 Is Coming Soon — What Will It Look Like? 必然是帶有推測性的。如今 Astra 已公開,本指南聚焦於已確認的模型行為、基準取捨、API 經濟性,以及在何種情境下,Astra 相較於更便宜的前沿替代方案實際更合適。
什麼是 GPT-6 Astra?
GPT-6 Astra 是 OpenAI 的 GPT-5.6 Sol 旗艦的後繼者。OpenAI 將 Astra 描述為其面向最艱難端到端工作的最強大模型,特別強調需要模型推理、使用工具、與軟體互動、修訂中間產物,並把任務從初始請求帶到完成成果的工作流程。這個定位很關鍵:Astra 不僅僅是一個更大的聊天模型,它被設計成在代理中充當推理引擎,運作於瀏覽器、終端機、文件、試算表、開發環境與企業軟體之間。
發佈貼文強調其在電腦使用、瀏覽、軟體工程、資安、科學與專業工作方面的最先進表現。據報告,Astra 在 FrontierMath Tier 4、ARC-AGI-3 與 ExploitBench 上分別達到 97.6% / 99.9% / 100%。這些數字醒目,但不應解讀為「Astra 在每項基準都勝出」。在 OpenAI 自用的 Artificial Analysis Intelligence Index 上,Astra 得分為 61.2,而 Claude Fable 5.1 為 65.7。因此,這次發佈更應視為在執行力與代理式工作上的躍遷,而非在所有智力衡量上全面橫掃。
GPT-5.6 Sol 有哪些改變?
電腦使用成為一等能力
Astra 最明顯的世代提升是電腦使用。在 OSWorld 2.0 上,OpenAI 報告 Astra 為 72.6%,而 GPT-5.6 Sol 為 65.7%。在相同延遲模擬中,Astra 約 40 分鐘完成任務,而 Sol 約為 75 分鐘,降幅約 47%。結合更新後的 Codex 控制框架,OpenAI 報告在 Mind2Web 上完成速度提升 1.9 倍。實務重點不僅是 Astra 能「看見」螢幕;它能在多步驟軟體任務中更長時間保持一致,且更少走代價高昂的冤枉路。
專業成品產出更為審慎
OpenAI 明確針對以可用成品為結尾的專業工作流程訓練 Astra,而非僅輸出原始文字。發佈資料描述其在文件、試算表、簡報、資料分析、設計工作與模板遵循上的更強表現。Astra 也更擅長在任務中途需求變更時保持方向感,因此一則指示訊息較不易覆蓋原始目標。這對長時間運行的企業代理特別有用,因為新的指示常在工作流程啟動後才到達。
長會話保留更多有用的工作脈絡
對於長時間的編碼會話,Astra 為 Codex 引入新的方式,以在主動上下文填滿後仍能保存與檢索筆記。過去的方法高度依賴壓縮,可能會遺漏「為何某次嘗試失敗」或「已測過哪些約束」。OpenAI 表示 Astra 能在跨上下文視窗之間保留筆記,在大型重構與除錯中提升連續性。
推理強度現已可延伸到最大
開發者可選擇 low、medium、high、xhigh 或 max 的推理強度。相較於把 Astra 視為單一固定點,這構成更寬的品質-成本曲線。官方模型指南 建議選用能滿足評測目標的最低強度,因為最佳經濟性通常來自 token 效率,而非總是以最高推理強度運行。
GPT-6 Astra 基準表現
OpenAI 發佈了涵蓋電腦使用、專業工作、編碼、學術推理、健康、資安、長上下文與對齊的廣泛比較。閱讀此表格的最佳方式是將「通用智能」與「完成使用工具的工作能力」分開來看。在 OpenAI 的表中,Astra 在 Artificial Analysis Intelligence Index 僅比 Sol 略高,但在多個代理式與操作性基準上大幅領先。
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | 差異意味著什麼 |
|---|---|---|---|
| AutomationBench | 41.4% | 18.1% | 端到端商務工作流程的大幅提升 |
| OSWorld 2.0 | 72.6% | 65.7% | 更好的電腦互動與任務完成 |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 以終端機為基礎的代理式編碼有大幅提升 |
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 使用程式/工具的科學工作流程有重大提升 |
| FrontierMath Tier 4 v2 | 97.6% | 83.0% | 更強的前沿數學推理 |
| ExploitBench | 100.0% | 78.5% | 關鍵級資安能力 |
| SRE-Bench, one attempt | 88.0% | 55.9% | 更強的逆向工程 / SRE 工作 |
| MRCR v2, 512K-1M | 96.3% | 73.8% | 提升超長上下文的檢索能力 |
| AA Intelligence Index v4.1.1 | 61.2 | 60.9 | 相較 Sol,通用智能基本持平 |
模式相當清楚。當基準需要持續與工具或環境互動時,Astra 的優勢最大。AutomationBench 從 18.1% 升至 41.4%;Terminal-Bench Science 從 22.4% 升至 64.6%;而長上下文的 MRCR 在 512K–1M 區間從 73.8% 提升至 96.3%。相比之下,Artificial Analysis Intelligence Index 只從 60.9 移動到 61.2。這也是為什麼把 Astra 描述為「貴 2.5 倍但只稍微更聰明」會錯過其真正的產品價值。
來源: OpenAI AutomationBench 圖表 (原圖,未重繪)
獨立基準:GPT-6 Astra 是否屬於世代飛躍?
獨立測試提供了重要的現實校驗。Artificial Analysis 報告的 Intelligence Index 得分為 61,等同於 GPT-5.6 Sol 的最大強度。與此同時,Astra 在 Coding Agent Index 上有強勁提升,且在代理式編碼中大幅減少 token 使用。Artificial Analysis 測得在其 Codex 控制框架下,Astra 相較於以最大強度運行的 GPT-5.6 Sol,token 使用量約為後者的三分之一,使 Astra 能在大致相同的每個代理式編碼任務成本下得到更高分數。
在通用智能上的經濟性則不那麼有利。Astra 在 Intelligence Index 的最大強度下,比 Sol 少用約 10% 的輸出 token,但 2.5 倍的每 token 價格上升抵消了這個效率提升;Artificial Analysis 估計,在最大強度下,Astra 的每任務成本約高出 75%。它也報告在 AA-Omniscience 上幻覺率由 92% 降至 51%,同時準確率提高 4 個百分點。
有用的結論是依工作負載而定:當代理需要行動、迭代、使用工具並完成複雜任務時,GPT-6 Astra 顯得最具世代意義。對一般推理或高量文字生成而言,較高的價格溢價則較難回收。
GPT-6 Astra vs GPT-5.6 Sol vs Claude Fable 5.1 vs Gemini 3.8 Flash
實務上的模型選擇比較應包含能力、多模態、上下文、代理式執行與價格。以下模型並不可互換:Astra 最佳化於困難的端到端執行,Claude Fable 5.1 在部分通用智能指標上領先,而 Gemini 3.8 Flash 以更低的 token 價格提供更廣的原生輸入模態。

| Metric | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Gemini 3.8 Flash |
|---|---|---|---|---|
| Context window | 1.05M | 1.05M | 1M | 1.048M |
| Max output | 128K | 128K | 128K | 65.5K |
| Input modalities | Text, image | Text, image | Text, image/PDF | Text, image, audio, video, PDF |
| AA Intelligence Index | 61.2 | 60.9 | 65.7 | 58.7 |
| AutomationBench | 41.4% | 18.1% | 31.4% | — |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 19.1% |
| DeepSWE 1.1 | 74.1% | 72.7% | 67.4% | 73.8% |
| FrontierMath Tier 4 v2 | 97.6% | 83.0% | 87.8% | — |
| HLE with tools | 57.2% | — | 65.0% | — |
| HealthBench Professional | 63.4% | 60.5% | 58.1% | 52.1% |
| Official standard input price | $10/M | $4/M | $10/M | $0.75/M |
| Official standard output price | $50/M | $20/M | $50/M | $3.75/M |
何時選擇 GPT-6 Astra 更好
當任務成本高昂是因為人類必須挽救失敗的代理執行時,選擇 Astra:例如大型程式變更、瀏覽器/桌面自動化、跨工具的深度研究、技術成品產出,或複雜的科學與營運工作流程。當更少重試、更少人工修正與更低的輸出 token 用量比單純的每 token 價格更重要時,其溢價最容易正當化。
何時選擇 Claude Fable 5.1 更好
Claude Fable 5.1 仍然是重要的前沿競爭者。在 OpenAI 自家的發佈表格中,它在 Artificial Analysis Intelligence Index 上得分 65.7,高於 Astra 的 61.2;在 HLE with tools 上為 65.0,高於 Astra 的 57.2。這意味著 Astra 不該被宣稱為通用智能上的全面勝者。如果你的評測集更像是長篇推理而非電腦使用的執行,Claude Fable 5.1 可能仍是更合適的選擇。
何時選擇 Gemini 3.8 Flash 更好
Gemini 3.8 Flash 針對前沿的另一個點位。它支援文字、圖片、音訊、影片與 PDF 輸入,具約 100 萬 token 的上下文視窗,同時官方起始定價遠低於 Astra。對於高量的多模態抽取、影音理解、常規代理,或無法接受 $10/$50 token 經濟的工作負載,Gemini 3.8 Flash 通常是更經濟的生產選擇。
為什麼 GPT-6 Astra 的資安評級很重要
Astra 是 OpenAI 在其 Preparedness Framework 下首個達到Critical 資安能力門檻的廣泛部署模型。OpenAI 表示,在給予適當工具與存取時,該模型可識別先前未知的安全漏洞並制定跨強化系統的利用策略。在發佈評估中,Astra 在 ExploitBench 得分 100%,在 ExploitGym 為 42.4%,在單次嘗試的 SRE-Bench 中達 88.0%。
這種能力伴隨更嚴格的部署控制。OpenAI 表示,在較高風險的資安情境中,產品級防護可能放慢、暫停或停止合法工作。ChatGPT 或 Codex 可能在繼續前要求使用者審核動作,而 API 任務可能停止。Astra 的預設部署也會拒絕較進階的利用程式創建請求;OpenAI 的 Daybreak 計畫為部分防禦性工作流程提供經核可的分離存取。
系統卡記錄了一個可監控性的取捨:相較於 Sol,Astra 整體對齊更好,但在對抗性評估條件下,其書面推理更難監控。因此,OpenAI 在工具使用的 Astra 推理周邊部署了更廣泛的不對齊監測。企業團隊應將代理權限、核准邊界、稽核日誌與最小權限的工具存取視為模型架構的一部分,而非可選附加。

來源: OpenAI 官方 ExploitGym 蜜罐安全圖 (原圖,未重繪)
GPT-6 Astra 定價
OpenAI 的現行 API 定價頁將短上下文與長上下文請求分開。對於標準處理,短上下文費率為每百萬 token:$10 輸入、$1 快取輸入、$12.50 快取寫入與 $50 輸出。超過 272K 輸入 token 的請求使用長上下文方案:每百萬 token $20 輸入、$2 快取輸入、$25 快取寫入與 $75 輸出。
| Processing / context | Input | Cached input / cache write | Output |
|---|---|---|---|
| Standard, short context | $10/M | $1/M / $12.50/M | $50/M |
| Standard, long context (>272K input) | $20/M | $2/M / $25/M | $75/M |
| Batch / Flex, short context | $5/M | $0.50/M / $6.25/M | $25/M |
| Batch / Flex, long context | $10/M | $1/M / $12.50/M | $37.50/M |
| Fast mode, short context | $20/M | $2/M / $25/M | $100/M |
| Fast mode, long context | $40/M | $4/M / $50/M | $150/M |
相較於GPT-5.6 Sol,Astra 的標準短上下文 token 價格高出 2.5 倍($10/$50 對 $4/$20)。這個溢價不必然意味著完成任務的成本就高 2.5 倍。在代理式編碼方面,OpenAI 與 Artificial Analysis 都報告,在某些配置下,Astra 的輸出 token 使用更低。正確的評估單位因此是每個成功任務的成本,而非僅以每 token 成本衡量。
如何存取 GPT-6 Astra
OpenAI 已於 2026 年 9 月 3 日分階段推出。Astra 預計在隨後幾天陸續提供給 ChatGPT Plus、Pro、Business 與 Enterprise 使用者、OpenAI API,以及 AWS。企業管理員可逐工作區啟用 Astra,且在發佈時預設為關閉。
以 OpenAI Responses API 呼叫 GPT-6 Astra
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6-astra",
reasoning={"effort": "high"},
input=(
"請審查此儲存庫架構。"
"找出最高風險的設計問題,說明證據,並提出遷移計畫。"
),
)
print(response.output_text)
模型 ID 為 gpt-6-astra。對以工具為主的工作流程,Responses API 是自然的起點,因為 Astra 支援函式呼叫、結構化輸出、網頁搜尋、檔案搜尋、程式碼解譯器、託管殼層、套用補丁、電腦使用、MCP 與工具搜尋。目前不支援微調。
真實世界的 GPT-6 Astra 用例
遊戲開發與視覺化軟體工作流程
Playco 在其直接運作於 Unity 與 Godot 的 AI 驅動 IDE——Playbot——中測試了 Astra。OpenAI 報告相較於前代模型,人工修正次數減少 50%,並從單一灰盒基礎建出了三個主題原型。這個例子重要之處在於任務不僅是產生原始碼:模型必須推理空間佈局、運行遊戲、測試變更、識別錯誤,並在視覺環境中迭代。
法務與金融文件審閱
OpenAI 將 Astra 定位於能產出精緻文件、試算表與分析成果的多步驟專業工作流程。在法務與金融審閱中,其實際價值在於能跨多個檔案維持任務狀態、交叉檢查證據,並返回一個完成的成品,而非僅回答一個孤立問題。專家驗證、核准控制與最小權限的資料存取仍然必要。
長期視野的工程代理
結合 Terminal-Bench、DeepSWE、資料庫遷移、電腦使用與長上下文的結果,使 Astra 對於倉庫層級工程特別相關。一個有用的部署模式是給 Astra 一個受限的開發環境、一個 issue 或遷移目標、測試與工具存取;接著以合併任務的品質、失敗迭代次數、人類審核時間與總成本來評估成功。這比單一編碼基準分數更適合作為生產指標。
GPT-6 Astra 的限制
- 高昂的 token 價格。Astra 在標準短上下文的每 token 成本為 GPT-5.6 Sol 的 2.5 倍,因此常規聊天、分類、抽取與簡單撰寫通常不具經濟性。
- 長上下文有附加費。輸入 token 超過 272K 的請求會改用較高的費率,因此「1.05M 上下文」不應被理解為等價價格的記憶體。
- 模型不支援原生音訊或影片輸入。Astra 接受文字與圖片並輸出文字;當原生音訊/影片理解是工作負載核心時,Gemini 3.8 Flash 更為靈活。
- 不支援微調。官方模型頁目前列為不支援微調,因此自訂需依賴提示、工具、檢索與工作流程設計。
- 資安防護可能中斷工作流程。OpenAI 明確警告在較高風險情境中,額外安全檢查可能會暫停或停止合法工作。
- 非通用基準的全面勝者。Claude Fable 5.1 在人工分析智能指數與含工具的 HLE 上領先 Astra,這些數據包含在 OpenAI 自家的發佈比較中。
常見問題
GPT-6 Astra 是否已正式發布?
是。OpenAI 已於 2026 年 9 月 3 日開始分階段推送。可用性將在組織、ChatGPT 付費方案、API 與 AWS 之間分階段開放,而非同時出現在每個帳戶。
GPT-6 Astra 的上下文視窗是多少?
官方模型頁列出 1.05M-token 的上下文視窗與 128K 的最大輸出。超過 272K 輸入 token 的請求會使用長上下文的定價方案。
GPT-6 Astra 的價格是多少?
標準短上下文價格為每百萬 token 輸入 $10 / 輸出 $50,快取輸入 $1、快取寫入 $12.50。長上下文、Batch/Flex 與 Fast 模式有不同費率,因此生產估算應使用與實際請求匹配的層級。
GPT-6 Astra 是否優於 Claude Fable 5.1?
視工作負載而定。Astra 在多個電腦使用、代理式編碼、科學、資安與專業工作評估上領先,而 Claude Fable 5.1 在 OpenAI 公開比較中,於 Artificial Analysis Intelligence Index 與 HLE with tools 上領先 Astra。請使用你的代理/任務評測,而非假設某個模型在每個類別都佔優。
GPT-6 Astra 是 AGI 嗎?
OpenAI 的官方產品頁將 Astra 描述為新一代智能與其最強大的廣泛部署模型,但未將該產品本身定義為「AGI」。部分任務上的基準飽和不等同於對 AGI 的統一、定論式定義。
結論
GPT-6 Astra 最應被理解為一個以執行為核心的前沿模型。其進步最有力的證據並非在 Artificial Analysis Intelligence Index 相對 GPT-5.6 Sol 由 60.9 微幅移至 61.2,而是其在電腦使用、代理式編碼、科學工作流程、長上下文檢索、專業任務完成與資安方面的大幅提升。1.05M 的上下文視窗與深厚的工具堆疊讓開發者有更大的空間打造在單次回應之外仍有用的代理。
取捨在於價格。$10/$50 的標準定價屬於溢價,長上下文請求成本更高,且獨立測試顯示在通用智能工作負載上,Astra 可能明顯比 Sol 更昂貴。當更高的完成率與更低的人力校正能抵銷 token 成本時,該模型便值回溢價。對於較簡單或高量的工作負載,GPT-5.6、Claude Fable 5.1 尤其是 Gemini 3.8 Flash 仍然是相關的替代方案,而非已被淘汰的前作。
