GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
ai-model/CometAPI 研究

GPT-6 Astra 基準測試:數據究竟說明了什麼

請提供需要翻譯的原文內容(可為 HTML/Markdown/JSON/XML/純文字等),我將在保留所有技術元素與原始結構的前提下,將可見文本精準翻譯為繁體中文。

CometAPI
Mia MarenAI 模型與 API 研究團隊
更新於 Sep 14, 2026 7 分鐘閱讀
GPT-6 Astra 基準測試:數據究竟說明了什麼
套用此模式

發出第一個 API 請求。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

摘要

GPT-6 Astra 展現出色的頭條指標分數。最大的提升出現在需要把推理轉化為行動的情境:終端操作、軟體使用、自動化、長上下文檢索、科學工作流程與資安。在已接近飽和的學術測試上,相較先前一代的 OpenAI 模型,提升往往小得多。

該模型將1,050,000-token 的上下文視窗與廣泛的工具支援結合。OpenAI 發佈的執行基準顯示,實際升級在長期工作上最為明顯,但工具架構設計、推理投入、延遲與工具存取都會實質影響結果。

關鍵要點

  • Astra 最清晰的提升在於代理型執行,而非所有類型的問答。
  • Terminal-Bench、AutomationBench、電腦使用與資料庫遷移等結果的進步幅度,顯著大於 GPQA 或 DeepSWE。
  • ARC-AGI-3 的結果顯示,模型狀態、上下文管理與評估框架(harness)會主導最終分數。
  • 大上下文視窗只有在接近上限時仍可檢索到資訊時才有意義;與僅宣傳容量相比,MRCR 更具資訊量。
  • 較高的 token 價格不必然意味較高任務成本;若模型需要更少的 token、輪數、重試或人工修正,成本可能更低。
  • 生產決策應同時比較成功率、耗時、總成本、工具可靠性與修正負擔。

GPT-6 Astra 一覽

OpenAI 指定最多可輸出128,000 個 tokens,支援文字與影像輸入、文字輸出,並提供從低到最高的推理投入。這些規格讓大型、多步驟工作流程成為可能,但不保證模型能檢索到正確證據或可靠完成任務。

官方規格CometAPI 中的 GPT-6 Astra實務意義
Model IDgpt-6-astra用於 API 路由的穩定識別子
Context window1,050,000 tokens支援大型程式庫、封存與代理歷史
Maximum output128,000 tokens可產生大型報告、修補程式與結構化成品
Knowledge cutoffApril 30, 2026更新事實需透過工具或提供來源
InputText and images支援文件、截圖、圖表與混合證據
OutputText產生散文、程式碼與結構化文本
Reasoning effortlow, medium, high, xhigh, max在延遲與成本間交換更深入的搜尋
Agent capabilitiesFunction calling, structured outputs, computer use, web/file search, hosted shell, Apply Patch, MCP使端到端工作流程成為可能,而非孤立答案
OpenAI Standard input$10 per million tokens輸入大小與快取重用影響總成本
OpenAI cached input$1 per million tokens適用於重用快取的提示前綴
OpenAI cache writes$12.50 per million tokens以未快取輸入費率的 1.25× 計費
OpenAI Standard output$50 per million tokens冗長輸出可能主導任務成本
Requests above 272K input tokensInput 與快取費率 ×2;Output 費率 ×1.5較高費率套用於整個請求

上下文上限衡量的是容量,而非可用的回憶能力。工具清單衡量的是可用性,而非成功執行。需要透過基準測試來驗證這些規格是否轉化為完成的工作。

GPT-6 Astra 的基準測試結果顯示了什麼?

整體表現呈現不均勻的模式。Astra 在某些學術與軟體推理測試上僅略超 Sol,但在終端工作、自動化、資料庫遷移、視覺互動、長上下文檢索與高等數學上則出現兩位數的增幅。

已發佈基準GPT-6 AstraGPT-5.6 SolClaude Fable 5.1Astra vs. Sol
Terminal-Bench 4.057.9%37.3%55.8%+20.6 pp
DeepSWE v1.174.1%72.7%67.4%+1.4 pp
Database Migration Tasks63.9%42.7%57.8%+21.2 pp
OSWorld 2.072.6%65.7%+6.9 pp
ScreenSpot-Pro92.7%76.9%+15.8 pp
AutomationBench41.4%18.1%31.4%+23.3 pp
BenchCAD95.9%83.3%84.3%+12.6 pp
FrontierMath Tier 4 v297.6%83.0%87.8%+14.6 pp
GPQA Diamond96.0%94.6%93.7%+1.4 pp
MRCR v2, 512K–1M96.3%73.8%+22.5 pp
AA Intelligence Index v4.1.161.260.965.7+0.3
ARC-AGI-3, Provider Adapter99.9%7.8%+92.1 pp

可分為三組。其一,DeepSWE 與 GPQA 的 1.4 點差距表示在強模型已表現優異的任務上,增量有限。其二,Terminal-Bench、AutomationBench、資料庫遷移與百萬 token 檢索超過 20 點的增幅,顯示執行能力有更大改變。其三,ARC-AGI-3 是解讀依賴評估框架的離群值。

獨立測試結果

Artificial Analysis 報告 Astra 與 Sol 在其 Intelligence Index 上約為61,但在 Coding Agent Index 上顯示更明顯的提升。這獨立強化了 OpenAI 數據中的模式:最大提升集中在代理型執行。

在 Codex 框架的最大投入下,Astra 在 Coding Agent Index 上 reportedly 使用的 token 約為 Sol 的三分之一。其在 Intelligence Index 的 token 使用僅下降約 10%。由於 Astra 的每 token 費率較高,這兩種效率曲線帶來不同的經濟性。

獨立評估觀察結果生產解讀
Intelligence Index與 Sol 差距不大廣泛推理未必值得支付高額溢價
Coding Agent Index代理型能力明顯提升較少的 token 可抵消較高的 token 費率
AA-Omniscience在最大投入下,幻覺率從 92% 降至 51%更好的棄答有助於研究與檢索系統
長期知識型工作各任務進展不一仍需在地化評估

沒有獨立基準能認證生產品質的事實性或安全性。團隊應另行評分正確答案、合理的不確定性、無依據的主張與未遵守來源限制的情形。

為何 Astra 更適合長期的代理型工作?

GPT-6 Astra 新增三項針對執行中會變化的工作而設計的控制。長時可靠性同樣取決於整個上下文系統:上下文視窗決定容量;壓縮(compaction)控制舊資料的濃縮;持續的推理(persisted reasoning)承接相關的模型狀態;檢索維持較早證據的可搜尋性;應用程式必須保留重要的工具輸出、測試結果、失敗的方案與使用者需求。這些機制應與代理架構一併測試。

  • 非同步工具呼叫:Astra 可在應用執行長時間工具時,持續獨立推理或呼叫其他工具。
  • 中途導引:應用可透過 WebSocket 在不中斷已完成工作的情況下,發送更正或新需求。
  • 對話中調整推理投入:可在保留快取提示前綴的同時,透過設定更新提升或降低推理投入。

Astra 實際提升之處

代理型程式開發:終端工作是更大的升級

Terminal-Bench 4.0 評估代理能否完成困難的終端任務,而非僅生成孤立的程式碼答案。Astra 達到 57.9%,比 Sol 高 20.6 個百分點,亦高於 Fable 2.1 點。對 OpenAI 而言,這是代際上的重大提升,但相較另一套前沿代理系統僅是較窄的優勢。

DeepSWE 呈現不同面貌:Astra 74.1%,Sol 72.7%。1.4 點的差距提醒我們不要從單一程式基準泛化。Astra 的優勢似乎多出現在需要環境互動、迭代、狀態保存與驗證的程式任務。

Database Migration Tasks 進一步強化此解讀。Astra 63.9%,比 Sol 高 21.2 點,亦高於 Fable 6.1 點。遷移工作結合程式理解、工具使用、步驟安排與操作判斷——這類複合工作流程中,小幅推理改進能累積成更大的完成度提升。

對程式代理而言,請同時評估模型與架構。倉庫指令、終端工具、重試行為、上下文保存與測試執行都會影響量測結果。

電腦使用:成功率與執行時間同樣重要

在 Agents’ Last Exam 上,GPT-6 Astra 得分 59.3%,GPT-5.6 Sol 為 53.6%:提升 5.7 個百分點。這為上文的 OSWorld 2.0 與 ScreenSpot-Pro 增添更廣泛的代理任務結果。

除準確度外,OSWorld 的執行時間比較具實務意義:Astra 每個任務約 40 分鐘,Sol 約 75 分鐘,約縮短 47% 的耗時,同時提升任務成功率。

一個僅稍微更常成功、且快得多的代理,能帶來巨大吞吐提升。因此採購測試應同時報告成功率、耗時、工具呼叫、重試與人工介入,而非僅有準確度。

自動化與專業工作

AutomationBench 從 18.1% 上升至 41.4%,提升 23.3 點。絕對分數距離完美仍遠,但失敗型態的變化比在飽和區附近的 1 點變動更有意義。在 BenchCAD 上,Astra 達 95.9%,領先 Sol 12.6 點與 Fable 11.6 點。

這些結果支持一個具體主張:Astra 更擅長把指令轉化為經驗證的行動序列。這並不代表每個商務流程都有同等提升。實際流程可能引入驗證步驟、專有介面、含糊政策或基準未涵蓋的資料格式。

科學

科學領域是 Astra 最明顯的能力提升之一。在 FrontierMath Tier 4 v2 上,Astra 達 97.6%,Sol 為 83.0%,Fable 為 87.8%。相較 Sol 的 14.6 點優勢相當可觀,雖然該基準涵蓋的是選定的任務分佈,而非完整科學工作流程。

資安

資安是第二個重大提升,重要性高於一般榜單名次。在涵蓋 2026 年 6 至 8 月的 ExploitBench 上,Astra 39.0%,Sol 5.5%。OpenAI 報告該新集合針對前 3 個月的漏洞,以降低歷史接觸的影響。在 OpenAI 的資安評估中,Astra 在受控環境下展現出發現並利用兩個先前未知零日漏洞的能力。此結果重要之處在於評估以近期揭露漏洞為設計核心,而非長期已知問題,降低因記憶既有案例而得分的可能。該結果推動 Astra 達到 OpenAI 的 Critical 資安能力門檻,因而改變部署所需的防護措施。這並非表示 Astra 能不受限地自主進行網路作戰,而是其能力等級改變了部署防護的需求。具較強漏洞發掘與利用能力的系統,需要更嚴格的存取控制、監控、沙箱與人工審查機制。

長時間任務:上下文視窗不是全部

Astra 的 1,050,000-token 上下文視窗描述的是容量,而非連續性。長時間表現也取決於壓縮、持續狀態、可檢索的早期上下文、保留的推理狀態,以及工具輸出的保存。在 MRCR v2 上,Astra 在 256K–512K 得分 100.0%,在 512K–1M 為 96.3%,Sol 分別為 91.5% 與 73.8%。最長範圍 22.5 點的差距顯示,接近上限時的可用檢索比宣稱容量更重要。

MRCR 仍是合成檢索測試,因此生產評估應保留摘要常遺失的證據:為何先前修正失敗、某元件的具體行為、改變實作方向的測試結果、歷史需求,以及藏於工具輸出中的細節。程式庫與研究封存也應在重複名稱、交互參照、過時政策、矛盾來源與長干擾段落下進行測試。這能區分原始上下文容量,與長期代理實際需要的上下文保存與檢索行為。

上下文保存:Astra 與傳統長上下文系統的不同

傳統長上下文工作流程通常遵循以下模式:

context → compaction → summary → continue

此作法可降低 token 使用量,但引入關鍵風險:重要的中間資訊可能在摘要中消失。

遺失的往往不是最終答案,而是未來決策所需的操作性細節:

  • 為何先前的修正失敗;
  • 哪個元件出現異常行為;
  • 哪個測試結果改變了實作方向;
  • 後續新增了哪些使用者需求;
  • 哪個工具輸出包含重要證據。

GPT-6 Astra 透過在長時間代理工作流程中結合上下文保存與檢索機制,來應對此限制。

系統不再僅依賴壓縮摘要,而是可保留重要記錄、在需要時檢索較早資訊,並在多次工具互動間維持連續性。

對如 Codex 的程式代理而言,這表示一個長時間除錯任務能保留:

  • 先前失敗的實驗;
  • 倉庫修改;
  • 測試輸出;
  • 架構決策;
  • 未解決問題。

因此,Astra 的 100 萬 token 上下文視窗的價值不僅在於可容納多少資訊,也在於能否在數小時互動後保存並找回正確資訊。

推理與解讀

ARC-AGI-3:框架是結果的一部分

ARC-AGI-3 最清楚地展示了前沿基準測試衡量的是整個系統,而非孤立模型。ARC Prize 報告在 Standard 框架、最大投入下為62.7%,在 Provider Adapter、high 投入為99.9%

ARC Prize 評估Standard HarnessProvider AdapterAdapter Gain
max62.7%98.6%+35.9 pp
xhigh59.3%98.4%+39.1 pp
high54.8%99.9%+45.1 pp
medium38.6%98.4%+59.8 pp
low17.5%98.0%+80.5 pp

GPT-6 Astra 基準測試:數據究竟說明了什麼

ARC Prize 比較不同評估框架下 Astra 的行動效率

提供者中立框架政策要求模型在可見狀態中保存重要資訊。Provider Adapter 會保留額外推理狀態,並使用供應商特定的上下文管理。對於共同解出的遊戲-推理對,ARC Prize 報告顯示使用 adapter 後執行速度提升 3.66 倍,總 token 減少 49%。

99.9% 的結果衡量的是特定的「模型—提供者—adapter」系統,不能視為與框架無關的原始模型智慧測量。上下文架構是被基準的系統一部分。

推理投入不呈線性擴張

ARC 表也顯示,最大投入不一定產生最高分。在 Provider Adapter 下,high 投入達到 99.9%,而 max 為 98.6%。在 Standard 框架下,max 表現最佳。

OpenAI 指出,發佈表上的數字通常使用觀察到的最佳推理設定。此作法估計表現上限,但無法找出生產中最佳配置。團隊應測試多個投入層級,計算每增加一秒與一美元的邊際品質提升。

數學與學術推理

FrontierMath Tier 4 v2 從 83.0% 上升至 97.6%,提升 14.6 點。這是重大基準進步,但不代表前沿數學已被解決。其評估涵蓋選定任務分佈,並未衡量數學研究的所有階段,包括問題選擇、形式化證明驗證、長期計畫發展或對抗性同儕審查。

GPQA Diamond 呈現相反模式:Astra 96.0%,Sol 94.6%,Fable 93.7%,Gemini 3.8 Flash 95.3%。各模型在天花板附近緊密聚集。報告 Astra 與 Sol 的 1.4 點差距是正確的,但若稱之為廣泛的智慧革命則誇大了證據。

關鍵能力與防護

資安評估AstraSol絕對提升
ExploitBench100.0%78.5%+21.5 pp
ExploitGym42.4%30.3%+12.1 pp
ExploitBench, June–August 202639.0%5.5%+33.5 pp
SRE-Bench88.0%55.9%+32.1 pp
SEC-Bench Pro85.4%79.1%+6.3 pp

OpenAI 以過去三個月揭露的漏洞建立 ExploitBench(2026 年 6–8 月),降低歷史漏洞接觸誇大結果的機率。Astra 在該集合得 39.0%,Sol 5.5%,且 OpenAI 報告 Astra 發現並利用兩個先前未知的零日漏洞。這些結果促使 Astra 成為 OpenAI 首個達到 Critical 資安能力門檻並廣泛部署的模型,直接影響防護與存取政策。

如何閱讀接近飽和的分數

90% 以上的分數需要更謹慎的語言。從 50% 到 60% 解出每百題多 10 題;從 95% 到 96% 每百題僅多 1 題,雖然錯誤數從 5 減到 4,乃錯誤減少 20%。兩種描述皆數學正確,但支撐的是截然不同的標題。

反之亦然於低分基準。從 18.1% 上升至 41.4% 仍遠不足以達成可靠自主運行,但它讓成功案例翻倍,能改變受監督的工作流程。絕對分數決定系統是否可用;改善幅度反映能力變化速度。生產決策需要兩者。

多維比較

維度AstraSolFable決策訊號
一般學術推理優秀;常接近飽和緊隨其後具競爭力小差距很少單獨決定部署
終端執行一線水準代際差距大近距競爭者測試完整的程式代理架構
電腦使用成功率更高且耗時更短較慢且較不準確發佈表缺乏可比數據衡量每小時成功數
長上下文檢索在 100 萬 tokens 附近仍強接近上限時明顯劣化缺乏直接可比數據使用貼近生產的檢索測試
推理控制low 至 max不同投入包絡自適應思維方法調參配置,不僅是模型名稱
資安能力風險層級質變發佈結果較低此處未比較防護與存取政策至關重要
token 經濟性費率較高;有時使用更少 token費率較低依工作負載而定比較每次成功任務的成本

結果取決於工作負載。當任務需要與工具與環境持續互動、失敗後復原或在極大上下文中可靠檢索時,Astra 最具吸引力。對上下文需求適中、迭代有限的工作,Sol 可能仍更具經濟性。Fable 是終端工作上的近距競爭者,並在某些外部學術評估領先,因此應用層級的基準測試比供應商層級結論更有用。

誰應該使用 GPT-6 Astra?

使用情境建議
簡單分類不一定值得使用 Astra
簡單摘要不一定值得使用 Astra
標準 RAG先基準比較成本與效能
長文件綜整與分析值得測試 Astra
代理型程式開發強烈建議測試
電腦使用強烈建議測試
多步驟自動化強烈建議測試
複雜研究值得測試
科學運算/專用軟體值得測試
資安能力強,但需要適當安全控管
高吞吐、簡單任務成本較低的模型可能更具成本效益

GPT-6 Astra 的性能提升是否值得更高價格?

GPT-6 Astra 明顯比 GPT-5.6 Sol 更昂貴,但基準提升並非在所有工作負載上平均分佈。因此,價格問題不能僅以 token 費率比較來回答。

情境表現提升成本合理性
簡單問答提升小通常不值得溢價
程式代理提升大溢價可被合理化
長上下文分析提升明顯取決於檢索需求
電腦自動化提升強常值得測試
一般推理提升有限謹慎比較成本

在 OpenAI Standard 費率下,GPT-6 Astra 的輸入每百萬 tokens 為 $10、快取輸入為 $1、快取寫入為 $12.50、輸出為 $50。相較 GPT-5.6 Sol 的 $4 與 $20,Astra 的標準輸入與輸出分別為 2.5 倍。當請求超過 272K 輸入 tokens 時,Astra 的輸入與快取費率加倍,輸出費率上升 1.5 倍,且套用於整個請求。

價格溢價最清楚地對齊於代理型工作。Astra 在 Terminal-Bench、AutomationBench、資料庫遷移與最長範圍 MRCR 上提升超過 20 個百分點;獨立測試亦報告在 Coding Agent Index 上的 token 使用約為 Sol 的三分之一。在廣泛推理上,匹配度較弱:Intelligence Index 幾乎持平,token 使用僅下降約 10%。因此購買決策應比較每次成功任務的成本,包括輸出、快取活動、工具使用、耗時、重試、失敗與人工修正。

每次成功任務的成本

每次成功任務的成本 = (Input cost + Output cost + Tool cost + Retry cost + Human review cost) / Successful tasks

預期商務成本

預期商務成本 = API cost + Tool cost + Retry cost + Human-review cost + Failure cost

決策指標應是總成本除以成功任務數,並在可接受品質門檻下評估——而非每百萬 tokens 的標價。

開發者應如何為 Astra 做基準測試

公共榜單應決定「值得測試什麼」,而非做出最終部署決策。建立具代表性的任務集,包含日常案例、困難案例、缺失上下文案例、工具故障與對抗性指令。對每個模型使用相同的生產提示、權限、來源檔、時間預算與完成標準。

評估維度測量項目原因
任務成功通過驗收標準防止具說服力但不完整的答案被計作成功
可靠性重複執行的成功分佈揭露不穩定的一次性勝利
工具執行經驗證的成功行動區分工具呼叫與正確結果
事實性受支撐的事實主張衡量證據品質與棄答
延遲中位與尾端完成時間捕捉營運吞吐
成本每次成功任務的總成本包含重試與失敗嘗試
人力投入更正與審查分鐘數常在實際部署成本中占主導
可導引性需求變更後的復原測試長時間代理行為

CometAPI 中的 Astra API 使用模型 ID gpt-6-astra。多模型 API 讓在 Astra、Sol、Fable 與 Gemini 上以同一評估執行成為可行,而不必圍繞某家供應商的宣傳表格重設基準。將嚴苛的代理型任務路由至能賺得其溢價的模型,並在優勢消失之處使用成本較低的模型。

結論

Astra 的基準成績單令人印象深刻,但最耀眼的分數不一定最有用。ARC-AGI-3 展現了供應商特定代理框架的潛力;Standard 框架分數則顯示基礎設施對結果的強大影響。GPQA 與獨立的 Intelligence Index 顯示一般推理的提升可能溫和。終端工作、自動化、電腦使用、長上下文檢索、科學工作流程與資安,才是更重要的故事。

這次發佈的重點,不是聊天機器人在每個問題上同比變得更聰明,而是前沿智慧在「完成工作」上變得更好。這項升級是否值得付費,取決於整個模型—系統配置與每次成功生產任務的經濟性。

繼續學習

把這篇文章連到下一個決策。

查看所有主題
發布於 Sep 14, 2026
最後更新 Sep 14, 2026
27 次瀏覽
已審核內容清晰度、來源標註與最新 API 術語。

準備好將 AI 開發成本降低 20% 了嗎?

幾分鐘內免費開始。包含免費試用點數。無需信用卡。

閱讀更多