摘要
GPT-6.1 Sol 是 OpenAI 於 2026 年 9 月對 GPT-6 Sol 的升級版本(面向開發者的高階程式設計、電腦操作、文件處理與多步驟代理工作流程),詳見 OpenAI 的 September 2026 upgrade to GPT-6 Sol。它保留標準短上下文 API 定價:每百萬輸入 tokens 為 $2、每百萬輸出 tokens 為 $10,同時在 OpenAI 報告的評測中提升能力與任務效率。其上下文視窗仍為 1.05 百萬 tokens,輸出上限為 128,000 tokens。
重要要點
- OpenAI 於 2026 年 9 月 29 日發布 GPT-6.1 Sol,用於複雜程式設計、電腦使用與專業工作流程。
- 它保留 1,050,000 個 token 的上下文視窗與 128,000 個 token 的輸出上限,支援文字與圖像輸入、文字輸出。
- 標準短上下文 API 費率為每百萬 tokens:輸入 $2、快取輸入 $0.10、快取寫入 $2.50、輸出 $10;較大的提示與不同處理模式會影響帳單。
- 官方評測顯示其相較 GPT-6 Sol 有所提升,且在多個測試工作負載上接近 Astra;基準的任務成本比與 token 價格比是不同概念。
- 工具呼叫請使用 Responses API。發佈時,該模型可透過 API、Codex 與 ChatGPT Work(合資格付費方案)使用,但尚未在一般 Chat 中提供。
什麼是 GPT-6.1 Sol?
GPT-6.1 Sol 是 OpenAI 在 GPT-6 系列中聚焦效率的升級模型。OpenAI 將其描述為對 GPT-6 Sol 的升級,在代理式程式設計、電腦使用與專業工作上幾乎貼近 GPT-6 Astra 的能力,同時在標準輸入與輸出 token 費率下成本僅為 Astra 的五分之一。
此次更新重點不在於提升原始上下文上限,而在於提高每美元能完成的有效工作量。對於已使用 CometAPI 上 GPT-6 Sol API 的團隊而言,GPT-6.1 Sol 可視為能力升級,同時維持相同的 $2/$10 標準輸入/輸出定價,並將快取輸入費率減半。
這樣的定位對生產級代理很關鍵。高頻程式設計、文件處理、工作流自動化與電腦使用系統,可能需要執行數百或數千次推理密集的請求。能以較低的單任務成本接近前沿能力的模型,比把所有困難請求一律導向 Astra 更實用。
遷移時有一個重要細節:GPT-6.1 Sol 不支援 none 或 minimal 的推理強度。最低設定為 low,因此從 GPT-6 Sol 遷移的開發者應檢視路由邏輯與請求參數。
GPT-6.1 Sol 在基準測試中的表現如何?
以下結果來自 OpenAI 的發佈評測。它們衡量的是特定任務與配置,而非通用的模型排名。OpenAI 在其研究環境或透過其 API 對模型進行評估;系統提示、工具與推理設定可能不同於生產 ChatGPT。競品結果取自公開報告。每任務成本與標準 token 價格是不同的衡量:前者取決於 tokens、推理、工具及評測協定。對於未完整指定測試框架或配置的部分,應視為報告比較,而非獨立重現的結果。
DeepSWE v1.1 的代理式程式設計表現
DeepSWE v1.1 衡量長期軟體工程任務於真實程式碼庫中的表現。OpenAI 報告指出,GPT-6.1 Sol 以約五分之一的成本匹敵 GPT-6 Astra,並在較低推理強度與成本下,比 GPT-6 Sol 的最佳分數提升 6.4 個百分點。
這使該升級對反覆檢查版本庫、修改檔案、執行工具、運行測試與除錯的程式設計代理特別相關,而不僅是產生孤立的程式碼片段。
AutomationBench 的商務工作流表現
AutomationBench 衡量代理是否能完成跨商務應用的多步驟工作流。在中等推理強度下,OpenAI 報告 GPT-6.1 Sol 以約三分之一的成本,比 Opus 5.5 高出 2.2 個百分點,並在相同設定下比 GPT-6 Sol 提升 4.8 個百分點。
該基準使用 47 種工具,涵蓋銷售、行銷、營運、支援、財務與人資,較單純問答測試更貼近企業自動化。
發佈報告指明使用 AutomationBench 1.0.6。與 Opus 的比較是在中等推理強度下;這是 OpenAI 報告的結果,並非宣稱 GPT-6.1 Sol 在所有企業工作流上全面勝出。開發者亦可透過 CometAPI 的 Claude Opus 5.5 API 進行針對工作負載的比較。
OSWorld 2.0 的電腦使用表現
在 OSWorld 2.0 離線集上,GPT-6.1 Sol 於最大推理強度下,比 GPT-6 Sol 高 7 個百分點,且每任務成本低於一半。它以約 Astra 每任務成本的七分之一,與 GPT-6 Astra 的差距僅 2.1 個百分點。
該結果使用 v2026.08.08 版本的離線集之部分獎勵。請將該度量、版本與最大推理強度設定一併理解;其他版本或獎勵定義不可直接互換。
這對瀏覽器代理、桌面自動化、軟體操作,以及需要與圖形介面互動而非僅輸出文字的工作流具有重要意義。
Terminal-Bench Science 的科學工作流表現
Terminal-Bench Science 0.1 評估包含數據分析、模擬、模型擬合與定理證明等科學工作流,透過程式碼與終端工具執行。OpenAI 報告稱,GPT-6.1 Sol 於最大推理強度下,將 GPT-6 Sol 的分數提升超過一倍,同時每任務成本低於一半。
| 模型 | 最大推理強度下的平均任務成本 |
|---|---|
| GPT-6.1 Sol | $5.47 |
| Opus 5.5 | $23.21 |
| GPT-6 Astra | $23.80 |
在該評測中,GPT-6 Astra 仍以 68.1% 的成績居首,因此不應解讀為 GPT-6.1 Sol 在所有前沿研究工作負載上取代 Astra。其優勢在於以更低的任務成本接近該能力。
困難提示上的事實準確性
OpenAI 報告在低推理強度下相較 GPT-6 Sol 的事實準確性提升最大:含有事實錯誤的回答比例從 11.4% 降至 7.7%,約降低 32%。在被測試的各推理設定中,GPT-6.1 Sol 與 GPT-6 Astra 的差距最多為 1.9 個百分點,同時每任務成本低於 Astra 的五分之一。
OpenAI 提醒,該評測使用經刻意挑選的困難、去識別化對話,這些對話先前由使用者標記存在事實錯誤。因此,這些百分比不應視為日常幻覺率。
OpenAI 的官方事實準確性圖表將錯誤率對上模擬平均延遲。圖表直接取自系統卡附錄;這些挑選的困難對話不代表一般使用情境的錯誤率。
OpenAI 官方事實準確性評估:曾被使用者標記的對話之錯誤率
GPT-6.1 API 定價
GPT-6.1 Sol 使用與 GPT-6 Sol 相同的標準輸入與輸出費率,但將已快取輸入的費率從每百萬 tokens $0.20 降至 $0.10。OpenAI 亦會依上下文長度與處理模式對模型進行不同定價,因此生產成本應基於完整的請求模式估算,而非僅看標題費率。
標準定價
在 OpenAI 標準處理下,GPT-6.1 Sol 的費率為每百萬 tokens:輸入 $2、輸出 $10。已快取輸入為 $0.10,而快取寫入為 $2.50。
| 標準定價 | OpenAI GPT-6.1 Sol | CometAPI GPT-6.1 Sol |
|---|---|---|
| Input | $2.00 / 1M tokens | $1.60 / 1M tokens |
| Cached input | $0.10 / 1M tokens | $0.08 / 1M tokens |
| Cache write | $2.50 / 1M tokens | $2.00 / 1M tokens |
| Output | $10.00 / 1M tokens | $8.00 / 1M tokens |
已快取輸入與快取寫入
對 GPT-6.1 Sol 而言,快取的重要性高於僅看標題的輸入價格。
其 $0.10 的已快取輸入費率僅為 $2 未快取輸入費率的 5%,當應用重複使用相同的系統提示、工具定義、版本庫說明或長參考文件時,重複上下文會便宜許多。快取寫入按每百萬 tokens 計價 $2.50,即標準未快取輸入費率的 1.25 倍。
對長時間運行的代理而言,成本高度取決於可重用的上下文比例。若工作流反覆傳送大型且穩定的提示,其有效成本可能與每次都重建完整上下文的工作流截然不同。
長上下文定價
GPT-6.1 Sol 支援 1.05 百萬 token 的上下文視窗,但若輸入 tokens 超過 272,000,則進入 OpenAI 的長上下文定價層級。
整個請求的費率將變為:
| 長上下文定價 | OpenAI GPT-6.1 Sol | CometAPI GPT-6.1 Sol |
|---|---|---|
| Input | $4.00 / 1M tokens | $3.20 / 1M tokens |
| Cached input | $0.20 / 1M tokens | $0.16 / 1M tokens |
| Cache write | $5.00 / 1M tokens | $4.00 / 1M tokens |
| Output | $15.00 / 1M tokens | $12.00 / 1M tokens |
換言之,一旦提示超過 272K 輸入 tokens,OpenAI 會對整個請求套用 2 倍的輸入與快取定價,以及 1.5 倍的輸出定價,而不僅是超過門檻的部分。
這使上下文管理對大型程式碼庫、文件分析系統與常駐代理尤其重要。僅略高於門檻的請求,其成本可能顯著高於透過檢索、摘要或提示分段保持在門檻以下的請求。
Batch、Flex 與 Fast 模式
OpenAI 也會依處理模式調整 GPT-6.1 Sol 的定價。
Batch 與 Flex 處理的價格相對標準模式降低 50%,適用於延遲不如成本重要時。於短上下文定價下,約為每百萬 tokens:輸入 $1、已快取輸入 $0.05、快取寫入 $1.25、輸出 $5。
Fast 模式則相反,其成本為標準模式的 2 倍,短上下文費率約為每百萬 tokens:輸入 $4、已快取輸入 $0.20、快取寫入 $5、輸出 $20。此模式適用於為較低延遲付出較高 token 成本的工作負載。
在支援的情況下,區域處理可能再增加 10% 的溢價。
實務選擇相對明確:一般互動工作負載使用 Standard;當成本較重要時使用 Batch 或 Flex;僅在延遲具足夠商業價值、足以合理化約 2 倍標準費率時使用 Fast。
GPT-6.1 Sol 有何不同?
GPT-6.1 Sol 強化了兩種高階部署路線的區隔。GPT-6 Astra 是以能力為先的選擇,而 GPT-6.1 Sol 則成為以效率為先的進階工作選項。
這種差異支持混合路由:對要求高的生產工作,先嘗試 GPT-6.1 Sol,僅在特別困難或失敗案例時再升級到 Astra。如此可在不支付 Astra 級費率的情況下,保留對最強能力的存取。
近乎 Astra 的能力,但非 Astra 級成本
核心特點是能力與成本比。OpenAI 稱 GPT-6.1 Sol 在多個高難專業工作負載上提供接近 Astra 的表現,同時標準輸入與輸出 token 價格僅為 Astra 的五分之一。
對生產系統而言,這可能比小幅的基準差距更重要。較低的單任務成本可為重試、驗證步驟、更大上下文與更高請求量留出空間,且仍在同一預算內。
更強的代理式程式設計
DeepSWE 的結果暗示此次升級針對更長的程式設計迴圈:版本庫級除錯、多檔案修改、測試執行與修復、基於 Shell 的開發工作流,以及代理式軟體維護。
更強的電腦使用
OSWorld 的提升表示在需要將推理與 GUI 互動結合的場景中表現更佳,使 GPT-6.1 Sol 對瀏覽器與桌面自動化更具相關性。
更佳的專業文件處理
在 GDP.pdf 上,GPT-6.1 Sol 在各測試推理設定中搭配回退機制的情況下,分數高於 Opus 5.5,每任務成本不到其一半;同時以約五分之一的成本逼近 Astra。
這使其對包含財報、法律文件、醫療資料、研究論文與其他複雜專業 PDF 的工作流具有吸引力。
深度工具整合
透過 Responses API,GPT-6.1 Sol 支援 web search、file search、image generation、Code Interpreter、hosted shell、Apply Patch、Skills、computer use、MCP 與 tool search。
GPT-6.1 Sol vs GPT-6 Sol vs GPT-6 Astra
| 類別與官方模型規格 | GPT-6 Sol | GPT-6.1 Sol | GPT-6 Astra |
|---|---|---|---|
| 定位 | 複雜程式設計與代理式工作流程 | 以更低成本提供接近 Astra 的表現 | 最適合要求最高的能力 |
| 上下文視窗 | 1.05M | 1.05M | 1.05M |
| 最大輸出 | 128K | 128K | 128K |
| 標準輸入 / 1M | $2 | $2 | $10 |
| 已快取輸入 / 1M | $0.20 | $0.10 | $1.00 |
| 快取寫入 / 1M | $2.50 | $2.50 | $12.50 |
| 輸出 / 1M | $10 | $10 | $50 |
| 最低推理強度 | None | Low | Low |
| 代理式程式設計 | 作為報告中 DeepSWE 提升的基線 | 比 Sol 的最佳分數高 6.4 點;在報告比較中與 Astra 匹敵 | 在報告的 DeepSWE 比較中與 Sol 6.1 匹敵 |
| 電腦使用 | 作為報告中 OSWorld 比較的基線 | 相較 Sol 提升 7 點;在指定離線集中以最大強度低於 Astra 2.1 點 | 在該報告比較中領先 Sol 6.1 2.1 點 |
| 最佳適配 | 既有的 Sol 工作負載 | 高容量的進階代理 | 最困難的前沿工作負載 |
當與 CometAPI 的 GPT-6 Astra API 比較時,定價差異尤其明顯。OpenAI 官方定價為 Astra 的每百萬 tokens:輸入 $10、輸出 $50,而 GPT-6.1 Sol 為 $2 與 $10。
應選擇哪個 GPT-6 模型?
GPT-6.1 Sol 是大多數進階生產工作負載的最強默認選擇。它保留與 GPT-6 Sol 相同的每百萬 tokens:輸入 $2、輸出 $10,但在代理式程式設計、電腦使用與專業工作流方面改進,並與 GPT-6 Astra 更為接近。
若你的現有工作流已表現良好且不需要新的代理式能力提升,選擇 GPT-6 Sol。
若你希望在表現與成本間取得最佳平衡,特別是針對程式設計代理、自動化、電腦使用與高頻推理工作負載,選擇 GPT-6.1 Sol。
當最大能力比成本更重要時,選擇 GPT-6 Astra。其官方定價為每百萬 tokens:輸入 $10、輸出 $50,相較之下,GPT-6.1 Sol 為 $2 與 $10。因此,CometAPI 的 GPT-6 Astra API 更適合最困難或高價值任務,而非日常大規模部署。
何時仍應使用 GPT-6 Astra?
GPT-6.1 Sol 並未取代 Astra。OpenAI 繼續將 GPT-6 Astra 定位為最高能力模型,而 Astra 仍在如 Terminal-Bench Science 等困難評測中領先。
- 任務成功遠比 token 成本重要。
- 工作異常複雜或偏重研究。
- 你需要最高可用的推理上限。
- 失敗嘗試成本足夠高,使較高的模型成本成為次要問題。
- 輕微的品質差距會產生不成比例的商業價值。
務實的路由策略是:大多數要求高的生產工作使用 GPT-6.1 Sol,並在需要最大能力、足以支撐較高成本時才升級至 Astra。
在實際工作負載中,GPT-6.1 Sol 是否比 GPT-6 Astra 更便宜?
若以標準 token 費率計,答案是是:GPT-6.1 Sol 的輸入與輸出成本皆為 Astra 的五分之一。但生產經濟應以每個成功任務的成本來評估,而非僅看每個 token 的成本。
若代理需要反覆推理、工具呼叫與重試,即便模型較便宜,但若需要更多嘗試,整體可能仍不划算。反之,若 GPT-6.1 Sol 在你的工作負載上能達到接近 Astra 的完成率,五倍的 token 價差可能轉化為可觀的節省。
在哪裡可以使用 GPT-6.1 Sol?
於 2026 年 9 月 29 日的發佈時,GPT-6.1 Sol 可供 Plus、Pro、Business、Enterprise 與 Edu 用戶在 ChatGPT Work 與 Codex 使用,也可透過 OpenAI API 使用。當時尚未於一般 Chat 提供。實際存取取決於方案、客戶端、地區與工作區設定。於 2026 年 9 月 30 日檢查,CometAPI 即時模型型錄 列出了 gpt-6.1-sol,支援 /v1/responses 與 /v1/chat/completions 路由。使用工具工作流程請用 Responses,並在部署前確認你的 API 金鑰之模型存取與計費。
如何使用 GPT-6.1 Sol API?
工具呼叫請使用 Responses API。GPT-6.1 Sol 支援不含工具的 Chat Completions 請求;依賴工具的代理不應假設兩個端點具相同的工具行為。以下 Python 最小範例使用 OpenAI 的端點與憑證。
安裝官方 OpenAI Python SDK,於環境中設定 OPENAI_API_KEY,並使用有該模型存取權的 API 專案。以下純文字範例傳送一個 Responses API 請求並列印其文字輸出;自身不啟用代理工具。
from openai import OpenAI
client = OpenAI() # Reads OPENAI_API_KEY from the environment
response = client.responses.create(
model="gpt-6.1-sol",
input="Review this software architecture and identify the three highest-risk design decisions.",
reasoning={"effort": "medium"},
)
print(response.output_text)
對更困難的程式設計、研究或代理任務,可將推理強度提高至 high、xhigh 或 max。對較低成本工作,可使用 low,但不支援 none 與 minimal。
透過 CometAPI 使用 GPT-6.1 Sol
依循 CometAPI quickstart 建立帳號與 API 金鑰。將金鑰存入 COMETAPI_KEY,使用 pip install openai 安裝 OpenAI Python SDK,並按下方所示設定 gateway。
型錄目前列出 gpt-6.1-sol。以下純文字範例使用 文件化的 Responses 端點;工具需要額外的請求配置。模型清單可確認型錄可用性,而使用你金鑰成功發送請求則可確認帳戶的實際存取。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
response = client.responses.create(
model="gpt-6.1-sol",
input="Review this architecture and list three design risks.",
reasoning={"effort": "medium"},
)
print(response.output_text)
推理強度可選 low、medium、high、xhigh 或 max。不要傳送 none 或 minimal。若認證失敗,請檢查金鑰與帳戶餘額;若出現模型或路由錯誤,請重新確認當前型錄與端點。在切換生產流量前先執行小型 smoke test。
OpenAI 的 GPT-6.1 Sol 安全性評估顯示了什麼?
OpenAI 的 GPT-6.1 Sol 系統卡附錄 報告了相較 GPT-6 Sol 的對齊改進,包括在涉及破損工具透明度、明確限制、未授權結果與電腦使用安全的困難評測中,失敗率更低。
OpenAI 在其準備度框架下,將 GPT-6.1 Sol 視為網路安全能力的 Critical,生物與化學能力為 High,並套用與 GPT-6 Astra 相同的防護措施堆疊。
這些評估刻意使用易引發失敗的困難場景,因此不應將其比率視為典型使用的代表。
常見問題
GPT-6.1 Sol 是否取代 GPT-6 Sol?
GPT-6.1 Sol 是較新的升級,而非完全不同的產品方向。它面向與 GPT-6 Sol 相同的進階程式設計與代理式工作負載,但在軟體工程、電腦使用與多步驟自動化等方面提升表現。
GPT-6.1 Sol 是否與 GPT-6 Astra 一樣強大?
並非在所有工作負載上皆然。GPT-6 Astra 仍是 OpenAI 在最苛刻任務中的高能力選項,而 GPT-6.1 Sol 旨在以更佳效率為大規模生產使用縮小大量表現差距。
誰應該使用 GPT-6.1 Sol?
GPT-6.1 Sol 對運行程式設計代理、自動化系統、文件工作流、電腦使用代理以及其他需大規模重複運用強推理的工作負載之開發者與團隊最為相關。
GPT-6.1 Sol 最大的改進是什麼?
最大的提升不在於更大的上下文視窗或新的輸入模態,而是在真實世界代理表現更強,特別是在程式設計、電腦使用與專業工作流方面,同時維持與 GPT-6 Sol 相近的成本級別。
結論
GPT-6.1 Sol 著重於將進階推理的成本曲線下移,而非延展 GPT-6 的原始規格上限。它保留 1.05M 的上下文視窗與 128K 的輸出上限,同時在程式設計代理、商務工作流、電腦使用、科學工作流與事實準確性方面相較 GPT-6 Sol 有所提升。
同時,標準輸入與輸出定價仍為每百萬 tokens:$2/$10,而 Astra 為 $10/$50。
對開發者而言,這建立了一個實用的部署層級:在需要最大能力時仍可使用 Astra,而 GPT-6.1 Sol 可處理更大比例的進階生產工作負載,而無需讓每個請求都承擔旗艦級經濟成本。最有意義的基準,仍然是你的自有工作負載。
