TL;DR: 2026 年 7 月約三週內接連發布六個重大模型:OpenAI 的三層 GPT-5.6 家族(Sol/Terra/Luna)、Google 的 Gemini 3.6 Flash、xAI 的 Grok 4.5、Moonshot AI 的 Kimi K3、Anthropic 的 Claude Opus 5,以及智譜的 GLM-5.2。沒有放諸四海皆準的最佳選擇。實務決策取決於推理深度、程式設計表現、每 token 成本、上下文需求,以及是否需要開放權重部署。本文依據各家官方資訊與 CometAPI 列示進行比較,對於基準測試的主張以來源標註呈現,而非視為單一通用排名。
關鍵要點:
- GPT-5.6 並非單一模型,而是三個等級(Sol、Terra、Luna)對應三個價位;選錯等級所造成的成本誤差,往往比選錯整個模型家族更大。
- Gemini 3.6 Flash 與 GLM-5.2 都公開標示 1,000,000-token 的上下文視窗;Kimi K3 也達到相同數字——在這一代主流模型中,上下文大小已不再是差異化因素。
- GLM-5.2 與 Kimi K3 皆支援開放權重部署,但授權不同。GLM-5.2 以 MIT License 釋出;Kimi K3 採用獨立的 Kimi K3 License,自託管或提供模型即服務前應審閱其商業條款。
- Claude Opus 5 已正式發布。Anthropic 於 2026 年 7 月 24 日宣布,具備 1M-token 上下文、最高 128K 同步輸出,官方定價為每百萬輸入 token $5、每百萬輸出 token $25;CometAPI 目前列為 $4/$20。
本月實際發布內容
2026 年 7 月是前沿與近前沿模型異常密集的發布月。約三週內,OpenAI 發布 GPT-5.6 家族(7 月 9 日)、xAI 推出 Grok 4.5(7 月 8 日)、Moonshot AI 發布 Kimi K3(7 月 16 日)、Google 發布 Gemini 3.6 Flash(7 月 21 日),而 Anthropic 正式上線 Claude Opus 5(7 月 24 日)。智譜的 GLM-5.2 稍早在 6 月推出,但其 1M-token 上下文與 MIT 授權的開放發布,使其在採購與部署決策上同樣具關聯性。
對任何基於這些模型構建產品的人而言,實務問題不是抽象上哪個最好,而是哪個經確認的選項符合特定任務。六者在成本、上下文、程式行為、授權與部署彈性方面存在實質差異。
定價與規格一覽
以下價格皆以每百萬 token 計。對於具有多個等級的模型,分別列出。
| Model | Input | Output | Context Window | License | Released |
|---|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $30.00 | Not publicly specified | Proprietary | Jul 9, 2026 |
| GPT-5.6 Terra | $2.50 | $15.00 | Not publicly specified | Proprietary | Jul 9, 2026 |
| GPT-5.6 Luna | $1.00 | $6.00 | Not publicly specified | Proprietary | Jul 9, 2026 |
| Grok 4.5 | $2.00 | $4.00 | Not publicly specified | Proprietary | Jul 8, 2026 |
| Kimi K3 | $3.00 | $15.00 | 1,048,576 tokens | Open weights (Kimi K3 License) | Jul 16, 2026 |
| Gemini 3.6 Flash | $1.50 | $7.50 | 1,048,576 tokens (65,536 output) | Proprietary | Jul 21, 2026 |
| GLM-5.2 | $1.40 | $4.41 | 1,000,000 tokens | Open (MIT license) | Jun 13, 2026 |
| Claude Opus 5 | $5.00 | $25.00 | 1,000,000 tokens (128K output) | Proprietary | Jul 24, 2026 |
*上表為官方供應商牌告價格;若透過統一 API 套用標準折扣,將按比例降低各家費率——本表旨在呈現模型之間的相對差距,而非某特定供應商的結帳價格。
從定價與規格表可見幾點:作為 GPT-5.6 的最高等級,Sol 的定價針對前沿推理與代理型工作,而非日常使用;相較其定位,Grok 4.5 的輸出價格偏低。GLM-5.2 在此組合中列示的輸出價格最低,且使用寬鬆的 MIT License。Kimi K3 亦提供可下載權重與 1M-token 上下文,但採用 Kimi K3 License 而非 MIT。Gemini 3.6 Flash、Kimi K3、GLM-5.2、Claude Opus 5 均公布約 1M-token 的上下文視窗,因此僅以上下文容量已不足以區分。CometAPI 的列示費率通常低於供應商牌告,但就工作負載層級的評估而言,仍比單獨比較 token 價格更有意義。
各模型實際調校方向
GPT-5.6 Sol 面向前沿推理、代理型程式設計與長時程技術工作——支援 "Max Reasoning Effort" 模式與可並行部署子代理的 "Ultra Mode"。鑒於與 Terra、Luna 的價格差距,這一等級適合處理困難的多步驟問題,而非例行任務。
GPT-5.6 Terra 為平衡中階——日常生產力、文件處理、程式設計支援與商務自動化。對多數不特別需要 Sol 推理深度的應用後端而言,Terra 是更可辯護的預設。
GPT-5.6 Luna 鎖定輕量、高量使用場景:分類、客服流程、上手引導、重複內容生成。以每百萬 token $1.00/$6.00(未計任何匯接折扣)定價,正好對應此類高呼叫量、低複雜度工作負載——並且支援快取輸入定價,相對標準輸入費率享有 90% 折扣;由於高量工作負載往往具高度重複性,這在此等級比高階等級更為重要。
Grok 4.5 並未像 GPT-5.6 的各等級那樣公開明確的專項定位,但其定價介於入門與中階之間——更適合就特定工作負載,與 Terra 或 Kimi K3 直接對比測試,而非僅依價格推斷定位。
Kimi K3 是一個 2.8 兆參數的 Mixture-of-Experts 模型,面向長時程程式設計、多模態知識工作,以及在 1M-token 上下文內的大型文件或程式碼庫分析。Moonshot AI 已釋出完整權重,可進行自託管,但其採用的 Kimi K3 License 與標準 MIT 釋出有所不同,包含商用條款。
Gemini 3.6 Flash 是 Google 的效率導向發布:官方將其明確定位為 3.5 Flash 的漸進式、成本與延遲優化的後續版本,而非全新前沿模型;在程式與代理型基準上有實質提升,同時每 token 輸出價格低於前代。對於看重每次代理迭代的延遲與成本、而不僅是原始能力的代理型工作負載,它是合適選擇。
GLM-5.2 是此比較中授權更寬鬆的開放選項。Z.ai 以 MIT License 釋出,具備 1M-token 上下文,並明確強調長時程程式設計、工具使用與可調整思考強度。團隊可透過 API 存取,或在自身基礎設施上運行已發布的權重,前提是符合自家基礎設施與評估需求。
程式設計能力比較
六個發布面向不同工程樣式,因此程式能力更應從工作負載適配角度理解,而非單一排名。
- Claude Opus 5 在困難除錯、根因分析、大型重構與長時程軟體代理方面最為契合;Anthropic 強調更強的驗證與迭代行為。
- GPT-5.6 的 Sol、Terra、Luna 提供自複雜程式與推理,至平衡開發工作與高量代碼輔助的分層路徑。
- Gemini 3.6 Flash 針對快速的代理型程式迭代循環調校,當延遲與每次迭代成本同等重要時表現突出。
- Kimi K3 著重於對超大型程式碼庫的長時程程式設計,具 1M-token 上下文與可下載權重。
- GLM-5.2 結合長時程程式設計、工具使用、可調整思考強度與可在 MIT 授權下本地部署。
- Grok 4.5 的官方定位未提供如 GPT 分層般的程式專項劃分,應作為與其他模型直接對比評估的候選。
如此頻繁比較與切換模型的取捨
這並非鼓勵追逐每一次新發布。每逢新模型就切換生產工作負載,確實要付出代價:重新測試提示詞、重新驗證輸出品質、並依實際流量(而非合成基準)重算每任務成本。統一 API 並不會消除這些評估工作,但能移除實際執行比較時的多帳號、多計費開銷——能夠用相同的請求結構與單一帳單,同時調用 GPT-5.6 Terra、Gemini 3.6 Flash、Kimi K3 與 GLM-5.2,使得在承諾之前實際測試不只一個候選模型變得可行,而不至於僅因手上已有哪家金鑰就直接默許。
這是真實的優勢,但不是完整解答——它無法取代逐一閱讀各模型的實際文件,也不會讓模型選型免除上述切換成本。它的作用是降低弄清楚哪個模型真正適合某個工作負載的成本;這與「某模型是最好的」是兩回事(也更誠實)。
FAQ
什麼是 2026 年 7 月發布的最佳 AI 模型?沒有單一最佳答案。GPT-5.6 Sol 與 Claude Opus 5 瞄準高要求的推理與程式設計工作;Gemini 3.6 Flash 強調高效率的代理型循環;Kimi K3 結合長上下文與開放權重;GLM-5.2 則以 MIT 授權結合長時程能力。正確選擇取決於工作負載與部署約束。
GPT-5.6 是一個模型還是多個?三個:Sol(旗艦,前沿推理)、Terra(平衡,日常使用)、Luna(快速低成本,高量任務)——各自獨立定價,從 Luna 的每百萬 token $0.80/$4.80 到 Sol 的 $4.00/$24.00。
Claude Opus 5 是否已正式發布?是的。Anthropic 於 2026 年 7 月 24 日宣布 Claude Opus 5。官方釋出描述 1M-token 的上下文視窗,並將其定位於複雜的代理型程式設計與知識工作;官方 API 定價為每百萬輸入 token $5、每百萬輸出 token $25。
這些模型中哪個在大規模運行時最便宜?依表中供應商列示的輸出價格,GLM-5.2 是最低成本選項,並以 MIT License 提供。Kimi K3 也有開放權重,但其獨立的 Kimi K3 License 與更大的模型體量,會改變自託管的經濟性。GPT-5.6 Luna 是此處涵蓋的、成本最低的專有(僅 API)選項。
我需要選定一個模型並直接承諾嗎,還是可以測試多個?在投入生產流量前,針對實際提示詞與流量測試多個模型通常值得付出前期成本——統一 API(包括 CometAPI 在內)能讓這件事更便宜,因為它移除了為執行比較而另開帳號的開銷,但無法取代閱讀各模型自有文件。
結論
2026 年 7 月的發布潮沒有產生明確的單一贏家,而是帶來六個在推理深度、程式表現、token 成本、上下文與授權上各有取捨的確認選項。GPT-5.6 Sol 與 Claude Opus 5 瞄準最困難的推理與軟體工程工作;Gemini 3.6 Flash 與 GPT-5.6 Luna 更強調效率;Kimi K3 在自有授權下提供開放權重與 1M-token 的多模態上下文;GLM-5.2 則以 1M-token 且採 MIT 授權提供替代方案。這些都可透過 CometAPI 以單一金鑰存取,有助於進行可控測試;但模型選擇仍應基於實際工作負載的提示詞、工具、延遲目標與成功準則。
