DeepSeek V4 Pro 0813 is now live on CometAPI →

Grok 4.6 來了:GPT-5.6 等級的基準測試結果與程式設計表現

CometAPI
AnnaAug 13, 2026
Grok 4.6 來了:GPT-5.6 等級的基準測試結果與程式設計表現

TL; DR xAI 於 2026 年 8 月 12 日正式發布 Grok 4.6,並透過 xAI API、Cursor 與 Grok Build 提供使用。其具備 500,000-token 的上下文視窗,支援文字與圖片輸入,提供四檔推理力度,且知識截止日期為 2026 年 2 月 1 日。根據xAI 的 Grok 4.6 官方公告,其在 Artificial Analysis Intelligence Index(九項評測的綜合指數)上與 GPT-5.6 Sol 持平。

API 定價起始為:對於 200,000 token 以下的提示,每百萬輸入 token $2、每百萬快取輸入 token $0.50、每百萬輸出 token $6。當提示達到 200,000 token 時,整個請求將按長上下文費率計價:每百萬輸入 $4、快取輸入 $1、輸出 $12。對於尋求多模型靈活接入的開發者,CometAPI 等平台可輕鬆將 Grok 4.6 與其他前沿模型一同整合,API 價格為 xAI 價格的 80%。

Key Takeaways

  • xAI 於 2026 年 8 月 12 日正式發布 Grok 4.6;較早的發布窗口報導現已過時。
  • The API model ID is ,且該模型也可在 Cursor 和 Grok Build 中使用。grok-4.6
  • 上下文視窗為 500K tokens,支援文字與圖片輸入,輸出為文字。
  • 200K 提示 token 以下的標準定價為 $2/M 輸入、$0.50/M 快取輸入、$6/M 輸出
  • 單次請求一旦達到 200K 提示 token,將對該請求的「所有 token」按較高費率計價,而非僅對超過門檻的部分計價。
  • 推理力度可設為 lowmediumhighxhigh;為文件記載的預設值。
  • Grok 4.6 在 Artificial Analysis Intelligence Index(分數 61)上與 GPT-5.6 Sol 持平,且在代理式編程、知識型工作與長期任務上相較 Grok 4.5 有大幅提升。
  • Grok Imagine Image 2.0 為獨立的圖像生成 API。Grok 4.6 能理解圖像,但本身不返回生成的圖像。

Grok 4.6 Specifications and Price at a Glance

以下規格來自xAI 的模型文件8 月 12 日發布說明的確認。

SpecificationGrok 4.6
Official release dateAugust 12, 2026
API model IDgrok-4.6
PositioningFlagship model for coding, agents and general workloads
Context window500,000 tokens
InputsText and images
OutputText
Documented text-output limitNo text-output limit stated by xAI
Reasoning controlsLow, medium, high and xhigh
Default reasoning effortHigh
Knowledge cutoffFebruary 1, 2026
Native API accessAvailable
Coding-tool accessCursor and Grok Build
Current-events accessRequires Web Search or X Search tools

Official xAI API pricing

xAI 當前的 API 定價表將短上下文與長上下文請求分開計價。

Prompt sizeInput per 1M tokensCached input per 1M tokensOutput per 1M tokens
Below 200,000 tokens$2.00$0.50$6.00
200,000 tokens or more$4.00$1.00$12.00

此門檻對程式碼庫代理尤其重要。當請求的提示達到 200,000 token,xAI 會對該請求的「所有 token」按長上下文費率計價,而非僅針對超過門檻的部分。因此,包含 199,000 提示 token 的請求可能會比包含 200,000 的請求便宜許多,即便兩者大小幾乎相同。

當前 xAI 定價文件中未列出 Grok 4.6 的批量折扣。團隊不應假設離線任務可享有適用於其他 xAI 模型的折扣。

What Is Grok 4.6?

Grok 4.6 是 SpaceXAI 最新的旗艦大型語言模型,於 2026 年 8 月 12 日發布。它直接基於 Grok 4.5,透過更長的補充訓練,聚焦於為進階推理與技術概念策選的模型生成資料、高品質工程資料集、改良的最佳化器,以及擴展的強化學習(面向程式設計與知識工作場景)。

該模型保留與前代相同的 1.5 兆參數基礎;能力提升主要來自後訓練,而非參數規模的增加。它特別設計用於在多步任務中保持效能——無論是研究一個主題、分析大量資訊、導覽與編輯陌生的程式碼庫,或將高階想法轉化為完善的應用或工作產物。SpaceXAI 強調在長期專案上的自我檢查行為與更強的互動與視覺工作表現。

與傳統聊天機器人的差異很重要。

傳統 LLM 流程大致為:

Prompt → Generate answer

Grok 4.6 則更接近以下工作流:

Goal → Plan → Research → Use tools → Modify code → Test → Evaluate → Continue

xAI 的當前定位強調該模型能更長時間地專注於複雜專案、跨程式碼庫工作、研究不熟悉的主題、構建應用,並驗證自身工作。

這使得 Grok 4.6 對於快速擴張的AI 程式代理與自主代理市場尤為相關。

What Are the Main Features of Grok 4.6?

Long-Running Agent Capability

Grok 4.6 最重要的改進是聚焦於長時間運行的任務

模型不僅優化單次回應,更設計為能在專案的多個階段中持續推進。

典型例子包括:

  • 構建應用程式
  • 除錯大型倉庫
  • 研究不熟悉的主題
  • 修改多個元件
  • 執行測試
  • 調查故障
  • 修訂實作
  • 檢查最終結果

這與傳統的指令遵循型基準有本質上的不同。

Advanced Coding Performance

程式設計是 Grok 4.6 最明顯的提升領域之一。

當前基準報告顯示:

  • 65.9% on DeepSWE 1.1
  • 69.9% on CursorBench 3.2
  • 61.3% on FrontierCode 1.1 Extended

這些評測特別相關,因為它們關注的是代理式編碼行為,而非單純的程式碼補全。

從 Grok 4.5 到 Grok 4.6 的進步在 DeepSWE 1.1 上尤其顯著,據報導從約 54% 提升至 65.9%

Multimodal Input

Grok 4.6 支援文字與圖像輸入,讓開發者能將視覺資訊與推理結合。

潛在應用包括:

  • 螢幕截圖除錯
  • UI 分析
  • 圖表解讀
  • 文件理解
  • 視覺化研究
  • 基於圖像的編碼任務

這使 Grok 4.6 比純文字的程式模型更具彈性。

Grok 的搜尋能力是其生態系的重要組成。

API 支援:

  • Web 搜尋
  • X 搜尋
  • 函式呼叫
  • 程式碼執行

xAI 當前的 Grok 4.5 API 文件確認了 Grok API 環境中的這些工具能力。

對於研究型代理而言,這意味著模型可以從靜態的預訓練知識,轉向當前資訊檢索加上推理

Configurable Reasoning

Grok 的 API 暴露了可配置的推理力度。

這讓開發者可在下列之間取捨:

速度 / 成本 ↔ 推理深度

對於簡單任務,較低推理可減少不必要的計算。

對於複雜的編碼或研究任務,較高推理可提供更審慎的問題求解。

Cost-Competitive Frontier Performance

Grok 4.6 的定價可謂其最強的商業優勢之一。

報導的標準 API 價格為:

  • $2 / 1M 輸入 token
  • $6 / 1M 輸出 token

這與 Grok 4.5 報告的定價相同,儘管能力明顯提升。

這帶來對前沿模型而言相當激進的性價比主張。


How Does Grok 4.6 Perform on Benchmarks?

當前最有價值的基準數據集中在代理智能與程式設計領域。

BenchmarkGrok 4.6What It Measures
Artificial Analysis Intelligence Index61Broad frontier-model intelligence
CursorBench 3.269.9%Coding-agent performance
DeepSWE 1.165.9%Software engineering agents
FrontierCode 1.1 Extended61.3%Advanced coding
GDPVal-AA v21,753 EloKnowledge-work task performance

Artificial Analysis Intelligence Index 的 61 分據稱使 Grok 4.6 與 GPT-5.6 Sol 在該指數上處於相同水準。

GDPVal-AA v2 的 1,753 Elo 也相當重要,因為 GDPVal 評估的是專業知識型工作任務,而非僅是學術問答。

The Important Benchmark Takeaway

對 Grok 4.6 最有力的證據並非單一的 MMLU 式分數。

其基準輪廓指向:

程式設計 + 代理 + 知識工作 + 長時間執行

這正是現代 AI 發展的方向。

對於像 CometAPI 這樣的網站,這一點尤需把握:Grok 4.6 應主要被定位為一款代理型前沿模型,而非另一個通用聊天機器人模型。

How does Grok 4.6 compare with its predecessor and competitors?

Grok 4.6 vs Grok 4.5

FeatureGrok 4.5Grok 4.6
Primary focusGeneral reasoning + agentsLong-running agents + coding
Context500K-class deployment500K
InputText + imageText + image
Web searchYesYes
X searchYesYes
Code executionYesYes
Function callingYesYes
Input price$2/M$2/M
Output price$6/M$6/M
DeepSWE 1.1~54%65.9%
Intelligence Index~5661

重點在於,Grok 4.6 並不像是以價格層級替換 Grok 4.5 的簡單更新。它是一個面向長期代理工作流程的能力升級。

xAI 當前的 Grok 4.5 文件將該模型列為每百萬 token $2/$6,並具備可配置推理與工具支援。

Comparison Table: Grok 4.6 vs Key Competitors

AspectGrok 4.6GPT-5.6 SolClaude Fable 5 / Opus 5Notes
AA Intelligence Index616162 / 63Composite score
Input / Output $/1M$2 / $6~$5 / $30~$5 / $25Grok far cheaper on output
Context Window500KUp to 1M+Often 1M
StrengthsAgents, coding efficiency, costBroad reasoning, codingLong-horizon, safety
Cursor IntegrationNative, strongAvailableAvailableGrok optimized for Cursor
Turn EfficiencyHigh (fewer steps)CompetitiveHigher step counts reportedImportant for agents
AvailabilityAPI + Cursor + partnersOfficial + partnersOfficial + partnersCometAPI unifies access

資料來自 SpaceXAI 公告、Artificial Analysis 與公開模型卡,時間截至 2026 年 8 月 13 日。

當前的 Artificial Analysis 比較尤其值得關注。

據稱 Grok 4.6 在 Intelligence Index 上獲得 61 分,與 GPT-5.6 Sol 持平。但經濟性大相逕庭。

競品 GPT 變體的確切定價應以各自提供方的最新價格為準,不過關鍵的市場觀察很明確:Grok 4.6 以相對激進的 token 價格提供前沿水準的基準表現。

這讓 Grok 4.6 對於高量代理執行、否則會使高端前沿模型變得昂貴的應用,特別具有吸引力。

What Are the Limitations of Grok 4.6?

500K 上下文小於部分提供 1M 上下文的競品

Grok 4.6 的 500K 上下文雖大,但並非市場上最大的。

對於極大規模的程式庫或龐大的文件集合,1M 上下文的模型可能更有優勢。

專有模型

不同於 MiMo-V2.5-Pro,Grok 4.6 並非開放權重模型。

開發者無法下載模型並獨立部署。

基準比較需謹慎

不同的程式基準使用不同的框架、提示、工具與評估流程。

例如,SWE-Bench Pro 專為真實的長期軟體工程問題設計,結果會因代理腳手架不同而大幅差異。

因此,69.9% 的 CursorBench 不應被解讀為「Grok 4.6 比另一模型高 69.9%」

正確理解是:它在該基準的特定評估設定下得到該分數。

代理實際成本可能高於表面 token 價格

$2/$6 的 token 價格很有吸引力,但自主代理可能因下列因素消耗巨量 token:

  • 工具呼叫
  • 反覆搜尋
  • 程式執行
  • 失敗嘗試
  • 長上下文
  • 自我驗證

因此,真正的單位經濟性取決於每個成功完成任務的成本,而非僅是每百萬 token 的價格。

Price and Access

官方定價(標準層,約低於 200K 提示 token):

  • 輸入:每 1M token $2.00
  • 快取輸入:每 1M token 約 $0.50
  • 輸出:每 1M token $6.00

較快變體的價格為上述費率的兩倍。對於超長上下文(≥200K),費率可能加倍。強烈建議對代理循環使用提示快取以降低成本。

可用性

  • Cursor 與 Grok Build(首週包含 2× 使用額度)
  • SpaceXAI API(grok-4.6)
  • 合作夥伴:OpenRouter、Vercel、Cloudflare 等
  • SuperGrok 聊天/應用(透過模型選擇器)

CometAPI 建議:若你已在使用(或計畫使用)多個前沿模型,CometAPI 可透過單一與 OpenAI 相容的端點(https://api.cometapi.com/v1)無縫接入 Grok 4.6。你可獲得統一計費、使用分析、覆蓋 500+ 模型(包含 GPT、Claude、Gemini、DeepSeek、Grok 系列)的具競爭力有效費率,以及以一行設定切換模型的能力。這對於 A/B 測試 Grok 4.6 與其他編碼或代理模型,或在建置受益於模型路由與回退的生產系統時特別有價值。前往 cometapi.com 取得免費 API 金鑰並瀏覽即時模型目錄。

Should You Switch to Grok 4.6?

是,若

  • 你大量使用 Cursor 或構建長期運行的編碼/知識代理,並希望以具競爭力的成本獲得穩定的多步可靠性。
  • 你在乎 token 經濟性——Grok 4.6 以接近 GPT-5.6 Sol 的智能水準,提供約為最昂貴前沿選項五分之一的輸出 token 價格。
  • 你重視回合效率(以較少步驟和 token 完成複雜任務)。
  • 你希望立即使用針對現代開發中常見的互動、視覺與代理工作流程明確訓練的模型。

若符合以下情況,考慮維持或混合其他模型

  • 你的主要工作負載是純競賽式編程,或特定封閉模型的強項(如某些 Claude 的長上下文或安全調校場景)。
  • 你要求在每一項個別軟體工程基準上都拿到最高分,無視成本。
  • 你需要單次呼叫超過 500K 的更大全上下文(部分競品提供 1M+)。

多數團隊將受益於將 Grok 4.6 與現有技術棧並行評估。由於它可透過 CometAPI 等聚合器取得,切換成本很低——只需更改模型名稱,並在你的實際工作負載上量測任務完成率、延遲與成本。

Conclusion

Grok 4.6 對 SpaceXAI 而言是重要的一步:在關鍵綜合與代理基準上達到前沿智能水準,在長期編碼與知識型工作表現上有明顯提升,並延續壓過許多封閉競品的激進定價。其在 Cursor 的原生可用性,配合強大的多步可靠性,使其對構建真實世界軟體代理與互動應用的開發者尤其具吸引力。

無論你選擇直接使用、透過 Cursor/Grok Build,或經由 CometAPI 等統一道路,Grok 4.6 今日即可投入生產級評估。請造訪官方公告 x.ai/news/grok-4-6 以取得完整細節與模型卡,並在 cometapi.com 瀏覽即時目錄,將其與其他領先模型並列比較,立即開始使用新能力。

Primary Sources

請務必在官方頁面核對最新的定價、速率限制與基準數字,因為 AI 生態正快速演進。

0 次瀏覽
已審核內容清晰度、來源標註與最新 API 術語。

準備好將 AI 開發成本降低 20% 了嗎?

幾分鐘內免費開始。包含免費試用點數。無需信用卡。

閱讀更多