Grok 4.6 的技術規格
| 項目 | Grok 4.6 |
|---|---|
| 供應商 | xAI |
| 模型 ID | grok-4.6 |
| 模型類型 | 前沿多模態推理與代理型模型 |
| 主要優勢 | 長時運行代理、程式開發、知識型工作、互動/視覺化應用構建 |
| 輸入模態 | 文字與圖像 |
| 輸出模態 | 文字 |
| 上下文視窗 | 500,000 個 token |
| 知識截斷 | 2026 年 2 月 1 日 |
| 輸出限制 | xAI 未公布文字輸出上限 |
| 推理 | low、medium、high(預設)、xhigh |
| API | Responses API、Chat Completions |
| 工具 | 函式呼叫、網頁搜尋、X 搜尋、程式碼執行 |
| API 定價 | $2 / 1M 輸入 token;$6 / 1M 輸出 token |
| 高速變體 | 以標準價格的 2 倍提供 |
| 發佈 | 2026 年 8 月 12 日 |
什麼是 Grok 4.6?
Grok 4.6 是 xAI 最新的前沿模型,聚焦於代理式智慧。
它與傳統聊天機器人的差異至關重要。
xAI 強調該模型能夠長時間持續投入複雜專案、跨程式碼庫工作、研究不熟悉的主題、構建應用,並能自我驗證成果。
這使得 Grok 4.6 對迅速擴張的AI 程式設計代理與自主代理市場尤為相關。
Grok 4.6 的主要特性
- **長時運行的代理執行:**Grok 4.6 經過訓練,能在多步驟中持續完成複雜工作,而非只優化單輪回答。
- **代理式程式開發:**面向程式碼倉庫層級的軟體工程、程式碼生成、除錯、迭代測試與領域特定的開發環境。
- **知識型工作研究:**模型可研究不熟悉的領域、整理資訊、推理複雜需求,並將發現轉化為具體產出。
- **視覺化與互動式應用構建:**xAI 報告稱在視覺與互動專案上有更強的一次性成果,包括將產品想法轉為可運行的應用,並透過回饋循環加以精煉。
- **自我測試與驗證:**在較長的任務路徑中,xAI 觀察到模型更常於繼續前主動檢查自身工作。
- **原生工具使用:**Grok 4.6 透過 API 支援函式呼叫、網頁搜尋、X 搜尋與程式碼執行。
- **可配置推理:**開發者可選擇
low、medium、high或xhigh的推理強度,使模型能適配延遲敏感與深度推理的工作負載。
Grok 4.6 的基準測試表現
xAI 報告稱,Grok 4.6 在 Artificial Analysis Intelligence Index(九項基準的綜合指標)上與 GPT-5.6 Sol 相當。其已公布的最強結果包括:
| Benchmark | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Claude Fable 5 Max |
|---|---|---|---|---|
| Artificial Analysis Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54.0% | 73.0% | 70.0% |
| FrontierCode v1.1 (Extended) | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26.0% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | — | 58.8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
以上數據來自 xAI 8 月 12 日的發佈公告。xAI 指出,第三方數據取自開發者系統卡或公開基準排行榜,因此跨模型的結果需結合評估方法與模型設定加以理解。
Grok 4.6 對比 Grok 4.5、GPT-5.6 Sol、Claude Fable 5
| 模型 | 主要定位 | 上下文 | AA Intelligence | 程式/代理能力概況 |
|---|---|---|---|---|
| Grok 4.6 | 長時運行代理、程式開發、知識型工作 | 500K | 61 | 強大的代理式程式開發與互動專案工作流程 |
| Grok 4.5 | 快速的前沿通用與程式開發模型 | 500K | 56 | 在程式與代理工作流程上有強力基線 |
| GPT-5.6 Sol | 前沿的一般推理與代理工作 | 已發佈的競品上下文因部署而異 | 61 | 在 DeepSWE 與 Terminal-Bench 上表現強勁 |
| Claude Fable 5 | 前沿的知識型工作與程式開發 | 已發佈的競品上下文因部署而異 | 62 | 在 CursorBench、FrontierCode、APEX-SWE 上表現極強 |
Grok 4.6 最具吸引力的場景是工作負載需要持續執行,而不是一次性的高品質回答。它對開發者特別有利,尤其是那些構建會反覆研究、呼叫工具、編輯程式碼、測試結果,並從累積上下文持續推進的代理。另一方面,Claude Fable 5 在若干已公布的程式與代理基準上保持優勢,而 GPT-5.6 Sol 則在 xAI 的比較中於 DeepSWE 與 Terminal-Bench 領先 Grok 4.6。
限制與注意事項
- 基準成績依任務而異:Grok 4.6 並非在所有情境中都是最高分。其公布結果顯示在不同代理評測上有明顯強弱。
- 長時運行的工作負載可能消耗大量 token:即使每 token 價格具競爭力,大上下文視窗與迭代工具使用會增加總推理用量。
- 工具配置至關重要:網頁搜尋、X 搜尋、程式碼執行與函式呼叫需要能安全處理工具權限與回傳資料的應用架構。
- 知識截斷:官方記載的截斷日期為 2026 年 2 月 1 日。對較新資訊,開發者應使用合適的檢索或網路搜尋工具,而非依賴模型的靜態知識。
- 快取需刻意配置:xAI 建議在 Responses API 使用
prompt_cache_key,在 Chat Completions 使用x-grok-conv-id以提升快取命中可靠性。
Grok 4.6 的應用場景
- 自主程式設計代理 — 倉庫分析、實作、除錯、測試與迭代修復。
- 產品原型設計 — 將廣泛的產品需求轉化為可運行的互動式應用。
- 技術研究代理 — 研究不熟悉的技術領域並輸出具結構的成果。
- 開發者副駕 — 程式碼生成、審查、除錯與多步驟開發工作流程。
- 知識型工作自動化 — 文件分析、資訊綜整、規劃與結構化輸出生成。
- 工具型助理 — 結合模型推理與網頁搜尋、X 搜尋、程式碼執行及自訂函式呼叫的應用。
如何存取 Grok 4.6 API
對已使用 CometAPI 統一 API 層的應用,請使用 CometAPI 暴露的 Grok 4.6 模型 ID,並遵循 CometAPI API 文件中的現行端點/結構。當應用需要在前沿 LLM 之間切換時,這可減少供應商特定的整合工作。
典型流程如下:
- 建立或登入 CometAPI 帳戶。
- 在 CometAPI 控制台建立 API 權杖。
- 選擇
grok-4.6模型端點。 - 依據該模型的文件化請求結構,透過 CometAPI 端點發送請求。
- 在您的應用中處理返回的文字、工具呼叫或結構化輸出。