TL;DR Grok 4.7 是 SpaceXAI 面向程式開發、代理式工作流程與專業知識型工作的前沿模型,於 2026 年 9 月 21 日發佈。它結合了 500,000-token 的上下文視窗、文字與影像輸入、可配置推理、函式呼叫、網頁與 X 搜尋,以及程式碼執行。
對於低於 200,000 tokens 的提示,官方 xAI API 列出每百萬輸入 tokens $2、每百萬快取輸入 tokens $0.50、每百萬輸出 tokens $6。CometAPI 目前將 Grok 4.7 標示為每百萬輸入 $1.60、快取輸入 $0.40、輸出 $4.80,對同級別提示提供較官方價目 20% 的降幅(以其模型頁面所示為準)。
其實際價值主張不是通吃基準測試的冠軍。當工作負載同時需要工程任務、長時間代理迴圈、工具使用、大型工作上下文,且對輸出 token 成本敏感時,Grok 4.7 最具吸引力。團隊應先在自家程式庫與工作流程中驗證,再決定導入生產路由。
重點摘要
- Grok 4.7 採用比 Grok 4.6 更大的基礎模型、更長期的強化學習於更困難、耗時的任務,並具更強的自我驗證。
- API 支援 500,000-token 上下文視窗、文字與影像輸入、文字輸出、四檔推理層級、結構化輸出、函式呼叫、網頁與 X 搜尋,以及程式碼執行。
- SpaceXAI 報告 CursorBench 4.0 為 46.3%、DeepSWE v1.1 為 71.0%、Terminal-Bench 4.0 為 38.0%。這些為供應商公布結果,非普遍領先的證據。
- CometAPI 顯示 Grok 4.7 可用,提供與 OpenAI 相容的端點,並以較 xAI 官方目錄價低 20% 的標價。
- 當工程代理與持續工具使用且成本敏感時選擇 Grok 4.7;若極長上下文或基準關鍵領域比單位價格更重要,則選擇替代方案。
什麼是 Grok 4.7?
Grok 4.7 是 SpaceXAI 最新的前沿大型語言模型,定位於「程式開發、自主代理任務與專業知識型工作」。此次發佈聚焦於需要持續互動、工具使用、驗證與修訂的任務,而非僅一次性回答。
SpaceXAI 表示 Grok 4.7 透過更長時間、面向更困難任務組合的強化學習進行訓練,偏重於可能需耗時多小時才能完成的問題。此訓練方向使其特別適合於程式庫層級的軟體工程、除錯、研究、文件創作、工程分析與多步驟自動化。
Grok 4.7 與 Grok 4.6 的差異與提升?
更大的基礎模型
Grok 4.7 採用比 Grok 4.6 更大的基礎模型。SpaceXAI 尚未公開最終參數量,因此可合理推斷基礎模型容量提升,但無法給出具體參數估計。
更長期且更困難任務上的強化學習
強化學習階段被延長,並轉向更困難、視野更長的問題。SpaceXAI 強調可能需數小時完成的任務,使模型更貼合自主程式開發、研究與專業代理工作流程。
更強的自我驗證
Grok 4.7 被訓練以更謹慎地檢查自身成果。於軟體工程中,可靠的代理必須反覆檢視、修改、測試、診斷失敗、修正與驗證,而非僅產生初稿答案。
相較 Grok 4.6 的量化提升
| 維度 | Grok 4.6 | Grok 4.7 | 變化 |
|---|---|---|---|
| CursorBench 4.0 | 40.4% | 46.3% | +5.9 pts |
| DeepSWE v1.1 | 65.2% | 71.0% | +5.8 pts |
| EEBench | 53.0% | 64.0% | +11.0 pts |
| AA Briefcase v1.1 | 1,546 | 1,657 | +111 |
| Terminal-Bench 4.0 | 20.3% | 38.0% | +17.7 pts |
| Harvey Legal Agent Benchmark | 15.8% | 19.6% | +3.8 pts |
| HealthBench Professional | 48.5% | 56.7% | +8.2 pts |
於所發布的啟動測試集中,Grok 4.7 在所有列出的結果上皆優於 Grok 4.6。最大絕對增幅來自 Terminal-Bench 4.0,這與本次強調長時間命令列與工具使用工作流程一致。這些數據仍屬供應商公布,應先以實際任務驗證後再決定是否遷移。
Grok 4.7 在基準測試上的表現如何?
SpaceXAI 的發佈評估涵蓋軟體工程、終端工作、專業辦公任務、法律、臨床推理與電機工程。這些為供應商公布結果,應先以生產工作負載驗證,再做採購或路由決策。
| 基準測試 | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
於Grok 4.7 發佈結果中,SpaceXAI 將 71.0% 的 DeepSWE v1.1 分數標示為高推理努力。
發佈公告未揭露每一項基準的全部測試架構、工具配置、重複次數或評估環境。將這些數值視為供應商公布結果,並在自己的程式庫、工具、延遲目標與失敗標準下進行驗證後,再進行生產路由。
Grok 4.7 的基準輪廓顯示了什麼?
軟體工程
CursorBench 4.0 自 Grok 4.6 的 40.4% 升至 Grok 4.7 的 46.3%,而 DeepSWE v1.1 自 65.2% 升至 71.0%。這支持了 Grok 4.7 作為程式開發代理模型的定位,而非僅限於對話式程式輔助。
長時間終端工作
Terminal-Bench 4.0 呈現世代差異中較大的變化:Grok 4.6 的 20.3% 對比 Grok 4.7 的 38.0%。17.7 個百分點的絕對提升,與 SpaceXAI 對更長視野強化學習與自我驗證的強調相符。
電機工程
在 EEBench 上,Grok 4.7 達到 64.0%,相較 Grok 4.6 的 53.0%。於已發布的比較中,這屬於 Grok 4.7 最強的相對表現之一。
專業知識型工作
AA Briefcase v1.1 由 1,546 上升至 1,657。這些任務設計旨在反映多小時的專業工作,涉及文件、簡報、分析與其他結構化產出等成品。
Grok 4.7 與 GPT-5.6 Sol、Fable 5.1:如何比較?
供應商原廠定價檢視:OpenAI 列出 GPT-5.6 Sol 為每百萬輸入 tokens $4、每百萬輸出 tokens $20;Anthropic 列出 Claude Fable 5.1 為每百萬輸入 tokens $10、每百萬輸出 tokens $50。
| 維度 | Grok 4.7 | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| 主要定位 | 程式開發、代理式任務、知識型工作 | 複雜專業推理與程式開發 | 長時間代理、程式開發與知識型工作 |
| 上下文視窗 | 500,000 tokens | 1,050,000 tokens | 1,000,000 tokens |
| 模態 | 文字與影像輸入;文字輸出 | 文字與影像輸入;文字輸出 | 文字與影像輸入;文字輸出 |
| 推理控制 | Low、Medium、High、xHigh | 無至 max | 可調式思考,具可配置努力程度 |
| 供應商 API 狀態 | 可於公開 xAI API 使用 | 可透過 OpenAI Chat Completions 與 Responses 使用 | 可透過 Claude API 與受支援的雲市集使用 |
| 輸入價格 / 每百萬 tokens | $2 | $4 | $10 |
| 輸出價格 / 每百萬 tokens | $6 | $20 | $50 |
| CursorBench 4.0 | 46.3% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0% | 72.7% | 70.0% |
| 最佳適配 | 對價格敏感的工程代理與持續工具使用 | 需要非常長上下文的廣泛專業推理 | 當最大化長時間代理表現、程式品質、終端執行或臨床推理值得較高價格時 |
應該選哪個模型?
- 當工程工作負載、持續工具使用、可配置推理與較低的輸出 token 成本為優先時,選擇 Grok 4.7。它對於程式庫代理、終端工作流程,以及低於 200K 價格門檻的大上下文研究特別有吸引力。
- 當任務需要更廣泛的專業推理、超過一百萬 token 的上下文視窗,或其在 DeepSWE、臨床推理等關鍵評估中經自家驗證更強時,選擇 GPT-5.6 Sol。
- 當最大化長時間代理效能、程式品質、終端執行或臨床推理可合理支撐較高 token 價格時,選擇 Claude Fable 5.1。
- 當工作負載多樣時,採用模型路由。將常規工程與高頻代理步驟路由至最具成本效率且合格的模型,僅在量測成功率可支撐溢價時,為特定任務保留較昂貴的模型。
正確選擇取決於端到端任務成功率、延遲、重試、工具呼叫準確性與人工返工,而非單一基準或標題 token 價格。
Grok 4.7 API 要花多少錢?
下表比較了 2026 年 9 月 22 日於 CometAPI 的 Grok 4.7 模型頁面所示價格與 xAI 官方價格。CometAPI 稱提供 20% 折扣;在生產前請確認即時價格,因為閘道價格與促銷條款可能變動。
| 提示層級 | 價格類型 | xAI official | CometAPI | 差異 |
|---|---|---|---|---|
| 低於 200K 提示 tokens | 輸入 / 1M | $2.00 | $1.60 | 低 20% |
| 快取輸入 / 1M | $0.50 | $0.40 | 低 20% | |
| 輸出 / 1M | $6.00 | $4.80 | 低 20% | |
| 高於 200K 提示 tokens | 輸入 / 1M | $4.00 | $3.20 | 低 20% |
| 快取輸入 / 1M | $1.00 | $0.80 | 低 20% | |
| 輸出 / 1M | $12.00 | $9.60 | 低 20% |
標準上下文定價:提示不超過 200,000 tokens
對於提示不超過 200,000 tokens 的請求,Grok 4.7 的費率為每百萬輸入 tokens $2、每百萬快取輸入 tokens $0.50、每百萬輸出 tokens $6。快取輸入最便宜,因此具有重複系統指令或可重用上下文的應用,只要符合快取條件,即可藉由快取這些 tokens 降低成本。
舉例而言,一次使用 100,000 未快取輸入 tokens 並產生 10,000 輸出 tokens 的請求,約需 $0.26(不含其他平台費用):輸入 $0.20 加上輸出 $0.06。
超長上下文定價:超過 200,000 提示 tokens
當提示超過 200,000 tokens,費率加倍為每百萬輸入 tokens $4、每百萬快取輸入 tokens $1、每百萬輸出 tokens $12。此較高層級因提示長度而適用,因此團隊應在送出每次請求前,監控累積的對話歷史、工具紀錄、擷取文件與程式庫上下文。
因此,務實的成本決策不僅在於任務使用了多少 tokens,還在於提示是否跨越 200,000-token 邊界。彙總已完成的工作、移除過時的工具輸出、僅擷取最相關檔案,可在不犧牲必要上下文的前提下,讓合適工作負載維持在標準層級。
SpaceXAI 發佈說明記載了此門檻。生產預算亦應將重試、代理迴圈、失敗的工具呼叫與輸出長度納入考量,而非僅按標題輸入 token 價格比較供應商。
什麼讓 Grok 4.7 對 AI 代理有用?
- 500K 上下文視窗:可在單一工作上下文中容納大量原始碼、規格、工具輸出、日誌與對話歷史。對程式庫尺度的開發與多文件分析有用,但仍需主動修剪上下文。
- 可配置推理:應用可選擇 low、medium、high 或 xhigh 的努力程度,依任務難度在延遲與運算之間取捨。
- 函式呼叫與結構化輸出:代理可查詢資料庫、執行測試、檢視文件、呼叫內部 API,並回傳機器可讀結果。
- Web 與 X 搜尋:當模型訓練資料不足時,可透過搜尋工具擷取最新資訊。擷取內容仍應視為不受信任輸入並加以驗證。
- 程式碼執行:模型可驗證計算、轉換資料、測試生成解法,而不僅依賴語言模型推理。
- 長視野工作流程聚焦:訓練重點放在耗時多小時的任務、上下文管理與自我驗證,對會累積工具紀錄且需在失敗後恢復的代理迴圈尤為適合。
Grok 4.7 如何提升安全性?
SpaceXAI 表示 Grok 4.7 引入了全新防護堆疊,並報告更強的越獄防護與雙重用途安全性。於發佈公告中,公司報告在 LatchBio 的生物安全基準上為 62.4%,且於 HackerBench v0.3 上僅有 3.3% 的高風險雙重用途提示被允許通過。
這些數據為供應商公布評估。它們有助於理解發佈主張,但不應被視為真實世界安全表現的普適衡量。
開發者如何使用 Grok 4.7 API?
Grok 4.7 目前可透過 CometAPI 使用,模型 ID 為「grok-4.7」。CometAPI 提供與 OpenAI 相容的端點、跨多家模型供應商的一把 API 金鑰與結算流程、更容易的並排測試與路由,且目前標示的 token 價格比 xAI 官方費率低 20%。在生產前,請確認即時模型頁、端點健康度、支援參數、定價與資料處理要求。
CometAPI 請求範例:
curl "https://api.cometapi.com/v1/responses" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-d '{
"model": "grok-4.7",
"input": "Explain how a distributed task queue handles worker failure."
}'
值得切換到 Grok 4.7 嗎?
對已依賴 Grok 4.6 進行程式代理或長時間專業工作流程的使用者而言,Grok 4.7 是實質的升級候選,因為其啟動基準集於每一報告面向皆有提升,且在長上下文門檻以下的標準 token 定價仍維持 $2/$6。
對其他前沿模型使用者而言,決策取決於工作負載。當輸出 token 成本、工程工作負載、大上下文與持續工具使用重要時,Grok 4.7 尤其值得關注。若在關鍵領域另有模型更強,採用模型路由往往比全面改用單一供應商更理性。
結論
Grok 4.7 並非對 Grok 4.6 的例行數字更新。此次發佈明確面向「透過工具進行的長時間工作、重複驗證、巨量上下文與多次執行步驟」。
最大的世代增益出現在此訓練方向應該最有影響之處:Terminal-Bench 4.0 自 20.3% 升至 38.0%,EEBench 自 53.0% 升至 64.0%,CursorBench 4.0 自 40.4% 升至 46.3%;同時,在 200K 提示門檻以下的標準定價維持每百萬輸入 $2、輸出 $6。
因此,其務實的價值主張不是「Grok 4.7 贏下所有基準」,而是它縮小了前沿級代理能力與較低成本推論之間的鴻溝,對需要執行多步驟而非一次回答的程式代理、研究系統與專業工作流程尤其重要。
