GPT-6 Sol, GPT-6 Luna, and Claude Opus 5.5 are now live on CometAPI →
technology/CometAPI 研究

Grok 4.7:基準測試、定價、功能與 API 存取

了解 Grok 4.7 是什麼,包括其 500K 上下文視窗、基準測試、定價、推理模式、代理能力、與 Grok 4.6 的比較,以及存取方式。

CometAPI
Deon GoodwinAI 模型與 API 研究團隊
更新於 Sep 22, 2026 5 分鐘閱讀
Grok 4.7:基準測試、定價、功能與 API 存取
套用此模式

發出第一個 API 請求。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Grok 4.7 是 SpaceXAI 面向程式開發、代理式工作流程與專業知識型工作的前沿模型,於 2026 年 9 月 21 日發佈。它結合了 500,000-token 的上下文視窗、文字與影像輸入、可配置推理、函式呼叫、網頁與 X 搜尋,以及程式碼執行。

對於低於 200,000 tokens 的提示,官方 xAI API 列出每百萬輸入 tokens $2、每百萬快取輸入 tokens $0.50、每百萬輸出 tokens $6。CometAPI 目前將 Grok 4.7 標示為每百萬輸入 $1.60、快取輸入 $0.40、輸出 $4.80,對同級別提示提供較官方價目 20% 的降幅(以其模型頁面所示為準)。

其實際價值主張不是通吃基準測試的冠軍。當工作負載同時需要工程任務、長時間代理迴圈、工具使用、大型工作上下文,且對輸出 token 成本敏感時,Grok 4.7 最具吸引力。團隊應先在自家程式庫與工作流程中驗證,再決定導入生產路由。

重點摘要

  • Grok 4.7 採用比 Grok 4.6 更大的基礎模型、更長期的強化學習於更困難、耗時的任務,並具更強的自我驗證。
  • API 支援 500,000-token 上下文視窗、文字與影像輸入、文字輸出、四檔推理層級、結構化輸出、函式呼叫、網頁與 X 搜尋,以及程式碼執行。
  • SpaceXAI 報告 CursorBench 4.0 為 46.3%、DeepSWE v1.1 為 71.0%、Terminal-Bench 4.0 為 38.0%。這些為供應商公布結果,非普遍領先的證據。
  • CometAPI 顯示 Grok 4.7 可用,提供與 OpenAI 相容的端點,並以較 xAI 官方目錄價低 20% 的標價。
  • 當工程代理與持續工具使用且成本敏感時選擇 Grok 4.7;若極長上下文或基準關鍵領域比單位價格更重要,則選擇替代方案。

什麼是 Grok 4.7?

Grok 4.7 是 SpaceXAI 最新的前沿大型語言模型,定位於「程式開發、自主代理任務與專業知識型工作」。此次發佈聚焦於需要持續互動、工具使用、驗證與修訂的任務,而非僅一次性回答。

SpaceXAI 表示 Grok 4.7 透過更長時間、面向更困難任務組合的強化學習進行訓練,偏重於可能需耗時多小時才能完成的問題。此訓練方向使其特別適合於程式庫層級的軟體工程、除錯、研究、文件創作、工程分析與多步驟自動化。

Grok 4.7 與 Grok 4.6 的差異與提升?

更大的基礎模型

Grok 4.7 採用比 Grok 4.6 更大的基礎模型。SpaceXAI 尚未公開最終參數量,因此可合理推斷基礎模型容量提升,但無法給出具體參數估計。

更長期且更困難任務上的強化學習

強化學習階段被延長,並轉向更困難、視野更長的問題。SpaceXAI 強調可能需數小時完成的任務,使模型更貼合自主程式開發、研究與專業代理工作流程。

更強的自我驗證

Grok 4.7 被訓練以更謹慎地檢查自身成果。於軟體工程中,可靠的代理必須反覆檢視、修改、測試、診斷失敗、修正與驗證,而非僅產生初稿答案。

相較 Grok 4.6 的量化提升

維度Grok 4.6Grok 4.7變化
CursorBench 4.040.4%46.3%+5.9 pts
DeepSWE v1.165.2%71.0%+5.8 pts
EEBench53.0%64.0%+11.0 pts
AA Briefcase v1.11,5461,657+111
Terminal-Bench 4.020.3%38.0%+17.7 pts
Harvey Legal Agent Benchmark15.8%19.6%+3.8 pts
HealthBench Professional48.5%56.7%+8.2 pts

於所發布的啟動測試集中,Grok 4.7 在所有列出的結果上皆優於 Grok 4.6。最大絕對增幅來自 Terminal-Bench 4.0,這與本次強調長時間命令列與工具使用工作流程一致。這些數據仍屬供應商公布,應先以實際任務驗證後再決定是否遷移。

Grok 4.7 在基準測試上的表現如何?

SpaceXAI 的發佈評估涵蓋軟體工程、終端工作、專業辦公任務、法律、臨床推理與電機工程。這些為供應商公布結果,應先以生產工作負載驗證,再做採購或路由決策。

基準測試Grok 4.7 xHighGrok 4.6 HighGPT-5.6 Sol MaxFable 5.1 Max
CursorBench 4.046.3%40.4%41.7%51.8%
DeepSWE v1.171.0%*65.2%72.7%70.0%
EEBench64.0%53.0%39.4%56.4%
AA Briefcase v1.11,6571,5461,4871,678
Terminal-Bench 4.038.0%20.3%37.3%57.9%
Harvey Legal Agent Benchmark19.6%15.8%2.5%6.7%
HealthBench Professional56.7%48.5%60.5%62.1%

Grok 4.7 發佈結果中,SpaceXAI 將 71.0% 的 DeepSWE v1.1 分數標示為高推理努力。

發佈公告未揭露每一項基準的全部測試架構、工具配置、重複次數或評估環境。將這些數值視為供應商公布結果,並在自己的程式庫、工具、延遲目標與失敗標準下進行驗證後,再進行生產路由。

Grok 4.7 的基準輪廓顯示了什麼?

軟體工程

CursorBench 4.0 自 Grok 4.6 的 40.4% 升至 Grok 4.7 的 46.3%,而 DeepSWE v1.1 自 65.2% 升至 71.0%。這支持了 Grok 4.7 作為程式開發代理模型的定位,而非僅限於對話式程式輔助。

長時間終端工作

Terminal-Bench 4.0 呈現世代差異中較大的變化:Grok 4.6 的 20.3% 對比 Grok 4.7 的 38.0%。17.7 個百分點的絕對提升,與 SpaceXAI 對更長視野強化學習與自我驗證的強調相符。

電機工程

在 EEBench 上,Grok 4.7 達到 64.0%,相較 Grok 4.6 的 53.0%。於已發布的比較中,這屬於 Grok 4.7 最強的相對表現之一。

專業知識型工作

AA Briefcase v1.1 由 1,546 上升至 1,657。這些任務設計旨在反映多小時的專業工作,涉及文件、簡報、分析與其他結構化產出等成品。

Grok 4.7 與 GPT-5.6 Sol、Fable 5.1:如何比較?

供應商原廠定價檢視:OpenAI 列出 GPT-5.6 Sol 為每百萬輸入 tokens $4、每百萬輸出 tokens $20;Anthropic 列出 Claude Fable 5.1 為每百萬輸入 tokens $10、每百萬輸出 tokens $50。

維度Grok 4.7GPT-5.6 SolClaude Fable 5.1
主要定位程式開發、代理式任務、知識型工作複雜專業推理與程式開發長時間代理、程式開發與知識型工作
上下文視窗500,000 tokens1,050,000 tokens1,000,000 tokens
模態文字與影像輸入;文字輸出文字與影像輸入;文字輸出文字與影像輸入;文字輸出
推理控制Low、Medium、High、xHigh無至 max可調式思考,具可配置努力程度
供應商 API 狀態可於公開 xAI API 使用可透過 OpenAI Chat Completions 與 Responses 使用可透過 Claude API 與受支援的雲市集使用
輸入價格 / 每百萬 tokens$2$4$10
輸出價格 / 每百萬 tokens$6$20$50
CursorBench 4.046.3%41.7%51.8%
DeepSWE v1.171.0%72.7%70.0%
最佳適配對價格敏感的工程代理與持續工具使用需要非常長上下文的廣泛專業推理當最大化長時間代理表現、程式品質、終端執行或臨床推理值得較高價格時

應該選哪個模型?

  • 當工程工作負載、持續工具使用、可配置推理與較低的輸出 token 成本為優先時,選擇 Grok 4.7。它對於程式庫代理、終端工作流程,以及低於 200K 價格門檻的大上下文研究特別有吸引力。
  • 當任務需要更廣泛的專業推理、超過一百萬 token 的上下文視窗,或其在 DeepSWE、臨床推理等關鍵評估中經自家驗證更強時,選擇 GPT-5.6 Sol。
  • 當最大化長時間代理效能、程式品質、終端執行或臨床推理可合理支撐較高 token 價格時,選擇 Claude Fable 5.1。
  • 當工作負載多樣時,採用模型路由。將常規工程與高頻代理步驟路由至最具成本效率且合格的模型,僅在量測成功率可支撐溢價時,為特定任務保留較昂貴的模型。

正確選擇取決於端到端任務成功率、延遲、重試、工具呼叫準確性與人工返工,而非單一基準或標題 token 價格。

Grok 4.7 API 要花多少錢?

下表比較了 2026 年 9 月 22 日於 CometAPI 的 Grok 4.7 模型頁面所示價格與 xAI 官方價格。CometAPI 稱提供 20% 折扣;在生產前請確認即時價格,因為閘道價格與促銷條款可能變動。

提示層級價格類型xAI officialCometAPI差異
低於 200K 提示 tokens輸入 / 1M$2.00$1.60低 20%
快取輸入 / 1M$0.50$0.40低 20%
輸出 / 1M$6.00$4.80低 20%
高於 200K 提示 tokens輸入 / 1M$4.00$3.20低 20%
快取輸入 / 1M$1.00$0.80低 20%
輸出 / 1M$12.00$9.60低 20%

標準上下文定價:提示不超過 200,000 tokens

對於提示不超過 200,000 tokens 的請求,Grok 4.7 的費率為每百萬輸入 tokens $2、每百萬快取輸入 tokens $0.50、每百萬輸出 tokens $6。快取輸入最便宜,因此具有重複系統指令或可重用上下文的應用,只要符合快取條件,即可藉由快取這些 tokens 降低成本。

舉例而言,一次使用 100,000 未快取輸入 tokens 並產生 10,000 輸出 tokens 的請求,約需 $0.26(不含其他平台費用):輸入 $0.20 加上輸出 $0.06。

超長上下文定價:超過 200,000 提示 tokens

當提示超過 200,000 tokens,費率加倍為每百萬輸入 tokens $4、每百萬快取輸入 tokens $1、每百萬輸出 tokens $12。此較高層級因提示長度而適用,因此團隊應在送出每次請求前,監控累積的對話歷史、工具紀錄、擷取文件與程式庫上下文。

因此,務實的成本決策不僅在於任務使用了多少 tokens,還在於提示是否跨越 200,000-token 邊界。彙總已完成的工作、移除過時的工具輸出、僅擷取最相關檔案,可在不犧牲必要上下文的前提下,讓合適工作負載維持在標準層級。

SpaceXAI 發佈說明記載了此門檻。生產預算亦應將重試、代理迴圈、失敗的工具呼叫與輸出長度納入考量,而非僅按標題輸入 token 價格比較供應商。

什麼讓 Grok 4.7 對 AI 代理有用?

  • 500K 上下文視窗:可在單一工作上下文中容納大量原始碼、規格、工具輸出、日誌與對話歷史。對程式庫尺度的開發與多文件分析有用,但仍需主動修剪上下文。
  • 可配置推理:應用可選擇 low、medium、high 或 xhigh 的努力程度,依任務難度在延遲與運算之間取捨。
  • 函式呼叫與結構化輸出:代理可查詢資料庫、執行測試、檢視文件、呼叫內部 API,並回傳機器可讀結果。
  • Web 與 X 搜尋:當模型訓練資料不足時,可透過搜尋工具擷取最新資訊。擷取內容仍應視為不受信任輸入並加以驗證。
  • 程式碼執行:模型可驗證計算、轉換資料、測試生成解法,而不僅依賴語言模型推理。
  • 長視野工作流程聚焦:訓練重點放在耗時多小時的任務、上下文管理與自我驗證,對會累積工具紀錄且需在失敗後恢復的代理迴圈尤為適合。

Grok 4.7 如何提升安全性?

SpaceXAI 表示 Grok 4.7 引入了全新防護堆疊,並報告更強的越獄防護與雙重用途安全性。於發佈公告中,公司報告在 LatchBio 的生物安全基準上為 62.4%,且於 HackerBench v0.3 上僅有 3.3% 的高風險雙重用途提示被允許通過。

這些數據為供應商公布評估。它們有助於理解發佈主張,但不應被視為真實世界安全表現的普適衡量。

開發者如何使用 Grok 4.7 API?

Grok 4.7 目前可透過 CometAPI 使用,模型 ID 為「grok-4.7」。CometAPI 提供與 OpenAI 相容的端點、跨多家模型供應商的一把 API 金鑰與結算流程、更容易的並排測試與路由,且目前標示的 token 價格比 xAI 官方費率低 20%。在生產前,請確認即時模型頁、端點健康度、支援參數、定價與資料處理要求。

CometAPI 請求範例:

curl "https://api.cometapi.com/v1/responses" \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $COMETAPI_KEY" \
  -d '{
    "model": "grok-4.7",
    "input": "Explain how a distributed task queue handles worker failure."
  }'

值得切換到 Grok 4.7 嗎?

對已依賴 Grok 4.6 進行程式代理或長時間專業工作流程的使用者而言,Grok 4.7 是實質的升級候選,因為其啟動基準集於每一報告面向皆有提升,且在長上下文門檻以下的標準 token 定價仍維持 $2/$6。

對其他前沿模型使用者而言,決策取決於工作負載。當輸出 token 成本、工程工作負載、大上下文與持續工具使用重要時,Grok 4.7 尤其值得關注。若在關鍵領域另有模型更強,採用模型路由往往比全面改用單一供應商更理性。

結論

Grok 4.7 並非對 Grok 4.6 的例行數字更新。此次發佈明確面向「透過工具進行的長時間工作、重複驗證、巨量上下文與多次執行步驟」。

最大的世代增益出現在此訓練方向應該最有影響之處:Terminal-Bench 4.0 自 20.3% 升至 38.0%,EEBench 自 53.0% 升至 64.0%,CursorBench 4.0 自 40.4% 升至 46.3%;同時,在 200K 提示門檻以下的標準定價維持每百萬輸入 $2、輸出 $6。

因此,其務實的價值主張不是「Grok 4.7 贏下所有基準」,而是它縮小了前沿級代理能力與較低成本推論之間的鴻溝,對需要執行多步驟而非一次回答的程式代理、研究系統與專業工作流程尤其重要。

繼續學習

把這篇文章連到下一個決策。

查看所有主題
發布於 Sep 22, 2026
最後更新 Sep 22, 2026
21 次瀏覽
已審核內容清晰度、來源標註與最新 API 術語。

準備好將 AI 開發成本降低 20% 了嗎?

幾分鐘內免費開始。包含免費試用點數。無需信用卡。

閱讀更多