摘要
Grok 4.7 現在有了最明確的預發布信號:9 月 2 日的十天倒數 指向預計於 2026 年 9 月 12 日左右發布。先前的聲明描述該模型擁有約 2.1 兆參數,並以大量 SpaceX 公司資料進行補充訓練。然而,xAI 尚未發布 Grok 4.7 的模型卡、基準測試套件、最終 API 識別符、上下文視窗或官方定價。在這些細節公布前,已發布的 Grok 4.6 仍是可衡量的生產基準。
關鍵要點
- 預計的 9 月 12 日是由 Musk 的十天倒數推論而來,並非 xAI 另行發布的行事曆公告。
- 2.1T 規模與使用 SpaceX 資料的說法屬於發布前聲明;有效參數、路由、架構與訓練方法論仍未公布。
- Grok 4.6 已在知識工作與代理任務上展現強勁表現,包括 FrontierCode v1.1(Extended)達 61.3%,但在多項高難度編碼評測上仍落後於最強對比模型。
- 評估 Grok 4.7 應以接受任務率、長時程可靠性、Token 效率、延遲與每個成功結果成本為基準,而非僅看參數數量。
- CometAPI 將在 xAI 正式發布模型並提供生產端點存取後整合 Grok 4.7;開發者在遷移前仍應驗證實際模型 ID、價格與響應行為。
什麼是 Grok 4.7?
Grok 4.7 是 Grok 4.6 的宣告後繼者,預期將延續 xAI 在程式設計、工程、長時程代理與專業知識工作上的重點。當前的公開證據主要來自創辦人聲明與發布倒數,而非完整的技術發布套件。
最重要的是區分三個對象:已宣告的 Grok 4.7 模型、描述其可能規模與訓練的發布前信號,以及線上可用的Grok 4.6 生產基準。在 xAI 公布最終文件且能對發布端點成功發出請求之前,開發者應將 Grok 4.7 視為即將進行評估的候選者。
Grok 4.7 發布日期與時間軸
Grok 4.7 何時預計發布?
Musk 於 9 月 2 日表示該模型將在十天後到來,指向約在 2026 年 9 月 12 日
來源: Elon Musk on X, September 2, 2026
Grok 4.7 發布時間軸
| 日期 | 公開信號 | 解讀 |
|---|---|---|
| 2026 年 7 月下旬 | Musk 描述一個約 2.1T 的模型、改進的 Token 效率,以及略慢的服務速度。 | 創辦人描述的模型規模與效率預期。 |
| 2026 年 8 月 12 日 | 初始訓練被描述為已完成;補充訓練據稱納入大量 SpaceX 公司資料。 | 訓練進度更新,非發布確認。 |
| 2026 年 9 月 2 日 | 「Grok 4.7 於 10 天後推出。」 | 迄今最明確的公開發布倒數。 |
| 2026 年 9 月 12 日 | 由倒數推導出的日曆日期。 | 預期目標;最終可用性仍需 xAI 的發布公告與可運作的端點。 |
Grok 4.7 規格:已確認與未確認資訊
閱讀當前 Grok 4.7 資訊的最佳方式,是分開創辦人直接表述與 xAI 尚未發布的規格。新貼文僅確認了模型名稱與發布倒數;並未新增技術參數或基準測試結果。
| 規格 | 當前 Grok 4.7 狀態 | 證據等級 |
|---|---|---|
| 發布時程 | 約在 9 月 12 日,從 9 月 2 日的十天倒數推論而來 | 創辦人宣布的目標 |
| 模型規模 | 約 2.1 兆參數 | 創辦人表述 |
| 初始訓練 | 於 8 月 12 日前後被描述為已完成 | 創辦人表述 |
| 補充訓練 | 包含大量 SpaceX 公司資料 | 創辦人表述 |
| 相對品質 | 聲稱顯著優於 Grok 4.6 | 未驗證的說法 |
| Token 效率 | 聲稱較 Grok 4.6 改進 | 未驗證的說法 |
| 服務速度 | 預期會略慢 | 創辦人表述 |
| 上下文視窗 | xAI 未公布 | 未知 |
| 輸入/輸出模態 | xAI 未公布 | 未知 |
| 最終 API 模型 ID | xAI 文件中未確認 | 未知 |
| 官方定價 | xAI 未公布 | 未知 |
| 官方基準測試 | 尚未發布 Grok 4.7 的任何基準測試 | 未知 |
約 2.1 兆參數的說法並未揭露有效參數、稀疏性、專家路由、推理成本或實際訓練計算量。僅憑參數數量無法界定生產品質。
為何 SpaceX 訓練信號可能比 2.1T 更重要
更具影響力的披露,可能是SpaceX 公司資料的補充。高品質的工程語料可改善技術推理、設計、除錯、最佳化,以及長時程代理工作;在這些領域,任務分配與訓後品質往往比裸規模更重要。
這一方向與 xAI 的已發布模型策略一致。Grok 4.6 的訓練報告描述了更長的高品質工程資料補充訓練,隨後在程式設計、STEM、網頁開發、核心最佳化與電腦輔助設計上進行監督式微調與強化學習。
這使得 Grok 4.7 的說法在技術上具有可置信度,但尚未證實。若有實質優勢,應在發布後通過可重現的工程測試、任務完成率、延遲與每個成功結果成本中體現。
Grok 4.7 對比 Grok 4.6 的表現:基準顯示了什麼
目前尚無 Grok 4.7 的官方分數。負責任的對比點是 xAI 已發布的 Grok 4.6 評估。完整模型概覽見 CometAPI 的 Grok 4.6 深度解析;下表僅保留最有助於決策的基準行。
| 官方評測 | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Claude Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54.0% | 73.0% | 70.0% |
| FrontierCode v1.1 (Extended) | 61.3% | 56.6% | 60.6% | 63.6% |
| Terminal-Bench v3.0 | 26.0% | 15.7% | 34.6% | 34.1% |
基準結果:Grok 4.6 在上述各行均明顯優於 Grok 4.5。其在整體智慧指標上與 GPT-5.6 Sol 相當,在 GDPVal-AA v2 上領先此組,並在 FrontierCode 略勝 GPT-5.6 Sol。其已公布的主要差距仍在 DeepSWE 與 Terminal-Bench。
這些結果為 Grok 4.7 設下具體標準。若較大模型與工程導向的補充訓練能轉化到生產,預期的突破將是更強的倉庫層級編碼與終端任務完成,同時不喪失 Grok 4.6 的知識工作優勢。一個可信的進階目標是,在程式設計與長時程代理工作流程方面,與已發布的 Claude Fable 5.1 具備競爭力。這是一個有待驗證的預測,而非當前的基準聲明。
Grok 4.7 對比 Grok 4.6:預期突破與升級指引
外流與創辦人表述的信號顯示五個可能的改進方向。由於 xAI 尚未發布最終評估數據,每一項預期都應轉化為可衡量的驗收測試。
倉庫層級程式開發
Grok 4.6 在 CursorBench 與 FrontierCode 已表現強勁,但在 DeepSWE 與 Terminal-Bench 上仍有明顯進步空間。Grok 4.7 應在相同倉庫上展現更高的補丁接受率、更少回歸,以及更好的指令列恢復能力,方可取代 4.6。
長時程代理可靠性
SpaceX 資料信號與 xAI 既有的代理訓練方向,暗示聚焦多階段工程工作。衡量完成的工作流程、工具呼叫失敗、重試、人工介入與錯誤後的恢復,而非僅看最終文字品質。
知識工作與技術推理
Grok 4.6 已在 GDPVal-AA v2 上領先對比組。Grok 4.7 應維持此優勢,同時提升在設計審查、研究綜整、除錯、最佳化與其他複雜技術任務上的遷移效果。
Token 效率
較大的模型若能用更少步驟達到正確結果,仍可能在每個成功任務上更便宜。比較為達成同一接受結果所需的總輸入、已快取輸入、輸出 Token、重試次數與成本。
服務層面的取捨
若 Grok 4.7 較慢,品質提升必須足以彌補延遲。記錄首個 Token 時間、持續吞吐量、完成任務的壁鐘時間、錯誤率,以及在真實併發下的成本。
Grok 4.7 基準測試:5 項測試以驗證相對 Grok 4.6 的實質升級
- 軟體工程成功率:在具代表性的倉庫上,衡量已解決議題、通過測試、回歸率與補丁接受度。
- 長時程代理可靠性:在多步執行中追蹤完成的工作流程、工具呼叫失敗、重試、恢復與人工介入。
- 真實工程遷移能力:以公開評分標準測試設計、除錯、最佳化、科學推理與 CAD 相關任務。
- 每個成功任務的 Token 效率:比較達成相同接受結果所需的總 Token 與花費。
- 生產負載下的延遲與成本:在真實併發下評估首個 Token 時間、吞吐量、壁鐘時間、錯誤率與成本。
9 月 12 日前開發者應做什麼——以及 CometAPI 的角色
Pre-Launch Developer Checklist
- 基於真實的程式開發、研究、工程與代理工作流程,建立固定的評估集。
- 以 Grok 4.6 執行評估,記錄成功率、重試、工具呼叫、延遲、Token 與總成本。
- 保持模型選擇可配置,避免硬編碼暫定的 Grok 4.7 識別符。
- 追蹤 xAI 發布說明 與 CometAPI 模型頁以確認可用性。
- 發布後,驗證上下文、模態、推理控制、價格、速率限制與推出範圍。
- 在轉移生產流量前,重放相同的評估集。
CometAPI 提供統一的 API 層,讓使用者透過單一帳號與整合樣式存取多家 AI 模型供應商。已提供 Grok 4.7 追蹤頁面。CometAPI 將在 xAI 正式發布並開放生產端點存取後立刻整合 Grok 4.7。
在此之前,將任何發布前的識別符、價格或能力欄位視為暫定。在發送生產流量前,請確認路由已啟用、實際請求可成功、返回的模型為預期版本,且主控台可見當前定價。
Grok 4.7 與 Grok 4.6 的定價展望
已公布的 Grok 4.6 標準費率為在長上下文閾值以下,每 1 百萬輸入 Token $2、每 1 百萬輸出 Token $6。xAI 的發布說明列出對超過 200,000 提示 Token 的請求有更高費率。Grok 4.7 的定價尚未正式公布。
| 已公布的定價依據 | 輸入 / 1M | 輸出 / 1M | 狀態 |
|---|---|---|---|
| Grok 4.6,提示低於 200K | $2 | $6 | 已公布 |
| Grok 4.6,提示高於 200K | $4 | $12 | 已公布的長上下文分級 |
| Grok 4.7 | 未公布 | 未公布 | 正式發布後確認 |
三種定價方向皆具可能:與 Grok 4.6 持平以加速採用;若服務成本明顯更高則採用溢價分級;或依上下文長度與速度區分費率。以上為規劃情境,非 xAI 預測。
Pre-Launch Developer Checklist
- 基於真實的程式開發、研究、工程與代理工作流程,建立固定的評估集。
- 以 Grok 4.6 執行評估,記錄成功率、重試、工具呼叫、延遲、Token 與總成本。
- 保持模型選擇可配置,避免硬編碼暫定的 Grok 4.7 識別符。
- 追蹤 xAI 發布說明 與 CometAPI 模型頁以確認可用性。
- 發布後,驗證上下文、模態、推理控制、價格、速率限制與推出範圍。
- 在轉移生產流量前,重放相同的評估集。
Grok 4.7:接下來該關注什麼
四個事件將把當前的倒數轉化為可驗證的產品發布:官方 xAI 發布貼文;涵蓋上下文、模態與推理控制的模型文件;最終 API 定價與模型識別符;以及可重現的基準測試或生產評估。
最有用的發布問題,不是 2.1T 聽起來有多大,而是 Grok 4.7 是否比現有基準更可靠地完成困難的工程與代理任務,並以更好的每個成功結果成本達成。
常見問題
Grok 4.7 何時預計發布?
Musk 的9 月 2 日十天倒數指向約 2026 年 9 月 12 日。這是推論的目標,而非 xAI 另行公布的日曆日期。
Grok 4.7 是否已經發布?
Grok 4.7 已被公開預告/宣布,但尚未有完整的官方 API/模型文件發布。
Grok 4.7 是否為 2.1 兆參數模型?
Musk 曾描述其約 2.1 兆參數。xAI 尚未發布確認有效參數或路由細節的架構文件。
Grok 4.7 會優於 Grok 4.6 嗎?
Musk 聲稱有顯著提升,但尚無官方的 Grok 4.7 基準表。請在可重現結果可用前,將此視為未驗證說法。
Grok 4.7 是否可透過 CometAPI 使用?
已有 CometAPI 追蹤頁面,但最終可用性、識別符、定價與支援格式,應在官方發布後確認。
結論
Grok 4.7 的進展已從籠統的九月上旬估計,轉為具體的倒數。Musk 最新聲明指向約 2026 年 9 月 12 日,而先前的貼文描述了約 2.1T 的模型以及以大量 SpaceX 公司資料進行的補充訓練。
這些是異常具體的發布前信號,但並非模型卡、基準測試套件或 API 合約。開發者應維持 Grok 4.6 作為可衡量的基準,現在就準備受控的評估,並在 xAI 與 CometAPI 確認生產存取前,暫緩做出遷移或預算決策。
