TL;DR
Grok 4.6 是想要受管前沿 API 用於代理型程式開發與知識工作的更強預設選擇:在 Artificial Analysis Intelligence Index 上得分 61,在當前獨立測量中生成速度更快,且輸入/輸出每百萬 tokens 的起價為 $2/$6。
Kimi K3 在上下文長度與模型開放性重要時更具彈性。它結合 2.8 兆參數、104B 活躍參數與約 1M-token 的上下文視窗,加上開放權重與原生多模態能力。其託管 API 標價較高,為輸入/輸出每百萬 tokens $3/$15,但快取命中僅 $0.30/百萬 tokens。
重點:若需具成本效益的託管代理 API,選擇 Grok 4.6;若需 1M 上下文、開放權重與基礎設施控制,選擇 Kimi K3。用於程式開發時,請在你自己的程式庫上測試兩者,因為廠商發佈的基準版本與測試框架不同。
Key Takeaways
- Grok 4.6 於 2026 年 8 月 12 日發佈,特別強調長時間運行代理、程式碼庫工作、知識工作與更具野心的互動或視覺化專案。
- Kimi K3 是 Moonshot AI 的2.8 兆參數開放權重旗艦,具備 Kimi Delta Attention、Attention Residuals、原生視覺與約 1M-token 上下文視窗。
- 獨立整體智慧幾乎持平:Grok 4.6 為 61,Kimi K3 為 60。
- Grok 4.6 的標稱 token 價格更低:輸入/輸出分別為 $2/$6,而 Kimi K3 為 $3/$15。
- Kimi K3 提供約兩倍的上下文容量與開放權重;Grok 4.6 屬專有,但在多項獨立代理評估中更具輪次與成本效率。
Grok 4.6 vs Kimi K3: Quick Comparison
| 規格 | Grok 4.6 | Kimi K3 |
|---|---|---|
| 開發者 | SpaceXAI / xAI | Moonshot AI / Kimi |
| 發佈日期 | August 12, 2026 | July 16, 2026 |
| Model ID | grok-4.6 | kimi-k3 |
| 架構 | 未公開 | MoE; KDA + AttnRes + Stable LatentMoE |
| 總參數 | 未公開 | 2.8T |
| 活躍參數 | 未公開 | 104B |
| 專家數 | 未公開 | 總計 896;每 token 啟用 16 |
| 上下文視窗 | 500,000 tokens | 1,048,576/約 1M tokens |
| 輸入 / 輸出 | 文字 + 圖像 → 文字 | 文字 + 圖像 → 文字 |
| 推理 | 可配置 | 常開;low / high / max |
| 函式 / 工具使用 | 函式呼叫 + 結構化輸出 | ToolCalls, tool_choice, dynamic tool loading |
| 開放權重 | 否 | 是 |
| AA Intelligence Index | 61 | 60 |
| 官方輸入 / 輸出價格 | $2 / $6 per MTok | $3 / $15 per MTok |
| 最佳適用 | 託管代理、程式開發、知識工作 | 長上下文、開放權重部署、程式 + 視覺推理 |
什麼是 Grok 4.6?
Grok 4.6 是 SpaceXAI 面向程式開發、代理型任務與知識工作的前沿模型。該公司稱此次發佈圍繞長時間運行的代理與更具野心的互動與視覺化工作打造,而不僅是靜態基準的刷新。實務上,這意味著模型旨在跨多個步驟持續執行任務:研究主題、導航程式碼庫、分析資訊、調用工具,並迭代產出完整的應用或工作成果。
與 Grok 4.5 的變化是什麼?
SpaceXAI 報告進行了更長的補充訓練,使用經策展的模型生成推理資料、高階技術概念、高品質工程資料,以及改進的最佳化器與訓練配方。團隊接著用 Grok 4.5 重新生成多個推理與代理框架的 SFT 軌跡,篩除問題軌跡,並在涵蓋一般程式開發、核心最佳化、網頁開發、CAD 與知識工作的環境中應用代理型強化學習。
實際結果是,模型不僅分數更高,還在更長的軌跡上展現更多自我測試與驗證。對代理來說,這種行為很重要,因為當模型被允許編輯檔案、調用工具或在沒有持續人工介入的情況下執行多步計畫時,小錯誤的成本會被放大。
Grok 4.6 規格
| 屬性 | Grok 4.6 |
|---|---|
| 上下文 | 500,000 tokens |
| 模態 | 文字與圖像輸入;文字輸出 |
| 推理 | 可配置推理 |
| 原生 API 能力 | 函式呼叫與結構化輸出 |
| 知識截止 | February 1, 2026 |
| 短上下文定價 | 每百萬 tokens 輸入 $2;快取 $0.50;輸出 $6 |
| 長上下文門檻 | ≥200K 提示 tokens;$4 / $1 / $12 |
什麼是 Kimi K3?
Kimi K3 是 Moonshot AI 的旗艦開放權重多模態代理型模型。它結合 2.8 兆總參數、1M-token 上下文視窗與原生視覺,定位於長期程式開發、端到端知識工作、推理與以視覺為基礎的软件任務。
與 Grok 4.6 不同,Kimi K3 對外公開其模型權重。當前官方模型卡指出推理期間的活躍參數為 104B,因此其運算路徑遠小於 2.8T 的完整參數數量,即便部署完整模型仍需要可觀的基礎設施。
KDA、AttnRes 與更稀疏的 MoE
架構是 K3 最大的差異化之一。Moonshot 表示 Kimi Delta Attention (KDA) 與 Attention Residuals (AttnRes) 旨在改善長序列與深層模型中的資訊流。Stable LatentMoE 提升稀疏性,使每個 token 啟用 896 位專家中的 16 位。配合訓練與資料配方的變更,Moonshot 報告相較 Kimi K2,整體擴展效率約提升 2.5 倍。
Kimi K3 規格
| 屬性 | Kimi K3 |
|---|---|
| 總參數 / 活躍參數 | 2.8T / 104B |
| 架構 | MoE,含 KDA + AttnRes + Stable LatentMoE |
| 專家數 | 896;每 token 啟用 16 |
| 上下文 | 1M tokens |
| 視覺 | 原生視覺理解 |
| 推理 | 預設啟用;low / high / max |
| 工具 | ToolCalls、tool_choice 約束、dynamic tool loading |
| 開放權重 | 可於 Hugging Face 取得 |
| 官方定價 | $0.30 快取命中 / 輸入 $3 / 輸出 $15 per MTok |
Grok 4.6 vs Kimi K3: 基準比較
最乾淨的直接比較是獨立的 Artificial Analysis Intelligence Index,因為兩者都在相同框架下評估。當前分數為 Grok 4.6 的 61(high)與 Kimi K3 的 60(max)。1 分的差距不足以支持誰「世代領先」的結論。更有用的問題是各自在哪些領域拿到分數。
| 獨立指標 | Grok 4.6 | Kimi K3 | 優勢 |
|---|---|---|---|
| Artificial Analysis Intelligence Index | 61 | 60 | Grok 4.6 高 1 分 |
| 輸出速度 | 65.8 tok/s | 40.7 tok/s | Grok 4.6 |
| 首個 token 時間 | ~32.3 s | 3.27 s | Kimi K3 |
| 上下文視窗 | 500K | ~1.05M | Kimi K3 |
程式開發表現
SpaceXAI 發佈了多項 Grok 4.6 的程式與軟體工程結果:CursorBench 3.2 為 69.9%、DeepSWE 1.1 為 65.9%、FrontierCode 1.1 Extended 為 61.3%、APEX-SWE 為 56.4%,以及 Terminal-Bench 3.0 為 26.0%。這些意義重大,因為它們涵蓋的是儲存庫編輯、代理型軟體工程與終端機工作,而非僅是程式補全瑣碎題。
| Grok 4.6 廠商報告的程式基準 | 分數 |
|---|---|
| CursorBench 3.2 | 69.9% |
| DeepSWE 1.1 | 65.9% |
| FrontierCode 1.1 Extended | 61.3% |
| APEX-SWE | 56.4% |
| Terminal-Bench 3.0 | 26.0% |
對於 Kimi K3,Moonshot 發佈的是不同但廣泛的程式測試組合。其官方發佈材料報告 DeepSWE 67.5、Terminal-Bench 2.1 取得 88.3、FrontierSWE 81.2、ProgramBench 77.8 與 SWE Marathon 42.0。重要的前提是 Terminal-Bench 2.1 與 3.0 是不同版本,且 FrontierSWE 與 FrontierCode 不是同一評估。僅憑原始數字不應視為同類比較的勝負。

代理型與知識型工作
Grok 4.6 在代理型工作上顯得最強。SpaceXAI 報告 GDPVal-AA v2 的 Elo 為 1753、APEX-Agents 為 57.5%,以及 AA-Briefcase 的 Elo 為 1577。Artificial Analysis 獨立強調了相同模式:Grok 4.6 的最大提升在長期、工具使用的工作,而非僅是靜態推理。
Kimi K3 也瞄準知識工作代理。Moonshot 的發佈套件顯示其在 BrowseComp、GDPval-AA v2、JobBench、SpreadsheetBench 2 與視覺代理評估上有強勁表現。對開發者更重要的是,Kimi API 提供 tool choice 約束與動態工具載入,在代理必須使用企業系統或在回答前檢索事實時,這是實用的控制手段。

多模態與視覺推理
Kimi K3 在架構層面有更清晰的多模態敘事:Moonshot 描述其原生視覺能力,並特別展示在遊戲開發、前端工程與 CAD 中的「vision in the loop」,模型可檢視視覺回饋並修訂程式碼。
Grok 4.6 也接受文字與圖像輸入,SpaceXAI 表示該模型在視覺與互動專案上的初次產出較 Grok 4.5 更強。差異較少在於兩者是否能看圖,而更多在佈署哲學:Kimi 釋出開放的多模態模型,而 Grok 則將視覺理解封裝在受管前沿 API 與代理生態系中。
上下文視窗:500K vs 1M
Grok 4.6 支援 500,000 tokens,而 Kimi K3 支援約 1 百萬 tokens。當工作負載確實需要在一次請求中超過 500K tokens(例如極大程式庫、多本書的研究集,或極長的代理軌跡)時,Kimi 是明顯選擇。
然而,上下文大小是容量,並非檢索或推理品質的保證。對生產系統而言,請在實際的長上下文失敗模式上測試模型:跨檔案依賴追蹤、遠距事實檢索、矛盾偵測與指令持續性。檢索增強生成仍可能比每次傳送一百萬 tokens 更便宜且可控。
速度與延遲
Artificial Analysis 目前測得 Grok 4.6 為 每秒 65.8 輸出 tokens,Kimi K3 為 每秒 40.7 tokens。一旦開始生成,Grok 在此測量中明顯更快。但首個 token 的模式相反:Kimi K3 的測得 TTFT 為 3.27 秒,而 Grok 4.6 當前供應商的測量在開始串流前更慢。
這形成了有用的產品區隔。對互動式聊天或 IDE 體驗而言,較快的首字可讓 Kimi 感覺更即時,即便完整答案更久。對長生成與代理運行,Grok 較高的生成吞吐可縮短請求尾端。供應商、區域、推理力度、快取狀態與請求大小都可能改變這些數字,應視為當前快照而非永久屬性。
Grok 4.6 vs Kimi K3: API 定價
在標準上下文長度下,Grok 4.6 的費率為每百萬輸入 tokens $2、每百萬快取 tokens $0.50、每百萬輸出 tokens $6。當提示達到或超過 200K tokens 時,xAI 將整個請求按長上下文費率計費:輸入 $4、快取 $1、輸出 $12(皆為每百萬 tokens)。
Kimi 在 1M 上下文視窗內使用統一的隨用隨付定價。Kimi API 列出每百萬快取命中 tokens $0.30,每百萬輸入 tokens $3,以及每百萬輸出 tokens $15。這意味著 Kimi 在快取命中時更便宜,但在全新輸出 tokens 上昂貴得多;當 Grok 請求跨越 200K 長上下文門檻時,Grok 的價格優勢會縮小。

每 1M tokens 的官方標稱 API 價格。Grok 的長上下文請求(≥200K 提示 tokens)使用圖表未顯示的更高費率。 來源:SpaceXAI 與 Kimi API 定價
| 價格 / 每 1M tokens | Grok 4.6 | Kimi K3 |
|---|---|---|
| 官方短上下文輸入 | $2.00 | $3.00 |
| 官方快取命中 | $0.50 | $0.30 |
| 官方輸出 | $6.00 | $15.00 |
| 長上下文定價 | ≥200K: $4 / $1 / $12 | 1M 上下文內均一價格 |
| CometAPI 輸入 | $1.60 | $2.40 |
| CometAPI 輸出 | $4.80 | $12.00 |
在 CometAPI 上,Grok 4.6 目前列為每百萬輸入 tokens $1.60、輸出 $4.80,而 Kimi K3 列為輸入 $2.40、輸出 $12。兩者都較其供應商在 CometAPI 模型頁面所示的官方輸入/輸出價格低 20%。
開放權重 vs 專有模型
Kimi K3 是開放權重模型,可下載權重。這使研究、精細的基礎設施控制、私有推理架構與透過第三方推理棧部署成為可能。這不代表 K3 輕量:2.8T 參數的模型即使具有 MoE 稀疏性與低精度格式,仍是嚴肅的系統工程專案。
Grok 4.6 是專有模型。其架構與參數量未公開,開發者以受管服務方式存取。取捨是操作簡單性:你無需建立推理叢集、管理模型權重或最佳化核心即可獲得前沿級代理表現。
優勢與取捨
| 模型 | 優勢 | 取捨 |
|---|---|---|
| Grok 4.6 | 較低託管 API 價格;AA 智慧 61;測得生成更快;長期代理結果強;整合 xAI 工具棧 | 500K 上下文;權重封閉;長上下文定價翻倍;測得首個 token 較慢 |
| Kimi K3 | ~1M 上下文;開放權重;2.8T MoE;原生多模態;強大的程式/代理套件;極低快取命中價格 | 較高輸出價格;測得生成較慢;完整自我託管需沉重的基礎設施 |
Grok 4.6 vs Kimi K3:該如何選擇?
| 使用情境 | 推薦 | 原因 |
|---|---|---|
| 預設前沿 API | Grok 4.6 | 價格較低且獨立智慧略佔優 |
| 長時間知識工作代理 | Grok 4.6 | 來自 GDPVal-AA 與 AA-Briefcase 的最強證據 |
| 儲存庫級程式開發 | 兩者皆測 | 兩者皆為長期程式開發設計;基準套件不同 |
| 提示 >500K tokens | Kimi K3 | 約 1M 上下文 |
| 開放權重研究 | Kimi K3 | 權重與架構可用 |
| 私有/自管推理 | Kimi K3 | 開放權重允許自定部署 |
| 低快取命中成本 | Kimi K3 | $0.30/MTok 快取命中 |
| 較低全新輸出 token 成本 | Grok 4.6 | 標準上下文下 $6/MTok 對比 $15/MTok |
| 更快的首個可見回應 | Kimi K3 | 測得 TTFT 低得多 |
| 更快的長篇生成 | Grok 4.6 | 測得輸出 tokens/s 更高 |
| 視覺程式/CAD/遊戲工作流程 | Kimi K3 | 原生視覺 + 官方「vision in the loop」重點 |
整體建議:Grok 4.6 是大多數代理開發者更強的預設託管 API。當 1M 上下文、開放權重與部署控制是需求而非可選時,Kimi K3 是更具彈性的前沿模型。
如何透過 CometAPI 存取 Grok 4.6 與 Kimi K3
兩個模型都已在 CometAPI 上線。Grok 4.6 模型頁列出模型 ID grok-4.6 並支援 Chat Completions / Responses 式存取,而 Kimi K3 模型頁透過統一的 CometAPI 端點暴露 kimi-k3。這讓 A/B 測試更容易,因為你可以在保持驗證與大多數應用管線不變的情況下切換模型 ID。
from openai import OpenAI
import os
client = OpenAI(
base_url="https://api.cometapi.com/v1",
api_key=os.environ["COMETAPI_KEY"],
)
for model in ["grok-4.6", "kimi-k3"]:
response = client.chat.completions.create(
model=model,
messages=[
{"role": "user", "content": "Review this repository bug and propose a tested fix."}
],
)
print(model, response.choices[0].message.content)
對生產品評估,請保持提示、工具、儲存庫快照與成功標準一致。除了答案品質,也要追蹤工具呼叫成功率、回合數、總輸入/輸出 tokens、延遲,以及對失敗工具呼叫的恢復能力。這比單一基準分數更能預測真實代理成本。
結論
Grok 4.6 與 Kimi K3 比較最重要的結果是,它們的頂層智慧遠比產品設計更接近。獨立評估目前給出 61 對 60,但周邊經濟性與部署選擇差異甚大。
Grok 4.6 被優化為受管前沿服務:較低的新鮮 token 定價、強勁的代理型基準、較快的測得生成與成熟的工具/API 路徑。Kimi K3 被優化為靈活性:1M 上下文、2.8T MoE 規模、原生多模態與開放權重。
對多數只需要最佳預設託管模型以用於程式開發與長時間代理的開發者而言,Grok 4.6 是更安全的起點。若你的系統依賴 >500K 上下文、開放權重部署、視覺程式或對推理棧的控制,儘管託管 token 價格較高,Kimi K3 仍可能是更好的架構選擇。
FAQs
Grok 4.6 比 Kimi K3 更聰明嗎?
在當前的 Artificial Analysis Intelligence Index 上,Grok 4.6 得分 61,而 Kimi K3 為 60。這是微幅領先,非決定性差距。具體任務表現會因工作負載而逆轉。
哪個更適合程式開發?
兩者都是可信的程式模型。Grok 4.6 目前在代理型程式開發上表現強且託管定價較低;Kimi K3 提供更大的上下文視窗、開放權重與強勁的儲存庫/視覺程式結果。請用你自己的程式庫基準測試,因為廠商報告的基準版本不同。
哪個模型的上下文視窗更大?
Kimi K3 支援約 1M tokens,約為 Grok 4.6 的 500K token 上下文的兩倍。
哪個更便宜?
在標準上下文的新鮮 tokens 上,Grok 4.6 更便宜:輸入 $2/輸出 $6 每 MTok,而 Kimi K3 為 $3/$15。Kimi 的快取命中費率為 $0.30/MTok 更低,而 Grok 在提示達到 200K tokens 後適用更高費率。
我可以自我託管 Kimi K3 嗎?
Kimi K3 的開放權重可於 Hugging Face 取得,因此可自管部署。完整的 2.8T 模型仍極為龐大,需要嚴謹的多節點或專業推理基礎設施才能達到實用效能。
我可以自我託管 Grok 4.6 嗎?
沒有公開的 Grok 4.6 權重。Grok 4.6 以 SpaceXAI 與合作夥伴 API 提供的專有受管模型形式交付。
我可以透過同一個 API 存取兩者嗎?
可以。CometAPI 目前同時列出 Grok 4.6 與 Kimi K3,讓開發者能在統一的 API 與計費層後進行比較。
