**TLDR:**Moonshot AI 於 2026 年 7 月 16 日發佈 Kimi K3——劃時代的 2.8 兆參數開放權重模型(3T 級別首發),具備原生多模態、1-million-token 上下文,並在程式設計、代理式任務、前端開發與知識型工作上展現前沿表現,與 Claude Fable 5、GPT-5.6 Sol 等頂級閉源模型相抗衡甚至更勝。
重點整理
- 規模與創新:2.8T 參數,MoE 架構每個 token 啟用 16/896 個 experts,Kimi Delta Attention (KDA)、Attention Residuals,相較 K2 約 2.5x 擴展效率,Kimi K3 - Kimi API Platform
- 表現:Artificial Analysis Intelligence Index 約 57(前四名,領先 Claude Opus 4.8),Frontend Code Arena 名列前茅,Terminal-Bench(88.3%)、BrowseComp(91.2%)、GPQA-Diamond(93.5%)表現強勁。整體略落後 Fable 5/Sol,但超越多數其他模型;在 Arena.ai Frontend Code Arena 排名第 1(1,679 Elo,擊敗 Fable 5),參見 Arena 在 X 上的貼文 與 Tom's Hardware 的報導。
- 能力:原生視覺/影片,1M 上下文可覆蓋超大倉庫/程式碼庫,代理式編碼、3D 推理、影片編輯、研究型儀表板。
- 存取:可即時於 kimi.com 使用、API(模型 kimi-k3,接入指南);開放權重即將釋出。Moonshot 因需求激增暫停新的 Kimi K3 訂閱。可透過 CometAPI 輕鬆整合。
- 價值:每任務成本更低(某些評測約 $0.94),拒答更少,特別適合程式與 Vision 工作流。
Kimi K3 技術部落格將 Kimi K3 描述為「Open Frontier Intelligence,Kimi K3 標誌著 AI 民主化的關鍵時刻。當像 Moonshot 這樣的中國實驗室在算力受限下持續突破,這個開放模型正挑戰美國閉源前沿的主導地位並賦能全球開發者。」
什麼是 Kimi K3?來自 Moonshot AI 的開放 3T 級模型
Moonshot AI(北京)於 2026 年 7 月 16 日推出旗艦模型 Kimi K3。官方定位為「約 3 兆參數級別中的首個開放模型」,採用稀疏 Mixture-of-Experts(MoE)架構,總參數 2.8 兆,每個 token 僅啟用 896 位專家中的 16 位,平衡超大規模與效率。
其承襲 Kimi K2 系列(K2.5、K2.6 等),在程式設計與多模態已具口碑。K3 引入架構創新:Kimi Delta Attention (KDA) 與 Attention Residuals (AttnRes),以及 Stable LatentMoE、量化感知訓練(自 SFT 階段起採用 MXFP4 權重、MXFP8 啟動)。這些帶來約 2.5x 更佳擴展效率,並相較前代可達 6.3x 更快解碼。
關鍵規格(Kimi K3 Technical Specifications):
- 參數:2.8T(稀疏 MoE)
- 上下文視窗:1,048,576 tokens(約 1M)
- 模態:原生文字 + 影像 + 影片理解;文字輸出
- 最大片段輸出:預設 131k tokens,可上探至上下文上限
- 推理:發佈時預設 Max effort;之後將提供較低/較高模式
- 開放權重:承諾於 2026 年 7 月 27 日前釋出(參照 K2 的修改版 MIT 授權)
K3 主打長期任務——不只是快速答覆,而是能完成含視覺回饋的複雜工程、研究或代理式工作流程(「Vision in the Loop」)。展示案例包括自動建構 GPU 編譯器(可與 Triton 匹敵)、以 45nm 製程進行晶片設計,以及快速的天體物理研究。
需求已對容量造成壓力
該模型的早期反響強勁到影響可用容量。Moonshot 在 X 上表示,過去 48 小時的需求已逼近現有 GPU 上限,將暫時停止新訂閱,同步擴充容量。Business Insider 亦報導了同一暫停消息,並指出既有訂閱不受影響。
這對生產規劃具有意義。即便模型很強,若需求超過算力也會影響可用性。評估 Kimi K3 的團隊應避免單一供應商依賴、監控延遲與錯誤率,並盡可能透過 CometAPI 之類的統一供應層進行回退路由。
程式設計基準:Kimi K3 最強之處
Kimi K3 的程式輪廓是開發者關注的核心原因。它在 Terminal-Bench 2.1 與 GPT-5.6 Sol 幾乎打成平手,在 Program Bench 略勝 GPT-5.6 Sol 與 Claude Fable 5,並在 FrontierSWE 上領先 GPT-5.6 Sol。在 OpenLM 的表格中,SWE Marathon 亦優於對比模型。
Arena 的前端結果提供了另一個實用信號。Arena 報告 Kimi K3 在 Frontend Code Arena 拿到 1679 分,領先 Claude Fable 5。此基準重要之處在於前端工作常由人類偏好而非單元測試評判。能從提示產出乾淨、視覺一致 UI 的程式助手,對產品團隊、代理商、SaaS 建設者與內部工具都很有價值。
綜合排行榜
- Artificial Analysis AI Leaderboard:初登場即第 3。Intelligence Index 分數具競爭力(如部分評測約 57.1)。
- 私有長期知識型工作評測:Elo 1547(較 K2.6 +732),僅次於 Fable 5。
程式與代理式基準(自報與獨立)
K3 在此尤為突出,依靠規模與架構,在持續代理式表現中占優。
- Frontend Code Arena(Arena.ai):第 1,1,679 分,領先 Fable 5 與 GPT-5.6 Sol。於盲測開發者偏好中,網頁開發表現出色。
- DeepSWE:67.3–67.5(強勁,使用 KimiCode 測 harness)
- Program Bench:第 1,77.8
- SWE Marathon:第 1,42.0(部分 harness)
- Terminal-Bench 2.1:具競爭力,接近 GPT-5.6 Sol
視覺與多模態
原生訓練(非外掛)帶來穩健結果:
- MMMU-Pro:81.6%
- MathVision:部分報告為高 90 段位
- OmniDocBench:91.1%(領先)
支援螢幕截圖、圖表、影片,用於 UI 微調或遊戲開發等閉環任務。
比較表:Kimi K3 vs. 領先模型(約略/匯編自多方報告;未註明時為 Max Effort)
| 基準 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | 備註/來源 |
|---|---|---|---|---|
| Frontend Code Arena | 1,679(#1) | 較低 | 較低 | Arena.ai |
| DeepSWE | 67.3–67.5 | 具競爭力 | - | Moonshot/KimiCode |
| Program Bench | 77.8(#1) | - | 接近 | Vals.ai |
| Intelligence Index (AA) | 約 57.1 | 約 59.9 | 約 58.9 | Artificial Analysis |
| Long-Horizon Elo | 1547 | 更高 | - | Internal Moonshot |
| 每任務成本(評測) | 約 $0.94 | 較高 | 較高 | 獨立測試 |
資料來源:Moonshot 的技術部落格、獨立排行榜與分析。結果會受測試框架/努力程度影響;請隨時核對最新數據。
K3 在敏感主題的拒答率較低,且於代理式流程中一致性強。獨立測試(如 YouTube 評測、Vals AI)亦確認其為真實世界程式場景最強的開放模型之一。
Kimi K3 能做什麼?在程式、視覺與更多場景的能力
程式與代理式工程
K3 能維持長時段會話且需最少監督:可導航龐大倉庫、使用工具、透過螢幕截圖除錯(「vision in the loop」)。
範例:
- 核心優化與編譯器開發:自零打造 MiniTriton(類 Triton 編譯器),可與優化堆疊匹敵。GPU 核心優化與 Fable 5 競爭。
- 遊戲開發:將構想/圖像/影片轉化為可遊玩的 3D/多人作品,並進行迭代微調。
- 晶片設計:自動連續 48 小時完成 nano 級晶片設計。
- 前端:在網頁應用與全端任務的排行榜上名列前茅。
視覺與多模態
原生圖像/影片理解可支援:
- 影片編輯:從 56 段素材自編宣傳片(選片、剪輯、同步、修訂)——以分鐘完成需時數小時的工作。
- 3D 推理、動態圖形、互動式儀表板。
- 透過螢幕截圖進行程式迭代的「vision in the loop」。
Kimi API 文件顯示以 base64 data URLs 傳入影像,影片則透過上傳檔案並以 ms:// 參照。同時提醒不支援公開影像 URL 作為 vision 輸入,因此開發者應傳送 base64 或上傳檔案參照,並將訊息內容組織為物件陣列。這點對實作很重要:不要將混合了影像與文字的訊息序列化為單一純文字字串。
知識型工作與研究
對企業而言,這比一般聊天機器人更有價值。該模型專為「代理式」工作設計,能維持計畫、呼叫工具、處理中間結果並產出最終成果。範例包含市調報告、資料清理助手、合規摘要、客服知識庫維護與內部工程 Copilot。
- 產出顧問級報告、互動視覺化、儀表板(例如從數千來源生成 42 年 ASIC 產業分析)。
- 科學流程:重現天體物理關係,並以子代理分析重力波。
- 透過 Kimi Work 的小工具/儀表板進行持續、資料驅動的呈現。
K3 將文獻與可執行程式碼相連,快速產出具出版水準的成果。
Kimi K3 與其他前沿模型:實務比較
| 模型 | 最佳適配場景 | 優勢 | 注意事項 | CometAPI 建議 |
|---|---|---|---|---|
| Kimi K3 | 長上下文程式、知識型工作、代理、視覺推理 | 2.8T MoE 規模、1M 上下文、強勁的程式與代理式基準、開放權重路線圖 | 發佈周容量壓力、對思考歷史的敏感性、視覺支援可能因接入路徑而異 | 作為旗艦程式與長上下文模型優先測試 |
| GPT-5.6 Sol | 困難推理、程式、研究、廣泛生產任務 | 整體基準很強、工具成熟 | 多數路徑價格更高 | 作為對照與升級模型使用 |
| Claude Fable 5 | 寫作、程式、代理式工作流、偏好導向任務 | 優質使用體驗與廣泛前沿表現 | 成本較高,某些任務可能出現政策退回 | 適合導向使用者的代理與寫作密集型應用做比較 |
| Claude Opus 4.8 | 深度推理與可靠專業助手 | 穩定的高端助手行為 | 較新旗艦版本發布後,相對偏舊 | 作為回退或基準基線 |
| GLM-5.2 | 成本敏感的開放模型評估 | 作為開放替代具競爭力 | 在多項 K3 對比中較弱 | 納入成本/效能路由測試 |
如何存取 Kimi K3:逐步指南
如何存取 Kimi K3
1. 透過 Kimi 產品使用 Kimi K3
非開發者最簡單的路徑是使用 Kimi 的消費與生產力產品:Kimi 網頁端、App、Kimi Work、Kimi Code。這是最快體驗其寫作、程式、研究與偏向 UI 行為的方式,而無需先做整合。7 月 20 日報導的暫停新訂閱意味著存取情況可能變動,規劃團隊部署前請先查詢最新產品頁資訊。
2. 透過 Kimi API Platform 使用 Kimi K3
開發者可使用 OpenAI 風格的用戶端呼叫 Kimi K3。Moonshot 文件列出:
- base URL:
https://api.moonshot.ai/v1 - model ID:
kimi-k3 - 範例中的環境變數:
MOONSHOT_API_KEY - Python SDK 要求:OpenAI SDK 1.0 或更新版
基本 Python 範例:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "user", "content": "Introduce Kimi K3 in one sentence."}
],
)
print(completion.choices[0].message.content)
Kimi K3 預設啟用思考模式,並支援 reasoning_effort 的 low、high、max 值,預設為 max。API 支援串流、嚴格 JSON 結構化輸出、Partial Mode、工具呼叫、動態工具載入、自動上下文快取,以及透過 Formula 的官方工具整合。文件同時列出若干重要上限:max_completion_tokens 預設 131,072,可設定至 1,048,576;temperature 與 top-p 為固定;在多輪與工具呼叫工作流中,開發者應回傳完整的 assistant 訊息;且網路搜尋正在更新,近期不建議用於生產。
3. 透過 CometAPI 使用 Kimi K3
對許多團隊而言,CometAPI 更實用,因其提供多家模型供應商的統一 API 層。CometAPI 的 Kimi K3 頁面顯示該模型已上線,包含:
- model ID:
kimi-k3 - provider:Moonshot AI
- 上下文視窗:最高 1,000,000 tokens
- CometAPI 價格:每 1M tokens,輸入 $2.4、輸出 $12
- 官方標價:每 1M tokens,輸入 $3、輸出 $15
- endpoint:
/v1/chat/completions - base URL:
https://api.cometapi.com/v1
CometAPI Python 範例:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
max_retries=0,
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "system",
"content": "You are a careful software engineering assistant.",
},
{
"role": "user",
"content": "Review this migration plan and identify the riskiest steps.",
},
],
max_completion_tokens=1024,
)
print(completion.choices[0].message.content)
若你的應用已使用 OpenAI SDK,CometAPI 的 quickstart 建議僅變更兩處設定:將 base_url 設為 https://api.cometapi.com/v1,並改用 COMETAPI_KEY 取代先前供應商金鑰。之後在 model 欄位傳入 CometAPI 的模型 ID 即可。
4. 權重釋出後以開放權重方式使用 Kimi K3
Moonshot 稱將於 2026 年 7 月 27 日前釋出完整 Kimi K3 權重。釋出後,研究人員、基礎設施團隊與進階企業用戶可評估自建、優化或私有部署。對多數公司而言,核心問題會是經濟性:雖然模型開放,但要服務一個 2.8T 的 MoE 系統,仍需嚴肅的 GPU 基礎設施、推理工程與營運監控。
最終結論
Kimi K3 可說是 2026 年迄今最重要的模型發佈之一。它結合了超大規模、認真的開放權重策略、100 萬 token 的上下文視窗、原生視覺理解,以及位居當前程式與代理式系統前列的基準表現。它並未抹去對 GPT、Claude、Gemini、DeepSeek、Qwen 或其他模型的需求,但確實為最棘手的長上下文工作流程提供了可信的新選擇。
立即在 kimi.com 或透過 CometAPI 快速整合。善用其在程式與視覺上的強項開始實驗——結果不言自明。
