GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
ai-model/CometAPI 研究

什麼是 Kimi K3:2026 年的基準測試、能力與存取指南

Kimi K3 指南:它是什麼、基準測試、API 存取、視覺、程式設計與 CometAPI

CometAPI
AnnaAI 模型與 API 研究團隊
更新於 Sep 3, 2026 5 分鐘閱讀
什麼是 Kimi K3:2026 年的基準測試、能力與存取指南
套用此模式

發出第一個 API 請求。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

**TLDR:**Moonshot AI 於 2026 年 7 月 16 日發佈 Kimi K3——劃時代的 2.8 兆參數開放權重模型(3T 級別首發),具備原生多模態、1-million-token 上下文,並在程式設計、代理式任務、前端開發與知識型工作上展現前沿表現,與 Claude Fable 5、GPT-5.6 Sol 等頂級閉源模型相抗衡甚至更勝。

重點整理

  • 規模與創新:2.8T 參數,MoE 架構每個 token 啟用 16/896 個 experts,Kimi Delta Attention (KDA)、Attention Residuals,相較 K2 約 2.5x 擴展效率,Kimi K3 - Kimi API Platform
  • 表現:Artificial Analysis Intelligence Index 約 57(前四名,領先 Claude Opus 4.8),Frontend Code Arena 名列前茅,Terminal-Bench(88.3%)、BrowseComp(91.2%)、GPQA-Diamond(93.5%)表現強勁。整體略落後 Fable 5/Sol,但超越多數其他模型;在 Arena.ai Frontend Code Arena 排名第 1(1,679 Elo,擊敗 Fable 5),參見 Arena 在 X 上的貼文Tom's Hardware 的報導
  • 能力:原生視覺/影片,1M 上下文可覆蓋超大倉庫/程式碼庫,代理式編碼、3D 推理、影片編輯、研究型儀表板。
  • 存取:可即時於 kimi.com 使用、API(模型 kimi-k3,接入指南);開放權重即將釋出。Moonshot 因需求激增暫停新的 Kimi K3 訂閱。可透過 CometAPI 輕鬆整合。
  • 價值:每任務成本更低(某些評測約 $0.94),拒答更少,特別適合程式與 Vision 工作流。

Kimi K3 技術部落格將 Kimi K3 描述為「Open Frontier Intelligence,Kimi K3 標誌著 AI 民主化的關鍵時刻。當像 Moonshot 這樣的中國實驗室在算力受限下持續突破,這個開放模型正挑戰美國閉源前沿的主導地位並賦能全球開發者。」

什麼是 Kimi K3?來自 Moonshot AI 的開放 3T 級模型

Moonshot AI(北京)於 2026 年 7 月 16 日推出旗艦模型 Kimi K3。官方定位為「約 3 兆參數級別中的首個開放模型」,採用稀疏 Mixture-of-Experts(MoE)架構,總參數 2.8 兆,每個 token 僅啟用 896 位專家中的 16 位,平衡超大規模與效率。

其承襲 Kimi K2 系列(K2.5、K2.6 等),在程式設計與多模態已具口碑。K3 引入架構創新:Kimi Delta Attention (KDA) 與 Attention Residuals (AttnRes),以及 Stable LatentMoE、量化感知訓練(自 SFT 階段起採用 MXFP4 權重、MXFP8 啟動)。這些帶來約 2.5x 更佳擴展效率,並相較前代可達 6.3x 更快解碼。

關鍵規格(Kimi K3 Technical Specifications):

  • 參數:2.8T(稀疏 MoE)
  • 上下文視窗:1,048,576 tokens(約 1M)
  • 模態:原生文字 + 影像 + 影片理解;文字輸出
  • 最大片段輸出:預設 131k tokens,可上探至上下文上限
  • 推理:發佈時預設 Max effort;之後將提供較低/較高模式
  • 開放權重:承諾於 2026 年 7 月 27 日前釋出(參照 K2 的修改版 MIT 授權)

K3 主打長期任務——不只是快速答覆,而是能完成含視覺回饋的複雜工程、研究或代理式工作流程(「Vision in the Loop」)。展示案例包括自動建構 GPU 編譯器(可與 Triton 匹敵)、以 45nm 製程進行晶片設計,以及快速的天體物理研究。

需求已對容量造成壓力

該模型的早期反響強勁到影響可用容量。Moonshot 在 X 上表示,過去 48 小時的需求已逼近現有 GPU 上限,將暫時停止新訂閱,同步擴充容量。Business Insider 亦報導了同一暫停消息,並指出既有訂閱不受影響。

這對生產規劃具有意義。即便模型很強,若需求超過算力也會影響可用性。評估 Kimi K3 的團隊應避免單一供應商依賴、監控延遲與錯誤率,並盡可能透過 CometAPI 之類的統一供應層進行回退路由。

程式設計基準:Kimi K3 最強之處

Kimi K3 的程式輪廓是開發者關注的核心原因。它在 Terminal-Bench 2.1 與 GPT-5.6 Sol 幾乎打成平手,在 Program Bench 略勝 GPT-5.6 Sol 與 Claude Fable 5,並在 FrontierSWE 上領先 GPT-5.6 Sol。在 OpenLM 的表格中,SWE Marathon 亦優於對比模型。

Arena 的前端結果提供了另一個實用信號。Arena 報告 Kimi K3 在 Frontend Code Arena 拿到 1679 分,領先 Claude Fable 5。此基準重要之處在於前端工作常由人類偏好而非單元測試評判。能從提示產出乾淨、視覺一致 UI 的程式助手,對產品團隊、代理商、SaaS 建設者與內部工具都很有價值。

綜合排行榜

  • Artificial Analysis AI Leaderboard:初登場即第 3。Intelligence Index 分數具競爭力(如部分評測約 57.1)。
  • 私有長期知識型工作評測:Elo 1547(較 K2.6 +732),僅次於 Fable 5。

程式與代理式基準(自報與獨立)

K3 在此尤為突出,依靠規模與架構,在持續代理式表現中占優。

  • Frontend Code Arena(Arena.ai):第 1,1,679 分,領先 Fable 5 與 GPT-5.6 Sol。於盲測開發者偏好中,網頁開發表現出色。
  • DeepSWE:67.3–67.5(強勁,使用 KimiCode 測 harness)
  • Program Bench:第 1,77.8
  • SWE Marathon:第 1,42.0(部分 harness)
  • Terminal-Bench 2.1:具競爭力,接近 GPT-5.6 Sol

視覺與多模態

原生訓練(非外掛)帶來穩健結果:

  • MMMU-Pro:81.6%
  • MathVision:部分報告為高 90 段位
  • OmniDocBench:91.1%(領先)

支援螢幕截圖、圖表、影片,用於 UI 微調或遊戲開發等閉環任務。

比較表:Kimi K3 vs. 領先模型(約略/匯編自多方報告;未註明時為 Max Effort)

基準Kimi K3Claude Fable 5GPT-5.6 Sol備註/來源
Frontend Code Arena1,679(#1)較低較低Arena.ai
DeepSWE67.3–67.5具競爭力-Moonshot/KimiCode
Program Bench77.8(#1)-接近Vals.ai
Intelligence Index (AA)約 57.1約 59.9約 58.9Artificial Analysis
Long-Horizon Elo1547更高-Internal Moonshot
每任務成本(評測)約 $0.94較高較高獨立測試

資料來源:Moonshot 的技術部落格、獨立排行榜與分析。結果會受測試框架/努力程度影響;請隨時核對最新數據。

K3 在敏感主題的拒答率較低,且於代理式流程中一致性強。獨立測試(如 YouTube 評測、Vals AI)亦確認其為真實世界程式場景最強的開放模型之一。

Kimi K3 能做什麼?在程式、視覺與更多場景的能力

程式與代理式工程

K3 能維持長時段會話且需最少監督:可導航龐大倉庫、使用工具、透過螢幕截圖除錯(「vision in the loop」)。

範例:

  • 核心優化與編譯器開發:自零打造 MiniTriton(類 Triton 編譯器),可與優化堆疊匹敵。GPU 核心優化與 Fable 5 競爭。
  • 遊戲開發:將構想/圖像/影片轉化為可遊玩的 3D/多人作品,並進行迭代微調。
  • 晶片設計:自動連續 48 小時完成 nano 級晶片設計。
  • 前端:在網頁應用與全端任務的排行榜上名列前茅。

視覺與多模態

原生圖像/影片理解可支援:

  • 影片編輯:從 56 段素材自編宣傳片(選片、剪輯、同步、修訂)——以分鐘完成需時數小時的工作。
  • 3D 推理、動態圖形、互動式儀表板。
  • 透過螢幕截圖進行程式迭代的「vision in the loop」。

Kimi API 文件顯示以 base64 data URLs 傳入影像,影片則透過上傳檔案並以 ms:// 參照。同時提醒不支援公開影像 URL 作為 vision 輸入,因此開發者應傳送 base64 或上傳檔案參照,並將訊息內容組織為物件陣列。這點對實作很重要:不要將混合了影像與文字的訊息序列化為單一純文字字串。

知識型工作與研究

對企業而言,這比一般聊天機器人更有價值。該模型專為「代理式」工作設計,能維持計畫、呼叫工具、處理中間結果並產出最終成果。範例包含市調報告、資料清理助手、合規摘要、客服知識庫維護與內部工程 Copilot。

  • 產出顧問級報告、互動視覺化、儀表板(例如從數千來源生成 42 年 ASIC 產業分析)。
  • 科學流程:重現天體物理關係,並以子代理分析重力波。
  • 透過 Kimi Work 的小工具/儀表板進行持續、資料驅動的呈現。

K3 將文獻與可執行程式碼相連,快速產出具出版水準的成果。

Kimi K3 與其他前沿模型:實務比較

模型最佳適配場景優勢注意事項CometAPI 建議
Kimi K3長上下文程式、知識型工作、代理、視覺推理2.8T MoE 規模、1M 上下文、強勁的程式與代理式基準、開放權重路線圖發佈周容量壓力、對思考歷史的敏感性、視覺支援可能因接入路徑而異作為旗艦程式與長上下文模型優先測試
GPT-5.6 Sol困難推理、程式、研究、廣泛生產任務整體基準很強、工具成熟多數路徑價格更高作為對照與升級模型使用
Claude Fable 5寫作、程式、代理式工作流、偏好導向任務優質使用體驗與廣泛前沿表現成本較高,某些任務可能出現政策退回適合導向使用者的代理與寫作密集型應用做比較
Claude Opus 4.8深度推理與可靠專業助手穩定的高端助手行為較新旗艦版本發布後,相對偏舊作為回退或基準基線
GLM-5.2成本敏感的開放模型評估作為開放替代具競爭力在多項 K3 對比中較弱納入成本/效能路由測試

如何存取 Kimi K3:逐步指南

如何存取 Kimi K3

1. 透過 Kimi 產品使用 Kimi K3

非開發者最簡單的路徑是使用 Kimi 的消費與生產力產品:Kimi 網頁端、App、Kimi Work、Kimi Code。這是最快體驗其寫作、程式、研究與偏向 UI 行為的方式,而無需先做整合。7 月 20 日報導的暫停新訂閱意味著存取情況可能變動,規劃團隊部署前請先查詢最新產品頁資訊。

2. 透過 Kimi API Platform 使用 Kimi K3

開發者可使用 OpenAI 風格的用戶端呼叫 Kimi K3。Moonshot 文件列出:

  • base URL:https://api.moonshot.ai/v1
  • model ID:kimi-k3
  • 範例中的環境變數:MOONSHOT_API_KEY
  • Python SDK 要求:OpenAI SDK 1.0 或更新版

基本 Python 範例:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1",
)

completion = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "user", "content": "Introduce Kimi K3 in one sentence."}
    ],
)

print(completion.choices[0].message.content)

Kimi K3 預設啟用思考模式,並支援 reasoning_effortlowhighmax 值,預設為 max。API 支援串流、嚴格 JSON 結構化輸出、Partial Mode、工具呼叫、動態工具載入、自動上下文快取,以及透過 Formula 的官方工具整合。文件同時列出若干重要上限:max_completion_tokens 預設 131,072,可設定至 1,048,576;temperature 與 top-p 為固定;在多輪與工具呼叫工作流中,開發者應回傳完整的 assistant 訊息;且網路搜尋正在更新,近期不建議用於生產。

3. 透過 CometAPI 使用 Kimi K3

對許多團隊而言,CometAPI 更實用,因其提供多家模型供應商的統一 API 層。CometAPI 的 Kimi K3 頁面顯示該模型已上線,包含:

  • model ID:kimi-k3
  • provider:Moonshot AI
  • 上下文視窗:最高 1,000,000 tokens
  • CometAPI 價格:每 1M tokens,輸入 $2.4、輸出 $12
  • 官方標價:每 1M tokens,輸入 $3、輸出 $15
  • endpoint:/v1/chat/completions
  • base URL:https://api.cometapi.com/v1

CometAPI Python 範例:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
    max_retries=0,
)

completion = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "You are a careful software engineering assistant.",
        },
        {
            "role": "user",
            "content": "Review this migration plan and identify the riskiest steps.",
        },
    ],
    max_completion_tokens=1024,
)

print(completion.choices[0].message.content)

若你的應用已使用 OpenAI SDK,CometAPI 的 quickstart 建議僅變更兩處設定:將 base_url 設為 https://api.cometapi.com/v1,並改用 COMETAPI_KEY 取代先前供應商金鑰。之後在 model 欄位傳入 CometAPI 的模型 ID 即可。

4. 權重釋出後以開放權重方式使用 Kimi K3

Moonshot 稱將於 2026 年 7 月 27 日前釋出完整 Kimi K3 權重。釋出後,研究人員、基礎設施團隊與進階企業用戶可評估自建、優化或私有部署。對多數公司而言,核心問題會是經濟性:雖然模型開放,但要服務一個 2.8T 的 MoE 系統,仍需嚴肅的 GPU 基礎設施、推理工程與營運監控。

最終結論

Kimi K3 可說是 2026 年迄今最重要的模型發佈之一。它結合了超大規模、認真的開放權重策略、100 萬 token 的上下文視窗、原生視覺理解,以及位居當前程式與代理式系統前列的基準表現。它並未抹去對 GPT、Claude、Gemini、DeepSeek、Qwen 或其他模型的需求,但確實為最棘手的長上下文工作流程提供了可信的新選擇。

立即在 kimi.com 或透過 CometAPI 快速整合。善用其在程式與視覺上的強項開始實驗——結果不言自明。

繼續學習

把這篇文章連到下一個決策。

查看所有主題
發布於 Jul 20, 2026
最後更新 Sep 3, 2026
329 次瀏覽
已審核內容清晰度、來源標註與最新 API 術語。

準備好將 AI 開發成本降低 20% 了嗎?

幾分鐘內免費開始。包含免費試用點數。無需信用卡。

閱讀更多