GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
new/CometAPI 研究

Kimi K4 即將推出:我們所知與可期待

據稱 Kimi K4 正在開發中。請探討其預期規格、架構、基準測試目標、功能,以及相較於前沿模型的可能表現。

CometAPI
Mia MarenAI 模型與 API 研究團隊
更新於 Sep 3, 2026 6 分鐘閱讀
Kimi K4 即將推出:我們所知與可期待
套用此模式

發出第一個 API 請求。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

先說結論

Kimi K4 尚未正式發布,Moonshot AI 尚未公布其最終規格、基準結果、API 定價或發佈日期。迄今為止最有力的公開信號,是有報導稱 Moonshot 正在為一款預期明顯大於 Kimi K3 的後繼者尋求額外的 Nvidia Blackwell 產能。這是正在準備下一代模型的有力證據,但並非官方產品公告。

可負責任討論的是 K4 可能的方向。Moonshot 目前的2.8 兆參數 Kimi K3已結合稀疏 Mixture‑of‑Experts 擴展、原生視覺、一百萬 token 的上下文視窗,以及長時程代理能力。因此,Kimi K4 更可能以可靠的代理執行、程式設計深度、多模態推理與擴展效率作為評價標準,而不僅僅是參數數量。

核心結論很簡單:Kimi K4 顯然正在開發中,但公司外流傳的幾乎所有數字規格都未獲證實。任何可信的前瞻都必須區分已驗證的 K3 事實、關於 K4 的報導,以及前瞻性推斷。

Kimi K4 是什麼?4

Kimi K4 是 Moonshot AI 預期用於承接Kimi K3的公開名稱。目前應將其視為開發中的模型,而非已宣布的 API 產品。Moonshot AI 尚未發布 K4 的模型卡、技術報告、API 標識、定價頁、授權或基準表。

根據 The Information 的報導,Moonshot AI 正在討論 Kimi K4 的計畫。該報導援引兩位知情人士,稱 K4 將顯著大於 K3,且 Moonshot 正尋求取得更多 Nvidia Blackwell 晶片以為該模型做準備。然而,報導並未確認 5 兆、6 兆或任何其他確切參數規模,也未說明 K4 是否將以開放權重形式發布、僅透過託管產品提供,或拆分為多個變體。

這種不確定性很重要,因為 Kimi 的發布一向結合模型權重、託管 API、終端產品與專用代理系統。未來的 K4 公告可能指向單一模型、一組模型家族,或一個圍繞路由、工具、記憶與多模態組件構建的更廣義系統。

為什麼 Kimi K4 如此早就引發關注?

Kimi K3 提升了開放權重的擴展上限

Kimi K3奠定了不同尋常的雄心基線。其官方模型摘要列出:總參數 2.8 兆、啟用參數 1,04​ 億、93 層、896 個路由專家、每個 token 啟用 16 個專家、2 個共享專家,以及 1,048,576 token 的上下文長度。模型同時包含一個 401 百萬參數的 MoonViT‑V2 視覺編碼器。

這種組合讓 K3 因兩個原因而重要。其一,它證明開放權重模型可以擴展至與領先專有系統相同的廣泛能力級別。其二,其稀疏設計展示了總參數數量與推理成本並不相同:每個 token 只會啟動部分專家。

報導指出會有更大的後繼者

產業報導稱,Moonshot AI 正在為 K4尋求更多 Blackwell 級別運算,並形容該模型規模顯著大於 K3。這份報導是 K4 不止於社群揣測的最佳公開證據,但最終架構、訓練時程、模型大小與部署計畫仍未定案。

算力故事之所以重要,是因為擴展會帶來兩個不同的瓶頸。訓練需要足夠的加速器、網路、存儲與工程穩定性以完成前沿級別的運行;服務則需要另一套推理策略來達到可接受的延遲與成本。因此,更大的 K4 不僅需要更多硬體,還需要架構與系統層面的改進。

K3 的架構被設計為可進一步擴展

Moonshot 的Kimi K3 技術博客將 Kimi Delta Attention 與 Attention Residuals 描述為設計用於在兆級以上擴展的架構骨幹。Kimi Delta Attention 提供高效的注意力基礎,而 Attention Residuals 則在模型深度上選擇性地檢索表徵,而非均勻累積。

K3 亦使用Stable LatentMoE,每個 token 實際啟動 896 個路由專家中的 16 個。Quantile Balancing 由 router‑score 分位數導出專家分配,Per‑Head Muon 使注意力頭得以獨立優化。這些選擇指向 K4 必須解決的問題:穩定的路由、均衡的專家利用率、高效的長上下文注意力,以及在極端規模下可預測的訓練。

既然 Kimi K3 已是 2.8T 模型,為什麼 Kimi K4 仍然重要?

Kimi K3 已運作於異常巨大的規模,因此不能僅以是否擁有更多參數來評估 K4。更有意義的問題是,額外的訓練算力是否可以帶來更好的任務完成、更強的長時程可靠性,以及更低的有效推理成本。

因此,對 K4 的有用評估應聚焦於四個指標:

  • 任務完成率
  • 長時程代理可靠性
  • 程式設計成功率
  • 每個成功任務的成本

最後一個指標對開發者尤為重要。每次成功修復倉庫的成本更低的模型,可能比得分更高但失敗軌跡顯著更多的模型更有價值。

預期的 Kimi K4 規格

下表區分了 K3 已確認的技術基線、與 K4 的報導和推斷。預期不等於已宣布。未知欄位應保持未知,直至 Moonshot AI 發布模型卡或 API 文件。

規格基礎Kimi K3 已確認Kimi K4 公開報導置信度
模型狀態已發布開發中報導
架構稀疏 MoE未披露;可能是稀疏 MoE 的演進推論
總參數2.8T據報導顯著大於 K3報導;確切值未知
啟用參數104B未披露未知
專家配置896 路由;16 選擇;2 共享未披露未知
上下文視窗1,048,576 tokens很可能至少 1M,但未確認預期
注意力機制KDA 與 Gated MLA可能的下一代 KDA推論
原生視覺MoonViT‑V2多模態延續的可能性高預期
開放權重可用未確認未知
API 模型 IDkimi-k3未宣布未知
發佈日期可用未宣布未知

最重要的約束是參數這一行。「顯著更大」並未確立精確大小。同樣,K3 的一百萬 token 上下文、多模態設計與開放權重也不能直接搬入 K4 的規格表作為既成事實。它們是方向上合理的預期,而非已公布的產品承諾。

Kimi K4 可能引入哪些功能?

  1. 更大但更高效的稀疏 MoE 擴展

顯而易見的預期是更大的 Mixture‑of‑Experts 模型。更重要的問題在於 K4 是否改善總容量、啟用容量與服務成本之間的關係。若增加專家池而不改進路由,可能會導致專家未充分使用、熱專家、通訊瓶頸以及訓練不穩定。

可信的 K4 進展應結合更大的容量與更好的負載均衡、更專門化的專家、更低的啟用比例,或更強的跨專家協調。這些細節均未披露,因此文章應將其描述為工程目標,而非洩露功能。

更先進的 Kimi Delta Attention

Kimi Delta Attention 是 K3 長上下文設計的核心。下一代版本可能改進對百萬 token 輸入的檢索、降低注意力狀態記憶,並在長時程代理運行中保留重要資訊。實際的測試不僅是上下文視窗大小,而是模型是否能在不依賴強力分塊或重複檢索的情況下,找到、結合並行動於遠距證據。

更可靠的長時程代理

Kimi K3已定位於長時間的技術與知識工作。其官方展示包含編譯器開發、GPU 核心優化、科學程式設計、互動研究、遊戲開發與晶片設計工作流程。K4 需要將這些令人印象深刻的展示,化為更一致的日常執行。

重要的度量包括:更少不必要的工具呼叫、更強的目標保持、在動作失敗後更好的恢復、更可靠的驗證,以及更低的跨次運行方差。能夠一次完成困難基準但在生產中表現難以預測的模型,價值不如稍弱但執行穩定的模型。

更強的程式設計與軟體工程能力

K4 很可能持續聚焦於程式設計,但前沿已超越生成單一函式。具競爭力的軟體工程模型必須能映射倉庫、理解依賴、操作終端、修改多個檔案、運行測試、診斷失敗並修正方案。

K3 已在 ProgramBench、SWE‑Marathon、FrontierSWE 與終端任務中表現強勁。K4 最明確的機會,是在深度倉庫修復上縮小剩餘差距,同時保持 K3 在持續多步工作上的優勢。

更深的原生多模態

K3 在模型層面結合文本與視覺,Moonshot 的產品示例則將此能力延展到視頻編輯與視覺在迴圈內的開發。K4 可能改進 screenshot‑to‑code 工作流程、圖表與文檔推理、視頻時序理解、介面測試,以及在繼續之前檢視視覺結果的代理。

關鍵區分在於接受圖像與在閉迴圈中使用感知之間。多模態代理必須觀察渲染結果、識別不匹配、編輯其工作並驗證修訂。這比回答單張圖片問題要求更高。

更佳的推理與部署效率

即便釋出權重,比 K3 更大的模型也可能難以自行託管。K4 將受益於感知量化的訓練、有效的專家並行、推測式解碼、優化的 KV 狀態管理,以及更小的伴隨變體。對大多數團隊而言,託管 API 的實際性仍可能高於直接運營前沿級稀疏模型。

Kimi K4 需要達成什麼樣的基準表現?

K4 尚無公開的基準結果。負責任的方法是先建立由 K3 與當前前沿競品所形成的表現門檻,然後指出後繼者需要改進之處。下方擴展基線涵蓋推理、程式設計、終端操作、深度研究、代理式知識工作與試算表任務。所有數值皆來自表頭連結的 Kimi K3 官方模型卡。

官方基準套件Kimi K3GPT-5.6 SolClaude Fable 5Claude Opus 4.8
GPQA Diamond93.594.192.691.0
DeepSWE67.573.070.059.0
ProgramBench77.877.676.871.9
Terminal-Bench 2.188.388.888.084.6
FrontierSWE81.271.386.666.7
SWE-Marathon42.039.035.040.0
Kimi Code Bench 2.072.964.876.971.7
BrowseComp91.290.488.084.3
DeepSearchQA (F1)95.0Not reported94.293.1
ResearchRubrics76.273.8Not reported73.5
GDPval-AA v2 (Elo)1686173617471593
SpreadsheetBench 234.832.434.731.6

這些是由 Moonshot 報告的比較結果,而非單一受控的獨立排行榜。有些模型透過不同的代理框架評估,官方腳註描述了回退、網安防護、硬體替代、推理設置與基準特定程序。GDPval‑AA v2 是 Elo 等級,不應與百分比型行列進行數值比較。不要將小幅分數差異解讀為普遍優勢。

官方程式設計基準快照

Kimi K4 即將推出:我們所知與可期待

官方 Kimi K3 程式設計比較。該圖為 Moonshot 發布的圖形;請參考 最新的模型卡與腳註 以取得最新的數據表與評估方法。

基準結果與解讀

GPT‑5.6 Sol在 DeepSWE 上領先Kimi K3,顯示其在困難的倉庫級軟體修復上具優勢。Claude Fable 5在 FrontierSWE 上領先,而 K3 在該基準上仍明顯領先 GPT‑5.6 Sol 與Claude Opus 4.8

K3 在持續工作上表現更為鮮明。它稍微領先 ProgramBench,並在所選比較中錄得最強的 SWE‑Marathon 成績。它也領先 BrowseComp,並在 SpreadsheetBench 2 上與 Claude Fable 5 幾乎持平。

對 K4 而言,目標不應是每張圖表固定提升一定百分比。更有用的目標是提升深度程式碼庫修復與電腦使用可靠性,同時不丟失 K3 在長時程程式設計、瀏覽與代理式知識工作上的優勢。

Kimi K4 即將推出:我們所知與可期待

官方 Kimi K3 通用與視覺代理比較。來源: Moonshot AI Kimi K3 模型頁

Kimi K4 與 Kimi K3、GPT‑5.6 Sol、Claude Fable 5 的比較

在發布前的比較不能給 K4 指派不存在的分數,但可以展示若 K4 延續 K3 系列時預期所處的競爭位置。

維度Kimi K4 預期位置Kimi K3 已確認封閉參考:GPT-5.6 Sol 與 Claude Fable 5
可用性開發中可用可用
模型開放性未知開放權重專有
已確認的上下文未知1M tokens供應商定義或 1M 級
主要優勢預期為更大規模的前沿智能長時程程式設計與知識工作前沿推理、程式設計與電腦使用
多模態預期;未確認原生視覺多模態
自我託管未知在相當基礎設施下可行不提供
代理成熟度預期提升
部署成本未知且可能較高自託管成本高;提供託管 API僅託管 API
主要關注理由規模與可能的開放性已驗證的開放前沿基線封閉模型的最高能力

比較結論

Kimi K3以開放權重、一百萬 token 上下文視窗與強勁的長時程表現而差異化。GPT‑5.6 Sol在某些困難推理與倉庫修復任務上仍更強,而Claude Fable 5在軟體工程與電腦使用代理上特別具競爭力。

若 K4 保持開放或廣泛可及,並同時縮小這些能力差距,其意義將超越更大的參數數量。它將顯示開放或半開放系統可逼近最強專有代理平台的可靠性。若 K4 走向封閉且服務成本極高,實際差異將小得多。

Kimi K4 對開放權重 AI 可能意味著什麼?

K3 已表明開放權重開發正進入過去幾乎只由專有實驗室所涉的規模。K4 可能進一步推進這一邊界,但開放性具有多個層次:可下載的權重、可用的程式碼、可行的授權、可復現的推理、可負擔的硬體需求,以及可存取的託管 API。

模型可能在技術上開放,卻在經濟上不可及。K3 的 2.8T 規模意味著,即使存在稀疏啟用與量化,嚴肅的自託管仍需要相當的基礎設施。更大的 K4 可能加大能檢視權重的研究者與能高效運營該模型的組織之間的差距。

對更廣泛生態而言,理想的 K4 發布應結合透明的權重、高效的推理配方、強健的工具使用行為與託管 API。這將使研究者得以研究模型,企業透過 API 部署,而專門團隊可將其調適於私有或受監管的工作負載。

Kimi K4 何時發布?

Moonshot AI 尚未宣布 Kimi K4 的發布日期。公開報導將該模型與算力採購相連與開發規劃相連。因此,精確的月份、季度或倒數皆不可靠。

同樣未知的是 K4 是否會同時出現在 Kimi 網頁產品、Kimi Code、Kimi Work、Moonshot API 與開放權重倉庫。K3 已在其中數個面向可用,但 K4 可能採取分階段發布或不同的分發策略。

值得關注的信號包括官方的 Moonshot 技術博客、經驗證的模型倉庫、Kimi 平台文件、已發布的授權,以及帶有可復現評估細節的模型卡。社交貼文與參數傳聞在這些來源出現之前應處於次要地位。

在等待 K4 期間如何存取 Kimi 模型

目前無法呼叫 K4。開發者可改為透過CometAPI 上的 Kimi K3評估當前架構。現行模型 ID 是純程式碼文本:kimi‑k3。請使用 POST /v1/chat/completions。未有官方整合頁發布前,請勿將生產請求送往臆測的 kimi‑k4 標識。

建立 CometAPI 帳戶並生成 API 金鑰。將金鑰存放於環境變數,而非在應用程式原始碼中硬編碼。

from openai import OpenAI​ client = OpenAI(    api_key="YOUR_COMETAPI_KEY",    base_url="https://api.cometapi.com/v1", )​ response = client.chat.completions.create(    model="kimi-k3",    messages=[        {            "role": "user",            "content": "請分析此軟體專案的架構。"        }    ], )​ print(response.choices[0].message.content)

此程式碼區塊為 Python。端點、模型 ID、參數名稱與程式碼關鍵字刻意以程式碼呈現,而非超連結。當 K4 上線後,開發者應在更改生產路由前,確認其實際模型標識、端點相容性、支援的模態與定價。

我們仍然不知道的 Kimi K4 資訊

一篇負責任的預發布文章應保留以下未知,而非以社群估計填補:

  • 最終的總參數與啟用參數
  • 專家數量、共享專家與路由策略
  • 上下文視窗與最大輸出長度
  • 支援的輸入與輸出模態
  • 開放權重狀態、倉庫與授權
  • API 模型 ID、端點、推理模式與定價
  • 官方基準結果與評估框架
  • 量化格式與自託管硬體需求
  • 產品可用性與發布日期

保持這部分的明確性可以防止預測規格在後續被錯誤地傳為官方事實,也便於在 Moonshot AI 發布一手文件後及時更新文章。

FAQ

Kimi K4 已經發布了嗎?

沒有。目前沒有官方的 Kimi K4 模型卡、API 文件或公開發布公告。當前討論主要基於 Moonshot AI在準備比 K3 更大的後繼者的報導。

Kimi K4 會有多大?

確切規模未知。報導稱其可能顯著大於 K3,但多兆參數的具體說法尚未獲得 Moonshot AI 證實。

Kimi K4 會開源嗎?

尚未確認。K3 以 Kimi K3 License 的形式提供開放權重,但過往的發布策略不保證 K4 採用相同分發方式。

Kimi K4 會有一百萬 token 的上下文視窗嗎?

合理預期 K4 將保留或改進 K3 的長上下文能力,但 Moonshot AI 尚未公布 K4 的上下文限制。

開發者現在能透過 CometAPI 使用 Kimi K4 嗎?

目前沒有確認的 K4 模型路由。開發者現在可以透過同一整合層測試Kimi K3,並與其他前沿模型比較。

結論

Kimi K4 不應被簡化為一個傳聞中的參數數字。K3 已證明 Moonshot AI 能結合極端的稀疏模型規模、百萬級上下文、原生視覺、開放權重與長時程代理行為。真正的問題在於,K4 能否將這種規模轉化為更可靠的軟體工程、更強的電腦使用、更完善的多模態回饋迴圈,以及更高效的推理。

最重要的細節仍然未知:精確架構、發布日期、基準分數、授權、API 存取與服務成本。在 Moonshot 發布一手文件之前,任何超出已報導開發信號的 K4 規格都應被標記為預期或推斷。

開發者無需等待即可評估 Moonshot AI 的當前方向。Kimi K3 已可透過 CometAPI 使用,在 Kimi K4 到來之前,這為程式設計、長上下文推理、多模態分析與代理工作流提供了實用基線。

繼續學習

把這篇文章連到下一個決策。

查看所有主題
發布於 Aug 31, 2026
最後更新 Sep 3, 2026
134 次瀏覽
已審核內容清晰度、來源標註與最新 API 術語。

準備好將 AI 開發成本降低 20% 了嗎?

幾分鐘內免費開始。包含免費試用點數。無需信用卡。

閱讀更多