TLDR Kimi K3 是 Moonshot AI 最新的旗艦模型,於 2026 年 7 月推出,面向長跨度編碼、深度推理、多模態理解與端到端知識工作。Moonshot 將其描述為一個具備原生視覺與 100 萬 token 上下文視窗的 2.8 兆參數 open 3T 級模型。
對希望快速接入且不想分別管理多家供應商帳號的開發者而言,CometAPI 已上線 Kimi K3,模型 ID 為 kimi-k3,使用相容於 OpenAI 的 /v1/chat/completions 端點與基底 URL https://api.cometapi.com/v1. CometAPI 上線的 Kimi K3 的輸入價格為每 100 萬 tokens $2.40,輸出價格為每 100 萬 tokens $12.00;對照官方 Kimi API 公布的 cache-miss 輸入 $3.00 與輸出 $15.00。由於 Kimi K3 的需求已導致 Moonshot 出現暫時性的訂閱限流,生產團隊應使用 CometAPI,不僅便於設置,亦可用於模型對比、用量監控與備援路由。
Key Takeaways
- 在生產環境中,保留多輪工作流程中的完整 assistant 訊息、設定
max_completion_tokens上限、追蹤 token 用量,並建立備援路由。 - Kimi K3 是 Moonshot AI 的 2.8T 參數 Mixture‑of‑Experts 模型,具備 100 萬 token 上下文與原生視覺理解。
- CometAPI 的 Kimi k3 模型 ID 為
kimi-k3;主要端點為POSThttps://api.cometapi.com/v1/chat/completions。 - K3 會持續進行推理。使用
reasoning_effort設定為low、high或max;Kimi 文件預設為max。 - 對長程式碼、研究與分析任務強烈建議使用串流,因為用戶可在模型仍在運算時就看到部分輸出。
- 視覺輸入必須使用多模態的
content陣列。Kimi 文件 表示 Kimi 的視覺路由不支援公共圖片 URL;請使用 base64 或已上傳檔案的引用。 - Kimi K3 支援結構化輸出、JSON 模式、工具呼叫、
tool_choice、動態工具載入與上下文快取。
CometAPI 是在單一 API 層同時評估 Kimi K3 與 GPT、Claude、Gemini、DeepSeek、Qwen 等模型的實用方式。
What is Kimi K3: Moonshot AI’s Flagship Model
Moonshot AI 於 2026 年 7 月 16 日發佈 Kimi K3,為迄今最強大的模型——採用稀疏 Mixture‑of‑Experts(MoE)架構,總參數約 2.8 兆(每個 token 啟用 896 個專家中的 16 個)。其特性包含 Kimi Delta Attention,可在百萬級上下文中將解碼速度提升至最高 6.3 倍,以及 Attention Residuals,使訓練效率提升約 25%。
Key Specs(來源:官方與獨立報告):
| 能力 | Kimi K3 詳情 |
|---|---|
| 模型 ID | kimi-k3 |
| 上下文視窗 | 1,048,576 tokens(1M) |
| 參數量 | 合計 2.8T(MoE) |
| 輸入 | 文字 + 原生視覺(圖像) |
| 推理 | 常時啟用,發佈時預設最大努力 |
| 功能 | 工具呼叫、結構化/JSON 輸出、串流 |
| 開放權重 | 承諾於 2026 年 7 月 27 日釋出(修改版 MIT) |
它在長跨度編碼、代理型任務、視覺理解與知識工作方面表現出色。獨立基準評測顯示其具競爭力(例如,在 Artificial Analysis Intelligence Index 上得分 57.1,前端編碼領域表現強勁)。
Latest News Context from businessinsider:發佈後需求暴增,Moonshot 一度暫停新用戶訂閱。這也顯示中國在開放權重前沿模型上的推進,且 Moonshot 正尋求重大 IPO 機會。
全量權重預計於 2026 年 7 月 27 日釋出
Moonshot 的 Kimi K3 文件指出,完整模型權重將於 2026 年 7 月 27 日前釋出。在該釋出完成且第三方部署工具成熟之前,多數團隊仍應以託管 API 為最快捷的實用途徑。即便權重可用,要服務一個 2.8T 參數的 MoE 模型也不同於在單機上運行小型開放模型。Moonshot 技術博客建議 K3 部署採用至少 64 張加速器的超級節點配置,因此對許多 SaaS 團隊、代理商、內部工具與 AI 產品團隊而言,託管 API 仍將是預設選擇。
Benchmark Performance: Data, Sources, and Analysis
Kimi K3 在前沿任務上表現亮眼,特別是程式碼與代理領域,同時整體競爭力強。獨立實驗室如 Artificial Analysis 基本驗證了供應商的聲稱(但也有如幻覺率等注意事項)。
整體智能
- Artificial Analysis Intelligence Index v4.1:57.1(總排名第 4;落後於 Fable 5 ~60、GPT-5.6 Sol ~59;領先於 Claude Opus 4.8 ~55.7)。
- GDPval-AA v2 Elo:1,668(相較 K2.6 的 1,190 大幅提升;超越 Opus 4.8,略遜於 Fable 5)。

來源:reddit
程式碼基準(官方 + 獨立)
K3 在此表現突出,名列 Frontend Code Arena 之首(1,679 Elo,超越 Fable 5 與 Sol)。

來源:Kimi
Coding Index(Artificial Analysis):表現強,約 ~76,與領先者具備競爭力。
K3 擅長倉庫級別工作、具視覺迭代的前端任務與使用工具的代理。開發者反映其在許多編碼任務上達到「Opus 4.8+ 水準」。
What Is the Kimi K3 API?
以開發者視角的簡述
Kimi K3 API 通過 chat-completions 風格的介面提供對 Moonshot AI K3 模型的託管存取。典型請求會傳入訊息列表、選擇 model: "kimi-k3",並接收 assistant 的回覆。除了基本聊天格式,K3 還新增了對生產至關重要的能力:可配置的思考力度、長上下文、視覺輸入、串流、JSON 與結構化輸出、工具呼叫與上下文快取。
Kimi K3 不適合被理解為「便宜的通用聊天機器人」。其最大價值在於重負載工作。如果你的產品需要向模型餵入大型程式碼庫、長篇文件包、密集試算表匯出、複數截圖、偵錯記錄或複雜的工具規劃,K3 正是為這類工作而設計。若你的應用只需要短 FAQ 回答或對極小輸入做分類,更小的模型可能更具成本效益。
K3 新增 API 功能與用法
- 1M 上下文:可處理完整倉庫、書籍或長對話而不需截斷。
- 原生視覺:可直接在訊息中分析圖像(base64 或 URL)。
- 常時啟用推理:預設最大努力;支援結構化思考軌跡(串流可顯示增量)。
- 工具呼叫與代理:提供 OpenAI 風格的函式呼叫以支持複雜流程。
- 結構化輸出:JSON 模式,便於可靠解析。
- 快取:自動前綴快取可顯著降低重複上下文的成本(在編碼任務中回報 90%+ 命中)。
Key Capabilities of Kimi K3 API on CometAPI
100 萬 token 上下文:面向長文件與大型程式碼庫
CometAPI 列示 Kimi K3 具 1,000k token 的上下文視窗。此規模改變了工作流程設計方式。你可以測試在單一請求中保留更大上下文:例如架構文件 + 程式碼片段、產品需求 + 錯誤報告、研究論文 + 筆記,或長客服歷史。
這不代表每個請求都應使用滿上下文。長上下文成本高且會拉長首 token 延遲。當模型需要全局視野時才使用,而非取代乾淨的檢索設計。CometAPI 的強健生產模式是混合路由:用向量或搜尋檢索最相關片段,但在少數需要廣域上下文才能提升品質的任務,保留 K3 作為選項。
常時推理與可配置的 reasoning_effort
Kimi 文件指出 K3 會持續推理,並支援頂層欄位 reasoning_effort,可設為 low、high 與 max。較輕的任務可選較低力度以兼顧延遲與成本;對於偵錯、數學推導、架構評審、程式碼遷移、長文件綜整與多工具規劃等,則使用 high 或 max。
在 CometAPI 上,當 Kimi K3 路由支援供應商特定參數時,於 Chat Completions 請求傳入 reasoning_effort。若 SDK 版本不接受頂層欄位,請透過 extra_body 或使用原生 HTTPS。
使用串流以提升使用者體驗
Kimi 串流文件說明,串流將通過 Server-Sent Events 傳遞 token,而非等待完整回覆。對 K3 而言尤為實用,因為深度推理與長輸出通常耗時更久。在開發者工具中,可先串流計畫再輸出程式碼;在研究助手中,先串流章節摘要;在內部分析應用中,先串流初步觀察,再生成最終結構化答案。
視覺輸入:截圖、圖表與影片
Kimi K3 支援視覺理解。Kimi 視覺文件指出,K3 能理解圖像與影片內容,且視覺訊息應使用包含 image_url 或 video_url 部分的 content 陣列。同一文件同時指出 URL 格式圖像並不受支援;請使用 base64 data URL 或上傳檔案引用。對 CometAPI 用戶而言,建議在測試環境先以 base64 圖像開始,因為它簡單、可攜,且無需依賴公共圖床就能安全記錄日誌。
結構化輸出、JSON 模式與工具呼叫
Kimi K3 通過 response_format 支援結構化輸出,並透過 JSON Schema 定義支援工具呼叫。K3 的新 API 功能包含 tool_choice 與動態工具載入。對代理產品而言,工具清單可能極大;可先提供小型的 search_tools 函式,檢索出相關工具,並僅將必要工具定義動態插入對話中。
務實的決策很簡單:不要只看基準表格。使用 CometAPI 基於你自己的提示建立可重複的評估集,至少包含 20–50 個真實任務:修 bug、資料擷取、截圖、PDF、客戶問題、工具呼叫軌跡與成本敏感的請求。將 Kimi K3 路由到那些能發揮長上下文、推理與視覺優勢並物有所值的工作上。
API Pricing: What Kimi K3 Costs
CometAPI Kimi K3 定價
CometAPI 的 Kimi K3 模型頁面列示:
| 提供者路由 | 輸入價格 | 輸出價格 | 上下文 | 模型 ID |
|---|---|---|---|---|
| CometAPI Kimi K3 | $2.40 per 1M tokens | $12.00 per 1M tokens | 1,000k tokens | kimi-k3 |
同頁面對比官方價格:每 100 萬 tokens 輸入 $3.00、輸出 $15.00,顯示 CometAPI 上線價約 8 折。價格可能變動,請在發佈高流量價格文案或制定生產預算前,核對 CometAPI 模型頁面的即時資訊。
官方 Kimi API 定價
Moonshot 技術博客列示 Kimi API 定價為:每 100 萬 cache-hit 輸入 tokens $0.30、每 100 萬 cache-miss 輸入 tokens $3.00、每 100 萬輸出 tokens $15.00。同時指出在編碼工作負載下,官方 Kimi API 可達 90% 以上的快取命中率。請將此 90% 視為供應商對特定負載的回報值,而非對所有應用的保證。你的命中率取決於提示、工具定義、倉庫前綴與會話歷史的穩定性。
簡單成本示例(CometAPI)
| 範例請求 | 輸入 tokens | 輸出 tokens | 預估 CometAPI 成本 |
|---|---|---|---|
| 短程式碼審查 | 20,000 | 2,000 | $0.072 |
| 中等規模倉庫提問 | 100,000 | 5,000 | $0.300 |
| 大型文件分析 | 500,000 | 20,000 | $1.440 |
| 接近滿上下文的綜合生成 | 950,000 | 50,000 | $2.880 |
公式:(input_tokens / 1,000,000 * 2.40) + (output_tokens / 1,000,000 * 12.00)。
兩點注意。其一,推理 token 在推理型模型中通常按輸出 token 計費,因此請審慎設定 max_completion_tokens。其二,長上下文應審慎使用。傳 500,000 個 tokens 很強大,但若 20,000 個高訊號 tokens 即可達到相同品質,通常不值得傳太多。
How to Use Kimi K3 API in CometAPI
步驟 1:建立 CometAPI 金鑰
建立或登入 CometAPI 帳號,開啟 API 金鑰頁並建立金鑰。將其存為伺服器端環境變數 COMETAPI_KEY。切勿將生產金鑰放在瀏覽器 JavaScript、行動 App、公共倉庫、截圖或客戶端日誌中。
PowerShell:
$env:COMETAPI_KEY = "your_cometapi_key_here"
macOS 或 Linux:
export COMETAPI_KEY="your_cometapi_key_here"
步驟 2:安裝 OpenAI SDK
CometAPI 支援相容 OpenAI 的 SDK。Python 中安裝一次:
python -m pip install --upgrade openai
步驟 3:發出你的第一個 Kimi K3 API 呼叫
使用 CometAPI 的基底 URL 與 kimi-k3 模型 ID:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "system",
"content": "You are a precise technical assistant for API developers.",
},
{
"role": "user",
"content": "Explain when I should use Kimi K3 for a coding agent.",
},
],
max_completion_tokens=1200,
)
print(completion.choices[0].message.content)
print(completion.usage)
對應的 cURL 請求:
curl https://api.cometapi.com/v1/chat/completions \
-H "Authorization: Bearer $COMETAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [
{"role": "system", "content": "You are a precise technical assistant for API developers."},
{"role": "user", "content": "Explain Kimi K3 in one paragraph."}
],
"max_completion_tokens": 800
}'
K3 New API Features and Usage
Thinking effort
使用 reasoning_effort 控制 K3 的推理預算。Kimi 文件 列示 low、high 與 max,且預設為 max。生產環境可依任務類型選擇:
| 任務類型 | 建議力度 | 原因 |
|---|---|---|
| 短摘要、改寫、簡單 Q&A | low | 對低風險任務更快更省 |
| 程式碼審查、資料擷取、規劃、分析 | high | 品質與成本的較佳平衡 |
| 複雜偵錯、數學、代理任務、長上下文推理 | max | 當深度推理值得更高延遲與輸出 token 成本時提供最佳品質 |
Python 範例:
completion = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="high",
messages=[
{
"role": "user",
"content": (
"Review this migration plan for hidden risks. "
"Return the top 5 issues and a safer rollout sequence."
),
}
],
max_completion_tokens=2000,
)
message = completion.choices[0].message
print(message.content)
若你的 OpenAI SDK 版本不接受 reasoning_effort 作為命名引數,請透過 extra_body 傳入:
completion = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Solve this scheduling problem."}],
extra_body={"reasoning_effort": "high"},
)
重要實作細節:Kimi 的思考文件 指出,多輪 K3 對話應保留 API 回傳的完整 assistant 訊息,包括 reasoning_content 與 tool_calls 等欄位。若只存可見的 content,在長會話中可能削弱推理延續性。
串流回應
當答案可能很長、延遲重要或你希望在聊天 UI 顯示進度時,請啟用串流。
stream = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "user",
"content": "Create a detailed refactor plan for a 200k-line monolith.",
}
],
stream=True,
stream_options={"include_usage": True},
max_completion_tokens=3000,
)
for chunk in stream:
choice = chunk.choices[0]
delta = choice.delta
reasoning = getattr(delta, "reasoning_content", None)
if reasoning:
# In most products, store reasoning securely or hide it from end users.
pass
if delta.content:
print(delta.content, end="", flush=True)
usage = getattr(choice, "usage", None)
if usage:
print("\n\nUsage:", usage)
Kimi 串流文件 強調 SSE 串流結尾會以 data: [DONE] 收束。在原生 SSE 客戶端中,接收到該標記前請勿視作已完成。
視覺輸入
Kimi K3 能分析圖像與影片。最安全的 CometAPI 初始測試做法是 base64 圖像請求。請使用多模態的 content 陣列,而非將陣列包在字串中。
import base64
import mimetypes
from pathlib import Path
image_path = Path("dashboard-screenshot.png")
mime_type = mimetypes.guess_type(image_path.name)[0] or "image/png"
image_b64 = base64.b64encode(image_path.read_bytes()).decode("utf-8")
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": {
"url": f"data:{mime_type};base64,{image_b64}",
},
},
{
"type": "text",
"text": (
"Review this dashboard screenshot. "
"Identify UX issues, missing states, and data-quality risks."
),
},
],
}
],
max_completion_tokens=1800,
)
print(completion.choices[0].message.content)
Kimi 視覺文件 列示支援的圖像格式(如 PNG、JPEG、WebP、GIF)與影片格式(如 MP4、MOV、AVI、WebM 等)。同時建議圖像解析度不高於 4K、影片不高於 FHD,因為更高解析度可能增加處理時間而未能提升理解。
使用 JSON Schema 的結構化輸出
在生產管線中,若後續步驟需要結構化資料,請不要解析自由文本。當路由支援時,使用帶 JSON Schema 的 response_format。
import json
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "user",
"content": (
"Extract implementation tasks from this request: "
"Add SSO, migrate billing webhooks, and create admin audit logs."
),
}
],
response_format={
"type": "json_schema",
"json_schema": {
"name": "implementation_tasks",
"strict": True,
"schema": {
"type": "object",
"properties": {
"tasks": {
"type": "array",
"items": {
"type": "object",
"properties": {
"title": {"type": "string"},
"risk": {"type": "string"},
"owner": {"type": "string"},
},
"required": ["title", "risk", "owner"],
"additionalProperties": False,
},
}
},
"required": ["tasks"],
"additionalProperties": False,
},
},
},
)
data = json.loads(completion.choices[0].message.content)
print(data["tasks"])
工具呼叫與 tool_choice
K3 的工具呼叫最佳實務 建議避免在單次請求中夾帶龐大的工具庫。模式是:先暴露一個工具搜尋函式,首輪使用 tool_choice: "required" 強制檢索,然後僅動態載入模型需要的工具定義。
精簡的訂單狀態範例:
import json
tools = [
{
"type": "function",
"function": {
"name": "get_order_status",
"description": "Look up a customer's order status.",
"parameters": {
"type": "object",
"properties": {
"order_id": {"type": "string"},
},
"required": ["order_id"],
"additionalProperties": False,
},
},
}
]
messages = [
{"role": "user", "content": "Where is order A1024?"},
]
first = client.chat.completions.create(
model="kimi-k3",
messages=messages,
tools=tools,
tool_choice="required",
)
assistant_message = first.choices[0].message
messages.append(assistant_message.model_dump(exclude_none=True))
for call in assistant_message.tool_calls or []:
args = json.loads(call.function.arguments)
result = {"order_id": args["order_id"], "status": "Shipped", "eta": "2026-07-24"}
messages.append(
{
"role": "tool",
"tool_call_id": call.id,
"content": json.dumps(result),
}
)
final = client.chat.completions.create(
model="kimi-k3",
messages=messages,
tools=tools,
)
print(final.choices[0].message.content)
Kimi K3 Best Practice for Production Teams
在 Kimi K3 擅長的場景使用它
Kimi K3 非常適合倉庫級分析、前端編碼、錯誤重現、長文件綜整、試算表推理、視覺輔助 QA 與需要工具的代理型工作。對短文案生成、簡單分類或低風險客服宏等,可能超出所需。於 CometAPI 設定模型路由規則:讓 K3 承擔困難任務,而低成本模型處理例行流量。
建立備援,因發佈期容量受限
AP 報導 Moonshot 暫停新訂閱提醒我們:可用性亦是選型的一部分。請在應用層建立備援:若 Kimi K3 返回供應商容量錯誤,路由至另一個在 CometAPI 上具相似能力的模型、縮減上下文或使用退避重試。確保使用者體驗優雅:展示進度、保留草稿,讓失敗可恢復。
多輪會話中謹慎保存上下文
Kimi K3 的訓練包含保留思考歷史。Moonshot 技術博客警告:在會話中途切換至 K3,或未傳遞完整的歷史 assistant 訊息,可能降低穩定性。實務上,對開發者工具與代理,請儲存 API 返回的完整 assistant 訊息物件。未經測試請勿壓縮掉 tool_calls 或供應商特定的推理欄位。
控制輸出與推理成本
請務必設定 max_completion_tokens。Kimi API 參考指出,K3 的預設最大完成 token 為 131,072,且可設定至 1,048,576(受模型上下文上限限制)。這很強大,但若你的提示引導模型輸出超長答案,可能在帳單上造成驚訝。對多數產品流程,請定義不同上限:摘要 800–1,500,詳細分析 2,000–4,000,僅在需要長篇生成時提高上限。
為快取設計
Kimi 上下文快取在重複的初始上下文保持穩定時效果最佳。Kimi 現行快取文件描述為自動:無需手動建立快取、快取 ID 或 TTL 管理。對編碼代理,將倉庫說明、工具定義與專案政策維持一致前綴;對文件問答,讓文件包在相關問題間保持穩定。避免每回合改寫 system 提示,並將固定的大上下文放在 messages 陣列前段,以利快取辨識重複前綴。
審慎使用視覺功能
視覺輸入很有價值,但圖像與影片會依內容與解析度消耗 tokens。當影像能提供文字無法捕捉的資訊時再使用:如 UI 版面、圖表、手寫筆記、設計稿、CAD 截圖與錯誤畫面。請下調過高解析度、裁切無關空白,並搭配精確提問。
結論與建議
CometAPI 上的 Kimi K3 以易於整合的方式提供前沿能力——龐大上下文、視覺與推理——且價格可接受。無論是打造編碼代理、多模態應用或可擴展 AI 服務,建議從 CometAPI 著手,以獲得統一存取、節省與可靠性。註冊、從上述快速入門開始試驗,並自信擴張。
