GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
ai-model/CometAPI 研究

如何使用 Kimi K3 API

了解如何透過 CometAPI 使用 Kimi K3 API。內容涵蓋設定、定價、流式傳輸、思考強度、視覺輸入等。

CometAPI
AnnaAI 模型與 API 研究團隊
更新於 Sep 3, 2026 8 分鐘閱讀
如何使用 Kimi K3 API
套用此模式

發出第一個 API 請求。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR Kimi K3 是 Moonshot AI 最新的旗艦模型,於 2026 年 7 月推出,面向長跨度編碼、深度推理、多模態理解與端到端知識工作。Moonshot 將其描述為一個具備原生視覺與 100 萬 token 上下文視窗的 2.8 兆參數 open 3T 級模型。

對希望快速接入且不想分別管理多家供應商帳號的開發者而言,CometAPI 已上線 Kimi K3,模型 ID 為 kimi-k3,使用相容於 OpenAI 的 /v1/chat/completions 端點與基底 URL https://api.cometapi.com/v1. CometAPI 上線的 Kimi K3 的輸入價格為每 100 萬 tokens $2.40,輸出價格為每 100 萬 tokens $12.00;對照官方 Kimi API 公布的 cache-miss 輸入 $3.00 與輸出 $15.00。由於 Kimi K3 的需求已導致 Moonshot 出現暫時性的訂閱限流,生產團隊應使用 CometAPI,不僅便於設置,亦可用於模型對比、用量監控與備援路由。

Key Takeaways

  • 在生產環境中,保留多輪工作流程中的完整 assistant 訊息、設定 max_completion_tokens 上限、追蹤 token 用量,並建立備援路由。
  • Kimi K3 是 Moonshot AI 的 2.8T 參數 Mixture‑of‑Experts 模型,具備 100 萬 token 上下文與原生視覺理解。
  • CometAPI 的 Kimi k3 模型 ID 為 kimi-k3;主要端點為 POST https://api.cometapi.com/v1/chat/completions
  • K3 會持續進行推理。使用 reasoning_effort 設定為 lowhighmax;Kimi 文件預設為 max
  • 對長程式碼、研究與分析任務強烈建議使用串流,因為用戶可在模型仍在運算時就看到部分輸出。
  • 視覺輸入必須使用多模態的 content 陣列。Kimi 文件 表示 Kimi 的視覺路由不支援公共圖片 URL;請使用 base64 或已上傳檔案的引用。
  • Kimi K3 支援結構化輸出、JSON 模式、工具呼叫、tool_choice、動態工具載入與上下文快取。

CometAPI 是在單一 API 層同時評估 Kimi K3 與 GPT、Claude、Gemini、DeepSeek、Qwen 等模型的實用方式。

What is Kimi K3: Moonshot AI’s Flagship Model

Moonshot AI 於 2026 年 7 月 16 日發佈 Kimi K3,為迄今最強大的模型——採用稀疏 Mixture‑of‑Experts(MoE)架構,總參數約 2.8 兆(每個 token 啟用 896 個專家中的 16 個)。其特性包含 Kimi Delta Attention,可在百萬級上下文中將解碼速度提升至最高 6.3 倍,以及 Attention Residuals,使訓練效率提升約 25%。

Key Specs來源:官方與獨立報告):

能力Kimi K3 詳情
模型 IDkimi-k3
上下文視窗1,048,576 tokens(1M)
參數量合計 2.8T(MoE)
輸入文字 + 原生視覺(圖像)
推理常時啟用,發佈時預設最大努力
功能工具呼叫、結構化/JSON 輸出、串流
開放權重承諾於 2026 年 7 月 27 日釋出(修改版 MIT)

它在長跨度編碼、代理型任務、視覺理解與知識工作方面表現出色。獨立基準評測顯示其具競爭力(例如,在 Artificial Analysis Intelligence Index 上得分 57.1,前端編碼領域表現強勁)。

Latest News Context from businessinsider:發佈後需求暴增,Moonshot 一度暫停新用戶訂閱。這也顯示中國在開放權重前沿模型上的推進,且 Moonshot 正尋求重大 IPO 機會。

全量權重預計於 2026 年 7 月 27 日釋出

Moonshot 的 Kimi K3 文件指出,完整模型權重將於 2026 年 7 月 27 日前釋出。在該釋出完成且第三方部署工具成熟之前,多數團隊仍應以託管 API 為最快捷的實用途徑。即便權重可用,要服務一個 2.8T 參數的 MoE 模型也不同於在單機上運行小型開放模型。Moonshot 技術博客建議 K3 部署採用至少 64 張加速器的超級節點配置,因此對許多 SaaS 團隊、代理商、內部工具與 AI 產品團隊而言,託管 API 仍將是預設選擇。

Benchmark Performance: Data, Sources, and Analysis

Kimi K3 在前沿任務上表現亮眼,特別是程式碼與代理領域,同時整體競爭力強。獨立實驗室如 Artificial Analysis 基本驗證了供應商的聲稱(但也有如幻覺率等注意事項)。

整體智能

  • Artificial Analysis Intelligence Index v4.1:57.1(總排名第 4;落後於 Fable 5 ~60、GPT-5.6 Sol ~59;領先於 Claude Opus 4.8 ~55.7)。
  • GDPval-AA v2 Elo:1,668(相較 K2.6 的 1,190 大幅提升;超越 Opus 4.8,略遜於 Fable 5)。

如何使用 Kimi K3 API

來源:reddit

程式碼基準(官方 + 獨立)

K3 在此表現突出,名列 Frontend Code Arena 之首(1,679 Elo,超越 Fable 5 與 Sol)。

如何使用 Kimi K3 API

來源:Kimi

Coding Index(Artificial Analysis):表現強,約 ~76,與領先者具備競爭力。

K3 擅長倉庫級別工作、具視覺迭代的前端任務與使用工具的代理。開發者反映其在許多編碼任務上達到「Opus 4.8+ 水準」。

What Is the Kimi K3 API?

以開發者視角的簡述

Kimi K3 API 通過 chat-completions 風格的介面提供對 Moonshot AI K3 模型的託管存取。典型請求會傳入訊息列表、選擇 model: "kimi-k3",並接收 assistant 的回覆。除了基本聊天格式,K3 還新增了對生產至關重要的能力:可配置的思考力度、長上下文、視覺輸入、串流、JSON 與結構化輸出、工具呼叫與上下文快取。

Kimi K3 不適合被理解為「便宜的通用聊天機器人」。其最大價值在於重負載工作。如果你的產品需要向模型餵入大型程式碼庫、長篇文件包、密集試算表匯出、複數截圖、偵錯記錄或複雜的工具規劃,K3 正是為這類工作而設計。若你的應用只需要短 FAQ 回答或對極小輸入做分類,更小的模型可能更具成本效益。

K3 新增 API 功能與用法

  • 1M 上下文:可處理完整倉庫、書籍或長對話而不需截斷。
  • 原生視覺:可直接在訊息中分析圖像(base64 或 URL)。
  • 常時啟用推理:預設最大努力;支援結構化思考軌跡(串流可顯示增量)。
  • 工具呼叫與代理:提供 OpenAI 風格的函式呼叫以支持複雜流程。
  • 結構化輸出:JSON 模式,便於可靠解析。
  • 快取:自動前綴快取可顯著降低重複上下文的成本(在編碼任務中回報 90%+ 命中)。

Key Capabilities of Kimi K3 API on CometAPI

100 萬 token 上下文:面向長文件與大型程式碼庫

CometAPI 列示 Kimi K3 具 1,000k token 的上下文視窗。此規模改變了工作流程設計方式。你可以測試在單一請求中保留更大上下文:例如架構文件 + 程式碼片段、產品需求 + 錯誤報告、研究論文 + 筆記,或長客服歷史。

這不代表每個請求都應使用滿上下文。長上下文成本高且會拉長首 token 延遲。當模型需要全局視野時才使用,而非取代乾淨的檢索設計。CometAPI 的強健生產模式是混合路由:用向量或搜尋檢索最相關片段,但在少數需要廣域上下文才能提升品質的任務,保留 K3 作為選項。

常時推理與可配置的 reasoning_effort

Kimi 文件指出 K3 會持續推理,並支援頂層欄位 reasoning_effort,可設為 lowhighmax。較輕的任務可選較低力度以兼顧延遲與成本;對於偵錯、數學推導、架構評審、程式碼遷移、長文件綜整與多工具規劃等,則使用 high 或 max。

在 CometAPI 上,當 Kimi K3 路由支援供應商特定參數時,於 Chat Completions 請求傳入 reasoning_effort。若 SDK 版本不接受頂層欄位,請透過 extra_body 或使用原生 HTTPS。

使用串流以提升使用者體驗

Kimi 串流文件說明,串流將通過 Server-Sent Events 傳遞 token,而非等待完整回覆。對 K3 而言尤為實用,因為深度推理與長輸出通常耗時更久。在開發者工具中,可先串流計畫再輸出程式碼;在研究助手中,先串流章節摘要;在內部分析應用中,先串流初步觀察,再生成最終結構化答案。

視覺輸入:截圖、圖表與影片

Kimi K3 支援視覺理解。Kimi 視覺文件指出,K3 能理解圖像與影片內容,且視覺訊息應使用包含 image_urlvideo_url 部分的 content 陣列。同一文件同時指出 URL 格式圖像並不受支援;請使用 base64 data URL 或上傳檔案引用。對 CometAPI 用戶而言,建議在測試環境先以 base64 圖像開始,因為它簡單、可攜,且無需依賴公共圖床就能安全記錄日誌。

結構化輸出、JSON 模式與工具呼叫

Kimi K3 通過 response_format 支援結構化輸出,並透過 JSON Schema 定義支援工具呼叫。K3 的新 API 功能包含 tool_choice 與動態工具載入。對代理產品而言,工具清單可能極大;可先提供小型的 search_tools 函式,檢索出相關工具,並僅將必要工具定義動態插入對話中。

務實的決策很簡單:不要只看基準表格。使用 CometAPI 基於你自己的提示建立可重複的評估集,至少包含 20–50 個真實任務:修 bug、資料擷取、截圖、PDF、客戶問題、工具呼叫軌跡與成本敏感的請求。將 Kimi K3 路由到那些能發揮長上下文、推理與視覺優勢並物有所值的工作上。

API Pricing: What Kimi K3 Costs

CometAPI Kimi K3 定價

CometAPI 的 Kimi K3 模型頁面列示:

提供者路由輸入價格輸出價格上下文模型 ID
CometAPI Kimi K3$2.40 per 1M tokens$12.00 per 1M tokens1,000k tokenskimi-k3

同頁面對比官方價格:每 100 萬 tokens 輸入 $3.00、輸出 $15.00,顯示 CometAPI 上線價約 8 折。價格可能變動,請在發佈高流量價格文案或制定生產預算前,核對 CometAPI 模型頁面的即時資訊。

官方 Kimi API 定價

Moonshot 技術博客列示 Kimi API 定價為:每 100 萬 cache-hit 輸入 tokens $0.30、每 100 萬 cache-miss 輸入 tokens $3.00、每 100 萬輸出 tokens $15.00。同時指出在編碼工作負載下,官方 Kimi API 可達 90% 以上的快取命中率。請將此 90% 視為供應商對特定負載的回報值,而非對所有應用的保證。你的命中率取決於提示、工具定義、倉庫前綴與會話歷史的穩定性。

簡單成本示例(CometAPI)

範例請求輸入 tokens輸出 tokens預估 CometAPI 成本
短程式碼審查20,0002,000$0.072
中等規模倉庫提問100,0005,000$0.300
大型文件分析500,00020,000$1.440
接近滿上下文的綜合生成950,00050,000$2.880

公式:(input_tokens / 1,000,000 * 2.40) + (output_tokens / 1,000,000 * 12.00)

兩點注意。其一,推理 token 在推理型模型中通常按輸出 token 計費,因此請審慎設定 max_completion_tokens。其二,長上下文應審慎使用。傳 500,000 個 tokens 很強大,但若 20,000 個高訊號 tokens 即可達到相同品質,通常不值得傳太多。

How to Use Kimi K3 API in CometAPI

步驟 1:建立 CometAPI 金鑰

建立或登入 CometAPI 帳號,開啟 API 金鑰頁並建立金鑰。將其存為伺服器端環境變數 COMETAPI_KEY。切勿將生產金鑰放在瀏覽器 JavaScript、行動 App、公共倉庫、截圖或客戶端日誌中。

PowerShell:

$env:COMETAPI_KEY = "your_cometapi_key_here"

macOS 或 Linux:

export COMETAPI_KEY="your_cometapi_key_here"

步驟 2:安裝 OpenAI SDK

CometAPI 支援相容 OpenAI 的 SDK。Python 中安裝一次:

python -m pip install --upgrade openai

步驟 3:發出你的第一個 Kimi K3 API 呼叫

使用 CometAPI 的基底 URL 與 kimi-k3 模型 ID:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
)

completion = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "You are a precise technical assistant for API developers.",
        },
        {
            "role": "user",
            "content": "Explain when I should use Kimi K3 for a coding agent.",
        },
    ],
    max_completion_tokens=1200,
)

print(completion.choices[0].message.content)
print(completion.usage)

對應的 cURL 請求:

curl https://api.cometapi.com/v1/chat/completions \
  -H "Authorization: Bearer $COMETAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [
      {"role": "system", "content": "You are a precise technical assistant for API developers."},
      {"role": "user", "content": "Explain Kimi K3 in one paragraph."}
    ],
    "max_completion_tokens": 800
  }'

K3 New API Features and Usage

Thinking effort

使用 reasoning_effort 控制 K3 的推理預算。Kimi 文件 列示 lowhighmax,且預設為 max。生產環境可依任務類型選擇:

任務類型建議力度原因
短摘要、改寫、簡單 Q&Alow對低風險任務更快更省
程式碼審查、資料擷取、規劃、分析high品質與成本的較佳平衡
複雜偵錯、數學、代理任務、長上下文推理max當深度推理值得更高延遲與輸出 token 成本時提供最佳品質

Python 範例:

completion = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="high",
    messages=[
        {
            "role": "user",
            "content": (
                "Review this migration plan for hidden risks. "
                "Return the top 5 issues and a safer rollout sequence."
            ),
        }
    ],
    max_completion_tokens=2000,
)

message = completion.choices[0].message
print(message.content)

若你的 OpenAI SDK 版本不接受 reasoning_effort 作為命名引數,請透過 extra_body 傳入:

completion = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Solve this scheduling problem."}],
    extra_body={"reasoning_effort": "high"},
)

重要實作細節:Kimi 的思考文件 指出,多輪 K3 對話應保留 API 回傳的完整 assistant 訊息,包括 reasoning_contenttool_calls 等欄位。若只存可見的 content,在長會話中可能削弱推理延續性。

串流回應

當答案可能很長、延遲重要或你希望在聊天 UI 顯示進度時,請啟用串流。

stream = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "user",
            "content": "Create a detailed refactor plan for a 200k-line monolith.",
        }
    ],
    stream=True,
    stream_options={"include_usage": True},
    max_completion_tokens=3000,
)

for chunk in stream:
    choice = chunk.choices[0]
    delta = choice.delta

    reasoning = getattr(delta, "reasoning_content", None)
    if reasoning:
        # In most products, store reasoning securely or hide it from end users.
        pass

    if delta.content:
        print(delta.content, end="", flush=True)

    usage = getattr(choice, "usage", None)
    if usage:
        print("\n\nUsage:", usage)

Kimi 串流文件 強調 SSE 串流結尾會以 data: [DONE] 收束。在原生 SSE 客戶端中,接收到該標記前請勿視作已完成。

視覺輸入

Kimi K3 能分析圖像與影片。最安全的 CometAPI 初始測試做法是 base64 圖像請求。請使用多模態的 content 陣列,而非將陣列包在字串中。

import base64
import mimetypes
from pathlib import Path

image_path = Path("dashboard-screenshot.png")
mime_type = mimetypes.guess_type(image_path.name)[0] or "image/png"
image_b64 = base64.b64encode(image_path.read_bytes()).decode("utf-8")

completion = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "image_url",
                    "image_url": {
                        "url": f"data:{mime_type};base64,{image_b64}",
                    },
                },
                {
                    "type": "text",
                    "text": (
                        "Review this dashboard screenshot. "
                        "Identify UX issues, missing states, and data-quality risks."
                    ),
                },
            ],
        }
    ],
    max_completion_tokens=1800,
)

print(completion.choices[0].message.content)

Kimi 視覺文件 列示支援的圖像格式(如 PNG、JPEG、WebP、GIF)與影片格式(如 MP4、MOV、AVI、WebM 等)。同時建議圖像解析度不高於 4K、影片不高於 FHD,因為更高解析度可能增加處理時間而未能提升理解。

使用 JSON Schema 的結構化輸出

在生產管線中,若後續步驟需要結構化資料,請不要解析自由文本。當路由支援時,使用帶 JSON Schema 的 response_format

import json

completion = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "user",
            "content": (
                "Extract implementation tasks from this request: "
                "Add SSO, migrate billing webhooks, and create admin audit logs."
            ),
        }
    ],
    response_format={
        "type": "json_schema",
        "json_schema": {
            "name": "implementation_tasks",
            "strict": True,
            "schema": {
                "type": "object",
                "properties": {
                    "tasks": {
                        "type": "array",
                        "items": {
                            "type": "object",
                            "properties": {
                                "title": {"type": "string"},
                                "risk": {"type": "string"},
                                "owner": {"type": "string"},
                            },
                            "required": ["title", "risk", "owner"],
                            "additionalProperties": False,
                        },
                    }
                },
                "required": ["tasks"],
                "additionalProperties": False,
            },
        },
    },
)

data = json.loads(completion.choices[0].message.content)
print(data["tasks"])

工具呼叫與 tool_choice

K3 的工具呼叫最佳實務 建議避免在單次請求中夾帶龐大的工具庫。模式是:先暴露一個工具搜尋函式,首輪使用 tool_choice: "required" 強制檢索,然後僅動態載入模型需要的工具定義。

精簡的訂單狀態範例:

import json

tools = [
    {
        "type": "function",
        "function": {
            "name": "get_order_status",
            "description": "Look up a customer's order status.",
            "parameters": {
                "type": "object",
                "properties": {
                    "order_id": {"type": "string"},
                },
                "required": ["order_id"],
                "additionalProperties": False,
            },
        },
    }
]

messages = [
    {"role": "user", "content": "Where is order A1024?"},
]

first = client.chat.completions.create(
    model="kimi-k3",
    messages=messages,
    tools=tools,
    tool_choice="required",
)

assistant_message = first.choices[0].message
messages.append(assistant_message.model_dump(exclude_none=True))

for call in assistant_message.tool_calls or []:
    args = json.loads(call.function.arguments)
    result = {"order_id": args["order_id"], "status": "Shipped", "eta": "2026-07-24"}
    messages.append(
        {
            "role": "tool",
            "tool_call_id": call.id,
            "content": json.dumps(result),
        }
    )

final = client.chat.completions.create(
    model="kimi-k3",
    messages=messages,
    tools=tools,
)

print(final.choices[0].message.content)

Kimi K3 Best Practice for Production Teams

在 Kimi K3 擅長的場景使用它

Kimi K3 非常適合倉庫級分析、前端編碼、錯誤重現、長文件綜整、試算表推理、視覺輔助 QA 與需要工具的代理型工作。對短文案生成、簡單分類或低風險客服宏等,可能超出所需。於 CometAPI 設定模型路由規則:讓 K3 承擔困難任務,而低成本模型處理例行流量。

建立備援,因發佈期容量受限

AP 報導 Moonshot 暫停新訂閱提醒我們:可用性亦是選型的一部分。請在應用層建立備援:若 Kimi K3 返回供應商容量錯誤,路由至另一個在 CometAPI 上具相似能力的模型、縮減上下文或使用退避重試。確保使用者體驗優雅:展示進度、保留草稿,讓失敗可恢復。

多輪會話中謹慎保存上下文

Kimi K3 的訓練包含保留思考歷史。Moonshot 技術博客警告:在會話中途切換至 K3,或未傳遞完整的歷史 assistant 訊息,可能降低穩定性。實務上,對開發者工具與代理,請儲存 API 返回的完整 assistant 訊息物件。未經測試請勿壓縮掉 tool_calls 或供應商特定的推理欄位。

控制輸出與推理成本

請務必設定 max_completion_tokens。Kimi API 參考指出,K3 的預設最大完成 token 為 131,072,且可設定至 1,048,576(受模型上下文上限限制)。這很強大,但若你的提示引導模型輸出超長答案,可能在帳單上造成驚訝。對多數產品流程,請定義不同上限:摘要 800–1,500,詳細分析 2,000–4,000,僅在需要長篇生成時提高上限。

為快取設計

Kimi 上下文快取在重複的初始上下文保持穩定時效果最佳。Kimi 現行快取文件描述為自動:無需手動建立快取、快取 ID 或 TTL 管理。對編碼代理,將倉庫說明、工具定義與專案政策維持一致前綴;對文件問答,讓文件包在相關問題間保持穩定。避免每回合改寫 system 提示,並將固定的大上下文放在 messages 陣列前段,以利快取辨識重複前綴。

審慎使用視覺功能

視覺輸入很有價值,但圖像與影片會依內容與解析度消耗 tokens。當影像能提供文字無法捕捉的資訊時再使用:如 UI 版面、圖表、手寫筆記、設計稿、CAD 截圖與錯誤畫面。請下調過高解析度、裁切無關空白,並搭配精確提問。

結論與建議

CometAPI 上的 Kimi K3 以易於整合的方式提供前沿能力——龐大上下文、視覺與推理——且價格可接受。無論是打造編碼代理、多模態應用或可擴展 AI 服務,建議從 CometAPI 著手,以獲得統一存取、節省與可靠性。註冊、從上述快速入門開始試驗,並自信擴張。

繼續學習

把這篇文章連到下一個決策。

查看所有主題
發布於 Jul 22, 2026
最後更新 Sep 3, 2026
117 次瀏覽
已審核內容清晰度、來源標註與最新 API 術語。

準備好將 AI 開發成本降低 20% 了嗎?

幾分鐘內免費開始。包含免費試用點數。無需信用卡。

閱讀更多