Claude Haiku 5.5 and Nano Banana 2.1 are now live on CometAPI →
guide/CometAPI 研究

如何使用 MiMo-V2.5 API:完整開發者指南

瞭解 Xiaomi API 規格、基準測試、定價、多模態請求、串流、Python 整合,以及生產環境最佳實務。

CometAPI
Deon GoodwinAI 模型與 API 研究團隊
更新於 Oct 7, 2026 5 分鐘閱讀
如何使用 MiMo-V2.5 API:完整開發者指南
套用此模式

發出第一個 API 請求。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

CometAPI 中的 MiMo-V2.5 API 提供對小米稀疏專家混合模型的存取能力,適用於程式開發、多模態理解與智能體工作負載。當專案需要 100 萬 token 的上下文視窗、原生多模態輸入與低 token 成本時,MiMo-V2.5 API 是實用預設;若更注重高難度的編碼、推理,或長程工具使用而不太在意價格,則 MiMo-V2.5 Pro 更適合。本指南示範如何透過 CometAPI 呼叫 API、串流回應、結構化多模態請求、估算成本,並強化生產環境整合。

Key Takeaways

  • MiMo-V2.5 模型總參數為 310B,每個 token 啟用 15B 參數,並支援 1M-token 的上下文視窗。
  • 多模態任務、大上下文分析與成本敏感的智能體請使用 MiMo-V2.5 路由;面對最困難的編碼與推理任務時選擇 MiMo-V2.5 Pro。
  • 與 OpenAI 相容的端點讓遷移更簡單,但生產系統仍需設定逾時、重試邏輯、token 預算與供應商端能力檢查。
  • 依 CometAPI 的標示費率,含 10,000 個輸入 token 與 2,000 個輸出 token 的單次請求,在 MiMo-V2.5 路由約花費 $0.001568。

MiMo-V2.5 Model Overview

小米於 2026 年 4 月 22 日推出該模型。CometAPI 中的 MiMo-V2.5 API 透過與 OpenAI 相容的 chat-completions 介面對外開放,因此現有用戶端通常只需更換 base URL、API 金鑰與模型識別符即可遷移。

依據官方模型卡,該模型結合稀疏 MoE 語言骨幹與專用的視覺與音訊編碼器。其可接受文字、影像、視訊與音訊輸入,並產出文字輸出。大型上下文視窗適用於倉庫級程式碼審查、文件集合、長時錄音逐字稿,以及多步驟智能體。

SpecificationValueWhy it matters
Architecture稀疏專家混合(Sparse mixture of experts)為每個 token 啟用網路的一小部分。
Total parameters310B提供廣泛容量,且非每個 token 都用到所有參數。
Active parameters15B相對於總模型大小,支援更高效率的推論。
Context window1,000,000 tokens處理大型程式碼倉庫與長篇文件集合。
Maximum output透過當前路由可達 128K tokens支援長篇報告與擴展的程式碼生成。
Native inputsText, image, video, audio啟用統一的多模態工作流程。
Output modalityText回應以文字形式返回。
Vision encoder729M 參數的 ViT處理影像與視訊任務的視覺內容。
Audio encoder261M 參數的 Transformer處理語音與其他音訊輸入。
LicenseMIT依授權條款允許廣泛的商業與研究用途。

下方官方多模態基準圖展示了在影像理解、多模態智能體與視訊理解任務的表現。

如何使用 MiMo-V2.5 API:完整開發者指南

小米 MiMo-V2.5 官方多模態基準比較

供應商路由可能僅暴露底層模型支援媒體格式的子集。上線多模態功能前,請針對實際端點驗證影像、音訊與視訊的有效負載格式。

MiMo-V2.5 Benchmark Performance

小米報告在編碼、終端操作與多模態智能體評測上有強勁表現。這些數據有助於定位模型,但不能替代針對自身提示、工具、延遲目標與故障條件的測試。

BenchmarkReported scoreEvaluation focus
SWE-Bench Pro56.1倉庫層級軟體工程
Terminal-Bench 2.065.8基於終端機的智能體任務
Claw-Eval General62.1 Pass@3一般智能體能力
Claw-Eval Multimodal23.8 Pass@3多模態智能體任務
Claw-Eval Multi-Turn63.2 Pass@3多輪智能體行為
ResearchClawBench16.91面向研究的智能體工作流程

官方編碼比較顯示在 Terminal-Bench 2.0 上取得 65.8、在 SWE-Bench Pro 上取得 56.1,並將模型置於更廣泛的編碼智能體比較中。

如何使用 MiMo-V2.5 API:完整開發者指南

小米 MiMo-V2.5 官方編碼基準比較

結果暗示:該模型對於結合程式碼、工具與混合媒體的應用尤其具吸引力。若要做出可控的生產決策,請在內部評估中量測任務成功率、token 使用量、端到端延遲、重試頻率與人工修正率。

MiMo-V2.5 vs MiMo-V2.5 Pro: A Multi-Dimensional Comparison

DimensionMiMo-V2.5MiMo-V2.5-Pro
Total parameters310B1.02T
Active parameters15B42B
Context window1M tokens1M tokens
Primary strength全模態與通用智能體工作負載複雜智能體與高要求的編碼
Input price per 1M tokens$0.112$0.348
Output price per 1M tokens$0.224$0.696
Best fit多模態、大上下文、成本敏感系統困難推理、編碼與長程執行
Official API input modalitiesText, image, video, audioText
Official API output modalityTextText

比較結論:當決策受成本、吞吐量或多模態覆蓋驅動時,請先使用 MiMo-V2.5 路由;當內部評測顯示在困難的編碼、推理或工具使用案例上有明顯準確度提升時,再將特定請求升級至 MiMo-V2.5 Pro。採用分級路由往往能比全部走 MiMo-V2.5 Pro 獲得更佳的成本與品質平衡。

How to Call the MiMo-V2.5 API

該 API 遵循熟悉的chat-completions 結構。請將金鑰保存在伺服器端,從環境變數載入,切勿把它嵌入瀏覽器或行動端程式碼。

Set the API key

export COMETAPI_KEY="your_api_key_here"

$env:COMETAPI_KEY = "your_api_key_here"


### Send a cURL request

curl https://api.cometapi.com/v1/chat/completions
-H "Authorization: Bearer $COMETAPI_KEY"
-H "Content-Type: application/json"
-d '{
"model": "mimo-v2.5",
"messages": [
{"role": "system", "content": "You are a careful coding assistant."},
{"role": "user", "content": "Explain the bug and propose a minimal patch."}
],
"temperature": 0.2
}'


### Use Python with the OpenAI SDK

import os
from openai import OpenAI

client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
model="mimo-v2.5",
messages=[
{"role": "system", "content": "You are a precise engineering assistant."},
{"role": "user", "content": "Review this migration plan for hidden risks."},
],
temperature=0.2,
)

print(response.choices[0].message.content)


> 請勿記錄 API 金鑰、完整授權標頭或敏感提示內容。於生產環境使用機密管理工具,並按既定週期輪替憑證。

## How to Stream MiMo-V2.5 API Responses

串流可降低長答案的感知延遲。服務會返回逐步事件,SDK 會以片段方式提供。

stream = client.chat.completions.create(
model="mimo-v2.5",
messages=[{"role": "user", "content": "Draft a safe database migration checklist."}],
stream=True,
)

for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)


在網頁服務中,請以 Server-Sent Events 或 WebSocket 轉發增量片段,處理用戶端斷線,並在使用者取消時停止上游生成。

## MiMo-V2.5 API Multimodal and Structured Workflows

對於需要影像理解的任務,在同一個使用者訊息中同時發送文字指示與影像物件。不同供應商路由接受的媒體表示法可能不同,以下為有效負載範式,請針對當前路由確認支援。

{
"model": "mimo-v2.5",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "Extract the visible error and suggest the next diagnostic step."},
{"type": "image_url", "image_url": {"url": "https://example.com/error.png"}}
]
}
]
}


若需要機器可讀的輸出,請要求緊湊的 JSON 物件,並依自身綱要驗證。切勿僅因成功解析就假定生成的 JSON 是安全的。

import json

raw = response.choices[0].message.content
result = json.loads(raw)

required = {"summary", "risks", "next_action"}
missing = required - result.keys()
if missing:
raise ValueError(f"Missing fields: {sorted(missing)}")


## MiMo-V2.5 API Pricing on CometAPI and Cost Control

| Route                          | Input per 1M tokens | Output per 1M tokens | 100-request example |
| ------------------------------ | ------------------- | -------------------- | ------------------- |
| MiMo-V2.5                      | $0.112              | $0.224               | $0.1568             |
| MiMo-V2.5 Pro                  | $0.348              | $0.696               | $0.4872             |
| Xiaomi pay-as-you-go reference | $0.14               | $0.28                | $0.1960             |

此範例假設 100 次請求,每次含 10,000 個輸入 token 與 2,000 個輸出 token。依此假設,MiMo-V2.5 路由約比 MiMo-V2.5 Pro 便宜 68%。小米[公佈的即用即付費率](https://platform.xiaomimimo.com/docs/zh-CN/integration/roocode)可作為參考,而實際帳單請以上線時的供應商價格為準。

MiMo-V2.5 input: 100 × 10,000 / 1,000,000 × $0.112 = $0.1120
MiMo-V2.5 output: 100 × 2,000 / 1,000,000 × $0.224 = $0.0448
MiMo-V2.5 total: $0.1568

Pro input: 100 × 10,000 / 1,000,000 × $0.348 = $0.3480
Pro output: 100 × 2,000 / 1,000,000 × $0.696 = $0.1392
Pro total: $0.4872


透過最大輸出上限、提示壓縮、上下文快取、請求分類,以及僅將困難任務升級路由等方法控制成本。追蹤每個成功任務的成本而非每次請求成本;便宜但反覆失敗的請求,總體成本可能更高。

## How to Design Long-Context MiMo-V2.5 API Requests

1M-token 視窗讓更大的輸入成為可能,但並未消除檢索與注意力的權衡。請構建提示,讓模型能快速定位相關證據。

* 將任務、輸出契約與決策標準放在開頭。
* 以穩定的識別符與清晰分隔符分隔文件。
* 僅納入會影響答案的證據。
* 要求模型在結果中引用文件識別符或行號。
* 隨上下文增長量測準確度;不要把最大上下文當作理想上下文。

> 長上下文會同時增加 token 成本,並提升無關內容干擾模型的機率。即使全集可放入視窗,檢索、摘要與分層提示仍然重要。

## Production Reliability

### Retry only transient failures

對速率限制與暫時性伺服器故障進行指數退避加隨機擾動的重試。不要自動重試驗證失敗、格式錯誤或政策錯誤。

import random
import time

def delay_for(attempt: int) -> float:
return min(30.0, (2 ** attempt) + random.random())

for attempt in range(5):
try:
result = call_model()
break
except TransientAPIError:
if attempt == 4:
raise
time.sleep(delay_for(attempt))


### Set operational guardrails

* 設定連線與整體請求逾時。
* 對具外部副作用的流程附加冪等性鍵。
* 記錄模型 ID、延遲、輸入與輸出 token、重試次數與最終狀態。
* 在記錄前去識別化機密與個資。
* 對工具使用實施允許清單,對破壞性操作要求確認。
* 維持故障轉移的後備模型或排程佇列,以應對供應商中斷。

## MiMo-V2.5 API Common Errors and Solutions

| Symptom       | Likely cause                                   | Recommended action                                               |
| ------------- | ---------------------------------------------- | ---------------------------------------------------------------- |
| 401 or 403    | 缺少、無效或未授權的 API 金鑰                   | 驗證伺服器端機密與專案權限。                                     |
| 400           | 訊息格式錯誤或不支援的媒體物件                 | 檢查 JSON,並確認路由特定的有效負載支援。                       |
| 413           | 請求本文過大                                   | 降低媒體大小或拆分輸入。                                         |
| 429           | 速率或額度限制                                 | 以隨機擾動退避並在用戶端限制並發度。                             |
| 5xx           | 供應商暫時性故障                               | 在有界的預算內重試或進行故障轉移。                               |
| Slow response | 大上下文、長輸出或工具延遲                     | 串流輸出、限制 token,並剖析各階段延遲。                         |
| Invalid JSON  | 生成漂移                                       | 驗證、在安全情況下修復一次,持續失敗則拒絕。                     |

## Conclusion

MiMo-V2.5 是需要多模態輸入、大上下文與積極成本控制團隊的最佳起點。對於能以可量化品質提升來證明較高價格合理性的任務,Pro 應作為審慎的升級選項。先從小型評測集開始,為每次請求加上監測,並僅在測試真實負載、長上下文行為、重試處理與失敗恢復後,才推進到生產整合。

## FAQ

### What endpoint should I use?

使用 `/api.cometapi.com/v1/chat/completions`,或在與 OpenAI 相容的 SDK 中設定 base URL 為 `/api.cometapi.com/v1`。

### What model identifier should I send?

對 MiMo-V2.5 路由使用 `mimo-v2.5`。若帳號使用供應商別名,上線前請確認當前識別符。

### When should I choose MiMo-V2.5 Pro?

當內部評估顯示在困難的編碼、推理或長時間工具任務上有實質優勢時,選擇 MiMo-V2.5 Pro;日常或多模態流量在 MiMo-V2.5 路由品質足夠時應保持在該路由。

### Does a 1M-token context mean I should send everything?

不。大上下文是容量上限,並非提示設計目標。請檢索並整理會影響答案的證據,並在輸入增大時同時量測品質與成本。

### Can I call the API directly from a browser?

請勿在前端程式碼中暴露機密 API 金鑰。請從後端呼叫供應商,並在後端實施驗證、速率限制、記錄與資料控管。

### How do I verify multimodal support?

以實際供應商路由測試確切的媒體有效負載。底層模型的原生模態不保證每個路由都以相同方式暴露所有格式。
繼續學習

把這篇文章連到下一個決策。

查看所有主題
發布於 Oct 7, 2026
最後更新 Oct 7, 2026
1 次瀏覽
已審核內容清晰度、來源標註與最新 API 術語。

閱讀更多