TL;DR
CometAPI 中的 MiMo-V2.5 API 提供對小米稀疏專家混合模型的存取能力,適用於程式開發、多模態理解與智能體工作負載。當專案需要 100 萬 token 的上下文視窗、原生多模態輸入與低 token 成本時,MiMo-V2.5 API 是實用預設;若更注重高難度的編碼、推理,或長程工具使用而不太在意價格,則 MiMo-V2.5 Pro 更適合。本指南示範如何透過 CometAPI 呼叫 API、串流回應、結構化多模態請求、估算成本,並強化生產環境整合。
Key Takeaways
- MiMo-V2.5 模型總參數為 310B,每個 token 啟用 15B 參數,並支援 1M-token 的上下文視窗。
- 多模態任務、大上下文分析與成本敏感的智能體請使用 MiMo-V2.5 路由;面對最困難的編碼與推理任務時選擇 MiMo-V2.5 Pro。
- 與 OpenAI 相容的端點讓遷移更簡單,但生產系統仍需設定逾時、重試邏輯、token 預算與供應商端能力檢查。
- 依 CometAPI 的標示費率,含 10,000 個輸入 token 與 2,000 個輸出 token 的單次請求,在 MiMo-V2.5 路由約花費 $0.001568。
MiMo-V2.5 Model Overview
小米於 2026 年 4 月 22 日推出該模型。CometAPI 中的 MiMo-V2.5 API 透過與 OpenAI 相容的 chat-completions 介面對外開放,因此現有用戶端通常只需更換 base URL、API 金鑰與模型識別符即可遷移。
依據官方模型卡,該模型結合稀疏 MoE 語言骨幹與專用的視覺與音訊編碼器。其可接受文字、影像、視訊與音訊輸入,並產出文字輸出。大型上下文視窗適用於倉庫級程式碼審查、文件集合、長時錄音逐字稿,以及多步驟智能體。
| Specification | Value | Why it matters |
|---|---|---|
| Architecture | 稀疏專家混合(Sparse mixture of experts) | 為每個 token 啟用網路的一小部分。 |
| Total parameters | 310B | 提供廣泛容量,且非每個 token 都用到所有參數。 |
| Active parameters | 15B | 相對於總模型大小,支援更高效率的推論。 |
| Context window | 1,000,000 tokens | 處理大型程式碼倉庫與長篇文件集合。 |
| Maximum output | 透過當前路由可達 128K tokens | 支援長篇報告與擴展的程式碼生成。 |
| Native inputs | Text, image, video, audio | 啟用統一的多模態工作流程。 |
| Output modality | Text | 回應以文字形式返回。 |
| Vision encoder | 729M 參數的 ViT | 處理影像與視訊任務的視覺內容。 |
| Audio encoder | 261M 參數的 Transformer | 處理語音與其他音訊輸入。 |
| License | MIT | 依授權條款允許廣泛的商業與研究用途。 |
下方官方多模態基準圖展示了在影像理解、多模態智能體與視訊理解任務的表現。

小米 MiMo-V2.5 官方多模態基準比較
供應商路由可能僅暴露底層模型支援媒體格式的子集。上線多模態功能前,請針對實際端點驗證影像、音訊與視訊的有效負載格式。
MiMo-V2.5 Benchmark Performance
小米報告在編碼、終端操作與多模態智能體評測上有強勁表現。這些數據有助於定位模型,但不能替代針對自身提示、工具、延遲目標與故障條件的測試。
| Benchmark | Reported score | Evaluation focus |
|---|---|---|
| SWE-Bench Pro | 56.1 | 倉庫層級軟體工程 |
| Terminal-Bench 2.0 | 65.8 | 基於終端機的智能體任務 |
| Claw-Eval General | 62.1 Pass@3 | 一般智能體能力 |
| Claw-Eval Multimodal | 23.8 Pass@3 | 多模態智能體任務 |
| Claw-Eval Multi-Turn | 63.2 Pass@3 | 多輪智能體行為 |
| ResearchClawBench | 16.91 | 面向研究的智能體工作流程 |
官方編碼比較顯示在 Terminal-Bench 2.0 上取得 65.8、在 SWE-Bench Pro 上取得 56.1,並將模型置於更廣泛的編碼智能體比較中。

小米 MiMo-V2.5 官方編碼基準比較
結果暗示:該模型對於結合程式碼、工具與混合媒體的應用尤其具吸引力。若要做出可控的生產決策,請在內部評估中量測任務成功率、token 使用量、端到端延遲、重試頻率與人工修正率。
MiMo-V2.5 vs MiMo-V2.5 Pro: A Multi-Dimensional Comparison
| Dimension | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| Total parameters | 310B | 1.02T |
| Active parameters | 15B | 42B |
| Context window | 1M tokens | 1M tokens |
| Primary strength | 全模態與通用智能體工作負載 | 複雜智能體與高要求的編碼 |
| Input price per 1M tokens | $0.112 | $0.348 |
| Output price per 1M tokens | $0.224 | $0.696 |
| Best fit | 多模態、大上下文、成本敏感系統 | 困難推理、編碼與長程執行 |
| Official API input modalities | Text, image, video, audio | Text |
| Official API output modality | Text | Text |
比較結論:當決策受成本、吞吐量或多模態覆蓋驅動時,請先使用 MiMo-V2.5 路由;當內部評測顯示在困難的編碼、推理或工具使用案例上有明顯準確度提升時,再將特定請求升級至 MiMo-V2.5 Pro。採用分級路由往往能比全部走 MiMo-V2.5 Pro 獲得更佳的成本與品質平衡。
How to Call the MiMo-V2.5 API
該 API 遵循熟悉的chat-completions 結構。請將金鑰保存在伺服器端,從環境變數載入,切勿把它嵌入瀏覽器或行動端程式碼。
Set the API key
export COMETAPI_KEY="your_api_key_here"
$env:COMETAPI_KEY = "your_api_key_here"
### Send a cURL request
curl https://api.cometapi.com/v1/chat/completions
-H "Authorization: Bearer $COMETAPI_KEY"
-H "Content-Type: application/json"
-d '{
"model": "mimo-v2.5",
"messages": [
{"role": "system", "content": "You are a careful coding assistant."},
{"role": "user", "content": "Explain the bug and propose a minimal patch."}
],
"temperature": 0.2
}'
### Use Python with the OpenAI SDK
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="mimo-v2.5",
messages=[
{"role": "system", "content": "You are a precise engineering assistant."},
{"role": "user", "content": "Review this migration plan for hidden risks."},
],
temperature=0.2,
)
print(response.choices[0].message.content)
> 請勿記錄 API 金鑰、完整授權標頭或敏感提示內容。於生產環境使用機密管理工具,並按既定週期輪替憑證。
## How to Stream MiMo-V2.5 API Responses
串流可降低長答案的感知延遲。服務會返回逐步事件,SDK 會以片段方式提供。
stream = client.chat.completions.create(
model="mimo-v2.5",
messages=[{"role": "user", "content": "Draft a safe database migration checklist."}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)
在網頁服務中,請以 Server-Sent Events 或 WebSocket 轉發增量片段,處理用戶端斷線,並在使用者取消時停止上游生成。
## MiMo-V2.5 API Multimodal and Structured Workflows
對於需要影像理解的任務,在同一個使用者訊息中同時發送文字指示與影像物件。不同供應商路由接受的媒體表示法可能不同,以下為有效負載範式,請針對當前路由確認支援。
{
"model": "mimo-v2.5",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "Extract the visible error and suggest the next diagnostic step."},
{"type": "image_url", "image_url": {"url": "https://example.com/error.png"}}
]
}
]
}
若需要機器可讀的輸出,請要求緊湊的 JSON 物件,並依自身綱要驗證。切勿僅因成功解析就假定生成的 JSON 是安全的。
import json
raw = response.choices[0].message.content
result = json.loads(raw)
required = {"summary", "risks", "next_action"}
missing = required - result.keys()
if missing:
raise ValueError(f"Missing fields: {sorted(missing)}")
## MiMo-V2.5 API Pricing on CometAPI and Cost Control
| Route | Input per 1M tokens | Output per 1M tokens | 100-request example |
| ------------------------------ | ------------------- | -------------------- | ------------------- |
| MiMo-V2.5 | $0.112 | $0.224 | $0.1568 |
| MiMo-V2.5 Pro | $0.348 | $0.696 | $0.4872 |
| Xiaomi pay-as-you-go reference | $0.14 | $0.28 | $0.1960 |
此範例假設 100 次請求,每次含 10,000 個輸入 token 與 2,000 個輸出 token。依此假設,MiMo-V2.5 路由約比 MiMo-V2.5 Pro 便宜 68%。小米[公佈的即用即付費率](https://platform.xiaomimimo.com/docs/zh-CN/integration/roocode)可作為參考,而實際帳單請以上線時的供應商價格為準。
MiMo-V2.5 input: 100 × 10,000 / 1,000,000 × $0.112 = $0.1120
MiMo-V2.5 output: 100 × 2,000 / 1,000,000 × $0.224 = $0.0448
MiMo-V2.5 total: $0.1568
Pro input: 100 × 10,000 / 1,000,000 × $0.348 = $0.3480
Pro output: 100 × 2,000 / 1,000,000 × $0.696 = $0.1392
Pro total: $0.4872
透過最大輸出上限、提示壓縮、上下文快取、請求分類,以及僅將困難任務升級路由等方法控制成本。追蹤每個成功任務的成本而非每次請求成本;便宜但反覆失敗的請求,總體成本可能更高。
## How to Design Long-Context MiMo-V2.5 API Requests
1M-token 視窗讓更大的輸入成為可能,但並未消除檢索與注意力的權衡。請構建提示,讓模型能快速定位相關證據。
* 將任務、輸出契約與決策標準放在開頭。
* 以穩定的識別符與清晰分隔符分隔文件。
* 僅納入會影響答案的證據。
* 要求模型在結果中引用文件識別符或行號。
* 隨上下文增長量測準確度;不要把最大上下文當作理想上下文。
> 長上下文會同時增加 token 成本,並提升無關內容干擾模型的機率。即使全集可放入視窗,檢索、摘要與分層提示仍然重要。
## Production Reliability
### Retry only transient failures
對速率限制與暫時性伺服器故障進行指數退避加隨機擾動的重試。不要自動重試驗證失敗、格式錯誤或政策錯誤。
import random
import time
def delay_for(attempt: int) -> float:
return min(30.0, (2 ** attempt) + random.random())
for attempt in range(5):
try:
result = call_model()
break
except TransientAPIError:
if attempt == 4:
raise
time.sleep(delay_for(attempt))
### Set operational guardrails
* 設定連線與整體請求逾時。
* 對具外部副作用的流程附加冪等性鍵。
* 記錄模型 ID、延遲、輸入與輸出 token、重試次數與最終狀態。
* 在記錄前去識別化機密與個資。
* 對工具使用實施允許清單,對破壞性操作要求確認。
* 維持故障轉移的後備模型或排程佇列,以應對供應商中斷。
## MiMo-V2.5 API Common Errors and Solutions
| Symptom | Likely cause | Recommended action |
| ------------- | ---------------------------------------------- | ---------------------------------------------------------------- |
| 401 or 403 | 缺少、無效或未授權的 API 金鑰 | 驗證伺服器端機密與專案權限。 |
| 400 | 訊息格式錯誤或不支援的媒體物件 | 檢查 JSON,並確認路由特定的有效負載支援。 |
| 413 | 請求本文過大 | 降低媒體大小或拆分輸入。 |
| 429 | 速率或額度限制 | 以隨機擾動退避並在用戶端限制並發度。 |
| 5xx | 供應商暫時性故障 | 在有界的預算內重試或進行故障轉移。 |
| Slow response | 大上下文、長輸出或工具延遲 | 串流輸出、限制 token,並剖析各階段延遲。 |
| Invalid JSON | 生成漂移 | 驗證、在安全情況下修復一次,持續失敗則拒絕。 |
## Conclusion
MiMo-V2.5 是需要多模態輸入、大上下文與積極成本控制團隊的最佳起點。對於能以可量化品質提升來證明較高價格合理性的任務,Pro 應作為審慎的升級選項。先從小型評測集開始,為每次請求加上監測,並僅在測試真實負載、長上下文行為、重試處理與失敗恢復後,才推進到生產整合。
## FAQ
### What endpoint should I use?
使用 `/api.cometapi.com/v1/chat/completions`,或在與 OpenAI 相容的 SDK 中設定 base URL 為 `/api.cometapi.com/v1`。
### What model identifier should I send?
對 MiMo-V2.5 路由使用 `mimo-v2.5`。若帳號使用供應商別名,上線前請確認當前識別符。
### When should I choose MiMo-V2.5 Pro?
當內部評估顯示在困難的編碼、推理或長時間工具任務上有實質優勢時,選擇 MiMo-V2.5 Pro;日常或多模態流量在 MiMo-V2.5 路由品質足夠時應保持在該路由。
### Does a 1M-token context mean I should send everything?
不。大上下文是容量上限,並非提示設計目標。請檢索並整理會影響答案的證據,並在輸入增大時同時量測品質與成本。
### Can I call the API directly from a browser?
請勿在前端程式碼中暴露機密 API 金鑰。請從後端呼叫供應商,並在後端實施驗證、速率限制、記錄與資料控管。
### How do I verify multimodal support?
以實際供應商路由測試確切的媒體有效負載。底層模型的原生模態不保證每個路由都以相同方式暴露所有格式。
