TL;DR
Xiaomi 的標準版 V2.5 將原生文字、影像、影片與音訊理解與 100 萬 token 的上下文視窗、工具使用,以及稀疏專家混合(Mixture-of-Experts, MoE)效率結合。當多模態輸入與每個完成任務的成本重要時,更適合選用標準版。Pro 變體在高難度程式開發與長時程代理任務上體量更大、能力更強,但偏重文字輸入,且依 Xiaomi 公布的費率來看,每個 token 約為標準版的三倍成本。
實務決策很簡單:多模態代理、文件與媒體分析、大量自動化選擇標準版;若瓶頸在艱難的軟體工程或持續自主執行,則選擇 Pro。
Key Takeaways
-
標準版總參數為 310B,單 token 啟用 15B。
-
接受文字、影像、影片與音訊輸入,輸出為文字。
-
API 支援 100 萬上下文、最多 128K 輸出、工具呼叫、網頁搜尋、串流、結構化輸出與上下文快取。
-
發布方報告的結果包括 Terminal-Bench 2.0 得分 65.8 與 SWE-Bench Pro 得分 56.1。
-
Xiaomi 目前的 MiMo-V2.5-Pro 模型卡列出總參數 1.02T、啟用參數 42B。發布方列示的 SWE-Bench Pro 分數為 MiMo-V2.5 的 56.1 與 Pro 的 57.2;這些是帶時效性的發布方比較,並不保證特定的編碼工作流程。
-
依 Xiaomi 現行費率,標準版輸入/輸出成本為每百萬 token $0.14/$0.28;Pro 為 $0.435/$0.87。
-
CometAPI 中兩個 API 的價格均比官方未快取價低 20%。
資訊查核:2026 年 9 月 28 日。價格、基準測試、限制、可用性與請求格式可能變動。Xiaomi 已宣布其官方 mimo-v2.5 與 mimo-v2.5-pro API 模型名稱將於 2026 年 10 月 21 日北京時間 10:00 停用,且不自動替換。請規劃遷移並在部署前確認線路有效。
API 生命週期提醒:官方 Xiaomi 平台計畫於 2026 年 10 月 21 日淘汰兩個 V2.5 模型 ID。此通知針對 Xiaomi 的 API 平台;請另行檢查任何第三方閘道。Xiaomi 模型淘汰公告
What the Standard Model Is
MiMo-V2.5 是 Xiaomi MiMo 面向效率的多模態感知與代理工作基礎模型。它在單一架構中提供原生文字、影像、影片與音訊輸入,並產生文字輸出。
Xiaomi 的模型發佈記錄將 MiMo-V2.5 系列公開測試定於 2026 年 4 月 23 日。隨後釋出 MIT 授權的權重。MiMo-V2.5 總參數為 310B,但每個 token 僅啟用約 15B;它使用大型的專家池而非每次都運行全部 310B 參數。
MiMo-V2.5-Pro 則對應不同工作負載。它是一個兆級參數、文字輸入的模型,面向最困難的編碼、終端機與長時間代理任務。兩個變體都支援 100 萬最大上下文,但在模態、活躍運算與價格上差異明顯。
MiMo-V2.5 Specifications and Features
| 官方架構細節 | 值 | 為何重要 |
|---|---|---|
| 架構 | 稀疏 MoE | 大量專家容量與選擇性啟用 |
| 總參數 / 啟用參數 | 310B / 15B | 活躍運算遠低於總容量 |
| Transformer 層數 | 48:1 個稠密 + 47 個 MoE | 多數層使用路由專家 |
| 路由專家 | 256;每個 token 啟用 8 個 | 專業化而不需執行稠密 310B |
| 注意力 | 39 層 SWA + 9 層全域 | 平衡局部效率與長距資訊流 |
| SWA 視窗 | 128 token | 降低長上下文快取壓力 |
| 上下文 / 最大輸出 | 1M / 128K token | 支援長文件與延展軌跡 |
| 輸入 / 輸出 | 文字、影像、影片、音訊 / 文字 | 原生四種輸入模態 |
| 視覺編碼器 | 729M 參數 ViT;28 層 | 影像與影片理解 |
| 音訊編碼器 | 261M 參數 transformer;24 層 | 原生音訊理解 |
| Multi-Token Prediction | 3 個模組;約 329M 參數 | 支援推測解碼效率 |
| 訓練規模 | 約 48T token | 廣泛的文字與多模態訓練管線 |
| API 能力 | 工具、網頁、串流、結構化輸出、快取 | 面向生產的代理原語 |
| 授權 | MIT | 允許商用與修改 |
運作範圍包括 100 萬上下文與 128K 輸出,另有每分鐘 100 次請求與每分鐘 1000 萬 token 的公開上限。供應商層級限制可能因帳戶與整合路線而異。
Xiaomi MiMo 的官方架構圖。 官方架構資產。
How MiMo-V2.5 Architecture Works
稀疏專家:總容量不等於活躍運算
核心效率在於 310B 總參數、15B 啟用的設計。路由器為每個 token 從 256 位專家中選擇 8 位。這讓模型能使用遠大於傳統 15B 稠密模型的參數池,而無須每次執行所有 310B 參數。
這並不代表自託管就變得簡單。完整權重仍需儲存與分發,因此記憶體容量、互連頻寬、專家路由與服務軟體仍是實質限制。
長上下文的混合注意力
主幹以5:1 的 SWA 對全域比例交錯滑動視窗與全域注意力。39 個局部層控制快取成長,9 個全域層維持長距資訊流。Xiaomi 報告與全全域設計相比,KV 快取幾乎降低六倍。
100 萬 token 的最大值是容量,而非保證精度。檢索品質、延遲、工具狀態增長與遠距證據的注意力仍需依工作負載具體評估。
原生編碼器與代理能力
一個 729M 參數的視覺 transformer 處理影像與影片輸入;一個 261M 參數的音訊 transformer 處理音訊。投影器將兩者映射至語言主幹,使單一代理可結合螢幕截圖、影片片段、音軌、文字指令與工具結果。
三個 Multi-Token Prediction 模組支援推測解碼與強化學習效率。模型訓練約 48T token,並在後訓練階段逐步將上下文延伸至 100 萬。
開源權重採用 MIT 授權條款。允許商用部署,但基礎設施成本與第三方相依仍需另行審視。
MiMo-V2.5 Benchmarks: Coding, Agents, and Multimodal Results
基準測試說明:
下列數據為發布方報告。它們提供方向性參考,並不保證適用於特定的程式庫、媒體格式、工具堆疊、延遲目標或安全政策。
Coding and Agent Results

Xiaomi MiMo 官方的編碼與代理基準測試圖。
| 官方編碼基準測試 | 報告分數 | 決策信號 |
|---|---|---|
| MiMo Coding Bench | 71.8 | 廣泛的編碼代理能力 |
| Claw-Eval Text | 62.3 | 一般文字代理完成度 |
| Terminal-Bench 2.0 | 65.8 | 互動式終端機執行 |
| SWE-Bench Pro | 56.1 | 真實世界軟體工程 |
| Claw-Eval Multi-Turn | 63.2 | 較長多步驟代理工作 |
| ResearchClawBench | 16.91 | 自主研究工作流程 |
結果:最強場景是實際的工具使用而非孤立的程式補全。65.8 的 Terminal-Bench 支持以終端機為核心的代理,而 56.1 的 SWE-Bench Pro 表現顯示具備有用的倉庫層級能力。遠低的研究分數提醒需另行測試蒐證與引註行為。
Multimodal Results

Xiaomi MiMo 官方的影像、影片與多模態代理基準測試圖。
| 官方多模態基準測試 | 報告分數 | 測試能力 |
|---|---|---|
| CharXiv RQ | 81.0 | 圖表與文件推理 |
| MMMU-Pro | 77.9 | 專家級多模態推理 |
| HR-Bench 4K | 88.5 | 高解析度影像理解 |
| OmniDocBench | 87.2 | 文件理解 |
| Claw-Eval Multimodal | 23.8 | 多模態代理完成度 |
| Video-MME | 87.7 | 影片理解 |
| DailyOmni | 83.5 | 日常視聽推理 |
| VideoHolmes | 64.0 | 時序影片推理 |
結果:文件、高解析度影像與影片理解是最明確的強項。23.8 的多模態代理分數遠低於感知分數,因此同時需要理解媒體並可靠操作工具的系統應進行端到端評估。
MiMo-V2.5 vs MiMo-V2.5-Pro: Multi-Dimensional Comparison
| 官方架構比較 | MiMo-V2.5 | MiMo-V2.5-Pro 官方 Pro 規格 官方 Pro 基準測試 | 實務意涵 |
|---|---|---|---|
| 總參數 | 310B | 1.02T | Pro 的總容量超出 3× |
| 啟用參數 | 15B | 42B | Pro 約使用 2.8× 的活躍參數 |
| 層數 / 路由專家 | 48 / 256 | 70 / 384 | Pro 是更大的服務目標 |
| 模型卡上下文上限 | 1M | 1M | 兩者皆列 100 萬 token;請在實際工作負載規模測試檢索與延遲 |
| 官方 API 最大輸出 | 128K | 128K | 目前 Xiaomi API 模型頁皆列 128K;供應商特定限制可能不同 |
| 原生輸入 | 文字、影像、影片、音訊 | 文字 | MiMo-V2.5 是文件載明的多模態選擇;在發送媒體前請確認 Pro 端點 |
| SWE-Bench Pro | 56.1 | 57.2 | Pro 領先 1.1 分 |
| Terminal-Bench 2.0 | 65.8 | 68.4 | Pro 領先 2.6 分 |
| 主要適配 | 高效多模態代理 | 複雜編碼與長時程代理 | 請依實測工作負載選擇;模型層面的差距並不能證明廣義品質全面領先 |
比較結果:在兩個共用的編碼代理測試上,Pro 的優勢溫和;標準版則提供原生影像、影片與音訊輸入,且啟用參數遠少。當困難任務的少量完成率提升比多模態輸入與較低單位成本更有價值時,Pro 才更合理。
How Much Do MiMo-V2.5 and MiMo-V2.5-Pro Cost?
| 價格基準:2026-05-27 | 官方標準 API | 官方 Pro API | CometAPI 中的 MiMo-V2.5 API | CometAPI 中的 MiMo-V2.5-Pro API |
|---|---|---|---|---|
| 輸入,快取未命中 / MTok | $0.14 | $0.435 | $0.112 | $0.348 |
| 輸出 / MTok | $0.28 | $0.87 | $0.224 | $0.696 |
| 輸入,快取命中 / MTok | $0.0028 | $0.0036 | 請查詢即時計費 | 請查詢即時計費 |
| 相對官方未快取價之折扣 | 基準 | 基準 | 20% | 20% |
以官方費率計算,Pro 的未快取輸入與輸出均約為標準版的 3.1×。上述供應商價格將每組未快取價再降 20%,但兩變體之間的相對差距基本不變。
每 token 價格不等於總成本。工具重試、上下文大小、輸出長度、延遲、失敗任務復原與人工審核,才決定每個完成任務的成本。請先以代表性樣本負載實測,再選定預設的生產模型。
What Is MiMo-V2.5 Best For?
- 多模態代理:在單一流程中結合螢幕截圖、文件、影片、音訊、指令與工具。
- 長文件分析:處理程式庫、合約、研究封存、日誌與客服紀錄。
- 媒體理解:總結影片、抽取事件、解讀圖表並回答視聽問題。
- 編碼與終端代理:檢視檔案、執行指令、修改程式碼,並根據測試結果迭代。
- 高量自動化:以稀疏啟用與較低 token 單價支撐重複生產任務。
Limitations and Risks
- 雖然每個 token 只啟用 15B 參數,但自託管仍需完整的 310B 權重系統。
- 多模態輸出為文字;影像、語音與影片生成需另用其他模型。
- 100 萬上下文上限不保證在整個視窗內均勻的檢索精度。
- 發布方的基準測試未必可遷移至自訂工具、程式庫、提示或安全約束。
- 供應商端的模態曝露可能與底層開源模型的完整能力有所差異。
生產閘道:
在承諾導流前,請以代表性任務驗證精度、工具呼叫完成度、延遲、token 消耗、模態處理與回退行為。
API Example
以下 Python 範例使用 OpenAI 相容的 CometAPI 端點與標準版模型 ID。部署前請確認當前端點與支援的請求結構。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
max_retries=0,
)
response = client.chat.completions.create(
model="mimo-v2.5",
max_tokens=256,
messages=[
{
"role": "user",
"content": "Summarize the main findings in this technical report.",
}
],
)
print(response.choices[0].message.content)
Decision Guide
| 工作負載信號 | 起始選擇 | 何時切換 |
|---|---|---|
| 影像、影片或音訊為一等公民的輸入 | 標準版 | 除非可接受多模態前處理,否則不要切換 |
| 大量文件或混合媒體 | 標準版 | 僅在推理失敗主導成本時改用 Pro |
| 困難的程式庫工程 | 兩者皆測 | 若 Pro 的完成率提升足以抵消 3.1× 的單位成本,則選 Pro |
| 長時程的自主終端機軌跡 | Pro | 若無可量化收益則回到標準版 |
| 高量、例行的自動化 | 標準版 | 僅升級失敗或高價值任務 |
推薦路由:
對多模態與高量工作預設使用標準版,僅將困難的文字優先編碼或長時程任務路由至 Pro。此法可在維持能力的同時控制總成本。
Conclusion
標準版不僅僅是較小的 Pro。它是獨立的最佳化點:原生多模態輸入、100 萬上下文、強大的工具導向基準表現,以及每個 token 僅 15B 的啟用參數,且 token 價格低得多。
Pro 是針對困難軟體工程與持續自主執行的專才選項。其額外容量帶來可觀但非普遍的收益,因此最佳的部署模式是依工作負載路由,而非所有請求都選擇同一變體。
FAQ
標準版是開源的嗎?
其權重以 MIT 授權條款釋出,允許商用、修改、微調與再散佈,須遵守授權條款。
它使用多少參數?
稀疏 MoE 含 310B 總參數,每個 token 啟用 15B。啟用參數描述的是每個 token 的計算,而非完整模型的儲存大小。
它支援影像、影片與音訊嗎?
是。標準變體原生接受文字、影像、影片與音訊並輸出文字。Pro 變體的官方規格列為文字輸入。
最大上下文視窗是多少?
兩個模型卡皆標示最多 100 萬 token。Xiaomi 目前的 API 頁面為 MiMo-V2.5 與 MiMo-V2.5-Pro 列出 128K 最大輸出。實際可用上限可能隨端點、供應商、帳戶與請求格式而異;在依賴這些上限之前請先確認部署路線。
當前官方 Pro API 頁面分別確認 100 萬上下文與 128K 最大輸出:MiMo-V2.5-Pro API 規格
哪個變體更適合編碼代理?
Pro 在共用的編碼與終端機基準上分數更高,但差距不大。請在目標程式庫上同測兩者,根據任務完成率、延遲與總成本選擇。
哪個變體更適合多模態代理?
標準變體是自然選擇,因為它原生接受影像、影片與音訊輸入。Pro 偏重文字輸入。
生產團隊應如何選擇?
以標準版起步,量測失敗樣態,僅將受益於 Pro 的困難文字優先任務路由過去。比較的是每個完成任務的成本,而非僅看每 token 單價。
