要点
Xiaomi の標準 V2.5 モデルは、ネイティブなテキスト・画像・動画・音声の理解に、100万トークンのコンテキストウィンドウ、ツール使用、スパースな Mixture-of-Experts の効率を組み合わせています。マルチモーダル入力とタスク完了あたりのコストが重要な場合に適しています。Pro 版はより大きく、高難度のコーディングや長時間のエージェント動作で強力ですが、テキスト入力に特化しており、Xiaomi 公表の料金ではトークン単価がおよそ3倍です。
実務上の判断はシンプルです。マルチモーダルエージェント、ドキュメント/メディア分析、大量自動化には標準モデルを選び、ボトルネックが難易度の高いソフトウェアエンジニアリングや持続的な自律実行にある場合は Pro を選びます。
重要なポイント
- 標準モデルは総パラメータ310B、トークンごとのアクティブは15Bです。
- テキスト・画像・動画・音声を受け付け、テキストを返します。
- API は100万トークンのコンテキスト、最大128Kの出力、ツールコール、ウェブ検索、ストリーミング、構造化出力、コンテキストキャッシュに対応します。
- 公表値には Terminal-Bench 2.0 で65.8、SWE-Bench Pro で56.1が含まれます。
- Xiaomi の現行 MiMo-V2.5-Pro モデルカードは総1.02T、アクティブ42Bのパラメータを記載。公表の SWE-Bench Pro スコアは MiMo-V2.5 が56.1、Pro が57.2。いずれも日付のある発行元公表値であり、特定のコーディングワークフローを保証するものではありません。
- 現在の Xiaomi 料金では、標準の入力/出力は $0.14/$0.28(百万トークンあたり)、Pro は $0.435/$0.87。
- CometAPI の両 API は公式のキャッシュ未使用価格ペアより20%低く設定されています。
確認日: 2026年9月28日。価格、ベンチマーク、上限、提供状況、リクエスト形式は変更される可能性があります。Xiaomi は公式の mimo-v2.5 と mimo-v2.5-pro の API モデル名を2026年10月21日10時(北京時間)に非推奨化予定で、自動置換はありません。移行計画を立て、デプロイ前に実稼働ルートを確認してください。
API ライフサイクルの注意: 公式の Xiaomi プラットフォームは 10月21日に V2.5 の両モデル ID を廃止予定です。この通知は Xiaomi の API プラットフォームに関するものです。サードパーティのゲートウェイは別途確認してください。 Xiaomi モデル廃止のお知らせ
標準モデルとは
MiMo-V2.5 は、Xiaomi MiMo による効率志向の基盤モデルで、マルチモーダルな知覚とエージェント業務に向けられています。単一アーキテクチャでネイティブなテキスト・画像・動画・音声入力を受け付け、テキスト出力を生成します。
Xiaomi のモデルリリースログでは、MiMo-V2.5 シリーズのパブリックベータは 2026年4月23日とされています。その後、重みは MIT ライセンスで公開されました。MiMo-V2.5 は総310Bのパラメータを持ちますが、トークンごとにアクティブ化されるのは約15Bのみです。すべてのエキスパートを同時に実行せずに、大規模な専門家プールを活用します。
MiMo-V2.5-Pro は別のワークロードを対象としています。1兆パラメータ級のテキスト入力モデルで、最も難しいコーディング、ターミナル、長時間のエージェントタスクに設計されています。両バリアントは最大コンテキストが 1M で共通ですが、モダリティ、アクティブ計算量、価格が大きく異なります。
MiMo-V2.5 の仕様と機能
| 公式アーキテクチャ詳細 | 値 | 重要な理由 |
|---|---|---|
| アーキテクチャ | スパース MoE | 選択的活性化で大規模エキスパート容量を活用 |
| 総/アクティブパラメータ | 310B / 15B | アクティブ計算は総容量より大幅に小さい |
| トランスフォーマーレイヤー | 48: 1 つの Dense + 47 の MoE | 大半の層がルーティングされたエキスパートを使用 |
| ルーティングエキスパート数 | 256;トークンごとに 8 がアクティブ | 310B をフル実行せず専門性を確保 |
| アテンション | 39 の SWA + 9 のグローバル層 | 局所効率と長距離フローのバランス |
| SWA ウィンドウ | 128 トークン | 長コンテキストのキャッシュ圧力を軽減 |
| コンテキスト/最大出力 | 1M / 128K トークン | 長大な文書と拡張トレースをサポート |
| 入力/出力 | テキスト・画像・動画・音声 / テキスト | 4 種の入力タイプをネイティブに処理 |
| ビジョンエンコーダ | 729M の ViT;28 層 | 画像・動画の理解 |
| オーディオエンコーダ | 261M のトランスフォーマー;24 層 | ネイティブな音声理解 |
| マルチトークン予測 | 3 モジュール;約 329M パラメータ | 推測デコーディングによる効率化をサポート |
| 学習規模 | 約 48T トークン | 幅広いテキスト/マルチモーダル学習パイプライン |
| API 機能 | ツール、ウェブ、ストリーミング、構造化出力、キャッシュ | 本番志向のエージェント基盤機能 |
| ライセンス | MIT | 商用利用と改変が可能 |
運用上の許容範囲には 1M のコンテキストと 128K の出力に加え、1 分あたり 100 リクエスト、1 分あたり 1000 万トークンという公表上限が含まれます。プロバイダレベルの上限はアカウントや統合ルートにより異なる場合があります。
Xiaomi MiMo の公式アーキテクチャ図。 公式アーキテクチャアセット.
MiMo-V2.5 のアーキテクチャの仕組み
スパースエキスパート: 総容量はアクティブ計算量ではない
中核となる効率のポイントは、総310B・アクティブ15Bという設計です。ルータがトークンごとに 256 のエキスパートから 8 を選択します。これにより、従来の 15B の Dense モデルより大きなパラメータプールにアクセスしつつ、毎回 310B 全てを実行する必要がありません。
これはセルフホスティングを容易にするものではありません。完全な重みは依然として保存と配布が必要で、メモリ容量、インターコネクト帯域、エキスパートルーティング、サービングソフトウェアが依然として重要な制約です。
長文脈のためのハイブリッドアテンション
バックボーンはスライディングウィンドウ型とグローバルアテンションを5:1 の SWA 対グローバル比で交互に配置しています。39 のローカル層がキャッシュ成長を抑制し、9 のグローバル層が長距離の情報フローを維持します。Xiaomi は、全層グローバル構成に比べて KV キャッシュをほぼ 6 倍削減できると報告しています。
100万トークンの最大値は容量であり、精度の保証ではありません。検索品質、レイテンシ、ツール状態の増大、遠距離証拠へのアテンションは、ワークロード固有に評価が必要です。
ネイティブエンコーダとエージェント機能
729M パラメータのビジョントランスフォーマーが画像と動画入力を、261M パラメータのオーディオトランスフォーマーが音声入力を処理します。プロジェクタが両ストリームを言語バックボーンへ写像し、スクリーンショット、動画セグメント、音声トラック、テキスト指示、ツール結果を 1 つのエージェントで組み合わせられます。
3 つのマルチトークン予測モジュールが推測デコーディングと強化学習の効率を支えます。モデルは約 48T トークンで学習され、ポストトレーニングで段階的にコンテキストが 1M へ拡張されました。
オープン重みはMIT ライセンスを採用しています。商用デプロイは可能ですが、インフラコストやサードパーティ依存は別途レビューが必要です。
MiMo-V2.5 のベンチマーク: コーディング、エージェント、マルチモーダル結果
ベンチマークに関する注意:
以下の数値は発行元公表値です。方向性を示す参考であり、特定のリポジトリ、メディア形式、ツールスタック、レイテンシ目標、安全方針を保証するものではありません。
コーディングとエージェントの結果

Xiaomi MiMo の公式コーディング/エージェント系ベンチマークチャート。
| 公式コーディングベンチマーク | 公表スコア | 判断材料 |
|---|---|---|
| MiMo Coding Bench | 71.8 | 広範なコーディングエージェント能力 |
| Claw-Eval Text | 62.3 | 一般的なテキストエージェント完遂 |
| Terminal-Bench 2.0 | 65.8 | 対話的なターミナル実行 |
| SWE-Bench Pro | 56.1 | 実世界のソフトウェア工学 |
| Claw-Eval Multi-Turn | 63.2 | より長い多段のエージェント作業 |
| ResearchClawBench | 16.91 | 自律的なリサーチワークフロー |
結果: 実務的にはコード補完の単体性能よりツール活用が強みです。Terminal-Bench での 65.8 はターミナル中心のエージェントを裏付け、SWE-Bench Pro の 56.1 はリポジトリレベルの有用性を示唆します。研究系の低スコアは、証拠収集や引用行動を個別に評価すべきことを思い出させます。
マルチモーダルの結果

Xiaomi MiMo の公式画像・動画・マルチモーダルエージェントのベンチマークチャート。
| 公式マルチモーダルベンチマーク | 公表スコア | テスト対象能力 |
|---|---|---|
| CharXiv RQ | 81.0 | チャートとドキュメントの推論 |
| MMMU-Pro | 77.9 | 専門レベルのマルチモーダル推論 |
| HR-Bench 4K | 88.5 | 高解像度画像の理解 |
| OmniDocBench | 87.2 | ドキュメント理解 |
| Claw-Eval Multimodal | 23.8 | マルチモーダルエージェント完遂 |
| Video-MME | 87.7 | 動画理解 |
| DailyOmni | 83.5 | 日常的な視聴覚推論 |
| VideoHolmes | 64.0 | 時系列動画推論 |
結果: ドキュメント、高解像度画像、動画の理解が最も明確な強みです。マルチモーダルエージェントの 23.8 は知覚系より低いので、メディア理解とツール操作の双方が必要なシステムはエンドツーエンドで評価すべきです。
MiMo-V2.5 と MiMo-V2.5-Pro の多次元比較
| 公式アーキテクチャ比較 | MiMo-V2.5 | MiMo-V2.5-Pro Official Pro specifications Official Pro benchmarks | 実務上の含意 |
|---|---|---|---|
| 総パラメータ | 310B | 1.02T | Pro は総容量が 3 倍超 |
| アクティブパラメータ | 15B | 42B | Pro は約 2.8 倍のアクティブパラメータ |
| レイヤー/ルーティングエキスパート | 48 / 256 | 70 / 384 | Pro はより大きなサービングターゲット |
| モデルカードのコンテキスト上限 | 1M | 1M | 両者とも最大 1M を表記。実ワークロードサイズで検索とレイテンシを検証 |
| 公式 API の最大出力 | 128K | 128K | 現行 Xiaomi API ページでは両者 128K。プロバイダ固有の上限は異なる可能性 |
| ネイティブ入力 | テキスト・画像・動画・音声 | テキスト | MiMo-V2.5 は文書化されたマルチモーダルの選択肢。Pro エンドポイントでメディア可否を要確認 |
| SWE-Bench Pro | 56.1 | 57.2 | Pro が 1.1 ポイント上回る |
| Terminal-Bench 2.0 | 65.8 | 68.4 | Pro が 2.6 ポイント上回る |
| 主な適合領域 | 効率重視のマルチモーダルエージェント | 複雑なコーディングと長時間エージェント | モデルレベルの差は小さく、一般的な品質優位を証明するものではない。ワークロードで選定 |
比較結果: Pro は共有するコーディング/エージェント系の 2 テストでの優位は控えめである一方、標準版はネイティブな画像・動画・音声入力を備え、アクティブパラメータが大幅に少ない。マルチモーダル入力や低単価よりも、難タスク完遂の小さな上積みの価値が高い場合に Pro を正当化できます。
MiMo-V2.5 と MiMo-V2.5-Pro はいくらかかる?
| 価格基準: 2026年5月27日 | 公式標準 API | 公式 Pro API | CometAPI の MiMo-V2.5 API | CometAPI の MiMo-V2.5-Pro API |
|---|---|---|---|---|
| 入力(キャッシュミス)/百万トークン | $0.14 | $0.435 | $0.112 | $0.348 |
| 出力/百万トークン | $0.28 | $0.87 | $0.224 | $0.696 |
| 入力(キャッシュヒット)/百万トークン | $0.0028 | $0.0036 | ライブ課金を要確認 | ライブ課金を要確認 |
| 公式の非キャッシュ価格比の割引 | 基準 | 基準 | 20% | 20% |
公式料金では、Pro は標準の約 3.1 倍の単価(入力/出力とも)です。上記のプロバイダ価格は各非キャッシュ価格ペアを 20% 削減しますが、両バリアント間の相対差は本質的に変わりません。
トークン単価は総コストではありません。ツール再試行、コンテキストサイズ、出力量、レイテンシ、失敗時のリカバリ、人手レビューがタスク完了あたりのコストを決めます。標準的なワークロードサンプルで試験してから、デフォルトの本番モデルを選定してください。
MiMo-V2.5 が最も適している用途
- マルチモーダルエージェント: スクリーンショット、ドキュメント、動画、音声、指示、ツールを 1 つのワークフローで統合
- 長文書分析: リポジトリ、契約書、研究アーカイブ、ログ、サポート履歴の処理
- メディア理解: 動画要約、イベント抽出、チャート解釈、視聴覚 Q&A
- コーディング/ターミナルエージェント: ファイル検査、コマンド実行、コード修正、テスト結果への反復
- 大量自動化: スパース活性化と低トークン価格で反復的な本番タスクに対応
制限事項とリスク
- トークンごとのアクティブは 15B ですが、セルフホスティングには 310B 全重みのシステムが必要です。
- マルチモーダル出力はテキストのみ。画像・音声・動画の生成には別モデルが必要です。
- 100万トークンの上限は、ウィンドウ全体で均一な検索精度を保証しません。
- 発行元のベンチマークは、カスタムツール、リポジトリ、プロンプト、安全制約に転移しない可能性があります。
- プロバイダによるモダリティの露出は、基となるオープン重みモデルの全機能と異なる場合があります。
運用投入前のゲート:
代表タスクで、精度、ツールコール完了、レイテンシ、トークン消費、モダリティ処理、フォールバック動作を検証してからトラフィックを投入してください。
API 例
以下の Python 例は、OpenAI 互換の CometAPI エンドポイントと標準モデル ID を使用します。デプロイ前に現在のエンドポイントとサポートされるリクエストスキーマを確認してください。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
max_retries=0,
)
response = client.chat.completions.create(
model="mimo-v2.5",
max_tokens=256,
messages=[
{
"role": "user",
"content": "Summarize the main findings in this technical report.",
}
],
)
print(response.choices[0].message.content)
選定ガイド
| ワークロードのシグナル | まず選ぶ | 切り替える条件 |
|---|---|---|
| 画像・動画・音声が第一級の入力である | 標準 | マルチモーダルの前処理を許容しない限り切り替えない |
| 大量のドキュメントまたは混在メディア | 標準 | 推論失敗がコストの主因となる場合のみ Pro |
| 難易度の高いリポジトリエンジニアリング | 両方検証 | Pro の完遂向上が 3.1 倍の単価差を相殺する場合は Pro |
| 長い自律的ターミナル動作 | Pro | 向上が測定できないなら標準へ戻す |
| 大量の定型自動化 | 標準 | 失敗タスクまたは高付加価値タスクのみをエスカレーション |
推奨ルーティング:
マルチモーダルと大量処理は標準をデフォルトにし、難度の高いテキスト中心のコーディングや長時間タスクのみを Pro に振り分ける。これにより能力を維持しつつ総コストを抑制できます。
結論
標準モデルは単なる小型の Pro ではありません。ネイティブなマルチモーダル入力、100万トークンのコンテキスト、ツール志向ベンチマークの強さ、15B のアクティブパラメータを低単価で実現する、独自の最適化ポイントです。
Pro は、難易度の高いソフトウェアエンジニアリングと持続的な自律実行に特化した選択肢です。追加容量は測定可能な向上を生みますが普遍的ではないため、全リクエストで一方を固定するのではなく、ワークロードに基づくルーティングが最も有効です。
FAQ
標準モデルはオープンソースですか?
重みは MIT ライセンスで公開されており、ライセンス条件の範囲で商用利用、改変、ファインチューニング、再配布が可能です。
パラメータ数はどれくらいですか?
スパース MoE は総 310B のパラメータを持ち、トークンごとに 15B がアクティブ化されます。アクティブパラメータはトークンあたりの計算量を表し、モデル全体の保存サイズを意味するものではありません。
画像・動画・音声に対応していますか?
はい。標準バリアントはテキスト、画像、動画、音声を受け付け、テキストを返します。Pro バリアントの公式仕様はテキスト入力を記載しています。
最大コンテキストウィンドウは?
両モデルカードとも最大 1M トークンのコンテキストウィンドウを記載しています。Xiaomi の現行 API ページでは MiMo-V2.5 と MiMo-V2.5-Pro の最大出力は 128K と記載。実際に利用できる上限はエンドポイント、プロバイダ、アカウント、リクエスト形式により異なる場合があるため、依存する前にデプロイ済みルートで確認してください。
現行の公式 Pro API ページは、1M のコンテキストと 128K の最大出力を別途確認しています: MiMo-V2.5-Pro API specifications
コーディングエージェントにはどちらが良いですか?
共有するコーディング/ターミナル系ベンチマークでは Pro が高い結果を報告していますが、その差は控えめです。対象リポジトリで両方を試し、タスク完了率、レイテンシ、総コストで選んでください。
マルチモーダルエージェントにはどちらが良いですか?
標準バリアントが自然な選択です。ネイティブに画像・動画・音声入力を受け付けます。Pro はテキスト入力に特化しています。
本番チームはどう選ぶべきですか?
まず標準で開始し、失敗を計測し、Pro の恩恵がある難度の高いテキスト中心タスクのみを振り分けます。トークン単価ではなく、タスク完了あたりのコストで比較してください。
