GPT-6.1 Sol are now live on CometAPI →
ai-model/CometAPIリサーチ

MiMo-V2.5 とは? 仕様、ベンチマーク、機能、価格、APIアクセス

Xiaomi MiMo-V2.5 の仕様、アーキテクチャ、公式ベンチマーク、価格、MiMo-V2.5-Pro との比較、ユースケース、制限事項、および CometAPI へのアクセスを調査してください。

CometAPI
Deon GoodwinAIモデルとAPIの調査チーム
更新日 Oct 5, 2026 5 分読み
MiMo-V2.5 とは? 仕様、ベンチマーク、機能、価格、APIアクセス
このパターンを使う

最初のAPI呼び出しを行う。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

要点

Xiaomi の標準 V2.5 モデルは、ネイティブなテキスト・画像・動画・音声の理解に、100万トークンのコンテキストウィンドウ、ツール使用、スパースな Mixture-of-Experts の効率を組み合わせています。マルチモーダル入力とタスク完了あたりのコストが重要な場合に適しています。Pro 版はより大きく、高難度のコーディングや長時間のエージェント動作で強力ですが、テキスト入力に特化しており、Xiaomi 公表の料金ではトークン単価がおよそ3倍です。

実務上の判断はシンプルです。マルチモーダルエージェント、ドキュメント/メディア分析、大量自動化には標準モデルを選び、ボトルネックが難易度の高いソフトウェアエンジニアリングや持続的な自律実行にある場合は Pro を選びます。

重要なポイント

  • 標準モデルは総パラメータ310B、トークンごとのアクティブは15Bです。
  • テキスト・画像・動画・音声を受け付け、テキストを返します。
  • API は100万トークンのコンテキスト、最大128Kの出力、ツールコール、ウェブ検索、ストリーミング、構造化出力、コンテキストキャッシュに対応します。
  • 公表値には Terminal-Bench 2.0 で65.8、SWE-Bench Pro で56.1が含まれます。
  • Xiaomi の現行 MiMo-V2.5-Pro モデルカードは総1.02T、アクティブ42Bのパラメータを記載。公表の SWE-Bench Pro スコアは MiMo-V2.5 が56.1、Pro が57.2。いずれも日付のある発行元公表値であり、特定のコーディングワークフローを保証するものではありません。
  • 現在の Xiaomi 料金では、標準の入力/出力は $0.14/$0.28(百万トークンあたり)、Pro は $0.435/$0.87。
  • CometAPI の両 API は公式のキャッシュ未使用価格ペアより20%低く設定されています。
    確認日: 2026年9月28日。価格、ベンチマーク、上限、提供状況、リクエスト形式は変更される可能性があります。Xiaomi は公式の mimo-v2.5 と mimo-v2.5-pro の API モデル名を2026年10月21日10時(北京時間)に非推奨化予定で、自動置換はありません。移行計画を立て、デプロイ前に実稼働ルートを確認してください。

API ライフサイクルの注意: 公式の Xiaomi プラットフォームは 10月21日に V2.5 の両モデル ID を廃止予定です。この通知は Xiaomi の API プラットフォームに関するものです。サードパーティのゲートウェイは別途確認してください。 Xiaomi モデル廃止のお知らせ

標準モデルとは

MiMo-V2.5 は、Xiaomi MiMo による効率志向の基盤モデルで、マルチモーダルな知覚とエージェント業務に向けられています。単一アーキテクチャでネイティブなテキスト・画像・動画・音声入力を受け付け、テキスト出力を生成します。

Xiaomi のモデルリリースログでは、MiMo-V2.5 シリーズのパブリックベータは 2026年4月23日とされています。その後、重みは MIT ライセンスで公開されました。MiMo-V2.5 は総310Bのパラメータを持ちますが、トークンごとにアクティブ化されるのは約15Bのみです。すべてのエキスパートを同時に実行せずに、大規模な専門家プールを活用します。

MiMo-V2.5-Pro は別のワークロードを対象としています。1兆パラメータ級のテキスト入力モデルで、最も難しいコーディング、ターミナル、長時間のエージェントタスクに設計されています。両バリアントは最大コンテキストが 1M で共通ですが、モダリティ、アクティブ計算量、価格が大きく異なります。

MiMo-V2.5 の仕様と機能

公式アーキテクチャ詳細値重要な理由
アーキテクチャスパース MoE選択的活性化で大規模エキスパート容量を活用
総/アクティブパラメータ310B / 15Bアクティブ計算は総容量より大幅に小さい
トランスフォーマーレイヤー48: 1 つの Dense + 47 の MoE大半の層がルーティングされたエキスパートを使用
ルーティングエキスパート数256;トークンごとに 8 がアクティブ310B をフル実行せず専門性を確保
アテンション39 の SWA + 9 のグローバル層局所効率と長距離フローのバランス
SWA ウィンドウ128 トークン長コンテキストのキャッシュ圧力を軽減
コンテキスト/最大出力1M / 128K トークン長大な文書と拡張トレースをサポート
入力/出力テキスト・画像・動画・音声 / テキスト4 種の入力タイプをネイティブに処理
ビジョンエンコーダ729M の ViT;28 層画像・動画の理解
オーディオエンコーダ261M のトランスフォーマー;24 層ネイティブな音声理解
マルチトークン予測3 モジュール;約 329M パラメータ推測デコーディングによる効率化をサポート
学習規模約 48T トークン幅広いテキスト/マルチモーダル学習パイプライン
API 機能ツール、ウェブ、ストリーミング、構造化出力、キャッシュ本番志向のエージェント基盤機能
ライセンスMIT商用利用と改変が可能

運用上の許容範囲には 1M のコンテキストと 128K の出力に加え、1 分あたり 100 リクエスト、1 分あたり 1000 万トークンという公表上限が含まれます。プロバイダレベルの上限はアカウントや統合ルートにより異なる場合があります。

MiMo-V2.5 とは? 仕様、ベンチマーク、機能、価格、APIアクセス

Xiaomi MiMo の公式アーキテクチャ図。 公式アーキテクチャアセット.

MiMo-V2.5 のアーキテクチャの仕組み

スパースエキスパート: 総容量はアクティブ計算量ではない

中核となる効率のポイントは、総310B・アクティブ15Bという設計です。ルータがトークンごとに 256 のエキスパートから 8 を選択します。これにより、従来の 15B の Dense モデルより大きなパラメータプールにアクセスしつつ、毎回 310B 全てを実行する必要がありません。

これはセルフホスティングを容易にするものではありません。完全な重みは依然として保存と配布が必要で、メモリ容量、インターコネクト帯域、エキスパートルーティング、サービングソフトウェアが依然として重要な制約です。

長文脈のためのハイブリッドアテンション

バックボーンはスライディングウィンドウ型とグローバルアテンションを5:1 の SWA 対グローバル比で交互に配置しています。39 のローカル層がキャッシュ成長を抑制し、9 のグローバル層が長距離の情報フローを維持します。Xiaomi は、全層グローバル構成に比べて KV キャッシュをほぼ 6 倍削減できると報告しています。

100万トークンの最大値は容量であり、精度の保証ではありません。検索品質、レイテンシ、ツール状態の増大、遠距離証拠へのアテンションは、ワークロード固有に評価が必要です。

ネイティブエンコーダとエージェント機能

729M パラメータのビジョントランスフォーマーが画像と動画入力を、261M パラメータのオーディオトランスフォーマーが音声入力を処理します。プロジェクタが両ストリームを言語バックボーンへ写像し、スクリーンショット、動画セグメント、音声トラック、テキスト指示、ツール結果を 1 つのエージェントで組み合わせられます。

3 つのマルチトークン予測モジュールが推測デコーディングと強化学習の効率を支えます。モデルは約 48T トークンで学習され、ポストトレーニングで段階的にコンテキストが 1M へ拡張されました。

オープン重みはMIT ライセンスを採用しています。商用デプロイは可能ですが、インフラコストやサードパーティ依存は別途レビューが必要です。

MiMo-V2.5 のベンチマーク: コーディング、エージェント、マルチモーダル結果

ベンチマークに関する注意:

以下の数値は発行元公表値です。方向性を示す参考であり、特定のリポジトリ、メディア形式、ツールスタック、レイテンシ目標、安全方針を保証するものではありません。

コーディングとエージェントの結果

MiMo-V2.5 とは? 仕様、ベンチマーク、機能、価格、APIアクセス

Xiaomi MiMo の公式コーディング/エージェント系ベンチマークチャート。

公式コーディングベンチマーク公表スコア判断材料
MiMo Coding Bench71.8広範なコーディングエージェント能力
Claw-Eval Text62.3一般的なテキストエージェント完遂
Terminal-Bench 2.065.8対話的なターミナル実行
SWE-Bench Pro56.1実世界のソフトウェア工学
Claw-Eval Multi-Turn63.2より長い多段のエージェント作業
ResearchClawBench16.91自律的なリサーチワークフロー

結果: 実務的にはコード補完の単体性能よりツール活用が強みです。Terminal-Bench での 65.8 はターミナル中心のエージェントを裏付け、SWE-Bench Pro の 56.1 はリポジトリレベルの有用性を示唆します。研究系の低スコアは、証拠収集や引用行動を個別に評価すべきことを思い出させます。

マルチモーダルの結果

MiMo-V2.5 とは? 仕様、ベンチマーク、機能、価格、APIアクセス

Xiaomi MiMo の公式画像・動画・マルチモーダルエージェントのベンチマークチャート。

公式マルチモーダルベンチマーク公表スコアテスト対象能力
CharXiv RQ81.0チャートとドキュメントの推論
MMMU-Pro77.9専門レベルのマルチモーダル推論
HR-Bench 4K88.5高解像度画像の理解
OmniDocBench87.2ドキュメント理解
Claw-Eval Multimodal23.8マルチモーダルエージェント完遂
Video-MME87.7動画理解
DailyOmni83.5日常的な視聴覚推論
VideoHolmes64.0時系列動画推論

結果: ドキュメント、高解像度画像、動画の理解が最も明確な強みです。マルチモーダルエージェントの 23.8 は知覚系より低いので、メディア理解とツール操作の双方が必要なシステムはエンドツーエンドで評価すべきです。

MiMo-V2.5 と MiMo-V2.5-Pro の多次元比較

公式アーキテクチャ比較MiMo-V2.5MiMo-V2.5-Pro
Official Pro specifications
Official Pro benchmarks
実務上の含意
総パラメータ310B1.02TPro は総容量が 3 倍超
アクティブパラメータ15B42BPro は約 2.8 倍のアクティブパラメータ
レイヤー/ルーティングエキスパート48 / 25670 / 384Pro はより大きなサービングターゲット
モデルカードのコンテキスト上限1M1M両者とも最大 1M を表記。実ワークロードサイズで検索とレイテンシを検証
公式 API の最大出力128K128K現行 Xiaomi API ページでは両者 128K。プロバイダ固有の上限は異なる可能性
ネイティブ入力テキスト・画像・動画・音声テキストMiMo-V2.5 は文書化されたマルチモーダルの選択肢。Pro エンドポイントでメディア可否を要確認
SWE-Bench Pro56.157.2Pro が 1.1 ポイント上回る
Terminal-Bench 2.065.868.4Pro が 2.6 ポイント上回る
主な適合領域効率重視のマルチモーダルエージェント複雑なコーディングと長時間エージェントモデルレベルの差は小さく、一般的な品質優位を証明するものではない。ワークロードで選定

比較結果: Pro は共有するコーディング/エージェント系の 2 テストでの優位は控えめである一方、標準版はネイティブな画像・動画・音声入力を備え、アクティブパラメータが大幅に少ない。マルチモーダル入力や低単価よりも、難タスク完遂の小さな上積みの価値が高い場合に Pro を正当化できます。

MiMo-V2.5 と MiMo-V2.5-Pro はいくらかかる?

価格基準: 2026年5月27日公式標準 API公式 Pro APICometAPI の MiMo-V2.5 APICometAPI の MiMo-V2.5-Pro API
入力(キャッシュミス)/百万トークン$0.14$0.435$0.112$0.348
出力/百万トークン$0.28$0.87$0.224$0.696
入力(キャッシュヒット)/百万トークン$0.0028$0.0036ライブ課金を要確認ライブ課金を要確認
公式の非キャッシュ価格比の割引基準基準20%20%

公式料金では、Pro は標準の約 3.1 倍の単価(入力/出力とも)です。上記のプロバイダ価格は各非キャッシュ価格ペアを 20% 削減しますが、両バリアント間の相対差は本質的に変わりません。

トークン単価は総コストではありません。ツール再試行、コンテキストサイズ、出力量、レイテンシ、失敗時のリカバリ、人手レビューがタスク完了あたりのコストを決めます。標準的なワークロードサンプルで試験してから、デフォルトの本番モデルを選定してください。

MiMo-V2.5 が最も適している用途

  • マルチモーダルエージェント: スクリーンショット、ドキュメント、動画、音声、指示、ツールを 1 つのワークフローで統合
  • 長文書分析: リポジトリ、契約書、研究アーカイブ、ログ、サポート履歴の処理
  • メディア理解: 動画要約、イベント抽出、チャート解釈、視聴覚 Q&A
  • コーディング/ターミナルエージェント: ファイル検査、コマンド実行、コード修正、テスト結果への反復
  • 大量自動化: スパース活性化と低トークン価格で反復的な本番タスクに対応

制限事項とリスク

  • トークンごとのアクティブは 15B ですが、セルフホスティングには 310B 全重みのシステムが必要です。
  • マルチモーダル出力はテキストのみ。画像・音声・動画の生成には別モデルが必要です。
  • 100万トークンの上限は、ウィンドウ全体で均一な検索精度を保証しません。
  • 発行元のベンチマークは、カスタムツール、リポジトリ、プロンプト、安全制約に転移しない可能性があります。
  • プロバイダによるモダリティの露出は、基となるオープン重みモデルの全機能と異なる場合があります。

運用投入前のゲート:

代表タスクで、精度、ツールコール完了、レイテンシ、トークン消費、モダリティ処理、フォールバック動作を検証してからトラフィックを投入してください。

API 例

以下の Python 例は、OpenAI 互換の CometAPI エンドポイントと標準モデル ID を使用します。デプロイ前に現在のエンドポイントとサポートされるリクエストスキーマを確認してください。

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
    max_retries=0,
)

response = client.chat.completions.create(
    model="mimo-v2.5",
    max_tokens=256,
    messages=[
        {
            "role": "user",
            "content": "Summarize the main findings in this technical report.",
        }
    ],
)

print(response.choices[0].message.content)

選定ガイド

ワークロードのシグナルまず選ぶ切り替える条件
画像・動画・音声が第一級の入力である標準マルチモーダルの前処理を許容しない限り切り替えない
大量のドキュメントまたは混在メディア標準推論失敗がコストの主因となる場合のみ Pro
難易度の高いリポジトリエンジニアリング両方検証Pro の完遂向上が 3.1 倍の単価差を相殺する場合は Pro
長い自律的ターミナル動作Pro向上が測定できないなら標準へ戻す
大量の定型自動化標準失敗タスクまたは高付加価値タスクのみをエスカレーション

推奨ルーティング:

マルチモーダルと大量処理は標準をデフォルトにし、難度の高いテキスト中心のコーディングや長時間タスクのみを Pro に振り分ける。これにより能力を維持しつつ総コストを抑制できます。

結論

標準モデルは単なる小型の Pro ではありません。ネイティブなマルチモーダル入力、100万トークンのコンテキスト、ツール志向ベンチマークの強さ、15B のアクティブパラメータを低単価で実現する、独自の最適化ポイントです。

Pro は、難易度の高いソフトウェアエンジニアリングと持続的な自律実行に特化した選択肢です。追加容量は測定可能な向上を生みますが普遍的ではないため、全リクエストで一方を固定するのではなく、ワークロードに基づくルーティングが最も有効です。

FAQ

標準モデルはオープンソースですか?

重みは MIT ライセンスで公開されており、ライセンス条件の範囲で商用利用、改変、ファインチューニング、再配布が可能です。

パラメータ数はどれくらいですか?

スパース MoE は総 310B のパラメータを持ち、トークンごとに 15B がアクティブ化されます。アクティブパラメータはトークンあたりの計算量を表し、モデル全体の保存サイズを意味するものではありません。

画像・動画・音声に対応していますか?

はい。標準バリアントはテキスト、画像、動画、音声を受け付け、テキストを返します。Pro バリアントの公式仕様はテキスト入力を記載しています。

最大コンテキストウィンドウは?

両モデルカードとも最大 1M トークンのコンテキストウィンドウを記載しています。Xiaomi の現行 API ページでは MiMo-V2.5 と MiMo-V2.5-Pro の最大出力は 128K と記載。実際に利用できる上限はエンドポイント、プロバイダ、アカウント、リクエスト形式により異なる場合があるため、依存する前にデプロイ済みルートで確認してください。

現行の公式 Pro API ページは、1M のコンテキストと 128K の最大出力を別途確認しています: MiMo-V2.5-Pro API specifications

コーディングエージェントにはどちらが良いですか?

共有するコーディング/ターミナル系ベンチマークでは Pro が高い結果を報告していますが、その差は控えめです。対象リポジトリで両方を試し、タスク完了率、レイテンシ、総コストで選んでください。

マルチモーダルエージェントにはどちらが良いですか?

標準バリアントが自然な選択です。ネイティブに画像・動画・音声入力を受け付けます。Pro はテキスト入力に特化しています。

本番チームはどう選ぶべきですか?

まず標準で開始し、失敗を計測し、Pro の恩恵がある難度の高いテキスト中心タスクのみを振り分けます。トークン単価ではなく、タスク完了あたりのコストで比較してください。

学習を続ける

この記事を次の判断につなげる。

すべてのトピックを見る
公開日 Oct 5, 2026
最終更新 Oct 5, 2026
0 回視聴
明確性、出典の帰属、最新のAPI用語について確認済みです。

もっと読む