TL;DR
MiMo-V2.5 API in CometAPI は、コーディング、マルチモーダル理解、エージェント系ワークロード向けの Xiaomi の疎な Mixture-of-Experts モデルへアクセスを提供します。MiMo-V2.5 API は、100 万トークンのコンテキストウィンドウ、ネイティブなマルチモーダル入力、低トークンコストが必要なプロジェクトで実用的なデフォルトです。MiMo-V2.5 Pro は、難度の高いコーディングや推論、長期のツール使用で価格よりも性能が重要な場合に適しています。本ガイドでは、CometAPI 経由での API 呼び出し方法、レスポンスのストリーミング、マルチモーダルリクエストの構成、コスト見積、そして本番統合の堅牢化方法を示します。
Key Takeaways
- MiMo-V2.5 モデルは総計 310B パラメータで、トークンごとのアクティブパラメータは 15B、コンテキストウィンドウは 100 万トークンです。
- マルチモーダル作業、大規模コンテキスト分析、コスト重視のエージェントには MiMo-V2.5 ルートを、最難度のコーディングや推論には MiMo-V2.5 Pro を使用します。
- OpenAI 互換エンドポイントにより移行は容易ですが、本番システムではタイムアウト、再試行ロジック、トークン予算、プロバイダ側の機能確認が依然として必要です。
- CometAPI の提示レートでは、入力 10,000 トークン・出力 2,000 トークンのリクエストは MiMo-V2.5 ルートで約 $0.001568 です。
MiMo-V2.5 Model Overview
Xiaomi は 2026 年 4 月 22 日にモデルを発表しました。MiMo-V2.5 API in CometAPI は OpenAI 互換の chat-completions インターフェース経由で公開されており、既存クライアントはベース URL、API キー、モデル識別子を変更するだけで移行できる場合がほとんどです。
公式モデルカードによれば、このモデルは疎な MoE 言語バックボーンに、専用のビジョンおよびオーディオエンコーダを組み合わせています。テキスト、画像、動画、音声入力を受け付け、テキスト出力を生成します。大きなコンテキストウィンドウは、リポジトリ規模のコードレビュー、文書セット、長い書き起こし、マルチステップのエージェントに有用です。
| Specification | Value | Why it matters |
|---|---|---|
| Architecture | Sparse mixture of experts | 各トークンでネットワークの一部のみを活性化します。 |
| Total parameters | 310B | 各トークンで全パラメータを使わずに広い容量を提供します。 |
| Active parameters | 15B | 総モデルサイズに対して効率的な推論を支援します。 |
| Context window | 1,000,000 tokens | 大規模リポジトリや長大な文書コレクションを扱えます。 |
| Maximum output | Up to 128K tokens through the current route | 長文レポートや拡張的なコード生成を支援します。 |
| Native inputs | Text, image, video, audio | 統合されたマルチモーダルワークフローを可能にします。 |
| Output modality | Text | 応答は生成テキストとして返されます。 |
| Vision encoder | 729M-parameter ViT | 画像・動画タスク向けに視覚コンテンツを処理します。 |
| Audio encoder | 261M-parameter Transformer | 音声やその他のオーディオ入力を処理します。 |
| License | MIT | ライセンス条件のもとで幅広い商用・研究利用を許容します。 |
以下の公式マルチモーダルベンチマーク画像は、画像理解、マルチモーダルエージェント、動画理解タスクにおける結果を示しています。

Xiaomi MiMo-V2.5 の公式マルチモーダルベンチマーク比較
プロバイダのルートが公開するメディア形式は、基盤モデルがサポートする形式よりも狭い場合があります。マルチモーダル機能を出荷する前に、アクティブなエンドポイントで受け付けられる画像・音声・動画のペイロード形式を必ず検証してください。
MiMo-V2.5 Benchmark Performance
Xiaomi は、コーディング、ターミナル操作、マルチモーダルエージェント評価で強力な結果を報告しています。これらの数値はモデルの位置付けに有用ですが、自身のプロンプト、ツール、レイテンシ目標、障害条件でのテストに代わるものではありません。
| Benchmark | Reported score | Evaluation focus |
|---|---|---|
| SWE-Bench Pro | 56.1 | リポジトリレベルのソフトウェアエンジニアリング |
| Terminal-Bench 2.0 | 65.8 | ターミナルベースのエージェントタスク |
| Claw-Eval General | 62.1 Pass@3 | 一般的なエージェント能力 |
| Claw-Eval Multimodal | 23.8 Pass@3 | マルチモーダルエージェントタスク |
| Claw-Eval Multi-Turn | 63.2 Pass@3 | マルチターンのエージェント挙動 |
| ResearchClawBench | 16.91 | 研究指向のエージェントワークフロー |
公式のコーディング比較では、Terminal-Bench 2.0 で 65.8、SWE-Bench Pro で 56.1 を示すとともに、より広いコーディングエージェント比較でもモデルを位置付けています。

Xiaomi MiMo-V2.5 の公式コーディングベンチマーク比較
示唆される点: このモデルは、コード、ツール、混在メディアを組み合わせたアプリケーションに特に魅力的です。決定論的な本番判断には、タスク成功率、トークン使用量、エンドツーエンドのレイテンシ、再試行頻度、人手での修正率を測定する内部評価を実施してください。
MiMo-V2.5 vs MiMo-V2.5 Pro: A Multi-Dimensional Comparison
| Dimension | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| Total parameters | 310B | 1.02T |
| Active parameters | 15B | 42B |
| Context window | 1M tokens | 1M tokens |
| Primary strength | オムニモーダルおよび一般的なエージェントワークロード | 複雑なエージェントと高難度のコーディング |
| Input price per 1M tokens | $0.112 | $0.348 |
| Output price per 1M tokens | $0.224 | $0.696 |
| Best fit | マルチモーダル・大規模コンテキスト・コスト重視のシステム | 高度な推論・コーディング・長期的な実行 |
| Official API input modalities | Text, image, video, audio | Text |
| Official API output modality | Text | Text |
比較結果: コスト、スループット、マルチモーダル対応が意思決定の主因である場合は、まず MiMo-V2.5 ルートから始めてください。難度の高いコーディング、推論、ツール使用のケースで内部評価により有意な精度向上が示されたリクエストのみを MiMo-V2.5 Pro に切り替えます。全件を MiMo-V2.5 Pro に送るよりも、階層化されたルーターの方がコストと品質のバランスが良いことが多いです。
How to Call the MiMo-V2.5 API
この API は馴染みのあるchat-completions スキーマに従います。キーはサーバ側に保持し、環境変数から読み込み、ブラウザやモバイルコードに埋め込まないでください。
Set the API key
export COMETAPI_KEY="your_api_key_here"
$env:COMETAPI_KEY = "your_api_key_here"
### Send a cURL request
curl https://api.cometapi.com/v1/chat/completions
-H "Authorization: Bearer $COMETAPI_KEY"
-H "Content-Type: application/json"
-d '{
"model": "mimo-v2.5",
"messages": [
{"role": "system", "content": "You are a careful coding assistant."},
{"role": "user", "content": "Explain the bug and propose a minimal patch."}
],
"temperature": 0.2
}'
### Use Python with the OpenAI SDK
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="mimo-v2.5",
messages=[
{"role": "system", "content": "You are a precise engineering assistant."},
{"role": "user", "content": "Review this migration plan for hidden risks."},
],
temperature=0.2,
)
print(response.choices[0].message.content)
> API キーや完全な認可ヘッダー、機密プロンプト内容をログに記録しないでください。本番ではシークレットマネージャを使用し、定めたスケジュールで認証情報をローテーションしてください。
## How to Stream MiMo-V2.5 API Responses
ストリーミングは長い回答の体感レイテンシを低減します。サービスは増分イベントを返し、SDK はチャンクとしてそれらを公開します。
stream = client.chat.completions.create(
model="mimo-v2.5",
messages=[{"role": "user", "content": "Draft a safe database migration checklist."}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)
Web サービスでは、Server-Sent Events や WebSocket メッセージでデルタを転送し、クライアントの切断を処理し、ユーザーがキャンセルしたら上流の生成を停止してください。
## MiMo-V2.5 API Multimodal and Structured Workflows
画像認識を要するタスクでは、同一の user メッセージ内にテキスト指示と画像オブジェクトを送信します。受け入れられるメディア表現はプロバイダのルートによって異なる場合があるため、以下はペイロードのパターンとして扱い、現在のルートでのサポートを確認してください。
{
"model": "mimo-v2.5",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "Extract the visible error and suggest the next diagnostic step."},
{"type": "image_url", "image_url": {"url": "https://example.com/error.png"}}
]
}
]
}
機械可読の出力が必要な場合は、コンパクトな JSON オブジェクトを要求し、自身のスキーマで検証してください。パースできるからといって、生成された JSON が安全だと決めつけないでください。
import json
raw = response.choices[0].message.content
result = json.loads(raw)
required = {"summary", "risks", "next_action"}
missing = required - result.keys()
if missing:
raise ValueError(f"Missing fields: {sorted(missing)}")
## MiMo-V2.5 API Pricing on CometAPI and Cost Control
| Route | Input per 1M tokens | Output per 1M tokens | 100-request example |
| ------------------------------ | ------------------- | -------------------- | ------------------- |
| MiMo-V2.5 | $0.112 | $0.224 | $0.1568 |
| MiMo-V2.5 Pro | $0.348 | $0.696 | $0.4872 |
| Xiaomi pay-as-you-go reference | $0.14 | $0.28 | $0.1960 |
例では、100 件のリクエストそれぞれが入力 10,000 トークン・出力 2,000 トークンであると仮定しています。この前提では、MiMo-V2.5 ルートは MiMo-V2.5 Pro より約 68% 安価です。Xiaomi の[従量課金レート](https://platform.xiaomimimo.com/docs/zh-CN/integration/roocode)は有用な参照ポイントですが、実際の請求はデプロイ前に稼働中のプロバイダ価格と照合してください。
MiMo-V2.5 input: 100 × 10,000 / 1,000,000 × $0.112 = $0.1120
MiMo-V2.5 output: 100 × 2,000 / 1,000,000 × $0.224 = $0.0448
MiMo-V2.5 total: $0.1568
Pro input: 100 × 10,000 / 1,000,000 × $0.348 = $0.3480
Pro output: 100 × 2,000 / 1,000,000 × $0.696 = $0.1392
Pro total: $0.4872
コストは最大出力量の制限、プロンプト圧縮、キャッシュ化されたコンテキスト、リクエストの分類、そして難度の高いタスクにのみエスカレーションするルーターで制御します。リクエストあたりのコストではなく、成功したタスクあたりのコストを追跡してください。安価でも失敗を繰り返すリクエストは、最終的により高くつく場合があります。
## How to Design Long-Context MiMo-V2.5 API Requests
100 万トークンのウィンドウは大きな入力を可能にしますが、検索や注意のトレードオフをなくすものではありません。モデルが関連証拠を素早く見つけられるよう、プロンプトを設計してください。
* タスク、出力の契約、判断基準を冒頭付近に置く。
* 文書を安定した識別子と明確な区切りで分ける。
* 回答に影響し得る証拠のみを含める。
* 結果に文書識別子や行参照を明記するよう求める。
* コンテキストが増えるほど精度を計測し、最大コンテキストを理想と見なさない。
> 長いコンテキストは、トークンコストと無関係な内容がモデルを攪乱する可能性の双方を増加させます。コーパス全体が収まる場合でも、検索、要約、階層型プロンプトは依然として重要です。
## Production Reliability
### Retry only transient failures
レート制限や一時的なサーバ障害には、指数バックオフとジッタで再試行します。無効な認証、ペイロード不備、ポリシー違反は自動再試行しないでください。
import random
import time
def delay_for(attempt: int) -> float:
return min(30.0, (2 ** attempt) + random.random())
for attempt in range(5):
try:
result = call_model()
break
except TransientAPIError:
if attempt == 4:
raise
time.sleep(delay_for(attempt))
### Set operational guardrails
* 接続および全体のリクエストタイムアウトを設定する。
* 外部副作用を伴うワークフローには冪等性キーを付与する。
* モデル ID、レイテンシ、入出力トークン、再試行回数、最終ステータスを記録する。
* ログ前に秘密情報や個人データをマスクする。
* ツールの許可リストと、破壊的操作の確認を必須化する。
* プロバイダ障害に備えてフォールバックモデルやキューを用意する。
## MiMo-V2.5 API Common Errors and Solutions
| Symptom | Likely cause | Recommended action |
| ------------- | ---------------------------------------------- | ---------------------------------------------------------------- |
| 401 or 403 | API キーの欠落・無効・権限不足 | サーバ側のシークレットとプロジェクト権限を確認してください。 |
| 400 | メッセージ不正または未対応メディアオブジェクト | JSON を検証し、ルート固有のペイロードサポートを確認してください。 |
| 413 | リクエストボディが大きすぎる | メディアを縮小するか、入力を分割してください。 |
| 429 | レートまたはクオータ制限 | ジッタ付きでバックオフし、クライアント側の並行制限を施してください。 |
| 5xx | 一時的なプロバイダ障害 | 予算内で再試行するか、フェイルオーバーしてください。 |
| Slow response | 大きなコンテキスト、長い出力、ツールのレイテンシ | 出力をストリーミングし、トークンを上限設定し、各段階をプロファイル。 |
| Invalid JSON | 生成の逸脱 | 検証し、安全なら一度修復、持続する場合は拒否してください。 |
## Conclusion
MiMo-V2.5 は、マルチモーダル入力、大きなコンテキスト、積極的なコスト制御を必要とするチームにとって、最良の出発点です。Pro は、測定された品質向上が高い価格を正当化するタスクに対する意図的なエスカレーション経路とすべきです。小さな評価セットから始め、すべてのリクエストに計測を施し、実際のペイロード、長文コンテキスト動作、再試行処理、障害回復をテストした後に統合を昇格させてください。
## FAQ
### What endpoint should I use?
`/api.cometapi.com/v1/chat/completions` を使用するか、OpenAI 互換 SDK でベース URL として `/api.cometapi.com/v1` を設定します。
### What model identifier should I send?
MiMo-V2.5 ルートには `mimo-v2.5` を使用します。アカウントがプロバイダ固有のエイリアスを使用する場合は、ローンチ前に現在の識別子を確認してください。
### When should I choose MiMo-V2.5 Pro?
内部評価で、難度の高いコーディング、推論、長時間のツールタスクにおいて有意な優位性が示された場合に MiMo-V2.5 Pro を選びます。品質が十分であれば、日常的またはマルチモーダルのトラフィックは MiMo-V2.5 ルートに維持してください。
### Does a 1M-token context mean I should send everything?
いいえ。大きなコンテキストは容量上限であり、プロンプト設計の目標ではありません。回答に影響しうる証拠を検索・整理して含め、入力が増えるにつれて品質とコストを測定してください。
### Can I call the API directly from a browser?
フロントエンドコードでシークレット API キーを公開しないでください。バックエンドからプロバイダを呼び出し、そこで認証、レート制限、ログ、データ制御を適用します。
### How do I verify multimodal support?
実際のメディアペイロードをアクティブなプロバイダルートでテストしてください。基盤モデルのネイティブなモダリティが、すべてのルートで同じ形式を公開することを保証するわけではありません。
