TL;DR
MiMo-V2.5 API di CometAPI menyediakan akses ke model sparse mixture-of-experts milik Xiaomi untuk pengodean, pemahaman multimodal, dan beban kerja agen. MiMo-V2.5 API adalah default praktis saat proyek membutuhkan jendela konteks 1 juta token, input multimodal native, dan biaya token rendah; MiMo-V2.5 Pro lebih cocok ketika pengodean sulit, penalaran, atau penggunaan alat berjangka panjang lebih penting daripada harga. Panduan ini menunjukkan cara memanggil API melalui CometAPI, melakukan streaming respons, menyusun permintaan multimodal, memperkirakan biaya, dan memperkuat integrasi produksi.
Key Takeaways
- Model MiMo-V2.5 menggunakan total 310B parameter dengan 15B parameter aktif per token dan mendukung jendela konteks 1M token.
- Gunakan rute MiMo-V2.5 untuk pekerjaan multimodal, analisis konteks besar, dan agen yang sensitif biaya; pilih MiMo-V2.5 Pro untuk tugas pengodean dan penalaran tersulit.
- Endpoint yang kompatibel dengan OpenAI memudahkan migrasi, tetapi sistem produksi tetap memerlukan timeouts, logika retry, anggaran token, dan pemeriksaan kapabilitas di sisi penyedia.
- Pada tarif CometAPI yang dinyatakan, sebuah permintaan dengan 10.000 token input dan 2.000 token output berbiaya sekitar $0.001568 pada rute MiMo-V2.5.
MiMo-V2.5 Model Overview
Xiaomi memperkenalkan model ini pada 22 April 2026. MiMo-V2.5 API di CometAPI mengeksposnya melalui antarmuka chat-completions yang kompatibel dengan OpenAI, sehingga klien yang ada biasanya dapat bermigrasi dengan mengganti base URL, kunci API, dan pengidentifikasi model.
Menurut model card resmi, model ini menggabungkan backbone bahasa MoE spars dengan encoder visi dan audio khusus. Model menerima input teks, gambar, video, dan audio sambil menghasilkan output teks. Jendela konteks besar berguna untuk peninjauan kode skala repositori, himpunan dokumen, transkrip panjang, dan agen multilangkah.
| Spesifikasi | Nilai | Alasan penting |
|---|---|---|
| Arsitektur | Sparse Mixture-of-Experts (MoE) | Mengaktifkan bagian terbatas jaringan untuk tiap token. |
| Total parameter | 310B | Memberi kapasitas luas tanpa memakai semua parameter per token. |
| Parameter aktif | 15B | Mendukung inferensi efisien relatif terhadap ukuran model total. |
| Jendela konteks | 1,000,000 token | Menangani repositori besar dan koleksi dokumen panjang. |
| Output maksimum | Hingga 128K token pada rute saat ini | Mendukung laporan panjang dan generasi kode yang diperluas. |
| Input native | Teks, gambar, video, audio | Memungkinkan alur kerja multimodal terpadu. |
| Modality output | Teks | Respons dikembalikan sebagai teks yang dihasilkan. |
| Encoder visi | ViT ber-parameter 729M | Memroses konten visual untuk tugas gambar dan video. |
| Encoder audio | Transformer ber-parameter 261M | Memroses ucapan dan input audio lainnya. |
| Lisensi | MIT | Mengizinkan penggunaan komersial dan riset yang luas sesuai lisensi. |
Gambar benchmark multimodal resmi di bawah ini melaporkan hasil di berbagai tugas pemahaman gambar, agen multimodal, dan pemahaman video.

Perbandingan benchmark multimodal resmi Xiaomi MiMo-V2.5
Rute penyedia dapat mengekspos set format media yang lebih sempit dibanding dukungan model dasar. Validasi format payload gambar, audio, dan video yang tepat terhadap endpoint aktif sebelum merilis fitur multimodal.
MiMo-V2.5 Benchmark Performance
Xiaomi melaporkan hasil kuat pada pengodean, penggunaan terminal, dan evaluasi agen multimodal. Angka-angka ini berguna untuk memposisikan model, namun bukan pengganti pengujian pada prompt, alat, target latensi, dan kondisi kegagalan Anda sendiri.
| Benchmark | Skor dilaporkan | Fokus evaluasi |
|---|---|---|
| SWE-Bench Pro | 56.1 | Rekayasa perangkat lunak level repositori |
| Terminal-Bench 2.0 | 65.8 | Tugas agen berbasis terminal |
| Claw-Eval General | 62.1 Pass@3 | Kapabilitas agen umum |
| Claw-Eval Multimodal | 23.8 Pass@3 | Tugas agen multimodal |
| Claw-Eval Multi-Turn | 63.2 Pass@3 | Perilaku agen multi-giliran |
| ResearchClawBench | 16.91 | Alur kerja agen berorientasi riset |
Perbandingan pengodean resmi menunjukkan 65.8 pada Terminal-Bench 2.0 dan 56.1 pada SWE-Bench Pro, sekaligus menempatkan model dalam perbandingan agen pengodean yang lebih luas.

Perbandingan benchmark pengodean resmi Xiaomi MiMo-V2.5
Apa yang disarankan hasil ini: model ini sangat menarik untuk aplikasi yang menggabungkan kode, alat, dan media campuran. Untuk keputusan produksi deterministik, jalankan evaluasi internal yang mengukur keberhasilan tugas, penggunaan token, latensi end-to-end, frekuensi retry, dan tingkat koreksi manusia.
MiMo-V2.5 vs MiMo-V2.5 Pro: Perbandingan Multi-Dimensi
| Dimensi | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| Total parameter | 310B | 1.02T |
| Parameter aktif | 15B | 42B |
| Jendela konteks | 1M token | 1M token |
| Kekuatan utama | Beban kerja agen omnianalitik dan umum | Agen kompleks dan pengodean yang menuntut |
| Harga input per 1M token | $0.112 | $0.348 |
| Harga output per 1M token | $0.224 | $0.696 |
| Kesesuaian terbaik | Sistem multimodal, konteks besar, sensitif biaya | Penalaran sulit, pengodean, eksekusi jangka panjang |
| Modality input API resmi | Teks, gambar, video, audio | Teks |
| Modality output API resmi | Teks | Teks |
Hasil perbandingan: mulai dengan rute MiMo-V2.5 saat biaya, throughput, atau cakupan multimodal menjadi penentu. Pindahkan permintaan terpilih ke MiMo-V2.5 Pro bila evaluasi internal menunjukkan peningkatan akurasi yang bermakna pada kasus penggunaan pengodean, penalaran, atau penggunaan alat yang sulit. Router bertingkat sering memberi keseimbangan biaya-kualitas yang lebih baik dibanding mengirim semua permintaan ke MiMo-V2.5 Pro.
How to Call the MiMo-V2.5 API
API mengikuti skema chat-completions yang familier. Simpan kunci di server Anda, muat dari variabel lingkungan, dan jangan pernah menyematkannya di kode browser atau mobile.
Set the API key
export COMETAPI_KEY="your_api_key_here"
$env:COMETAPI_KEY = "your_api_key_here"
### Send a cURL request
curl https://api.cometapi.com/v1/chat/completions
-H "Authorization: Bearer $COMETAPI_KEY"
-H "Content-Type: application/json"
-d '{
"model": "mimo-v2.5",
"messages": [
{"role": "system", "content": "You are a careful coding assistant."},
{"role": "user", "content": "Explain the bug and propose a minimal patch."}
],
"temperature": 0.2
}'
### Use Python with the OpenAI SDK
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="mimo-v2.5",
messages=[
{"role": "system", "content": "You are a precise engineering assistant."},
{"role": "user", "content": "Review this migration plan for hidden risks."},
],
temperature=0.2,
)
print(response.choices[0].message.content)
> Jangan mencatat kunci API, header otorisasi lengkap, atau konten prompt sensitif. Gunakan pengelola rahasia di produksi dan rotasi kredensial pada jadwal yang ditentukan.
## How to Stream MiMo-V2.5 API Responses
Streaming mengurangi latensi yang dirasakan untuk jawaban panjang. Layanan mengembalikan event inkremental, yang diekspos SDK sebagai chunk.
stream = client.chat.completions.create(
model="mimo-v2.5",
messages=[{"role": "user", "content": "Draft a safe database migration checklist."}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)
Dalam layanan web, teruskan delta dengan Server-Sent Events atau pesan WebSocket, tangani pemutusan klien, dan hentikan generasi hulu ketika pengguna membatalkan.
## MiMo-V2.5 API Multimodal and Structured Workflows
Untuk tugas yang menyadari gambar, kirim instruksi teks plus objek gambar dalam pesan pengguna yang sama. Representasi media yang diterima dapat bervariasi menurut rute penyedia, jadi perlakukan hal ini sebagai pola payload dan konfirmasikan dukungan rute saat ini.
{
"model": "mimo-v2.5",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "Extract the visible error and suggest the next diagnostic step."},
{"type": "image_url", "image_url": {"url": "https://example.com/error.png"}}
]
}
]
}
Untuk output yang dapat dibaca mesin, minta objek JSON ringkas dan validasi terhadap skema Anda sendiri. Jangan pernah menganggap JSON yang dihasilkan aman hanya karena dapat diurai.
import json
raw = response.choices[0].message.content
result = json.loads(raw)
required = {"summary", "risks", "next_action"}
missing = required - result.keys()
if missing:
raise ValueError(f"Missing fields: {sorted(missing)}")
## MiMo-V2.5 API Pricing on CometAPI and Cost Control
| Rute | Input per 1M token | Output per 1M token | Contoh 100 permintaan |
| ----------------------------- | ------------------ | ------------------- | --------------------- |
| MiMo-V2.5 | $0.112 | $0.224 | $0.1568 |
| MiMo-V2.5 Pro | $0.348 | $0.696 | $0.4872 |
| Referensi bayar-sesuai-pakai Xiaomi | $0.14 | $0.28 | $0.1960 |
Contoh ini mengasumsikan 100 permintaan, masing-masing dengan 10.000 token input dan 2.000 token output. Dengan asumsi tersebut, rute MiMo-V2.5 sekitar 68% lebih murah daripada MiMo-V2.5 Pro. [Tarif bayar-sesuai-pakai](https://platform.xiaomimimo.com/docs/zh-CN/integration/roocode) yang dipublikasikan Xiaomi memberikan titik acuan berguna, sementara tagihan aktual harus diverifikasi terhadap harga penyedia aktif sebelum deployment.
MiMo-V2.5 input: 100 × 10,000 / 1,000,000 × $0.112 = $0.1120
MiMo-V2.5 output: 100 × 2,000 / 1,000,000 × $0.224 = $0.0448
MiMo-V2.5 total: $0.1568
Pro input: 100 × 10,000 / 1,000,000 × $0.348 = $0.3480
Pro output: 100 × 2,000 / 1,000,000 × $0.696 = $0.1392
Pro total: $0.4872
Kendalikan biaya dengan batas output maksimum, kompresi prompt, konteks cache, klasifikasi permintaan, dan router yang hanya meningkatkan penanganan tugas sulit. Lacak biaya per tugas yang berhasil alih-alih biaya per permintaan; permintaan lebih murah yang gagal berulang bisa lebih mahal secara keseluruhan.
## How to Design Long-Context MiMo-V2.5 API Requests
Jendela 1M token membuat input lebih besar menjadi mungkin, tetapi tidak menghapus trade-off retrieval dan atensi. Bangun prompt sehingga model dapat menemukan bukti relevan dengan cepat.
* Letakkan tugas, kontrak output, dan kriteria keputusan di dekat awal.
* Pisahkan dokumen dengan pengidentifikasi stabil dan delimiter yang jelas.
* Sertakan hanya bukti yang dapat memengaruhi jawaban.
* Minta model mengutip pengidentifikasi dokumen atau referensi baris dalam hasilnya.
* Ukur akurasi saat konteks bertambah; jangan perlakukan konteks maksimum sebagai konteks ideal.
> Konteks panjang meningkatkan biaya token dan peluang materi tidak relevan mengganggu model. Retrieval, peringkasan, dan prompting hierarkis tetap penting bahkan ketika seluruh korpus muat.
## Production Reliability
### Retry only transient failures
Ulangi limit rate dan kegagalan server sementara dengan exponential backoff dan jitter. Jangan otomatis mengulang autentikasi tidak valid, payload yang salah bentuk, atau kesalahan kebijakan.
import random
import time
def delay_for(attempt: int) -> float:
return min(30.0, (2 ** attempt) + random.random())
for attempt in range(5):
try:
result = call_model()
break
except TransientAPIError:
if attempt == 4:
raise
time.sleep(delay_for(attempt))
### Set operational guardrails
* Gunakan timeout koneksi dan timeout permintaan keseluruhan.
* Lampirkan idempotency key pada alur kerja yang memiliki efek samping eksternal.
* Catat ID model, latensi, token input dan output, jumlah retry, dan status akhir.
* Redaksi rahasia dan data pribadi sebelum logging.
* Wajibkan allowlist alat dan konfirmasi untuk tindakan destruktif.
* Pertahankan model atau antrean fallback untuk gangguan penyedia.
## MiMo-V2.5 API Common Errors and Solutions
| Gejala | Kemungkinan penyebab | Tindakan yang disarankan |
| ------------- | --------------------------------------------- | -------------------------------------------------------------- |
| 401 atau 403 | Kunci API hilang, tidak valid, atau tak berizin | Verifikasi rahasia sisi server dan izin proyek. |
| 400 | Pesan salah bentuk atau objek media tidak didukung | Validasi JSON dan konfirmasikan dukungan payload spesifik rute. |
| 413 | Body permintaan terlalu besar | Kurangi ukuran media atau pecah input. |
| 429 | Limit rate atau kuota | Backoff dengan jitter dan batasi konkruensi di sisi klien. |
| 5xx | Kegagalan penyedia sementara | Ulangi dalam batas anggaran atau lakukan failover. |
| Respons lambat| Konteks besar, output panjang, atau latensi alat | Streaming output, batasi token, dan profil setiap tahap. |
| JSON tidak valid | Pergeseran generasi | Validasi, perbaiki sekali jika aman, dan tolak kegagalan persisten. |
## Conclusion
Model MiMo-V2.5 adalah titik awal terkuat bagi tim yang membutuhkan input multimodal, konteks besar, dan kontrol biaya agresif. Pro harus menjadi jalur eskalasi yang disengaja untuk tugas di mana peningkatan kualitas yang terukur membenarkan harga lebih tinggi. Mulailah dengan himpunan evaluasi kecil, instrumentasikan setiap permintaan, dan promosikan integrasi hanya setelah menguji payload nyata, perilaku konteks panjang, penanganan retry, dan pemulihan kegagalan.
## FAQ
### Endpoint apa yang harus saya gunakan?
Gunakan `/api.cometapi.com/v1/chat/completions`, atau set `/api.cometapi.com/v1` sebagai base URL di SDK yang kompatibel dengan OpenAI.
### Pengidentifikasi model apa yang harus saya kirim?
Gunakan `mimo-v2.5` untuk rute MiMo-V2.5. Konfirmasikan pengidentifikasi saat ini sebelum peluncuran jika akun Anda menggunakan alias spesifik penyedia.
### Kapan saya harus memilih MiMo-V2.5 Pro?
Pilih MiMo-V2.5 Pro ketika evaluasi Anda menunjukkan keunggulan material pada tugas pengodean, penalaran, atau tugas alat yang berjalan lama. Pertahankan trafik rutin atau multimodal pada rute MiMo-V2.5 ketika kualitasnya memadai.
### Apakah jendela konteks 1M token berarti saya harus mengirim semuanya?
Tidak. Konteks besar adalah batas kapasitas, bukan target desain prompt. Ambil dan susun bukti yang dapat memengaruhi jawaban, lalu ukur kualitas dan biaya seiring pertumbuhan input.
### Bisakah saya memanggil API langsung dari browser?
Jangan mengekspos kunci API rahasia di kode frontend. Panggil penyedia dari backend Anda dan terapkan autentikasi, limit rate, logging, dan kontrol data di sana.
### Bagaimana cara memverifikasi dukungan multimodal?
Uji payload media yang tepat terhadap rute penyedia aktif. Modality native model dasar tidak menjamin setiap rute mengekspos setiap format dengan cara yang sama.
