TL;DR
Model V2.5 standar Xiaomi menggabungkan pemahaman native atas teks, gambar, video, dan audio dengan jendela konteks 1 juta token, penggunaan alat, serta efisiensi Mixture-of-Experts jarang (sparse). Ini lebih tepat saat input multimodal dan biaya per tugas selesai menjadi pertimbangan. Varian Pro lebih besar dan lebih kuat untuk pengodean berat dan kerja agen berjangka panjang, tetapi berfokus pada input teks dan biayanya sekitar tiga kali lipat per token menurut tarif yang dipublikasikan Xiaomi.
Keputusan praktisnya sederhana: pilih model standar untuk agen multimodal, analisis dokumen dan media, serta otomatisasi volume tinggi; pilih Pro ketika hambatannya adalah rekayasa perangkat lunak yang sulit atau eksekusi otonom yang berkelanjutan.
Key Takeaways
- Model standar menggunakan 310B parameter total dan mengaktifkan 15B per token.
- Menerima teks, gambar, video, dan audio, lalu mengembalikan teks.
- API-nya mendukung konteks 1M, output hingga 128K, pemanggilan alat, penelusuran web, streaming, output terstruktur, dan caching konteks.
- Hasil yang dilaporkan penerbit mencakup 65,8 pada Terminal-Bench 2.0 dan 56,1 pada SWE-Bench Pro.
- Kartu model MiMo-V2.5-Pro saat ini dari Xiaomi mencantumkan 1,02T total dan 42B parameter aktif. Skor SWE-Bench Pro yang dicantumkan penerbit adalah 56,1 untuk MiMo-V2.5 dan 57,2 untuk Pro; ini adalah perbandingan dari penerbit yang sudah bertanggal, bukan jaminan untuk alur kerja pengodean tertentu.
- Pada tarif Xiaomi saat ini, biaya input/output standar adalah $0,14/$0,28 per juta token; Pro $0,435/$0,87.
- Kedua API di CometAPI diberi harga 20% di bawah pasangan harga resmi tanpa cache.
Informasi diperiksa: 28 September 2026. Harga, tolok ukur, batas, ketersediaan, dan format permintaan dapat berubah. Xiaomi telah mengumumkan bahwa nama model API resmi mimo-v2.5 dan mimo-v2.5-pro akan dihentikan pada pukul 10:00 waktu Beijing pada 21 Oktober 2026, tanpa penggantian otomatis. Rencanakan migrasi dan konfirmasi rute aktif sebelum penerapan.
Catatan siklus hidup API: platform resmi Xiaomi berencana memensiunkan kedua ID model V2.5 pada 21 Oktober 2026. Pemberitahuan ini menyangkut platform API Xiaomi; periksa setiap gateway pihak ketiga secara terpisah. Pemberitahuan penghentian model Xiaomi
What the Standard Model Is
MiMo-V2.5 adalah model dasar berorientasi efisiensi dari Xiaomi MiMo untuk persepsi multimodal dan kerja agen. Model ini menyediakan input native teks, gambar, video, dan audio dalam satu arsitektur dan menghasilkan output teks.
Log rilis model Xiaomi bertanggalkan beta publik seri MiMo-V2.5 pada 23 April 2026. Bobotnya kemudian dirilis di bawah lisensi MIT. MiMo-V2.5 memiliki 310B parameter total, tetapi hanya mengaktifkan sekitar 15B untuk setiap token; ia menggunakan kumpulan besar spesialis tanpa menjalankan semuanya sekaligus.
MiMo-V2.5-Pro menargetkan beban kerja berbeda. Ini adalah model berparameter triliun, ber-input teks, yang dirancang untuk tugas pengodean tersulit, terminal, dan kerja agen jangka panjang. Kedua varian berbagi konteks maksimum 1M tetapi berbeda tajam dalam modalitas, komputasi aktif, dan harga.
MiMo-V2.5 Specifications and Features
| Detail arsitektur resmi | Nilai | Alasan penting |
|---|---|---|
| Architecture | Sparse MoE | Kapasitas ahli besar dengan aktivasi selektif |
| Total / active parameters | 310B / 15B | Komputasi aktif jauh di bawah kapasitas total |
| Transformer layers | 48: 1 dense + 47 MoE | Sebagian besar layer menggunakan ahli terarah |
| Routed experts | 256; 8 aktif per token | Spesialisasi tanpa eksekusi dense 310B |
| Attention | 39 SWA + 9 layer global | Menyeimbangkan efisiensi lokal dan aliran jauh |
| SWA window | 128 token | Mengurangi tekanan cache konteks panjang |
| Context / maximum output | 1M / 128K token | Mendukung dokumen panjang dan jejak panjang |
| Input / output | Teks, gambar, video, audio / teks | Persepsi native di empat tipe input |
| Vision encoder | 729M ViT; 28 layer | Pemahaman gambar dan video |
| Audio encoder | 261M transformer; 24 layer | Pemahaman audio native |
| Multi-Token Prediction | 3 modul; sekitar 329M parameter | Mendukung efisiensi decoding spekulatif |
| Training scale | Sekitar 48T token | Jalur pelatihan teks dan multimodal luas |
| API capabilities | Tools, web, streaming, output terstruktur, caching | Primitif agen berorientasi produksi |
| License | MIT | Penggunaan komersial dan modifikasi diizinkan |
Batas operasi mencakup konteks 1M dan output 128K, plus batas yang dipublikasikan 100 permintaan per menit dan 10 juta token per menit. Batas di tingkat penyedia dapat berbeda menurut akun dan rute integrasi.
Diagram arsitektur resmi Xiaomi MiMo. Aset arsitektur resmi.
How MiMo-V2.5 Architecture Works
Sparse Experts: Total Capacity Is Not Active Compute
Fakta efisiensi utama adalah desain 310B-total, 15B-aktif. Router memilih delapan dari 256 ahli untuk setiap token. Itu memberi model akses ke kumpulan parameter yang jauh lebih besar dibanding model dense 15B konvensional tanpa mengeksekusi semua 310B parameter setiap saat.
Ini tidak membuat self-hosting menjadi sepele. Bobot lengkap tetap harus disimpan dan didistribusikan, sehingga kapasitas memori, bandwidth interkoneksi, perutean ahli, dan perangkat lunak penyajian tetap menjadi batasan yang material.
Hybrid Attention for Long Context
Kerangka belakang menginterleavkan sliding-window dan global attention pada rasio SWA-ke-global 5:1. Tiga puluh sembilan layer lokal mengendalikan pertumbuhan cache, sementara sembilan layer global mempertahankan aliran informasi jarak jauh. Xiaomi melaporkan pengurangan KV-cache hampir enam kali dibandingkan desain yang sepenuhnya global.
Batas maksimum 1M token adalah kapasitas, bukan jaminan akurasi. Kualitas retrieval, latensi, pertumbuhan state alat, dan perhatian terhadap bukti jauh tetap memerlukan evaluasi spesifik beban kerja.
Native Encoders and Agent Features
Sebuah vision transformer 729M-parameter menangani input gambar dan video; sebuah audio transformer 261M-parameter menangani audio. Projector memetakan kedua aliran ke kerangka bahasa, memungkinkan satu agen menggabungkan tangkapan layar, segmen video, trek audio, instruksi teks, dan hasil alat.
Tiga modul Multi-Token Prediction mendukung decoding spekulatif dan efisiensi reinforcement learning. Model dilatih pada sekitar 48T token, dengan konteks yang diperluas secara progresif hingga 1M selama pascapelatihan.
Bobot terbuka menggunakan lisensi MIT. Penerapan komersial diizinkan, tetapi biaya infrastruktur dan ketergantungan pihak ketiga tetap memerlukan peninjauan terpisah.
MiMo-V2.5 Benchmarks: Coding, Agents, and Multimodal Results
Catatan tolok ukur:
angka di bawah ini dilaporkan oleh penerbit. Itu adalah bukti arah, bukan jaminan untuk repositori, format media, tumpukan alat, target latensi, atau kebijakan keselamatan tertentu.
Coding and Agent Results

Bagan tolok ukur pengodean dan agen resmi Xiaomi MiMo.
| Tolok ukur pengodean resmi | Skor yang dilaporkan | Sinyal keputusan |
|---|---|---|
| MiMo Coding Bench | 71,8 | Kapabilitas agen pengodean luas |
| Claw-Eval Text | 62,3 | Penyelesaian agen teks umum |
| Terminal-Bench 2.0 | 65,8 | Eksekusi terminal interaktif |
| SWE-Bench Pro | 56,1 | Rekayasa perangkat lunak dunia nyata |
| Claw-Eval Multi-Turn | 63,2 | Kerja agen multi-langkah lebih lama |
| ResearchClawBench | 16,91 | Alur kerja riset otonom |
Hasil: kasus terkuat adalah penggunaan alat praktis alih-alih pelengkapan kode terisolasi. Hasil 65,8 pada Terminal-Bench mendukung agen berorientasi terminal, sementara 56,1 pada SWE-Bench Pro menunjukkan kemampuan tingkat repositori yang berguna. Skor riset yang jauh lebih rendah mengingatkan untuk menguji perilaku pengumpulan bukti dan sitasi secara terpisah.
Multimodal Results

Bagan tolok ukur gambar, video, dan agen multimodal resmi Xiaomi MiMo.
| Tolok ukur multimodal resmi | Skor yang dilaporkan | Kapabilitas yang diuji |
|---|---|---|
| CharXiv RQ | 81,0 | Penalaran grafik dan dokumen |
| MMMU-Pro | 77,9 | Penalaran multimodal tingkat ahli |
| HR-Bench 4K | 88,5 | Pemahaman gambar beresolusi tinggi |
| OmniDocBench | 87,2 | Pemahaman dokumen |
| Claw-Eval Multimodal | 23,8 | Penyelesaian agen multimodal |
| Video-MME | 87,7 | Pemahaman video |
| DailyOmni | 83,5 | Penalaran audiovisual sehari-hari |
| VideoHolmes | 64,0 | Penalaran temporal video |
Hasil: dokumen, gambar beresolusi tinggi, dan pemahaman video adalah kekuatan paling jelas. Skor agen multimodal 23,8 jauh lebih rendah daripada skor persepsi, jadi sistem yang harus memahami media dan secara andal mengoperasikan alat perlu dievaluasi dari ujung ke ujung.
MiMo-V2.5 vs MiMo-V2.5-Pro: Multi-Dimensional Comparison
| Perbandingan arsitektur resmi | MiMo-V2.5 | MiMo-V2.5-Pro Spesifikasi Pro resmi Tolok ukur Pro resmi | Implikasi praktis |
|---|---|---|---|
| Total parameters | 310B | 1,02T | Pro memiliki lebih dari 3× kapasitas total |
| Activated parameters | 15B | 42B | Pro menggunakan sekitar 2,8× parameter aktif |
| Layers / routed experts | 48 / 256 | 70 / 384 | Pro adalah target penyajian yang lebih besar |
| Model-card context ceiling | 1M | 1M | Keduanya mencantumkan hingga 1M token; uji retrieval dan latensi pada ukuran beban kerja Anda |
| Official API maximum output | 128K | 128K | Halaman model API Xiaomi saat ini mencantumkan 128K; batas spesifik penyedia dapat berbeda |
| Native input | Teks, gambar, video, audio | Teks | MiMo-V2.5 adalah pilihan multimodal yang terdokumentasi; verifikasi endpoint Pro sebelum kirim media |
| SWE-Bench Pro | 56,1 | 57,2 | Pro unggul 1,1 poin |
| Terminal-Bench 2.0 | 65,8 | 68,4 | Pro unggul 2,6 poin |
| Primary fit | Agen multimodal efisien | Pengodean kompleks dan agen berjangka panjang | Pilih berdasarkan beban kerja yang diuji; margin level model tidak membuktikan keunggulan umum |
Hasil perbandingan: keunggulan tolok ukur Pro tergolong moderat pada dua uji agen pengodean bersama, sementara varian standar menambahkan input gambar, video, dan audio native serta menggunakan jauh lebih sedikit parameter aktif. Pro dibenarkan ketika kenaikan kecil dalam penyelesaian tugas sulit lebih berharga daripada input multimodal dan biaya unit yang lebih rendah.
How Much Do MiMo-V2.5 and MiMo-V2.5-Pro Cost?
| Basis harga: 27 Mei 2026 | API standar resmi | API Pro resmi | API MiMo-V2.5 di CometAPI | API MiMo-V2.5-Pro di CometAPI |
|---|---|---|---|---|
| Input, cache miss / MTok | $0,14 | $0,435 | $0,112 | $0,348 |
| Output / MTok | $0,28 | $0,87 | $0,224 | $0,696 |
| Input, cache hit / MTok | $0,0028 | $0,0036 | Periksa penagihan live | Periksa penagihan live |
| Diskon vs tarif resmi tanpa cache | Baseline | Baseline | 20% | 20% |
Pada tarif resmi, Pro berbiaya sekitar 3,1× dibanding standar untuk input dan output tanpa cache. Harga penyedia yang ditunjukkan di atas mengurangi masing-masing pasangan tanpa cache sebesar 20%, tetapi kesenjangan relatif antara varian tetap pada dasarnya tidak berubah.
Harga per token bukanlah biaya total. Ulang-alat, ukuran konteks, panjang output, latensi, pemulihan tugas gagal, dan tinjauan manusia menentukan biaya per tugas selesai. Jalankan sampel beban kerja representatif sebelum memilih model produksi default.
What Is MiMo-V2.5 Best For?
- Agen multimodal: gabungkan tangkapan layar, dokumen, video, audio, instruksi, dan alat dalam satu alur kerja.
- Analisis dokumen panjang: proses repositori, kontrak, arsip riset, log, dan riwayat dukungan.
- Pemahaman media: rangkum video, ekstrak peristiwa, tafsirkan grafik, dan jawab pertanyaan audiovisual.
- Agen pengodean dan terminal: inspeksi file, jalankan perintah, ubah kode, dan iterasi pada hasil uji.
- Otomatisasi volume tinggi: gunakan aktivasi jarang dan harga token lebih rendah untuk tugas produksi berulang.
Limitations and Risks
- Hanya 15B parameter aktif per token, tetapi self-hosting tetap memerlukan sistem bobot 310B penuh.
- Output multimodal adalah teks; generasi gambar, ucapan, dan video memerlukan model lain.
- Batas konteks 1M tidak menjamin akurasi retrieval seragam di seluruh jendela.
- Tolok ukur penerbit mungkin tidak berpindah ke alat, repositori, prompt, atau batasan keselamatan khusus Anda.
- Paparan modalitas oleh penyedia dapat berbeda dari kapabilitas penuh model bobot terbuka yang mendasarinya.
Gerbang produksi:
validasi akurasi, penyelesaian pemanggilan alat, latensi, konsumsi token, penanganan modalitas, dan perilaku fallback pada tugas representatif sebelum mengkomitkan trafik.
API Example
Contoh Python berikut menggunakan endpoint CometAPI yang kompatibel dengan OpenAI dan ID model standar. Konfirmasikan endpoint saat ini dan skema permintaan yang didukung sebelum penerapan.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
max_retries=0,
)
response = client.chat.completions.create(
model="mimo-v2.5",
max_tokens=256,
messages=[
{
"role": "user",
"content": "Summarize the main findings in this technical report.",
}
],
)
print(response.choices[0].message.content)
Decision Guide
| Sinyal beban kerja | Mulai dengan | Beralih ketika |
|---|---|---|
| Gambar, video, atau audio adalah input utama | Standar | Jangan beralih kecuali prapemrosesan multimodal dapat diterima |
| Volume dokumen besar atau media campuran | Standar | Pro hanya jika kegagalan penalaran mendominasi biaya |
| Rekayasa repositori sulit | Uji keduanya | Pilih Pro jika kenaikan penyelesaian menutup biaya unit 3,1× |
| Trajektori terminal otonom panjang | Pro | Kembali ke standar jika kenaikan tidak terukur |
| Otomatisasi rutin volume tinggi | Standar | Eskalasi hanya tugas gagal atau bernilai tinggi |
Rekomendasi perutean:
gunakan standar sebagai default untuk pekerjaan multimodal dan volume tinggi, lalu rute hanya tugas pengodean berfokus teks atau berjangka panjang yang sulit ke Pro. Ini mempertahankan kapabilitas sekaligus mengendalikan biaya total.
Conclusion
Model standar bukan sekadar Pro yang lebih kecil. Ini adalah titik optimasi yang berbeda: input multimodal native, konteks 1M, tolok ukur berorientasi alat yang kuat, dan 15B parameter aktif pada harga token yang jauh lebih rendah.
Pro adalah opsi spesialis untuk rekayasa perangkat lunak sulit dan eksekusi otonom berkelanjutan. Kapasitas tambahannya menghasilkan kenaikan terukur namun tidak universal, sehingga pola penerapan terkuat adalah perutean berbasis beban kerja alih-alih memilih satu varian untuk setiap permintaan.
FAQ
Apakah model standar bersifat open source?
Bobotnya dirilis di bawah lisensi MIT, memungkinkan penggunaan komersial, modifikasi, fine-tuning, dan redistribusi sesuai ketentuan lisensi.
Berapa banyak parameter yang digunakannya?
Sparse MoE berisi 310B parameter total dan mengaktifkan 15B untuk setiap token. Parameter aktif menggambarkan komputasi per token, bukan ukuran penyimpanan model lengkap.
Apakah mendukung gambar, video, dan audio?
Ya. Varian standar menerima input teks, gambar, video, dan audio dan mengembalikan teks. Spesifikasi resmi varian Pro mencantumkan input teks.
Berapa jendela konteks maksimum?
Kedua kartu model menyatakan jendela konteks hingga 1M token. Halaman API Xiaomi saat ini mencantumkan output maksimum 128K untuk MiMo-V2.5 dan MiMo-V2.5-Pro. Batas yang dapat digunakan sebenarnya dapat bervariasi menurut endpoint, penyedia, akun, dan format permintaan; verifikasi rute yang diterapkan sebelum bergantung pada batas tersebut.
Halaman API Pro resmi saat ini secara terpisah mengonfirmasi konteks 1M dan output maksimum 128K: Spesifikasi API MiMo-V2.5-Pro
Varian mana yang lebih baik untuk agen pengodean?
Pro melaporkan hasil lebih tinggi pada tolok ukur pengodean dan terminal yang sama, tetapi marginnya moderat. Uji keduanya pada repositori target dan pilih berdasarkan penyelesaian tugas, latensi, dan biaya total.
Varian mana yang lebih baik untuk agen multimodal?
Varian standar adalah pilihan alami karena secara native menerima input gambar, video, dan audio. Pro berfokus pada input teks.
Bagaimana sebaiknya tim produksi memilih?
Mulai dengan standar, ukur kegagalan, dan rute hanya tugas berfokus teks yang sulit yang mendapat manfaat dari Pro. Bandingkan biaya per tugas selesai, bukan hanya harga per token.
