TL;DR
Model standard V2.5 Xiaomi menggabungkan kefahaman asli teks, imej, video dan audio dengan tetingkap konteks 1 juta token, penggunaan alat, serta kecekapan Mixture‑of‑Experts (MoE) jarang. Ia lebih sesuai apabila input multimodal dan kos per tugas siap menjadi faktor utama. Varian Pro lebih besar dan lebih kuat untuk pengekodan yang menuntut serta kerja ejen jangka panjang, namun tertumpu pada input teks dan berharga kira-kira tiga kali ganda per token pada kadar yang diterbitkan Xiaomi.
Keputusan praktikal adalah mudah: pilih model standard untuk ejen multimodal, analisis dokumen dan media, serta automasi volum tinggi; pilih Pro apabila kejuruteraan perisian sukar atau pelaksanaan autonomi berterusan menjadi hambatan.
Poin Utama
- Model standard menggunakan 310B jumlah parameter sambil mengaktifkan 15B setiap token.
- Ia menerima teks, imej, video dan audio, kemudian mengembalikan teks.
- API-nya menyokong konteks 1M, output sehingga 128K, panggilan alat, carian web, penstriman, output berstruktur dan cache konteks.
- Keputusan yang dilaporkan penerbit termasuk 65.8 pada Terminal-Bench 2.0 dan 56.1 pada SWE-Bench Pro.
- Kad model MiMo-V2.5-Pro semasa Xiaomi menyenaraikan 1.02T jumlah dan 42B parameter aktif. Skor SWE-Bench Pro yang tersenarai oleh penerbit ialah 56.1 untuk MiMo-V2.5 dan 57.2 untuk Pro; ini ialah perbandingan bertarikh yang dilaporkan penerbit, bukan jaminan untuk aliran kerja pengekodan tertentu.
- Pada kadar Xiaomi semasa, kos input/output standard ialah $0.14/$0.28 per juta token; Pro berharga $0.435/$0.87.
- Kedua-dua API dalam CometAPI berharga 20% di bawah pasangan harga rasmi tanpa cache.
Maklumat diperiksa: September 28, 2026. Harga, penanda aras, had, ketersediaan dan format permintaan boleh berubah. Xiaomi telah mengumumkan bahawa nama model API rasmi mimo-v2.5 dan mimo-v2.5-pro akan dinyahgunakan pada 10:00 waktu Beijing pada October 21, 2026, tanpa penggantian automatik. Rancang migrasi dan sahkan laluan langsung sebelum pengedaran.
Nota kitar hayat API: platform rasmi Xiaomi merancang untuk menamatkan kedua-dua ID model V2.5 pada October 21, 2026. Notis ini berkaitan dengan platform API Xiaomi; semak sebarang gerbang pihak ketiga secara berasingan. Notis nyahgunaan model Xiaomi
Apakah Model Standard Itu
MiMo-V2.5 ialah model asas berorientasikan kecekapan Xiaomi MiMo untuk persepsi multimodal dan kerja ejen. Ia menyediakan input asli teks, imej, video dan audio dalam satu seni bina dan menghasilkan output teks.
Log keluaran model Xiaomi bertarikh beta awam siri MiMo-V2.5 pada April 23, 2026. Berat kemudiannya dikeluarkan di bawah lesen MIT. MiMo-V2.5 mempunyai 310B parameter keseluruhan, tetapi hanya mengaktifkan kira-kira 15B untuk setiap token; ia menggunakan kumpulan pakar yang besar tanpa menjalankan kesemua 310B parameter setiap masa.
MiMo-V2.5-Pro menyasarkan beban kerja yang berbeza. Ia ialah model input teks dengan trilion parameter, direka untuk tugas pengekodan paling sukar, terminal dan ejen jangka panjang. Kedua-dua varian berkongsi konteks maksimum 1M tetapi berbeza ketara dalam modaliti, pengkomputeran aktif dan harga.
Spesifikasi dan Ciri MiMo-V2.5
| Butiran seni bina rasmi | Nilai | Mengapa ia penting |
|---|---|---|
| Seni bina | MoE jarang | Kapasiti pakar besar dengan pengaktifan selektif |
| Jumlah / parameter aktif | 310B / 15B | Komput aktif jauh di bawah kapasiti keseluruhan |
| Lapisan transformer | 48: 1 padat + 47 MoE | Kebanyakan lapisan menggunakan pakar berute |
| Pakar berute | 256; 8 aktif per token | Pengkhususan tanpa melaksanakan 310B padat |
| Perhatian | 39 SWA + 9 lapisan global | Mengimbangi kecekapan tempatan dan aliran jauh |
| Tetingkap SWA | 128 token | Mengurangkan tekanan cache konteks panjang |
| Konteks / output maksimum | 1M / 128K token | Menyokong dokumen panjang dan jejak lanjutan |
| Input / output | Teks, imej, video, audio / teks | Persepsi asli merentas empat jenis input |
| Pengekod visi | 729M ViT; 28 lapisan | Kefahaman imej dan video |
| Pengekod audio | 261M transformer; 24 lapisan | Kefahaman audio asli |
| Peramalan Multi-Token | 3 modul; kira-kira 329M parameter | Menyokong kecekapan penyahkodan spekulatif |
| Skala latihan | Kira-kira 48T token | Saluran latihan teks dan multimodal luas |
| Keupayaan API | Alat, web, penstriman, output berstruktur, cache | Primitif ejen berorientasikan produksi |
| Lesen | MIT | Penggunaan komersial dan pengubahsuaian dibenarkan |
Sampul operasi merangkumi konteks 1M dan output 128K, serta had yang diterbitkan 100 permintaan seminit dan 10 juta token seminit. Had di peringkat penyedia mungkin berbeza mengikut akaun dan laluan integrasi.
Rajah seni bina rasmi Xiaomi MiMo. Aset seni bina rasmi.
Cara Seni Bina MiMo-V2.5 Berfungsi
Pakar Jarang: Kapasiti Keseluruhan Bukan Pengkomputeran Aktif
Fakta kecekapan teras ialah reka bentuk 310B keseluruhan, 15B aktif. Router memilih lapan daripada 256 pakar untuk setiap token. Ini memberikan model akses kepada kumpulan parameter yang jauh lebih besar berbanding model padat 15B konvensional tanpa melaksanakan semua 310B parameter setiap masa.
Ini tidak menjadikan hos sendiri sesuatu yang remeh. Berat lengkap masih perlu disimpan dan diedarkan, jadi kapasiti memori, lebar jalur antara sambungan, perutean pakar dan perisian penyajian kekal sebagai kekangan material.
Perhatian Hibrid untuk Konteks Panjang
Tulang belakang menyelangi perhatian tetingkap gelongsor dan global pada nisbah SWA-ke-global 5:1. Tiga puluh sembilan lapisan tempatan mengawal pertumbuhan cache, manakala sembilan lapisan global mengekalkan aliran maklumat jarak jauh. Xiaomi melaporkan pengurangan cache KV hampir enam kali ganda berbanding reka bentuk semua-global.
Had maksimum 1M token ialah kapasiti, bukan ketepatan terjamin. Kualiti pengambilan, latensi, pertumbuhan keadaan alat dan perhatian terhadap bukti jauh tetap memerlukan penilaian khusus beban kerja.
Pengekod Asli dan Ciri Ejen
Pengekod transformer visi 729M mengendalikan input imej dan video; transformer audio 261M mengendalikan audio. Projektor memetakan kedua-dua aliran ke tulang belakang bahasa, membolehkan satu ejen menggabungkan tangkapan skrin, segmen video, trek audio, arahan teks dan hasil alat.
Tiga modul Peramalan Multi-Token menyokong kecekapan penyahkodan spekulatif dan pembelajaran pengukuhan. Model dilatih pada kira-kira 48T token, dengan konteks dilanjutkan secara progresif hingga 1M semasa pascalatihan.
Berat terbuka menggunakan lesen MIT. Penggunaan komersial dibenarkan, tetapi kos infrastruktur dan kebergantungan pihak ketiga masih memerlukan semakan berasingan.
Penanda Aras MiMo-V2.5: Pengekodan, Ejen dan Keputusan Multimodal
Nota penanda aras:
angka di bawah adalah yang dilaporkan penerbit. Ia ialah bukti arah, bukan jaminan untuk repositori, format media, timbunan alat, sasaran latensi atau dasar keselamatan tertentu.
Keputusan Pengekodan dan Ejen

Carta penanda aras pengekodan dan ejen rasmi Xiaomi MiMo.
| Penanda aras pengekodan rasmi | Skor dilaporkan | Isyarat keputusan |
|---|---|---|
| MiMo Coding Bench | 71.8 | Keupayaan ejen pengekodan luas |
| Claw-Eval Text | 62.3 | Pelaksanaan ejen teks umum |
| Terminal-Bench 2.0 | 65.8 | Pelaksanaan terminal interaktif |
| SWE-Bench Pro | 56.1 | Kejuruteraan perisian dunia nyata |
| Claw-Eval Multi-Turn | 63.2 | Kerja ejen berbilang langkah |
| ResearchClawBench | 16.91 | Aliran kerja penyelidikan autonom |
Keputusan: kes terkuat ialah penggunaan alat praktikal berbanding lengkapan kod terasing. Keputusan 65.8 Terminal-Bench menyokong ejen berorientasikan terminal, manakala 56.1 pada SWE-Bench Pro menunjukkan kebolehan peringkat repositori yang berguna. Skor penyelidikan yang jauh lebih rendah mengingatkan agar menilai pengumpulan bukti dan kelakuan sitasi secara berasingan.
Keputusan Multimodal

Carta penanda aras imej, video dan ejen multimodal rasmi Xiaomi MiMo.
| Penanda aras multimodal rasmi | Skor dilaporkan | Keupayaan diuji |
|---|---|---|
| CharXiv RQ | 81.0 | Penaakulan carta dan dokumen |
| MMMU-Pro | 77.9 | Penaakulan multimodal peringkat pakar |
| HR-Bench 4K | 88.5 | Kefahaman imej beresolusi tinggi |
| OmniDocBench | 87.2 | Kefahaman dokumen |
| Claw-Eval Multimodal | 23.8 | Pelaksanaan ejen multimodal |
| Video-MME | 87.7 | Kefahaman video |
| DailyOmni | 83.5 | Penaakulan audiovisual harian |
| VideoHolmes | 64.0 | Penaakulan video temporal |
Keputusan: kefahaman dokumen, imej beresolusi tinggi dan video ialah kekuatan paling jelas. Skor ejen multimodal 23.8 jauh lebih rendah daripada skor persepsi, jadi sistem yang mesti memahami media dan mengendalikan alat dengan boleh dipercayai perlu dinilai hujung ke hujung.
MiMo-V2.5 vs MiMo-V2.5-Pro: Perbandingan Multi Dimensi
| Perbandingan seni bina rasmi | MiMo-V2.5 | MiMo-V2.5-Pro Spesifikasi Pro rasmi Penanda aras Pro rasmi | Implikasi praktikal |
|---|---|---|---|
| Jumlah parameter | 310B | 1.02T | Pro mempunyai lebih 3× kapasiti keseluruhan |
| Parameter diaktifkan | 15B | 42B | Pro menggunakan kira-kira 2.8× lebih banyak parameter aktif |
| Lapisan / pakar berute | 48 / 256 | 70 / 384 | Pro ialah sasaran penyajian yang lebih besar |
| Siling konteks kad model | 1M | 1M | Kedua-duanya menyenaraikan sehingga 1M token; uji pengambilan dan latensi pada saiz beban kerja |
| Output maksimum API rasmi | 128K | 128K | Halaman model API Xiaomi semasa menyenaraikan 128K; had khusus penyedia mungkin berbeza |
| Input asli | Teks, imej, video, audio | Teks | MiMo-V2.5 ialah pilihan multimodal yang didokumenkan; sahkan titik akhir Pro sebelum hantar media |
| SWE-Bench Pro | 56.1 | 57.2 | Pro mendahului sebanyak 1.1 mata |
| Terminal-Bench 2.0 | 65.8 | 68.4 | Pro mendahului sebanyak 2.6 mata |
| Kesesuaian utama | Ejen multimodal cekap | Pengekodan kompleks dan ejen jangka panjang | Pilih mengikut beban kerja yang diuji; margin peringkat model tidak membuktikan kelebihan umum |
Keputusan perbandingan: kelebihan penanda aras Pro adalah sederhana pada dua ujian ejen pengekodan bersama, manakala varian standard menambah input imej, video dan audio asli serta menggunakan parameter aktif yang jauh lebih sedikit. Pro wajar dipilih apabila peningkatan kecil dalam penyelesaian tugas sukar lebih berharga daripada input multimodal dan kos unit lebih rendah.
Berapakah Kos MiMo-V2.5 dan MiMo-V2.5-Pro?
| Asas harga: May 27, 2026 | API standard rasmi | API Pro rasmi | API MiMo-V2.5 di CometAPI | API MiMo-V2.5-Pro di CometAPI |
|---|---|---|---|---|
| Input, cache miss / MTok | $0.14 | $0.435 | $0.112 | $0.348 |
| Output / MTok | $0.28 | $0.87 | $0.224 | $0.696 |
| Input, cache hit / MTok | $0.0028 | $0.0036 | Semak bil langsung | Semak bil langsung |
| Diskaun vs kadar tanpa cache rasmi | Asas | Asas | 20% | 20% |
Pada kadar rasmi, Pro berharga kira-kira 3.1× daripada standard untuk input dan output tanpa cache. Harga penyedia yang ditunjukkan di atas mengurangkan setiap pasangan tanpa cache sebanyak 20%, tetapi jurang relatif antara varian kekal hampir tidak berubah.
Harga per token bukan kos keseluruhan. Ulangan alat, saiz konteks, panjang output, latensi, pemulihan tugas gagal dan semakan manusia menentukan kos per tugas siap. Jalankan sampel beban kerja yang mewakili sebelum memilih model produksi lalai.
Untuk Apa MiMo-V2.5 Paling Sesuai?
- Ejen multimodal: gabungkan tangkapan skrin, dokumen, video, audio, arahan dan alat dalam satu aliran kerja.
- Analisis dokumen panjang: proses repositori, kontrak, arkib penyelidikan, log dan sejarah sokongan.
- Kefahaman media: ringkaskan video, ekstrak peristiwa, tafsir carta dan jawab soalan audiovisual.
- Ejen pengekodan dan terminal: periksa fail, jalankan arahan, ubah suai kod dan ulang pada keputusan ujian.
- Automasi volum tinggi: gunakan pengaktifan jarang dan harga token lebih rendah untuk tugas produksi berulang.
Had dan Risiko
- Hanya 15B parameter aktif per token, tetapi hos sendiri masih memerlukan sistem berat 310B penuh.
- Output multimodal ialah teks; penjanaan imej, pertuturan dan video memerlukan model lain.
- Siling konteks 1M tidak menjamin ketepatan pengambilan seragam merentas seluruh tetingkap.
- Penanda aras penerbit mungkin tidak terpakai pada alat tersuai, repositori, prompt atau kekangan keselamatan.
- Pendedahan modaliti peringkat penyedia boleh berbeza daripada keupayaan penuh model berat terbuka yang mendasari.
Gerbang produksi:
sahkan ketepatan, penyempurnaan panggilan alat, latensi, penggunaan token, pengendalian modaliti dan tingkah laku jatuh balik pada tugas perwakilan sebelum melakukan trafik.
Contoh API
Contoh Python berikut menggunakan titik akhir CometAPI yang serasi dengan OpenAI dan ID model standard. Sahkan titik akhir semasa dan skema permintaan yang disokong sebelum pengedaran.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
max_retries=0,
)
response = client.chat.completions.create(
model="mimo-v2.5",
max_tokens=256,
messages=[
{
"role": "user",
"content": "Summarize the main findings in this technical report.",
}
],
)
print(response.choices[0].message.content)
Panduan Keputusan
| Isyarat beban kerja | Mulakan dengan | Tukar apabila |
|---|---|---|
| Imej, video atau audio ialah input kelas pertama | Standard | Jangan tukar melainkan prapemprosesan multimodal boleh diterima |
| Dokumen besar atau volum media bercampur | Standard | Pro hanya jika kegagalan penaakulan mendominasi kos |
| Kejuruteraan repositori sukar | Uji kedua-duanya | Pilih Pro jika kenaikan penyempurnaan mengimbangi kos unit 3.1× |
| Trajektori terminal autonomi panjang | Pro | Kembali ke standard jika kenaikan tidak terukur |
| Automasi rutin volum tinggi | Standard | Naik taraf hanya tugas gagal atau bernilai tinggi |
Penghalaan yang disyorkan:
gunakan standard sebagai lalai untuk kerja multimodal dan volum tinggi, kemudian halakan hanya tugas input-teks sukar atau jangka panjang kepada Pro. Ini mengekalkan keupayaan sambil mengawal jumlah kos.
Kesimpulan
Model standard bukan sekadar Pro yang lebih kecil. Ia ialah titik pengoptimuman tersendiri: input multimodal asli, konteks 1M, penanda aras berorientasikan alat yang kukuh, dan 15B parameter aktif pada harga token yang jauh lebih rendah.
Pro ialah pilihan pakar untuk kejuruteraan perisian sukar dan pelaksanaan autonomi berterusan. Kapasiti tambahannya menghasilkan peningkatan yang boleh diukur tetapi tidak sejagat, jadi corak pengedaran terkuat ialah penghalaan berasaskan beban kerja dan bukannya memilih satu varian untuk setiap permintaan.
Soalan Lazim
Adakah model standard sumber terbuka?
Beratnya dikeluarkan di bawah lesen MIT, membenarkan penggunaan komersial, pengubahsuaian, penalaan halus dan pengagihan semula tertakluk kepada terma lesen.
Berapa banyak parameter yang digunakan?
MoE jarang mengandungi 310B jumlah parameter dan mengaktifkan 15B untuk setiap token. Parameter aktif menerangkan pengkomputeran per token, bukan saiz storan model lengkap.
Adakah ia menyokong imej, video dan audio?
Ya. Varian standard menerima input teks, imej, video dan audio serta mengembalikan teks. Spesifikasi rasmi varian Pro menyenaraikan input teks.
Apakah tetingkap konteks maksimum?
Kedua-dua kad model menyatakan tetingkap konteks sehingga 1M token. Halaman API Xiaomi semasa menyenaraikan output maksimum 128K untuk MiMo-V2.5 dan MiMo-V2.5-Pro. Had yang boleh digunakan sebenarnya boleh berbeza mengikut titik akhir, penyedia, akaun dan format permintaan; sahkan laluan yang digunakan sebelum bergantung pada siling tersebut.
Halaman API Pro rasmi semasa mengesahkan 1M konteks dan output maksimum 128K: Spesifikasi API MiMo-V2.5-Pro
Varian manakah lebih baik untuk ejen pengekodan?
Pro melaporkan keputusan lebih tinggi pada penanda aras pengekodan dan terminal bersama, tetapi margin adalah sederhana. Uji kedua-duanya pada repositori sasaran dan pilih berdasarkan penyempurnaan tugas, latensi dan jumlah kos.
Varian manakah lebih baik untuk ejen multimodal?
Varian standard ialah pilihan semula jadi kerana ia menerima input imej, video dan audio secara asli. Pro tertumpu pada input teks.
Bagaimanakah pasukan produksi harus memilih?
Mulakan dengan standard, ukur kegagalan, dan halakan hanya tugas input-teks sukar yang mendapat manfaat daripada Pro. Bandingkan kos per tugas siap, bukan harga per token semata-mata.
