Claude Haiku 5.5 and Nano Banana 2.1 are now live on CometAPI →
ai-model/Penyelidikan CometAPI

Apakah MiMo-V2.5? Spesifikasi, Penanda Aras, Ciri-ciri, Harga, dan Akses API

Terokai spesifikasi, seni bina, penanda aras rasmi, harga, perbandingan dengan MiMo-V2.5-Pro, kes penggunaan, batasan, dan akses kepada CometAPI untuk Xiaomi MiMo-V2.5.

CometAPI
Deon GoodwinPasukan penyelidikan model AI dan API
Dikemas kini Oct 5, 2026 12 min baca
Apakah MiMo-V2.5? Spesifikasi, Penanda Aras, Ciri-ciri, Harga, dan Akses API
Guna corak ini

Buat panggilan API pertama.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Model standard V2.5 Xiaomi menggabungkan kefahaman asli teks, imej, video dan audio dengan tetingkap konteks 1 juta token, penggunaan alat, serta kecekapan Mixture‑of‑Experts (MoE) jarang. Ia lebih sesuai apabila input multimodal dan kos per tugas siap menjadi faktor utama. Varian Pro lebih besar dan lebih kuat untuk pengekodan yang menuntut serta kerja ejen jangka panjang, namun tertumpu pada input teks dan berharga kira-kira tiga kali ganda per token pada kadar yang diterbitkan Xiaomi.

Keputusan praktikal adalah mudah: pilih model standard untuk ejen multimodal, analisis dokumen dan media, serta automasi volum tinggi; pilih Pro apabila kejuruteraan perisian sukar atau pelaksanaan autonomi berterusan menjadi hambatan.

Poin Utama

  • Model standard menggunakan 310B jumlah parameter sambil mengaktifkan 15B setiap token.
  • Ia menerima teks, imej, video dan audio, kemudian mengembalikan teks.
  • API-nya menyokong konteks 1M, output sehingga 128K, panggilan alat, carian web, penstriman, output berstruktur dan cache konteks.
  • Keputusan yang dilaporkan penerbit termasuk 65.8 pada Terminal-Bench 2.0 dan 56.1 pada SWE-Bench Pro.
  • Kad model MiMo-V2.5-Pro semasa Xiaomi menyenaraikan 1.02T jumlah dan 42B parameter aktif. Skor SWE-Bench Pro yang tersenarai oleh penerbit ialah 56.1 untuk MiMo-V2.5 dan 57.2 untuk Pro; ini ialah perbandingan bertarikh yang dilaporkan penerbit, bukan jaminan untuk aliran kerja pengekodan tertentu.
  • Pada kadar Xiaomi semasa, kos input/output standard ialah $0.14/$0.28 per juta token; Pro berharga $0.435/$0.87.
  • Kedua-dua API dalam CometAPI berharga 20% di bawah pasangan harga rasmi tanpa cache.
    Maklumat diperiksa: September 28, 2026. Harga, penanda aras, had, ketersediaan dan format permintaan boleh berubah. Xiaomi telah mengumumkan bahawa nama model API rasmi mimo-v2.5 dan mimo-v2.5-pro akan dinyahgunakan pada 10:00 waktu Beijing pada October 21, 2026, tanpa penggantian automatik. Rancang migrasi dan sahkan laluan langsung sebelum pengedaran.

Nota kitar hayat API: platform rasmi Xiaomi merancang untuk menamatkan kedua-dua ID model V2.5 pada October 21, 2026. Notis ini berkaitan dengan platform API Xiaomi; semak sebarang gerbang pihak ketiga secara berasingan. Notis nyahgunaan model Xiaomi

Apakah Model Standard Itu

MiMo-V2.5 ialah model asas berorientasikan kecekapan Xiaomi MiMo untuk persepsi multimodal dan kerja ejen. Ia menyediakan input asli teks, imej, video dan audio dalam satu seni bina dan menghasilkan output teks.

Log keluaran model Xiaomi bertarikh beta awam siri MiMo-V2.5 pada April 23, 2026. Berat kemudiannya dikeluarkan di bawah lesen MIT. MiMo-V2.5 mempunyai 310B parameter keseluruhan, tetapi hanya mengaktifkan kira-kira 15B untuk setiap token; ia menggunakan kumpulan pakar yang besar tanpa menjalankan kesemua 310B parameter setiap masa.

MiMo-V2.5-Pro menyasarkan beban kerja yang berbeza. Ia ialah model input teks dengan trilion parameter, direka untuk tugas pengekodan paling sukar, terminal dan ejen jangka panjang. Kedua-dua varian berkongsi konteks maksimum 1M tetapi berbeza ketara dalam modaliti, pengkomputeran aktif dan harga.

Spesifikasi dan Ciri MiMo-V2.5

Butiran seni bina rasmiNilaiMengapa ia penting
Seni binaMoE jarangKapasiti pakar besar dengan pengaktifan selektif
Jumlah / parameter aktif310B / 15BKomput aktif jauh di bawah kapasiti keseluruhan
Lapisan transformer48: 1 padat + 47 MoEKebanyakan lapisan menggunakan pakar berute
Pakar berute256; 8 aktif per tokenPengkhususan tanpa melaksanakan 310B padat
Perhatian39 SWA + 9 lapisan globalMengimbangi kecekapan tempatan dan aliran jauh
Tetingkap SWA128 tokenMengurangkan tekanan cache konteks panjang
Konteks / output maksimum1M / 128K tokenMenyokong dokumen panjang dan jejak lanjutan
Input / outputTeks, imej, video, audio / teksPersepsi asli merentas empat jenis input
Pengekod visi729M ViT; 28 lapisanKefahaman imej dan video
Pengekod audio261M transformer; 24 lapisanKefahaman audio asli
Peramalan Multi-Token3 modul; kira-kira 329M parameterMenyokong kecekapan penyahkodan spekulatif
Skala latihanKira-kira 48T tokenSaluran latihan teks dan multimodal luas
Keupayaan APIAlat, web, penstriman, output berstruktur, cachePrimitif ejen berorientasikan produksi
LesenMITPenggunaan komersial dan pengubahsuaian dibenarkan

Sampul operasi merangkumi konteks 1M dan output 128K, serta had yang diterbitkan 100 permintaan seminit dan 10 juta token seminit. Had di peringkat penyedia mungkin berbeza mengikut akaun dan laluan integrasi.

Apakah MiMo-V2.5? Spesifikasi, Penanda Aras, Ciri-ciri, Harga, dan Akses API

Rajah seni bina rasmi Xiaomi MiMo. Aset seni bina rasmi.

Cara Seni Bina MiMo-V2.5 Berfungsi

Pakar Jarang: Kapasiti Keseluruhan Bukan Pengkomputeran Aktif

Fakta kecekapan teras ialah reka bentuk 310B keseluruhan, 15B aktif. Router memilih lapan daripada 256 pakar untuk setiap token. Ini memberikan model akses kepada kumpulan parameter yang jauh lebih besar berbanding model padat 15B konvensional tanpa melaksanakan semua 310B parameter setiap masa.

Ini tidak menjadikan hos sendiri sesuatu yang remeh. Berat lengkap masih perlu disimpan dan diedarkan, jadi kapasiti memori, lebar jalur antara sambungan, perutean pakar dan perisian penyajian kekal sebagai kekangan material.

Perhatian Hibrid untuk Konteks Panjang

Tulang belakang menyelangi perhatian tetingkap gelongsor dan global pada nisbah SWA-ke-global 5:1. Tiga puluh sembilan lapisan tempatan mengawal pertumbuhan cache, manakala sembilan lapisan global mengekalkan aliran maklumat jarak jauh. Xiaomi melaporkan pengurangan cache KV hampir enam kali ganda berbanding reka bentuk semua-global.

Had maksimum 1M token ialah kapasiti, bukan ketepatan terjamin. Kualiti pengambilan, latensi, pertumbuhan keadaan alat dan perhatian terhadap bukti jauh tetap memerlukan penilaian khusus beban kerja.

Pengekod Asli dan Ciri Ejen

Pengekod transformer visi 729M mengendalikan input imej dan video; transformer audio 261M mengendalikan audio. Projektor memetakan kedua-dua aliran ke tulang belakang bahasa, membolehkan satu ejen menggabungkan tangkapan skrin, segmen video, trek audio, arahan teks dan hasil alat.

Tiga modul Peramalan Multi-Token menyokong kecekapan penyahkodan spekulatif dan pembelajaran pengukuhan. Model dilatih pada kira-kira 48T token, dengan konteks dilanjutkan secara progresif hingga 1M semasa pascalatihan.

Berat terbuka menggunakan lesen MIT. Penggunaan komersial dibenarkan, tetapi kos infrastruktur dan kebergantungan pihak ketiga masih memerlukan semakan berasingan.

Penanda Aras MiMo-V2.5: Pengekodan, Ejen dan Keputusan Multimodal

Nota penanda aras:

angka di bawah adalah yang dilaporkan penerbit. Ia ialah bukti arah, bukan jaminan untuk repositori, format media, timbunan alat, sasaran latensi atau dasar keselamatan tertentu.

Keputusan Pengekodan dan Ejen

Apakah MiMo-V2.5? Spesifikasi, Penanda Aras, Ciri-ciri, Harga, dan Akses API

Carta penanda aras pengekodan dan ejen rasmi Xiaomi MiMo.

Penanda aras pengekodan rasmiSkor dilaporkanIsyarat keputusan
MiMo Coding Bench71.8Keupayaan ejen pengekodan luas
Claw-Eval Text62.3Pelaksanaan ejen teks umum
Terminal-Bench 2.065.8Pelaksanaan terminal interaktif
SWE-Bench Pro56.1Kejuruteraan perisian dunia nyata
Claw-Eval Multi-Turn63.2Kerja ejen berbilang langkah
ResearchClawBench16.91Aliran kerja penyelidikan autonom

Keputusan: kes terkuat ialah penggunaan alat praktikal berbanding lengkapan kod terasing. Keputusan 65.8 Terminal-Bench menyokong ejen berorientasikan terminal, manakala 56.1 pada SWE-Bench Pro menunjukkan kebolehan peringkat repositori yang berguna. Skor penyelidikan yang jauh lebih rendah mengingatkan agar menilai pengumpulan bukti dan kelakuan sitasi secara berasingan.

Keputusan Multimodal

Apakah MiMo-V2.5? Spesifikasi, Penanda Aras, Ciri-ciri, Harga, dan Akses API

Carta penanda aras imej, video dan ejen multimodal rasmi Xiaomi MiMo.

Penanda aras multimodal rasmiSkor dilaporkanKeupayaan diuji
CharXiv RQ81.0Penaakulan carta dan dokumen
MMMU-Pro77.9Penaakulan multimodal peringkat pakar
HR-Bench 4K88.5Kefahaman imej beresolusi tinggi
OmniDocBench87.2Kefahaman dokumen
Claw-Eval Multimodal23.8Pelaksanaan ejen multimodal
Video-MME87.7Kefahaman video
DailyOmni83.5Penaakulan audiovisual harian
VideoHolmes64.0Penaakulan video temporal

Keputusan: kefahaman dokumen, imej beresolusi tinggi dan video ialah kekuatan paling jelas. Skor ejen multimodal 23.8 jauh lebih rendah daripada skor persepsi, jadi sistem yang mesti memahami media dan mengendalikan alat dengan boleh dipercayai perlu dinilai hujung ke hujung.

MiMo-V2.5 vs MiMo-V2.5-Pro: Perbandingan Multi Dimensi

Perbandingan seni bina rasmiMiMo-V2.5MiMo-V2.5-Pro
Spesifikasi Pro rasmi
Penanda aras Pro rasmi
Implikasi praktikal
Jumlah parameter310B1.02TPro mempunyai lebih 3× kapasiti keseluruhan
Parameter diaktifkan15B42BPro menggunakan kira-kira 2.8× lebih banyak parameter aktif
Lapisan / pakar berute48 / 25670 / 384Pro ialah sasaran penyajian yang lebih besar
Siling konteks kad model1M1MKedua-duanya menyenaraikan sehingga 1M token; uji pengambilan dan latensi pada saiz beban kerja
Output maksimum API rasmi128K128KHalaman model API Xiaomi semasa menyenaraikan 128K; had khusus penyedia mungkin berbeza
Input asliTeks, imej, video, audioTeksMiMo-V2.5 ialah pilihan multimodal yang didokumenkan; sahkan titik akhir Pro sebelum hantar media
SWE-Bench Pro56.157.2Pro mendahului sebanyak 1.1 mata
Terminal-Bench 2.065.868.4Pro mendahului sebanyak 2.6 mata
Kesesuaian utamaEjen multimodal cekapPengekodan kompleks dan ejen jangka panjangPilih mengikut beban kerja yang diuji; margin peringkat model tidak membuktikan kelebihan umum

Keputusan perbandingan: kelebihan penanda aras Pro adalah sederhana pada dua ujian ejen pengekodan bersama, manakala varian standard menambah input imej, video dan audio asli serta menggunakan parameter aktif yang jauh lebih sedikit. Pro wajar dipilih apabila peningkatan kecil dalam penyelesaian tugas sukar lebih berharga daripada input multimodal dan kos unit lebih rendah.

Berapakah Kos MiMo-V2.5 dan MiMo-V2.5-Pro?

Asas harga: May 27, 2026API standard rasmiAPI Pro rasmiAPI MiMo-V2.5 di CometAPIAPI MiMo-V2.5-Pro di CometAPI
Input, cache miss / MTok$0.14$0.435$0.112$0.348
Output / MTok$0.28$0.87$0.224$0.696
Input, cache hit / MTok$0.0028$0.0036Semak bil langsungSemak bil langsung
Diskaun vs kadar tanpa cache rasmiAsasAsas20%20%

Pada kadar rasmi, Pro berharga kira-kira 3.1× daripada standard untuk input dan output tanpa cache. Harga penyedia yang ditunjukkan di atas mengurangkan setiap pasangan tanpa cache sebanyak 20%, tetapi jurang relatif antara varian kekal hampir tidak berubah.

Harga per token bukan kos keseluruhan. Ulangan alat, saiz konteks, panjang output, latensi, pemulihan tugas gagal dan semakan manusia menentukan kos per tugas siap. Jalankan sampel beban kerja yang mewakili sebelum memilih model produksi lalai.

Untuk Apa MiMo-V2.5 Paling Sesuai?

  • Ejen multimodal: gabungkan tangkapan skrin, dokumen, video, audio, arahan dan alat dalam satu aliran kerja.
  • Analisis dokumen panjang: proses repositori, kontrak, arkib penyelidikan, log dan sejarah sokongan.
  • Kefahaman media: ringkaskan video, ekstrak peristiwa, tafsir carta dan jawab soalan audiovisual.
  • Ejen pengekodan dan terminal: periksa fail, jalankan arahan, ubah suai kod dan ulang pada keputusan ujian.
  • Automasi volum tinggi: gunakan pengaktifan jarang dan harga token lebih rendah untuk tugas produksi berulang.

Had dan Risiko

  • Hanya 15B parameter aktif per token, tetapi hos sendiri masih memerlukan sistem berat 310B penuh.
  • Output multimodal ialah teks; penjanaan imej, pertuturan dan video memerlukan model lain.
  • Siling konteks 1M tidak menjamin ketepatan pengambilan seragam merentas seluruh tetingkap.
  • Penanda aras penerbit mungkin tidak terpakai pada alat tersuai, repositori, prompt atau kekangan keselamatan.
  • Pendedahan modaliti peringkat penyedia boleh berbeza daripada keupayaan penuh model berat terbuka yang mendasari.

Gerbang produksi:

sahkan ketepatan, penyempurnaan panggilan alat, latensi, penggunaan token, pengendalian modaliti dan tingkah laku jatuh balik pada tugas perwakilan sebelum melakukan trafik.

Contoh API

Contoh Python berikut menggunakan titik akhir CometAPI yang serasi dengan OpenAI dan ID model standard. Sahkan titik akhir semasa dan skema permintaan yang disokong sebelum pengedaran.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
    max_retries=0,
)

response = client.chat.completions.create(
    model="mimo-v2.5",
    max_tokens=256,
    messages=[
        {
            "role": "user",
            "content": "Summarize the main findings in this technical report.",
        }
    ],
)

print(response.choices[0].message.content)

Panduan Keputusan

Isyarat beban kerjaMulakan denganTukar apabila
Imej, video atau audio ialah input kelas pertamaStandardJangan tukar melainkan prapemprosesan multimodal boleh diterima
Dokumen besar atau volum media bercampurStandardPro hanya jika kegagalan penaakulan mendominasi kos
Kejuruteraan repositori sukarUji kedua-duanyaPilih Pro jika kenaikan penyempurnaan mengimbangi kos unit 3.1×
Trajektori terminal autonomi panjangProKembali ke standard jika kenaikan tidak terukur
Automasi rutin volum tinggiStandardNaik taraf hanya tugas gagal atau bernilai tinggi

Penghalaan yang disyorkan:

gunakan standard sebagai lalai untuk kerja multimodal dan volum tinggi, kemudian halakan hanya tugas input-teks sukar atau jangka panjang kepada Pro. Ini mengekalkan keupayaan sambil mengawal jumlah kos.

Kesimpulan

Model standard bukan sekadar Pro yang lebih kecil. Ia ialah titik pengoptimuman tersendiri: input multimodal asli, konteks 1M, penanda aras berorientasikan alat yang kukuh, dan 15B parameter aktif pada harga token yang jauh lebih rendah.

Pro ialah pilihan pakar untuk kejuruteraan perisian sukar dan pelaksanaan autonomi berterusan. Kapasiti tambahannya menghasilkan peningkatan yang boleh diukur tetapi tidak sejagat, jadi corak pengedaran terkuat ialah penghalaan berasaskan beban kerja dan bukannya memilih satu varian untuk setiap permintaan.

Soalan Lazim

Adakah model standard sumber terbuka?

Beratnya dikeluarkan di bawah lesen MIT, membenarkan penggunaan komersial, pengubahsuaian, penalaan halus dan pengagihan semula tertakluk kepada terma lesen.

Berapa banyak parameter yang digunakan?

MoE jarang mengandungi 310B jumlah parameter dan mengaktifkan 15B untuk setiap token. Parameter aktif menerangkan pengkomputeran per token, bukan saiz storan model lengkap.

Adakah ia menyokong imej, video dan audio?

Ya. Varian standard menerima input teks, imej, video dan audio serta mengembalikan teks. Spesifikasi rasmi varian Pro menyenaraikan input teks.

Apakah tetingkap konteks maksimum?

Kedua-dua kad model menyatakan tetingkap konteks sehingga 1M token. Halaman API Xiaomi semasa menyenaraikan output maksimum 128K untuk MiMo-V2.5 dan MiMo-V2.5-Pro. Had yang boleh digunakan sebenarnya boleh berbeza mengikut titik akhir, penyedia, akaun dan format permintaan; sahkan laluan yang digunakan sebelum bergantung pada siling tersebut.

Halaman API Pro rasmi semasa mengesahkan 1M konteks dan output maksimum 128K: Spesifikasi API MiMo-V2.5-Pro

Varian manakah lebih baik untuk ejen pengekodan?

Pro melaporkan keputusan lebih tinggi pada penanda aras pengekodan dan terminal bersama, tetapi margin adalah sederhana. Uji kedua-duanya pada repositori sasaran dan pilih berdasarkan penyempurnaan tugas, latensi dan jumlah kos.

Varian manakah lebih baik untuk ejen multimodal?

Varian standard ialah pilihan semula jadi kerana ia menerima input imej, video dan audio secara asli. Pro tertumpu pada input teks.

Bagaimanakah pasukan produksi harus memilih?

Mulakan dengan standard, ukur kegagalan, dan halakan hanya tugas input-teks sukar yang mendapat manfaat daripada Pro. Bandingkan kos per tugas siap, bukan harga per token semata-mata.

Terus belajar

Sambungkan artikel ini ke keputusan seterusnya.

Lihat semua topik
Diterbitkan pada Oct 5, 2026
Terakhir dikemas kini Oct 5, 2026
0 paparan
Disemak untuk kejelasan, atribusi sumber dan terminologi API semasa.

Baca Lagi