Spesifikasi Teknikal MiMo-V2.5
| Spesifikasi | MiMo-V2.5 |
|---|---|
| ID Model | mimo-v2.5 |
| Penyedia | Xiaomi MiMo |
| Jenis model | Model asas omni-modal natif |
| Seni bina | Campuran Pakar (MoE) jarang |
| Jumlah parameter | 310B |
| Parameter diaktifkan | 15B |
| Tetingkap konteks | 1M token |
| Output maksimum | 128K token |
| Modaliti input | Teks, Imej, Video, Audio |
| Output | Teks |
| Pengekod visi | ViT 729M parameter |
| Pengekod audio | Audio Transformer 261M parameter |
| Panggilan alat, Carian web, Output berstruktur, Penstriman, Cache konteks | Ya |
| Lesen | MIT |
Seni bina 310B/15B amat penting. MiMo-V2.5 bukan model 15B dalam erti kata konvensional; 15B ialah bilangan parameter yang diaktifkan bagi setiap token, manakala keseluruhan MoE mengandungi 310B parameter. Model ini menggunakan 256 pakar dirutekan dan mengaktifkan lapan pakar bagi setiap token.
Apakah MiMo-V2.5?
MiMo-V2.5 ialah model multimodal generasi baharu Xiaomi yang dibina khusus berasaskan persepsi omni-modal dan aplikasi agen.
Tidak seperti LLM teks sahaja konvensional, MiMo-V2.5 secara natif memahami imej, video, audio dan teks. Xiaomi memposisikannya untuk senario konteks panjang dan agen multimodal di mana model perlu memerhati maklumat, menalarnya, dan seterusnya menggunakan alat atau melaksanakan tindakan.
Terdapat juga pertimbangan versi semasa yang penting untuk pembangun: Xiaomi menyahgunakan model MiMo-V2 yang lebih lama pada 30 Jun 2026, dan mengesyorkan migrasi ke siri V2.5.
Ini menjadikan mimo-v2.5 sebagai ID model yang relevan untuk integrasi baharu dan bukannya mimo-v2-pro, mimo-v2-omni, atau mimo-v2-flash yang lebih lama.
Apakah Ciri Utama MiMo-V2.5?
Pemahaman Omni-Modal Natif
Ciri penentu MiMo-V2.5 ialah multimodaliti diintegrasikan terus ke dalam model.
Ia menerima:
- Teks
- Imej
- Video
- Audio
Ini membolehkan pembangun mencipta aplikasi yang menalar merentas pelbagai jenis maklumat dan bukannya memproses setiap modaliti secara berasingan lalu menyerahkan hasilnya kepada LLM teks. Xiaomi menerangkan ini sebagai persepsi modal penuh natif.
Contoh praktikal ialah agen analisis video yang menerima video panjang bersama trek audio dan soalan berasaskan teks, kemudian mengenal pasti peristiwa, menerangkan apa yang berlaku, dan menghasilkan jawapan berstruktur.
Tetingkap Konteks 1M-Token
MiMo-V2.5 menyokong 1 juta token konteks dan sehingga 128K token output.
Ini menjadikan model ini amat menarik untuk:
- Analisis dokumen besar
- Pemahaman video panjang
- Pengekodan pada aras repositori
- Sesi penyelidikan panjang
- Agen berbilang langkah
- Perbualan lanjutan
- Pangkalan pengetahuan perusahaan berskala besar
1M konteks bukan sekadar nombor pemasaran. Xiaomi secara khusus mengenal pasti penjejakan video panjang, analisis dokumen panjang, dan penaakulan temporal lanjutan sebagai beban kerja sasaran.
Penggunaan Alat Agen
MiMo-V2.5 menyokong panggilan fungsi, carian web, output berstruktur, dan penstriman.
Ini menjadikannya jauh lebih berguna untuk aplikasi agen berbanding model yang terhad kepada penjanaan teks.
Aliran kerja tipikal boleh kelihatan seperti:
Memerhati → Menalar → Mencari → Memanggil Alat → Menganalisis Hasil → Meneruskan
Ini amat berguna untuk agen penyelidikan, pembantu pengekodan, agen sokongan pelanggan, dan automasi multimodal.
Kecekapan MoE Jarang
MiMo-V2.5 menggunakan seni bina MoE jarang 310B parameter dengan hanya 15B parameter diaktifkan setiap token.
Rangka utamanya mengandungi 48 lapisan, termasuk 39 lapisan perhatian tetingkap gelongsor dan sembilan lapisan perhatian penuh. Reka bentuk hibrid ini bertujuan menjadikan konteks yang sangat panjang lebih mudah diurus dari segi pengiraan.
Perbezaan penting untuk pembangun ialah kiraan parameter diaktifkan tidak harus ditafsir sebagai keperluan memori keseluruhan. Menghos sendiri model 310B parameter kekal sebagai usaha infrastruktur yang besar.
Perhatian Tetingkap Gelongsor Hibrid
MiMo-V2.5 menggabungkan perhatian tetingkap gelongsor dengan perhatian global.
Seni binanya menggunakan tetingkap SWA 128 token, dengan 39 lapisan SWA dan sembilan lapisan perhatian penuh.
Pilihan seni bina ini amat relevan dengan keupayaan konteks 1M token model kerana mengekalkan perhatian penuh merentas setiap lapisan akan menjadikan inferens konteks panjang jauh lebih mahal.
Ramalan Berbilang Token
MiMo-V2.5 merangkumi tiga lapisan MTP dengan kira-kira 329M parameter. Reka bentuk MTP bertujuan meningkatkan kecekapan inferens melalui penyahkodan spekulatif dan menyokong latihan pembelajaran peneguhan yang lebih cekap.
Bagaimana Prestasi MiMo-V2.5 pada Penanda Aras?
MiMo-V2.5 telah menerbitkan hasil penanda aras yang merangkumi pengekodan, agen terminal, agen penyelidikan, dan tugas agen multimodal. Kad model Hugging Face semasa melaporkan keputusan berikut:
| Penanda aras | MiMo-V2.5 | Fokus Penilaian |
|---|---|---|
| SWE-Bench Pro | 56.1 | Kejuruteraan perisian |
| Terminal-Bench 2.0 | 65.8 | Tugas terminal/agen |
| Claw-Eval General | 62.1 Pass³% | Keupayaan agen umum |
| Claw-Eval Multimodal | 23.8 Pass³% | Keupayaan agen multimodal |
| Claw-Eval Multi-Turn | 63.2 Pass³% | Agen berbilang pusingan |
| ResearchClawBench | 16.91 | Tugas agen penyelidikan |
Nombor ini perlu ditafsir dengan berhati-hati.
Keputusan 56.1 SWE-Bench Pro menunjukkan keupayaan kejuruteraan perisian yang bermakna, manakala keputusan 65.8 Terminal-Bench 2.0 amat relevan untuk agen yang berinteraksi dengan terminal dan persekitaran pembangunan.
Pada masa yang sama, perbezaan antara skor Claw-Eval umum (62.1) dan skor multimodal (23.8) merupakan amaran berguna: prestasi agen umum yang kuat tidak secara automatik bermakna prestasi sama kuat pada setiap tugas agen multimodal.
Untuk penilaian produksi, pembangun oleh itu harus menguji beban kerja mereka sendiri dan tidak bergantung pada satu nombor papan kedudukan.
Bagaimana MiMo-V2.5 Berbanding MiMo-V2.5-Pro?
MiMo-V2.5 dan MiMo-V2.5-Pro tergolong dalam generasi V2.5 yang sama tetapi mempunyai sasaran pengoptimuman yang berbeza.
| Spesifikasi | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| Jumlah parameter | 310B | 1.02T |
| Parameter diaktifkan | 15B | 42B |
| Konteks | 1M | 1M |
| Input multimodal | Teks/Imej/Video/Audio | Berfokuskan agen |
| Kedudukan utama | Agen omni-modal | Agen kompleks & pengekodan |
| Pakar dirutekan | 256 | 384 |
| Pakar/token | 8 | 8 |
| Lapisan LLM | 48 | 70 |
| Lapisan MTP | 3 | 3 |
Perbezaannya adalah mudah:
Pilih MiMo-V2.5 untuk pemahaman multimodal natif dan agen tujuan umum yang cekap. Pilih MiMo-V2.5-Pro untuk penaakulan, pengekodan, dan beban kerja agen ufuk panjang yang paling sukar.
Panduan pemilihan model Xiaomi mengesyorkan mimo-v2.5 khusus untuk memahami kandungan imej, audio, dan video, sementara mengesyorkan mimo-v2.5-pro untuk penaakulan kompleks dan pemprosesan dokumen panjang.
Kes Penggunaan untuk MiMo-V2.5
Agen AI Multimodal
MiMo-V2.5 boleh berfungsi sebagai model pusat untuk agen yang perlu meneliti dokumen, imej, video, dan audio sebelum memutuskan tindakan yang hendak diambil.
Analisis Dokumen Berkonteks Panjang
Konteks 1M token menjadikannya sesuai untuk menganalisis:
- Koleksi dokumen undang-undang yang besar
- Dokumentasi teknikal
- Arkib penyelidikan
- Pangkalan kod yang besar
- Pangkalan pengetahuan perusahaan
Agen Pengekodan
Penanda aras agen dan keupayaan penggunaan alat model ini menjadikannya sesuai untuk pembantu pengekodan yang perlu meneliti repositori, menalar tentang pepijat, melaksanakan alat, dan beriterasi atas penyelesaian.
Pemahaman Video
Daripada menganggap penjanaan video sebagai tujuan utamanya, MiMo-V2.5 menggunakan video sebagai modaliti input untuk pemahaman.
Aplikasi berpotensi termasuk:
- Pemeringkasan video
- Soal jawab video panjang
- Carian video
- Pengesanan peristiwa
- Analisis video pendidikan
- Analisis rakaman keselamatan
Pembantu Audio-Visual
Memandangkan model menerima maklumat audio dan visual, pembangun boleh membina pembantu yang mampu mentafsir arahan pertuturan bersama konteks visual.
Agen Autonomi Jangka Panjang
Gabungan konteks panjang dan latihan berasaskan agen menjadikan MiMo-V2.5 sesuai untuk aliran kerja di mana model mesti mengekalkan keadaan merentasi banyak langkah perantaraan dan bukannya menyiapkan tugas dalam satu respons.
Had MiMo-V2.5
Spesifikasi MiMo-V2.5 mengagumkan, tetapi beberapa had praktikal wajar diberi perhatian.
Pertama, konteks 1M tidak bermakna setiap aplikasi akan mencapai prestasi optimum pada tetingkap maksimum. Inferens konteks panjang masih melibatkan pertimbangan memori, jalur lebar, dan kependaman yang signifikan.
Kedua, model ini ialah sistem MoE yang sangat besar. Walaupun hanya 15B parameter diaktifkan setiap token, model lengkap mengandungi kira-kira 310B parameter, menjadikan hos sendiri jauh lebih mencabar berbanding menjalankan model tumpat kecil.
Ketiga, prestasi penanda aras multimodal boleh berubah dengan ketara mengikut tugas. Keputusan Claw-Eval menunjukkan skor multimodal yang jauh lebih rendah berbanding skor agen umum, mengukuhkan keperluan untuk pengujian khusus aplikasi.
Akhir sekali, ekosistem model ini masih lebih baharu daripada ekosistem matang di sekitar GPT, Claude, dan Gemini. Oleh itu, pembangun harus menilai peralatan, keserasian penyedia, kelakuan output berstruktur, dan kebolehpercayaan panggilan alat sebelum menggunakannya dalam sistem produksi misi kritikal.
Cara Menggunakan API MiMo-V2.5 pada CometAPI
MiMo-V2.5 amat sesuai dalam platform pengagregatan API kerana ia mengikuti corak API yang serasi dengan ekosistem LLM sedia ada. Xiaomi sendiri menyediakan capaian API serasi OpenAI dan Anthropic.
Dengan CometAPI, integrasi boleh mengikuti aliran kerja asas yang sama digunakan untuk model lain yang disokong.
Langkah 1: Dapatkan Kunci API CometAPI
Cipta atau log masuk ke akaun CometAPI anda dan dapatkan kunci API anda.
import os
COMETAPI_KEY = os.environ["COMETAPI_KEY"]
Langkah 2: Konfigurasikan Model MiMo-V2.5
Tetapkan model kepada:
mimo-v2.5
dan gunakan titik akhir API serasi CometAPI.
Titik akhir dan skema permintaan yang tepat harus disemak dengan dokumentasi model/API CometAPI semasa sebelum penyebaran.
Langkah 3: Bina Aliran Kerja Multimodal dan Agen
Penggunaan mimo-v2.5 yang lebih menarik bukan sembang teks biasa. Pembangun boleh menggabungkan penaakulan multimodalnya dengan alat luaran untuk mencipta aliran kerja seperti:
Input pengguna → pemahaman imej/video/audio → penaakulan → panggilan alat → analisis hasil → tindakan seterusnya
Ini menjadikan model ini amat menarik untuk agen penyelidikan autonomi, agen pengekodan, sistem sokongan pelanggan multimodal, dan pembantu perusahaan berkonteks panjang.
Mengapa Menggunakan MiMo-V2.5 Melalui CometAPI?
MiMo-V2.5 amat berguna dalam persekitaran API berbilang model kerana pembangun mungkin mahu membandingkannya dengan GPT, Claude, Gemini, DeepSeek, atau model agen lain tanpa membina timbunan infrastruktur berasingan untuk setiap penyedia.
CometAPI boleh berguna apabila aplikasi anda memerlukan:
- Lapisan API bersatu
- Akses kepada pelbagai keluarga model AI
- Pertukaran model yang lebih mudah
- Pengurusan kunci API berpusat
- Perbandingan model yang pantas
- Satu lapisan integrasi untuk eksperimen dan produksi
Bagi pasukan yang menilai prestasi agen berbanding kos inferens, MiMo-V2.5 berbaloi diuji bersama model mercu tanda yang lebih mahal dan bukannya menganggap bahawa model proprietari terbesar secara automatik akan menjadi pilihan terbaik.