Spesifikasi Teknikal MiMo-V2.5-Pro
| Spesifikasi | MiMo-V2.5-Pro |
|---|---|
| ID model | mimo-v2.5-pro |
| Penyedia | Xiaomi MiMo |
| Jenis model | Model bahasa besar berorientasi agen |
| Seni bina | Campuran Pakar Jarang |
| Jumlah parameter | 1.02T |
| Parameter diaktifkan | 42B |
| Tetingkap konteks | 1M token |
| Output | Teks |
| Seni bina perhatian | Hibrid SWA + Perhatian Global |
| Token latihan | 27T |
| Konteks maksimum model asas | 256K |
| Konteks maksimum Pro | 1M |
| Lesen | MIT |
Perbezaan antara 1.02T jumlah parameter dan 42B parameter aktif adalah penting. MiMo-V2.5-Pro ialah model MoE: setiap token mengaktifkan hanya subset parameter yang tersedia. Ini mengubah profil pengiraan inferens dengan ketara berbanding model padat dengan 1T parameter, walaupun keseluruhan model masih mempunyai keperluan memori dan penyebaran yang sangat besar.
Apakah Ciri Utama MiMo-V2.5-Pro?
1. Seni Bina MoE Jarang pada Skala Trilion
MiMo-V2.5-Pro mengandungi 1.02T jumlah parameter dan 42B parameter diaktifkan.
Seni binanya mengandungi 384 pakar dirutekan, dengan lapan pakar diaktifkan bagi setiap token. Model ini mempunyai 70 lapisan transformer, terdiri daripada satu lapisan padat dan 69 lapisan MoE.
Ini memberikan kapasiti perwakilan yang jauh lebih besar berbanding MiMo-V2.5 standard sambil mengelakkan kos pengiraan untuk mengaktifkan semua 1.02T parameter bagi setiap token.
Kesimpulan praktikalnya ialah:
MiMo-V2.5-Pro ialah model berkapasiti trilion parameter mengikut jumlah keseluruhan, tetapi pengiraan per tokennya ditentukan oleh laluan 42B parameter aktif.
2. Konteks 1 Juta Token
Model ini menyokong sehingga 1M token konteks.
Ini ialah salah satu keupayaan terpentingnya untuk agen autonomi kerana aliran kerja jangka panjang boleh mengumpulkan:
- Output alat
- Kod sumber
- Keputusan carian
- Dokumentasi
- Keadaan penaakulan perantaraan
- Arahan pengguna
- Log pelaksanaan
Daripada berkali-kali merumus dan membuang konteks lama, agen berpotensi mengekalkan sejarah kerja yang jauh lebih besar.
Penilaian konteks panjang Xiaomi secara khusus menguji model daripada 32K hingga 1M token input.
3. Perhatian Hibrid Tetingkap Gelangsar dan Global
MiMo-V2.5-Pro menggunakan nisbah 6:1 antara Sliding Window Attention (SWA) dan Perhatian Global, dengan tetingkap gelangsar 128 token.
Seni bina ini mengandungi:
- 60 lapisan SWA
- 10 lapisan perhatian global
- Tetingkap SWA 128 token
Xiaomi melaporkan bahawa reka bentuk ini mengurangkan storan cache KV hampir 7× sambil mengekalkan prestasi konteks panjang melalui bias attention-sink yang boleh dipelajari.
Ini adalah antara bahagian paling signifikan dari segi teknikal bagi model ini.
Tetingkap konteks 1M adalah mahal jika setiap lapisan melakukan perhatian penuh ke atas keseluruhan jujukan. Perhatian hibrid mengurangkan jumlah maklumat yang perlu dihadiri secara global oleh setiap lapisan sambil mengekalkan lapisan perhatian global khusus untuk hubungan jarak jauh.
4. Peramalan Berbilang Token
MiMo-V2.5-Pro mengandungi tiga modul MTP ringan.
Multi-Token Prediction membolehkan model meramalkan berbilang token masa hadapan dengan cara yang boleh digunakan untuk penyahkodan gaya spekulatif dan pemecutan inferens.
Xiaomi melaporkan bahawa seni bina MTPnya boleh menjadikan kelajuan output tiga kali ganda semasa inferens di bawah konfigurasi penyebaran yang dihuraikan.
Ini amat penting untuk agen kerana agen mungkin menghasilkan sejumlah besar output perantaraan sepanjang trajektori yang panjang. Peningkatan kelajuan penjanaan token oleh itu boleh memberi kesan bermakna terhadap kependaman keseluruhan tugas.
5. Pembelajaran Pengukuhan Berorientasi Agen
Saluran pasca latihan MiMo-V2.5-Pro merangkumi:
- Penalaan halus terselia
- Pembelajaran pengukuhan berorientasi agen berskala besar
- Penyulingan On-Policy Berbilang Guru (MOPD)
Objektif latihan secara jelas berorientasi kepada tingkah laku agen yang kompleks, bukan sekadar menjawab soalan penanda aras statik.
Itulah sebabnya penilaian terkuat model ini tertumpu pada pengkodan, interaksi terminal, penaakulan konteks panjang, dan penanda aras agen.
6. Pra-latihan 27T Token
MiMo-V2.5-Pro telah dipra-latih pada kira-kira 27 trilion token, menggunakan ketepatan campuran FP8 dan panjang jujukan natif 32K sebelum menyokong tetingkap konteks 1M yang diperluas.
Skala pra-latihan, digabungkan dengan seni bina MoE berparameter trilion, menempatkan MiMo-V2.5-Pro dengan kukuh dalam kelas model perintis semasa.
Bagaimanakah Prestasi MiMo-V2.5-Pro pada Penanda Aras?
Keputusan penilaian yang diterbitkan amat berguna kerana ia merangkumi kedua-dua penanda aras penaakulan umum dan penilaian pengkodan/agen praktikal.
| Penanda aras | Keputusan MiMo-V2.5-Pro | Jenis penilaian |
|---|---|---|
| SWE-Bench Verified | 78.9 | Kejuruteraan perisian |
| SWE-Bench Pro | 57.2 | Kejuruteraan perisian |
| Terminal-Bench 2.0 | 68.4 | Agen terminal |
| GSM8K | 99.6 | Penaakulan matematik |
| GPQA Diamond | 66.7 | Penaakulan peringkat siswazah |
| MMLU-Pro | 68.5 | Penaakulan umum |
| MMLU | 89.4 | Pengetahuan/penaakulan umum |
| MMLU-Redux | 92.8 | Pengetahuan/penaakulan umum |
| HumanEval+ | 75.6 | Penjanaan kod |
| MBPP+ | 74.1 | Pengaturcaraan Python |
| LiveCodeBench v6 | 39.6 | Pengkodan kompetitif |
| ARC-Challenge | 97.2 | Penaakulan |
| AIME 2024/2025 | 37.3 | Matematik pertandingan |
Keputusan menunjukkan profil yang amat kukuh dalam kejuruteraan perisian dan penaakulan matematik. Skor 78.9 pada SWE-Bench Verified dan 68.4 pada Terminal-Bench 2.0 amat relevan untuk pembangun yang membina sistem pengkodan autonomi.
Prestasi Konteks Panjang
Keputusan konteks panjang boleh dikatakan lebih menarik daripada penanda aras standard.
Dalam penilaian GraphWalks, MiMo-V2.5-Pro mengekalkan prestasi yang boleh diukur pada panjang konteks yang ekstrem:
| Konteks | BFS | Parents |
|---|---|---|
| 512K | 0.56 | 0.92 |
| 1M | 0.37 | 0.62 |
Xiaomi melaporkan bahawa MiMo-V2-Pro terdahulu merosot dengan cepat melepasi 128K dan mencapai 0.00 pada 1M bagi kedua-dua subtugas, manakala V2.5-Pro mengekalkan prestasi bukan sifar pada konteks penuh 1M.
Ini adalah perbezaan yang bermakna: Konteks 1M MiMo-V2.5-Pro bukan sekadar maksimum teori; penilaian konteks panjang yang diterbitkan menunjukkan prestasi yang berguna jauh ke dalam tetingkap tersebut.
Contoh Agen Dunia Sebenar
| Tugas | Keputusan Dilaporkan |
|---|---|
| PKU SysY Compiler | 4.3 jam |
| Panggilan alat semasa tugas pengkompil | 672 |
| Kes ujian pengkompil lulus | 233/233 |
| Penyunting video full-stack | 11.5 jam |
| Kod dihasilkan untuk penyunting video | 8,192 baris |
| Campur tangan manusia | Tiada dilaporkan |
| Panggilan alat jangka panjang | Hampir 1,000 |
Ini ialah demonstrasi yang dilaporkan oleh Xiaomi, bukan skor penanda aras yang dibakukan.
MiMo-V2.5-Pro berbanding MiMo-V2.5
Kedua-dua model berkongsi generasi yang sama tetapi menyasarkan beban kerja yang berbeza.
| Spesifikasi | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| Jumlah parameter | 310B | 1.02T |
| Parameter diaktifkan | 15B | 42B |
| Konteks | 1M | 1M |
| Lapisan | 48 | 70 |
| Pakar dirutekan | 256 | 384 |
| Pakar/token | 8 | 8 |
| Lapisan perhatian penuh | 9 | 10 |
| Lapisan SWA | 39 | 60 |
| Fokus utama | Agen omni-modal | Agen kompleks/pengkodan |
| Pemahaman video/audio/imej | Ya | Terutamanya berfokus bahasa/agen |
| Prestasi agen jangka panjang | Kukuh | Perdana |
Oleh itu pilihan bukan sekadar “Pro lebih baik”.
Jika aplikasi memerlukan pemahaman imej, video dan audio secara natif, MiMo-V2.5 ialah pilihan yang lebih sesuai. Jika beban kerja tertumpu pada penaakulan kompleks, kejuruteraan perisian, interaksi terminal, dan agen jangka panjang, MiMo-V2.5-Pro lebih tepat.
Batasan MiMo-V2.5-Pro
1. Input Model Hanya Teks
Tidak seperti mimo-v2.5, spesifikasi rasmi model Pro menyenaraikan Teks sebagai modaliti inputnya. Ia tidak sepatutnya dipasarkan sebagai model multimodal dalam keluarga V2.5.
2. Keperluan Pengiraan Tinggi untuk Hos Sendiri
Model ini mempunyai kira-kira 1T jumlah parameter / 42B parameter aktif, menjadikan penggunaan secara lokal jauh lebih menuntut berbanding model kecil terbuka konvensional.
3. Prestasi Agen Bergantung pada Rangka Kerja
Tuntutan Xiaomi tentang hampir 1,000 panggilan alat secara jelas dikaitkan dengan penggunaan rangka kerja Agen yang sesuai. Model semata-mata tidak menjamin bahawa aplikasi akan mencapai prestasi jangka panjang yang sama.
4. Pengendalian Kandungan Penaakulan
Aplikasi Agen berbilang pusingan yang menggunakan mod pemikiran dan panggilan alat perlu mengekalkan reasoning_content dengan betul. Pengendalian yang salah boleh menghasilkan ralat API.
Kes Penggunaan Terbaik
Kejuruteraan perisian berskala besar
- Migrasi repositori
- Refaktor
- Nyahpepijat
- Penjanaan ujian
- Pembangunan pengkompil
- Pembangunan aplikasi full-stack
Agen pengkodan autonomi
MiMo-V2.5-Pro amat sesuai untuk Agen yang perlu berulang kali:
memeriksa → mengubah suai → melaksanakan → menguji → mendiagnosis → mengubah suai
Penaakulan dokumen panjang
Konteks 1M menjadikannya berguna untuk:
- Kontrak undang-undang
- Spesifikasi teknikal
- Koleksi penyelidikan berskala besar
- Dokumentasi perusahaan
Agen perniagaan kompleks
Panggilan alat + carian web + output berstruktur boleh menyokong:
- Agen penyelidikan
- Agen pemprosesan data
- Automasi aliran kerja perusahaan
- Sistem keputusan berbilang langkah
Cara Menggunakan API MiMo-V2.5-Pro pada CometAPI
ID model CometAPI yang berkaitan ialah:
mimo-v2.5-pro
Bagi pembangun, lapisan pengagregatan API amat berguna untuk menguji MiMo-V2.5-Pro berbanding model penaakulan dan agen bertaraf tinggi lain tanpa mengekalkan integrasi penyedia yang bebas.
Langkah 1: Dapatkan Kunci API CometAPI
Cipta atau log masuk ke akaun CometAPI anda dan peroleh kunci API daripada konsol API.
Tetapkan ia sebagai pembolehubah persekitaran:
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
Langkah 2: Konfigurasikan Klien API
Xiaomi menyediakan API yang serasi dengan kedua-dua protokol OpenAI dan Anthropic, menjadikan migrasi agak mudah. Untuk integrasi produksi, gunakan titik akhir/skema CometAPI semasa untuk mimo-v2.5-pro, terutamanya jika anda memerlukan ciri lanjutan seperti panggilan alat, penstriman, output berstruktur, atau permintaan konteks panjang.
Langkah 3: Sambungkan MiMo-V2.5-Pro kepada Alat
Model ini menjadi jauh lebih berguna apabila disambungkan kepada alat luaran.
Sebagai contoh:
┌── Web Search
│
User → MiMo-V2.5-Pro ├── GitHub
│
├── Terminal
│
├── Database
│
└── Internal APIs
↓
Tool Results
↓
MiMo-V2.5-Pro
↓
Final Result
Seni bina ini jauh lebih selaras dengan penggunaan yang dimaksudkan bagi model tersebut berbanding integrasi chatbot yang ringkas.