Apakah MiMo-V2.6-Flash?
MiMo-V2.6-Flash ialah model berfokus kecekapan daripada keluarga MiMo-V2.6 Xiaomi. Ia merupakan model penaakulan multimodal asli yang direka untuk panggilan berfrekuensi tinggi, beban kerja berskala besar, pengkodan, automasi, dan tugasan agen jangka panjang.
Model ini menerima input berbentuk teks, imej, video, dan audio dan menghasilkan output teks. Xiaomi menerangkannya sebagai model modaliti penuh yang dioptimumkan untuk aliran kerja dunia sebenar, dengan tetingkap konteks 1M token, pemikiran mendalam, panggilan alat, output berstruktur, penstriman, carian web, dan keupayaan cache konteks.
Titik semak berat terbuka MiMo-V2.6-Flash-RL menggunakan seni bina Mixture-of-Experts jarang dengan 309 bilion jumlah parameter dan 15 bilion parameter diaktifkan. Kad modelnya menerangkan panjang konteks 1M token, pengekod visi 681M parameter, pengekod audio, dan penyahkod spekulatif lima lapisan.
Spesifikasi Teknikal
| Spesifikasi | MiMo-V2.6-Flash |
|---|---|
| ID Model | mimo-v2.6-flash |
| Penyedia | Xiaomi MiMo |
| Jenis Model | Model penaakulan multimodal |
| Seni bina | Sparse MoE |
| Jumlah Parameter | 309B |
| Parameter Diaktifkan | 15B |
| Modaliti Input | Teks, Imej, Video, Audio |
| Modaliti Output | Teks |
| Tetingkap Konteks | 1M tokens |
| Output Maksimum | Sehingga 128K tokens |
| Penaakulan | Pemikiran mendalam |
| Panggilan Alat | Disokong |
| Output Berstruktur | Disokong |
| Penstriman | Disokong |
| Carian Web | Disokong |
| Cache Konteks | Disokong |
Halaman model rasmi Xiaomi menyenaraikan tetingkap konteks 1M token, sehingga 128K token output, 100 RPM, dan 10M TPM.
Ciri Utama MiMo-V2.6-Flash
1. Pemahaman Modaliti Penuh Asli
MiMo-V2.6-Flash direka untuk memproses teks, imej, video, dan audio dalam model yang sama. Ini menjadikannya sesuai untuk aplikasi di mana maklumat diedarkan merentas pelbagai format media dan tidak terkandung sepenuhnya dalam teks.
Aplikasi tipikal termasuk analisis dokumen multimodal, pemeriksaan visual, pemahaman video, penyelidikan berpandukan audio, dan aliran kerja yang menggabungkan pelbagai jenis bukti.
2. Konteks 1M Token
Model ini menyokong tetingkap konteks sehingga 1 juta token, menjadikannya sesuai untuk repositori besar, dokumen panjang, jejak alat yang luas, dan aliran kerja agen berbilang sesi. Xiaomi secara khusus memposisikan model ini untuk tugasan jangka panjang dan kolaborasi multi-agen.
Kapasiti konteks yang besar ini boleh mengurangkan keperluan untuk meringkaskan atau memecah isi maklumat yang besar berulang kali sebelum memprosesnya.
3. Penaakulan dan Aliran Kerja Berasaskan Agen
MiMo-V2.6-Flash dibina di sekitar beban kerja berorientasikan penaakulan dan agen. Senarai keupayaan rasminya merangkumi pemikiran mendalam dan panggilan alat, sementara kad model menerangkan pembelajaran pengukuhan campuran merentas pengkodan, agen umum, tugasan visual, dan keselamatan siber.
Ini menjadikannya relevan untuk aplikasi seperti:
- Agen penyelidikan berbilang langkah
- Agen pengkodan
- Orkestrasi alat
- Aliran kerja penggunaan komputer
- Analisis automatik
- Tugasan perancangan jangka panjang
4. Panggilan Alat dan Output Berstruktur
Model ini menyokong panggilan alat dan output berstruktur, membolehkannya menyertai aplikasi di mana model perlu memanggil fungsi luaran atau memulangkan maklumat dalam format yang boleh dibaca mesin secara boleh diramal.
Ini amat berguna untuk sistem agen yang menghubungkan LLM kepada carian, pangkalan data, API, alat perniagaan, atau fungsi aplikasi lain.
5. Keupayaan Agen Multimodal
MiMo-V2.6-Flash menggabungkan pemahaman multimodal dengan penaakulan berorientasikan agen. Daripada menganggap pemprosesan imej, video, audio, dan teks sebagai tugasan model yang berasingan, ia menyediakan antara muka model yang disatukan untuk input ini.
Seni bina ini berguna untuk aliran kerja seperti menyemak dokumen teknikal bersama diagram, menganalisis mesyuarat yang dirakam, memeriksa bukti video, atau menggabungkan tangkapan layar dengan arahan bertulis.
6. Reka Bentuk MiMo-V2.6 Berorientasikan Kecekapan
Varian Flash diposisikan oleh Xiaomi sebagai ahli keluarga MiMo-V2.6 yang seimbang dari segi kecekapan. Reka bentuk MoE jarang mengaktifkan subset parameter bagi setiap token dan bukannya menggunakan keseluruhan kumpulan parameter pada setiap token.
Model ini juga menggunakan penyahkod spekulatif lima lapisan yang meramal berbilang token berikutnya untuk pengesahan selari, satu pendekatan seni bina yang bertujuan mempertingkat kecekapan inferens.
Prestasi Penanda Aras
Jadual penilaian yang diterbitkan Xiaomi melaporkan keputusan MiMo-V2.6-Flash merentas penanda aras pengkodan, agen umum, keselamatan siber, dan agen visual. Ini adalah keputusan penanda aras yang diterbitkan oleh penyedia, jadi ia tidak harus dianggap sebagai pemeringkatan pihak ketiga yang bebas.
| Penanda Aras | MiMo-V2.6-Flash |
|---|---|
| DeepSWE v1.1 | 67.9 |
| ProgramBench | 26.0 |
| MiMo Code Bench | 61.2 |
| AutomationBench v1.0.6 | 52.3 |
| Toolathlon-Verified | 73.6 |
| Agents' Last Exam | 27.6 |
| Terminal Bench 4.0 | 28.8 |
| Terminal Bench 2.1 | 87.6 |
| OSWorld-Verified | 80.8 |
| JobBench | 61.2 |
| CyberGym | 95.1 |
| MiMo Cyber Bench | 77.2 |
| ExploitGym | 6.0 |
| ExploitBench | 25.3 |
| SEC Bench Pro | 47.5 |
| MiMo VisualCoding | 71.5 |
Sebagai contoh, Xiaomi melaporkan 87.6 pada Terminal Bench 2.1, 80.8 pada OSWorld-Verified, 73.6 pada Toolathlon-Verified, dan 95.1 pada CyberGym.
Profil penanda aras menunjukkan bahawa model ini direka khusus untuk aliran kerja berasaskan agen, pengkodan, penggunaan alat, dan multimodal berbanding diposisikan semata-mata sebagai model perbualan konvensional.
MiMo-V2.6-Flash vs MiMo-V2.6-Pro
MiMo-V2.6-Flash dan MiMo-V2.6-Pro tergolong dalam keluarga model yang sama dan berkongsi reka bentuk multimodal asli serta konteks 1M, tetapi menyasarkan titik berbeza dalam spektrum kecekapan model.
| Ciri | MiMo-V2.6-Flash | MiMo-V2.6-Pro |
|---|---|---|
| Keluarga | MiMo-V2.6 | MiMo-V2.6 |
| Seni bina | Sparse MoE | Sparse MoE |
| Jumlah Parameter | 309B | 1.02T |
| Parameter Diaktifkan | 15B | 42B |
| Konteks | 1M tokens | 1M tokens |
| Input | Teks, imej, video, audio | Teks, imej, video, audio |
| Kedudukan Utama | Seimbang kecekapan | Flagship |
| Aliran Kerja Agen | Disokong | Disokong |
| Panggilan Alat | Disokong | Disokong |
Seni bina yang diterbitkan menunjukkan model Pro pada 1.02T jumlah / 42B parameter diaktifkan, berbanding Flash pada 309B jumlah / 15B parameter diaktifkan.
MiMo-V2.6-Flash vs Model Lain
MiMo-V2.6-Flash menduduki kedudukan yang tersendiri dalam kalangan model penaakulan multimodal moden kerana ia menggabungkan empat ciri dalam satu model: konteks panjang, input multimodal asli, penaakulan, dan penggunaan alat berorientasikan agen.
Berbanding model penaakulan berasaskan teks sahaja, MiMo-V2.6-Flash boleh menggabungkan imej, video, dan audio secara langsung. Berbanding model multimodal yang lebih kecil, konteks 1M token menjadikannya lebih sesuai untuk repositori besar dan trajektori agen yang dilanjutkan. Berbanding MiMo-V2.6-Pro yang lebih besar, Flash menekankan seni bina yang lebih berorientasikan kecekapan.
Contoh Kes Penggunaan
Pengkodan dan Kejuruteraan Perisian
MiMo-V2.6-Flash boleh digunakan untuk penjanaan kod, penyahpepijatan, analisis repositori, perancangan perisian, dan aliran kerja pembangunan berasaskan agen.
Keputusan yang diterbitkan termasuk penilaian DeepSWE v1.1, ProgramBench, MiMo Code Bench, dan Terminal Bench.
Analisis Dokumen Konteks Panjang
Tetingkap konteks 1M token menjadikan model ini sesuai untuk menganalisis koleksi dokumen besar, spesifikasi teknikal, bahan penyelidikan, atau sejarah projek yang panjang tanpa perlu mengurangkan konteks secara agresif.
Penyelidikan Multimodal
Memandangkan model ini menerima teks, imej, video, dan audio, ia boleh menggabungkan maklumat daripada sumber media berbeza dalam satu aliran kerja penaakulan.
Automasi Agen dan Alat
Panggilan alat, output berstruktur, penaakulan, dan konteks panjang menjadikan model ini sesuai untuk agen yang perlu merancang tugasan, memanggil alat luaran, menyemak hasil, dan meneruskan penaakulan melalui berbilang langkah.
Aliran Kerja Penggunaan Komputer
Keputusan OSWorld-Verified 80.8 yang diterbitkan dan penanda aras agen lain menunjukkan bahawa Xiaomi menilai model ini pada tugasan agen interaktif selain penanda aras model bahasa tradisional.
Aliran Kerja Perniagaan Multimodal
MiMo-V2.6-Flash boleh menyokong aliran kerja yang melibatkan laporan, tangkapan layar, rakaman, pembentangan, dokumen, dan maklumat perniagaan media campuran lain di mana satu model perlu menyintesis pelbagai jenis input.
Batasan
MiMo-V2.6-Flash ialah model yang baru dilancarkan, jadi liputan penanda aras dan penilaian pihak ketiga yang bebas masih berkembang. Jadual penanda aras yang diterbitkan oleh Xiaomi menyediakan bukti substantif merentas tugasan agen dan multimodal, tetapi keputusan ini dilaporkan oleh penyedia dan bukan pengganti untuk ujian khusus aplikasi.
Model ini juga mempunyai seni bina asas yang besar walaupun dengan pengaktifan jarang. Organisasi yang mempertimbangkan hos kendiri oleh itu harus menilai perkakasan, keserasian enjin inferens, kuantisasi, throughput, dan keperluan operasi dan tidak menganggap bahawa angka 15B parameter diaktifkan mewakili jejak penggunaan keseluruhan. Kad model rasmi menyediakan panduan penggelengan untuk SGLang dan vLLM.
Cara Mengakses API MiMo-V2.6-Flash melalui CometAPI
Langkah 1: Daftar CometAPI dan Dapatkan Kunci API CometAPI Anda
Cipta atau akses akaun CometAPI anda dan buka kawasan pengurusan API. Jana kunci API daripada akaun CometAPI anda dan simpan untuk konfigurasi aplikasi anda.
Langkah 2: Pilih MiMo-V2.6-Flash dan Konfigurasikan Aplikasi Anda
Cari MiMo-V2.6-Flash dalam katalog model yang tersedia dan sahkan ID model sebagai mimo-v2.6-flash. Tetapkan MiMo-V2.6-Flash sebagai model sasaran dalam integrasi CometAPI anda. Konfigurasikan permintaan mengikut input multimodal dan keupayaan agen yang diperlukan oleh aplikasi anda.
Langkah 3: Hantar Permintaan
Hantar teks atau input multimodal yang disokong melalui integrasi CometAPI dan gunakan respons model yang dikembalikan dalam aliran kerja aplikasi anda.
Langkah 4: Proses Respons
Kendalikan teks yang dijana, output berstruktur, hasil penaakulan, atau maklumat panggilan alat mengikut aliran kerja aplikasi anda.