Spesifikasi Teknikal MiniMax M3
| Perkara | MiniMax M3 |
|---|---|
| Keluarga model | model asas frontier MiniMax M3 |
| Penyedia | MiniMax |
| Seni bina | MiniMax Sparse Attention (MSA) |
| Jenis input | Teks, Imej, Video |
| Jenis output | Teks |
| Tetingkap konteks | Sehingga 1,000,000 token (minimum dijamin 512K) |
| Kekuatan utama | Pengaturcaraan, aliran kerja berasaskan ejen, penaakulan multimodal, pemprosesan konteks panjang |
| Mod penaakulan | Mod pemikiran boleh diaktifkan/dinyahaktifkan |
| Penggunaan alat | Aliran kerja ejen, pemanggilan alat, pelaksanaan tugas terminal |
| Penyebaran | API, MiniMax Code, Token Plan, keluaran open-weight akan datang |
| Sokongan multimodal | Pralatihan multimodal asli dari langkah sifar |
| Tarikh keluaran | Jun 2026 |
Apakah MiniMax M3?
MiniMax M3 ialah model AI berskala frontier yang direka sekitar tiga keupayaan yang secara sejarahnya terhad kepada sistem sumber tertutup: prestasi pengaturcaraan lanjutan, pemprosesan konteks sejuta token, dan kefahaman multimodal asli. Tidak seperti model yang menambah visi sebagai sambungan kemudian, M3 dilatih sebagai model multimodal sejak awal, membolehkan penjajaran yang lebih mendalam antara penaakulan visual dan tekstual.
Model ini dibina atas MiniMax Sparse Attention (MSA), seni bina perhatian jarang yang direka untuk menjadikan konteks sejuta token praktikal dari segi pengiraan sambil mengekalkan prestasi pada tugasan pengaturcaraan, penaakulan, dan berasaskan ejen.
Ciri Utama MiniMax M3
- Tetingkap konteks 1M token: Menyokong repositori yang sangat besar, korpus penyelidikan yang panjang, analisis berbilang dokumen, dan sesi ejen jangka panjang.
- Seni bina berorientasikan ejen: Direka untuk penguraian tugasan autonomi, panggilan alat, perancangan beriterasi, dan pelaksanaan berbilang langkah.
- Multimodaliti asli: Memproses teks, imej, diagram, tangkapan skrin, dan input video tanpa bergantung pada timbunan visi berasingan.
- Keupayaan pengaturcaraan lanjutan: Prestasi kukuh pada penanda aras kejuruteraan perisian termasuk SWE-Bench Pro, Terminal-Bench, dan KernelBench.
- Pelaksanaan jangka panjang: Menunjukkan aliran kerja autonomi berjam-jam termasuk penggandaan penyelidikan dan projek pengoptimuman CUDA.
- Penaakulan boleh dikonfigurasi: Mod pemikiran boleh diaktifkan untuk beban kerja penaakulan yang lebih mendalam atau dinyahaktifkan untuk interaksi berlatensi lebih rendah.
Prestasi Penanda Aras MiniMax M3
MiniMax melaporkan keputusan peringkat frontier merentasi pengekodan, pelaksanaan berasaskan ejen, dan tugas penilaian multimodal. Keputusan yang dilaporkan termasuk:
| Penanda aras | Skor |
|---|---|
| SWE-Bench Pro | 59.0% |
| Terminal-Bench 2.1 | 66.0% |
| SWE-fficiency | 34.8% |
| KernelBench Hard | 28.8% |
| MCP Atlas | 74.2% |
| BrowseComp | 83.5 |
| PostTrainBench | 37.1 |
Syarikat itu turut melaporkan bahawa M3 mengatasi GPT-5.5 dan Gemini 3.1 Pro pada beberapa penanda aras berorientasikan pengaturcaraan sambil menghampiri prestasi Claude Opus 4.7 dalam penilaian terpilih. Dakwaan ini berpunca daripada pendedahan penanda aras dalaman MiniMax dan harus ditafsir bersama ujian pihak ketiga bebas apabila tersedia.
Seni Bina Konteks Panjang dan MSA
MiniMax Sparse Attention (MSA) ialah inovasi seni bina di sebalik keupayaan konteks sejuta token M3. Daripada menggunakan perhatian kuadratik penuh merentasi keseluruhan jujukan, MSA melaksanakan penghalaan pada peringkat blok dan perhatian jarang ke atas kawasan konteks terpilih.
Menurut MiniMax, ini mengurangkan keperluan pengiraan dengan ketara pada panjang konteks besar dan memberikan:
- Lebih 9× prestasi prefill yang lebih pantas pada panjang konteks 1M
- Lebih 15× prestasi penyahkodan yang lebih pantas
- Kira-kira 1/20 daripada pengiraan per token generasi sebelumnya pada skala konteks 1M
Penambahbaikan ini bertujuan menjadikan pengaturcaraan berskala repositori dan aliran kerja ejen jangka panjang praktikal.
MiniMax M3 vs Claude Opus 4.7 vs Gemini 3.1 Pro
| Keupayaan | MiniMax M3 | Claude Opus 4.7 | Gemini 3.1 Pro |
|---|---|---|---|
| Tetingkap Konteks | Sehingga 1M | Aras konteks tersedia secara awam yang lebih kecil | Multimodal konteks besar |
| Latihan Multimodal Asli | Ya | Ya | Ya |
| Fokus Pengaturcaraan Berasaskan Ejen | Sangat kuat | Sangat kuat | Kuat |
| SWE-Bench Pro | 59.0% | Lebih tinggi menurut pelaporan MiniMax | Lebih rendah menurut pelaporan MiniMax |
| Ketersediaan Open-Weight | Dirancang | Tiada | Tiada |
| Aliran Kerja Ejen Jangka Panjang | Fokus reka bentuk utama | Kuat | Kuat |
Had yang Diketahui
- Kebanyakan pendedahan penanda aras pada masa ini datang daripada MiniMax dan bukannya makmal penilaian bebas.
- Fail model open-weight dan laporan teknikal penuh telah diumumkan tetapi belum dikeluarkan secara meluas ketika pelancaran.
- Kebolehpercayaan dunia nyata merentasi persekitaran produksi masih sedang disahkan oleh komuniti pembangun.
- Beban kerja konteks sejuta token mungkin menyebabkan kos operasi dan latensi yang lebih tinggi berbanding beban kerja inferens standard.
Kes Penggunaan Representatif
Kejuruteraan Perisian Berskala Repositori
Menganalisis asas kod besar, melakukan refaktor berbilang fail, menjana tampalan, menyemak permintaan tarik, dan mengekalkan konteks pembangunan jangka panjang.
Agen Penyelidikan Autonomi
Menyokong tinjauan literatur, sintesis dokumen, analisis penanda aras, dan aliran kerja penyelidikan jangka panjang yang memerlukan ratusan ribu token.
Analisis Teknikal Multimodal
Mentafsir tangkapan skrin, diagram seni bina, carta, dokumen teknikal, dan kandungan video dalam aliran penaakulan yang sama.
Automasi Terminal dan DevOps
Melaksanakan aliran kerja kejuruteraan yang kompleks melibatkan pengujian, orkestrasi penyebaran, pengurusan kebergantungan, dan penyahpepijatan beriterasi.
Sistem Pengetahuan Perusahaan
Mencari dan membuat penaakulan ke atas koleksi besar polisi, kontrak, dokumentasi teknikal, dan repositori pengetahuan dalaman.
Versi Model dan Ketersediaan
MiniMax M3 diperkenalkan secara rasmi pada Jun 2026 sebagai penerus utama dalam barisan model MiniMax. Model ini tersedia melalui ekosistem API MiniMax dan CometAPI.