Spesifikasi Teknis MiMo-V2.5
| Spesifikasi | MiMo-V2.5 |
|---|---|
| Model ID | mimo-v2.5 |
| Penyedia | Xiaomi MiMo |
| Jenis model | Model fondasi omni-modal native |
| Arsitektur | Mixture-of-Experts jarang (Sparse) |
| Parameter total | 310B |
| Parameter aktif | 15B |
| Jendela konteks | 1M token |
| Output maksimum | 128K token |
| Modalitas input | Teks, Gambar, Video, Audio |
| Output | Teks |
| Encoder visi | ViT 729M-parameter |
| Encoder audio | Audio Transformer 261M-parameter |
| Pemanggilan Alat, Pencarian Web, Output Terstruktur, Streaming, Cache Konteks | Yes |
| Lisensi | MIT |
Arsitektur 310B/15B sangat penting. MiMo-V2.5 bukan model 15B dalam pengertian konvensional; 15B adalah jumlah parameter yang diaktifkan per token, sementara MoE lengkap berisi 310B parameter. Model ini menggunakan 256 pakar terarahkan dan mengaktifkan delapan pakar per token.
Apa itu MiMo-V2.5?
MiMo-V2.5 adalah model multimodal generasi berikutnya dari Xiaomi yang dibangun khusus untuk persepsi omni-modal dan aplikasi berbasis agen.
Tidak seperti LLM konvensional yang hanya teks, MiMo-V2.5 secara native memahami gambar, video, audio, dan teks. Xiaomi memposisikannya untuk skenario konteks panjang dan agen multimodal di mana model perlu melakukan persepsi informasi, menalar, lalu menggunakan alat atau melakukan tindakan.
Ada pula pertimbangan versi saat ini untuk pengembang: Xiaomi menghentikan model MiMo-V2 lama pada 30 Juni 2026, dan merekomendasikan migrasi ke seri V2.5.
Itu menjadikan mimo-v2.5 sebagai Model ID yang relevan untuk integrasi baru, alih-alih mimo-v2-pro, mimo-v2-omni, atau mimo-v2-flash yang lebih lama.
Apa Fitur Utama MiMo-V2.5?
Pemahaman Omni-Modal Native
Fitur pembeda MiMo-V2.5 adalah multimodalitas yang diintegrasikan langsung ke dalam model.
Model ini menerima:
- Teks
- Gambar
- Video
- Audio
Ini memungkinkan pengembang membuat aplikasi yang menalar lintas berbagai jenis informasi alih-alih memproses setiap modalitas secara terpisah dan meneruskan hasilnya ke LLM teks. Xiaomi menyebut ini sebagai persepsi full-modal native.
Contoh praktisnya adalah agen analisis video yang menerima video panjang beserta trek audio dan pertanyaan tekstual, lalu mengidentifikasi kejadian, menjelaskan apa yang terjadi, dan menghasilkan jawaban terstruktur.
Jendela Konteks 1M Token
MiMo-V2.5 mendukung konteks 1 juta token dan hingga 128K token output.
Ini menjadikan model ini sangat menarik untuk:
- Analisis dokumen besar
- Pemahaman video panjang
- Pengodean tingkat repositori
- Sesi riset panjang
- Agen multi-langkah
- Percakapan berkepanjangan
- Basis pengetahuan perusahaan besar
Kapasitas 1M konteks bukan sekadar angka pemasaran. Xiaomi secara khusus menargetkan pelacakan video panjang, analisis dokumen panjang, dan penalaran temporal yang diperluas sebagai beban kerja sasaran.
Penggunaan Alat Berbasis Agen
MiMo-V2.5 mendukung pemanggilan fungsi, pencarian web, output terstruktur, dan streaming.
Ini membuatnya jauh lebih berguna untuk aplikasi agen ketimbang model yang terbatas pada generasi teks.
Alur kerja tipikal dapat terlihat seperti:
Persepsi → Penalaran → Pencarian → Panggil Alat → Analisis Hasil → Lanjutkan
Ini sangat berguna untuk agen riset, asisten pengodean, agen dukungan pelanggan, dan otomasi multimodal.
Efisiensi MoE Sparse
MiMo-V2.5 menggunakan arsitektur MoE sparse 310B parameter dengan hanya 15B parameter diaktifkan per token.
Backbone-nya berisi 48 lapisan, termasuk 39 lapisan sliding-window attention dan sembilan lapisan attention penuh. Desain hibrida ini dimaksudkan agar konteks sangat panjang lebih terkelola secara komputasi.
Poin penting bagi pengembang adalah bahwa jumlah parameter yang diaktifkan tidak boleh ditafsirkan sebagai kebutuhan memori total. Meng-host sendiri model 310B-parameter tetap merupakan upaya infrastruktur yang besar.
Attention Jendela Geser Hibrida
MiMo-V2.5 menggabungkan sliding-window attention dengan attention global.
Arsitekturnya menggunakan jendela SWA 128 token, dengan 39 lapisan SWA dan sembilan lapisan attention penuh.
Pilihan arsitektural ini sangat relevan dengan kemampuan konteks 1M token model, karena mempertahankan attention penuh di setiap lapisan akan membuat inferensi konteks panjang jauh lebih mahal.
Prediksi Multi-Token
MiMo-V2.5 menyertakan tiga lapisan MTP dengan sekitar 329M parameter. Desain MTP ditujukan untuk meningkatkan efisiensi inferensi melalui speculative decoding dan mendukung pelatihan reinforcement learning yang lebih efisien.
Bagaimana Kinerja MiMo-V2.5 pada Benchmark?
MiMo-V2.5 telah memublikasikan hasil benchmark yang mencakup pengodean, agen terminal, agen riset, dan tugas agen multimodal. Model card di Hugging Face saat ini melaporkan hasil berikut:
| Benchmark | MiMo-V2.5 | Fokus Evaluasi |
|---|---|---|
| SWE-Bench Pro | 56.1 | Rekayasa perangkat lunak |
| Terminal-Bench 2.0 | 65.8 | Tugas terminal/agen |
| Claw-Eval General | 62.1 Pass³% | Kemampuan agen umum |
| Claw-Eval Multimodal | 23.8 Pass³% | Kemampuan agen multimodal |
| Claw-Eval Multi-Turn | 63.2 Pass³% | Agen multi-giliran |
| ResearchClawBench | 16.91 | Tugas agen riset |
Angka-angka ini perlu ditafsirkan dengan hati-hati.
Hasil 56.1 pada SWE-Bench Pro menunjukkan kemampuan rekayasa perangkat lunak yang bermakna, sementara hasil 65.8 pada Terminal-Bench 2.0 sangat relevan untuk agen yang berinteraksi dengan terminal dan lingkungan pengembangan.
Pada saat yang sama, perbedaan antara skor Claw-Eval umum (62.1) dan skor multimodal (23.8) adalah peringatan yang berguna: kinerja agen umum yang kuat tidak otomatis berarti kinerja yang sama kuatnya pada setiap tugas agen multimodal.
Untuk evaluasi produksi, pengembang sebaiknya menguji beban kerja mereka sendiri alih-alih bergantung pada satu angka papan peringkat.
Bagaimana Perbandingannya dengan MiMo-V2.5-Pro?
MiMo-V2.5 dan MiMo-V2.5-Pro termasuk generasi V2.5 yang sama tetapi memiliki target optimasi berbeda.
| Spesifikasi | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| Parameter total | 310B | 1.02T |
| Parameter aktif | 15B | 42B |
| Konteks | 1M | 1M |
| Input multimodal | Teks/Gambar/Video/Audio | Berfokus pada agen |
| Posisi utama | Agen omni-modal | Agen kompleks & pengodean |
| Pakar terarahkan | 256 | 384 |
| Pakar/token | 8 | 8 |
| Lapisan LLM | 48 | 70 |
| Lapisan MTP | 3 | 3 |
Pembedaan ini cukup jelas:
Pilih MiMo-V2.5 untuk pemahaman multimodal native dan agen serbaguna yang efisien. Pilih MiMo-V2.5-Pro untuk beban kerja penalaran, pengodean, dan agen horizon panjang yang paling sulit.
Panduan pemilihan model Xiaomi merekomendasikan mimo-v2.5 khususnya untuk memahami konten gambar, audio, dan video, sementara mimo-v2.5-pro direkomendasikan untuk penalaran kompleks dan pemrosesan dokumen panjang.
Use Case MiMo-V2.5
Agen AI Multimodal
MiMo-V2.5 dapat menjadi model pusat untuk agen yang perlu memeriksa dokumen, gambar, video, dan audio sebelum memutuskan tindakan.
Analisis Dokumen Konteks Panjang
Konteks 1M token membuatnya cocok untuk menganalisis:
- Kumpulan dokumen legal besar
- Dokumentasi teknis
- Arsip riset
- Basis kode besar
- Basis pengetahuan perusahaan
Agen Pengodean
Benchmark agen dan kemampuan penggunaan alat pada model ini membuatnya cocok untuk asisten pengodean yang perlu memeriksa repositori, menalar bug, mengeksekusi alat, dan beriterasi atas solusi.
Pemahaman Video
Alih-alih menjadikan pembuatan video sebagai tujuan utama, MiMo-V2.5 menggunakan video sebagai modalitas input untuk pemahaman.
Aplikasi potensial meliputi:
- Ringkasan video
- Tanya jawab video panjang
- Pencarian video
- Deteksi kejadian
- Analisis video edukasi
- Analisis rekaman keamanan
Asisten Audio-Visual
Karena model menerima informasi audio dan visual, pengembang dapat membangun asisten yang mampu menafsirkan instruksi lisan bersama konteks visual.
Agen Otonom Jangka Panjang
Kombinasi konteks panjang dan pelatihan berbasis agen membuat MiMo-V2.5 cocok untuk alur kerja di mana model harus mempertahankan state melalui banyak langkah antara, bukan menyelesaikan tugas dalam satu respons.
Keterbatasan MiMo-V2.5
Spesifikasi MiMo-V2.5 mengesankan, tetapi beberapa keterbatasan praktis perlu diperhatikan.
Pertama, konteks 1M tidak berarti setiap aplikasi akan mencapai kinerja optimal pada jendela maksimum. Inferensi konteks panjang tetap melibatkan pertimbangan memori, bandwidth, dan latensi yang signifikan.
Kedua, model ini adalah sistem MoE yang sangat besar. Meskipun hanya 15B parameter yang diaktifkan per token, model lengkap berisi sekitar 310B parameter, membuat hosting mandiri jauh lebih menuntut daripada menjalankan model dense kecil.
Ketiga, kinerja benchmark multimodal dapat sangat bervariasi menurut tugas. Hasil Claw-Eval menunjukkan skor multimodal yang jauh lebih rendah daripada skor agen umum, menegaskan perlunya pengujian khusus aplikasi.
Terakhir, ekosistem model ini masih lebih baru dibanding ekosistem matang yang mengelilingi GPT, Claude, dan Gemini. Karena itu, pengembang sebaiknya mengevaluasi tooling, kompatibilitas penyedia, perilaku output terstruktur, dan keandalan pemanggilan alat sebelum menggunakannya di sistem produksi yang sangat kritis.
Cara Menggunakan API MiMo-V2.5 di CometAPI
MiMo-V2.5 sangat cocok untuk platform agregasi API karena mengikuti pola API yang kompatibel dengan ekosistem LLM mapan. Xiaomi sendiri menyediakan akses API yang kompatibel dengan OpenAI dan Anthropic.
Dengan CometAPI, integrasi dapat mengikuti alur kerja dasar yang sama seperti model lain yang didukung.
Langkah 1: Dapatkan Kunci API CometAPI
Buat atau masuk ke akun CometAPI Anda dan dapatkan kunci API Anda.
import os
COMETAPI_KEY = os.environ["COMETAPI_KEY"]
Langkah 2: Konfigurasikan Model MiMo-V2.5
Setel model ke:
mimo-v2.5
dan gunakan endpoint API kompatibel milik CometAPI.
Endpoint dan skema permintaan yang tepat harus diperiksa terhadap dokumentasi model/API CometAPI terbaru sebelum deployment.
Langkah 3: Bangun Alur Kerja Multimodal dan Agen
Penggunaan mimo-v2.5 yang lebih menarik bukanlah obrolan teks biasa. Pengembang dapat menggabungkan penalaran multimodalnya dengan alat eksternal untuk membuat alur kerja seperti:
Masukan pengguna → pemahaman gambar/video/audio → penalaran → pemanggilan alat → analisis hasil → aksi berikutnya
Ini membuat model sangat menarik untuk agen riset otonom, agen pengodean, sistem dukungan pelanggan multimodal, dan asisten perusahaan berkonteks panjang.
Mengapa Menggunakan MiMo-V2.5 Melalui CometAPI?
MiMo-V2.5 sangat berguna dalam lingkungan API multi-model karena pengembang mungkin ingin membandingkannya dengan GPT, Claude, Gemini, DeepSeek, atau model agen lain tanpa membangun tumpukan infrastruktur terpisah untuk setiap penyedia.
CometAPI dapat berguna ketika aplikasi Anda membutuhkan:
- Lapisan API terpadu
- Akses ke banyak keluarga model AI
- Pergantian model yang lebih mudah
- Manajemen kunci API terpusat
- Perbandingan model yang cepat
- Satu lapisan integrasi untuk eksperimen dan produksi
Untuk tim yang mengevaluasi kinerja agen versus biaya inferensi, MiMo-V2.5 layak diuji berdampingan dengan model andalan yang lebih mahal alih-alih mengasumsikan bahwa model proprietary terbesar otomatis akan menjadi pilihan terbaik.