GPT-6.1 Sol are now live on CometAPI →
ai-model/Riset CometAPI

Apa itu MiMo-V2.5? Spesifikasi, Benchmark, Fitur, Harga, dan Akses API

Jelajahi spesifikasi, arsitektur, tolok ukur resmi, harga, perbandingan dengan MiMo-V2.5-Pro, kasus penggunaan, keterbatasan, dan akses CometAPI untuk Xiaomi MiMo-V2.5.

CometAPI
Deon GoodwinTim riset model AI dan API
Diperbarui Oct 5, 2026 12 menit baca
Apa itu MiMo-V2.5? Spesifikasi, Benchmark, Fitur, Harga, dan Akses API
Gunakan pola ini

Lakukan API call pertama.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Model V2.5 standar Xiaomi menggabungkan pemahaman native atas teks, gambar, video, dan audio dengan jendela konteks 1 juta token, penggunaan alat, serta efisiensi Mixture-of-Experts jarang (sparse). Ini lebih tepat saat input multimodal dan biaya per tugas selesai menjadi pertimbangan. Varian Pro lebih besar dan lebih kuat untuk pengodean berat dan kerja agen berjangka panjang, tetapi berfokus pada input teks dan biayanya sekitar tiga kali lipat per token menurut tarif yang dipublikasikan Xiaomi.

Keputusan praktisnya sederhana: pilih model standar untuk agen multimodal, analisis dokumen dan media, serta otomatisasi volume tinggi; pilih Pro ketika hambatannya adalah rekayasa perangkat lunak yang sulit atau eksekusi otonom yang berkelanjutan.

Key Takeaways

  • Model standar menggunakan 310B parameter total dan mengaktifkan 15B per token.
  • Menerima teks, gambar, video, dan audio, lalu mengembalikan teks.
  • API-nya mendukung konteks 1M, output hingga 128K, pemanggilan alat, penelusuran web, streaming, output terstruktur, dan caching konteks.
  • Hasil yang dilaporkan penerbit mencakup 65,8 pada Terminal-Bench 2.0 dan 56,1 pada SWE-Bench Pro.
  • Kartu model MiMo-V2.5-Pro saat ini dari Xiaomi mencantumkan 1,02T total dan 42B parameter aktif. Skor SWE-Bench Pro yang dicantumkan penerbit adalah 56,1 untuk MiMo-V2.5 dan 57,2 untuk Pro; ini adalah perbandingan dari penerbit yang sudah bertanggal, bukan jaminan untuk alur kerja pengodean tertentu.
  • Pada tarif Xiaomi saat ini, biaya input/output standar adalah $0,14/$0,28 per juta token; Pro $0,435/$0,87.
  • Kedua API di CometAPI diberi harga 20% di bawah pasangan harga resmi tanpa cache.
    Informasi diperiksa: 28 September 2026. Harga, tolok ukur, batas, ketersediaan, dan format permintaan dapat berubah. Xiaomi telah mengumumkan bahwa nama model API resmi mimo-v2.5 dan mimo-v2.5-pro akan dihentikan pada pukul 10:00 waktu Beijing pada 21 Oktober 2026, tanpa penggantian otomatis. Rencanakan migrasi dan konfirmasi rute aktif sebelum penerapan.

Catatan siklus hidup API: platform resmi Xiaomi berencana memensiunkan kedua ID model V2.5 pada 21 Oktober 2026. Pemberitahuan ini menyangkut platform API Xiaomi; periksa setiap gateway pihak ketiga secara terpisah. Pemberitahuan penghentian model Xiaomi

What the Standard Model Is

MiMo-V2.5 adalah model dasar berorientasi efisiensi dari Xiaomi MiMo untuk persepsi multimodal dan kerja agen. Model ini menyediakan input native teks, gambar, video, dan audio dalam satu arsitektur dan menghasilkan output teks.

Log rilis model Xiaomi bertanggalkan beta publik seri MiMo-V2.5 pada 23 April 2026. Bobotnya kemudian dirilis di bawah lisensi MIT. MiMo-V2.5 memiliki 310B parameter total, tetapi hanya mengaktifkan sekitar 15B untuk setiap token; ia menggunakan kumpulan besar spesialis tanpa menjalankan semuanya sekaligus.

MiMo-V2.5-Pro menargetkan beban kerja berbeda. Ini adalah model berparameter triliun, ber-input teks, yang dirancang untuk tugas pengodean tersulit, terminal, dan kerja agen jangka panjang. Kedua varian berbagi konteks maksimum 1M tetapi berbeda tajam dalam modalitas, komputasi aktif, dan harga.

MiMo-V2.5 Specifications and Features

Detail arsitektur resmiNilaiAlasan penting
ArchitectureSparse MoEKapasitas ahli besar dengan aktivasi selektif
Total / active parameters310B / 15BKomputasi aktif jauh di bawah kapasitas total
Transformer layers48: 1 dense + 47 MoESebagian besar layer menggunakan ahli terarah
Routed experts256; 8 aktif per tokenSpesialisasi tanpa eksekusi dense 310B
Attention39 SWA + 9 layer globalMenyeimbangkan efisiensi lokal dan aliran jauh
SWA window128 tokenMengurangi tekanan cache konteks panjang
Context / maximum output1M / 128K tokenMendukung dokumen panjang dan jejak panjang
Input / outputTeks, gambar, video, audio / teksPersepsi native di empat tipe input
Vision encoder729M ViT; 28 layerPemahaman gambar dan video
Audio encoder261M transformer; 24 layerPemahaman audio native
Multi-Token Prediction3 modul; sekitar 329M parameterMendukung efisiensi decoding spekulatif
Training scaleSekitar 48T tokenJalur pelatihan teks dan multimodal luas
API capabilitiesTools, web, streaming, output terstruktur, cachingPrimitif agen berorientasi produksi
LicenseMITPenggunaan komersial dan modifikasi diizinkan

Batas operasi mencakup konteks 1M dan output 128K, plus batas yang dipublikasikan 100 permintaan per menit dan 10 juta token per menit. Batas di tingkat penyedia dapat berbeda menurut akun dan rute integrasi.

Apa itu MiMo-V2.5? Spesifikasi, Benchmark, Fitur, Harga, dan Akses API

Diagram arsitektur resmi Xiaomi MiMo. Aset arsitektur resmi.

How MiMo-V2.5 Architecture Works

Sparse Experts: Total Capacity Is Not Active Compute

Fakta efisiensi utama adalah desain 310B-total, 15B-aktif. Router memilih delapan dari 256 ahli untuk setiap token. Itu memberi model akses ke kumpulan parameter yang jauh lebih besar dibanding model dense 15B konvensional tanpa mengeksekusi semua 310B parameter setiap saat.

Ini tidak membuat self-hosting menjadi sepele. Bobot lengkap tetap harus disimpan dan didistribusikan, sehingga kapasitas memori, bandwidth interkoneksi, perutean ahli, dan perangkat lunak penyajian tetap menjadi batasan yang material.

Hybrid Attention for Long Context

Kerangka belakang menginterleavkan sliding-window dan global attention pada rasio SWA-ke-global 5:1. Tiga puluh sembilan layer lokal mengendalikan pertumbuhan cache, sementara sembilan layer global mempertahankan aliran informasi jarak jauh. Xiaomi melaporkan pengurangan KV-cache hampir enam kali dibandingkan desain yang sepenuhnya global.

Batas maksimum 1M token adalah kapasitas, bukan jaminan akurasi. Kualitas retrieval, latensi, pertumbuhan state alat, dan perhatian terhadap bukti jauh tetap memerlukan evaluasi spesifik beban kerja.

Native Encoders and Agent Features

Sebuah vision transformer 729M-parameter menangani input gambar dan video; sebuah audio transformer 261M-parameter menangani audio. Projector memetakan kedua aliran ke kerangka bahasa, memungkinkan satu agen menggabungkan tangkapan layar, segmen video, trek audio, instruksi teks, dan hasil alat.

Tiga modul Multi-Token Prediction mendukung decoding spekulatif dan efisiensi reinforcement learning. Model dilatih pada sekitar 48T token, dengan konteks yang diperluas secara progresif hingga 1M selama pascapelatihan.

Bobot terbuka menggunakan lisensi MIT. Penerapan komersial diizinkan, tetapi biaya infrastruktur dan ketergantungan pihak ketiga tetap memerlukan peninjauan terpisah.

MiMo-V2.5 Benchmarks: Coding, Agents, and Multimodal Results

Catatan tolok ukur:

angka di bawah ini dilaporkan oleh penerbit. Itu adalah bukti arah, bukan jaminan untuk repositori, format media, tumpukan alat, target latensi, atau kebijakan keselamatan tertentu.

Coding and Agent Results

Apa itu MiMo-V2.5? Spesifikasi, Benchmark, Fitur, Harga, dan Akses API

Bagan tolok ukur pengodean dan agen resmi Xiaomi MiMo.

Tolok ukur pengodean resmiSkor yang dilaporkanSinyal keputusan
MiMo Coding Bench71,8Kapabilitas agen pengodean luas
Claw-Eval Text62,3Penyelesaian agen teks umum
Terminal-Bench 2.065,8Eksekusi terminal interaktif
SWE-Bench Pro56,1Rekayasa perangkat lunak dunia nyata
Claw-Eval Multi-Turn63,2Kerja agen multi-langkah lebih lama
ResearchClawBench16,91Alur kerja riset otonom

Hasil: kasus terkuat adalah penggunaan alat praktis alih-alih pelengkapan kode terisolasi. Hasil 65,8 pada Terminal-Bench mendukung agen berorientasi terminal, sementara 56,1 pada SWE-Bench Pro menunjukkan kemampuan tingkat repositori yang berguna. Skor riset yang jauh lebih rendah mengingatkan untuk menguji perilaku pengumpulan bukti dan sitasi secara terpisah.

Multimodal Results

Apa itu MiMo-V2.5? Spesifikasi, Benchmark, Fitur, Harga, dan Akses API

Bagan tolok ukur gambar, video, dan agen multimodal resmi Xiaomi MiMo.

Tolok ukur multimodal resmiSkor yang dilaporkanKapabilitas yang diuji
CharXiv RQ81,0Penalaran grafik dan dokumen
MMMU-Pro77,9Penalaran multimodal tingkat ahli
HR-Bench 4K88,5Pemahaman gambar beresolusi tinggi
OmniDocBench87,2Pemahaman dokumen
Claw-Eval Multimodal23,8Penyelesaian agen multimodal
Video-MME87,7Pemahaman video
DailyOmni83,5Penalaran audiovisual sehari-hari
VideoHolmes64,0Penalaran temporal video

Hasil: dokumen, gambar beresolusi tinggi, dan pemahaman video adalah kekuatan paling jelas. Skor agen multimodal 23,8 jauh lebih rendah daripada skor persepsi, jadi sistem yang harus memahami media dan secara andal mengoperasikan alat perlu dievaluasi dari ujung ke ujung.

MiMo-V2.5 vs MiMo-V2.5-Pro: Multi-Dimensional Comparison

Perbandingan arsitektur resmiMiMo-V2.5MiMo-V2.5-Pro
Spesifikasi Pro resmi
Tolok ukur Pro resmi
Implikasi praktis
Total parameters310B1,02TPro memiliki lebih dari 3× kapasitas total
Activated parameters15B42BPro menggunakan sekitar 2,8× parameter aktif
Layers / routed experts48 / 25670 / 384Pro adalah target penyajian yang lebih besar
Model-card context ceiling1M1MKeduanya mencantumkan hingga 1M token; uji retrieval dan latensi pada ukuran beban kerja Anda
Official API maximum output128K128KHalaman model API Xiaomi saat ini mencantumkan 128K; batas spesifik penyedia dapat berbeda
Native inputTeks, gambar, video, audioTeksMiMo-V2.5 adalah pilihan multimodal yang terdokumentasi; verifikasi endpoint Pro sebelum kirim media
SWE-Bench Pro56,157,2Pro unggul 1,1 poin
Terminal-Bench 2.065,868,4Pro unggul 2,6 poin
Primary fitAgen multimodal efisienPengodean kompleks dan agen berjangka panjangPilih berdasarkan beban kerja yang diuji; margin level model tidak membuktikan keunggulan umum

Hasil perbandingan: keunggulan tolok ukur Pro tergolong moderat pada dua uji agen pengodean bersama, sementara varian standar menambahkan input gambar, video, dan audio native serta menggunakan jauh lebih sedikit parameter aktif. Pro dibenarkan ketika kenaikan kecil dalam penyelesaian tugas sulit lebih berharga daripada input multimodal dan biaya unit yang lebih rendah.

How Much Do MiMo-V2.5 and MiMo-V2.5-Pro Cost?

Basis harga: 27 Mei 2026API standar resmiAPI Pro resmiAPI MiMo-V2.5 di CometAPIAPI MiMo-V2.5-Pro di CometAPI
Input, cache miss / MTok$0,14$0,435$0,112$0,348
Output / MTok$0,28$0,87$0,224$0,696
Input, cache hit / MTok$0,0028$0,0036Periksa penagihan livePeriksa penagihan live
Diskon vs tarif resmi tanpa cacheBaselineBaseline20%20%

Pada tarif resmi, Pro berbiaya sekitar 3,1× dibanding standar untuk input dan output tanpa cache. Harga penyedia yang ditunjukkan di atas mengurangi masing-masing pasangan tanpa cache sebesar 20%, tetapi kesenjangan relatif antara varian tetap pada dasarnya tidak berubah.

Harga per token bukanlah biaya total. Ulang-alat, ukuran konteks, panjang output, latensi, pemulihan tugas gagal, dan tinjauan manusia menentukan biaya per tugas selesai. Jalankan sampel beban kerja representatif sebelum memilih model produksi default.

What Is MiMo-V2.5 Best For?

  • Agen multimodal: gabungkan tangkapan layar, dokumen, video, audio, instruksi, dan alat dalam satu alur kerja.
  • Analisis dokumen panjang: proses repositori, kontrak, arsip riset, log, dan riwayat dukungan.
  • Pemahaman media: rangkum video, ekstrak peristiwa, tafsirkan grafik, dan jawab pertanyaan audiovisual.
  • Agen pengodean dan terminal: inspeksi file, jalankan perintah, ubah kode, dan iterasi pada hasil uji.
  • Otomatisasi volume tinggi: gunakan aktivasi jarang dan harga token lebih rendah untuk tugas produksi berulang.

Limitations and Risks

  • Hanya 15B parameter aktif per token, tetapi self-hosting tetap memerlukan sistem bobot 310B penuh.
  • Output multimodal adalah teks; generasi gambar, ucapan, dan video memerlukan model lain.
  • Batas konteks 1M tidak menjamin akurasi retrieval seragam di seluruh jendela.
  • Tolok ukur penerbit mungkin tidak berpindah ke alat, repositori, prompt, atau batasan keselamatan khusus Anda.
  • Paparan modalitas oleh penyedia dapat berbeda dari kapabilitas penuh model bobot terbuka yang mendasarinya.

Gerbang produksi:

validasi akurasi, penyelesaian pemanggilan alat, latensi, konsumsi token, penanganan modalitas, dan perilaku fallback pada tugas representatif sebelum mengkomitkan trafik.

API Example

Contoh Python berikut menggunakan endpoint CometAPI yang kompatibel dengan OpenAI dan ID model standar. Konfirmasikan endpoint saat ini dan skema permintaan yang didukung sebelum penerapan.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
    max_retries=0,
)

response = client.chat.completions.create(
    model="mimo-v2.5",
    max_tokens=256,
    messages=[
        {
            "role": "user",
            "content": "Summarize the main findings in this technical report.",
        }
    ],
)

print(response.choices[0].message.content)

Decision Guide

Sinyal beban kerjaMulai denganBeralih ketika
Gambar, video, atau audio adalah input utamaStandarJangan beralih kecuali prapemrosesan multimodal dapat diterima
Volume dokumen besar atau media campuranStandarPro hanya jika kegagalan penalaran mendominasi biaya
Rekayasa repositori sulitUji keduanyaPilih Pro jika kenaikan penyelesaian menutup biaya unit 3,1×
Trajektori terminal otonom panjangProKembali ke standar jika kenaikan tidak terukur
Otomatisasi rutin volume tinggiStandarEskalasi hanya tugas gagal atau bernilai tinggi

Rekomendasi perutean:
gunakan standar sebagai default untuk pekerjaan multimodal dan volume tinggi, lalu rute hanya tugas pengodean berfokus teks atau berjangka panjang yang sulit ke Pro. Ini mempertahankan kapabilitas sekaligus mengendalikan biaya total.

Conclusion

Model standar bukan sekadar Pro yang lebih kecil. Ini adalah titik optimasi yang berbeda: input multimodal native, konteks 1M, tolok ukur berorientasi alat yang kuat, dan 15B parameter aktif pada harga token yang jauh lebih rendah.

Pro adalah opsi spesialis untuk rekayasa perangkat lunak sulit dan eksekusi otonom berkelanjutan. Kapasitas tambahannya menghasilkan kenaikan terukur namun tidak universal, sehingga pola penerapan terkuat adalah perutean berbasis beban kerja alih-alih memilih satu varian untuk setiap permintaan.

FAQ

Apakah model standar bersifat open source?

Bobotnya dirilis di bawah lisensi MIT, memungkinkan penggunaan komersial, modifikasi, fine-tuning, dan redistribusi sesuai ketentuan lisensi.

Berapa banyak parameter yang digunakannya?

Sparse MoE berisi 310B parameter total dan mengaktifkan 15B untuk setiap token. Parameter aktif menggambarkan komputasi per token, bukan ukuran penyimpanan model lengkap.

Apakah mendukung gambar, video, dan audio?

Ya. Varian standar menerima input teks, gambar, video, dan audio dan mengembalikan teks. Spesifikasi resmi varian Pro mencantumkan input teks.

Berapa jendela konteks maksimum?

Kedua kartu model menyatakan jendela konteks hingga 1M token. Halaman API Xiaomi saat ini mencantumkan output maksimum 128K untuk MiMo-V2.5 dan MiMo-V2.5-Pro. Batas yang dapat digunakan sebenarnya dapat bervariasi menurut endpoint, penyedia, akun, dan format permintaan; verifikasi rute yang diterapkan sebelum bergantung pada batas tersebut.

Halaman API Pro resmi saat ini secara terpisah mengonfirmasi konteks 1M dan output maksimum 128K: Spesifikasi API MiMo-V2.5-Pro

Varian mana yang lebih baik untuk agen pengodean?

Pro melaporkan hasil lebih tinggi pada tolok ukur pengodean dan terminal yang sama, tetapi marginnya moderat. Uji keduanya pada repositori target dan pilih berdasarkan penyelesaian tugas, latensi, dan biaya total.

Varian mana yang lebih baik untuk agen multimodal?

Varian standar adalah pilihan alami karena secara native menerima input gambar, video, dan audio. Pro berfokus pada input teks.

Bagaimana sebaiknya tim produksi memilih?

Mulai dengan standar, ukur kegagalan, dan rute hanya tugas berfokus teks yang sulit yang mendapat manfaat dari Pro. Bandingkan biaya per tugas selesai, bukan hanya harga per token.

Lanjut belajar

Hubungkan artikel ini ke keputusan berikutnya.

Lihat semua topik
Dipublikasikan pada Oct 5, 2026
Terakhir diperbarui Oct 5, 2026
0 tampilan
Ditinjau untuk kejelasan, atribusi sumber, dan terminologi API terkini.

Baca Selengkapnya