GPT-6.1 Sol are now live on CometAPI →
ai-comparisons/Riset CometAPI

MiMo-V2.5 vs MiMo-V2.5-Pro, mana model Xiaomi yang lebih baik?

Perbandingan MiMo V2.5, Xiaomi MiMo, Benchmark MiMo Pro, Harga API MiMo, model AI multimodal, model agen pengodean, model konteks 1M

CometAPI
Deon GoodwinTim riset model AI dan API
Diperbarui Oct 6, 2026 11 menit baca
MiMo-V2.5 vs MiMo-V2.5-Pro, mana model Xiaomi yang lebih baik?
Gunakan pola ini

Lakukan API call pertama.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

MiMo-V2.5 adalah pilihan default yang lebih kuat untuk pekerjaan multimodal, agen rutin, dan produksi yang sensitif biaya. MiMo-V2.5-Pro adalah opsi spesialis untuk penalaran sulit, pengodean skala repositori, dan penggunaan alat yang berjalan lama. Keduanya menyediakan jendela konteks 1M token dan hingga 128K token keluaran, tetapi Pro menggunakan backbone bahasa yang jauh lebih besar dan biayanya sekitar 3,1× untuk token masukan dan keluaran biasa.

MiMo-V2.5 vs. Pro: Keputusan Cepat

Spesifikasi — rilis resmiMiMo-V2.5MiMo-V2.5-ProModel yang direkomendasikanAlasan
Posisi utamaModel omni-modal dan agen efisienAgen unggulan dan pengodean kompleksPilih sesuai beban kerjaMasukan omni-modal menguntungkan V2.5; pekerjaan teks sulit berkelanjutan menguntungkan Pro.
ArsitekturSparse MoESparse MoEPilih sesuai beban kerjaUkuran model saja tidak menetapkan pilihan yang lebih baik untuk setiap tugas.
Total parameter310B1.02TPilih sesuai beban kerjaModel yang lebih besar menargetkan penalaran sulit, tetapi total ukuran bukan hasil tugas.
Parameter yang diaktifkan15B42BPilih sesuai beban kerjaGunakan penyelesaian tugas dan biaya untuk memutuskan.
Lapisan LLM4870Pilih sesuai beban kerjaJumlah lapisan menggambarkan arsitektur, bukan kemenangan universal.
Pakar yang dirutekan256384Pilih sesuai beban kerjaPerbedaannya berarti hanya jika itu meningkatkan beban kerja target.
Pakar yang diaktifkan per token88KeduanyaKeduanya mengaktifkan delapan pakar per token.
Jendela konteks1M tokens1M tokensKeduanyaKeduanya mengiklankan jendela 1M token; uji pengambilan efektif.
Keluaran maksimum128K tokens128K tokensKeduanyaKeduanya mengiklankan hingga 128K token keluaran.
Modalitas masukanTeks, gambar, video, dan audioTeksMiMo-V2.5Menerima masukan gambar, video, dan audio; Pro berfokus pada masukan teks.
Pemanggilan alatYaYaPilih sesuai beban kerjaKeduanya dapat memanggil alat; uji tingkat keberhasilan pada trajektori aktual.
Bobot terbuka dan lisensiYa; MITYa; MITKeduanyaKeduanya menawarkan bobot terbuka di bawah MIT; biaya penyajian berbeda.

Perbedaan Penentu: Multimodal vs Agent-First

V2.5 secara native menerima teks, gambar, video, dan audio. Xiaomi memasangkan backbone bahasa dengan encoder visi 729M-parameter dan encoder audio 261M-parameter, memungkinkan informasi multimodal berpartisipasi langsung dalam alur penalaran yang sama.

  • Analisis tangkapan layar sebelum memanggil alat.
  • Pahami video dan trek audionya secara bersamaan.
  • Ekstrak informasi dari diagram dan gambar dokumen.
  • Operasikan antarmuka visual dan agen pendukung multimodal.
  • Melakukan penalaran atas urutan video yang panjang.

V2.5-Pro mengikuti desain berbeda. Xiaomi saat ini menetapkan teks sebagai modalitas masukan dan menekankan penalaran mendalam, pengembangan kode, serta orkestrasi alat jangka panjang.

Jika alur kerja itu sendiri memuat masukan gambar, video, atau audio, mulailah dengan V2.5. Uji Pro ketika bagian tersulitnya adalah penalaran atas teks, kode sumber, alat, atau trajektori agen yang panjang.

MiMo-V2.5 vs MiMo-V2.5-Pro, mana model Xiaomi yang lebih baik?

Perbandingan benchmark multimodal resmi dari Xiaomi.

Mengapa V2.5-Pro Bisa Lebih Baik pada Tugas Sulit

Skala Model: 310B/15B vs. 1.02T/42B

Kedua model menggunakan backbone Mixture-of-Experts jarang (Sparse MoE), atensi hibrida jendela geser dan global, serta tiga modul Multi-Token Prediction. Kartu model V2.5 dari Xiaomi mendokumentasikan backbone total 310B dengan 15B aktif; kartu model Pro menskalakan ini ke total 1.02T parameter dengan 42B diaktifkan per token.

Arsitektur — kartu model resmiV2.5ProPerbedaan
Total parameter310B1.02TSekitar 3,3×
Parameter aktif15B42B2,8×
Ukuran tersembunyi4,0966,1441,5×
Lapisan LLM4870Tambahan 22
Head atensi641282×
Pakar yang dirutekan2563841,5×
Pakar per token88Sama
Lapisan MTP33Sama

V2.5 menggunakan pola atensi 5:1, sementara Pro beralih ke pola lokal-ke-global 6:1. Xiaomi mengatakan desain ini mengurangi kebutuhan cache KV hampir 6× dan 7× masing-masing dibandingkan atensi penuh di seluruh jaringan.

Total parameter tidak berbanding lurus dengan kualitas jawaban. Backbone Pro yang lebih besar paling berdampak ketika kesulitan penalaran atau panjang trajektori membuat peningkatan reliabilitas kecil per langkah menjadi terakumulasi.

Mengapa Peningkatan Kecil pada Reliabilitas Dapat Berkombinasi

Tugas agen panjang memiliki banyak langkah saling bergantung. Kesalahan pada pemanggilan alat awal dapat memaksa percobaan ulang atau membatalkan pekerjaan selanjutnya, sehingga peningkatan moderat pada reliabilitas per langkah dapat memberi efek lebih besar pada penyelesaian ujung-ke-ujung. Evaluasilah efek itu pada tugas representatif alih-alih mengasumsikan ukuran model menjaminnya.

Di Mana V2.5-Pro Sebenarnya Meningkat?

Perbandingan numerik paling bersih adalah evaluasi base-model Xiaomi, di mana kedua model muncul di bawah pengaturan yang sama. Ini menghindari penggabungan hasil yang dihasilkan oleh harness tidak terkait atau konfigurasi pasca-pelatihan.

Pengetahuan Umum: Kenaikan Kecil hingga Moderat

Dalam perbandingan base-model Xiaomi, Pro naik 1,2 poin pada BBH, 3,1 pada MMLU, dan 2,7 pada MMLU-Pro. Ini terukur tetapi lebih kecil dibanding kenaikan pada tugas penalaran yang lebih sulit.

Matematika dan Sains: Kenaikan Lebih Besar

Pro naik 8,6 poin pada GPQA-Diamond, 16,3 pada GSM8K, dan 18,5 pada MATH dalam evaluasi base-model yang sama. Ini adalah bukti paling jelas untuk memilih Pro ketika penalaran sulit mendorong keberhasilan tugas.

Pengodean: Lebih Baik, tetapi Tidak Selalu Lebih Baik

Kenaikan yang dilaporkan adalah 4,3 poin pada HumanEval+, 3,2 pada MBPP+, 4,1 pada LiveCodeBench v6, dan 4,9 pada SWE-Bench AgentLess. Uji tugas tingkat repositori dan penggunaan alat secara terpisah: skor base-model ini tidak mengukur setiap alur kerja agen produksi.

MiMo-V2.5 vs MiMo-V2.5-Pro, mana model Xiaomi yang lebih baik?

Hasil benchmark: Pro bukan tiga kali lebih baik hanya karena biayanya sekitar tiga kali lebih mahal. Nilainya meningkat secara progresif seiring meningkatnya kesulitan penalaran dan durasi tugas.

Baris-baris ini adalah evaluasi base-model, bukan janji bahwa API produksi akan mereproduksi skor yang sama. Hasil agen bergantung pada alat, prompt, percobaan ulang, lingkungan eksekusi, dan anggaran token.

Pasca-pelatihan dan Agen Cakrawala Panjang

Model produksi menambahkan fine-tuning tersupervisi, pembelajaran penguatan beragen, dan Distilasi On-Policy Multi-Teacher. Xiaomi melaporkan skor pasca-pelatihan sebesar 56,1 pada SWE-bench Pro, 65,8 pada Terminal-Bench 2.0, dan 62,1 Pass³ pada bagian umum Claw-Eval untuk V2.5.

Pro lebih eksplisit dioptimalkan untuk rekayasa perangkat lunak ber-cakrawala panjang. Xiaomi menggambarkan ratusan pemanggilan alat dalam trajektori berkelanjutan dan mempublikasikan hasil 78,9% SWE-bench Verified.

Satu studi kasus resmi menunjukkan Pro menyelesaikan compiler SysY dalam 4,3 jam dengan 672 pemanggilan alat dan semua 233 pengujian lulus. Pelajarannya bukan bahwa setiap permintaan pengodean membutuhkan Pro; melainkan perbedaan reliabilitas kecil dapat menentukan apakah alur kerja dengan ratusan tindakan saling bergantung selesai.

MiMo-V2.5 vs MiMo-V2.5-Pro, mana model Xiaomi yang lebih baik?

Gambar benchmark pengodean dan agen resmi Xiaomi.

Konteks Panjang: Kapasitas Sama, Beban Kerja Berbeda

Kedua model menyediakan jendela konteks 1M token dan hingga 128K token keluaran melalui API Xiaomi saat ini. Ukuran konteks mentah karenanya tidak membedakan keduanya.

V2.5 menarik ketika konteks panjang mencakup materi multimodal seperti video, gambar dokumen, atau jejak agen visual. Pro adalah model untuk diuji ketika konteks itu sendiri menjadi masalah penalaran: repositori besar, kontrak panjang, korpus riset, atau trajektori agen yang berisi banyak tindakan berurutan.

Jendela konteks besar menggambarkan kapasitas, bukan jaminan fidelitas penalaran. Evaluasi pengambilan, retensi instruksi, dan penggunaan bukti pada panjang yang penting bagi aplikasi.

Harga dan Efisiensi Biaya

Harga luar negeri Xiaomi bayar sesuai pemakaian membuat trade-off menjadi jelas.

Harga — daftar harga resmiV2.5ProRasio
Masukan tanpa cache per 1M token$0.14$0.4353.11×
Masukan di-cache per 1M token$0.0028$0.00361.29×
Keluaran per 1M token$0.28$0.873.11×
Jendela konteks1M1MSama
Keluaran maksimum128K128KSama

Permintaan dengan 1M token masukan tanpa cache dan 200K token keluaran diperkirakan menelan biaya $0.196 pada V2.5 dan $0.609 pada Pro sebelum hit cache, biaya pencarian web, atau penagihan spesifik penyedia.

Perbedaan harga cache lebih kecil: Pro sekitar 29% lebih mahal untuk masukan hit cache alih-alih 211% lebih mahal. Agen jangka panjang dengan prompt sistem stabil, definisi alat, atau prefiks repositori karenanya harus mengukur tingkat hit cache aktualnya.

Perkirakan biaya per tugas yang berhasil. Agen Pro yang menyelesaikan alur kerja sulit sekali mungkin berbiaya lebih rendah daripada upaya gagal berulang pada model yang lebih murah.

Model Mana yang Harus Anda Gunakan?

Beban kerja — panduan resmiPilihan yang lebih baikAlasan
Obrolan teks rutinV2.5Biaya lebih rendah; Pro sering tak perlu
Generasi volume tinggiV2.5Harga token standar ~3,1× lebih rendah
Pemahaman gambar, video, atau audioV2.5Masukan multimodal native
Pemanggilan alat rutinV2.5Kapabilitas agen kuat dengan biaya lebih rendah
Matematika dan sains sulitProKenaikan benchmark lebih besar
Pengodean skala repositoriProDirancang untuk rekayasa perangkat lunak kompleks
Ratusan pemanggilan alat bergantungProCocok untuk eksekusi berkelanjutan
Konteks 1M sensitif biayaV2.5Konteks nominal sama dengan biaya jauh lebih rendah

Hasil pilihan: V2.5 adalah default untuk aplikasi multimodal, agen rutin, dan beban kerja sensitif biaya. Pro adalah peningkatan untuk penalaran sulit, rekayasa perangkat lunak kompleks, dan trajektori otonom yang panjang.

Strategi Produksi yang Lebih Baik: Merutekan di Antara Keduanya

Satu pilihan model global sering tidak diperlukan. Rute permintaan multimodal dan rutin ke V2.5, lalu eskalasi hanya penalaran teks yang sulit, pengodean kompleks, atau eksekusi cakrawala panjang ke Pro.

Dimensi evaluasiUkuranMengapa pentingSinyal perutean
PenyelesaianTugas berhasil / percobaanMencerminkan reliabilitas ujung-ke-ujungEskalasi kelas dengan penyelesaian rendah
KualitasSkor manusia atau rubrikMencegah biaya token mendominasiEskalasi tugas berisiko tinggi
Reliabilitas alatGalat dan percobaan ulangGalat kecil berakumulasi dalam agenEskalasi trajektori panjang
LatensiWaktu hingga hasil diterimaMencakup overhead percobaan ulangPertahankan tugas interaktif tetap ringan
BiayaPengeluaran per tugas diterimaMerefleksikan kegagalan dan pengulanganGunakan model termurah yang berhasil

Uji Kedua API di CometAPI

API MiMo-V2.5 di CometAPI dan API MiMo-V2.5-Pro di CometAPI mendukung evaluasi berdampingan melalui satu lapisan agregasi. Kirim prompt, instruksi sistem, alat, dan batas keluaran yang sama ke kedua model, lalu bandingkan keberhasilan tugas dan biaya.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
)

models = ["mimo-v2.5", "mimo-v2.5-pro"]
prompt = """
Review this implementation plan.
Identify hidden technical risks and propose the three highest-priority fixes.
"""

for model in models:
    response = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
        max_tokens=2000,
    )
    print(f"\n--- {model} ---")
    print(response.choices[0].message.content)

Jalankan batch representatif yang memuat permintaan langsung, penalaran sulit, pengeditan kode, tugas konteks panjang, dan pemanggilan alat agen. Catat tingkat penyelesaian, token, latensi, galat alat, percobaan ulang, kualitas jawaban, dan biaya per tugas yang berhasil.

Batasan

Batasan V2.5

Backbone bahasa yang lebih kecil meninggalkan performa saat kesulitan penalaran meningkat. Kesenjangannya moderat pada BBH tetapi menjadi jauh lebih besar pada GPQA-Diamond dan MATH. Jendela konteks 1M token juga tidak boleh disalahartikan sebagai fidelitas penalaran 1M token yang terjamin.

Batasan Pro

Harga masukan dan keluaran biasa Pro sekitar 3,1× dari V2.5, dan masukan teks saja membuatnya tidak cocok sebagai pengganti langsung untuk aplikasi multimodal. Model bobot terbuka 1.02T-parameter juga merupakan proyek self-hosting yang menuntut meskipun 42B parameter diaktifkan per token.

Kesimpulan Akhir

Pilih V2.5 untuk aplikasi multimodal, agen rutin, dan produksi sensitif biaya. Pilih Pro untuk penalaran sulit, rekayasa perangkat lunak kompleks, dan agen otonom yang berjalan lama. Untuk beban kerja campuran, rute sebagian besar trafik ke V2.5 dan eskalasi hanya permintaan yang kesulitannya atau panjang trajektorinya membenarkan biaya tambahan.

FAQ

Apakah Pro selalu lebih baik daripada V2.5?

Tidak. Pro lebih kuat pada penalaran teks sulit dan pengodean, tetapi V2.5 mendukung masukan gambar, video, dan audio serta jauh lebih murah.

Apakah kedua model mendukung jendela konteks 1M token?

Ya. Keduanya mengiklankan 1M token konteks dan hingga 128K token keluaran. Aplikasi tetap harus menguji pengambilan dan penalaran pada panjang operasi sebenarnya.

Agen multimodal harus menggunakan model yang mana?

Mulailah dengan V2.5 karena secara native menerima masukan visual dan audio. Pro saat ini menargetkan alur kerja masukan teks.

Kapan Pro sepadan dengan harganya yang lebih tinggi?

Paling dapat dipertahankan ketika reliabilitas penalaran yang lebih baik memengaruhi penyelesaian matematika sulit, pengodean skala repositori, atau trajektori panjang yang berisi banyak pemanggilan alat saling bergantung.

Haruskah sistem produksi hanya menggunakan satu model?

Tidak harus. Lapisan perutean dapat menjaga pekerjaan rutin dan multimodal pada V2.5 sambil mengeskalasi penalaran teks sulit dan tugas agen ke Pro.

Lanjut belajar

Hubungkan artikel ini ke keputusan berikutnya.

Lihat semua topik
Dipublikasikan pada Oct 6, 2026
Terakhir diperbarui Oct 6, 2026
0 tampilan
Ditinjau untuk kejelasan, atribusi sumber, dan terminologi API terkini.

Baca Selengkapnya