TL;DR
Xiaomi'nin standart V2.5 modeli, yerel metin, görüntü, video ve ses anlama yeteneklerini 1 milyon tokenlık bağlam penceresi, araç kullanımı ve seyrek Uzman Karışımı (MoE) verimliliği ile birleştirir. Multimodal girdi ve tamamlanan görev başına maliyet önemli olduğunda daha uygundur. Pro varyantı daha büyük olup zorlu kodlama ve uzun vadeli ajan çalışmalarında daha güçlüdür; ancak metin girdisine odaklıdır ve Xiaomi’nin yayımladığı oranlarda token başına yaklaşık üç kat daha pahalıdır.
Pratik karar basittir: multimodal ajanlar, belge ve medya analizi ile yüksek hacimli otomasyon için standart modeli seçin; darboğaz zorlayıcı yazılım mühendisliği veya sürdürülen otonom yürütme olduğunda Pro’yu seçin.
Temel çıkarımlar
- Standart model toplam 310B parametre kullanır ve token başına 15B’yi etkinleştirir.
- Metin, görüntü, video ve ses kabul eder ve metin döndürür.
- API’si 1M bağlam, 128K’ya kadar çıktı, araç çağrıları, web araması, akış, yapılandırılmış çıktı ve bağlam önbellekleme destekler.
- Yayımlayanın bildirdiği sonuçlar arasında Terminal-Bench 2.0’da 65.8 ve SWE-Bench Pro’da 56.1 yer alır.
- Xiaomi’nin mevcut MiMo-V2.5-Pro model kartı 1.02T toplam ve 42B etkin parametre listeler. Yayımlayanın listelediği SWE-Bench Pro puanları MiMo-V2.5 için 56.1 ve Pro için 57.2’dir; bunlar tarihli, yayımlayan tarafından bildirilen karşılaştırmalardır ve belirli bir kodlama iş akışı için garanti değildir.
- Mevcut Xiaomi oranlarında, standart giriş/çıkış maliyetleri milyon token başına $0.14/$0.28; Pro ise $0.435/$0.87’dir.
- CometAPI’de her iki API de resmi önbelleksiz fiyat çiftlerinden %20 daha düşük fiyatlandırılmıştır.
Bilgi kontrol edildi: 28 Eylül 2026. Fiyatlar, kıyaslamalar, limitler, erişilebilirlik ve istek formatları değişebilir. Xiaomi, resmi mimo-v2.5 ve mimo-v2.5-pro API model adlarının 21 Ekim 2026, Pekin saatine göre 10:00’da otomatik yedeksiz olarak kullanımdan kaldırılacağını duyurdu. Dağıtımdan önce geçiş planlayın ve canlı rotayı doğrulayın.
API yaşam döngüsü notu: resmi Xiaomi platformu her iki V2.5 model kimliğini 21 Ekim 2026’da emekliye ayırmayı planlıyor. Bu bildirim Xiaomi’nin API platformunu ilgilendirir; herhangi bir üçüncü taraf geçidi ayrı olarak kontrol edin. Xiaomi model kullanımdan kaldırma bildirimi
Standart Model Nedir
MiMo-V2.5 Xiaomi MiMo’nun multimodal algılama ve ajan çalışmalarında verimliliğe odaklı temel modelidir. Tek bir mimari içinde yerel metin, görüntü, video ve ses girişi sağlar ve metin çıktısı üretir.
Xiaomi’nin model yayın günlüğü MiMo-V2.5 serisinin herkese açık betasını 23 Nisan 2026 olarak tarihliyor. Ağırlıklar daha sonra MIT lisansı altında yayınlandı. MiMo-V2.5 toplam 310B parametreye sahiptir; ancak her token için yalnızca yaklaşık 15B’yi etkinleştirir; tüm uzman havuzuna sahip olup hepsini aynı anda çalıştırmaz.
MiMo-V2.5-Pro farklı bir iş yükünü hedefler. En zorlu kodlama, terminal ve uzun süreli ajan görevleri için tasarlanmış, trilyon parametreli, metin girdi odaklı bir modeldir. Her iki varyant da 1M maksimum bağlamı paylaşır; ancak modalite, etkin hesaplama ve fiyat açısından keskin biçimde farklılaşır.
MiMo-V2.5 Özellikler ve Yetkinlikler
| Resmi mimari ayrıntıları | Değer | Neden önemli |
|---|---|---|
| Mimari | Seyrek MoE | Seçmeli etkinleştirme ile geniş uzman kapasitesi |
| Toplam / etkin parametreler | 310B / 15B | Etkin hesaplama toplam kapasitenin epey altındadır |
| Transformer katmanları | 48: 1 yoğun + 47 MoE | Katmanların çoğu yönlendirilen uzmanları kullanır |
| Yönlendirilen uzmanlar | 256; token başına 8 etkin | 310B yoğun yürütme olmadan uzmanlaşma |
| Dikkat | 39 SWA + 9 küresel katman | Yerel verimlilik ve uzun menzilli akışın dengesi |
| SWA penceresi | 128 token | Uzun-bağlam önbellek baskısını azaltır |
| Bağlam / maksimum çıktı | 1M / 128K token | Uzun belgeler ve geniş izleri destekler |
| Girdi / çıktı | Metin, görüntü, video, ses / metin | Dört girdi türünde yerel algı |
| Görsel kodlayıcı | 729M ViT; 28 katman | Görüntü ve video anlama |
| Ses kodlayıcı | 261M transformer; 24 katman | Yerel ses anlama |
| Çoklu Token Tahmini | 3 modül; yaklaşık 329M parametre | Spekülatif çözümleme verimliliğini destekler |
| Eğitim ölçeği | Yaklaşık 48T token | Geniş metin ve multimodal eğitim hattı |
| API yetenekleri | Araçlar, web, akış, yapılandırılmış çıktı, önbellekleme | Üretim odaklı ajan ilkelleri |
| Lisans | MIT | Ticari kullanım ve değişikliklere izin verilir |
Çalışma zarfı 1M bağlam ve 128K çıktı ile birlikte dakika başına 100 istek ve dakika başına 10 milyon token yayınlanan limitlerini içerir. Sağlayıcı düzeyi limitler hesap ve entegrasyon yoluna göre farklılık gösterebilir.
Xiaomi MiMo’nun resmi mimari şeması. Resmi mimari varlığı.
MiMo-V2.5 Mimarisi Nasıl Çalışır
Seyrek Uzmanlar: Toplam Kapasite Etkin Hesaplama Değildir
Merkezi verimlilik gerçeği 310B toplam, 15B etkin tasarımdır. Yönlendirici her token için 256 uzmandan sekizini seçer. Bu, modeli geleneksel bir 15B yoğun modele göre çok daha büyük bir parametre havuzuna erişir kılar; ancak her seferinde tüm 310B parametreyi yürütmez.
Bu, kendi kendine barındırmayı önemsiz hale getirmez. Tam ağırlıklar yine depolanmalı ve dağıtılmalıdır; bu nedenle bellek kapasitesi, ara bağlantı bant genişliği, uzman yönlendirme ve sunum yazılımı önemli kısıtlar olmaya devam eder.
Uzun Bağlam için Hibrit Dikkat
Omurga, 5:1 SWA–küresel oranında kaydırmalı pencere ve küresel dikkati ardışık olarak yerleştirir. Otuz dokuz yerel katman önbellek büyümesini kontrol ederken dokuz küresel katman uzun mesafeli bilgi akışını korur. Xiaomi, tümü-küresel bir tasarıma kıyasla KV önbelleğinde neredeyse altı kat azalma bildirmektedir.
1M token maksimumu kapasitedir; garanti edilen doğruluk değildir. Getirme kalitesi, gecikme, araç durumu büyümesi ve uzak kanıtlar üzerindeki dikkat hâlen iş yüküne özgü değerlendirme gerektirir.
Yerel Kodlayıcılar ve Ajan Özellikleri
729M parametreli bir görsel transformer görüntü ve video girişlerini; 261M parametreli bir ses transformerı ses girişlerini işler. Projeksiyonlar her iki akışı da dil omurgasına eşler; böylece tek bir ajan bir ekran görüntüsünü, bir video segmentini, bir ses parçasını, metin talimatlarını ve araç sonuçlarını birleştirebilir.
Üç Çoklu Token Tahmini modülü spekülatif çözümleme ve pekiştirmeli öğrenme verimliliğini destekler. Model yaklaşık 48T token üzerinde eğitilmiş; bağlam, sonradan eğitim sırasında aşamalı olarak 1M’e genişletilmiştir.
Açık ağırlıklar MIT lisansını kullanır. Ticari dağıtım izinlidir; ancak altyapı maliyeti ve üçüncü taraf bağımlılıkları yine ayrı inceleme gerektirir.
MiMo-V2.5 Kıyaslamaları: Kodlama, Ajanlar ve Multimodal Sonuçlar
Kıyaslama notu:
aşağıdaki rakamlar yayımlayan tarafından rapor edilmiştir. Yönlendirici kanıttır; belirli bir depo, medya formatı, araç yığını, gecikme hedefi veya güvenlik politikası için garanti değildir.
Kodlama ve Ajan Sonuçları

Resmi Xiaomi MiMo kodlama ve ajan kıyaslama grafiği.
| Resmi kodlama kıyaslaması | Bildirilen puan | Karar sinyali |
|---|---|---|
| MiMo Coding Bench | 71.8 | Geniş kodlama-ajanı yetkinliği |
| Claw-Eval Text | 62.3 | Genel metin-ajanı tamamlama |
| Terminal-Bench 2.0 | 65.8 | Etkileşimli terminal yürütme |
| SWE-Bench Pro | 56.1 | Gerçek dünya yazılım mühendisliği |
| Claw-Eval Multi-Turn | 63.2 | Daha uzun çok adımlı ajan çalışması |
| ResearchClawBench | 16.91 | Otonom araştırma iş akışları |
Sonuç: en güçlü vaka, izole kod tamamlama yerine pratik araç kullanımıdır. 65.8’lik Terminal-Bench sonucu terminal odaklı ajanları desteklerken, SWE-Bench Pro’da 56.1 depo düzeyi yetenek önerir. Çok daha düşük araştırma puanı, kanıt toplama ve atıf davranışını ayrı test etme hatırlatmasıdır.
Multimodal Sonuçlar

Resmi Xiaomi MiMo görüntü, video ve multimodal-ajan kıyaslama grafiği.
| Resmi multimodal kıyaslama | Bildirilen puan | Test edilen yetenek |
|---|---|---|
| CharXiv RQ | 81.0 | Grafik ve belge akıl yürütme |
| MMMU-Pro | 77.9 | Uzman düzeyinde multimodal akıl yürütme |
| HR-Bench 4K | 88.5 | Yüksek çözünürlüklü görüntü anlama |
| OmniDocBench | 87.2 | Belge anlama |
| Claw-Eval Multimodal | 23.8 | Multimodal ajan tamamlama |
| Video-MME | 87.7 | Video anlama |
| DailyOmni | 83.5 | Gündelik görsel-işitsel akıl yürütme |
| VideoHolmes | 64.0 | Zamansal video akıl yürütme |
Sonuç: belge, yüksek çözünürlüklü görüntü ve video anlama en açık güçlü yönlerdir. 23.8’lik multimodal-ajan puanı algı puanlarından çok daha düşüktür; bu nedenle hem medyayı anlaması hem de araçları güvenilir şekilde çalıştırması gereken bir sistem uçtan uca değerlendirilmelidir.
MiMo-V2.5 ve MiMo-V2.5-Pro: Çok Boyutlu Karşılaştırma
| Resmi mimari karşılaştırma | MiMo-V2.5 | MiMo-V2.5-Pro Resmi Pro özellikleri Resmi Pro kıyaslamaları | Pratik sonuç |
|---|---|---|---|
| Toplam parametre | 310B | 1.02T | Pro, toplam kapasitede 3×’ten fazla |
| Etkinleştirilen parametreler | 15B | 42B | Pro, yaklaşık 2.8× daha fazla etkin parametre kullanır |
| Katmanlar / yönlendirilen uzmanlar | 48 / 256 | 70 / 384 | Pro daha büyük bir sunum hedefidir |
| Model kartı bağlam tavanı | 1M | 1M | Her ikisi de 1M token’a kadar listeler; iş yükünüzde getirme ve gecikmeyi test edin |
| Resmi API maksimum çıktı | 128K | 128K | Mevcut Xiaomi API sayfaları her ikisi için 128K listeler; sağlayıcıya özel limitler farklı olabilir |
| Yerel girdi | Metin, görüntü, video, ses | Metin | MiMo-V2.5 belgelenmiş multimodal seçimdir; Pro uç noktasına medya göndermeden önce doğrulayın |
| SWE-Bench Pro | 56.1 | 57.2 | Pro 1.1 puan önde |
| Terminal-Bench 2.0 | 65.8 | 68.4 | Pro 2.6 puan önde |
| Birincil uygunluk | Verimli multimodal ajanlar | Karmaşık kodlama ve uzun ufuklu ajanlar | İş yüküyle seçin; model düzeyi marjlar genel bir kalite üstünlüğünü kanıtlamaz |
Karşılaştırma sonucu: Pro’nun iki ortak kodlama-ajan testindeki kıyas avantajı mütevazıdır; buna karşılık standart varyant yerel görüntü, video ve ses girdisi ekler ve çok daha az etkin parametre kullanır. Pro, multimodal girdi ve daha düşük birim maliyet yerine, zor görev tamamlama küçük kazanımlarının daha değerli olduğu durumlarda haklıdır.
MiMo-V2.5 ve MiMo-V2.5-Pro Ne Kadar Maliyetli?
| Fiyat temeli: 27 Mayıs 2026 | Resmi standart API | Resmi Pro API | CometAPI’de MiMo-V2.5 API | CometAPI’de MiMo-V2.5-Pro API |
|---|---|---|---|---|
| Girdi, önbellek kaçırma / MTok | $0.14 | $0.435 | $0.112 | $0.348 |
| Çıktı / MTok | $0.28 | $0.87 | $0.224 | $0.696 |
| Girdi, önbellek isabeti / MTok | $0.0028 | $0.0036 | Canlı faturalamayı kontrol edin | Canlı faturalamayı kontrol edin |
| Resmi önbelleksiz oranlara göre indirim | Baz | Baz | %20 | %20 |
Resmi oranlarda, Pro hem önbelleksiz girdi hem de çıktıda standarttan yaklaşık 3.1× daha pahalıdır. Yukarıda gösterilen sağlayıcı fiyatları her önbelleksiz çifti %20 azaltır; ancak varyantlar arasındaki göreli fark esasen değişmeden kalır.
Token başına fiyat toplam maliyet değildir. Araç yeniden denemeleri, bağlam boyutu, çıktı uzunluğu, gecikme, başarısız görev kurtarma ve insan incelemesi tamamlanan görev başına maliyeti belirler. Varsayılan üretim modeli seçmeden önce temsili bir iş yükü örneği çalıştırın.
MiMo-V2.5 Neye En Uygundur?
- Multimodal ajanlar: tek iş akışında ekran görüntüleri, belgeler, video, ses, talimatlar ve araçları birleştirin.
- Uzun belge analizi: depoları, sözleşmeleri, araştırma arşivlerini, günlükleri ve destek geçmişlerini işleyin.
- Medya anlama: videoları özetleyin, olayları çıkarın, grafikleri yorumlayın ve görsel-işitsel soruları yanıtlayın.
- Kodlama ve terminal ajanları: dosyaları inceleyin, komutlar çalıştırın, kodu değiştirin ve test sonuçları üzerinde yineleyin.
- Yüksek hacimli otomasyon: seyrek etkinleştirme ve daha düşük token fiyatlandırmasını tekrarlanan üretim görevlerinde kullanın.
Sınırlamalar ve Riskler
- Token başına yalnızca 15B parametre etkinleşir; ancak kendi kendine barındırma yine 310B ağırlıklı tam sistemi gerektirir.
- Multimodal çıktı metindir; görüntü, konuşma ve video üretimi için diğer modeller gerekir.
- 1M bağlam tavanı tüm pencere boyunca uniform getirme doğruluğunu garanti etmez.
- Yayımlayanın kıyaslamaları özel araçlar, depolar, istemler veya güvenlik kısıtlarına aktarılmayabilir.
- Sağlayıcı modalite sunumu, temel açık ağırlık modelinin tam yeteneğinden farklı olabilir.
Üretim eşiği:
trafiği taahhüt etmeden önce temsili görevlerde doğruluğu, araç çağrısı tamamlama oranını, gecikmeyi, token tüketimini, modalite işlemesini ve geri dönüş davranışını doğrulayın.
API Örneği
Aşağıdaki Python örneği OpenAI uyumlu CometAPI uç noktasını ve standart model kimliğini kullanır. Dağıtımdan önce geçerli uç noktayı ve desteklenen istek şemasını doğrulayın.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
max_retries=0,
)
response = client.chat.completions.create(
model="mimo-v2.5",
max_tokens=256,
messages=[
{
"role": "user",
"content": "Summarize the main findings in this technical report.",
}
],
)
print(response.choices[0].message.content)
Karar Rehberi
| İş yükü sinyali | Başlangıç | Şu durumda geçiş yapın |
|---|---|---|
| Görüntüler, video veya ses birinci sınıf girdilerdir | Standart | Multimodal ön işleme kabul edilebilir olmadıkça geçiş yapmayın |
| Büyük belge veya karışık-medya hacmi | Standart | Akıl yürütme başarısızlıkları maliyete hakimse yalnızca Pro |
| Zorlu depo mühendisliği | Her ikisini de test edin | Tamamlama kazancı 3.1× birim maliyeti dengeliyorsa Pro’yu seçin |
| Uzun otonom terminal yörüngeleri | Pro | Kazançlar ölçülebilir değilse standarta dönün |
| Yüksek hacimli rutin otomasyon | Standart | Yalnızca başarısız veya yüksek değerli görevleri yükseltin |
Önerilen yönlendirme:
multimodal ve yüksek hacimli işler için varsayılan olarak standartı kullanın; ardından yalnızca zor metin-öncelikli kodlama veya uzun ufuklu görevleri Pro’ya yönlendirin. Bu, toplam maliyeti kontrol ederken yeteneği korur.
Sonuç
Standart model yalnızca daha küçük bir Pro değildir. Ayrı bir optimizasyon noktasıdır: yerel multimodal girdi, 1M bağlam, güçlü araç odaklı kıyaslamalar ve çok daha düşük token fiyatında 15B etkin parametre.
Pro, zorlayıcı yazılım mühendisliği ve sürdürülen otonom yürütme için uzman seçenektir. Ek kapasitesi ölçülebilir ancak evrensel olmayan kazanımlar üretir; bu nedenle en güçlü dağıtım deseni, her istek için tek bir varyant seçmek yerine iş yüküne dayalı yönlendirmedir.
SSS
Standart model açık kaynak mı?
Ağırlıkları MIT lisansı altında yayınlanmıştır; lisans koşullarına tabi olarak ticari kullanım, değişiklik, ince ayar ve yeniden dağıtıma izin verir.
Kaç parametre kullanıyor?
Seyrek MoE toplam 310B parametre içerir ve her token için 15B’yi etkinleştirir. Etkin parametreler token başına hesaplamayı tanımlar; tam modelin depolama boyutunu değil.
Görüntü, video ve sesi destekliyor mu?
Evet. Standart varyant metin, görüntü, video ve sesi kabul eder ve metin döndürür. Pro varyantının resmi özellikleri metin girdi listeler.
Maksimum bağlam penceresi nedir?
Her iki model kartı da 1M tokena kadar bağlam penceresi belirtir. Xiaomi’nin mevcut API sayfaları MiMo-V2.5 ve MiMo-V2.5-Pro için maksimum 128K çıktı listeler. Gerçek kullanılabilir limitler uç nokta, sağlayıcı, hesap ve istek formatına göre değişebilir; bu tavanlara güvenmeden önce dağıtılan rotayı doğrulayın.
Mevcut resmi Pro API sayfası 1M bağlamı ve 128K maksimum çıktıyı ayrıca doğrular: MiMo-V2.5-Pro API specifications
Kodlama ajanları için hangi varyant daha iyi?
Pro, ortak kodlama ve terminal kıyaslarında daha yüksek sonuçlar bildirir; ancak marj mütevazıdır. Hedef depoda her ikisini de test edin ve görev tamamlama, gecikme ve toplam maliyete göre seçin.
Multimodal ajanlar için hangi varyant daha iyi?
Standart varyant doğal seçimdir; çünkü yerel olarak görüntü, video ve ses girdisini kabul eder. Pro metin girdi odaklıdır.
Bir üretim ekibi nasıl seçim yapmalı?
Standart ile başlayın, başarısızlıkları ölçün ve yalnızca Pro’nun fayda sağladığı zor metin-öncelikli görevleri yönlendirin. Yalnızca token fiyatını değil, tamamlanan görev başına maliyeti karşılaştırın.
