TL;DR
Qwen3.8-Omni-Flash, Alibaba Qwen’in metin, görsel, ses ve video anlayışı için yerel omni-modal modelidir; çıktısı metindir. 18 Eylül 2026’da duyurulan model, 1M belirteçlik bağlam penceresi, yerel ses-video muhakemesi, ayarlanabilir düşünme, fonksiyon çağırma, web araması, uzamsal ses anlayışı ve araç kullanımı özelliklerini bir araya getirir.
En önemli değişim yalnızca daha iyi video anlayışı değildir. Qwen, modeli ajanik yetenekler etrafında inşa edilmiş ilk omni-modal modeli olarak tanımlıyor: model gördüğünü ve duyduğunu anlayabilir, bir sonraki adımı planlayabilir, araçları çağırabilir ve vlog düzenleme, video çeviri, film özet üretimi, toplantı analizi ve multimedya araştırması gibi uzun görevlerde çalışabilir.
Lansmanda, Qwen 29 değerlendirme genelinde ortalama %25’in üzerinde iyileşme bildirdi; bunlar bağımsız doğrulama yerine satıcı tarafından raporlanan lansman sonuçlarıdır.
Öne Çıkanlar
- Yerel omni-modal girdi: Qwen3.8-Omni-Flash metin, görsel, ses ve video kabul eder; şimdilik metin döndürür.
- Ajanik medya iş akışları: Medya anlayışını planlama, fonksiyon çağırma ve web aramasıyla birleştirebilir.
- Uzun bağlam ve ses derinliği: Barındırılan model 1M belirteçlik bağlam penceresi sunar; çok dilli, stereo ve birinci dereceden ambisonik sesi destekler.
- Satıcı-raporlu kıyas artışları: En büyük iyileşmeler multimodal ajanlar, uzun ses anlayışı, konuşmacı ayrımı ve ses temellendirmede görülür.
- Barındırılan erişim: Model barındırılan API’ler üzerinden kullanılabilir; multimodal ajan iş akışları için Qwen-MM-Plugins ayrı olarak açık kaynaklıdır.
Geliştiriciler, CometAPI’de Qwen3.8-Omni-Flash API’sine birleşik bir API iş akışı üzerinden erişebilir.
Qwen3.8-Omni-Flash Nedir?
Qwen3.8-Omni-Flash, Qwen’in yeni nesil yerel omni-modal modelidir. Sesi veya videoyu yalnızca ön işleme çıktıları olarak görmek yerine tek bir iş akışında metin, görsel kareler, konuşma, çevresel ses ve zamansal ilişkiler üzerinde mantık yürütür. Desteklediği girdiler metin, görseller, ses ve videodur; mevcut çıktısı metindir.
Bu çıktı ayrımı önemlidir. Resmi Alibaba Cloud dokümantasyonu, Qwen3.8-Omni-Flash’ı multimodal anlama ve ajan yürütmesi için konumlandırırken, ses çıktısı gerektiren kullanımlar, açıkça ses üretimi destekleyen Omni varyantlarına daha uygundur.
Lansman çerçevesi “medyayı algıla”dan “anla, planla, uygula ve teslim et”e kayıyor. Bu da modeli, video düzenleme, multimedya araştırması, toplantı analizi, öğretici video işleme ve modelin medyayla bir şeyler yapması gereken diğer iş akışları için ilgili kılıyor.
Qwen3.8-Omni-Flash özellikleri
Aşağıdaki özellik tablosu resmi Alibaba Cloud ve QwenCloud model sayfalarına dayanmaktadır; limitler ve fiyatlar bölgeye göre değişebilir, yayımlama veya dağıtımdan önce yeniden kontrol edilmelidir.
| Özellik | Qwen3.8-Omni-Flash — resmi model sayfası |
|---|---|
| Geliştirici | Alibaba Qwen |
| Yayın | 18 Eylül 2026 |
| Model türü | Yerel omni-modal model |
| Girdi / çıktı | Metin, görsel, ses, video / metin |
| Bağlam penceresi | 1,000,000 belirteç |
| Azami girdi | normalde 991,808 belirteç; düşünme modunda 983,616 belirteç |
| Azami çıktı | 131,072 belirteç |
| Azami muhakeme hakkı | QwenCloud’da 262K belirtece kadar |
| Düşünme | Varsayılan olarak etkin; yapılandırılabilir muhakeme çabası |
| Araçlar ve önbellekleme | Fonksiyon çağırma, web araması, örtük önbellek ve oturum önbelleği |
| Ses | 113 dil ve lehçe; stereo ve dört kanallı FOA |
| API tarzları | Sohbet Tamamlamaları ve Yanıtlar |
| QwenCloud fiyatı | 1M belirteç başına $0.15 girdi, $0.47 çıktı ve $0.016 örtük önbellek girdi |
| Açık ağırlıklar | Bu model için lansmanda duyurulmadı |
Qwen3.8-Omni-Flash Nasıl Çalışır?
QwenCloud, Qwen3.8-Omni-Flash’ın Qwen3.8-Flash-Next mimarisi üzerine kurulduğunu belirtir. Bu, mimari bağlam sağlar; ancak Flash-Next için yayımlanan parametre sayıları, Qwen bu eşlemeyi doğrulamadıkça Omni modelin kesin parametre özellikleri olarak otomatik biçimde sunulmamalıdır.
Gated DeltaNet + Qwen Sparse Attention
Flash-Next temeli, Gated DeltaNet’i Qwen Sparse Attention ile birleştirir. Basitleştirirsek, tekrarlamalı bileşen geçmiş bilgiyi kompakt bir duruma sıkıştırırken, seyrek dikkat her belirteç çifti üzerinde yoğun tam dikkat uygulamak yerine seçili uzun menzilli bağlamı geri getirir. Bu, özellikle dizi uzunluğunun hesaplama maliyetini domine edebildiği uzun ses ve video akışlarında önemlidir.
Statik algı yerine ajanık algı
Daha büyük değişim sistem düzeyindedir. Qwen, modelin uzun videoları aktif olarak keşfedebildiğini ve her bölüme eşit hesaplama harcamak yerine ilgili anlara odaklanabildiğini söylüyor. Kavramsal olarak ajan, kanıtın muhtemelen nerede olacağını belirler, o anları daha derin inceler, bunlar hakkında muhakeme eder ve ardından bir sonraki adımda hangi aracın veya işlemin yapılacağına karar verir.
Başlıca Qwen3.8-Omni-Flash Özellikleri Nelerdir?
Yerel ses-görüntü akıl yürütme
Qwen3.8-Omni-Flash, bir videonun görsel ve ses akışları üzerinde birlikte akıl yürütür. Bu, yanıtın her iki moduna da bağlı olduğu durumlarda önemlidir: bir şeyi kimin söylediğini belirlemek, bir sesin bir eylemden önce mi sonra mı geldiğine karar vermek, müziği veya ortam sesini yorumlamak ya da ekranda görünenlerle konuşulan talimatları ilişkilendirmek gibi.
Çok konuşmacılı ve uzamsal ses anlama
API, iki kanallı stereo ve dört kanallı birinci dereceden ambisonikler dahil çok kanallı sesi destekler. Yönlü bilgiyi korumak, toplantı analizi, somutlanmış ajanlar, kayıtlı etkinlikler, çok konuşmacılı ortamlar ve ses temellendirme için yardımcı olabilir.
Ayarlanabilir muhakeme çabası
Düşünme varsayılan olarak etkindir. Geliştiriciler, karmaşık multimedya görevleri için daha derin muhakemeye karşı gecikme ve belirteç tüketimini dengelemek amacıyla muhakeme çabasını yapılandırabilir.
Fonksiyon çağırma ve web araması
Fonksiyon çağırma ve web araması, ajanik konumlandırmanın merkezindedir. Model bir video, görsel veya ses dosyasını anladıktan sonra haricî bir araca yapılandırılmış argümanlar iletebilir, ek bilgi getirebilir veya iş akışına model dışında devam edebilir.
Qwen-MM-Plugins
Qwen ayrıca multimodal-yerli ajan koşumları için Apache-2.0 lisanslı Qwen-MM-Plugins paketini yayımladı. İş akışları arasında video üretimi, videodan notlara dönüşüm, gösterim videolarından yeniden kullanılabilir beceriler öğrenme ve işitsel-görsel bellek yer alıyor.
Qwen3.8-Omni-Flash Kıyaslarda Ne Kadar İyi?
Qwen3.8-Omni-Flash Metin ve Kodlamada Hâlâ İyi mi?
Qwen’in lansman sonuçları, Omni modelinin çeşitli kodlama ve muhakeme değerlendirmelerinde ilgili Flash metin modeline yakın kaldığını gösteriyor. Qwen, LiveCodeBench v6’da 92.6, SWE-bench Pro’da 63.3 ve GPQA Diamond’da 91.0 rapor ediyor. Bunlar, Qwen’in lansman kurulumuna göre satıcı-raporlu sonuçlardır ve üretimde kullanılan kodlama görevleri ile ajan çerçevesine karşı doğrulanmalıdır.
Qwen, Qwen3.5-Omni-Plus’a kıyasla 29 değerlendirme genelinde ortalama %25’ten fazla iyileşme bildiriyor. Aşağıdaki tablolar resmi lansman kıyas sonuçlarını özetler. Bunlar birinci taraf sonuçlarıdır ve yayımlanma tarihinde bağımsız olarak yeniden üretilmemiştir.
Değerlendirme koşulları: Statik satırlar, Qwen’in lansman kurulumunda tek bir model çalışmasını ölçer. “+ ajan” etiketli satırlar, çevreleyen bir ajan çerçevesi, geri getirme veya yinelemeli medya incelemesini içerir. Resmi lansman materyalleri, istem şablonları, örnekleme ayarları, medya ön işleme ve koşum sürümleri için başvurulmalıdır; bu ayrıntıların açıklanmadığı yerlerde sonuç, bağımsız olarak yeniden üretilebilir olmaktan ziyade satıcı-raporlu olarak değerlendirilmelidir.
Daha büyük önem, multimodal anlamadan multimodal yürütmeye geçiştir. Önceki boru hatları sıklıkla sesi yazıya döker, video karelerini örnekler, bu çıktıları bir LLM’e gönderir, bir yanıt üretir ve gerçek görev için ayrı uygulama mantığına dayanırdı. Qwen3.8-Omni-Flash, bu döngünün daha fazlasını tek bir ajan sisteminde sıkıştıracak şekilde tasarlanmıştır.
Bir medya üretim ajanı, düzenlemeleri planlamadan önce görüntü ve sesi inceleyebilir. Bir toplantı ajanı, konuşmacı kimliğini konuşulan içerik ve sunum görselleriyle birleştirebilir. Bir araştırma ajanı, saatler süren işitsel-görsel materyalde ilgili anları bulabilir ve ardından dış bağlam arayabilir. Bu çerçevede ses ve video, pasif ekler yerine bir ajan için çalışma bağlamı hâline gelir.
Ses-görüntü ajanları
| Kıyas — resmi lansman kaynağı | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| WildClawBench-MM | 71.0 | 34.5 | 58.9 |
| UniClawBench | 69.6 | 67.1 | 69.0 |
| AgenticVBench | 36.8 | 14.5 | 45.0 |
| OmniGAIA | 74.0 | — | 78.6 |
| StreamingBench | 80.8 | 57.1 | 79.9 |
En büyük nesil sıçraması WildClawBench-MM’de; Qwen, 34.5’ten 71.0’e yükseliş bildiriyor. AgenticVBench de keskin biçimde iyileşirken, Gemini 3.8 Flash bu kıyasta önde kalıyor. Dolayısıyla desen, “tek model her şeyi kazanır” türünde evrensel bir sonuç değildir.
Ses-görüntü anlama ve muhakeme
| Kıyas | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| OmniVideoBench | 63.4 | 53.8 | 65.2 |
| OmniVideoBench + Qwen Code ajan | 67.8 | — | 65.2 |
| Video-MME-v2 | 65.0 | — | 71.0 |
| Video-MME-v2 + ajan | 71.3 | — | 71.0 |
| LVOmniBench | 63.3 | — | 70.7 |
| LVOmniBench + ajan | 73.6 | — | 70.7 |
| JointAVBench | 75.9 | — | 70.4 |
Statik satırlar karışık. Gemini, çeşitli geleneksel video muhakemesi testlerinde önde; ancak Qwen’in sonucu sıklıkla bir ajan döngüsü içinde yükseliyor. Bu ayrım, yalnızca üretim uygulaması benzer geri getirme, araçlar veya yinelemeli inceleme kullanıyorsa önemlidir.
Ses ve çok konuşmacılı anlama
| Kıyas | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| LongAudioSpan | 82.7 | 74.4 | 79.3 |
| AliMeeting DER ↓ | 3.4 | 88.1 | 72.6 |
| AliMeeting cpWER ↓ | 17.2 | 89.6 | 53.1 |
| FLEURS-ASR WER ↓ | 9.3 | 7.2 | 7.9 |
| VoiceBench | 91.6 | 92.9 | 92.3 |
Toplantı satırları öne çıkarken, FLEURS-ASR ve VoiceBench selefe göre iyileşmiyor. Lansman sonuçları, bu nedenle, tekdüze bir konuşma tanıma kazanımından ziyade daha zengin çok konuşmacılı, uzamsal ve uzun bağlamlı ses anlayışına işaret ediyor.
Qwen3.8-Omni-Flash vs Qwen3.5-Omni-Plus vs Gemini 3.8 Flash
Tablo, Qwen’in resmi ürün bilgilerini Google’ın resmi Gemini 3.8 Flash spesifikasyonu ile birleştirir. Kıyas karşılaştırmaları Qwen tarafından yürütülmüştür ve tarafsız üçüncü taraf sıralamaları olarak değerlendirilmemelidir.
| Boyut | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| Mimari | Qwen3.8-Flash-Next temeli; Omni’ye birebir parametre eşlemesi açıklanmadı | Önceki Qwen Omni nesli | Google’a ait tescilli Gemini mimarisi |
| Bağlam penceresi | 1M belirteç | Daha küçük dağıtım limitleri | 1,048,576 girdi belirteci |
| Muhakeme | Ayarlanabilir muhakeme çabası; düşünme varsayılan olarak etkin | Atıf yapılan dağıtımda varsayılan açık bir düşünme modu yok | Düşük, orta ve yüksek düşünme seviyeleri |
| Çok modlu girdi | Metin, görsel, ses, video | Metin, görsel, ses, video | Metin, görsel, video, ses ve PDF |
| Çıktı | Metin | Metin ve desteklenen konuşma iş akışları | Metin |
| Kodlama | Güçlü satıcı-raporlu kodlama skorları; ana farklılaştırıcı değil | Ana konumlandırma değil | Uzun ufuklu yazılım mühendisliği ve ajanlar için tasarlanmış |
| API kullanılabilirliği | Sohbet Tamamlamaları ve Yanıtlar; barındırılan API | Barındırılan Qwen API’leri | Gemini API; genel olarak kullanılabilir |
| Araçlar | Fonksiyon çağırma ve web araması | Fonksiyon çağırma ve web araması | Fonksiyon çağırma, arama temellendirme, kod yürütme ve diğer yerleşik araçlar |
| Yayınlanan API fiyatı | QwenCloud: 1M belirteç başına $0.15 girdi / $0.47 çıktı | Bölge ve uç noktaya bağlı | Google giriş fiyatı: 31 Aralık 2026’ya kadar 1M belirteç başına $0.75 girdi / $3.75 çıktı |
| En uygun kullanım | Medya ajanları ve analiz | Omni sohbet ve konuşma çıktısı | Geniş kapsamlı multimodal, kodlama ve otonom ajan iş akışları |
Qwen3.5-Omni-Plus, üretilen konuşmanın gerektiği durumlarda geçerliliğini korur. Qwen3.8-Omni-Flash, verimli ses-video anlayışı ve araca yönelik yürütme etrafında daha belirgin şekilde optimize edilmiştir.
Gemini 3.8 Flash’a karşı Qwen’in değerlendirmesi karışık: Qwen3.8-Omni-Flash, ses, çok konuşmacı işleme, temellendirme ve çeşitli ajan iş akışlarında rekabetçi iken, Gemini bazı statik video muhakemesi testlerinde öndedir. Akla yatkın karşılaştırma iş yüküne özeldir.
Birleşik erişimi değerlendiren geliştiriciler, CometAPI’de Gemini 3.8 Flash API’sini, Qwen3.8-Flash API’sini ve Qwen3.8-Flash-Next API’sini tablo dışında karşılaştırabilir; böylece teknik kaynak bağlantıları ile ürün erişim bağlantıları ayrık kalır.
Qwen3.8-Omni-Flash’ın Sınırlamaları
- Yalnızca metin çıktısı: Sesi ve videoyu anlar ancak yanıt modundaki çıktı olarak konuşma üretmez.
- Barındırılan dağıtım: Qwen3.8-Omni-Flash için lansmanda açık ağırlıklar duyurulmadı.
- Güncel kıyaslar: Manşet karşılaştırmalar ağırlıklı olarak birinci taraf sonuçlardır ve bağımsız çoğaltma gerektirir.
- Ajan koşum etkileri: Bazı skorlar geri getirme, araç ortamları veya yinelemeli incelemeyi içerir; ham model sonuçlarıyla karıştırılmamalıdır.
- İş akışına bağlı maliyet: Uygulama, geri getirme, önbellekleme veya hedefli inceleme yerine büyük segmentleri tekrar tekrar yeniden işlerse uzun videolar hâlâ pahalı olabilir.
Qwen3.8-Omni-Flash’ı Kimler Kullanmalı?
Qwen3.8-Omni-Flash, ses veya videonun yalnızca özetlenmesi gereken bir ek değil, bizzat görevin parçası olduğu durumlarda en ilgi çekicidir. Uygun kullanım örnekleri arasında toplantı zekâsı, uzun biçimli medya araması, video çeviri boru hatları, öğreticiden notlara iş akışları, medya üretim ajanları ve işitsel-görsel arşivler yer alır.
Geleneksel metin sohbeti için, özel bir Flash metin modeli daha basit kalabilir. Konuşma çıktısı gerektiren uygulamalar için, açık ses üretimi destekleyen bir Omni modeli daha iyi bir uyum olabilir. Görme, duyma, muhakeme ve eylemi birleştiren iş akışları için Qwen3.8-Omni-Flash, Qwen ürün ailesindeki daha ayırt edici seçenektir.
Sonuç
Qwen3.8-Omni-Flash, yalnızca bir başka multimodal Flash sürümü değil, ajanik ses-video modeli olarak anlaşılmalıdır. 1M bağlamı, yerel ses-video muhakemesi, çok konuşmacı ve uzamsal ses yetenekleri, ayarlanabilir muhakeme, fonksiyon çağırma, arama ve Qwen-MM-Plugins ekosistemi aynı geçişe yöneliktir: bir yapay zekâ sisteminin multimedya anlamaktan multimedya ile iş yapmaya geçmesini sağlamak.
Lansman verileri, özellikle ajanik iş akışlarında ve karmaşık ses senaryolarında Qwen3.5-Omni-Plus’a göre önemli bir nesil iyileşimi gösteriyor. Gemini 3.8 Flash’a karşı Qwen’in verileri daha dengeli. Bu nedenle önemli soru, hangi modelin tek bir tabloyu kazandığı değil, hedef iş akışını doğru ve ekonomik biçimde tamamlayan model ve koşum kombinasyonunun hangisi olduğudur.
