Spesifikasi Teknis Qwen3.8-Flash-Next
| Spesifikasi | Qwen3.8-Flash-Next |
|---|---|
| Pengembang | Qwen Team, Alibaba Group |
| Jenis model | Model bahasa kausal multimodal dengan vision encoder; MoE ultra-renggang |
| Parameter model utama | 125B |
| Parameter teraktivasi | 6B per token |
| Parameter embedding n-gram | 51B tambahan |
| Parameter MTP | 4B |
| Lapisan | 48 |
| Pola atensi hibrida | 12 x [3 Gated DeltaNet layers + 1 Qwen Sparse Attention layer] |
| Pakar MoE | total 512; 10 dirutekan + 1 bersama per token |
| Residual dengan gerbang | 4 cabang; peringkat bottleneck 320 |
| Jendela konteks bawaan | 262,144 token |
| Konteks diperluas | Hingga 1,000,000 token dengan YaRN |
| Modalitas | Masukan teks, gambar, video; keluaran teks |
| Kontrol pemikiran | Berpikir/tidak berpikir serta kontrol upaya penalaran di API yang didukung |
| Penyebaran | Transformers, vLLM, SGLang, TokenSpeed dan kerangka lain yang didukung |
| Bobot terbuka | Ya |
| ID model CometAPI | qwen3.8-flash-next |
Apa itu Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next adalah model MoE multimodal berbobot terbuka yang akan datang dari tim Qwen milik Alibaba. Lebih penting lagi, ini diposisikan sebagai pratinjau awal arsitektur yang dimaksudkan untuk mendukung keluarga model Qwen4 di masa depan, bukan sekadar titik pemeriksaan Qwen3.8 yang bersifat inkremental.
Qwen menggunakan rilis ini untuk memperkenalkan arah arsitektur generasi berikutnya kepada ekosistem open-source sebelum keluarga Qwen4 yang lebih luas hadir. Ini memberi pengembang mesin inferensi, proyek kuantisasi, kerangka penyajian model, dan pengembang aplikasi kesempatan untuk mempersiapkan perubahan arsitektur terlebih dahulu.
Arsitektur yang diungkap saat ini memperkenalkan dua komponen penting: arsitektur hibrida berbasis GDN dan Qwen Sparse Attention (QSA). GDN merujuk pada pendekatan atensi linear bergate bergaya DeltaNet yang mengikuti arah atensi hibrida yang sebelumnya dieksplorasi di Qwen3-Next. QSA dihadirkan sebagai mekanisme atensi jarang yang baru, meskipun spesifikasi teknis lengkapnya belum didokumentasikan secara publik.
Fitur Utama Qwen3.8-Flash-Next
- Pratinjau arsitektur Qwen4: Qwen3.8-Flash-Next secara eksplisit diposisikan sebagai implementasi awal dari arah arsitektur yang akan mendukung keluarga Qwen4 yang akan datang.
- Desain MoE multimodal: Model ini digambarkan sebagai model Mixture-of-Experts multimodal, memperluas strategi model jarang yang efisien dari Qwen menuju generasi arsitektur baru.
- Arsitektur hibrida GDN: Model ini melanjutkan arah riset atensi hibrida yang diperkenalkan dengan Qwen3-Next, menggabungkan mekanisme atensi linear yang efisien dengan atensi konvensional di mana pengambilan presisi itu penting. Qwen3-Next menunjukkan bahwa pendekatan ini dapat secara signifikan meningkatkan efisiensi inferensi konteks panjang.
- Qwen Sparse Attention: QSA adalah salah satu dari dua perubahan arsitektur yang disorot secara publik untuk Flash-Next. Implementasi detail dan manfaat kuantitatifnya masih menunggu dokumentasi dari Qwen.
- Orientasi ekosistem bobot terbuka: Rilis ini dimaksudkan untuk memberi komunitas open-source akses awal ke perubahan arsitektur sehingga runtime inferensi dan tooling hilir dapat beradaptasi sebelum Qwen4 hadir.
- Performa Coding dan Agen dari Qwen3.8-Flash-Next
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
Qwen3.8-Flash-Next vs Qwen3.8-Max vs Qwen3.8-27B
| Model | Posisi | Arsitektur / Skala | Multimodal | Status saat ini |
|---|---|---|---|---|
| Qwen3.8-Flash-Next | Pratinjau arsitektur Qwen4 / model terbuka berorientasi efisiensi | MoE multimodal; spesifikasi lengkap menunggu | Ya | Akan hadir |
| Qwen3.8-Max | Model Qwen3.8 flagship yang di-host | MoE skala besar | Ya | Tersedia |
| Qwen3.8-27B | Model Qwen3.8 berbobot terbuka | Model dense 27B | Kemampuan spesifik model | Tersedia |
Qwen3.8-Max sudah tersedia melalui ekosistem cloud Alibaba dan diposisikan untuk penalaran tingkat lanjut, pemahaman visual, coding, dan beban kerja agen. Dokumentasi Qwen saat ini mencantumkan Qwen3.8-Max dengan jendela konteks 1M token, sementara CometAPI sudah mengekspos qwen3.8-max.
Karena itu, Flash-Next sebaiknya dipandang berbeda: signifikansi utamanya pada tahap ini bersifat arsitektural daripada berbasis benchmark. Ini mempratinjau arah teknis Qwen4 dan memberi ekosistem open-source target lebih awal untuk optimisasi runtime dan penyebaran.