Qwen3.8-Flash-Next bukan sekadar anggota yang lebih kecil atau lebih cepat dari keluarga Qwen3.8. Qwen menggambarkannya sebagai model MoE multimodal open-weight dan pratinjau awal arsitektur yang digunakan di Qwen4. Desainnya sekaligus mengubah mekanisme attention, koneksi residual, kapasitas embedding, dan optimisasi, dengan tujuan meningkatkan kapabilitas sambil tajam mengurangi komputasi per token.
TL;DR
Qwen3.8-Flash-Next menggabungkan model utama 125B parameter dengan tabel embedding N-gram 51B tambahan, sementara hanya mengaktifkan 6B parameter per token. Model ini secara native menangani 262.144 token dan dapat diperluas hingga 1.000.000 token dengan YaRN. Arsitekturnya dibangun di sekitar campuran 3:1 antara Gated DeltaNet dan Qwen Sparse Attention, koneksi Gated Residual empat-cabang, N-gram Embedding, kumpulan ahli MoE ultra-sparse yang besar, Multi-Token Prediction, dan pelatihan berbasis Muon.
Poin terpenting adalah efisiensi, bukan sekadar jumlah parameter. Qwen melaporkan bahwa pelatihan model ini memerlukan sekitar sepersembilan biaya Qwen3.7-Plus, namun evaluasi peluncurannya menempatkan model ini di depan baseline Qwen sebelumnya pada banyak tugas coding, office-agent, dan multimodal. Ini adalah hasil yang dilaporkan vendor dan sebaiknya dibaca sebagai bukti peluncuran, bukan validasi independen.
Bagi pengembang, open weight tersedia melalui kanal Qwen, sementara versi produksi terkelola disebut Qwen3.8-Flash di QwenCloud. CometAPI mencantumkan Qwen3.8-Flash-Next dengan ID model qwen3.8-flash-next, memberi pengembang rute terpadu bersama model frontier lainnya.
Key Takeaways
- 125B parameter model utama + 51B N-gram embedding, dengan 6B parameter aktif per token.
- Pola hybrid attention 3 GDN : 1 QSA dirancang untuk menggabungkan memori efisien dengan pengambilan jarak jauh yang presisi.
- Konteks native 262.144 token dan hingga 1M token melalui YaRN.
- Qwen melaporkan hingga 7,6x percepatan prefill dan 4,9x decode pada konteks 1M untuk QSA.
- Arus residual diperlebar menjadi empat cabang bertingkat (gated), meningkatkan aliran informasi lintas layer dan stabilitas pelatihan.
- Tabel peluncuran resmi menunjukkan hasil kuat di SWE-bench Pro, CoWorkBench, JobBench, Toolathlon, AndroidWorld, dan RealWorldQA, namun tidak menyapu bersih semua benchmark.
- Qwen memposisikan rilis ini sebagai pratinjau arsitektur, sehingga pentingnya sebagian terkait sinyal desain untuk Qwen4, bukan hanya peringkat benchmark saat ini.
What Is Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next adalah model bahasa multimodal kausal dengan vision encoder dan tulang punggung bahasa Mixture-of-Experts ultra-sparse. Kartu model resmi menggambarkan arsitektur 48 layer dengan 512 expert, 10 routed expert ditambah satu shared expert, serta susunan tersembunyi yang mengulang tiga layer Gated DeltaNet diikuti satu layer Qwen Sparse Attention.
Rilis ini memainkan peran mirip Qwen3-Next: mengekspose perubahan arsitektural sebelum ditingkatkan skalanya ke keluarga penuh berikutnya. Qwen secara eksplisit menyebut model ini pratinjau eksperimental arsitektur yang akan menopang Qwen4. Hal ini membuat model ini menarik bagi engineer yang peduli pada efisiensi serving, konteks panjang, dan arah riset arsitektur model terbuka.
4 core components of Qwen3.8-Flash-Next
Model ini mengubah empat komponen inti secara bersamaan: attention, aliran residual, kapasitas embedding, dan optimisasi. Ko-desain ini penting karena peningkatan efisiensi pada satu komponen dapat hilang jika komponen lain menjadi bottleneck pada konteks panjang atau skala besar.
Hybrid Attention: GDN + Qwen Sparse Attention
Sebagian besar layer tidak melakukan global attention. Sebagai gantinya, tiga dari setiap empat layer menggunakan Gated DeltaNet untuk mengompresi informasi historis ke dalam state berukuran tetap. Layer keempat menggunakan global attention untuk pengambilan yang presisi, tetapi global attention itu didesain ulang sebagai Qwen Sparse Attention (QSA).
QSA menghindari pencarian setiap token secara independen. Sebuah indexer ringan terlebih dulu mengelompokkan urutan ke dalam mikro-blok, memperkirakan blok mana yang penting, kemudian hanya melakukan attention ke wilayah terpilih. Dalam deskripsi Qwen, hal ini mengurangi komputasi attention dan overhead pengindeksan yang dibutuhkan untuk menemukan konteks relevan. Desain ini sangat kompatibel dengan jaringan hibrida karena indeks sparse dibangun secara independen dalam setiap layer attention alih-alih bergantung pada kesamaan antar-layer attention berdekatan.
Angka efisiensinya substansial. Pada konteks 1M token, Qwen melaporkan hingga 7,6x lebih cepat prefill dan 4,9x lebih cepat decode untuk kernel attention QSA. Dalam eksperimen serving dengan reuse cache tinggi dan tingkat hit prefix-cache 90%, model penuh mencapai 8,6x throughput prefill dibanding Qwen3.7-Plus pada konteks 1M.
Gated Residual: Four Paths Instead of One
Transformer konvensional berulang kali membaca dan menulis satu arus residual. Qwen3.8-Flash-Next justru menggunakan Gated Residual untuk melebarkan arus tersebut menjadi empat cabang paralel. Gate pembacaan per-elemen menentukan seberapa banyak informasi yang diambil dari tiap cabang, sementara gate penulisan per-cabang menentukan apa yang ditulis kembali.
Tujuannya adalah mempertahankan fitur-fitur berguna di seluruh kedalaman tanpa memaksa setiap fitur melewati kanal yang terus-menerus tercampur. Qwen juga melaporkan bahwa gate menekan outlier aktivasi dan state residual dapat disimpan dalam FP8, menurunkan trafik memori. Gagasan kuncinya bukan sekadar menambah kapasitas residual; melainkan perutean informasi lintas layer yang terkendali.
N-gram Embedding: More Capacity Without Proportional Compute
Model ini menambahkan 51B parameter N-gram Embedding di luar 125B tulang punggung utama. Tidak seperti embedding biasa yang mengindeks dari satu token, N-gram Embedding menggunakan pola token lokal seperti bigram dan trigram. Ini memberi model memori bergaya lookup yang besar untuk pola lokal berulang.
Bagian yang tidak biasa adalah letak kapasitasnya. Karena alamat lookup dapat diketahui sebelum embedding dibutuhkan, tabel dapat disimpan di memori host dan diprefetch secara asinkron sementara komputasi GPU terus berjalan. Artinya, tambahan 51B parameter tidak berperilaku seperti 51B parameter perkalian-matriks padat. Arsitektur ini pada dasarnya menskalakan dua sumber daya berbeda: parameter model berat-komputasi dan memori lookup berkomputasi ringan.
Muon and Training Optimization
Qwen melatih arsitektur ini dengan optimizer Muon untuk peta linear dua dimensi seperti bobot utama pada attention, GDN, dan expert MoE, sementara embedding, router, dan parameter Gated Residual ber-rank rendah tetap menggunakan AdamW. Matriks fusi seperti proyeksi QKV dan SwiGLU dipisah menjadi transformasi linear independen sebelum ortogonalisasi.
Tim juga memasangkan ulang scaling law untuk arsitektur baru dan melaporkan bahwa Batch Size Warmup konvensional tidak diperlukan. Peningkatan batch size secara bertahap tidak meningkatkan hasil akhir dan justru memerlukan 18,8% lebih banyak langkah optimizer. Resep final karenanya langsung memulai pada batch size target.
Ultra-Sparse MoE and Multi-Token Prediction
Kartu model resmi mencantumkan 512 expert dengan 10 routed expert dan satu shared expert aktif per token. Kumpulan expert yang besar meningkatkan kapasitas tersimpan tanpa mengaktifkan seluruh model untuk setiap token. Modul Multi-Token Prediction (MTP) satu-layer dilatih dengan beberapa langkah untuk meningkatkan penerimaan speculative-decoding sekaligus mendukung tulang punggung utama.
Qwen3.8-Flash-Next Benchmark Performance
Qwen menerbitkan evaluasi bahasa, coding, agen, dan visi-bahasa yang luas. Angka-angka ini berguna karena banyak model pembanding dijalankan ulang dalam harness Qwen, namun tetap evaluasi peluncuran yang dilaporkan vendor, bukan reproduksi benchmark independen. Beberapa baris juga menggunakan harness atau juri spesifik benchmark, jadi interpretasi paling aman bersifat directional: menunjukkan di mana Qwen3.8-Flash-Next paling kuat dan di mana kompetitor masih unggul.
Coding and Agent Performance
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
Narasi coding-nya kuat namun bernuansa. Qwen3.8-Flash-Next memimpin set pembanding yang terdaftar pada SWE-bench Pro, SWE-bench Multilingual, CoWorkBench, JobBench, Toolathlon Verified, dan LiveCodeBench v6. Namun, DeepSeek V4 Flash unggul pada NL2Repo-Bench, sementara Claude Opus 4.6 memimpin HLE. Ini menjadikan efisiensi sebagai tajuk utama yang lebih dapat dipertahankan daripada dominasi benchmark universal.
Peningkatan paling mencolok dibanding baseline Qwen sebelumnya terlihat pada pekerjaan berjangka panjang. CoWorkBench naik dari 65,1 pada Qwen3.7-Plus menjadi 73,9, sementara JobBench bergerak dari 27,6 menjadi 55,7. Karena CoWorkBench adalah benchmark internal Qwen, peningkatan tersebut perlu replikasi independen, namun selaras dengan fokus arsitektur pada workflow agen dan perkantoran yang hemat biaya.
Multimodal Performance
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | Claude Opus 4.6 |
|---|---|---|---|---|
| ClawEval-MM (Pass@3 / Avg) | 64.4 / 60.4 | 57.4 / 56.9 | 57.4 / 60.1 | 52.5 / 54.7 |
| RecreationBench | 49.9 | 47.1 | 30.2 | -- |
| AndroidWorld | 84.5 | 81.9 | 81.0 | 62.0 |
| OSWorld 2.0 (Binary / Partial) | 19.4 / 52.3 | 19.4 / 48.0 | 2.8 / 21.5 | -- |
| Vision2Web | 64.0 | 62.9 | 42.1 | -- |
| ERQA | 72.3 | 65.5 | 69.8 | 40.8 |
| LVBench | 76.6 | 72.4 | 76.2 | 63.0 |
| RealWorldQA | 88.5 | 85.9 | 86.9 | 73.9 |
| MathVision (without / with CI) | 90.6 / 95.7 | 90.0 / 94.6 | 90.3 / 88.7 | 65.5 / -- |
| CharXiv RQ (without / with CI) | 84.6 / 90.6 | 83.7 / 90.2 | 85.8 / 85.9 | 66.0 / -- |
Sumber data: evaluasi peluncuran resmi Qwen**.
Hasil multimodal mendukung pandangan bahwa ini bukan sekadar model Flash yang berfokus pada coding. Qwen3.8-Flash-Next meraih 84,5 pada AndroidWorld, 64,0 pada Vision2Web, 76,6 pada LVBench, dan 88,5 pada RealWorldQA dalam tabel Qwen. Kartu model juga menyediakan contoh input gambar dan video, termasuk rekomendasi sampling frame-rate lebih tinggi untuk pekerjaan video skala jam. pekerjaan video.
Qwen3.8-Flash-Next vs Other Models
Perbandingan yang berguna sebaiknya memisahkan tiga pertanyaan: berapa banyak komputasi yang diaktifkan per token, seberapa luas modalitas dan konteks model, dan seberapa baik kinerjanya pada workflow representatif. Jumlah total parameter mentah saja tidak menjawab pertanyaan-pertanyaan tersebut.
Qwen3.8-Flash-Next vs Qwen3.8-27B vs Qwen3.7-Plus
| Dimension | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus |
|---|---|---|---|
| Model parameters | 125B + 51B N-gram embedding | 27B | 397B |
| Activated parameters | 6B | 27B | 17B |
| Native context | 262K | 262K in Qwen comparison setup | Prior-generation long-context model |
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 |
| CoWorkBench | 73.9 | 70.7 | 65.1 |
| JobBench | 55.7 | 33.4 | 27.6 |
| AndroidWorld | 84.5 | 81.9 | 81.0 |
Hasil kunci adalah kapabilitas per parameter aktif. Qwen3.8-Flash-Next mengaktifkan 6B parameter per token dibanding 27B pada Qwen3.8-27B dan 17B pada Qwen3.7-Plus, namun unggul pada skor DeepSWE, CoWorkBench, JobBench, dan AndroidWorld yang terdaftar. Trade-off-nya adalah jejak memori: sparsity mengurangi komputasi aktif, bukan jumlah kapasitas model yang pada akhirnya harus disimpan di suatu tempat.
Qwen3.8-Flash-Next vs DeepSeek V4 Flash vs Claude Opus 4.6
| Dimension | Qwen3.8-Flash-Next | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|
| Weights | Open-weight | Open-weight | Closed |
| Reported parameter profile | 125B main + 51B N-gram; 6B active | 284B total; 13B active | Not publicly disclosed |
| Primary efficiency story | QSA + GDN + 6B active MoE + lookup memory | High-throughput sparse MoE | Managed frontier reasoning and agent stack |
| Native multimodality | Text, image, video -> text | Text-oriented Flash family; vision route available separately on CometAPI | Text + vision/files through hosted APIs |
| SWE-bench Pro* | 62.5 | 56.0 | 53.4 |
| CoWorkBench* | 73.9 | 45.1 | 68.2 |
| NL2Repo-Bench* | 48.1 | 54.2 | 47.6 |
| HLE* | 35.9 | 33.8 | 40.0 |
DeepSeek V4 Flash tetap lebih kuat pada NL2Repo-Bench dalam perbandingan Qwen, yang penting untuk generasi kode level repositori. Claude Opus 4.6 lebih kuat pada HLE di tabel yang sama dan mewakili model tertutup terkelola, bukan target deployment terbuka. Qwen3.8-Flash-Next paling terdiferensiasi oleh kombinasi open weight, multimodalitas native, rekayasa konteks panjang, dan anggaran parameter aktif yang sangat kecil.
Qwen3.8-Flash-Next vs Qwen3.8-Max
| Dimension | Qwen3.8-Flash-Next | Qwen3.8-Max |
|---|---|---|
| Role | Pratinjau arsitektur open yang mengutamakan efisiensi | Flagship Qwen3.8 |
| Main/total scale | 125B utama + 51B N-gram; 6B aktif | 2,4T total; sekitar 95B aktif pada halaman model CometAPI |
| Architecture emphasis | QSA, GDN, Gated Residual, N-gram Embedding, Muon | Kapabilitas frontier maksimum pada skala jauh lebih besar |
| Best fit | Agen volume tinggi, asisten coding, otomasi multimodal, self-hosting | Penalaran tersulit, agen enterprise besar, workload berfokus kapabilitas |
| Context | 262K native; hingga 1M dengan YaRN | Kelas 1M konteks ter-host pada rute flagship Qwen3.8 saat ini |
Qwen3.8-Max spesifikasi didasarkan pada listing model CometAPI saat ini.
Perbedaannya sederhana: Qwen3.8-Max adalah flagship yang mengutamakan kapabilitas, sementara Qwen3.8-Flash-Next adalah eksperimen arsitektur dan efisiensi. Pengembang yang memilih di antara keduanya sebaiknya bertanya apakah bottleneck-nya adalah kapabilitas model absolut atau biaya menjalankan banyak tugas konteks panjang yang menggunakan tool pada skala besar.
Qwen3.8-Flash-Next Pricing and Availability
Open weight untuk Qwen3.8-Flash-Next diterbitkan melalui Hugging Face dan ModelScope. Untuk serving terkelola, Qwen menyatakan bahwa versi produksi disebut Qwen3.8-Flash di QwenCloud, dengan konteks 1M diaktifkan secara default dan tool resmi bawaan.
Qwen mencantumkan harga produksi terkelola sebesar $0,16 per sejuta token input dan $0,47 per sejuta token output. Harga tersebut merujuk pada model produksi QwenCloud Qwen3.8-Flash, bukan self-hosting open weight.
| Route | Input | Output |
|---|---|---|
| QwenCloud production model (Qwen3.8-Flash) | $0.16 / 1M tokens | $0.47 / 1M tokens |
| Open-weight self-hosting | Infrastructure-dependent | Infrastructure-dependent |
| CometAPI route | Check live model page | Check live model page |
Harga QwenCloud berasal dari artikel peluncuran resmi Qwen; penagihan CometAPI harus diperiksa pada halaman model live.
Untuk pengguna CometAPI, model Qwen3.8-Flash-Next khusus mengidentifikasi rute sebagai qwen3.8-flash-next. Karena perutean, ketersediaan upstream, dan penagihan dapat berubah secara independen dari rilis open weight, integrasi produksi sebaiknya membaca katalog CometAPI live sebelum mengunci asumsi harga.
CometAPI Recommendation
Qwen3.8-Flash-Next diharapkan segera tersedia melalui CometAPI. CometAPI menyediakan satu endpoint yang kompatibel dengan OpenAI (https://api.cometapi.com/v1) yang mengagregasi 500+ model dari penyedia terkemuka, termasuk seri model Qwen. Pendekatan ini mengurangi vendor lock-in, menyederhanakan eksperimen dengan Qwen3.8-Flash (setelah tersedia melalui platform atau endpoint Qwen terkait), dan merapikan deployment produksi yang mungkin mencampur model untuk tugas berbeda (misalnya, Qwen untuk agen coding hemat biaya + model lain untuk penalaran khusus). Dokumentasi dan panduan cepat tersedia di apidoc.cometapi.com dan situs utama CometAPI.
Baik Anda self-host open weight, menggunakan QwenCloud, atau merutekan melalui platform terpadu seperti CometAPI, Qwen3.8-Flash-Next menurunkan hambatan untuk agen multimodal berkinerja tinggi dengan konteks panjang.
What Can Qwen3.8-Flash-Next Do?
1. High-Volume Coding Agents
Anggaran parameter aktif 6B yang dipadukan dengan skor SWE-bench Pro 62,5 dalam evaluasi Qwen membuat Qwen3.8-Flash-Next sangat menarik untuk sistem coding yang menjalankan banyak sesi paralel. Contohnya mencakup code review, triase isu, navigasi repositori, pembuatan test, dan patching iteratif di mana throughput hampir sama pentingnya dengan kecerdasan satu kali jalan.
2. Long-Horizon Office and Knowledge Work
CoWorkBench dan JobBench merupakan pusat positioning model ini. Arsitekturnya dirancang untuk loop agen yang berulang kali membaca konteks, memanggil tool, memperbarui state, dan melanjutkan bekerja alih-alih menjawab sekali. Ini secara natural memetakan ke workflow dokumen, analisis spreadsheet, perakitan laporan, sintesis riset, dan otomasi proses bisnis.
3. Multimodal Computer and Mobile Agents
Input gambar dan video, performa AndroidWorld, evaluasi OSWorld, dan hasil Vision2Web membuat model ini relevan untuk agen GUI. Model ini dapat menjadi lapisan penalaran di balik sistem yang menafsirkan screenshot, mengoperasikan antarmuka mobile, mereproduksi layout aplikasi, atau menggabungkan state visual dengan panggilan tool.
4. Long-Video and Visual Reasoning
Kartu model resmi mencakup contoh input video eksplisit dan panduan prapemrosesan video skala jam. Ini membuat model berguna untuk tanya jawab video, pencarian video panjang, ekstraksi kejadian visual, dan workflow yang menggabungkan pemahaman video dengan tool hilir.
5. Million-Token Research and Repository Workflows
Model terbuka ini native pada 262.144 token dan dapat diperluas hingga 1.000.000 dengan YaRN. Pembedaan ini penting: 1M adalah ekstensi, bukan konteks native model terbuka. Untuk repositori besar atau korpus riset, QSA dimaksudkan untuk membuat biaya pengambilan pada konteks panjang menjadi lebih praktis ketimbang global attention padat.
How Can Developers Run Qwen3.8-Flash-Next?
Pengembang dapat mengunduh open weight dari Hugging Face dan menjalankan model dengan Transformers, vLLM, SGLang atau TokenSpeed. Qwen menyediakan contoh OpenAI-compatible Chat Completions untuk input teks dan multimodal.
Sebagai contoh, kartu model resmi mendemonstrasikan serving Qwen/Qwen3.8-Flash-Next dengan vLLM dan pemanggilannya melalui /v1/chat/completions. Input gambar dan video juga didemonstrasikan melalui antarmuka yang kompatibel dengan OpenAI.
Qwen3.8-Flash-Next beroperasi dalam thinking mode secara default. Pengembang dapat mengontrol perilaku thinking melalui enable_thinking, preserve_thinking dan reasoning_effort; tingkat reasoning-effort yang didokumentasikan adalah xhigh, medium dan low.
What Are the Limitations of Qwen3.8-Flash-Next?
Keterbatasan praktis terbesar adalah biaya perangkat keras. Meskipun hanya 6B parameter model bahasa yang diaktifkan, checkpoint berisi 125B parameter bahasa ditambah komponen embedding n-gram 51B dan parameter MTP 4B. Repositori saat ini sekitar 360 GB, sehingga deployment lokal tetap merupakan tugas infrastruktur yang berat.
Keterbatasan kedua adalah 262K merupakan panjang konteks native, bukan 1M. Model dapat diperluas hingga 1M token, tetapi halaman CometAPI atau model sebaiknya tidak langsung mencantumkan "1M native context." Redaksi yang benar adalah konteks native 262K, dapat diperluas hingga 1M.
Terakhir, performa benchmark tidak seragam. Qwen3.8-Flash-Next sangat kompetitif pada tugas coding dan agenik tetapi tidak memimpin setiap benchmark. Misalnya, Claude Opus 4.6 mencetak 40,0 pada HLE dibanding 35,9 untuk Flash-Next, sementara DeepSeek-V4-Flash-0731 memimpin model yang terdaftar pada NL2Repo-Bench.
Qwen3.8-Flash-Next : What It Signals for Qwen4
Signifikansi yang lebih luas dari rilis ini adalah perannya sebagai pratinjau awal arsitektur yang diperkirakan akan menopang Qwen4. Qwen3.8-Flash-Next menyatukan Qwen Sparse Attention, Gated DeltaNet, koneksi Gated Residual empat-cabang, N-gram Embedding, kumpulan expert MoE ultra-sparse, dan Multi-Token Prediction. Pilihan-pilihan ini menunjukkan bagaimana Qwen mengeksplorasi kapasitas lebih tinggi, konteks lebih panjang, serta performa multimodal dan agen yang lebih kuat tanpa meningkatkan komputasi aktif pada laju yang sama.
Final Verdict
Qwen3.8-Flash-Next penting karena mengubah bentuk masalah efisiensi. Alih-alih memperlakukan semua parameter setara, model ini menggabungkan jalur MoE aktif yang relatif kecil dengan memori bergaya lookup yang sangat besar dan mekanisme pengambilan sparse yang dirancang untuk konteks panjang. Ini memberi Qwen beberapa tuas independen untuk meningkatkan kapasitas tanpa menambah komputasi matriks per token pada laju yang sama.
Bagi pengembang, hal ini menjadikan model sebagai opsi menarik untuk asisten coding volume tinggi, agen konteks panjang, otomasi multimodal, dan eksperimen self-hosted. Bagi roadmap Qwen yang lebih luas, ini bahkan lebih signifikan: Qwen secara eksplisit menggunakan rilis ini untuk mengekspos arah arsitektur yang akan disempurnakan menuju Qwen4.
