Specifiche tecniche di Qwen3.8-Flash-Next
| Specifica | Qwen3.8-Flash-Next |
|---|---|
| Sviluppatore | Qwen Team, Alibaba Group |
| Tipo di modello | Modello linguistico causale multimodale con encoder di visione; MoE ultra-sparso |
| Parametri del modello principale | 125B |
| Parametri attivati | 6B per token |
| Parametri di embedding N-gram | 51B aggiuntivi |
| Parametri MTP | 4B |
| Livelli | 48 |
| Pattern di attenzione ibrida | 12 x [3 livelli Gated DeltaNet + 1 livello Qwen Sparse Attention] |
| Esperti MoE | 512 in totale; 10 instradati + 1 condiviso per token |
| Residuo con gate | 4 rami; rank del bottleneck 320 |
| Finestra di contesto nativa | 262,144 token |
| Contesto esteso | Fino a 1,000,000 token con YaRN |
| Modalità | Input di testo, immagine, video; output di testo |
| Controlli di pensiero | Controlli pensiero/non-pensiero e dello sforzo di ragionamento nelle API supportate |
| Distribuzione | Transformers, vLLM, SGLang, TokenSpeed e altri framework supportati |
| Pesi aperti | Sì |
| ID modello CometAPI | qwen3.8-flash-next |
Che cos'è Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next è un prossimo modello MoE multimodale a pesi aperti del team Qwen di Alibaba. Più importante, è presentato come una anteprima iniziale dell’architettura destinata a alimentare la futura famiglia di modelli Qwen4, invece di essere semplicemente un altro checkpoint incrementale di Qwen3.8.
Qwen utilizza questa release per esporre al sistema open-source la sua direzione architetturale di nuova generazione prima dell’arrivo della più ampia famiglia Qwen4. Questo offre agli sviluppatori di motori di inferenza, ai progetti di quantizzazione, ai framework di serving dei modelli e agli sviluppatori di applicazioni l’opportunità di prepararsi in anticipo ai cambiamenti architetturali.
L’architettura attualmente divulgata introduce due componenti importanti: una architettura ibrida basata su GDN e la Qwen Sparse Attention (QSA). GDN si riferisce a un approccio di attenzione lineare in stile DeltaNet con gate che segue la direzione dell’attenzione ibrida precedentemente esplorata in Qwen3-Next. QSA è presentata come un nuovo meccanismo di attenzione sparsa, sebbene la sua specifica tecnica completa non sia ancora stata documentata pubblicamente.
Caratteristiche principali di Qwen3.8-Flash-Next
- Anteprima dell’architettura Qwen4: Qwen3.8-Flash-Next è esplicitamente posizionato come una implementazione precoce della direzione architetturale che alimenterà la prossima famiglia Qwen4.
- Design MoE multimodale: Il modello è descritto come un modello Mixture-of-Experts multimodale, estendendo la strategia di modello sparso efficiente di Qwen verso una nuova generazione di architettura.
- Architettura ibrida GDN: Il modello prosegue la direzione di ricerca sull’attenzione ibrida introdotta con Qwen3-Next, combinando meccanismi di attenzione lineare efficienti con attenzione convenzionale laddove è importante un recupero preciso. Qwen3-Next ha dimostrato che questo approccio può migliorare sostanzialmente l’efficienza di inferenza su contesti lunghi.
- Qwen Sparse Attention: QSA è uno dei due cambiamenti architetturali evidenziati pubblicamente per Flash-Next. La sua implementazione dettagliata e i benefici quantitativi restano da documentare da parte di Qwen.
- Orientamento all’ecosistema open-weight: La release è pensata per dare alla comunità open-source accesso anticipato ai cambiamenti architetturali affinché i runtime di inferenza e gli strumenti a valle possano adattarsi prima dell’arrivo di Qwen4.
- Prestazioni di coding e agent di Qwen3.8-Flash-Next
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
Qwen3.8-Flash-Next vs Qwen3.8-Max vs Qwen3.8-27B
| Modello | Posizionamento | Architettura / scala | Multimodale | Stato attuale |
|---|---|---|---|---|
| Qwen3.8-Flash-Next | Anteprima dell’architettura Qwen4 / modello open orientato all’efficienza | MoE multimodale; specifiche complete in attesa | Sì | In arrivo |
| Qwen3.8-Max | Modello Qwen3.8 di punta ospitato | MoE su larga scala | Sì | Disponibile |
| Qwen3.8-27B | Modello Qwen3.8 open-weight | Modello denso da 27B | Capacità specifiche del modello | Disponibile |
Qwen3.8-Max è già disponibile nell’ecosistema cloud di Alibaba ed è posizionato per carichi di lavoro di ragionamento avanzato, comprensione visiva, coding e agent. La documentazione attuale di Qwen elenca Qwen3.8-Max con una finestra di contesto da 1M token, mentre CometAPI espone già qwen3.8-max.
Flash-Next dovrebbe pertanto essere visto in modo diverso: il suo significato principale in questa fase è architetturale piuttosto che basato sui benchmark. Anticipa la direzione tecnica di Qwen4 e offre all’ecosistema open-source un obiettivo anticipato per l’ottimizzazione dei runtime e della distribuzione.