TL;DR
Qwen3.8-Omni-Flash è il modello onnimodale nativo di Alibaba Qwen per la comprensione di testo, immagini, audio e video, con il testo come modalità di output. Annunciato il 18 settembre 2026, combina una finestra di contesto da 1M di token, ragionamento nativo su audio-video, pensiero regolabile, function calling, ricerca sul web, comprensione dell’audio spaziale e uso di strumenti.
Il cambiamento più importante non è semplicemente una migliore comprensione dei video. Qwen descrive il modello come il suo primo modello onnimodale costruito attorno a capacità basate su agenti: può comprendere ciò che vede e sente, pianificare cosa fare dopo, invocare strumenti e lavorare su compiti più lunghi come il montaggio di vlog, la traduzione di video, la produzione di riassunti di film, l’analisi di riunioni e la ricerca multimediale.
Al lancio, Qwen ha riportato un miglioramento medio superiore al 25% su 29 valutazioni rispetto a Qwen3.5-Omni-Plus. Si tratta di risultati di lancio riportati dal fornitore, non di valutazioni indipendenti.
Key Takeaways
- Input onnimodale nativo: Qwen3.8-Omni-Flash accetta testo, immagini, audio e video, mentre attualmente restituisce testo.
- Flussi di lavoro media basati su agenti: può combinare comprensione dei media con pianificazione, function calling e ricerca sul web.
- Lungo contesto e profondità audio: il modello ospitato offre una finestra di contesto da 1M di token e supporta audio multilingue, stereo e ambisonico di primo ordine.
- Guadagni di benchmark riportati dal fornitore: i maggiori miglioramenti appaiono negli agenti multimodali, nella comprensione di audio lungo, nella diarizzazione dei parlanti e nel grounding audio.
- Disponibilità ospitata: il modello è disponibile tramite API ospitate; Qwen-MM-Plugins è separatamente open source per flussi di lavoro di agenti multimodali.
Gli sviluppatori possono accedere alla API di Qwen3.8-Omni-Flash in CometAPI tramite un flusso di lavoro API unificato.
What Is Qwen3.8-Omni-Flash?
Qwen3.8-Omni-Flash è il modello onnimodale nativo di nuova generazione di Qwen. Invece di trattare audio o video solo come artefatti di pre-elaborazione, ragiona su testo, fotogrammi visivi, parlato, suoni ambientali e relazioni temporali all’interno di un unico flusso di lavoro. Gli input supportati sono testo, immagini, audio e video; l’output attuale è testo.
Questa distinzione sull’output è importante. La documentazione ufficiale di Alibaba Cloud posiziona Qwen3.8-Omni-Flash per la comprensione multimodale e l’esecuzione di agenti, mentre i casi d’uso con output vocale restano meglio serviti dalle varianti Qwen Omni che supportano esplicitamente la generazione di audio.
L’impostazione del lancio si sposta da “percepire i media” a “comprendere, pianificare, eseguire e consegnare”. Questo rende il modello rilevante per il montaggio video, la ricerca multimediale, l’analisi di riunioni, l’elaborazione di video didattici e altri flussi di lavoro in cui il modello deve fare qualcosa con i media anziché limitarsi a riassumerli.
Qwen3.8-Omni-Flash specifications
La tabella delle specifiche seguente si basa sulle pagine ufficiali del modello su Alibaba Cloud e QwenCloud; limiti e prezzi possono variare per regione e vanno ricontrollati prima della pubblicazione o della messa in produzione.
| Specifica | Qwen3.8-Omni-Flash — pagina ufficiale del modello |
|---|---|
| Sviluppatore | Alibaba Qwen |
| Rilascio | 18 settembre 2026 |
| Tipo di modello | Modello onnimodale nativo |
| Input / output | Testo, immagine, audio, video / testo |
| Finestra di contesto | 1.000.000 token |
| Input massimo | 991.808 token normale; 983.616 token in modalità di ragionamento |
| Output massimo | 131.072 token |
| Budget di ragionamento max | Fino a 262K token su QwenCloud |
| Ragionamento | Abilitato per impostazione predefinita; impegno di ragionamento regolabile |
| Strumenti e cache | Function calling, ricerca sul web, cache implicita e cache di sessione |
| Audio | 113 lingue e dialetti; stereo e FOA a quattro canali |
| Stili di API | Chat Completions e Responses |
| Prezzo QwenCloud | $0,15 input, $0,47 output e $0,016 input con cache implicita per 1M token |
| Pesi aperti | Non annunciati per questo modello al lancio |
How Does Qwen3.8-Omni-Flash Work?
QwenCloud afferma che Qwen3.8-Omni-Flash è costruito sull’architettura Qwen3.8-Flash-Next. Questo fornisce contesto architetturale, ma i conteggi di parametri pubblicati per Flash-Next non devono essere presentati automaticamente come la specifica esatta in termini di parametri del modello Omni a meno che Qwen non confermi tale corrispondenza.
Gated DeltaNet + Qwen Sparse Attention
Il fondamento Flash-Next combina Gated DeltaNet con Qwen Sparse Attention. In termini semplificati, la componente ricorrente comprime le informazioni storiche in uno stato compatto, mentre l’attenzione sparsa recupera selettivamente contesto di lungo raggio invece di applicare attenzione densa a ogni coppia di token. Ciò è particolarmente rilevante per lunghi flussi audio e video, dove la lunghezza della sequenza può dominare il costo computazionale.
Percezione agentica invece di percezione statica
Il cambiamento più grande è a livello di sistema. Qwen afferma che il modello può esplorare attivamente video lunghi e concentrarsi sui momenti rilevanti anziché spendere uguale calcolo in ogni segmento. Concettualmente, l’agente identifica dove è probabile che si trovi l’evidenza, ispeziona più a fondo quei momenti, vi ragiona e quindi decide quale strumento o operazione deve avvenire successivamente.
What Are the Main Qwen3.8-Omni-Flash Features?
Ragionamento nativo su audio-video
Qwen3.8-Omni-Flash ragiona congiuntamente sui flussi visivi e audio di un video. Questo conta quando la risposta dipende da entrambe le modalità: identificare chi ha detto qualcosa, decidere se un suono è avvenuto prima o dopo un’azione, interpretare musica o audio ambientale, o collegare istruzioni pronunciate a ciò che appare sullo schermo.
Comprensione multi-parlante e audio spaziale
L’API supporta audio multicanale, inclusi stereo a due canali e ambisonics di primo ordine a quattro canali. Preservare l’informazione direzionale può aiutare con analisi di riunioni, agenti embodied, eventi registrati, ambienti con più parlanti e grounding audio.
Sforzo di ragionamento regolabile
Il pensiero è abilitato per impostazione predefinita. Gli sviluppatori possono configurare lo sforzo di ragionamento per bilanciare latenza e consumo di token con un ragionamento più profondo per compiti multimediali complessi.
Function calling e ricerca sul web
Function calling e ricerca sul web sono centrali per il posizionamento “basato su agenti”. Dopo aver compreso un file video, un’immagine o un audio, il modello può passare argomenti strutturati a uno strumento esterno, recuperare informazioni aggiuntive o proseguire un flusso di lavoro al di fuori del modello.
Qwen-MM-Plugins
Qwen ha rilasciato anche Qwen-MM-Plugins, un toolkit Apache-2.0 per harness di agenti nativi multimodali. I suoi flussi di lavoro includono produzione video, conversione da video a note, apprendimento di abilità riutilizzabili da video dimostrativi e memoria audiovisiva.
How Good Is Qwen3.8-Omni-Flash on Benchmarks?
Is Qwen3.8-Omni-Flash Still Good at Text and Coding?
I risultati di lancio di Qwen indicano che il modello Omni resta vicino al modello di testo Flash correlato in diverse valutazioni di coding e ragionamento. Qwen riporta 92,6 su LiveCodeBench v6, 63,3 su SWE-bench Pro e 91,0 su GPQA Diamond. Si tratta di risultati riportati dal fornitore nell’assetto di lancio di Qwen e andrebbero convalidati rispetto ai compiti di coding e all’harness dell’agente usati in produzione.
Qwen riporta un miglioramento medio superiore al 25% su 29 valutazioni rispetto a Qwen3.5-Omni-Plus. Le tabelle seguenti riassumono i risultati ufficiali di benchmark del lancio. Sono risultati di prima parte e non erano ancora stati riprodotti indipendentemente al momento della pubblicazione.
Condizioni di valutazione: Le righe statiche misurano una singola esecuzione del modello nell’assetto di lancio di Qwen. Le righe etichettate “+ agent” includono un harness circostante dell’agente, recupero o ispezione iterativa dei media. I materiali ufficiali di lancio dovrebbero essere consultati per i template di prompt, le impostazioni di campionamento, la pre-elaborazione dei media e le versioni degli harness; laddove questi dettagli non siano divulgati, il risultato dovrebbe essere trattato come riportato dal fornitore piuttosto che riproducibile in modo indipendente.
Il significato più ampio è il passaggio dalla comprensione multimodale all’esecuzione multimodale. Le pipeline precedenti spesso trascrivevano l’audio, campionavano fotogrammi video, inviavano questi artefatti a un LLM, producevano una risposta e poi si affidavano a logiche applicative separate per il compito effettivo. Qwen3.8-Omni-Flash è progettato per comprimere una parte maggiore di quel ciclo in un unico sistema di agenti.
Un agente per la produzione media può ispezionare filmati e audio prima di pianificare i montaggi. Un agente per riunioni può combinare l’identità del parlante con il contenuto parlato e i visual della presentazione. Un agente per la ricerca può individuare momenti rilevanti in ore di materiale audiovisivo e poi cercare contesto esterno. In questa impostazione, audio e video diventano contesto operativo per un agente piuttosto che allegati passivi.
Audio-video agents
| Benchmark — fonte ufficiale del lancio | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| WildClawBench-MM | 71,0 | 34,5 | 58,9 |
| UniClawBench | 69,6 | 67,1 | 69,0 |
| AgenticVBench | 36,8 | 14,5 | 45,0 |
| OmniGAIA | 74,0 | — | 78,6 |
| StreamingBench | 80,8 | 57,1 | 79,9 |
Il salto generazionale più ampio è WildClawBench-MM, dove Qwen riporta una crescita da 34,5 a 71,0. Anche AgenticVBench migliora nettamente, mentre Gemini 3.8 Flash resta avanti in quel benchmark. Il modello non “vince tutto” in modo universale.
Audio-video understanding and reasoning
| Benchmark | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| OmniVideoBench | 63,4 | 53,8 | 65,2 |
| OmniVideoBench + agente Qwen Code | 67,8 | — | 65,2 |
| Video-MME-v2 | 65,0 | — | 71,0 |
| Video-MME-v2 + agent | 71,3 | — | 71,0 |
| LVOmniBench | 63,3 | — | 70,7 |
| LVOmniBench + agent | 73,6 | — | 70,7 |
| JointAVBench | 75,9 | — | 70,4 |
Le righe statiche sono miste. Gemini guida diversi test convenzionali di ragionamento video, ma il risultato di Qwen spesso cresce all’interno di un loop di agente. Questa distinzione conta solo quando l’applicazione in produzione usa recupero, strumenti o ispezione iterativa comparabili.
Audio and multi-speaker understanding
| Benchmark | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| LongAudioSpan | 82,7 | 74,4 | 79,3 |
| AliMeeting DER ↓ | 3,4 | 88,1 | 72,6 |
| AliMeeting cpWER ↓ | 17,2 | 89,6 | 53,1 |
| FLEURS-ASR WER ↓ | 9,3 | 7,2 | 7,9 |
| VoiceBench | 91,6 | 92,9 | 92,3 |
Le righe sulle riunioni sono le più rilevanti, mentre FLEURS-ASR e VoiceBench non migliorano rispetto al predecessore. I risultati di lancio quindi indicano una comprensione audio più ricca per scenari multi-parlante, spaziali e a lungo contesto, più che una vittoria uniforme nel riconoscimento vocale.
Qwen3.8-Omni-Flash vs Qwen3.5-Omni-Plus vs Gemini 3.8 Flash
La tabella combina le informazioni ufficiali di prodotto di Qwen con le specifiche ufficiali di Google per Gemini 3.8 Flash. I confronti di benchmark restano eseguiti da Qwen e non dovrebbero essere trattati come classifiche neutrali di terze parti.
| Dimensione | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| Architettura | Fondamento Qwen3.8-Flash-Next; mappatura esatta dei parametri Omni non divulgata | Generazione Omni precedente | Architettura proprietaria Gemini di Google |
| Finestra di contesto | 1M token | Limiti di distribuzione inferiori | 1.048.576 token di input |
| Ragionamento | Sforzo di ragionamento regolabile; ragionamento attivo di default | Nessuna modalità di ragionamento attiva di default equivalente nel deployment citato | Livelli di ragionamento basso, medio e alto |
| Input multimodale | Testo, immagine, audio, video | Testo, immagine, audio, video | Testo, immagine, video, audio e PDF |
| Output | Testo | Testo e flussi di lavoro con output vocale supportato | Testo |
| Coding | Punteggi di coding forti riportati dal fornitore; non è il principale differenziatore | Non è il posizionamento principale | Progettato per ingegneria del software a lungo orizzonte e agenti |
| Disponibilità API | Chat Completions e Responses; API ospitata | API Qwen ospitate | Gemini API; generalmente disponibile |
| Strumenti | Function calling e ricerca sul web | Function calling e ricerca sul web | Function calling, search grounding, esecuzione di codice e altri strumenti integrati |
| Prezzi API pubblicati | QwenCloud: $0,15 input / $0,47 output per 1M token | Dipende da regione ed endpoint | Prezzo introduttivo di Google: $0,75 input / $3,75 output per 1M token fino al 31 dicembre 2026 |
| Casi d’uso ideali | Agenti e analisi dei media | Conversazione Omni e output vocale | Ampi flussi di lavoro multimodali, coding e agenti autonomi |
Qwen3.5-Omni-Plus resta rilevante quando è richiesta la generazione di parlato. Qwen3.8-Omni-Flash è più chiaramente ottimizzato per un’efficiente comprensione audio-video e un’esecuzione orientata agli strumenti.
Rispetto a Gemini 3.8 Flash, la valutazione di Qwen è mista: Qwen3.8-Omni-Flash è competitivo in audio, elaborazione multi-parlante, grounding e vari flussi di lavoro con agenti, mentre Gemini guida alcuni test statici di ragionamento video. Il confronto sensato è specifico per il carico di lavoro.
Gli sviluppatori che valutano un accesso unificato possono confrontare la Gemini 3.8 Flash API in CometAPI, la Qwen3.8-Flash API in CometAPI e la Qwen3.8-Flash-Next API in CometAPI al di fuori della tabella, in modo che i link alle fonti tecniche e quelli di accesso ai prodotti rimangano distinti.
Limitations of Qwen3.8-Omni-Flash
- Output solo testuale: comprende audio e video ma non genera parlato come modalità di risposta.
- Distribuzione ospitata: i pesi aperti non sono stati annunciati per Qwen3.8-Omni-Flash al lancio.
- Benchmark recenti: i confronti principali sono primariamente risultati di prima parte e necessitano di replica indipendente.
- Effetti dell’harness dell’agente: alcuni punteggi includono recupero, ambienti di strumenti o ispezione iterativa e non vanno confusi con il solo modello grezzo.
- Costo dipendente dal flusso di lavoro: i video lunghi possono risultare ancora costosi se l’applicazione riprocessa ripetutamente segmenti ampi invece di usare recupero, cache o ispezione mirata.
Who Should Use Qwen3.8-Omni-Flash?
Qwen3.8-Omni-Flash è più interessante quando audio o video sono parte del compito stesso piuttosto che un allegato da riassumere. Casi d’uso adatti includono intelligenza per riunioni, ricerca su media di lunga durata, pipeline di traduzione video, flussi di lavoro da tutorial a note, agenti per la produzione media e archivi audiovisivi.
Per la chat testuale convenzionale, un modello di solo testo della famiglia Flash può restare più semplice. Per applicazioni con output vocale, un modello Omni con generazione audio esplicita può essere più adatto. Per flussi di lavoro che combinano vedere, sentire, ragionare e agire, Qwen3.8-Omni-Flash è l’opzione più distintiva nella lineup Qwen.
Conclusion
Qwen3.8-Omni-Flash va inteso come un modello audio-video “basato su agenti”, non semplicemente un’altra release multimodale della linea Flash. Il suo contesto da 1M, il ragionamento nativo su audio-video, le capacità multi-parlante e di audio spaziale, il ragionamento regolabile, il function calling, la ricerca e l’ecosistema Qwen-MM-Plugins mirano alla stessa transizione: consentire a un sistema di IA di passare dalla comprensione dei contenuti multimediali al lavoro concreto con tali contenuti.
I dati di lancio indicano un notevole salto generazionale rispetto a Qwen3.5-Omni-Plus, in particolare nei flussi di lavoro basati su agenti e negli scenari audio complessi. Rispetto a Gemini 3.8 Flash, i numeri di Qwen sono più bilanciati. La domanda importante non è quindi quale modello vince una tabella, ma quale combinazione di modello e harness completa il flusso di lavoro target in modo accurato ed economico.
