GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
ai-model/Ricerca CometAPI

Che cos'è Qwen3.8-Omni-Flash e come accedervi

Scopri che cos'è Qwen3.8-Omni-Flash, inclusi i suoi agenti audio-video, l'architettura, i benchmark, i prezzi, le limitazioni e l'accesso alle API.

CometAPI
Mia MarenTeam di ricerca su modelli AI e API
Aggiornato Sep 21, 2026 12 min di lettura
Che cos'è Qwen3.8-Omni-Flash e come accedervi
Usa questo schema

Esegui la prima chiamata API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Qwen3.8-Omni-Flash è il modello onnimodale nativo di Alibaba Qwen per la comprensione di testo, immagini, audio e video, con il testo come modalità di output. Annunciato il 18 settembre 2026, combina una finestra di contesto da 1M di token, ragionamento nativo su audio-video, pensiero regolabile, function calling, ricerca sul web, comprensione dell’audio spaziale e uso di strumenti.

Il cambiamento più importante non è semplicemente una migliore comprensione dei video. Qwen descrive il modello come il suo primo modello onnimodale costruito attorno a capacità basate su agenti: può comprendere ciò che vede e sente, pianificare cosa fare dopo, invocare strumenti e lavorare su compiti più lunghi come il montaggio di vlog, la traduzione di video, la produzione di riassunti di film, l’analisi di riunioni e la ricerca multimediale.

Al lancio, Qwen ha riportato un miglioramento medio superiore al 25% su 29 valutazioni rispetto a Qwen3.5-Omni-Plus. Si tratta di risultati di lancio riportati dal fornitore, non di valutazioni indipendenti.

Key Takeaways

  • Input onnimodale nativo: Qwen3.8-Omni-Flash accetta testo, immagini, audio e video, mentre attualmente restituisce testo.
  • Flussi di lavoro media basati su agenti: può combinare comprensione dei media con pianificazione, function calling e ricerca sul web.
  • Lungo contesto e profondità audio: il modello ospitato offre una finestra di contesto da 1M di token e supporta audio multilingue, stereo e ambisonico di primo ordine.
  • Guadagni di benchmark riportati dal fornitore: i maggiori miglioramenti appaiono negli agenti multimodali, nella comprensione di audio lungo, nella diarizzazione dei parlanti e nel grounding audio.
  • Disponibilità ospitata: il modello è disponibile tramite API ospitate; Qwen-MM-Plugins è separatamente open source per flussi di lavoro di agenti multimodali.

Gli sviluppatori possono accedere alla API di Qwen3.8-Omni-Flash in CometAPI tramite un flusso di lavoro API unificato.

What Is Qwen3.8-Omni-Flash?

Qwen3.8-Omni-Flash è il modello onnimodale nativo di nuova generazione di Qwen. Invece di trattare audio o video solo come artefatti di pre-elaborazione, ragiona su testo, fotogrammi visivi, parlato, suoni ambientali e relazioni temporali all’interno di un unico flusso di lavoro. Gli input supportati sono testo, immagini, audio e video; l’output attuale è testo.

Questa distinzione sull’output è importante. La documentazione ufficiale di Alibaba Cloud posiziona Qwen3.8-Omni-Flash per la comprensione multimodale e l’esecuzione di agenti, mentre i casi d’uso con output vocale restano meglio serviti dalle varianti Qwen Omni che supportano esplicitamente la generazione di audio.

L’impostazione del lancio si sposta da “percepire i media” a “comprendere, pianificare, eseguire e consegnare”. Questo rende il modello rilevante per il montaggio video, la ricerca multimediale, l’analisi di riunioni, l’elaborazione di video didattici e altri flussi di lavoro in cui il modello deve fare qualcosa con i media anziché limitarsi a riassumerli.

Qwen3.8-Omni-Flash specifications

La tabella delle specifiche seguente si basa sulle pagine ufficiali del modello su Alibaba Cloud e QwenCloud; limiti e prezzi possono variare per regione e vanno ricontrollati prima della pubblicazione o della messa in produzione.

SpecificaQwen3.8-Omni-Flash — pagina ufficiale del modello
SviluppatoreAlibaba Qwen
Rilascio18 settembre 2026
Tipo di modelloModello onnimodale nativo
Input / outputTesto, immagine, audio, video / testo
Finestra di contesto1.000.000 token
Input massimo991.808 token normale; 983.616 token in modalità di ragionamento
Output massimo131.072 token
Budget di ragionamento maxFino a 262K token su QwenCloud
RagionamentoAbilitato per impostazione predefinita; impegno di ragionamento regolabile
Strumenti e cacheFunction calling, ricerca sul web, cache implicita e cache di sessione
Audio113 lingue e dialetti; stereo e FOA a quattro canali
Stili di APIChat Completions e Responses
Prezzo QwenCloud$0,15 input, $0,47 output e $0,016 input con cache implicita per 1M token
Pesi apertiNon annunciati per questo modello al lancio

How Does Qwen3.8-Omni-Flash Work?

QwenCloud afferma che Qwen3.8-Omni-Flash è costruito sull’architettura Qwen3.8-Flash-Next. Questo fornisce contesto architetturale, ma i conteggi di parametri pubblicati per Flash-Next non devono essere presentati automaticamente come la specifica esatta in termini di parametri del modello Omni a meno che Qwen non confermi tale corrispondenza.

Gated DeltaNet + Qwen Sparse Attention

Il fondamento Flash-Next combina Gated DeltaNet con Qwen Sparse Attention. In termini semplificati, la componente ricorrente comprime le informazioni storiche in uno stato compatto, mentre l’attenzione sparsa recupera selettivamente contesto di lungo raggio invece di applicare attenzione densa a ogni coppia di token. Ciò è particolarmente rilevante per lunghi flussi audio e video, dove la lunghezza della sequenza può dominare il costo computazionale.

Percezione agentica invece di percezione statica

Il cambiamento più grande è a livello di sistema. Qwen afferma che il modello può esplorare attivamente video lunghi e concentrarsi sui momenti rilevanti anziché spendere uguale calcolo in ogni segmento. Concettualmente, l’agente identifica dove è probabile che si trovi l’evidenza, ispeziona più a fondo quei momenti, vi ragiona e quindi decide quale strumento o operazione deve avvenire successivamente.

What Are the Main Qwen3.8-Omni-Flash Features?

Ragionamento nativo su audio-video

Qwen3.8-Omni-Flash ragiona congiuntamente sui flussi visivi e audio di un video. Questo conta quando la risposta dipende da entrambe le modalità: identificare chi ha detto qualcosa, decidere se un suono è avvenuto prima o dopo un’azione, interpretare musica o audio ambientale, o collegare istruzioni pronunciate a ciò che appare sullo schermo.

Comprensione multi-parlante e audio spaziale

L’API supporta audio multicanale, inclusi stereo a due canali e ambisonics di primo ordine a quattro canali. Preservare l’informazione direzionale può aiutare con analisi di riunioni, agenti embodied, eventi registrati, ambienti con più parlanti e grounding audio.

Sforzo di ragionamento regolabile

Il pensiero è abilitato per impostazione predefinita. Gli sviluppatori possono configurare lo sforzo di ragionamento per bilanciare latenza e consumo di token con un ragionamento più profondo per compiti multimediali complessi.

Function calling e ricerca sul web

Function calling e ricerca sul web sono centrali per il posizionamento “basato su agenti”. Dopo aver compreso un file video, un’immagine o un audio, il modello può passare argomenti strutturati a uno strumento esterno, recuperare informazioni aggiuntive o proseguire un flusso di lavoro al di fuori del modello.

Qwen-MM-Plugins

Qwen ha rilasciato anche Qwen-MM-Plugins, un toolkit Apache-2.0 per harness di agenti nativi multimodali. I suoi flussi di lavoro includono produzione video, conversione da video a note, apprendimento di abilità riutilizzabili da video dimostrativi e memoria audiovisiva.

How Good Is Qwen3.8-Omni-Flash on Benchmarks?

Is Qwen3.8-Omni-Flash Still Good at Text and Coding?

I risultati di lancio di Qwen indicano che il modello Omni resta vicino al modello di testo Flash correlato in diverse valutazioni di coding e ragionamento. Qwen riporta 92,6 su LiveCodeBench v6, 63,3 su SWE-bench Pro e 91,0 su GPQA Diamond. Si tratta di risultati riportati dal fornitore nell’assetto di lancio di Qwen e andrebbero convalidati rispetto ai compiti di coding e all’harness dell’agente usati in produzione.

Qwen riporta un miglioramento medio superiore al 25% su 29 valutazioni rispetto a Qwen3.5-Omni-Plus. Le tabelle seguenti riassumono i risultati ufficiali di benchmark del lancio. Sono risultati di prima parte e non erano ancora stati riprodotti indipendentemente al momento della pubblicazione.

Condizioni di valutazione: Le righe statiche misurano una singola esecuzione del modello nell’assetto di lancio di Qwen. Le righe etichettate “+ agent” includono un harness circostante dell’agente, recupero o ispezione iterativa dei media. I materiali ufficiali di lancio dovrebbero essere consultati per i template di prompt, le impostazioni di campionamento, la pre-elaborazione dei media e le versioni degli harness; laddove questi dettagli non siano divulgati, il risultato dovrebbe essere trattato come riportato dal fornitore piuttosto che riproducibile in modo indipendente.

Il significato più ampio è il passaggio dalla comprensione multimodale all’esecuzione multimodale. Le pipeline precedenti spesso trascrivevano l’audio, campionavano fotogrammi video, inviavano questi artefatti a un LLM, producevano una risposta e poi si affidavano a logiche applicative separate per il compito effettivo. Qwen3.8-Omni-Flash è progettato per comprimere una parte maggiore di quel ciclo in un unico sistema di agenti.

Un agente per la produzione media può ispezionare filmati e audio prima di pianificare i montaggi. Un agente per riunioni può combinare l’identità del parlante con il contenuto parlato e i visual della presentazione. Un agente per la ricerca può individuare momenti rilevanti in ore di materiale audiovisivo e poi cercare contesto esterno. In questa impostazione, audio e video diventano contesto operativo per un agente piuttosto che allegati passivi.

Audio-video agents

Benchmark — fonte ufficiale del lancioQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
WildClawBench-MM71,034,558,9
UniClawBench69,667,169,0
AgenticVBench36,814,545,0
OmniGAIA74,078,6
StreamingBench80,857,179,9

Il salto generazionale più ampio è WildClawBench-MM, dove Qwen riporta una crescita da 34,5 a 71,0. Anche AgenticVBench migliora nettamente, mentre Gemini 3.8 Flash resta avanti in quel benchmark. Il modello non “vince tutto” in modo universale.

Audio-video understanding and reasoning

BenchmarkQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
OmniVideoBench63,453,865,2
OmniVideoBench + agente Qwen Code67,865,2
Video-MME-v265,071,0
Video-MME-v2 + agent71,371,0
LVOmniBench63,370,7
LVOmniBench + agent73,670,7
JointAVBench75,970,4

Le righe statiche sono miste. Gemini guida diversi test convenzionali di ragionamento video, ma il risultato di Qwen spesso cresce all’interno di un loop di agente. Questa distinzione conta solo quando l’applicazione in produzione usa recupero, strumenti o ispezione iterativa comparabili.

Audio and multi-speaker understanding

BenchmarkQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
LongAudioSpan82,774,479,3
AliMeeting DER ↓3,488,172,6
AliMeeting cpWER ↓17,289,653,1
FLEURS-ASR WER ↓9,37,27,9
VoiceBench91,692,992,3

Le righe sulle riunioni sono le più rilevanti, mentre FLEURS-ASR e VoiceBench non migliorano rispetto al predecessore. I risultati di lancio quindi indicano una comprensione audio più ricca per scenari multi-parlante, spaziali e a lungo contesto, più che una vittoria uniforme nel riconoscimento vocale.

Qwen3.8-Omni-Flash vs Qwen3.5-Omni-Plus vs Gemini 3.8 Flash

La tabella combina le informazioni ufficiali di prodotto di Qwen con le specifiche ufficiali di Google per Gemini 3.8 Flash. I confronti di benchmark restano eseguiti da Qwen e non dovrebbero essere trattati come classifiche neutrali di terze parti.

DimensioneQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
ArchitetturaFondamento Qwen3.8-Flash-Next; mappatura esatta dei parametri Omni non divulgataGenerazione Omni precedenteArchitettura proprietaria Gemini di Google
Finestra di contesto1M tokenLimiti di distribuzione inferiori1.048.576 token di input
RagionamentoSforzo di ragionamento regolabile; ragionamento attivo di defaultNessuna modalità di ragionamento attiva di default equivalente nel deployment citatoLivelli di ragionamento basso, medio e alto
Input multimodaleTesto, immagine, audio, videoTesto, immagine, audio, videoTesto, immagine, video, audio e PDF
OutputTestoTesto e flussi di lavoro con output vocale supportatoTesto
CodingPunteggi di coding forti riportati dal fornitore; non è il principale differenziatoreNon è il posizionamento principaleProgettato per ingegneria del software a lungo orizzonte e agenti
Disponibilità APIChat Completions e Responses; API ospitataAPI Qwen ospitateGemini API; generalmente disponibile
StrumentiFunction calling e ricerca sul webFunction calling e ricerca sul webFunction calling, search grounding, esecuzione di codice e altri strumenti integrati
Prezzi API pubblicatiQwenCloud: $0,15 input / $0,47 output per 1M tokenDipende da regione ed endpointPrezzo introduttivo di Google: $0,75 input / $3,75 output per 1M token fino al 31 dicembre 2026
Casi d’uso idealiAgenti e analisi dei mediaConversazione Omni e output vocaleAmpi flussi di lavoro multimodali, coding e agenti autonomi

Qwen3.5-Omni-Plus resta rilevante quando è richiesta la generazione di parlato. Qwen3.8-Omni-Flash è più chiaramente ottimizzato per un’efficiente comprensione audio-video e un’esecuzione orientata agli strumenti.

Rispetto a Gemini 3.8 Flash, la valutazione di Qwen è mista: Qwen3.8-Omni-Flash è competitivo in audio, elaborazione multi-parlante, grounding e vari flussi di lavoro con agenti, mentre Gemini guida alcuni test statici di ragionamento video. Il confronto sensato è specifico per il carico di lavoro.

Gli sviluppatori che valutano un accesso unificato possono confrontare la Gemini 3.8 Flash API in CometAPI, la Qwen3.8-Flash API in CometAPI e la Qwen3.8-Flash-Next API in CometAPI al di fuori della tabella, in modo che i link alle fonti tecniche e quelli di accesso ai prodotti rimangano distinti.

Limitations of Qwen3.8-Omni-Flash

  • Output solo testuale: comprende audio e video ma non genera parlato come modalità di risposta.
  • Distribuzione ospitata: i pesi aperti non sono stati annunciati per Qwen3.8-Omni-Flash al lancio.
  • Benchmark recenti: i confronti principali sono primariamente risultati di prima parte e necessitano di replica indipendente.
  • Effetti dell’harness dell’agente: alcuni punteggi includono recupero, ambienti di strumenti o ispezione iterativa e non vanno confusi con il solo modello grezzo.
  • Costo dipendente dal flusso di lavoro: i video lunghi possono risultare ancora costosi se l’applicazione riprocessa ripetutamente segmenti ampi invece di usare recupero, cache o ispezione mirata.

Who Should Use Qwen3.8-Omni-Flash?

Qwen3.8-Omni-Flash è più interessante quando audio o video sono parte del compito stesso piuttosto che un allegato da riassumere. Casi d’uso adatti includono intelligenza per riunioni, ricerca su media di lunga durata, pipeline di traduzione video, flussi di lavoro da tutorial a note, agenti per la produzione media e archivi audiovisivi.

Per la chat testuale convenzionale, un modello di solo testo della famiglia Flash può restare più semplice. Per applicazioni con output vocale, un modello Omni con generazione audio esplicita può essere più adatto. Per flussi di lavoro che combinano vedere, sentire, ragionare e agire, Qwen3.8-Omni-Flash è l’opzione più distintiva nella lineup Qwen.

Conclusion

Qwen3.8-Omni-Flash va inteso come un modello audio-video “basato su agenti”, non semplicemente un’altra release multimodale della linea Flash. Il suo contesto da 1M, il ragionamento nativo su audio-video, le capacità multi-parlante e di audio spaziale, il ragionamento regolabile, il function calling, la ricerca e l’ecosistema Qwen-MM-Plugins mirano alla stessa transizione: consentire a un sistema di IA di passare dalla comprensione dei contenuti multimediali al lavoro concreto con tali contenuti.

I dati di lancio indicano un notevole salto generazionale rispetto a Qwen3.5-Omni-Plus, in particolare nei flussi di lavoro basati su agenti e negli scenari audio complessi. Rispetto a Gemini 3.8 Flash, i numeri di Qwen sono più bilanciati. La domanda importante non è quindi quale modello vince una tabella, ma quale combinazione di modello e harness completa il flusso di lavoro target in modo accurato ed economico.

Continua a imparare

Collega questo articolo alla prossima decisione.

Vedi tutti gli argomenti
Pubblicato il Sep 21, 2026
Ultimo aggiornamento Sep 21, 2026
2 visualizzazioni
Revisionato per chiarezza, attribuzione delle fonti e terminologia API aggiornata.

Pronto a ridurre i costi di sviluppo AI del 20%?

Inizia gratuitamente in pochi minuti. Crediti di prova gratuiti inclusi. Nessuna carta di credito richiesta.

Leggi di più