TL;DR Il team Qwen di Alibaba ha lanciato ufficialmente Qwen3.8-Max il 3 agosto 2026 — un modello Mixture-of-Experts sparso con 2,4 trilioni di parametri totali (95 miliardi attivi), una finestra di contesto da 1 milione di token e supporto multimodale nativo (testo + immagine + video).
È il primo modello Qwen di classe Max con pesi aperti programmati (previsti per la settimana successiva). Con un prezzo aggressivo di 2 $ per milione di token in input e 6 $ per milione di token in output, offre risultati solidi su task agentici di lungo orizzonte, ingegneria del software autonoma (incluso un progetto documentato di auto‑evoluzione del codice di 16 giorni), riproduzione di ricerche e benchmark multimodali. Compete da vicino con modelli come Kimi K3 e si colloca al di sopra di opzioni più leggere come DeepSeek V4 Flash in termini di capacità, rimanendo al contempo molto più conveniente rispetto ai principali modelli frontier occidentali per carichi di lavoro con molti output. Gli sviluppatori possono accedervi oggi tramite QwenCloud / Alibaba Cloud Model Studio e attraverso piattaforme unificate come CometAPI.
Punti chiave
- Scala ed efficienza: architettura MoE 2,4T totali / 95B attivi costruita sulle fondamenta di Qwen 3.5, che abilita prestazioni di livello frontier a costi di inferenza pratici.
- Forza sul lungo orizzonte: dimostrati coding autonomo multi‑giorno (265 commit, 127 PR in ~16 giorni senza intervento umano), riproduzione e miglioramento di paper di ricerca e operazioni di e‑commerce simulate su un anno.
- Punti salienti dei benchmark: PaperBench 93,0 (al vertice), Terminal Bench 2.1 86,6, punteggi multimodali e su documenti solidi; competitivo ma non dominante su ogni classifica di agenti di puro coding rispetto a Claude Fable 5 o GPT-5.6 Sol.
- Vantaggio di prezzo: tariffa flat 2 $ / 6 $ per 1M token su tutto il contesto da 1M (input in cache ~0,25 $), sotto Kimi K3 sull’output e molti modelli occidentali.
- Disponibilità: Live su QwenCloud e Alibaba Cloud Model Studio (API compatibili con OpenAI e Anthropic); pesi aperti pianificati; già elencato su CometAPI come
qwen3.8-maxper accesso unificato insieme ad altri 500+ modelli. Pesi aperti in arrivo; è prevista anche una variante più piccola Qwen3.8-27B per deployment locali/edge pratici. - Vantaggio pratico: eccelle nella produzione end‑to‑end di deliverable piuttosto che in risposte a singolo turno — ideale per agenti di coding, pipeline di ricerca, flussi d’ufficio e loop agentici sostenuti.
Che cos’è Qwen3.8-Max?
Qwen3.8-Max è l’ultimo e più capace modello flagship della serie Qwen di Alibaba, rilasciato ufficialmente il 3 agosto 2026 (dopo un’anteprima a metà luglio al World AI Conference di Shanghai). Rappresenta un passaggio deliberato verso modelli che possono completare task complessi multi‑giorno end‑to‑end con supervisione minima e produrre deliverable pronti per la messa in produzione.
A livello architetturale è un modello Mixture‑of‑Experts (MoE) sparso che scala a 2,4 trilioni di parametri totali, dei quali solo circa 95 miliardi vengono attivati per token. Questo design, costruito sulla base di Qwen 3.5, bilancia capacità massiva ed efficienza in inferenza. Il modello supporta una finestra di contesto da 1 milione di token (input massimo documentato intorno a 991K token e output massimo intorno a 131K token), input multimodali nativi (testo, immagini e video) e output testuale. Include controlli dello sforzo di ragionamento (xhigh / medium / low) e supporta sia le Chat Completions di OpenAI sia protocolli compatibili con Anthropic, risultando compatibile plug‑and‑play con framework di agenti popolari come Claude Code, Codex, Qoder CLI, Qwen Code e OpenClaw.
Diversamente dai precedenti modelli di classe Max rimasti chiusi, Alibaba si è impegnata a rilasciare i pesi di Qwen3.8-Max (e di una variante più piccola Qwen3.8-27B) la settimana successiva al lancio tramite Hugging Face e ModelScope — la prima volta che un modello Qwen di livello Max sarà disponibile apertamente.
Il modello è posizionato per agenti di coding, lavoro professionale reale (“cowork”), ricerca, pianificazione di lungo orizzonte e loop agentici multimodali. Le demo ufficiali enfatizzano il comportamento auto‑evolutivo: il modello crea issue, se le assegna, scrive e testa codice, itera sui feedback e migliora i propri strumenti per periodi estesi.
Fonti: Official Qwen blog e Alibaba Cloud announcements (agosto 2026); model card di Artificial Analysis; review indipendenti che riassumono il rilascio GA.
Novità in Qwen3.8-Max
Rispetto al suo predecessore Qwen3.7-Max, la generazione 3.8 offre notevoli miglioramenti nel coding agentico, affidabilità sul lungo orizzonte, ragionamento multimodale e prestazioni su documenti/office. Innovazioni chiave:
Autonomia reale sul lungo orizzonte:
Il modello può sostenere apprendimento adattivo a ciclo chiuso su centinaia di turni o più giorni. Esempi documentati includono un progetto di ingegneria software autonomo di 16 giorni che ha prodotto uno strumento CLI auto‑evolutivo (oh-my-cli) con 265 commit, 127 pull request e 151 issue interamente senza intervento umano; la riproduzione e il miglioramento della metodologia di un paper di ricerca (inclusi loop di training su GPU e guadagni misurabili sui benchmark); e un intero anno simulato di operazioni e‑commerce che ha superato significativamente le baseline.
Multimodale come ciclo di feedback continuo:
La visione non è semplicemente una modalità di input. Il modello usa la comprensione visiva per pianificazione, monitoraggio dell’esecuzione e autocorrezione — abilitando task come la ricreazione screenshot‑to‑code, la generazione interattiva di giochi/animazioni e la visualizzazione 2D‑to‑3D.
Il modello si posiziona in alto su Text Arena (quinto riportato) e Vision Arena (secondo riportato) nei dati post‑rilascio iniziali.


Focus sui deliverable end‑to‑end:
Enfasi sulla produzione di output di qualità di produzione attraverso centinaia di professioni, anziché risposte isolate.
Modalità di pensiero e inferenza rapida
Due modalità: thinking mode e fast inference mode. La thinking mode è per ragionamenti più profondi e pianificazione complessa. La fast mode è per risposte a bassa latenza quando il task è semplice. La documentazione di Alibaba Cloud's OpenCode mostra thinking abilitato per le route Qwen3.8 e elenca controlli di ragionamento per la route di anteprima, inclusi xhigh, medium e low.
Questa separazione è preziosa per il design di prodotto. I team non dovrebbero usare la modalità di ragionamento più pesante per ogni richiesta. Un bot di supporto può classificare un ticket semplice a basso costo, riassumere con un modello più veloce ed escalare alla thinking mode di Qwen3.8-Max solo quando l’utente chiede una decisione di policy complicata, un’analisi della causa radice, una revisione contrattuale o un piano di migrazione del codice.
Queste capacità sono state convalidate tramite esperimenti interni di lunga durata e una suite completa di benchmark che copre agenti di coding, agenti generali, ragionamento multimodale, comprensione di documenti e task di percezione/grounding.
Benchmarking: prestazioni di quantizzazione dei dati
Alibaba ha pubblicato una vasta suite di benchmark interni al GA. La verifica indipendente (Artificial Analysis Intelligence Index, LMArena, ecc.) era ancora in corso nei giorni immediatamente successivi al rilascio; i primi dati di Artificial Analysis posizionavano Qwen3.8-Max a un Intelligence Index di 53 (rank ~16/186 nel set tracciato), con elevata verbosità e velocità relativamente inferiore.
Punteggi ufficiali/segnalati selezionati (Qwen3.8-Max vs pari selezionati):
| Benchmark | Qwen3.8-Max | Claude Fable 5 / Opus 4.8 | GPT-5.6 Sol (max) | Qwen3.7-Max |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 86.6 | 84.6 | 88.8 | 74.5 |
| PaperBench | 93.0 | 88.8 / 80.3 | 90.5 | 64.8 |
| SWE-bench Pro | 67.7 | 80.0 / 69.2 | 64.6 | 60.6 |
| FrontierSWE | 73.5 | 88.8 | — | 40.7 |
| DeepSWE 1.1 | 56.6 | 70.0 | 73.0 | 21.6 |
| IFBench | 82.8 | ~63.5 | — | 79.1 |
| GPQA Diamond | 92.6 | 92.6 | 94.1 | 92.4 |
| OmniDocBench 1.5 | 92.1 | — | — | — |
| OSWorld-Verified | 86.1 | — | — | — |
Qwen3.8-Max spesso guida o si posiziona ai vertici nel ragionamento multimodale, nei task documentali/office e in alcune metriche di coding/ricerca agentici, pur restando dietro ai modelli chiusi più forti su alcune suite di agenti di pura ingegneria del software. Il salto generazionale su FrontierSWE e DeepSWE è particolarmente notevole. Considerare i numeri del vendor come direzionali; run indipendenti e valutazioni specifiche per il workload restano essenziali.
Prezzi API di Qwen3.8-Max
Prezzi ufficiali di Alibaba Cloud Model Studio / QwenCloud per Qwen3.8-Max (tariffe GA a inizio agosto 2026):
- Input: 2,00 $ per 1 milione di token
- Output: 6,00 $ per 1 milione di token (include i token di thinking/reasoning)
- Input in cache: circa 0,25 $ per 1 milione di token (risparmi significativi per contesti lunghi ripetuti)
Il pricing è flat sull’intera finestra di contesto da 1M token — un vantaggio notevole rispetto a molti concorrenti che applicano sovrapprezzi per contesti lunghi. Possono applicarsi sconti per batch e altri sconti a seconda della regione di deployment e del piano.
Contesto di confronto (listini approssimativi nello stesso periodo):
- Kimi K3: ~3 $ / 15 $
- Modelli frontier Claude / GPT di fascia alta: spesso 5+ $ / 15–25+ $
- Varianti DeepSeek V4 Flash: sostanzialmente inferiori (spesso sotto 0,50 $ complessivi per molti casi d’uso)
Per i team che già usano più provider, gateway aggregati come CometAPI offrono tipicamente ~20% di sconto rispetto alle tariffe ufficiali, un unico endpoint compatibile con OpenAI, fatturazione unificata e facile switching o failover tra modelli. Questo rende più semplice (e spesso più economico) sperimentare con Qwen3.8-Max (e il confronto simultaneo con DeepSeek V4 Flash, Kimi e altri). Consultare le pagine di pricing di CometAPI e le offerte di crediti gratuiti per le tariffe effettive più recenti.
Come Qwen3.8-Max si confronta con Kimi K3 e DeepSeek V4 Flash
| Dimensione | Qwen3.8-Max | Kimi K3 | DeepSeek V4 Flash |
|---|---|---|---|
| Parametri totali/attivi | 2,4T / ~95B | ~2,8T / ~104B | 284B / 13B |
| Contesto | 1M | 1M | 1M |
| Multimodale | Testo + Immagine + Video | Testo + Immagine + Video | Solo testo |
| Prezzo (in/out) | 2 $ / 6 $ | 3 $ / 15 $ | ~0,14 $ / 0,28 $ (molto più economico) |
| Pesi aperti | Previsti (la prossima settimana) | Già rilasciati | MIT, disponibili |
| Punti di forza | Autonomia sul lungo orizzonte, multimodale, PaperBench, prezzo sull’output | Punteggi indipendenti forti, leadership in frontend coding Arena | Efficienza sui costi estrema, coding agentico solido per la dimensione |
| Posizionamento relativo | Competitivo/leader su diversi benchmark agentici e multimodali | Leggero vantaggio su alcuni indici di intelligenza auditati | Valore eccellente; capacità assoluta inferiore |
Qwen3.8-Max in genere eguaglia o supera Kimi K3 in efficienza sui costi per lavori con molti output e task multimodali, mentre DeepSeek V4 Flash rimane il re del budget per carichi di testo ad alto volume in cui la capacità di picco è secondaria. Molti team useranno tutti e tre tramite un gateway unificato, instradando il traffico semplice ai modelli classe Flash e riservando Qwen3.8-Max o Kimi K3 alle sessioni agent complesse.
Qwen3.8-Max è all’altezza di Kimi K3?
Per certi versi, sì. Eguaglia il livello di contesto da 1M, ha un forte posizionamento multimodale ed è più economico sul pricing ufficiale standard in input/output. Non eguaglia il conteggio di parametri totali da 2,8T di Kimi, e la documentazione pubblica di Kimi attualmente fornisce indicazioni particolarmente dettagliate su tool, caching del contesto, output strutturato e visione.
Qwen3.8-Max è all’altezza di DeepSeek V4 Flash?
Compete sul contesto da 1M e nell’architettura MoE, ma i prodotti sono mirati a lavori diversi. DeepSeek V4 Flash è la rotta economica e veloce. Qwen3.8-Max è la rotta più ampia e ad alta capacità per lavori in cui comprensione multimodale, ragionamento avanzato e produttività enterprise contano più del prezzo token più basso possibile.
Cosa può fare Qwen3.8-Max?
Coding e Ingegneria del Software
Qwen3.8-Max è un candidato forte per sviluppo full‑stack, code review, comprensione di repository, pianificazione di migrazioni, design di API, debugging, ragionamento sui test e architettura software. Il suo lungo contesto aiuta quando il modello deve tenere a vista molti file, log e requisiti. Usarlo per task di codice difficili, non per ogni autocompletamento o semplice spiegazione di lint.
Office e Knowledge Work
Il posizionamento “Cowork” del modello è importante. I dipendenti enterprise non fanno solo domande in chat. Confrontano PDF, riassumono riunioni, rivedono slide, interpretano fogli di calcolo, controllano contratti, scrivono report e preparano decisioni a partire da evidenze disordinate. Il design multimodale e a lungo contesto di Qwen3.8-Max lo rende adatto a flussi d’ufficio in cui testo, documenti, screenshot e dati strutturati devono essere ragionati insieme.
Workflow agentici
Qwen3.8-Max è utile per la pianificazione degli agenti: scomporre un obiettivo in passi, decidere quale tool chiamare, valutare i risultati e rivedere il piano. In CometAPI, questo diventa più pratico perché la stessa applicazione può instradare i passi semplici a modelli più economici e riservare Qwen3.8-Max alla pianificazione o alla verifica.
Primi passi e suggerimenti per l’integrazione con CometAPI
- Accesso diretto: usare QwenCloud o Alibaba Cloud Model Studio con l’ID modello
qwen3.8-max. Sono supportati endpoint compatibili con OpenAI e Anthropic. - Accesso unificato via CometAPI: registrarsi su CometAPI.com, ottenere una API key, impostare
base_urlsuhttps://api.cometapi.com/v1e chiamaremodel="qwen3.8-max". La stessa chiave funziona per DeepSeek V4 Flash, Kimi K3, Claude, GPT e centinaia di altri modelli — ideale per sperimentazione, controllo dei costi e instradamento in produzione. CometAPI enfatizza prezzi competitivi, bassa latenza e rapida aggiunta di nuovi modelli (Qwen3.8-Max è stato elencato poco dopo il lancio). - Framework di agenti: integrare direttamente con Claude Code, OpenClaw o harness personalizzati. Abilitare sforzi di ragionamento più elevati per lavori complessi di lungo orizzonte.
- Pesi aperti: monitorare Hugging Face / ModelScope per il prossimo rilascio se si richiedono deployment on‑premise o fine‑tuning.
