Prezzi API Qwen 3.8 Max: $2 input, $6 output, contesto da 1M
TL;DR
Qwen 3.8 Max costa $2 per 1 milione di token in input e $6 per 1 milione di token in output su QwenCloud. Le tariffe di cache specifiche del modello sono $0.25/M per input nella cache implicita, $2.50/M per la creazione esplicita della cache e $0.17/M per le letture esplicite della cache.
Le stesse tariffe standard per token si applicano allโintera finestra di contesto da 1M di token supportata dal modello. I prompt piรน grandi costano di piรน perchรฉ contengono piรน token, non perchรฉ entrano in un livello di prezzo per contesto lungo.
Al prezzo di listino, Qwen 3.8 Max รจ piรน economico del 20% rispetto a Qwen 3.7 Max. Tuttavia, Qwen 3.7 Max รจ piรน economico finchรฉ rimane attiva la promozione attuale del 50%. La scelta migliore per la produzione dipende dal costo per attivitร accettata, includendo ragionamento, hit di cache, strumenti, retry, latenza e revisione umana.
Prezzi API Qwen 3.8 Max a colpo dโocchio
| Voce | Valore ufficiale attuale |
|---|---|
| ID modello in produzione | qwen3.8-max |
| Data di rilascio ufficiale | August 3, 2026 |
| Architettura | 2.4T parametri totali; 95B parametri attivi |
| Prezzo standard input | $2 / 1M token |
| Prezzo standard output | $6 / 1M token |
| Input in cache implicita | $0.25 / 1M token |
| Creazione cache esplicita | $2.50 / 1M token |
| Lettura cache esplicita | $0.17 / 1M token |
| Finestra di contesto | 1M token |
| Input massimo | 991K senza ragionamento; 983K con ragionamento |
| Output massimo | 131K |
| Ragionamento massimo | 262K |
| Modalitร di input | Testo, immagine e video |
| Modalitร di output | Testo |
| Limiti di riferimento QwenCloud | 2M TPM e 15K RPM |
La pagina del modello su QwenCloud รจ la fonte piรน diretta per lโID del modello corrente, i prezzi, le tariffe della cache, i limiti di contesto e le modalitร . Quote specifiche per account e area geografica possono variare, quindi usa i limiti mostrati nella tua console quando imposti la concorrenza in produzione.
Il rilascio in produzione sostituisce anche lโidentificatore di anteprima con qwen3.8-max e aggiunge un listino prezzi specifico del modello completo. I materiali di lancio di Qwen descrivono impostazioni di sforzo di ragionamento low, medium e xhigh, ma il comportamento in produzione va verificato rispetto allโendpoint e alla documentazione API effettivamente utilizzati.
Nota sensibile al tempo: Qwen ha annunciato che i pesi open seguiranno il rilascio dellโAPI. A partire dal 4 agosto 2026, non descrivere Qwen 3.8 Max come scaricabile o self-hostable finchรฉ non vengono pubblicati un checkpoint ufficiale e la relativa licenza.
Come funzionano i prezzi di Qwen 3.8 Max
QwenCloud attualmente indica una tariffa standard flat di $2 per 1M token in input e $6 per 1M token in output su tutta la finestra di contesto da 1M di token supportata da Qwen 3.8 Max. Lโistantanea dei prezzi ufficiali di seguito รจ stata catturata il 4 agosto 2026; verifica sempre la pagina del modello aggiornata prima di prendere decisioni di budget per la produzione.

Fonte***:*** QwenCloud, โQwen3.8-Maxโ ufficiale
| Voce di fatturazione | Prezzo per 1M token | Quando si applica |
|---|---|---|
| Input standard | $2.00 | Nuovi contenuti del prompt, definizioni strumenti e contesto non in cache |
| Output standard | $6.00 | Output generato e utilizzo di ragionamento fatturato |
| Hit cache implicita | $0.25 | Prefissi di prompt riutilizzati automaticamente; gli hit non sono garantiti |
| Creazione cache esplicita | $2.50 | Creazione di un prefisso di prompt riutilizzabile marcato |
| Lettura cache esplicita | $0.17 | Riutilizzo di un blocco di cache esplicita valido |
Una richiesta da 900K token costa quindi piรน di una da 100K token perchรฉ elabora nove volte piรน token in input, non perchรฉ attraversa un livello di prezzo unitario piรน alto.
Il ragionamento puรฒ aumentare il costo dellโoutput
Una risposta visibile breve non รจ sempre una risposta a basso costo. Le chiamate con ragionamento abilitato possono generare token di ragionamento aggiuntivi, quindi le stime di produzione dovrebbero usare i campi di utilizzo restituiti dallโAPI anzichรฉ la lunghezza visibile della risposta.
Dove il tuo endpoint supporta controlli di ragionamento per qwen3.8-max, confronta le impostazioni disponibili sullo stesso set di valutazione. Non dare per scontato che i default dellโanteprima si trasferiscano al modello GA.
I risparmi della cache dipendono dalla stabilitร del prompt
La pagina del modello Qwen 3.8 Max pubblica tariffe di cache specifiche del modello. Usa quelle tariffe, non rapporti di cache generici, quando stimi la spesa.
Le voci di cache esplicite hanno un periodo di validitร di cinque minuti e un hit riuscito reimposta tale periodo. La cache implicita รจ automatica, ma un hit non รจ garantito. Il caching รจ piรน utile quando prompt di sistema, definizioni degli strumenti, contesto del repository o documenti di grandi dimensioni rimangono stabili tra chiamate frequenti.
Gli strumenti integrati comportano addebiti separati
QwenCloud attualmente elenca le seguenti tariffe per gli strumenti in aggiunta allโuso dei token:
| Strumento integrato | Tariffa attuale |
|---|---|
| Web Search | $10 / 1K chiamate |
| Image Search | $8 / 1K chiamate |
| Web Extractor | Gratis per un periodo limitato |
| Code Interpreter | Gratis per un periodo limitato |
La function calling e lโMCP non hanno tariffe separati per gli strumenti, ma le descrizioni degli strumenti contano comunque come token di input. Le promozioni gratuite sugli strumenti possono cambiare, quindi controlla la guida ai prezzi di QwenCloud prima di finalizzare un budget di produzione.
Ad esempio, una richiesta con 20K token in input, 2K token in output e due chiamate a Web Search costa approssimativamente:
Input: 20,000 / 1,000,000 ร $2 = $0.040
Output: 2,000 / 1,000,000 ร $6 = $0.012
Web Search: 2 / 1,000 ร $10 = $0.020
Total: $0.072
In questo esempio, le due chiamate di ricerca rappresentano circa il 27,8% del costo totale della richiesta.
Esempi reali di costo di Qwen 3.8 Max
Questi esempi usano le tariffe specifiche del modello attuali su QwenCloud. Escludono tasse, retry, fallback e ricarichi specifici del fornitore.
Esempio 1: Richiesta agente media
Assume 50K input tokens and 5K output tokens:
Input: 50,000 / 1,000,000 ร $2 = $0.10
Output: 5,000 / 1,000,000 ร $6 = $0.03
Total: $0.13
Un primo tentativo riuscito costa circa $0.13. Un retry completo raddoppierebbe il costo del modello a circa $0.26.
Esempio 2: Analisi di documento lungo
Assume 800K input tokens and 20K output tokens:
Input: 800,000 / 1,000,000 ร $2 = $1.60
Output: 20,000 / 1,000,000 ร $6 = $0.12
Total: $1.72
Il modello non applica un sovrapprezzo separato per contesto lungo nel listino attuale, ma i prompt grandi generano comunque un costo assoluto significativo.
Esempio 3: Sessione di agente con cache
Si assume un prefisso riutilizzabile da 100K token, 10K nuovi token in input, 5K token in output e 50 chiamate mentre la cache esplicita rimane valida:
First call:
100K cache creation ร $2.50/M = $0.250
10K new input ร $2/M = $0.020
5K output ร $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read ร $0.17/M = $0.017
10K new input ร $2/M = $0.020
5K output ร $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
Risparmio stimato = $8.917, ovvero il 71,3%
Il risparmio stimato dipende da hit di cache riusciti e da un prefisso stabile. Intervalli lunghi o cambi frequenti ai prompt di sistema e agli schemi degli strumenti ridurranno il beneficio.
Qwen 3.8 Max vs Qwen 3.7 Max๏ผConfronto prezzi
Qwen 3.8 Max รจ piรน economico del 20% rispetto a Qwen 3.7 Max al prezzo di listino, ma Qwen 3.7 Max รจ piรน economico del 37,5% mentre รจ attiva la promozione del 50% attuale.
| Modello e stato di prezzo | Input / 1M | Output / 1M | Contesto |
|---|---|---|---|
| qwen3.8-max prezzo standard | $2.00 | $6.00 | 1M |
| qwen3.7-max prezzo di listino | $2.50 | $7.50 | 1M |
| qwen3.7-max promozione attuale | $1.25 | $3.75 | 1M |
Tieni a portata di mano la pagina del modello Qwen3.7 Max su CometAPI come fallback mentre testi il nuovo modello.
Il prezzo per token รจ solo una parte della decisione. Qwen 3.8 Max puรฒ comunque essere piรน economico se migliora il successo al primo tentativo, usa gli strumenti in modo piรน affidabile, riduce i retry o richiede meno correzioni umane.
Usa questa metrica di produzione:
Costo per attivitร accettata =
(token del modello + chiamate agli strumenti + retry + spesa di fallback + costo di revisione)
รท output accettati
I miglioramenti di benchmark riportati dal fornitore sono un motivo per ritestare workflow di coding e professionali impegnativi, non la prova che ogni carico di lavoro di Qwen 3.7 debba migrare.
Come migrare a Qwen 3.8 Max
Cambiare la stringa del modello รจ necessario, ma non sufficiente per una migrazione completa in produzione.
1. Testare lโID del modello in produzione
Sostituisci lโidentificatore di anteprima con qwen3.8-max in un ambiente di test. Non dare per scontato che alias, default, latenza o comportamento di risposta dellโanteprima rimangano invariati.
Una richiesta minima compatibile con OpenAI puรฒ essere simile a questa:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
Inizia con la richiesta minima documentata. Aggiungi i controlli di ragionamento solo quando la documentazione API corrente per il tuo endpoint li supporta esplicitamente.
2. Ricalibrare telemetria di costo e performance
Registra almeno:
- token di input, output e ragionamento
- hit di cache e token di creazione della cache
- tempo al primo token e latenza totale
- chiamate agli strumenti, retry e fallback
- output accettati vs rifiutati
- tempo di correzione umana
3. Ritestare lโinterfaccia usata dalla tua applicazione
Valida eventi in streaming, payload multimodali, schemi degli strumenti, output strutturato, ragioni di terminazione, campi di utilizzo, gestione degli errori e comportamento multi-turno. La pagina del modello in produzione documenta lโaccesso DashScope e compatibile OpenAI; verifica qualsiasi ulteriore livello di compatibilitร prima di farvi affidamento.
4. Rispettare i limiti pratici del contesto
Una finestra di contesto da 1M non equivale a un prompt utente da 1M token. QwenCloud indica un input massimo di 991K senza ragionamento e 983K con ragionamento. Aggiungi un margine di sicurezza affinchรฉ la richiesta abbia ancora spazio per output e ragionamento.
5. Eseguire Qwen 3.7 e Qwen 3.8 in parallelo
Usa prompt, strumenti, validatori, regole di retry e dataset identici. Confronta il costo per attivitร accettata e la latenza invece di giudicare risposte isolate โa occhioโ.
Come valutare e instradare Qwen 3.8 Max
Usa carichi di lavoro reali anzichรฉ medie generiche di benchmark.
| Carico di lavoro | Attivitร suggerite | Segnale principale di accettazione |
|---|---|---|
| Sviluppo su repository | 4 | I test passano senza correzioni manuali |
| Analisi di documenti lunghi | 3 | Le affermazioni sono supportate da prove fornite |
| Analisi multimodale | 2 | Dettagli rilevanti di immagini o video usati correttamente |
| Agenti che usano strumenti | 3 | Scelta corretta dello strumento e argomenti validi |
A practical routing policy is:
Simple, latency-sensitive task
โ Lower-cost Plus model
Existing workload that already meets quality targets
โ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
โ Qwen 3.8 Max
Failed validation
โ One controlled retry, then a tested fallback
Usa Qwen 3.8 Max per lavori difficili su repository, agenti di lungo orizzonte, analisi multimodale e workflow in cui Qwen 3.7 fallisce i test di accettazione. Mantieni Qwen 3.7 Max quando la promozione riduce materialmente i costi e il modello esistente soddisfa giร il tuo obiettivo di qualitร .
Controlla la pagina dei prezzi di CometAPI e le informazioni di instradamento live prima di fissare le soglie, perchรฉ disponibilitร del fornitore e prezzi instradati possono cambiare indipendentemente dal listino diretto di QwenCloud. Il CometAPI Cookbook puรฒ aiutarti a costruire richieste ripetibili e un framework di valutazione coerente.
FAQ
Quanto costa lโAPI di Qwen 3.8 Max?
QwenCloud attualmente indica Qwen 3.8 Max a $2 per 1 milione di token in input e $6 per 1 milione di token in output. Lโuso della cache e gli strumenti integrati hanno tariffe separate.
Qwen 3.8 Max costa di piรน oltre 128K token?
Nessun livello separato per contesto lungo รจ mostrato nel listino prezzi specifico del modello corrente. Le richieste lunghe costano di piรน perchรฉ contengono piรน token, non perchรฉ attraversano un livello di prezzo unitario piรน alto.
I token di ragionamento di Qwen 3.8 Max sono fatturati?
Il ragionamento puรฒ aumentare lโutilizzo generato e il costo totale. Usa i campi di token di ragionamento e di output restituiti dallโendpoint invece di stimare dalla risposta visibile.
Qwen 3.8 Max รจ open source?
Qwen ha annunciato che i pesi open seguiranno il rilascio dellโAPI. Non descrivere il modello come scaricabile o self-hostable finchรฉ non sono disponibili un checkpoint ufficiale e la licenza.
Gli utenti di Qwen 3.7 Max dovrebbero migrare immediatamente?
Non automaticamente. Qwen 3.8 Max ha un prezzo di listino standard piรน basso, mentre Qwen 3.7 Max รจ piรน economico durante la promozione attuale. Migra quando i tuoi dati su qualitร , latenza, comportamento della cache e costo per attivitร accettata supportano il cambiamento.
Prova Qwen 3.8 Max con CometAPI
Usa il CometAPI Quickstart per configurare un client compatibile con OpenAI. Prima di inviare traffico di produzione, conferma che qwen3.8-max sia attivo nel tuo account e verifica il prezzo instradato visualizzato lรฌ.
Confrontalo con la tua baseline di Qwen 3.7 usando prompt, validator, policy di retry e telemetria identici. Questo mantiene la valutazione focalizzata sul modello piuttosto che su cambiamenti nel framework di test.
