TL;DR Qwen 3.8 Max costa $2 per 1 milione di token di input e $6 per 1 milione di token di output su QwenCloud. Le tariffe di cache specifiche del modello sono $0,25/M per input memorizzato in cache in modo implicito, $2,50/M per la creazione esplicita della cache e $0,17/M per le letture esplicite della cache.
Le stesse tariffe standard per token si applicano allโintera finestra di contesto supportata da 1M token del modello. I prompt piรน grandi costano di piรน perchรฉ contengono piรน token, non perchรฉ entrano in un livello di prezzo superiore per il contesto lungo.
A prezzo di listino, Qwen 3.8 Max รจ piรน economico del 20% rispetto a Qwen 3.7 Max. Tuttavia, Qwen 3.7 Max รจ piรน economico finchรฉ rimane attiva lโattuale promozione del 50%. La scelta migliore in produzione dipende dal costo per attivitร accettata, inclusi ragionamento, hit della cache, strumenti, retry, latenza e revisione umana.
Prezzi API di Qwen 3.8 Max a colpo dโocchio
| Item | Current official value |
|---|---|
| Production model ID | qwen3.8-max |
| Official release date | August 3, 2026 |
| Architecture | 2.4T total parameters; 95B active parameters |
| Standard input price | $2 / 1M tokens |
| Standard output price | $6 / 1M tokens |
| Implicit cached input | $0.25 / 1M tokens |
| Explicit cache creation | $2.50 / 1M tokens |
| Explicit cache read | $0.17 / 1M tokens |
| Context window | 1M tokens |
| Maximum input | 991K without thinking; 983K with thinking |
| Maximum output | 131K |
| Maximum reasoning | 262K |
| Input modalities | Text, image, and video |
| Output modality | Text |
| QwenCloud reference limits | 2M TPM and 15K RPM |
La pagina del modello QwenCloud รจ la fonte piรน diretta per lโID del modello corrente, i prezzi, le tariffe della cache, i limiti di contesto e le modalitร . Quote specifiche per account e regione possono differire, quindi utilizza i limiti mostrati nella tua console quando imposti la concorrenza in produzione.
La release di produzione sostituisce anche lโidentificatore di anteprima con qwen3.8-max e aggiunge un listino prezzi completo specifico del modello. I materiali di lancio di Qwen descrivono impostazioni di sforzo di ragionamento low, medium e xhigh, ma il comportamento in produzione deve essere verificato rispetto allโendpoint e alla documentazione API effettivamente utilizzati.
Nota sensibile al tempo: Qwen ha annunciato che i pesi aperti seguiranno il rilascio dellโAPI. Al 4 agosto 2026, non descrivere Qwen 3.8 Max come scaricabile o self-hostable finchรฉ non saranno pubblicati un checkpoint ufficiale e la relativa licenza.
Come funziona la tariffazione di Qwen 3.8 Max
QwenCloud attualmente indica una tariffa standard fissa di $2 per 1M token di input e $6 per 1M token di output sullโintera finestra di contesto da 1M token supportata da Qwen 3.8 Max. Lโistantanea dei prezzi ufficiale riportata di seguito รจ stata acquisita il 4 agosto 2026; verifica sempre la pagina del modello live prima di prendere decisioni di budget per la produzione.

Fonte***:*** QwenCloud, โQwen3.8-Maxโ official
| Billing item | Price per 1M tokens | When it applies |
|---|---|---|
| Standard input | $2.00 | Nuovi contenuti del prompt, definizioni degli strumenti e contesto non in cache |
| Standard output | $6.00 | Output generato e utilizzo di ragionamento fatturato |
| Implicit cache hit | $0.25 | Prefissi di prompt riutilizzati automaticamente; gli hit non sono garantiti |
| Explicit cache creation | $2.50 | Creazione di un prefisso di prompt riutilizzabile contrassegnato |
| Explicit cache read | $0.17 | Riutilizzo di un blocco di cache esplicito valido |
Una richiesta da 900K token costa quindi piรน di una da 100K token perchรฉ elabora nove volte tanti token di inputโnon perchรฉ superi una soglia che attiva un livello di prezzo piรน alto.
Il ragionamento puรฒ aumentare il costo dellโoutput
Una risposta visibile breve non รจ sempre a basso costo. Le chiamate con ragionamento possono generare token di ragionamento aggiuntivi, quindi le stime di produzione dovrebbero usare i campi di utilizzo restituiti dallโAPI invece della lunghezza visibile della risposta.
Dove il tuo endpoint supporta i controlli di ragionamento per qwen3.8-max, confronta le impostazioni disponibili sullo stesso set di valutazione. Non dare per scontato che i default della preview si trasferiscano al modello GA.
I risparmi della cache dipendono dalla stabilitร del prompt
La pagina del modello di Qwen 3.8 Max pubblica tariffe di cache specifiche del modello. Usa quelle tariffeโnon rapporti di cache genericiโquando stimi la spesa.
Le voci di cache esplicita hanno un periodo di validitร di cinque minuti, e un hit riuscito reimposta quel periodo. La cache implicita รจ automatica, ma un hit non รจ garantito. Il caching รจ piรน utile quando prompt di sistema, definizioni degli strumenti, contesto di repository o documenti di grandi dimensioni rimangono stabili tra chiamate frequenti.
Gli strumenti integrati generano addebiti separati
QwenCloud attualmente elenca le seguenti tariffe degli strumenti in aggiunta allโuso di token:
| Built-in tool | Current fee |
|---|---|
| Web Search | $10 / 1K calls |
| Image Search | $8 / 1K calls |
| Web Extractor | Free for a limited time |
| Code Interpreter | Free for a limited time |
Function calling e MCP non hanno tariffe separate per gli strumenti, ma le descrizioni degli strumenti contano comunque come token di input. Le promozioni sugli strumenti gratuiti possono cambiare, quindi consulta la guida ai prezzi di QwenCloud prima di finalizzare un budget di produzione.
Ad esempio, una richiesta con 20K token di input, 2K token di output e due chiamate a Web Search costa approssimativamente:
Input: 20,000 / 1,000,000 ร $2 = $0.040
Output: 2,000 / 1,000,000 ร $6 = $0.012
Web Search: 2 / 1,000 ร $10 = $0.020
Total: $0.072
In questo esempio, le due chiamate di ricerca rappresentano circa il 27,8% del costo totale della richiesta.
Esempi reali di costo con Qwen 3.8 Max
Questi esempi utilizzano le tariffe specifiche del modello correnti su QwenCloud. Escludono tasse, retry, fallback e maggiorazioni specifiche del provider.
Esempio 1: Richiesta agente di media entitร
Assume 50K input tokens and 5K output tokens:
Input: 50,000 / 1,000,000 ร $2 = $0.10
Output: 5,000 / 1,000,000 ร $6 = $0.03
Total: $0.13
Un primo tentativo riuscito costa circa $0,13. Un retry completo aumenterebbe il costo del modello a circa $0,26.
Esempio 2: Analisi di documento lungo
Assume 800K input tokens and 20K output tokens:
Input: 800,000 / 1,000,000 ร $2 = $1.60
Output: 20,000 / 1,000,000 ร $6 = $0.12
Total: $1.72
Il modello non applica un sovrapprezzo separato per il contesto lungo sul listino attuale, ma i prompt grandi generano comunque un costo assoluto consistente.
Esempio 3: Sessione agente con cache
Supponi un prefisso riutilizzabile da 100K token, 10K nuovi token di input, 5K token di output e 50 chiamate mentre la cache esplicita resta valida:
First call:
100K cache creation ร $2.50/M = $0.250
10K new input ร $2/M = $0.020
5K output ร $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read ร $0.17/M = $0.017
10K new input ร $2/M = $0.020
5K output ร $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
Risparmio stimato = $8,917, ovvero 71,3%
Il risparmio stimato dipende da hit di cache riusciti e da un prefisso stabile. Lassi temporali lunghi o modifiche frequenti ai prompt di sistema e agli schemi degli strumenti ridurranno il beneficio.
Qwen 3.8 Max vs Qwen 3.7 Max: Confronto prezzi
Qwen 3.8 Max รจ piรน economico del 20% rispetto a Qwen 3.7 Max a prezzo di listino, ma Qwen 3.7 Max รจ piรน economico del 37,5% mentre รจ attiva lโattuale promozione del 50%.
| Model and pricing status | Input / 1M | Output / 1M | Context |
|---|---|---|---|
| qwen3.8-max standard price | $2.00 | $6.00 | 1M |
| qwen3.7-max list price | $2.50 | $7.50 | 1M |
| qwen3.7-max current promotion | $1.25 | $3.75 | 1M |
Tieni disponibile la pagina del modello CometAPI Qwen3.7 Max come fallback mentre testi il nuovo modello.
Il prezzo per token รจ solo una parte della decisione. Qwen 3.8 Max puรฒ essere comunque piรน economico se migliora il successo al primo tentativo, usa gli strumenti in modo piรน affidabile, riduce i retry o richiede meno correzioni umane.
Usa questa metrica di produzione:
Costo per attivitร accettata =
(token del modello + chiamate agli strumenti + retry + spesa di fallback + costo di revisione)
รท output accettati
I miglioramenti di benchmark riportati dal vendor sono un motivo per ritestare i flussi di lavoro impegnativi di coding e professionali, non la prova che ogni carico di lavoro Qwen 3.7 debba migrare.
Come migrare a Qwen 3.8 Max
Cambiare la stringa del modello รจ necessario, ma non basta per una migrazione completa in produzione.
1. Testa lโID del modello di produzione
Sostituisci lโidentificatore di anteprima con qwen3.8-max in un ambiente di test. Non dare per scontato che alias, default, latenza o comportamento della risposta dellโanteprima rimangano invariati.
Una richiesta minima compatibile con OpenAI puรฒ essere cosรฌ:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
Inizia con la richiesta minima documentata. Aggiungi i controlli di ragionamento solo quando la documentazione API corrente per il tuo endpoint li supporta esplicitamente.
2. Ristabilisci la telemetria di costo e prestazioni
Annota almeno:
- token di input, output e ragionamento
- hit della cache e token di creazione della cache
- tempo al primo token e latenza totale
- chiamate agli strumenti, retry e fallback
- output accettati rispetto a rifiutati
- tempo di correzione umana
3. Ritesta lโinterfaccia utilizzata dalla tua applicazione
Valida eventi in streaming, payload multimodali, schemi degli strumenti, output strutturato, motivi di terminazione, campi di utilizzo, gestione errori e comportamento multi-turno. La pagina del modello di produzione documenta lโaccesso DashScope e compatibile con OpenAI; verifica ogni ulteriore livello di compatibilitร prima di farvi affidamento.
4. Rispetta i limiti pratici del contesto
Una finestra di contesto da 1M non equivale a un prompt utente da 1M token. QwenCloud elenca un input massimo di 991K senza ragionamento e 983K con ragionamento. Aggiungi un margine di sicurezza in modo che la richiesta abbia ancora spazio per output e ragionamento.
5. Esegui Qwen 3.7 e Qwen 3.8 in parallelo
Usa prompt, strumenti, validator, regole di retry e dataset identici. Confronta il costo per attivitร accettata e la latenza invece di giudicare risposte isolate a occhio.
Come valutare e instradare Qwen 3.8 Max
Usa carichi di lavoro reali invece di medie di benchmark generiche.
| Workload | Suggested tasks | Primary acceptance signal |
|---|---|---|
| Repository coding | 4 | I test passano senza patch manuali |
| Long-document analysis | 3 | Le affermazioni sono supportate dalle prove fornite |
| Multimodal analysis | 2 | I dettagli rilevanti di immagini o video sono usati correttamente |
| Tool-using agents | 3 | Selezione corretta degli strumenti e argomenti validi |
A practical routing policy is:
Simple, latency-sensitive task
โ Lower-cost Plus model
Existing workload that already meets quality targets
โ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
โ Qwen 3.8 Max
Failed validation
โ One controlled retry, then a tested fallback
Usa Qwen 3.8 Max per lavori complessi su repository, agenti a orizzonte lungo, analisi multimodale e flussi in cui Qwen 3.7 non supera i test di accettazione. Mantieni Qwen 3.7 Max quando la promozione riduce materialmente i costi e il modello esistente soddisfa giร il tuo target di qualitร .
Controlla la pagina prezzi CometAPI e le informazioni di instradamento live prima di fissare le soglie, perchรฉ la disponibilitร del provider e i prezzi instradati possono cambiare indipendentemente dal listino diretto di QwenCloud. Il CometAPI Cookbook puรฒ aiutarti a creare richieste ripetibili e un impianto di valutazione coerente.
FAQ
Quanto costa lโAPI di Qwen 3.8 Max?
QwenCloud attualmente indica Qwen 3.8 Max a $2 per 1 milione di token di input e $6 per 1 milione di token di output. Lโuso della cache e gli strumenti integrati hanno tariffe separate.
Qwen 3.8 Max costa di piรน oltre i 128K token?
Nessun livello separato per il contesto lungo รจ indicato sul listino prezzi specifico del modello attuale. Le richieste lunghe costano di piรน perchรฉ contengono piรน token, non perchรฉ superano una soglia con prezzo unitario piรน alto.
I token di ragionamento di Qwen 3.8 Max vengono fatturati?
Il ragionamento puรฒ aumentare lโutilizzo generato e il costo totale. Usa i campi relativi ai token di ragionamento e di output restituiti dallโendpoint invece di stimare dalla risposta visibile.
Qwen 3.8 Max รจ open source?
Qwen ha annunciato che i pesi aperti seguiranno il rilascio dellโAPI. Non descrivere il modello come scaricabile o self-hostable finchรฉ non saranno disponibili un checkpoint ufficiale e la licenza.
Gli utenti di Qwen 3.7 Max dovrebbero migrare immediatamente?
Non automaticamente. Qwen 3.8 Max ha un prezzo di listino inferiore, mentre Qwen 3.7 Max รจ piรน economico durante la promozione corrente. Migra quando i tuoi dati su qualitร , latenza, comportamento della cache e costo per attivitร accettata supportano il cambiamento.
Prova Qwen 3.8 Max con CometAPI
Usa il Quickstart di CometAPI per configurare un client compatibile con OpenAI. Prima di inviare traffico in produzione, conferma che qwen3.8-max sia attivo nel tuo account e verifica il prezzo instradato visualizzato lรฌ.
Confrontalo con il tuo baseline di Qwen 3.7 usando prompt, validator, policy di retry e telemetria identici. Questo mantiene la valutazione focalizzata sul modello anzichรฉ su cambiamenti nel banco di prova.
