GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI โ†’
new/Ricerca CometAPI

Prezzi dell'API Qwen 3.8 Max: $2 Input, $6 Output, 1M di contesto

Qwen 3.8 Max costa $2/M per l'input e $6/M per l'output. Confronta tariffe della cache, costi degli strumenti, esempi reali, limiti e consigli sulla migrazione di Qwen 3.7.

CometAPI
Mia MarenTeam di ricerca su modelli AI e API
Aggiornato Sep 3, 2026 11 min di lettura
Prezzi dell'API Qwen 3.8 Max: $2 Input, $6 Output, 1M di contesto
Usa questo schema

Esegui la prima chiamata API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Qwen 3.8 Max costa $2 per 1 milione di token di input e $6 per 1 milione di token di output su QwenCloud. Le tariffe di cache specifiche del modello sono $0,25/M per input memorizzato in cache in modo implicito, $2,50/M per la creazione esplicita della cache e $0,17/M per le letture esplicite della cache.

Le stesse tariffe standard per token si applicano allโ€™intera finestra di contesto supportata da 1M token del modello. I prompt piรน grandi costano di piรน perchรฉ contengono piรน token, non perchรฉ entrano in un livello di prezzo superiore per il contesto lungo.

A prezzo di listino, Qwen 3.8 Max รจ piรน economico del 20% rispetto a Qwen 3.7 Max. Tuttavia, Qwen 3.7 Max รจ piรน economico finchรฉ rimane attiva lโ€™attuale promozione del 50%. La scelta migliore in produzione dipende dal costo per attivitร  accettata, inclusi ragionamento, hit della cache, strumenti, retry, latenza e revisione umana.

Prezzi API di Qwen 3.8 Max a colpo dโ€™occhio

ItemCurrent official value
Production model IDqwen3.8-max
Official release dateAugust 3, 2026
Architecture2.4T total parameters; 95B active parameters
Standard input price$2 / 1M tokens
Standard output price$6 / 1M tokens
Implicit cached input$0.25 / 1M tokens
Explicit cache creation$2.50 / 1M tokens
Explicit cache read$0.17 / 1M tokens
Context window1M tokens
Maximum input991K without thinking; 983K with thinking
Maximum output131K
Maximum reasoning262K
Input modalitiesText, image, and video
Output modalityText
QwenCloud reference limits2M TPM and 15K RPM

La pagina del modello QwenCloud รจ la fonte piรน diretta per lโ€™ID del modello corrente, i prezzi, le tariffe della cache, i limiti di contesto e le modalitร . Quote specifiche per account e regione possono differire, quindi utilizza i limiti mostrati nella tua console quando imposti la concorrenza in produzione.

La release di produzione sostituisce anche lโ€™identificatore di anteprima con qwen3.8-max e aggiunge un listino prezzi completo specifico del modello. I materiali di lancio di Qwen descrivono impostazioni di sforzo di ragionamento low, medium e xhigh, ma il comportamento in produzione deve essere verificato rispetto allโ€™endpoint e alla documentazione API effettivamente utilizzati.

Nota sensibile al tempo: Qwen ha annunciato che i pesi aperti seguiranno il rilascio dellโ€™API. Al 4 agosto 2026, non descrivere Qwen 3.8 Max come scaricabile o self-hostable finchรฉ non saranno pubblicati un checkpoint ufficiale e la relativa licenza.

Come funziona la tariffazione di Qwen 3.8 Max

QwenCloud attualmente indica una tariffa standard fissa di $2 per 1M token di input e $6 per 1M token di output sullโ€™intera finestra di contesto da 1M token supportata da Qwen 3.8 Max. Lโ€™istantanea dei prezzi ufficiale riportata di seguito รจ stata acquisita il 4 agosto 2026; verifica sempre la pagina del modello live prima di prendere decisioni di budget per la produzione.

Prezzi dell'API Qwen 3.8 Max: $2 Input, $6 Output, 1M di contesto

Fonte***:*** QwenCloud, โ€œQwen3.8-Maxโ€ official

Billing itemPrice per 1M tokensWhen it applies
Standard input$2.00Nuovi contenuti del prompt, definizioni degli strumenti e contesto non in cache
Standard output$6.00Output generato e utilizzo di ragionamento fatturato
Implicit cache hit$0.25Prefissi di prompt riutilizzati automaticamente; gli hit non sono garantiti
Explicit cache creation$2.50Creazione di un prefisso di prompt riutilizzabile contrassegnato
Explicit cache read$0.17Riutilizzo di un blocco di cache esplicito valido

Una richiesta da 900K token costa quindi piรน di una da 100K token perchรฉ elabora nove volte tanti token di inputโ€”non perchรฉ superi una soglia che attiva un livello di prezzo piรน alto.

Il ragionamento puรฒ aumentare il costo dellโ€™output

Una risposta visibile breve non รจ sempre a basso costo. Le chiamate con ragionamento possono generare token di ragionamento aggiuntivi, quindi le stime di produzione dovrebbero usare i campi di utilizzo restituiti dallโ€™API invece della lunghezza visibile della risposta.

Dove il tuo endpoint supporta i controlli di ragionamento per qwen3.8-max, confronta le impostazioni disponibili sullo stesso set di valutazione. Non dare per scontato che i default della preview si trasferiscano al modello GA.

I risparmi della cache dipendono dalla stabilitร  del prompt

La pagina del modello di Qwen 3.8 Max pubblica tariffe di cache specifiche del modello. Usa quelle tariffeโ€”non rapporti di cache genericiโ€”quando stimi la spesa.

Le voci di cache esplicita hanno un periodo di validitร  di cinque minuti, e un hit riuscito reimposta quel periodo. La cache implicita รจ automatica, ma un hit non รจ garantito. Il caching รจ piรน utile quando prompt di sistema, definizioni degli strumenti, contesto di repository o documenti di grandi dimensioni rimangono stabili tra chiamate frequenti.

Gli strumenti integrati generano addebiti separati

QwenCloud attualmente elenca le seguenti tariffe degli strumenti in aggiunta allโ€™uso di token:

Built-in toolCurrent fee
Web Search$10 / 1K calls
Image Search$8 / 1K calls
Web ExtractorFree for a limited time
Code InterpreterFree for a limited time

Function calling e MCP non hanno tariffe separate per gli strumenti, ma le descrizioni degli strumenti contano comunque come token di input. Le promozioni sugli strumenti gratuiti possono cambiare, quindi consulta la guida ai prezzi di QwenCloud prima di finalizzare un budget di produzione.

Ad esempio, una richiesta con 20K token di input, 2K token di output e due chiamate a Web Search costa approssimativamente:

Input:      20,000 / 1,000,000 ร— $2  = $0.040
Output:      2,000 / 1,000,000 ร— $6  = $0.012
Web Search:  2 / 1,000 ร— $10          = $0.020
Total:                                      $0.072

In questo esempio, le due chiamate di ricerca rappresentano circa il 27,8% del costo totale della richiesta.

Esempi reali di costo con Qwen 3.8 Max

Questi esempi utilizzano le tariffe specifiche del modello correnti su QwenCloud. Escludono tasse, retry, fallback e maggiorazioni specifiche del provider.

Esempio 1: Richiesta agente di media entitร 

Assume 50K input tokens and 5K output tokens:
Input:  50,000 / 1,000,000 ร— $2 = $0.10
Output:  5,000 / 1,000,000 ร— $6 = $0.03
Total:                                $0.13

Un primo tentativo riuscito costa circa $0,13. Un retry completo aumenterebbe il costo del modello a circa $0,26.

Esempio 2: Analisi di documento lungo

Assume 800K input tokens and 20K output tokens:
Input:  800,000 / 1,000,000 ร— $2 = $1.60
Output:  20,000 / 1,000,000 ร— $6 = $0.12
Total:                                  $1.72

Il modello non applica un sovrapprezzo separato per il contesto lungo sul listino attuale, ma i prompt grandi generano comunque un costo assoluto consistente.

Esempio 3: Sessione agente con cache

Supponi un prefisso riutilizzabile da 100K token, 10K nuovi token di input, 5K token di output e 50 chiamate mentre la cache esplicita resta valida:

First call:
100K cache creation ร— $2.50/M = $0.250
10K new input ร— $2/M          = $0.020
5K output ร— $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read ร— $0.17/M     = $0.017
10K new input ร— $2/M          = $0.020
5K output ร— $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

Risparmio stimato = $8,917, ovvero 71,3%

Il risparmio stimato dipende da hit di cache riusciti e da un prefisso stabile. Lassi temporali lunghi o modifiche frequenti ai prompt di sistema e agli schemi degli strumenti ridurranno il beneficio.

Qwen 3.8 Max vs Qwen 3.7 Max: Confronto prezzi

Qwen 3.8 Max รจ piรน economico del 20% rispetto a Qwen 3.7 Max a prezzo di listino, ma Qwen 3.7 Max รจ piรน economico del 37,5% mentre รจ attiva lโ€™attuale promozione del 50%.

Model and pricing statusInput / 1MOutput / 1MContext
qwen3.8-max standard price$2.00$6.001M
qwen3.7-max list price$2.50$7.501M
qwen3.7-max current promotion$1.25$3.751M

Tieni disponibile la pagina del modello CometAPI Qwen3.7 Max come fallback mentre testi il nuovo modello.

Il prezzo per token รจ solo una parte della decisione. Qwen 3.8 Max puรฒ essere comunque piรน economico se migliora il successo al primo tentativo, usa gli strumenti in modo piรน affidabile, riduce i retry o richiede meno correzioni umane.

Usa questa metrica di produzione:

Costo per attivitร  accettata =
(token del modello + chiamate agli strumenti + retry + spesa di fallback + costo di revisione)
รท output accettati

I miglioramenti di benchmark riportati dal vendor sono un motivo per ritestare i flussi di lavoro impegnativi di coding e professionali, non la prova che ogni carico di lavoro Qwen 3.7 debba migrare.

Come migrare a Qwen 3.8 Max

Cambiare la stringa del modello รจ necessario, ma non basta per una migrazione completa in produzione.

1. Testa lโ€™ID del modello di produzione

Sostituisci lโ€™identificatore di anteprima con qwen3.8-max in un ambiente di test. Non dare per scontato che alias, default, latenza o comportamento della risposta dellโ€™anteprima rimangano invariati.

Una richiesta minima compatibile con OpenAI puรฒ essere cosรฌ:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

Inizia con la richiesta minima documentata. Aggiungi i controlli di ragionamento solo quando la documentazione API corrente per il tuo endpoint li supporta esplicitamente.

2. Ristabilisci la telemetria di costo e prestazioni

Annota almeno:

  • token di input, output e ragionamento
  • hit della cache e token di creazione della cache
  • tempo al primo token e latenza totale
  • chiamate agli strumenti, retry e fallback
  • output accettati rispetto a rifiutati
  • tempo di correzione umana

3. Ritesta lโ€™interfaccia utilizzata dalla tua applicazione

Valida eventi in streaming, payload multimodali, schemi degli strumenti, output strutturato, motivi di terminazione, campi di utilizzo, gestione errori e comportamento multi-turno. La pagina del modello di produzione documenta lโ€™accesso DashScope e compatibile con OpenAI; verifica ogni ulteriore livello di compatibilitร  prima di farvi affidamento.

4. Rispetta i limiti pratici del contesto

Una finestra di contesto da 1M non equivale a un prompt utente da 1M token. QwenCloud elenca un input massimo di 991K senza ragionamento e 983K con ragionamento. Aggiungi un margine di sicurezza in modo che la richiesta abbia ancora spazio per output e ragionamento.

5. Esegui Qwen 3.7 e Qwen 3.8 in parallelo

Usa prompt, strumenti, validator, regole di retry e dataset identici. Confronta il costo per attivitร  accettata e la latenza invece di giudicare risposte isolate a occhio.

Come valutare e instradare Qwen 3.8 Max

Usa carichi di lavoro reali invece di medie di benchmark generiche.

WorkloadSuggested tasksPrimary acceptance signal
Repository coding4I test passano senza patch manuali
Long-document analysis3Le affermazioni sono supportate dalle prove fornite
Multimodal analysis2I dettagli rilevanti di immagini o video sono usati correttamente
Tool-using agents3Selezione corretta degli strumenti e argomenti validi
A practical routing policy is:
Simple, latency-sensitive task
โ†’ Lower-cost Plus model
Existing workload that already meets quality targets
โ†’ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
โ†’ Qwen 3.8 Max
Failed validation
โ†’ One controlled retry, then a tested fallback

Usa Qwen 3.8 Max per lavori complessi su repository, agenti a orizzonte lungo, analisi multimodale e flussi in cui Qwen 3.7 non supera i test di accettazione. Mantieni Qwen 3.7 Max quando la promozione riduce materialmente i costi e il modello esistente soddisfa giร  il tuo target di qualitร .

Controlla la pagina prezzi CometAPI e le informazioni di instradamento live prima di fissare le soglie, perchรฉ la disponibilitร  del provider e i prezzi instradati possono cambiare indipendentemente dal listino diretto di QwenCloud. Il CometAPI Cookbook puรฒ aiutarti a creare richieste ripetibili e un impianto di valutazione coerente.

FAQ

Quanto costa lโ€™API di Qwen 3.8 Max?

QwenCloud attualmente indica Qwen 3.8 Max a $2 per 1 milione di token di input e $6 per 1 milione di token di output. Lโ€™uso della cache e gli strumenti integrati hanno tariffe separate.

Qwen 3.8 Max costa di piรน oltre i 128K token?

Nessun livello separato per il contesto lungo รจ indicato sul listino prezzi specifico del modello attuale. Le richieste lunghe costano di piรน perchรฉ contengono piรน token, non perchรฉ superano una soglia con prezzo unitario piรน alto.

I token di ragionamento di Qwen 3.8 Max vengono fatturati?

Il ragionamento puรฒ aumentare lโ€™utilizzo generato e il costo totale. Usa i campi relativi ai token di ragionamento e di output restituiti dallโ€™endpoint invece di stimare dalla risposta visibile.

Qwen 3.8 Max รจ open source?

Qwen ha annunciato che i pesi aperti seguiranno il rilascio dellโ€™API. Non descrivere il modello come scaricabile o self-hostable finchรฉ non saranno disponibili un checkpoint ufficiale e la licenza.

Gli utenti di Qwen 3.7 Max dovrebbero migrare immediatamente?

Non automaticamente. Qwen 3.8 Max ha un prezzo di listino inferiore, mentre Qwen 3.7 Max รจ piรน economico durante la promozione corrente. Migra quando i tuoi dati su qualitร , latenza, comportamento della cache e costo per attivitร  accettata supportano il cambiamento.

Prova Qwen 3.8 Max con CometAPI

Usa il Quickstart di CometAPI per configurare un client compatibile con OpenAI. Prima di inviare traffico in produzione, conferma che qwen3.8-max sia attivo nel tuo account e verifica il prezzo instradato visualizzato lรฌ.

Confrontalo con il tuo baseline di Qwen 3.7 usando prompt, validator, policy di retry e telemetria identici. Questo mantiene la valutazione focalizzata sul modello anzichรฉ su cambiamenti nel banco di prova.

Continua a imparare

Collega questo articolo alla prossima decisione.

Vedi tutti gli argomenti
Pubblicato il Aug 4, 2026
Ultimo aggiornamento Sep 3, 2026
199 visualizzazioni
Revisionato per chiarezza, attribuzione delle fonti e terminologia API aggiornata.

Pronto a ridurre i costi di sviluppo AI del 20%?

Inizia gratuitamente in pochi minuti. Crediti di prova gratuiti inclusi. Nessuna carta di credito richiesta.

Leggi di piรน