GPT-5.6 Luna price down 80%, Terra down 20% โ†’

Prezzi dell'API Qwen 3.8 Max: $2 input, $6 output, 1M di contesto

CometAPI
Mia MarenAug 4, 2026
Prezzi dell'API Qwen 3.8 Max: $2 input, $6 output, 1M di contesto

Prezzi API Qwen 3.8 Max: $2 input, $6 output, contesto da 1M

TL;DR

Qwen 3.8 Max costa $2 per 1 milione di token in input e $6 per 1 milione di token in output su QwenCloud. Le tariffe di cache specifiche del modello sono $0.25/M per input nella cache implicita, $2.50/M per la creazione esplicita della cache e $0.17/M per le letture esplicite della cache.

Le stesse tariffe standard per token si applicano allโ€™intera finestra di contesto da 1M di token supportata dal modello. I prompt piรน grandi costano di piรน perchรฉ contengono piรน token, non perchรฉ entrano in un livello di prezzo per contesto lungo.

Al prezzo di listino, Qwen 3.8 Max รจ piรน economico del 20% rispetto a Qwen 3.7 Max. Tuttavia, Qwen 3.7 Max รจ piรน economico finchรฉ rimane attiva la promozione attuale del 50%. La scelta migliore per la produzione dipende dal costo per attivitร  accettata, includendo ragionamento, hit di cache, strumenti, retry, latenza e revisione umana.

Prezzi API Qwen 3.8 Max a colpo dโ€™occhio

VoceValore ufficiale attuale
ID modello in produzioneqwen3.8-max
Data di rilascio ufficialeAugust 3, 2026
Architettura2.4T parametri totali; 95B parametri attivi
Prezzo standard input$2 / 1M token
Prezzo standard output$6 / 1M token
Input in cache implicita$0.25 / 1M token
Creazione cache esplicita$2.50 / 1M token
Lettura cache esplicita$0.17 / 1M token
Finestra di contesto1M token
Input massimo991K senza ragionamento; 983K con ragionamento
Output massimo131K
Ragionamento massimo262K
Modalitร  di inputTesto, immagine e video
Modalitร  di outputTesto
Limiti di riferimento QwenCloud2M TPM e 15K RPM

La pagina del modello su QwenCloud รจ la fonte piรน diretta per lโ€™ID del modello corrente, i prezzi, le tariffe della cache, i limiti di contesto e le modalitร . Quote specifiche per account e area geografica possono variare, quindi usa i limiti mostrati nella tua console quando imposti la concorrenza in produzione.

Il rilascio in produzione sostituisce anche lโ€™identificatore di anteprima con qwen3.8-max e aggiunge un listino prezzi specifico del modello completo. I materiali di lancio di Qwen descrivono impostazioni di sforzo di ragionamento low, medium e xhigh, ma il comportamento in produzione va verificato rispetto allโ€™endpoint e alla documentazione API effettivamente utilizzati.

Nota sensibile al tempo: Qwen ha annunciato che i pesi open seguiranno il rilascio dellโ€™API. A partire dal 4 agosto 2026, non descrivere Qwen 3.8 Max come scaricabile o self-hostable finchรฉ non vengono pubblicati un checkpoint ufficiale e la relativa licenza.

Come funzionano i prezzi di Qwen 3.8 Max

QwenCloud attualmente indica una tariffa standard flat di $2 per 1M token in input e $6 per 1M token in output su tutta la finestra di contesto da 1M di token supportata da Qwen 3.8 Max. Lโ€™istantanea dei prezzi ufficiali di seguito รจ stata catturata il 4 agosto 2026; verifica sempre la pagina del modello aggiornata prima di prendere decisioni di budget per la produzione.

Prezzi dell'API Qwen 3.8 Max: $2 input, $6 output, 1M di contesto

Fonte***:*** QwenCloud, โ€œQwen3.8-Maxโ€ ufficiale

Voce di fatturazionePrezzo per 1M tokenQuando si applica
Input standard$2.00Nuovi contenuti del prompt, definizioni strumenti e contesto non in cache
Output standard$6.00Output generato e utilizzo di ragionamento fatturato
Hit cache implicita$0.25Prefissi di prompt riutilizzati automaticamente; gli hit non sono garantiti
Creazione cache esplicita$2.50Creazione di un prefisso di prompt riutilizzabile marcato
Lettura cache esplicita$0.17Riutilizzo di un blocco di cache esplicita valido

Una richiesta da 900K token costa quindi piรน di una da 100K token perchรฉ elabora nove volte piรน token in input, non perchรฉ attraversa un livello di prezzo unitario piรน alto.

Il ragionamento puรฒ aumentare il costo dellโ€™output

Una risposta visibile breve non รจ sempre una risposta a basso costo. Le chiamate con ragionamento abilitato possono generare token di ragionamento aggiuntivi, quindi le stime di produzione dovrebbero usare i campi di utilizzo restituiti dallโ€™API anzichรฉ la lunghezza visibile della risposta.

Dove il tuo endpoint supporta controlli di ragionamento per qwen3.8-max, confronta le impostazioni disponibili sullo stesso set di valutazione. Non dare per scontato che i default dellโ€™anteprima si trasferiscano al modello GA.

I risparmi della cache dipendono dalla stabilitร  del prompt

La pagina del modello Qwen 3.8 Max pubblica tariffe di cache specifiche del modello. Usa quelle tariffe, non rapporti di cache generici, quando stimi la spesa.

Le voci di cache esplicite hanno un periodo di validitร  di cinque minuti e un hit riuscito reimposta tale periodo. La cache implicita รจ automatica, ma un hit non รจ garantito. Il caching รจ piรน utile quando prompt di sistema, definizioni degli strumenti, contesto del repository o documenti di grandi dimensioni rimangono stabili tra chiamate frequenti.

Gli strumenti integrati comportano addebiti separati

QwenCloud attualmente elenca le seguenti tariffe per gli strumenti in aggiunta allโ€™uso dei token:

Strumento integratoTariffa attuale
Web Search$10 / 1K chiamate
Image Search$8 / 1K chiamate
Web ExtractorGratis per un periodo limitato
Code InterpreterGratis per un periodo limitato

La function calling e lโ€™MCP non hanno tariffe separati per gli strumenti, ma le descrizioni degli strumenti contano comunque come token di input. Le promozioni gratuite sugli strumenti possono cambiare, quindi controlla la guida ai prezzi di QwenCloud prima di finalizzare un budget di produzione.

Ad esempio, una richiesta con 20K token in input, 2K token in output e due chiamate a Web Search costa approssimativamente:

Input:      20,000 / 1,000,000 ร— $2  = $0.040
Output:      2,000 / 1,000,000 ร— $6  = $0.012
Web Search:  2 / 1,000 ร— $10          = $0.020
Total:                                      $0.072

In questo esempio, le due chiamate di ricerca rappresentano circa il 27,8% del costo totale della richiesta.

Esempi reali di costo di Qwen 3.8 Max

Questi esempi usano le tariffe specifiche del modello attuali su QwenCloud. Escludono tasse, retry, fallback e ricarichi specifici del fornitore.

Esempio 1: Richiesta agente media

Assume 50K input tokens and 5K output tokens:
Input:  50,000 / 1,000,000 ร— $2 = $0.10
Output:  5,000 / 1,000,000 ร— $6 = $0.03
Total:                                $0.13

Un primo tentativo riuscito costa circa $0.13. Un retry completo raddoppierebbe il costo del modello a circa $0.26.

Esempio 2: Analisi di documento lungo

Assume 800K input tokens and 20K output tokens:
Input:  800,000 / 1,000,000 ร— $2 = $1.60
Output:  20,000 / 1,000,000 ร— $6 = $0.12
Total:                                  $1.72

Il modello non applica un sovrapprezzo separato per contesto lungo nel listino attuale, ma i prompt grandi generano comunque un costo assoluto significativo.

Esempio 3: Sessione di agente con cache

Si assume un prefisso riutilizzabile da 100K token, 10K nuovi token in input, 5K token in output e 50 chiamate mentre la cache esplicita rimane valida:

First call:
100K cache creation ร— $2.50/M = $0.250
10K new input ร— $2/M          = $0.020
5K output ร— $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read ร— $0.17/M     = $0.017
10K new input ร— $2/M          = $0.020
5K output ร— $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

Risparmio stimato = $8.917, ovvero il 71,3%

Il risparmio stimato dipende da hit di cache riusciti e da un prefisso stabile. Intervalli lunghi o cambi frequenti ai prompt di sistema e agli schemi degli strumenti ridurranno il beneficio.

Qwen 3.8 Max vs Qwen 3.7 Max๏ผšConfronto prezzi

Qwen 3.8 Max รจ piรน economico del 20% rispetto a Qwen 3.7 Max al prezzo di listino, ma Qwen 3.7 Max รจ piรน economico del 37,5% mentre รจ attiva la promozione del 50% attuale.

Modello e stato di prezzoInput / 1MOutput / 1MContesto
qwen3.8-max prezzo standard$2.00$6.001M
qwen3.7-max prezzo di listino$2.50$7.501M
qwen3.7-max promozione attuale$1.25$3.751M

Tieni a portata di mano la pagina del modello Qwen3.7 Max su CometAPI come fallback mentre testi il nuovo modello.

Il prezzo per token รจ solo una parte della decisione. Qwen 3.8 Max puรฒ comunque essere piรน economico se migliora il successo al primo tentativo, usa gli strumenti in modo piรน affidabile, riduce i retry o richiede meno correzioni umane.

Usa questa metrica di produzione:

Costo per attivitร  accettata =

(token del modello + chiamate agli strumenti + retry + spesa di fallback + costo di revisione)

รท output accettati

I miglioramenti di benchmark riportati dal fornitore sono un motivo per ritestare workflow di coding e professionali impegnativi, non la prova che ogni carico di lavoro di Qwen 3.7 debba migrare.

Come migrare a Qwen 3.8 Max

Cambiare la stringa del modello รจ necessario, ma non sufficiente per una migrazione completa in produzione.

1. Testare lโ€™ID del modello in produzione

Sostituisci lโ€™identificatore di anteprima con qwen3.8-max in un ambiente di test. Non dare per scontato che alias, default, latenza o comportamento di risposta dellโ€™anteprima rimangano invariati.

Una richiesta minima compatibile con OpenAI puรฒ essere simile a questa:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

Inizia con la richiesta minima documentata. Aggiungi i controlli di ragionamento solo quando la documentazione API corrente per il tuo endpoint li supporta esplicitamente.

2. Ricalibrare telemetria di costo e performance

Registra almeno:

  • token di input, output e ragionamento
  • hit di cache e token di creazione della cache
  • tempo al primo token e latenza totale
  • chiamate agli strumenti, retry e fallback
  • output accettati vs rifiutati
  • tempo di correzione umana

3. Ritestare lโ€™interfaccia usata dalla tua applicazione

Valida eventi in streaming, payload multimodali, schemi degli strumenti, output strutturato, ragioni di terminazione, campi di utilizzo, gestione degli errori e comportamento multi-turno. La pagina del modello in produzione documenta lโ€™accesso DashScope e compatibile OpenAI; verifica qualsiasi ulteriore livello di compatibilitร  prima di farvi affidamento.

4. Rispettare i limiti pratici del contesto

Una finestra di contesto da 1M non equivale a un prompt utente da 1M token. QwenCloud indica un input massimo di 991K senza ragionamento e 983K con ragionamento. Aggiungi un margine di sicurezza affinchรฉ la richiesta abbia ancora spazio per output e ragionamento.

5. Eseguire Qwen 3.7 e Qwen 3.8 in parallelo

Usa prompt, strumenti, validatori, regole di retry e dataset identici. Confronta il costo per attivitร  accettata e la latenza invece di giudicare risposte isolate โ€œa occhioโ€.

Come valutare e instradare Qwen 3.8 Max

Usa carichi di lavoro reali anzichรฉ medie generiche di benchmark.

Carico di lavoroAttivitร  suggeriteSegnale principale di accettazione
Sviluppo su repository4I test passano senza correzioni manuali
Analisi di documenti lunghi3Le affermazioni sono supportate da prove fornite
Analisi multimodale2Dettagli rilevanti di immagini o video usati correttamente
Agenti che usano strumenti3Scelta corretta dello strumento e argomenti validi
A practical routing policy is:
Simple, latency-sensitive task
โ†’ Lower-cost Plus model
Existing workload that already meets quality targets
โ†’ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
โ†’ Qwen 3.8 Max
Failed validation
โ†’ One controlled retry, then a tested fallback

Usa Qwen 3.8 Max per lavori difficili su repository, agenti di lungo orizzonte, analisi multimodale e workflow in cui Qwen 3.7 fallisce i test di accettazione. Mantieni Qwen 3.7 Max quando la promozione riduce materialmente i costi e il modello esistente soddisfa giร  il tuo obiettivo di qualitร .

Controlla la pagina dei prezzi di CometAPI e le informazioni di instradamento live prima di fissare le soglie, perchรฉ disponibilitร  del fornitore e prezzi instradati possono cambiare indipendentemente dal listino diretto di QwenCloud. Il CometAPI Cookbook puรฒ aiutarti a costruire richieste ripetibili e un framework di valutazione coerente.

FAQ

Quanto costa lโ€™API di Qwen 3.8 Max?

QwenCloud attualmente indica Qwen 3.8 Max a $2 per 1 milione di token in input e $6 per 1 milione di token in output. Lโ€™uso della cache e gli strumenti integrati hanno tariffe separate.

Qwen 3.8 Max costa di piรน oltre 128K token?

Nessun livello separato per contesto lungo รจ mostrato nel listino prezzi specifico del modello corrente. Le richieste lunghe costano di piรน perchรฉ contengono piรน token, non perchรฉ attraversano un livello di prezzo unitario piรน alto.

I token di ragionamento di Qwen 3.8 Max sono fatturati?

Il ragionamento puรฒ aumentare lโ€™utilizzo generato e il costo totale. Usa i campi di token di ragionamento e di output restituiti dallโ€™endpoint invece di stimare dalla risposta visibile.

Qwen 3.8 Max รจ open source?

Qwen ha annunciato che i pesi open seguiranno il rilascio dellโ€™API. Non descrivere il modello come scaricabile o self-hostable finchรฉ non sono disponibili un checkpoint ufficiale e la licenza.

Gli utenti di Qwen 3.7 Max dovrebbero migrare immediatamente?

Non automaticamente. Qwen 3.8 Max ha un prezzo di listino standard piรน basso, mentre Qwen 3.7 Max รจ piรน economico durante la promozione attuale. Migra quando i tuoi dati su qualitร , latenza, comportamento della cache e costo per attivitร  accettata supportano il cambiamento.

Prova Qwen 3.8 Max con CometAPI

Usa il CometAPI Quickstart per configurare un client compatibile con OpenAI. Prima di inviare traffico di produzione, conferma che qwen3.8-max sia attivo nel tuo account e verifica il prezzo instradato visualizzato lรฌ.

Confrontalo con la tua baseline di Qwen 3.7 usando prompt, validator, policy di retry e telemetria identici. Questo mantiene la valutazione focalizzata sul modello piuttosto che su cambiamenti nel framework di test.

Pronto a ridurre i costi di sviluppo AI del 20%?

Inizia gratuitamente in pochi minuti. Crediti di prova gratuiti inclusi. Nessuna carta di credito richiesta.

Leggi di piรน