Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →
technology/Ricerca CometAPI

Prezzi 2026 dell'API Qwen3.7 Plus: Costi, Cache e Batch

Scopri come variano i costi dell’API Qwen3.7 Plus in base all’instradamento Alibaba, alla lunghezza del contesto, all’utilizzo della cache e ai processi batch, con le tariffe di CometAPI incluse a titolo di confronto.

CometAPI
Mia MarenTeam di ricerca su modelli AI e API
Aggiornato Aug 30, 2026 22 min di lettura
Prezzi 2026 dell'API Qwen3.7 Plus: Costi, Cache e Batch
Usa questo schema

Esegui la prima chiamata API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Qwen3.7 Plus parte da $0.40/M input e $1.60/M output sul percorso US-local di Alibaba, mentre il percorso Global parte da $0.276/M e $1.101/M. Per confronto, CometAPI attualmente indica il modello a $0.32/M in input e $1.28/M in output. Il principale rischio di costo è la soglia a 256K di Alibaba: una volta superata, il livello superiore si applica all’intera richiesta.

Panoramica dei prezzi dell'API Qwen3.7 Plus

Qwen3.7 Plus non ha un prezzo API universale. Il costo finale dipende dal percorso di deployment, dalla lunghezza della richiesta, da sconti temporanei, dall’uso della cache, dal thinking output, dalle chiamate Web Search e dalla disponibilità di funzionalità per area.

RouteInput tokens per requestInput price / 1MOutput price / 1MCurrent pricing note
Alibaba US-local qwen3.7-plus-us0–256K$0.40$1.60Nessuna etichetta promozionale mostrata sulla riga US-local corrente
Alibaba US-local qwen3.7-plus-us>256K–1M$1.20$4.80Il livello superiore si applica all’intera richiesta
Alibaba Global qwen3.7-plus0–256K$0.28$1.10Sono attualmente mostrati sconti a tempo limitato diurni e notturni
Alibaba Global qwen3.7-plus>256K–1M$0.83$3.30Sono attualmente mostrati sconti a tempo limitato diurni e notturni
Alibaba International qwen3.7-plus0–256K$0.40 list price$1.60 list priceLa pagina attuale mostra uno sconto a tempo limitato del 20%
Alibaba International qwen3.7-plus>256K–1M$1.20 list price$4.80 list priceLa pagina attuale mostra uno sconto a tempo limitato del 20%
CometAPI routed qwen3.7-plusCheck live route$0.32$1.28Prezzo in evidenza mostrato sulla pagina del modello attuale

Alibaba documenta una finestra di contesto da 1,000,000 token per qwen3.7-plus.

img

Fonti:**[Alibaba Cloud Model Studio pricing]

Nota sugli sconti temporanei di Alibaba

La tabella prezzi attuale di Alibaba etichetta il percorso Global qwen3.7-plus con uno sconto limitato del 20% di giorno e del 60% di notte.

La finestra notturna pubblicata è 22:00–08:00 UTC**+8**, basata sull’orario di fatturazione. Il percorso International mostra attualmente uno sconto limitato del 20%.

Poiché queste promozioni possono cambiare o scadere, i calcoli seguenti usano i prezzi di listino standard salvo esplicita indicazione contraria. Per una previsione operativa live, verificare la console Model Studio e la pagina prezzi il giorno in cui si invia traffico.

Prezzi Alibaba US-local vs Global

La distinzione più importante per gli sviluppatori US è che i percorsi US-local e Global di Alibaba non usano la stessa riga di prezzo.

L’ID modello US-local è:

qwen3.7-plus-us

Il prezzo di listino parte da:

  • $0.40 per 1M token di input
  • $1.60 per 1M token di output

L’ID modello Global è:

qwen3.7-plus

Il prezzo di listino parte da:

  • $0.276 per 1M token di input
  • $1.101 per 1M token di output

Il percorso Global è più economico in base al listino pubblicato, ma il costo non dovrebbe essere l’unico fattore di instradamento.

I team dovrebbero considerare anche:

  • Requisiti di data residency
  • Disponibilità regionale
  • Latenza
  • Supporto strumenti
  • Requisiti di conformità
  • Stabilità del servizio
  • Sconti temporanei del provider

Un percorso Global a prezzo inferiore potrebbe non essere adatto per carichi che richiedono elaborazione in una regione specifica.

Come funziona la soglia tariffaria a 256K

Alibaba Cloud usa il numero totale di token di input in una singola richiesta per selezionare la fascia di prezzo.

Se una richiesta supera i 256K token di input, il prezzo unitario più alto si applica a ogni token fatturato in quella richiesta, inclusi i token di output al tasso di output mostrato per la fascia superiore.

Una richiesta da 300K token non viene fatturata come:

  • 256K token al prezzo inferiore
  • 44K token al prezzo superiore

Invece, l’intera richiesta usa la fascia di prezzo superiore.

Per il percorso US-local, ciò significa che il prezzo passa da:

  • $0.40 a $1.20 per 1M token di input
  • $1.60 a $4.80 per 1M token di output

Le tariffe più alte si applicano a tutti i token di input e di output fatturabili in quella richiesta.

Esempi di costo per Qwen3.7 Plus

Esempio 1: una richiesta sotto 256K

Supponiamo che una richiesta contenga:

  • 100,000 token di input
  • 10,000 token di output
RouteInput calculationOutput calculationEstimated list-price cost
Alibaba US-local100K ÷ 1M × $0.40 = $0.040010K ÷ 1M × $1.60 = $0.0160$0.0560
Alibaba Global100K ÷ 1M × $0.276 = $0.027610K ÷ 1M × $1.101 = $0.0110$0.0386
CometAPI100K ÷ 1M × $0.32 = $0.032010K ÷ 1M × $1.28 = $0.0128$0.0448

Le cifre Alibaba sopra usano i prezzi di listino pubblicati prima di eventuali sconti temporanei applicabili.

Esempio 2: una richiesta sopra 256K

Supponiamo ora che una richiesta contenga:

  • 400,000 token di input
  • 20,000 token di output

Poiché la richiesta supera i 256K token di input, Alibaba Cloud applica la fascia superiore a tutti i token di input e output nella richiesta.

RouteInput calculationOutput calculationEstimated cost
Alibaba US-local400K ÷ 1M × $1.20 = $0.480020K ÷ 1M × $4.80 = $0.0960$0.5760
Alibaba Global400K ÷ 1M × $0.826 = $0.330420K ÷ 1M × $3.301 = $0.0660$0.3964
CometAPI headline-rate scenario*400K ÷ 1M × $0.32 = $0.128020K ÷ 1M × $1.28 = $0.0256$0.1536*

La cifra CometAPI è una stima condizionale, non un prezzo di produzione confermato per richieste sopra 256K.

La pagina pubblica del modello CometAPI mostra attualmente un solo prezzo in evidenza e circa 991.8K token massimi di input. Tuttavia, non specifica se per richieste sopra 256K:

  • Si mantiene lo stesso prezzo in evidenza
  • Si usa una fascia di prezzo separata per il long-context
  • Viene applicato un sovrapprezzo di instradamento

Se le tariffe in evidenza restassero invariate sopra 256K, il costo stimato sarebbe:

  • Input: 400K ÷ 1M × $0.32 = $0.1280
  • Output: 20K ÷ 1M × $1.28 = $0.0256
  • Totale: $0.1536

img

Fonte*:* CometAPI Qwen3.7 Plus Pricing

Suddividere una richiesta grande può ridurre il costo?

In alcuni casi, sì.

Supponiamo che il task da 400K input possa essere diviso in due richieste indipendenti, ciascuna contenente:

  • 200K token di input
  • 10K token di output

Sul percorso US-local:

PlanCalculationEstimated cost
One 400K-input request$0.4800 input + $0.0960 output$0.576
Two 200K-input requests2 × [($0.0800 input) + ($0.0160 output)]$0.192

La versione a due richieste è significativamente più economica perché entrambe le chiamate restano sotto la soglia 256K.

Tuttavia, questa è un’ottimizzazione illustrativa, non una raccomandazione universale.

Suddividere un task può introdurre:

  • Contesto duplicato
  • Chiamate API aggiuntive
  • Maggiore logica di orchestrazione
  • Latenza più alta
  • Perdita di contesto tra documenti
  • Qualità delle risposte inferiore

Usa questo approccio solo quando il lavoro può essere separato senza indebolire il risultato finale.

Prezzi della Context Cache per Qwen3.7 Plus

La Context Cache può ridurre il costo di prompt di sistema ripetuti, contesto di repository, documenti di policy, cataloghi prodotto e altro materiale di riferimento riutilizzabile.

Alibaba Cloud offre modalità Context Cache esplicita e implicita.

Cache modeCache creationCached-input priceOperational detail
Explicit cache125% of standard input price10% of standard input priceValidità cinque minuti; il timer si resetta dopo un hit; deterministica entro la validità
Implicit cache100% of standard input price20% of standard input priceRilevamento automatico del common prefix; la probabilità di hit non è garantita

Fonte: Alibaba Cloud Context Cache documentation.

Esempio di costo della Context Cache

Supponiamo che un workflow US-local invii ripetutamente:

  • 80K token di prefisso stabile
  • 5K nuovi token di input
  • 5K token di output
ScenarioInput costOutput costEstimated cost per request
No cache85K ÷ 1M × $0.40 = $0.03405K ÷ 1M × $1.60 = $0.0080$0.04
Implicit cache hit on 80K(80K ÷ 1M × $0.08) + (5K ÷ 1M × $0.40) = $0.0084$0.01$0.02
Explicit cache hit on 80K(80K ÷ 1M × $0.04) + (5K ÷ 1M × $0.40) = $0.0052$0.01$0.01

La cache esplicita ha una validità di cinque minuti che si resetta dopo un hit riuscito, non un TTL minimo di un’ora.

I token di creazione della cache costano il 125% del normale prezzo di input, mentre gli hit successivi costano il 10%.

Quando la cache esplicita diventa più economica?

Per il solo prefisso stabile, sia N il numero totale di richieste con prefisso identico.

Il costo normalizzato della cache esplicita è:

1.25 + 0.10 × (N − 1)

Una sequenza ideale con cache implicita è:

1.00 + 0.20 × (N − 1)

Sotto l’ipotesi semplificata che ogni richiesta dopo la prima ottenga un hit della cache implicita, la cache esplicita diventa più economica a quattro richieste totali:

  • Una richiesta di creazione cache
  • Tre riusi di cache riusciti

Rispetto alla mancata cache, la cache esplicita diventa più economica dalla seconda richiesta totale.

Nei carichi reali, il punto di pareggio può variare perché gli hit della cache implicita non sono garantiti.

Monitora:

  • Token di input in cache
  • Token di creazione cache
  • Token di input non in cache
  • Token di output
  • Tasso di hit della cache
  • Numero di retry
  • Tasso di successo del task

Ridurre i token non aiuta se miss di cache o regressioni di qualità portano a più retry.

Per qwen3.7-plus, Alibaba indirizza gli sviluppatori a usare lo strumento Responses API web_search.

Web Search aggiunge due componenti di costo separati:

  1. Il contenuto web recuperato viene aggiunto al prompt del modello ed è fatturato come normali token di input.
  2. La policy di ricerca ha una tariffa separata per 1,000 chiamate.

Le tariffe agent attualmente documentate sono:

Deployment scopeWeb Search fee / 1,000 calls
Chinese mainland and Global$0.57
International$10.00

Fonte: Alibaba Cloud Web Search documentation.

La tabella di supporto attuale elenca qwen3.7-plus per gli ambiti Global e International, ma non elenca l’ID modello US-local qwen3.7-plus-us.

Verifica la disponibilità dello strumento prima di progettare un workflow US-local attorno alla funzionalità Web Search integrata di Alibaba.

Esempio di costo Web Search International

Supponiamo che una richiesta contenga:

  • 10K normali token di input
  • 2K token di output
  • Due chiamate Web Search

Prima di conteggiare i token aggiuntivi restituiti dal motore di ricerca:

Cost componentCalculationCost
Model input10K ÷ 1M × $0.40 list price$0.0040
Model output2K ÷ 1M × $1.60 list price$0.0032
Web Search2 ÷ 1,000 × $10.00$0.0200
Total before retrieved-content tokens$0.0040 + $0.0032 + $0.0200$0.0272

La tariffa della policy di ricerca rappresenta:

$0.0200 ÷ $0.0272 = 73.5%

In questo esempio, la tariffa di ricerca rappresenta il 73.5% del totale prima di includere i token del contenuto recuperato, ovvero il 74% arrotondando alla percentuale intera più vicina.

Sul percorso Global, la tariffa per chiamata è molto più bassa. Tuttavia, le pagine recuperate possono comunque aumentare significativamente l’uso di token di input o spingere un agente long-running oltre la soglia tariffaria 256K.

Per workflow basati su ricerca, traccia sia:

  • Numero di chiamate di ricerca
  • Numero di token del contenuto recuperato

Prezzi e disponibilità della Batch API

La Batch File API di Alibaba addebita i token di input e output riusciti al 50% del corrispondente prezzo di inferenza in tempo reale.

È progettata per carichi offline in cui non sono necessarie risposte immediate, tra cui:

  • Valutazioni di modelli
  • Tagging di documenti
  • Classificazione su larga scala
  • Generazione di dati sintetici
  • Enrichment notturni
  • Elaborazione multimodale offline
  • Esecuzioni di benchmark

Tuttavia, lo sconto Batch non dovrebbe essere incluso automaticamente in ogni previsione di costo per Qwen3.7 Plus.

La documentazione attuale afferma che:

  • L’esatto modello qwen3.7-plus è elencato sotto China (Beijing).
  • L’ambito Batch di Singapore elenca alias generici come qwen-plus, invece dell’ID modello esatto qwen3.7-plus.
  • La documentazione non elenca qwen3.7-plus-us come modello Batch US-local supportato.
  • Le richieste Batch supportate di Qwen3.7 Plus hanno un contesto massimo di 256K, non 1M.
  • Batch non supporta la Context Cache.
  • Gli sconti Batch e cache non possono essere combinati.
  • La modalità Thinking è abilitata per impostazione predefinita per i job Batch della serie Qwen3.7, salvo configurazione esplicita.
  • I token di thinking sono fatturati al tasso dei token di output.
  • Il completion_window configurabile è un periodo massimo di attesa tra 24 e 336 ore.
  • Il completion window non garantisce che ogni job impieghi 24 ore o che si completi a un orario specifico.

img

Fonte*:* Alibaba Cloud OpenAI-compatible Batch API documentation**.

Uno sconto Batch del 50% non significa sempre un task più economico del 50%

Batch dimezza il prezzo unitario dei token di input e output. Non controlla quanti token di thinking genera il modello.

Il seguente esempio usa solo il rapporto input/output US-local per illustrare l’aritmetica. Non implica che il percorso US-local supporti attualmente Batch.

Illustrative scenarioInput tokensOutput including thinkingEstimated cost
Real-time, thinking disabled100K10K$0.0560
Batch, moderate thinking100K40K$0.0520
Batch, heavier thinking100K50K$0.0600

L’esempio in tempo reale è calcolato come:

  • Input: 100K ÷ 1M × $0.40 = $0.0400
  • Output: 10K ÷ 1M × $1.60 = $0.0160
  • Totale: $0.0560

L’esempio Batch con thinking moderato è calcolato usando tariffe a metà prezzo:

  • Input: 100K ÷ 1M × $0.20 = $0.0200
  • Output: 40K ÷ 1M × $0.80 = $0.0320
  • Totale: $0.0520

L’esempio Batch con thinking più intenso è:

  • Input: 100K ÷ 1M × $0.20 = $0.0200
  • Output: 50K ÷ 1M × $0.80 = $0.0400
  • Totale: $0.0600

Nello scenario finale, l’output di thinking aggiuntivo elimina completamente il risparmio nominale del Batch.

Per carichi offline deterministici come classificazione, estrazione, tagging e formattazione, imposta esplicitamente:

{
  "enable_thinking": false
}

Per task più complessi, imposta un thinking_budget adeguato e confronta il costo per task riuscito invece di assumere che lo sconto Batch headline riduca il conto finale esattamente del 50%.

Per pianificazioni US o Global, considera i risparmi Batch come non confermati finché l’ID modello esatto e il percorso non compaiano nella console corrente o nella documentazione regionale.

Token di thinking e costi di output

Qwen3.7 Plus supporta le modalità con e senza thinking.

Il thinking può migliorare le prestazioni su ragionamento complesso, coding, pianificazione e workflow di agent. Tuttavia, i token di thinking aumentano l’uso di output e sono fatturati al tasso dei token di output.

Questo è importante perché i token di output costano quattro volte i token di input sui livelli tariffari di Alibaba per Qwen3.7 Plus.

Per il percorso US-local sotto 256K:

  • Input: $0.40 per 1M token
  • Output: $1.60 per 1M token

Sopra 256K:

  • Input: $1.20 per 1M token
  • Output: $4.80 per 1M token

Per carichi sensibili al costo, considera di disabilitare o limitare il thinking per task semplici come:

  • Estrazione dati
  • Formattazione
  • Classificazione
  • Content tagging
  • Semplice sintesi
  • Instradamento di base
  • Generazione di output strutturati

Usa budget di thinking più lunghi solo quando i dati di valutazione mostrano che migliorano materialmente il completamento del task.

Qwen3.7 Plus vs Qwen3.7 Max vs Qwen3.6 Plus nei prezzi CometAPI

ModelCurrent CometAPI listed priceBest first testMain cost consideration
qwen3.7-plus$0.32/M input; $1.28/M outputAgenti multimodali, screenshot, visual coding, documenti, grafici e workflow UISoglia 256K sui percorsi Alibaba diretti, loop di strumenti e thinking output
qwen3.7-max$1.36/M input; $4.08/M outputCoding autonomo solo testo, deep reasoning e agent a lungo orizzonteLe attuali liste Qwen API mostrano input solo testo; non instradare carichi immagine o video a Max
qwen3.6-plus$0.32/M input; $1.92/M outputBaseline di migrazione per workflow Qwen3.6 esistentiPrezzo di output più alto rispetto a Qwen3.7 Plus

Fonti: CometAPI Qwen3.7 Plus model page**; CometAPI Qwen3.7 Max model pageCometAPI Qwen3.6 Plus model page

Qwen posiziona Qwen3.7 Plus come modello multimodale per comprensione visiva, coding, interazione con GUI, uso di strumenti e workflow di produttività.

Le attuali liste Qwen API mostrano Qwen3.7 Max con input testo e output testo, mentre la documentazione di comprensione visiva di Alibaba elenca Qwen3.7 Plus per input immagine e video.

Inizia con Plus quando il task include:

  • Immagini
  • Video
  • Screenshot
  • Documenti
  • Grafici
  • Stato dell’interfaccia
  • Visual coding
  • Interazione con GUI

Prova Max per lavoro solo testo quando un tasso di task risolti più alto può giustificare il costo token maggiore.

Come ridurre i costi dell’API Qwen3.7 Plus

1. Misura il traffico attorno alla soglia 256K

Raggruppa le richieste di produzione per lunghezza totale di input:

  • 0–32K
  • 32K–128K
  • 128K–256K
  • Sopra 256K

Poi rivedi quali workflow necessitano davvero della fascia di prezzo più alta.

Una richiesta non dovrebbe superare 256K solo perché per impostazione predefinita sono stati inclusi tutti i documenti disponibili, i turni di conversazione, i risultati degli strumenti o i file di repository.

2. Aggiungi un controllo preventivo dei token

Usa un counter di token compatibile con il modello nel livello applicativo o API gateway prima dell’invio di ogni richiesta.

Le seguenti soglie sono un euristico ingegneristico, non una regola Alibaba:

  • Sotto 220K: invia normalmente.
  • Tra 220K e 240K: registra un warning e previeni la crescita di contesto non necessaria.
  • Sopra circa 240K: compatta il contesto prima dell’invio.
  • Sopra 256K: procedi solo quando il guadagno atteso in qualità giustifica la fascia di prezzo superiore di Alibaba.

Quando il guard si attiva, il workflow può:

  1. Riassumere output di strumenti più vecchi.
  2. Rimuovere risultati di ricerca duplicati.
  3. Sostituire log grezzi con riepiloghi strutturati degli errori.
  4. Recuperare solo i chunk di documento più rilevanti.
  5. Spostare i turni di conversazione più vecchi in un blocco di memoria compresso.
  6. Suddividere gruppi di documenti realmente indipendenti in chiamate separate.
  7. Instradare il task a un provider con prezzo long-context piatto confermato, quando appropriato.

Lascia un margine di sicurezza perché:

  • Gli input immagine consumano token
  • Gli schemi degli strumenti aggiungono contesto
  • I messaggi di sistema possono essere grandi
  • Il contenuto web recuperato può crescere in modo imprevisto
  • I tokenizer possono contare lo stesso testo in modo diverso

Strumenti di osservabilità come Langfuse possono aiutare a monitorare l’uso di token. Un gateway come APISIX può far rispettare la soglia se abbinato a un tokenizer adatto o a una policy di routing personalizzata.

3. Metti prima i contenuti stabili

Posiziona il contenuto riutilizzabile vicino all’inizio del prompt, inclusi:

  • Istruzioni di sistema
  • Blocchi di policy
  • Schemi degli strumenti
  • Sommari di repository
  • Cataloghi prodotto
  • Documenti riutilizzabili
  • Linee guida di brand
  • Schemi di output

Posiziona più avanti il contenuto utente ad alta variabilità.

I prefissi stabili migliorano la probabilità di un hit della cache implicita e rendono i blocchi di cache esplicita più facili da gestire.

4. Riassumi i risultati vecchi degli strumenti

I workflow di agent possono accumulare grandi quantità di contesto tramite:

  • Risultati di ricerca
  • Output del browser
  • Log di esecuzione del codice
  • Risposte precedenti del modello
  • Messaggi di errore
  • Schemi degli strumenti

Invece di mantenere tutto l’output grezzo, riassumi periodicamente il contesto più vecchio e conserva solo le informazioni necessarie per il passo successivo.

5. Controlla l’output di thinking

Registra separatamente i token di thinking da quelli della risposta visibile.

Per task semplici, disabilita il thinking dove supportato o imposta un budget di ragionamento più piccolo.

Per task complessi, confronta il costo di ragionamento aggiuntivo con la riduzione di retry, errori e revisione umana.

6. Conta le chiamate agli strumenti e i token recuperati

Per agent con Web Search, registra:

  • Chiamate di ricerca
  • Chiamate dell’estrattore
  • Token del contenuto recuperato
  • Retry di ricerca
  • Retry del modello
  • Chiamate di fallback
  • Risultato finale del task

La tariffa dello strumento di ricerca può dominare le richieste piccole, mentre il contenuto recuperato può dominare le richieste lunghe.

7. Ottimizza per costo per task completato

Non confrontare i percorsi solo per il costo pubblicizzato per milione di token.

Misura:

  • Costo per richiesta
  • Costo per task completato
  • Tasso di successo del task
  • Tasso di retry
  • Tasso di fallback
  • Tasso di hit della cache
  • Chiamate di ricerca per task
  • Latenza
  • Tempo di revisione umana

Un modello più economico può diventare più costoso se genera risposte errate, richiede chiamate aggiuntive o crea più lavoro manuale.

Un piano pratico di valutazione per Qwen3.7 Plus

Prima di muovere traffico di produzione, crea un set di valutazione mirato basato sui tuoi carichi effettivi.

Un set di 30 task è di solito sufficiente per identificare differenze importanti in costo, latenza e qualità di completamento.

Evaluation sliceExample tasksPrimary metric
Visual understandingScreenshot, ricevute, grafici e pagine UICorrettezza e qualità delle evidenze
Visual codingDa mockup a componente, da screenshot a frontend, e ricostruzione SVGOutput eseguibile e tempo di modifica
Long context below 256KPolicy, repository e insiemi di documentiAccuratezza, latenza e tasso di hit della cache
Over-256K stressTask con 300K–600K token di inputQualità guadagnata rispetto al costo aggiuntivo di fascia
Search-grounded QAFatti correnti e ricerca prodottoChiamate di ricerca, token recuperati e accuratezza fondata
Agent workflowTask multi-step di coding o browserTasso di task risolti, retry, latenza e costo totale

Per ogni task, registra:

  • Token di input
  • Token di output
  • Token di thinking
  • Token in cache
  • Token di creazione cache
  • Chiamate di ricerca
  • Token del contenuto recuperato
  • Latenza
  • Numero di retry
  • Risultato finale del task

Il CometAPI Cookbook include ulteriori esempi di integrazione e routing dei modelli per questo tipo di valutazione.

FAQ

Quanto costa l’API Qwen3.7 Plus?

Il percorso US-local qwen3.7-plus-us di Alibaba costa $0.40 per 1M token di input e $1.60 per 1M token di output per richieste fino a 256K token di input.

Per richieste sopra 256K e fino a 1M, il prezzo aumenta a $1.20 per 1M token di input e $4.80 per 1M token di output.

Il percorso Global di Alibaba ha il prezzo di listino più basso in questo confronto. Il modello è disponibile anche tramite CometAPI a un prezzo indicato di $0.32 per 1M token di input e $1.28 per 1M token di output.

Come vengono tariffate le richieste long-context tramite CometAPI?

La scheda di Qwen3.7 Plus mostra un’unica tariffa di $0.32/M input e $1.28/M output, ma attualmente non specifica se si applica una fascia separata sopra 256K token.

Al prezzo visualizzato**, una richiesta con 400K token di input e 20K token di output costerebbe $0.1536**. Tratta questa come una stima finché la policy di fatturazione long-context non sarà confermata.

Qwen3.7 Plus è disponibile negli Stati Uniti?

Sì. Alibaba elenca un ID modello US-local chiamato qwen3.7-plus-us nella regione US (Virginia).

Alibaba elenca anche il percorso Global qwen3.7-plus nella stessa sezione prezzi regionale.

Scegli un percorso in base a:

  • Requisiti di deployment
  • Luogo di elaborazione dei dati
  • Supporto strumenti
  • Latenza
  • Disponibilità
  • Prezzo effettivo

Perché il prezzo di Qwen3.7 Plus salta dopo 256K token?

Alibaba sceglie la fascia di prezzo in base al conteggio totale dei token di input in una singola richiesta.

Una volta che la richiesta supera 256K token di input, tutti i token di input e output fatturati in quella richiesta usano le tariffe mostrate per la fascia superiore.

La tariffazione non è progressiva.

La Context Cache riduce i costi di Qwen3.7 Plus?

Sì.

Alibaba afferma che gli hit della cache esplicita sono fatturati al 10% del tasso normale di input, mentre gli hit della cache implicita al 20%.

La creazione della cache esplicita costa il 125% del normale prezzo di input, e la cache resta valida cinque minuti, con il timer che si resetta dopo ogni hit riuscito.

In un confronto ideale con hit ripetuti della cache implicita, la cache esplicita diventa più economica dopo una creazione e tre riusi riusciti.

Web Search aggiunge due costi:

  1. Il contenuto web recuperato aumenta l’uso normale di token di input.
  2. Lo strumento di ricerca ha una tariffa separata per 1,000 chiamate.

La tariffa attualmente documentata è:

  • $0.573411 per 1,000 chiamate per gli ambiti Global e Chinese-mainland
  • $10 per 1,000 chiamate per l’ambito International

Qwen3.7 Plus supporta la Batch API?

L’esatto qwen3.7-plus è attualmente elencato per Batch sotto China (Beijing), dove i token riusciti sono addebitati al 50% dei prezzi di inferenza in tempo reale e il contesto è limitato a 256K.

La documentazione corrente non elenca il percorso US-local qwen3.7-plus-us per Batch.

Non dare per scontato che lo sconto Batch si applichi alle distribuzioni US-local o Global senza verificare la disponibilità in console corrente.

Qwen3.7 Plus è più economico di Qwen3.7 Max?

Sì, in base alle tariffe riportate in questo confronto.

Qwen3.7 Plus è indicato a:

  • $0.32 per 1M token di input
  • $1.28 per 1M token di output

Qwen3.7 Max è indicato a:

  • $1.36 per 1M token di input
  • $4.08 per 1M token di output

Max può comunque risultare più economico per task testuali difficili se li completa con meno retry.

Meglio usare Alibaba direttamente o un aggregatore API?

L’accesso diretto ad Alibaba è la scelta più chiara quando un carico dipende da un ambito di deployment specifico, da una funzionalità nativa del provider, da un controllo regionale o da una relazione di fatturazione diretta.

Uno strato di aggregazione può essere più pratico quando la stessa applicazione deve testare o instradare su più famiglie di modelli. CometAPI, ad esempio, espone Qwen3.7 Plus insieme a modelli di provider come OpenAI, Anthropic, Google, Moonshot e DeepSeek tramite un’interfaccia compatibile con OpenAI.

Il percorso migliore dipende dai requisiti regionali, dal costo effettivo, dallo sforzo di integrazione, dalle necessità di fallback e dal bisogno di funzionalità native Alibaba.

Esegui un confronto in stile produzione prima di scegliere un percorso

Le tariffe per token pubblicate sono utili per restringere le opzioni, ma la decisione finale dovrebbe derivare da un carico simile alla produzione.

Un approccio pratico è eseguire lo stesso set di valutazione su Qwen3.7 Plus, Qwen3.7 Max e alcune alternative rilevanti. Un servizio API unificato come CometAPI può semplificare questo confronto esponendo i modelli Qwen, Claude, Gemini, GPT, Kimi e DeepSeek tramite la stessa interfaccia compatibile con OpenAI.

Durante il test, registra:

  • Token di input e output
  • Uso dei token di thinking
  • Uso della cache
  • Chiamate agli strumenti
  • Retry
  • Latenza
  • Successo del task

Usa la pagina del modello Qwen3.7 Plus come punto di partenza, quindi scegli il percorso con il costo più basso per task completato, non semplicemente il prezzo per token pubblicizzato più basso.

Continua a imparare

Collega questo articolo alla prossima decisione.

Vedi tutti gli argomenti
Pubblicato il Jul 14, 2026
Ultimo aggiornamento Aug 30, 2026
49 visualizzazioni
Revisionato per chiarezza, attribuzione delle fonti e terminologia API aggiornata.

Pronto a ridurre i costi di sviluppo AI del 20%?

Inizia gratuitamente in pochi minuti. Crediti di prova gratuiti inclusi. Nessuna carta di credito richiesta.

Leggi di più