TL;DR Qwen3.7 Plus parte da $0.40/M input e $1.60/M output sul percorso US-local di Alibaba, mentre il percorso Global parte da $0.276/M e $1.101/M. Per confronto, CometAPI attualmente indica il modello a $0.32/M in input e $1.28/M in output. Il principale rischio di costo è la soglia a 256K di Alibaba: una volta superata, il livello superiore si applica all’intera richiesta.
Panoramica dei prezzi dell'API Qwen3.7 Plus
Qwen3.7 Plus non ha un prezzo API universale. Il costo finale dipende dal percorso di deployment, dalla lunghezza della richiesta, da sconti temporanei, dall’uso della cache, dal thinking output, dalle chiamate Web Search e dalla disponibilità di funzionalità per area.
| Route | Input tokens per request | Input price / 1M | Output price / 1M | Current pricing note |
|---|---|---|---|---|
| Alibaba US-local qwen3.7-plus-us | 0–256K | $0.40 | $1.60 | Nessuna etichetta promozionale mostrata sulla riga US-local corrente |
| Alibaba US-local qwen3.7-plus-us | >256K–1M | $1.20 | $4.80 | Il livello superiore si applica all’intera richiesta |
| Alibaba Global qwen3.7-plus | 0–256K | $0.28 | $1.10 | Sono attualmente mostrati sconti a tempo limitato diurni e notturni |
| Alibaba Global qwen3.7-plus | >256K–1M | $0.83 | $3.30 | Sono attualmente mostrati sconti a tempo limitato diurni e notturni |
| Alibaba International qwen3.7-plus | 0–256K | $0.40 list price | $1.60 list price | La pagina attuale mostra uno sconto a tempo limitato del 20% |
| Alibaba International qwen3.7-plus | >256K–1M | $1.20 list price | $4.80 list price | La pagina attuale mostra uno sconto a tempo limitato del 20% |
| CometAPI routed qwen3.7-plus | Check live route | $0.32 | $1.28 | Prezzo in evidenza mostrato sulla pagina del modello attuale |
Alibaba documenta una finestra di contesto da 1,000,000 token per qwen3.7-plus.
Fonti:**[Alibaba Cloud Model Studio pricing]
Nota sugli sconti temporanei di Alibaba
La tabella prezzi attuale di Alibaba etichetta il percorso Global qwen3.7-plus con uno sconto limitato del 20% di giorno e del 60% di notte.
La finestra notturna pubblicata è 22:00–08:00 UTC**+8**, basata sull’orario di fatturazione. Il percorso International mostra attualmente uno sconto limitato del 20%.
Poiché queste promozioni possono cambiare o scadere, i calcoli seguenti usano i prezzi di listino standard salvo esplicita indicazione contraria. Per una previsione operativa live, verificare la console Model Studio e la pagina prezzi il giorno in cui si invia traffico.
Prezzi Alibaba US-local vs Global
La distinzione più importante per gli sviluppatori US è che i percorsi US-local e Global di Alibaba non usano la stessa riga di prezzo.
L’ID modello US-local è:
qwen3.7-plus-us
Il prezzo di listino parte da:
- $0.40 per 1M token di input
- $1.60 per 1M token di output
L’ID modello Global è:
qwen3.7-plus
Il prezzo di listino parte da:
- $0.276 per 1M token di input
- $1.101 per 1M token di output
Il percorso Global è più economico in base al listino pubblicato, ma il costo non dovrebbe essere l’unico fattore di instradamento.
I team dovrebbero considerare anche:
- Requisiti di data residency
- Disponibilità regionale
- Latenza
- Supporto strumenti
- Requisiti di conformità
- Stabilità del servizio
- Sconti temporanei del provider
Un percorso Global a prezzo inferiore potrebbe non essere adatto per carichi che richiedono elaborazione in una regione specifica.
Come funziona la soglia tariffaria a 256K
Alibaba Cloud usa il numero totale di token di input in una singola richiesta per selezionare la fascia di prezzo.
Se una richiesta supera i 256K token di input, il prezzo unitario più alto si applica a ogni token fatturato in quella richiesta, inclusi i token di output al tasso di output mostrato per la fascia superiore.
Una richiesta da 300K token non viene fatturata come:
- 256K token al prezzo inferiore
- 44K token al prezzo superiore
Invece, l’intera richiesta usa la fascia di prezzo superiore.
Per il percorso US-local, ciò significa che il prezzo passa da:
- $0.40 a $1.20 per 1M token di input
- $1.60 a $4.80 per 1M token di output
Le tariffe più alte si applicano a tutti i token di input e di output fatturabili in quella richiesta.
Esempi di costo per Qwen3.7 Plus
Esempio 1: una richiesta sotto 256K
Supponiamo che una richiesta contenga:
- 100,000 token di input
- 10,000 token di output
| Route | Input calculation | Output calculation | Estimated list-price cost |
|---|---|---|---|
| Alibaba US-local | 100K ÷ 1M × $0.40 = $0.0400 | 10K ÷ 1M × $1.60 = $0.0160 | $0.0560 |
| Alibaba Global | 100K ÷ 1M × $0.276 = $0.0276 | 10K ÷ 1M × $1.101 = $0.0110 | $0.0386 |
| CometAPI | 100K ÷ 1M × $0.32 = $0.0320 | 10K ÷ 1M × $1.28 = $0.0128 | $0.0448 |
Le cifre Alibaba sopra usano i prezzi di listino pubblicati prima di eventuali sconti temporanei applicabili.
Esempio 2: una richiesta sopra 256K
Supponiamo ora che una richiesta contenga:
- 400,000 token di input
- 20,000 token di output
Poiché la richiesta supera i 256K token di input, Alibaba Cloud applica la fascia superiore a tutti i token di input e output nella richiesta.
| Route | Input calculation | Output calculation | Estimated cost |
|---|---|---|---|
| Alibaba US-local | 400K ÷ 1M × $1.20 = $0.4800 | 20K ÷ 1M × $4.80 = $0.0960 | $0.5760 |
| Alibaba Global | 400K ÷ 1M × $0.826 = $0.3304 | 20K ÷ 1M × $3.301 = $0.0660 | $0.3964 |
| CometAPI headline-rate scenario* | 400K ÷ 1M × $0.32 = $0.1280 | 20K ÷ 1M × $1.28 = $0.0256 | $0.1536* |
La cifra CometAPI è una stima condizionale, non un prezzo di produzione confermato per richieste sopra 256K.
La pagina pubblica del modello CometAPI mostra attualmente un solo prezzo in evidenza e circa 991.8K token massimi di input. Tuttavia, non specifica se per richieste sopra 256K:
- Si mantiene lo stesso prezzo in evidenza
- Si usa una fascia di prezzo separata per il long-context
- Viene applicato un sovrapprezzo di instradamento
Se le tariffe in evidenza restassero invariate sopra 256K, il costo stimato sarebbe:
- Input: 400K ÷ 1M × $0.32 = $0.1280
- Output: 20K ÷ 1M × $1.28 = $0.0256
- Totale: $0.1536
Fonte*:* CometAPI Qwen3.7 Plus Pricing
Suddividere una richiesta grande può ridurre il costo?
In alcuni casi, sì.
Supponiamo che il task da 400K input possa essere diviso in due richieste indipendenti, ciascuna contenente:
- 200K token di input
- 10K token di output
Sul percorso US-local:
| Plan | Calculation | Estimated cost |
|---|---|---|
| One 400K-input request | $0.4800 input + $0.0960 output | $0.576 |
| Two 200K-input requests | 2 × [($0.0800 input) + ($0.0160 output)] | $0.192 |
La versione a due richieste è significativamente più economica perché entrambe le chiamate restano sotto la soglia 256K.
Tuttavia, questa è un’ottimizzazione illustrativa, non una raccomandazione universale.
Suddividere un task può introdurre:
- Contesto duplicato
- Chiamate API aggiuntive
- Maggiore logica di orchestrazione
- Latenza più alta
- Perdita di contesto tra documenti
- Qualità delle risposte inferiore
Usa questo approccio solo quando il lavoro può essere separato senza indebolire il risultato finale.
Prezzi della Context Cache per Qwen3.7 Plus
La Context Cache può ridurre il costo di prompt di sistema ripetuti, contesto di repository, documenti di policy, cataloghi prodotto e altro materiale di riferimento riutilizzabile.
Alibaba Cloud offre modalità Context Cache esplicita e implicita.
| Cache mode | Cache creation | Cached-input price | Operational detail |
|---|---|---|---|
| Explicit cache | 125% of standard input price | 10% of standard input price | Validità cinque minuti; il timer si resetta dopo un hit; deterministica entro la validità |
| Implicit cache | 100% of standard input price | 20% of standard input price | Rilevamento automatico del common prefix; la probabilità di hit non è garantita |
Fonte: Alibaba Cloud Context Cache documentation.
Esempio di costo della Context Cache
Supponiamo che un workflow US-local invii ripetutamente:
- 80K token di prefisso stabile
- 5K nuovi token di input
- 5K token di output
| Scenario | Input cost | Output cost | Estimated cost per request |
|---|---|---|---|
| No cache | 85K ÷ 1M × $0.40 = $0.0340 | 5K ÷ 1M × $1.60 = $0.0080 | $0.04 |
| Implicit cache hit on 80K | (80K ÷ 1M × $0.08) + (5K ÷ 1M × $0.40) = $0.0084 | $0.01 | $0.02 |
| Explicit cache hit on 80K | (80K ÷ 1M × $0.04) + (5K ÷ 1M × $0.40) = $0.0052 | $0.01 | $0.01 |
La cache esplicita ha una validità di cinque minuti che si resetta dopo un hit riuscito, non un TTL minimo di un’ora.
I token di creazione della cache costano il 125% del normale prezzo di input, mentre gli hit successivi costano il 10%.
Quando la cache esplicita diventa più economica?
Per il solo prefisso stabile, sia N il numero totale di richieste con prefisso identico.
Il costo normalizzato della cache esplicita è:
1.25 + 0.10 × (N − 1)
Una sequenza ideale con cache implicita è:
1.00 + 0.20 × (N − 1)
Sotto l’ipotesi semplificata che ogni richiesta dopo la prima ottenga un hit della cache implicita, la cache esplicita diventa più economica a quattro richieste totali:
- Una richiesta di creazione cache
- Tre riusi di cache riusciti
Rispetto alla mancata cache, la cache esplicita diventa più economica dalla seconda richiesta totale.
Nei carichi reali, il punto di pareggio può variare perché gli hit della cache implicita non sono garantiti.
Monitora:
- Token di input in cache
- Token di creazione cache
- Token di input non in cache
- Token di output
- Tasso di hit della cache
- Numero di retry
- Tasso di successo del task
Ridurre i token non aiuta se miss di cache o regressioni di qualità portano a più retry.
Prezzi di Qwen Web Search
Per qwen3.7-plus, Alibaba indirizza gli sviluppatori a usare lo strumento Responses API web_search.
Web Search aggiunge due componenti di costo separati:
- Il contenuto web recuperato viene aggiunto al prompt del modello ed è fatturato come normali token di input.
- La policy di ricerca ha una tariffa separata per 1,000 chiamate.
Le tariffe agent attualmente documentate sono:
| Deployment scope | Web Search fee / 1,000 calls |
|---|---|
| Chinese mainland and Global | $0.57 |
| International | $10.00 |
Fonte: Alibaba Cloud Web Search documentation.
La tabella di supporto attuale elenca qwen3.7-plus per gli ambiti Global e International, ma non elenca l’ID modello US-local qwen3.7-plus-us.
Verifica la disponibilità dello strumento prima di progettare un workflow US-local attorno alla funzionalità Web Search integrata di Alibaba.
Esempio di costo Web Search International
Supponiamo che una richiesta contenga:
- 10K normali token di input
- 2K token di output
- Due chiamate Web Search
Prima di conteggiare i token aggiuntivi restituiti dal motore di ricerca:
| Cost component | Calculation | Cost |
|---|---|---|
| Model input | 10K ÷ 1M × $0.40 list price | $0.0040 |
| Model output | 2K ÷ 1M × $1.60 list price | $0.0032 |
| Web Search | 2 ÷ 1,000 × $10.00 | $0.0200 |
| Total before retrieved-content tokens | $0.0040 + $0.0032 + $0.0200 | $0.0272 |
La tariffa della policy di ricerca rappresenta:
$0.0200 ÷ $0.0272 = 73.5%
In questo esempio, la tariffa di ricerca rappresenta il 73.5% del totale prima di includere i token del contenuto recuperato, ovvero il 74% arrotondando alla percentuale intera più vicina.
Sul percorso Global, la tariffa per chiamata è molto più bassa. Tuttavia, le pagine recuperate possono comunque aumentare significativamente l’uso di token di input o spingere un agente long-running oltre la soglia tariffaria 256K.
Per workflow basati su ricerca, traccia sia:
- Numero di chiamate di ricerca
- Numero di token del contenuto recuperato
Prezzi e disponibilità della Batch API
La Batch File API di Alibaba addebita i token di input e output riusciti al 50% del corrispondente prezzo di inferenza in tempo reale.
È progettata per carichi offline in cui non sono necessarie risposte immediate, tra cui:
- Valutazioni di modelli
- Tagging di documenti
- Classificazione su larga scala
- Generazione di dati sintetici
- Enrichment notturni
- Elaborazione multimodale offline
- Esecuzioni di benchmark
Tuttavia, lo sconto Batch non dovrebbe essere incluso automaticamente in ogni previsione di costo per Qwen3.7 Plus.
La documentazione attuale afferma che:
- L’esatto modello
qwen3.7-plusè elencato sotto China (Beijing). - L’ambito Batch di Singapore elenca alias generici come
qwen-plus, invece dell’ID modello esattoqwen3.7-plus. - La documentazione non elenca
qwen3.7-plus-uscome modello Batch US-local supportato. - Le richieste Batch supportate di Qwen3.7 Plus hanno un contesto massimo di 256K, non 1M.
- Batch non supporta la Context Cache.
- Gli sconti Batch e cache non possono essere combinati.
- La modalità Thinking è abilitata per impostazione predefinita per i job Batch della serie Qwen3.7, salvo configurazione esplicita.
- I token di thinking sono fatturati al tasso dei token di output.
- Il
completion_windowconfigurabile è un periodo massimo di attesa tra 24 e 336 ore. - Il completion window non garantisce che ogni job impieghi 24 ore o che si completi a un orario specifico.
Fonte*:* Alibaba Cloud OpenAI-compatible Batch API documentation**.
Uno sconto Batch del 50% non significa sempre un task più economico del 50%
Batch dimezza il prezzo unitario dei token di input e output. Non controlla quanti token di thinking genera il modello.
Il seguente esempio usa solo il rapporto input/output US-local per illustrare l’aritmetica. Non implica che il percorso US-local supporti attualmente Batch.
| Illustrative scenario | Input tokens | Output including thinking | Estimated cost |
|---|---|---|---|
| Real-time, thinking disabled | 100K | 10K | $0.0560 |
| Batch, moderate thinking | 100K | 40K | $0.0520 |
| Batch, heavier thinking | 100K | 50K | $0.0600 |
L’esempio in tempo reale è calcolato come:
- Input: 100K ÷ 1M × $0.40 = $0.0400
- Output: 10K ÷ 1M × $1.60 = $0.0160
- Totale: $0.0560
L’esempio Batch con thinking moderato è calcolato usando tariffe a metà prezzo:
- Input: 100K ÷ 1M × $0.20 = $0.0200
- Output: 40K ÷ 1M × $0.80 = $0.0320
- Totale: $0.0520
L’esempio Batch con thinking più intenso è:
- Input: 100K ÷ 1M × $0.20 = $0.0200
- Output: 50K ÷ 1M × $0.80 = $0.0400
- Totale: $0.0600
Nello scenario finale, l’output di thinking aggiuntivo elimina completamente il risparmio nominale del Batch.
Per carichi offline deterministici come classificazione, estrazione, tagging e formattazione, imposta esplicitamente:
{
"enable_thinking": false
}
Per task più complessi, imposta un thinking_budget adeguato e confronta il costo per task riuscito invece di assumere che lo sconto Batch headline riduca il conto finale esattamente del 50%.
Per pianificazioni US o Global, considera i risparmi Batch come non confermati finché l’ID modello esatto e il percorso non compaiano nella console corrente o nella documentazione regionale.
Token di thinking e costi di output
Qwen3.7 Plus supporta le modalità con e senza thinking.
Il thinking può migliorare le prestazioni su ragionamento complesso, coding, pianificazione e workflow di agent. Tuttavia, i token di thinking aumentano l’uso di output e sono fatturati al tasso dei token di output.
Questo è importante perché i token di output costano quattro volte i token di input sui livelli tariffari di Alibaba per Qwen3.7 Plus.
Per il percorso US-local sotto 256K:
- Input: $0.40 per 1M token
- Output: $1.60 per 1M token
Sopra 256K:
- Input: $1.20 per 1M token
- Output: $4.80 per 1M token
Per carichi sensibili al costo, considera di disabilitare o limitare il thinking per task semplici come:
- Estrazione dati
- Formattazione
- Classificazione
- Content tagging
- Semplice sintesi
- Instradamento di base
- Generazione di output strutturati
Usa budget di thinking più lunghi solo quando i dati di valutazione mostrano che migliorano materialmente il completamento del task.
Qwen3.7 Plus vs Qwen3.7 Max vs Qwen3.6 Plus nei prezzi CometAPI
| Model | Current CometAPI listed price | Best first test | Main cost consideration |
|---|---|---|---|
| qwen3.7-plus | $0.32/M input; $1.28/M output | Agenti multimodali, screenshot, visual coding, documenti, grafici e workflow UI | Soglia 256K sui percorsi Alibaba diretti, loop di strumenti e thinking output |
| qwen3.7-max | $1.36/M input; $4.08/M output | Coding autonomo solo testo, deep reasoning e agent a lungo orizzonte | Le attuali liste Qwen API mostrano input solo testo; non instradare carichi immagine o video a Max |
| qwen3.6-plus | $0.32/M input; $1.92/M output | Baseline di migrazione per workflow Qwen3.6 esistenti | Prezzo di output più alto rispetto a Qwen3.7 Plus |
Fonti: CometAPI Qwen3.7 Plus model page**; CometAPI Qwen3.7 Max model page;CometAPI Qwen3.6 Plus model page
Qwen posiziona Qwen3.7 Plus come modello multimodale per comprensione visiva, coding, interazione con GUI, uso di strumenti e workflow di produttività.
Le attuali liste Qwen API mostrano Qwen3.7 Max con input testo e output testo, mentre la documentazione di comprensione visiva di Alibaba elenca Qwen3.7 Plus per input immagine e video.
Inizia con Plus quando il task include:
- Immagini
- Video
- Screenshot
- Documenti
- Grafici
- Stato dell’interfaccia
- Visual coding
- Interazione con GUI
Prova Max per lavoro solo testo quando un tasso di task risolti più alto può giustificare il costo token maggiore.
Come ridurre i costi dell’API Qwen3.7 Plus
1. Misura il traffico attorno alla soglia 256K
Raggruppa le richieste di produzione per lunghezza totale di input:
- 0–32K
- 32K–128K
- 128K–256K
- Sopra 256K
Poi rivedi quali workflow necessitano davvero della fascia di prezzo più alta.
Una richiesta non dovrebbe superare 256K solo perché per impostazione predefinita sono stati inclusi tutti i documenti disponibili, i turni di conversazione, i risultati degli strumenti o i file di repository.
2. Aggiungi un controllo preventivo dei token
Usa un counter di token compatibile con il modello nel livello applicativo o API gateway prima dell’invio di ogni richiesta.
Le seguenti soglie sono un euristico ingegneristico, non una regola Alibaba:
- Sotto 220K: invia normalmente.
- Tra 220K e 240K: registra un warning e previeni la crescita di contesto non necessaria.
- Sopra circa 240K: compatta il contesto prima dell’invio.
- Sopra 256K: procedi solo quando il guadagno atteso in qualità giustifica la fascia di prezzo superiore di Alibaba.
Quando il guard si attiva, il workflow può:
- Riassumere output di strumenti più vecchi.
- Rimuovere risultati di ricerca duplicati.
- Sostituire log grezzi con riepiloghi strutturati degli errori.
- Recuperare solo i chunk di documento più rilevanti.
- Spostare i turni di conversazione più vecchi in un blocco di memoria compresso.
- Suddividere gruppi di documenti realmente indipendenti in chiamate separate.
- Instradare il task a un provider con prezzo long-context piatto confermato, quando appropriato.
Lascia un margine di sicurezza perché:
- Gli input immagine consumano token
- Gli schemi degli strumenti aggiungono contesto
- I messaggi di sistema possono essere grandi
- Il contenuto web recuperato può crescere in modo imprevisto
- I tokenizer possono contare lo stesso testo in modo diverso
Strumenti di osservabilità come Langfuse possono aiutare a monitorare l’uso di token. Un gateway come APISIX può far rispettare la soglia se abbinato a un tokenizer adatto o a una policy di routing personalizzata.
3. Metti prima i contenuti stabili
Posiziona il contenuto riutilizzabile vicino all’inizio del prompt, inclusi:
- Istruzioni di sistema
- Blocchi di policy
- Schemi degli strumenti
- Sommari di repository
- Cataloghi prodotto
- Documenti riutilizzabili
- Linee guida di brand
- Schemi di output
Posiziona più avanti il contenuto utente ad alta variabilità.
I prefissi stabili migliorano la probabilità di un hit della cache implicita e rendono i blocchi di cache esplicita più facili da gestire.
4. Riassumi i risultati vecchi degli strumenti
I workflow di agent possono accumulare grandi quantità di contesto tramite:
- Risultati di ricerca
- Output del browser
- Log di esecuzione del codice
- Risposte precedenti del modello
- Messaggi di errore
- Schemi degli strumenti
Invece di mantenere tutto l’output grezzo, riassumi periodicamente il contesto più vecchio e conserva solo le informazioni necessarie per il passo successivo.
5. Controlla l’output di thinking
Registra separatamente i token di thinking da quelli della risposta visibile.
Per task semplici, disabilita il thinking dove supportato o imposta un budget di ragionamento più piccolo.
Per task complessi, confronta il costo di ragionamento aggiuntivo con la riduzione di retry, errori e revisione umana.
6. Conta le chiamate agli strumenti e i token recuperati
Per agent con Web Search, registra:
- Chiamate di ricerca
- Chiamate dell’estrattore
- Token del contenuto recuperato
- Retry di ricerca
- Retry del modello
- Chiamate di fallback
- Risultato finale del task
La tariffa dello strumento di ricerca può dominare le richieste piccole, mentre il contenuto recuperato può dominare le richieste lunghe.
7. Ottimizza per costo per task completato
Non confrontare i percorsi solo per il costo pubblicizzato per milione di token.
Misura:
- Costo per richiesta
- Costo per task completato
- Tasso di successo del task
- Tasso di retry
- Tasso di fallback
- Tasso di hit della cache
- Chiamate di ricerca per task
- Latenza
- Tempo di revisione umana
Un modello più economico può diventare più costoso se genera risposte errate, richiede chiamate aggiuntive o crea più lavoro manuale.
Un piano pratico di valutazione per Qwen3.7 Plus
Prima di muovere traffico di produzione, crea un set di valutazione mirato basato sui tuoi carichi effettivi.
Un set di 30 task è di solito sufficiente per identificare differenze importanti in costo, latenza e qualità di completamento.
| Evaluation slice | Example tasks | Primary metric |
|---|---|---|
| Visual understanding | Screenshot, ricevute, grafici e pagine UI | Correttezza e qualità delle evidenze |
| Visual coding | Da mockup a componente, da screenshot a frontend, e ricostruzione SVG | Output eseguibile e tempo di modifica |
| Long context below 256K | Policy, repository e insiemi di documenti | Accuratezza, latenza e tasso di hit della cache |
| Over-256K stress | Task con 300K–600K token di input | Qualità guadagnata rispetto al costo aggiuntivo di fascia |
| Search-grounded QA | Fatti correnti e ricerca prodotto | Chiamate di ricerca, token recuperati e accuratezza fondata |
| Agent workflow | Task multi-step di coding o browser | Tasso di task risolti, retry, latenza e costo totale |
Per ogni task, registra:
- Token di input
- Token di output
- Token di thinking
- Token in cache
- Token di creazione cache
- Chiamate di ricerca
- Token del contenuto recuperato
- Latenza
- Numero di retry
- Risultato finale del task
Il CometAPI Cookbook include ulteriori esempi di integrazione e routing dei modelli per questo tipo di valutazione.
FAQ
Quanto costa l’API Qwen3.7 Plus?
Il percorso US-local qwen3.7-plus-us di Alibaba costa $0.40 per 1M token di input e $1.60 per 1M token di output per richieste fino a 256K token di input.
Per richieste sopra 256K e fino a 1M, il prezzo aumenta a $1.20 per 1M token di input e $4.80 per 1M token di output.
Il percorso Global di Alibaba ha il prezzo di listino più basso in questo confronto. Il modello è disponibile anche tramite CometAPI a un prezzo indicato di $0.32 per 1M token di input e $1.28 per 1M token di output.
Come vengono tariffate le richieste long-context tramite CometAPI?
La scheda di Qwen3.7 Plus mostra un’unica tariffa di $0.32/M input e $1.28/M output, ma attualmente non specifica se si applica una fascia separata sopra 256K token.
Al prezzo visualizzato**, una richiesta con 400K token di input e 20K token di output costerebbe $0.1536**. Tratta questa come una stima finché la policy di fatturazione long-context non sarà confermata.
Qwen3.7 Plus è disponibile negli Stati Uniti?
Sì. Alibaba elenca un ID modello US-local chiamato qwen3.7-plus-us nella regione US (Virginia).
Alibaba elenca anche il percorso Global qwen3.7-plus nella stessa sezione prezzi regionale.
Scegli un percorso in base a:
- Requisiti di deployment
- Luogo di elaborazione dei dati
- Supporto strumenti
- Latenza
- Disponibilità
- Prezzo effettivo
Perché il prezzo di Qwen3.7 Plus salta dopo 256K token?
Alibaba sceglie la fascia di prezzo in base al conteggio totale dei token di input in una singola richiesta.
Una volta che la richiesta supera 256K token di input, tutti i token di input e output fatturati in quella richiesta usano le tariffe mostrate per la fascia superiore.
La tariffazione non è progressiva.
La Context Cache riduce i costi di Qwen3.7 Plus?
Sì.
Alibaba afferma che gli hit della cache esplicita sono fatturati al 10% del tasso normale di input, mentre gli hit della cache implicita al 20%.
La creazione della cache esplicita costa il 125% del normale prezzo di input, e la cache resta valida cinque minuti, con il timer che si resetta dopo ogni hit riuscito.
In un confronto ideale con hit ripetuti della cache implicita, la cache esplicita diventa più economica dopo una creazione e tre riusi riusciti.
Come funziona la tariffazione di Qwen Web Search?
Web Search aggiunge due costi:
- Il contenuto web recuperato aumenta l’uso normale di token di input.
- Lo strumento di ricerca ha una tariffa separata per 1,000 chiamate.
La tariffa attualmente documentata è:
- $0.573411 per 1,000 chiamate per gli ambiti Global e Chinese-mainland
- $10 per 1,000 chiamate per l’ambito International
Qwen3.7 Plus supporta la Batch API?
L’esatto qwen3.7-plus è attualmente elencato per Batch sotto China (Beijing), dove i token riusciti sono addebitati al 50% dei prezzi di inferenza in tempo reale e il contesto è limitato a 256K.
La documentazione corrente non elenca il percorso US-local qwen3.7-plus-us per Batch.
Non dare per scontato che lo sconto Batch si applichi alle distribuzioni US-local o Global senza verificare la disponibilità in console corrente.
Qwen3.7 Plus è più economico di Qwen3.7 Max?
Sì, in base alle tariffe riportate in questo confronto.
Qwen3.7 Plus è indicato a:
- $0.32 per 1M token di input
- $1.28 per 1M token di output
Qwen3.7 Max è indicato a:
- $1.36 per 1M token di input
- $4.08 per 1M token di output
Max può comunque risultare più economico per task testuali difficili se li completa con meno retry.
Meglio usare Alibaba direttamente o un aggregatore API?
L’accesso diretto ad Alibaba è la scelta più chiara quando un carico dipende da un ambito di deployment specifico, da una funzionalità nativa del provider, da un controllo regionale o da una relazione di fatturazione diretta.
Uno strato di aggregazione può essere più pratico quando la stessa applicazione deve testare o instradare su più famiglie di modelli. CometAPI, ad esempio, espone Qwen3.7 Plus insieme a modelli di provider come OpenAI, Anthropic, Google, Moonshot e DeepSeek tramite un’interfaccia compatibile con OpenAI.
Il percorso migliore dipende dai requisiti regionali, dal costo effettivo, dallo sforzo di integrazione, dalle necessità di fallback e dal bisogno di funzionalità native Alibaba.
Esegui un confronto in stile produzione prima di scegliere un percorso
Le tariffe per token pubblicate sono utili per restringere le opzioni, ma la decisione finale dovrebbe derivare da un carico simile alla produzione.
Un approccio pratico è eseguire lo stesso set di valutazione su Qwen3.7 Plus, Qwen3.7 Max e alcune alternative rilevanti. Un servizio API unificato come CometAPI può semplificare questo confronto esponendo i modelli Qwen, Claude, Gemini, GPT, Kimi e DeepSeek tramite la stessa interfaccia compatibile con OpenAI.
Durante il test, registra:
- Token di input e output
- Uso dei token di thinking
- Uso della cache
- Chiamate agli strumenti
- Retry
- Latenza
- Successo del task
Usa la pagina del modello Qwen3.7 Plus come punto di partenza, quindi scegli il percorso con il costo più basso per task completato, non semplicemente il prezzo per token pubblicizzato più basso.
