Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →
ai-comparisons/Ricerca CometAPI

GPT-5.6 Sol vs Claude Sonnet 5 vs Gemini 3.7 Flash Prezzi delle API

请提供需要翻译的原文内容(可为纯文本、HTML、Markdown、JSON、XML 或代码片段),我将其准确翻译为 Italiano 并严格保留原始结构与技术元素。

CometAPI
Lei WangTeam di ricerca su modelli AI e API
Aggiornato Sep 1, 2026 12 min di lettura
GPT-5.6 Sol vs Claude Sonnet 5 vs Gemini 3.7 Flash Prezzi delle API
Usa questo schema

Esegui la prima chiamata API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Quanto costano GPT-5.6 Sol, Claude Sonnet 5 e Gemini 3.7 Flash?

Come puoi confrontare i prezzi dei modelli di IA tra diversi provider? Parti dallo stesso mix input-output, dalla stessa valuta e dalla stessa definizione di risultato riuscito. Un singolo “prezzo per 1M token” è incompleto perché i token di input e di output sono fatturati a tariffe diverse, le richieste con contesti lunghi possono entrare in una fascia superiore e i retry o le risposte respinte possono far salire molto il costo effettivo.

Al 26 agosto 2026, un carico contenente 800.000 token di input non in cache e 200.000 token di output costerebbe circa $5,76 con GPT-5.6 Sol, $2,88 con Claude Sonnet 5 o $1,08 con Gemini 3.7 Flash alle attuali tariffe CometAPI. Questi modelli occupano posizioni diverse per velocità e capacità, quindi questo è un confronto di fatturazione—non un’affermazione che offrano qualità identica.

Come confrontare i prezzi delle API di IA tra provider

Questo articolo usa dollari statunitensi per 1 milione di token di testo fatturabili. Lo scenario esemplificato rappresenta un flusso di supporto o conoscenza ad alto volume con 800.000 token di input e 200.000 token di output su molte richieste. Ogni richiesta resta sotto la soglia di prezzo per contesti brevi di 272.000 token di GPT-5.6 Terra.

La baseline esclude cache dei prompt, sconti batch, commissioni per strumenti, immagini, audio e chiamate fallite o ripetute. Presuppone inoltre che una risposta generata venga accettata. La formula è:

cost = (input tokens / 1M × input rate) + (output tokens / 1M × output rate)

Usa i conteggi di token effettivi restituiti in ogni risposta invece di stimare dai caratteri. I tokenizer differiscono tra famiglie di modelli, il che significa che lo stesso testo non produce necessariamente lo stesso numero di token fatturabili.

Prezzi API di GPT-5.6 Sol, Claude Sonnet 5 e Gemini 3.7 Flash

I tre ID modello e le tariffe riportati sotto sono stati ricontrollati rispetto alla directory modelli live di CometAPI il 26 agosto 2026. La tariffa CometAPI è l’importo usato nei calcoli esemplificativi. La colonna ufficiale è inclusa come riferimento di base.

Prezzi API di GPT-5.6 Sol

GPT-5.6 Terra: CometAPI riporta $1,60 per 1M token di input e $9,60 per 1M token di output, rispetto alla tariffa ufficiale $2 / $12. Nota sull’aggiornamento dei prezzi: la tariffa attuale riflette una riduzione del 20%; il changelog di CometAPI registra la riduzione di Terra il 31 luglio 2026, e la cifra è stata ricontrollata dopo la revisione prezzi del 22 agosto.

Aggiornamento verificato (26 agosto 2026): La nota commentata precedente è mantenuta così che il suo ancoraggio di revisione resti visibile. Per i calcoli in questo articolo, usa GPT-5.6 Sol a $3,20 per 1M token di input e $16 per 1M token di output, rispetto alla tariffa ufficiale $4 / $20. CometAPI ha annunciato la promozione il 24 agosto 2026 e la riporta fino al 21 novembre 2026.

Prezzi API di Claude Sonnet 5

Claude Sonnet 5: Al 26 agosto 2026, CometAPI riporta $1,60 per 1M token di input e $8 per 1M token di output, rispetto all’attuale listino di Anthropic $2 / $10. Anthropic ha aggiornato il post di lancio il 10 agosto 2026 rendendo permanente $2 / $10; l’aumento a $3 / $15 precedentemente annunciato per il 1° settembre non si applica più.

Prezzi API di Gemini 3.7 Flash

Gemini 3.7 Flash: Al 26 agosto 2026, CometAPI riporta $0,60 per 1M token di input e $3 per 1M token di output, rispetto alla tariffa introduttiva di Google $0,75 / $3,75 fino al 31 dicembre 2026.

ID modelloInput / output CometAPIInput / output ufficiale800K input + 200K output
gpt-5.6-sol$3.20 / $16$4 / $20$5.76
claude-sonnet-5$1.60 / $8$2 / $10$2.88
gemini-3.7-flash$0.60 / $3$0.75 / $3.75$1.08

Tutti i prezzi sono in USD per 1 milione di token. Vedi le pagine modello datate per GPT-5.6, Claude Sonnet 5 e Gemini 3.7 Flash, oltre alla guida ai prezzi di CometAPI. Claude Sonnet 5: CometAPI riporta $1,60 per 1M token di input e $8 per 1M token di output, rispetto all’attuale listino di Anthropic $2 / $10. Anthropic aveva originariamente annunciato un prezzo standard $3 / $15 per settembre 2026, ma ha aggiornato i prezzi il 10 agosto 2026 rendendo permanente la tariffa $2 / $10. GPT-5.6 Terra ha anche una fascia per contesti lunghi più alta, quindi non applicare il numero per contesti brevi a richieste oltre la soglia pubblicata.

Gemini 3.7 Flash ha il conto token più basso in questo scenario ed è posizionato come un modello Flash efficiente. Claude Sonnet 5 è un modello di produzione bilanciato, mentre GPT-5.6 Sol è l’opzione di punta per carichi di lavoro più difficili in ambito ragionamento e coding. La decisione utile non è solo “quale riga è la più economica?” ma “quale modello produce un risultato accettabile con il minor numero di token, retry e rilanci?”

Quanto costa 1M token per GPT, Claude e Gemini?

Per la baseline 800K-input e 200K-output, il calcolo è semplice. GPT-5.6 Sol costa 0.8 × $3.20 + 0.2 × $16 = $5.76. Claude Sonnet 5 costa 0.8 × $1.60 + 0.2 × $8 = $2.88. Gemini 3.7 Flash costa 0.8 × $0.60 + 0.2 × $3 = $1.08.

Quell’aritmetica è utile per il budgeting, ma il costo per output accettato è la metrica migliore in produzione. La tabella seguente mostra cosa accade quando lo stesso carico sperimenta comune overhead operativo.

ModelloBaseline5% ritentato10% rieseguito40% output
GPT-5.6 Sol$5.76$6.05$6.34$8.32
Claude Sonnet 5$2.88$3.02$3.17$4.16
Gemini 3.7 Flash$1.08$1.13$1.19$1.56

“5% ritentato” presume che il 5% dell’intero carico di token venga inviato di nuovo. “10% rieseguito” presume che un output su dieci fallisca un controllo qualità e venga rigenerato con lo stesso mix di token. “40% output” mantiene il totale a 1M token ma cambia il mix a 600K input e 400K output. Poiché i token di output costano di più, la verbosità può far crescere il conto più rapidamente dell’aumento del traffico.

Quanto aggiungono i retry e gli output falliti?

Quanto costano i retry e i rilanci delle API?

I retry possono duplicare lavoro fatturabile. Nella baseline, ritentare il 5% del carico porta GPT-5.6 Sol da $5,76 a circa $6,05, mentre rieseguire il 10% dopo un fallimento di qualità lo porta a circa $6,34. Un retry ripete una richiesta dopo un errore di trasporto o di servizio; un rilancio rigenera una risposta che era stata consegnata ma respinta. Ritenta solo limiti di frequenza, timeout e guasti temporanei del server. La guida agli errori e ai retry di CometAPI raccomanda backoff esponenziale con jitter e nessun retry automatico per richieste malformate o errori di autenticazione. Imposta un limite ai tentativi così che un incidente del provider non crei una tempesta di retry.

Quanto può far risparmiare la cache dei prompt?

I risparmi della cache dipendono dal riuso. La tariffa CometAPI per contesti brevi di GPT-5.6 Sol riporta letture dalla cache a $0,32/M e scritture a $4/M. Se metà degli 800K di input è un prefisso riutilizzabile in cache, la prima esecuzione costa circa $6,08 perché scrivere 400K token in cache aggiunge un sovrapprezzo di $0,32 rispetto all’input normale. Una successiva esecuzione con cache hit costa circa $4,61 invece di $5,76, risparmiando circa $1,15. Punto di pareggio: un riuso riuscito recupera più che il sovrapprezzo iniziale di scrittura; sulle prime due esecuzioni, il percorso con cache costa circa $10,69 contro $11,52 senza cache. Altri modelli hanno regole e minimi di cache diversi, quindi verificali prima di fare budget.

Come influisce la lunghezza dell’output sul costo delle API di IA?

Risposte lunghe sono costose. Le tariffe di output in tutte e tre le righe sono cinque volte le tariffe di input. Imposta un limite di output che corrisponda al compito, chiedi formati concisi e interrompi la generazione una volta completata la struttura richiesta.

Quanto costano gli output di IA falliti?

Un’attività fallita può comunque consumare token. Una richiesta che restituisce una risposta inutilizzabile può essere tecnicamente riuscita e completamente fatturabile. Traccia separatamente le violazioni di formato, le allucinazioni, i fallimenti degli strumenti e i rifiuti umani dagli errori HTTP.

Il prezzo dei token non misura il costo ingegneristico. SDK specifici del provider, fatture separate, monitoraggio duplicato e lavoro di migrazione aggiungono tutti costo operativo. Confrontando le tre famiglie tramite CometAPI, i team possono usare la stessa base URL compatibile con OpenAI—https://api.cometapi.com/v1—e cambiare l’ID modello mantenendo un unico livello di fatturazione e osservabilità. Le capacità specifiche del modello devono comunque essere testate.

Come ridurre i costi delle API di GPT, Claude e Gemini

Quanto possono ridurre i costi Batch e Flex?

Batch e Flex sono modalità di elaborazione, non sconti automatici su ogni richiesta. La guida ai prezzi di GPT-5.6 di CometAPI afferma che le tariffe token per Batch e Flex idonee sono circa il 50% inferiori allo Standard, mentre Anthropic indica fino al 50% di risparmio per l’elaborazione batch. Applicando una sensibilità del 50% alla baseline $5,76 di GPT-5.6 Sol si ottengono circa $2,88, ma consideralo un esempio finché la stessa modalità e tariffa non compaiono nel tuo account CometAPI. Usa Batch per lavori asincroni; usa Flex solo quando è accettabile una latenza variabile.

GPT-5.6 Terra vs Claude Sonnet 5 vs Gemini 3.7 Flash: qual è il più economico?

Usando lo stesso carico 800K-input e 200K-output alle tariffe CometAPI verificate il 26 agosto 2026, Gemini 3.7 Flash costa $1,08, Claude Sonnet 5 costa $2,88 e GPT-5.6 Terra costa $3,20. Gemini è il più economico in termini di costo token grezzo in questo confronto. GPT-5.6 Terra può comunque risultare economico per compiti più difficili se la sua capacità riduce retry o correzione umana, quindi confronta il costo per risultato accettato prima di scegliere un percorso di produzione.

Instrada in base alla difficoltà del compito. Usa un modello a basso costo per classificazione, estrazione e bozze di routine, poi esegui l’escalation solo per richieste ambigue o di alto valore. Un fallback deve corrispondere a modalità richieste, supporto strumenti e formato di output—non solo avere una tariffa inferiore.

Prevedi il budget dell’output prima della chiamata. Imposta un massimo di output realistico e registra i token effettivi di input, output e cache dalla risposta. La guida alla stima dei costi di CometAPI tratta le stime pre-chiamata come guardrail di budget e l’uso effettivo come misurazione finale.

Metti in cache contenuti stabili, non contesti che cambiano. Istruzioni di sistema, policy di prodotto e lunghi documenti di riferimento sono buoni candidati quando si ripetono. Misura il tasso di hit della cache e includi il costo di scrittura in cache; altrimenti una cache può sembrare più economica in teoria ma risparmiare poco in produzione.

Ritenta selettivamente. Aggiungi backoff esponenziale, jitter e un numero massimo di tentativi. Registra l’ID del modello, lo stato, l’ID richiesta, i token e se la richiesta era un retry. Questo rende visibile la spesa duplicata.

Ottimizza il costo per risultato accettato. Esegui un set di valutazione fisso e calcola spesa API totale / output accettati. Un modello più costoso può risultare più economico nel complesso se richiede meno retry, prompt più brevi o meno correzione umana.

Ricontrolla prima del lancio. Disponibilità dei modelli, tariffe introduttive, soglie di fascia e sconti cambiano. Interroga la Models API o rivedi la directory pubblica dei modelli il giorno in cui pubblichi o approvi un budget.

FAQ

Cosa significa “costo per 1M token”?

È una tariffa normalizzata, non il prezzo di ogni richiesta. Moltiplica le tariffe di input e di output del modello per i token che il tuo carico usa effettivamente. Tieni separati token in cache, fasce per contesti lunghi e addebiti basati sul compito.

Qual è il più economico: GPT, Claude o Gemini?

Per i modelli specifici e il carico 800K-input/200K-output verificati il 26 agosto 2026, Gemini 3.7 Flash è l’opzione a costo più basso a $1,08 tramite CometAPI, seguito da Claude Sonnet 5 a $2,88 e GPT-5.6 Sol a $5,76. Non è automaticamente la scelta migliore per ogni compito; confronta qualità, latenza e costo per output accettato sui tuoi prompt.

Dovrei confrontare prezzi ufficiali o prezzi degli aggregator?

Confronta il prezzo che pagherai effettivamente, poi conserva la tariffa ufficiale come riferimento. Usa la stessa data, valuta, mix di token, fascia e ipotesi di sconto per ogni riga.

I retry sono sempre fatturati?

Non dare per scontato che siano gratuiti. Una richiesta di trasporto fallita può non raggiungere l’inferenza, mentre un risultato applicativo scaduto o respinto può aver già consumato lavoro del modello. Usa utilizzo e registri di fatturazione effettivi e previeni retry automatici di errori non ritentabili.

La cache dei prompt riduce sempre i costi?

No. Le scritture in cache possono costare più dell’input normale e i risparmi dipendono dalle letture ripetute. Calcola il punto di pareggio dalle attuali tariffe di scrittura e lettura del modello, poi monitora gli hit reali della cache.

Con quale frequenza dovrebbero essere verificati i prezzi?

Verificali prima di pubblicare un’affermazione di prezzo, cambiare un modello di produzione o approvare una previsione. Conserva l’ID modello e la data di verifica insieme al calcolo in modo che la stima possa essere riprodotta in seguito.

Conclusione: quale API di IA è più economica per il tuo carico di lavoro?

Un confronto corretto dei prezzi GPT vs Claude vs Gemini usa una fonte datata, un unico mix di token e una definizione unica di successo. Le tariffe per token creano la baseline; cache, retry, lunghezza dell’output e fallimenti di qualità determinano il conto reale. CometAPI rende più semplice il testing cross-provider mantenendo costanti endpoint e livello di fatturazione, ma il modello a costo più basso è comunque quello che raggiunge l’obiettivo di qualità con il minimo lavoro totale.

Continua a imparare

Collega questo articolo alla prossima decisione.

Vedi tutti gli argomenti
Pubblicato il Sep 1, 2026
Ultimo aggiornamento Sep 1, 2026
0 visualizzazioni
Revisionato per chiarezza, attribuzione delle fonti e terminologia API aggiornata.

Pronto a ridurre i costi di sviluppo AI del 20%?

Inizia gratuitamente in pochi minuti. Crediti di prova gratuiti inclusi. Nessuna carta di credito richiesta.

Leggi di più