TL;DR
Prezzi aggiornati: le tariffe Standard a contesto breve di GPT-5.6 sono ora $5 input / $30 output per Sol, $2 / $12 per Terra e $0.20 / $1.20 per Luna per 1 milione di token.
Il 30 luglio 2026, OpenAI ha ridotto i prezzi di GPT-5.6 Terra del 20% e quelli di Luna dell’80%. I prezzi di Sol restano invariati.
Attenzione ai fattori di costo nascosti: l’alias generico gpt-5.6 instrada a Sol, le richieste con più di 272K token di input usano tariffe long‑context più alte, e i token di output costano ancora 6× rispetto ai token di input in tutti e tre i livelli.
Per carichi Sol sensibili alla latenza, il nuovo Fast mode di OpenAI offre fino a 2.5× di velocità in più al 2× del prezzo Standard.
Panoramica dei prezzi dell’API OpenAI
Per chi cerca in generale i prezzi dell’API di OpenAI, la prima domanda di solito è: quale modello attuale sto effettivamente pagando? La tabella seguente offre una vista compatta di alcuni modelli di testo OpenAI prima di analizzare più da vicino GPT-5.6.
(> Aggiornamento prezzi — 30 luglio 2026: OpenAI ha ridotto i prezzi API di GPT-5.6 Terra del 20% e di Luna dell’80%. Terra ora costa $2 per 1M token di input e $12 per 1M token di output, mentre Luna costa $0.20 in input e $1.20 in output. I prezzi di Sol restano invariati.)
| Modello | Input / 1M token | Input in cache | Output / 1M token |
|---|---|---|---|
| gpt-5.6-sol | $5.00 | $0.50 | $30.00 |
| gpt-5.6-terra | $2.00 | $0.20 | $12.00 |
| gpt-5.6-luna | $0.20 | $0.02 | $1.20 |
| gpt-5.5 | $5.00 | $0.50 | $30.00 |
| gpt-5.4 | $2.50 | $0.25 | $15.00 |
| gpt-5.4-mini | $0.75 | $0.075 | $4.50 |
| gpt-5.4-nano | $0.20 | $0.02 | $1.25 |
Al nuovo prezzo, Luna eguaglia la tariffa di input da $0.20 di GPT-5.4 nano offrendo al contempo una tariffa di output leggermente inferiore di $1.20 rispetto a $1.25.
Fonte*:* Prezzi dell'API OpenAI
Il modello più importante è facile da perdere: i token di output di GPT-5.6 costano 6× rispetto ai token di input su Sol, Terra e Luna. Risposte lunghe, agenti prolissi e workflow ricchi di ragionamento possono quindi far crescere i costi più velocemente di piccole variazioni nella lunghezza del prompt.
Per una panoramica più ampia della famiglia GPT-5.6 — incluse capacità del modello, posizionamento, benchmark, accesso API e funzionalità chiave di lancio — vedi l’annuncio su GPT-5.6 o la guida su GPT-5.6 di CometAPI. Questo articolo si concentra specificamente su prezzi, calcoli di costo e fattori che possono influenzare la bolletta API reale.
Prezzi di GPT-5.6: Sol vs Terra vs Luna
GPT-5.6 introduce tre livelli di prezzo. OpenAI posiziona Sol come percorso di punta, Terra come opzione bilanciata e Luna come livello a costo inferiore per carichi ad alto volume.
Per un approfondimento su funzionalità, accesso all’API GPT-5.6 e casi d’uso di ciascun modello,details to see the here about GPT-5.6 model .
Prezzi Standard di GPT-5.6 per richieste con ≤272K token di input
| Modello | Input breve | Input in cache | Scrittura cache | Output breve | Input lungo | Input lungo in cache | Scrittura cache lunga | Output lungo |
|---|---|---|---|---|---|---|---|---|
| gpt-5.6-sol | $5.00 | $0.50 | $6.25 | $30.00 | $10.00 | $1.00 | $12.50 | $45.00 |
| gpt-5.6-terra | $2.00 | $0.20 | $2.50 | $12.00 | $4.00 | $0.40 | $5.00 | $18.00 |
| gpt-5.6-luna | $0.20 | $0.02 | $0.25 | $1.20 | $0.40 | $0.04 | $0.50 | $1.80 |
Fonte*:* Prezzi dell'API OpenAI
Prezzi per contesti lunghi: le richieste con più di 272K token di input usano tariffe più alte. Input, input in cache e scritture in cache sono fatturati a 2× della tariffa standard, mentre l’output è fatturato a 1.5×. Le tariffe più alte si applicano all’intera richiesta.
Un punto di partenza ragionevole è testare Luna per attività più semplici e ad alto volume, Terra per carichi applicativi bilanciati e Sol per i compiti più difficili o ad alto impatto. Queste non sono raccomandazioni universali: accuratezza, retry, comportamento degli strumenti e revisione umana possono pesare più della differenza nel prezzo di listino.
Un dettaglio importante sull’alias
Le linee guida sul modello di OpenAI indicano che l’alias generico gpt-5.6 instrada a gpt-5.6-sol.
Ciò significa che una richiesta inviata a gpt-5.6 usa il livello di prezzo Sol. Se il tuo carico funziona bene su Terra o Luna, usa l’ID modello esplicito invece di presumere che l’alias generico selezioni il livello più economico adatto.
Esempio 1: Una richiesta API tipica
Partiamo da una forma di richiesta comune:
- 1,000 token di input
- 500 token di output
| Modello | Costo mensile input | Costo mensile output | Totale |
|---|---|---|---|
| gpt-5.6-sol | $10,000 | $15,000 | $25,000 |
| gpt-5.6-terra | $4,000 | $6,000 | $10,000 |
| gpt-5.6-luna | $400 | $600 | $1,000 |
In questo scenario, il nuovo prezzo di Luna riduce la stima del conto mensile dei token da $5,000 a $1,000, mentre Terra scende da $12,500 a $10,000.
Calcolo per Sol:
(1,000 / 1,000,000 × $5) + (500 / 1,000,000 × $30) = $0.020
Questo esempio mostra anche perché la lunghezza dell’output conta. Anche se la richiesta contiene il doppio dei token di input rispetto ai token di output, la parte di output rappresenta il 75% del costo in token su Sol perché l’output è prezzato a sei volte il tasso dell’input.
Per chat, agenti e generazione di codice, controllare la verbosità non necessaria può talvolta far risparmiare più che ridurre leggermente un system prompt.
Esempio 2: Costo mensile su larga scala
Supponiamo ora che un’applicazione gestisca 1 milione di richieste al mese, in media:
- 2,000 token di input per richiesta
- 500 token di output per richiesta
Equivale a 2 miliardi di token di input e 500 milioni di token di output al mese.
| Modello | Costo mensile input | Costo mensile output | Totale |
|---|---|---|---|
| gpt-5.6-sol | $10,000 | $15,000 | $25,000 |
| gpt-5.6-terra | $5,000 | $7,500 | $12,500 |
| gpt-5.6-luna | $2,000 | $3,000 | $5,000 |
Il divario è abbastanza ampio da giustificare test di instradamento, ma la riga più bassa non è automaticamente la scelta migliore in produzione. Se un modello più economico causa più retry, task falliti o revisione manuale, il costo totale del workflow può essere maggiore.
Prezzi per contesti lunghi: cosa succede oltre 272K token?
I modelli GPT-5.6 supportano una finestra di contesto da 1.05M token, ma OpenAI applica tariffe più alte quando una richiesta contiene più di 272,000 token di input.
Per queste richieste long‑context:
- l’input è addebitato a 2× la tariffa per contesto breve
- input in cache e scritture in cache sono anch’essi addebitati a 2×
- l’output è addebitato a 1.5×
- le tariffe più alte si applicano all’intera richiesta, non solo ai token sopra i 272K
Per Sol, ciò cambia l’input da $5 a $10 per 1M token e l’output da $30 a $45. La stessa struttura di moltiplicatori si applica a Terra e Luna.
Questo crea un brusco salto dei costi vicino a 272K. Per carichi prossimi alla soglia, riduci chunk di retrieval duplicati, cronologie di conversazione obsolete, file di repository non necessari o output prolissi degli strumenti prima di inviare la richiesta. Vedi la guida all’ottimizzazione dei costi di OpenAI per ulteriori suggerimenti sulla riduzione dei token.
Prezzi Standard, Batch, Flex e Priority
Per i carichi di testo GPT-5.6 idonei, OpenAI offre più livelli di elaborazione.
| Tier | Sol input/output | Terra input/output | Luna input/output | Uso tipico |
|---|---|---|---|---|
| Standard | $5 / $30 | $2 / $12 | $0.20 / $1.20 | Traffico sincrono normale |
| Batch | $2.50 / $15 | $1 / $6 | $0.10 / $0.60 | Job asincroni offline |
| Flex | $2.50 / $15 | $1 / $6 | $0.10 / $0.60 | Carichi sensibili al costo che possono tollerare lentezza |
| Fast mode | $10 / $60 | $4 / $24 | $0.40 / $2.40 | Traffico a contesto breve sensibile alla latenza |
Batch e Flex restano circa il 50% più economici rispetto ai prezzi Standard. Priority Processing è stato rinominato Fast mode il 30 luglio 2026, anche se le richieste esistenti con service_tier: "priority" restano compatibili.
Per GPT-5.6 Sol, Fast mode fornisce fino a 2.5× di elaborazione più veloce rispetto allo Standard a 2× del prezzo in token Standard, senza cambiamenti nell’intelligenza del modello. È più appropriato quando la latenza percepita dagli utenti è così importante da giustificare il sovrapprezzo.
Caching del prompt: quando fa risparmiare con GPT-5.6?
Per GPT-5.6, le scritture in cache costano 1.25× la normale tariffa di input, mentre le letture in cache ricevono il prezzo ridotto dell’input in cache.
Considera un prefisso riutilizzabile da 100,000 token su Sol:
| Azione | Costo |
|---|---|
| Elaborare una volta come input normale non in cache | $0.50 |
| Scrivere il prefisso in cache | $0.63 |
| Leggere in seguito il prefisso dalla cache | $0.05 |
Due utilizzi non in cache costano $1.00. Una scrittura in cache più una lettura corrispondente costano $0.675, con un risparmio di $0.325 in questo esempio semplificato.
Limiti di questo esempio: questo calcolo confronta solo il costo di input del prefisso riutilizzabile. Non include token di output, altri input non in cache, strumenti o retry. I risparmi reali dipendono dal fatto che il prefisso soddisfi i requisiti della cache e da quanto spesso venga effettivamente riutilizzato.
Il caching è quindi più utile per lunghi prefissi di prompt stabili che ricevono richieste ripetute corrispondenti. Una scrittura in cache che non viene mai riutilizzata aggiunge costo invece di ridurlo.
La guida al prompt caching di OpenAI documenta i prezzi di scrittura in cache, le letture in cache, i breakpoint espliciti e il comportamento del TTL.
Altri costi che possono cambiare la tua bolletta API OpenAI
Token di ragionamento e modalità Pro
I token di ragionamento sono fatturati come token di output anche quando non sono mostrati come testo visibile della risposta. Impostazioni di ragionamento più alte possono quindi aumentare l’uso totale di token di output e la latenza.
Dove supportato, reasoning.mode = "pro" è meglio trattato come una configurazione da testare, non come una regola predefinita di risparmio o qualità. OpenAI non indica un sovrapprezzo Pro fisso separato per questa modalità; l’impatto sul costo deriva dall’uso risultante di token. Una base ragionevole è testare Standard e Pro su task rappresentativi e confrontare successo del task, token di output totali, latenza e retry.
Ricerca web e altri strumenti
Attualmente OpenAI indica la ricerca web standard a $10 per 1,000 chiamate, più i token dei contenuti di ricerca fatturati alla tariffa del modello selezionato. Due ricerche web su una piccola richiesta Luna possono quindi costare più dei token del modello della richiesta.
OpenAI indica anche un prezzo separato di anteprima della ricerca web per modelli non di ragionamento a $25 per 1,000 chiamate, con token dei contenuti di ricerca gratuiti. Controlla la combinazione esatta di strumento e modello sulla pagina ufficiale dei prezzi invece di applicare una tariffa di ricerca web a ogni endpoint.
Elaborazione regionale
Gli endpoint idonei di elaborazione regionale o residenza dei dati per modelli rilasciati a partire dal 5 marzo 2026 comportano un aumento del 10% secondo la pagina prezzi di OpenAI. I team enterprise con requisiti di residenza dovrebbero includere tale fattore nelle stime di budget.
Come calcolare il costo dell’API OpenAI
Per una richiesta di base:
Costo in token =
(input token / 1M × tariffa input)
- (output token / 1M × tariffa output)
Per la pianificazione in produzione, estendilo includendo:
Costo totale del workflow =
uncached input
- cached input
- cache writes
- output and reasoning tokens
- tool fees
- service-tier adjustments
- regional uplift, if applicable
- retries and fallback requests
L’indicatore più utile è spesso:
Costo per task riuscito = costo totale del workflow / task riusciti
Questo evita che una tariffa per token più bassa appaia artificialmente allettante quando produce anche più fallimenti o lavoro di revisione.
Come scegliere il modello giusto senza spendere troppo
Usa la tabella prezzi come punto di partenza, quindi testa su task reali.
- Inizia con il modello dal costo più basso che sembra in grado di svolgere il compito. Luna può essere un primo test sensato per lavori semplici e ad alto volume, ma non dare per scontato che sia il migliore per ogni estrazione o riassunto.
- Misura la lunghezza dell’output. I token di output di GPT-5.6 costano 6× i token di input, quindi le risposte verbose meritano attenzione.
- Tieni d’occhio la soglia dei 272K. Superarla cambia le tariffe per l’intera richiesta.
- Usa Batch o Flex per lavoro non urgente idoneo. Verifica i vincoli operativi prima di spostare traffico di produzione.
- Metti in cache solo prefissi riutilizzabili. Misura gli effettivi cache hit invece di presumere che un prompt lungo vada messo in cache.
- Tieni traccia di strumenti e retry. Possono annullare i risparmi di un modello più economico.
Per i team che confrontano percorsi tra provider, i prezzi di CometAPI offrono una vista in tempo reale cross‑model. Il CometAPI Quickstart e il Cookbook possono essere usati per eseguire lo stesso set di test su più percorsi compatibili con OpenAI.
FAQ
Quanto costa GPT-5.6 nel 2026?
Il prezzo dipende dal modello. Le tariffe Standard a contesto breve di GPT-5.6 vanno da $1 di input / $6 di output per 1M token per Luna a $5 / $30 per Sol. Sono disponibili anche modelli a costo inferiore come GPT-5.4 mini e nano. Controlla il modello esatto sulla pagina prezzi live di OpenAI.
Il prezzo dell’API ChatGPT è lo stesso di quello di GPT-5.6?
“Prezzi API ChatGPT” è spesso usato informalmente per indicare i prezzi API di OpenAI per modelli con capacità di chat, ma gli abbonamenti ChatGPT e la fatturazione API sono prodotti separati. L’uso dell’API è prezzato in base al modello specifico e al tipo di utilizzo.
Qual è il modello GPT-5.6 più economico?
gpt-5.6-luna è il modello GPT-5.6 più economico, a $0.20 per 1M token di input e $1.20 per 1M token di output. Il 30 luglio OpenAI ha ridotto entrambe le tariffe dell’80%, rendendo Luna significativamente più economico per agenti ad alto volume, classificazione, elaborazione documenti e workflow con strumenti ben definiti.
Quale modello usa gpt-5.6?
Le linee guida di OpenAI sui modelli indicano che l’alias gpt-5.6 instrada a gpt-5.6-sol. Usa ID modello espliciti Terra o Luna quando vuoi quei livelli.
Quando si applicano i prezzi long‑context di GPT-5.6?
Quando l’input supera 272,000 token, GPT-5.6 applica tariffe long‑context più alte all’intera richiesta: 2× per tariffe legate all’input e 1.5× per l’output.
Batch e Flex sono più economici dello Standard per GPT-5.6?
Per i carichi GPT-5.6 idonei, le tariffe in token elencate per Batch e Flex sono circa il 50% inferiori allo Standard. Hanno caratteristiche di elaborazione diverse, quindi conferma che il carico possa tollerare quei vincoli.
Le scritture in cache costano di più per GPT-5.6?
Sì. Le scritture in cache di GPT-5.6 sono prezzate a 1.25× rispetto all’input normale, mentre le letture corrispondenti usano la tariffa scontata dell’input in cache. I risparmi dipendono dal riuso effettivo.
Confronta i costi di GPT-5.6 sul tuo carico
Le tabelle dei prezzi sono un punto di partenza. Il costo reale dipende da prompt, lunghezza dell’output, tasso di hit della cache, strumenti, retry e successo dei task.
Con CometAPI, puoi testare GPT-5.6 Sol, Terra, Luna e altri modelli tramite un’unica API compatibile con OpenAI usando lo stesso carico.
Prossimi passi: confronta i prezzi dei modelli attuali, segui il CometAPI Quickstart o usa il CometAPI Cookbook per costruire valutazioni di modelli ripetibili.
Scegli il percorso dal costo più basso che soddisfi comunque i tuoi requisiti di qualità, latenza e affidabilità.
