TL;DR La tariffa ufficiale dell'API parte da $10 per milione di token di input e $50 per milione di token di output, pari a 2,5 volte il prezzo per token standard di GPT-5.6 Sol.
GPT-6 Astra è progettato per flussi di lavoro di coding prolungati, uso del browser e del computer, ricerca e agentic, in cui il costo reale è spesso determinato da tentativi ripetuti, chiamate agli strumenti, crescita del contesto, utilizzo della cache e probabilità che il modello completi correttamente l’attività. OpenAI posiziona Astra sul lato più difficile del lavoro end-to-end, piuttosto che sull’inferenza economica ad alto volume.
C’è anche una soglia di prezzo importante: una volta che una richiesta supera 272K token di input, le tariffe di Astra aumentano per l’intera richiesta.
Da notare:
- Attenzione alla dimensione del contesto: superare 272K token di input cambia le tariffe per l’intera richiesta.
- Considerare la cache: i prefissi ricorrenti e stabili possono costare molto meno quando il riutilizzo della cache ha successo.
- Scegliere il tier di elaborazione: Batch/Flex scambia immediatezza per tariffe più basse; Fast aggiunge un sovrapprezzo.
- Misurare gli esiti delle attività: includere token, strumenti, esecuzioni fallite e tempo di correzione umana nel confronto.
GPT-6 Astra Prezzi in breve
La tabella separa input ordinari, letture da cache, scritture in cache e output. Le fasce di contesto si riferiscono al conteggio dei token di input; tutti i prezzi dei token sono per milione di token.
Batch e Flex usano metà delle tariffe Standard. Fast applica il doppio delle tariffe Standard applicabili. Queste modalità di elaborazione rispondono a diverse esigenze di latenza e disponibilità.
| Modalità di prezzo / contesto | Input / 1M | Input in cache / 1M | Scrittura in cache / 1M | Output / 1M |
|---|---|---|---|---|
| Standard ≤272K | $10.00 | $1.00 | $12.50 | $50.00 |
| Standard >272K | $20.00 | $2.00 | $25.00 | $75.00 |
| Batch/Flex ≤272K | $5.00 | $0.50 | $6.25 | $25.00 |
| Batch/Flex >272K | $10.00 | $1.00 | $12.50 | $37.50 |
| Fast ≤272K | $20.00 | $2.00 | $25.00 | $100.00 |
| Fast >272K | $40.00 | $4.00 | $50.00 | $150.00 |
Il numero più importante in questa tabella non è probabilmente $10 o $50. È 272K.
Per i prompt oltre 272K token di input, OpenAI applica tariffe di input/cache 2× e di output 1,5× all’intera richiesta. Un piccolo incremento vicino a quella soglia può quindi produrre un aumento di costo molto più grande.
Che cos’è GPT-6 Astra?
GPT-6 Astra combina coding, ricerca e interazione con il computer in un unico modello. La sua capacità di contesto, il limite di output e i flussi di lavoro supportati spiegano dove il premio di prezzo può essere rilevante.
| Specifiche API ufficiali | Valore |
|---|---|
| Sviluppatore | OpenAI |
| ID modello | gpt-6-astra |
| Finestra di contesto | 1.050.000 token |
| Output massimo | 128.000 token |
| Knowledge cutoff | April 30, 2026 |
| Modalità di input | Testo e immagini |
| Modalità di output | Testo |
| Livelli di ragionamento | Low, Medium, High, XHigh, Max |
| API consigliata | Responses API per workflow ricchi di tool |
| Fine-tuning | Non supportato |
| Soglia di prezzo long-context | Oltre 272K token di input |
Quella finestra di contesto da 1,05M token è particolarmente rilevante per il prezzo. Astra può ingerire repository molto grandi, documenti, storici di strumenti e materiale di ricerca, ma usare aggressivamente la finestra di contesto disponibile non significa che sia economicamente ottimale.
Le funzionalità di tool calling asincrono e steering a turno in corso supportano flussi di lavoro più lunghi, insieme all’uso del computer, caching dei prompt, orchestrazione multi-agente e compattazione. Il supporto del modello non implica che ogni provider esponga ogni tool o funzione.
Quanto costa GPT-6 Astra tramite CometAPI?
CometAPI attualmente offre accesso API a GPT-6 Astra con tariffe dei token per contesti brevi e lunghi inferiori del 20% rispetto alle tariffe ufficiali corrispondenti.
- Contesto breve: CometAPI indica $8/M per l’input e $40/M per l’output, rispetto ai $10/M e $50/M di OpenAI.
- Contesto lungo: CometAPI indica $16/M per l’input e $60/M per l’output, rispetto ai $20/M e $75/M di OpenAI.
- Cache: le tariffe di lettura/scrittura cache per contesto breve sono $0.80/M e $10/M; per contesto lungo sono $1.60/M e $20/M.
- Differenza: le tariffe CometAPI indicate sono inferiori del 20% rispetto alle tariffe OpenAI corrispondenti in ciascuna categoria. Confermare le tariffe correnti prima del budgeting di produzione.
Per l’esempio precedente di 100K input e 10K output:
OpenAI: 100K × $10/M + 10K × $50/M = $1.50
CometAPI: 100K × $8/M + 10K × $40/M = $1.20
Risparmio per richiesta: $0.30
A 10.000 richieste equivalenti, la differenza semplificata diventa $3.000.
Per il carico long-context con 300K input e 20K output:
OpenAI: 300K × $20/M + 20K × $75/M = $7.50
CometAPI: 300K × $16/M + 20K × $60/M = $6.00
Risparmio per richiesta: $1.50
I prezzi e le regole di fatturazione dell’API possono cambiare. Il budgeting di produzione dovrebbe usare la tariffa CometAPI corrente per il modello e il carico di lavoro attivi.
La differenza percentuale è semplice, ma carichi agentici di grandi dimensioni ne amplificano l’impatto assoluto perché una richiesta può consumare centinaia di migliaia di token di input.
Quali costi vanno oltre i token del modello con GPT-6 Astra?
Per la generazione di testo tradizionale, i token di input e di output dominano il calcolo dei costi. Per gli agenti Astra, potrebbero essere solo una parte del conto.
OpenAI addebita separatamente gli strumenti di web e file search. La ricerca web costa $10 per 1.000 chiamate, con il contenuto recuperato fatturato anche a tariffe di token del modello. Le chiamate file-search costano $2.50 per 1.000, e lo storage costa $0.10/GB/giorno dopo l’1 GB gratuito.
Hosted Shell e Code Interpreter hanno costi separati per i container: la tariffa per 1 GB è $0.03 per sessione di 20 minuti per container. Le sessioni idonee usano fatturazione al minuto con un minimo di cinque minuti. Allocazioni di memoria più grandi hanno tariffe più alte.
Il contenuto generato dagli strumenti può anche aumentare il consumo di token. Un agente di navigazione o uso del computer può aggiungere ripetutamente screenshot, pagine, output del terminale, documenti recuperati e storici degli strumenti al contesto. Anche se ogni singola azione è economica, lo storico accumulato può spingere la richiesta successiva oltre la soglia dei 272K di Astra.
Ciò significa che un budget di produzione dovrebbe tracciare almeno: token del modello + attività di cache + chiamate agli strumenti + esecuzione ospitata + retry + passi totali + tasso di successo dei task.
Più è autonomo il flusso di lavoro, meno utile diventa il prezzo per milione di token come KPI autonomo.
Lo sforzo di ragionamento influisce sul costo di GPT-6 Astra?
Lo sforzo di ragionamento non è una voce separata nella tabella pubblicata delle tariffe per token. Può comunque cambiare la spesa totale in modo indiretto: un ragionamento più profondo può produrre più token di output, estendere l’uso degli strumenti o allungare la traiettoria di un agente, mentre decisioni migliori possono ridurre i retry e la correzione umana. Confrontare le impostazioni di ragionamento con lo stesso set di task e riportare i token del modello totali, le tariffe degli strumenti, il tasso di completamento e il tempo di correzione.
Quante prestazioni si stanno acquistando?
Un confronto di prezzo è incompleto senza capire cosa si ottiene con una tariffa più alta.
OpenAI riporta guadagni sostanziali nelle valutazioni agentiche e tecniche. Le percentuali sotto sono risultati riportati dal vendor, non misurazioni indipendenti; un trattino significa che non è stato riportato alcun risultato.
| Benchmark ufficiale (%) | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Gemini 3.8 Flash |
|---|---|---|---|---|
| AutomationBench | 41.4 | 18.1 | 31.4 | — |
| Terminal-Bench 4.0 | 57.9 | 37.3 | 55.8 | 19.1 |
| Terminal-Bench Science 0.1 | 64.6 | 22.4 | 52.6 | — |
| FrontierMath Tier 4 (v2) | 97.6 | 83.0 | 87.8 | — |
| GPQA Diamond | 96.0 | 94.6 | 93.7 | 95.3 |
| ExploitBench | 100.0 | 78.5 | — | — |
Nella valutazione offline OSWorld 2.0 di OpenAI, Astra ha ottenuto 72,6% contro 65,7% per GPT-5.6 Sol. Una simulazione di latenza ha stimato circa 40 contro 75 minuti per task. Questi tempi descrivono l’impostazione della valutazione, non una garanzia di latenza generale.
Ciò ha rilevanza economica.
Un modello che costa 2,5× per token non necessariamente costa 2,5× per task completato se usa meno turni, richiede meno retry, completa i workflow più rapidamente o evita l’escalation a un operatore umano.
Al tempo stesso, Astra non è automaticamente il miglior valore per ogni task. Il premio è più facile da giustificare dove i suoi vantaggi agentici influiscono effettivamente sul completamento dell’attività.
La soglia di 272K cambia l’economia
La parte più facilmente trascurata del prezzo di GPT-6 Astra è cosa accade quando l’input supera 272K token.
Consideriamo diverse richieste semplificate nel tier Standard senza caching o addebiti aggiuntivi per tool.
| Carico di lavoro | Input | Output | Fascia di prezzo | Costo OpenAI stimato |
|---|---|---|---|---|
| Breve richiesta di code | 20K | 2K | ≤272K | $0.30 |
| Ampia analisi | 100K | 10K | ≤272K | $1.50 |
| Agente vicino alla soglia | 270K | 10K | ≤272K | $3.20 |
| Agente leggermente più grande | 280K | 10K | >272K | $6.35 |
| Attività su scala repository | 300K | 20K | >272K | $7.50 |
L’esempio da 270K token costa:
270K × $10/M + 10K × $50/M = $3.20
Aumentando l’input di soli 10K token la richiesta passa alla tariffazione long-context:
280K × $20/M + 10K × $75/M = $6.35
L’input è cresciuto di circa il 3,7%, ma il costo totale della richiesta è aumentato di quasi il 98%.
Ciò rende la gestione del contesto un importante meccanismo di controllo dei costi per gli agenti Astra. Invece di aggiungere continuamente ogni risultato di tool, file, screenshot e turno di conversazione, gli agenti in produzione possono riassumere lo stato più vecchio, recuperare solo i file rilevanti, isolare il contesto stabile per il caching e avviare sotto-agenti freschi per attività indipendenti.
Con Astra, l’ottimizzazione dei token non significa quindi solo ridurre il conteggio dei token. Può anche significare restare dal lato più economico di una soglia di prezzo.
Come il caching dei prompt cambia i costi di input di GPT-6 Astra
Per le richieste Standard nella fascia short-context, l’input ordinario costa $10/M, le letture da cache costano $1/M e le scritture in cache costano $12.50/M. La tariffa inferiore per le letture si applica solo quando il prefisso riutilizzabile è servito con successo dalla cache.
Le letture cache riuscite costano un decimo dell’input ordinario, mentre le scritture hanno una propria tariffa. Il riutilizzo dipende dal prefisso in cache corrispondente che rimanga disponibile. Misurare separatamente scritture e hit, anziché trattare ogni prompt ripetuto come un hit di cache.
Consideriamo dieci richieste ipotetiche che includono ciascuna lo stesso prefisso da 100K token e restano entro 272K token di input totali. Confrontiamo due casi controllati: nessun caching, contro una scrittura completa del prefisso seguita da nove letture complete del prefisso con successo, senza ulteriori scritture.
| Costo del prefisso ripetuto su dieci richieste | Nessun caching | Una scrittura + nove letture |
|---|---|---|
| Input ordinario del prefisso | 10 × 100K × $10/M = $10.00 | $0.00 |
| Scrittura del prefisso in cache | $0.00 | 100K × $12.50/M = $1.25 |
| Letture del prefisso da cache | $0.00 | 9 × 100K × $1/M = $0.90 |
| Totale per il solo prefisso ripetuto | $10.00 | $2.15 |
Scope of the 78.5% figure:
la riduzione da $10.00 a $2.15 si applica solo al costo di input del prefisso ripetuto nell’esempio una-scrittura, nove-hit sopra. Non è una stima dei risparmi tipici di
né una riduzione del 78,5% dell’intero conto API.
Per includere l’output, supponiamo che ciascuna delle dieci richieste generi anche 2.000 token di output fatturabili. A $50/M, l’output aggiunge $1.00 al costo aggregato di ciascuno scenario. Senza altri input o addebiti, i totali dei token del modello sono $11.00 senza caching e $3.15 con caching, una riduzione di circa il 71,4%. Input extra, miss o riscritture della cache, strumenti e diversi tier di elaborazione cambiano nuovamente il totale.
Stimare i risparmi da scritture di cache misurate e letture riuscite insieme ai restanti addebiti. Un grande prefisso riutilizzabile può ridurre la spesa di input, ma il suo effetto sul costo totale dipende da quanto del conto quel prefisso rappresenta.
GPT-6 Astra vs Claude Fable 5.1: stesso prezzo di base, economia della cache diversa
Claude Fable 5.1 ha tariffe headline $10/M per l’input e $50/M per l’output, in linea con i prezzi Standard short-context di Astra per input e output.
I prezzi headline sono quindi identici, ma il caching no.
| Dimensione di costo | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| Input / 1M | $10.00 | $10.00 |
| Output / 1M | $50.00 | $50.00 |
| Lettura cache / 1M | $1.00 | $0.25 |
| Scrittura cache / 1M | $12.50 | $12.50 (cache 5 min) |
| Finestra di contesto | 1.05M | 1M |
| Terminal-Bench 4.0 | 57.9 | 55.8 |
| AutomationBench | 41.4 | 31.4 |
La tariffa di lettura cache $0.25/M di Fable è un quarto della tariffa $1/M di Astra per contesto breve. La tariffa di scrittura cache a 5 minuti di Fable coincide con i $12.50/M di Astra; l’opzione di scrittura a 1 ora di Fable costa $20/M.
Per carichi estremamente ripetitivi dominati da prefissi in cache, Fable può avere un’economia lato input migliore anche se entrambi i modelli mostrano lo stesso prezzo headline $10/$50. Per attività di ingegneria software e automazione ricche di tool, i risultati più forti di Astra su benchmark agentici selezionati possono compensare tale svantaggio della cache.
Prezzi di input e output uguali non implicano quindi costi di carico uguali. Durata della cache, tasso di hit, output generato e successo del task devono essere confrontati insieme.
GPT-6 Astra vs GPT-5.6 Sol: vale 2,5× il prezzo per token?
GPT-5.6 Sol costa $4/M per l’input e $20/M per l’output nella fascia Standard short-context, rispetto ai $10/M e $50/M di Astra. La tabella separa questa differenza di tariffa dalle differenze di capacità.
| Confronto ufficiale modelli | GPT-6 Astra | GPT-5.6 Sol | Differenza |
|---|---|---|---|
| Input / 1M | $10 | $4 | Astra 2,5× |
| Output / 1M | $50 | $20 | Astra 2,5× |
| Input in cache / 1M | $1 | $0.40 | Astra 2,5× |
| Contesto | 1.05M | 1.05M | Uguale |
| Output massimo | 128K | 128K | Uguale |
| AutomationBench | 41.4 | 18.1 | Astra +23,3 pt |
| Terminal-Bench 4.0 | 57.9 | 37.3 | Astra +20,6 pt |
| OSWorld | 72.6 | 65.7 | Astra +6,9 pt |
Se due modelli usassero esattamente lo stesso numero di token e avessero lo stesso tasso di successo, Sol sarebbe chiaramente più economico.
Puramente dal pricing dei token, Astra ha bisogno che il suo workflow consumi circa il 40% del lavoro equivalente in token fatturabili rispetto a Sol per neutralizzare una differenza di tariffa 2,5×.
Ma i workflow autonomi non si comportano così linearmente. Un tentativo da $1 fallito seguito da un altro tentativo da $1 costa più di una richiesta da $1.50 che ha successo immediatamente. Lo stesso vale quando un modello più debole causa più chiamate agli strumenti, traiettorie più lunghe, revisione umana o esecuzione ripetuta del codice.
OpenAI riporta che Astra produce risultati più solidi con meno token di output e un costo API stimato per task inferiore in diverse valutazioni, nonostante la tariffa per token più alta.
Per chat ordinarie, riscrittura, estrazione, classificazione e altri carichi di lavoro semplici, l’argomento è molto più debole.
GPT-6 Astra vs Gemini 3.8 Flash: una fascia di costo molto diversa
Gemini 3.8 Flash occupa una fascia di prezzo inferiore. La tariffa introduttiva di Google è $0.75/M per l’input e $3.75/M per l’output fino al 31 dicembre 2026.
Ciò rende Astra circa 13,3× più costoso sia sull’input non in cache sia sull’output alle tariffe Standard short-context.
| Dimensioni di confronto | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Gemini 3.8 Flash (pricing) |
|---|---|---|---|---|
| Input / 1M | $10.00 | $4.00 | $10.00 | $0.75* |
| Output / 1M | $50.00 | $20.00 | $50.00 | $3.75* |
| Input in cache / 1M | $1.00 | $0.40 | $0.25 | $0.075* |
| Contesto | 1.05M | 1.05M | 1M | 1,048,576 |
| Output massimo | 128K | 128K | 128K | 65,536 |
| Terminal-Bench 4.0 | 57.9 | 37.3 | 55.8 | 19.1 |
| GPQA Diamond | 96.0 | 94.6 | 93.7 | 95.3 |
I prezzi di Gemini nella tabella sono introduttivi fino al
. Dal 1° gennaio 2027, le tariffe input/output diventano $1.50/$7.50 per milione di token e le letture cache diventano $0.15/M.
Lo storage della cache è fatturato separatamente
a $0.50/M token/ora durante il 2026 e $1/M token/ora dal gennaio 2027. I prezzi OpenAI mostrati usano la fascia Standard short-context.
Il confronto illustra perché il routing dei modelli può essere più efficiente che selezionare un unico modello per ogni richiesta. Usare Astra per i task di ingegneria su scala repository o automazione più difficili e instradare i carichi ad alto volume e routine verso un modello più economico può produrre un profilo di costo complessivo migliore rispetto a usare Astra ovunque o non usare mai Astra.
Costo di GPT-6 Astra per tier di elaborazione: Standard vs Batch, Flex e Fast
Le modalità di elaborazione di GPT-6 Astra possono cambiare il conto tanto quanto la scelta del modello.
Per una richiesta con 300K input e 20K output, si applicano le tariffe long-context.
| Modalità di elaborazione | Costo input | Costo output | Totale |
|---|---|---|---|
| Batch/Flex | $3.00 | $0.75 | $3.75 |
| Standard | $6.00 | $1.50 | $7.50 |
| Fast | $12.00 | $3.00 | $15.00 |
Batch/Flex dimezza quindi il conto dei token semplificato rispetto a Standard, mentre Fast lo raddoppia.
Batch/Flex ha senso quando la latenza di completamento è flessibile, come esecuzioni di valutazione, arricchimento dati, analisi offline di repository, backfill di documenti e lavori di ricerca asincroni.
Standard è la baseline naturale per carichi di lavoro produttivi interattivi in cui né il costo minimo possibile né la massima velocità dominano.
Fast può essere utile quando il tempo trascorso ha valore aziendale misurabile. OpenAI descrive fino a 2× elaborazione più rapida con Astra a un tasso pari al doppio di quello applicabile. Astra Fast non ha SLA di latenza ed è indisponibile con residenza dei dati UE.
Il miglior tier è quindi una decisione di business, non semplicemente un’impostazione di performance.
Il costo per task riuscito è la metrica migliore
Consideriamo due agenti di coding ipotetici.
Supponiamo che l’Agente A usi un modello più economico, costi $0.80 per tentativo e abbia successo con probabilità 55%; l’Agente B usa Astra, costa $1.40 per tentativo e ha successo con probabilità 90%. Solo per questa illustrazione, i tentativi sono indipendenti, ogni ripetizione ha lo stesso costo e probabilità di successo, e i retry continuano fino al successo.
In base a tali assunzioni, il costo atteso del modello per task riuscito è il costo per tentativo diviso per la probabilità di successo:
Agente A: $0.80 / 0.55 ≈ $1.45
Agente B: $1.40 / 0.90 ≈ $1.56
Il rapporto esatto rende l’Agente B circa il 6,9% più costoso, o circa il 7%. Questo esempio non mostra che Astra faccia risparmiare; mostra perché un multiplo della tariffa per token non equivale a un multiplo del costo per successo.
La formula già tiene conto dei tentativi ripetuti, quindi non aggiungere una seconda quota di retry. Revisione umana, strumenti e overhead di esecuzione possono cambiare il confronto se misurati separatamente. I fallimenti reali possono anche essere correlati, rendendo questo semplice modello inadatto a alcuni workflow.
Per una valutazione reale, dividere tutta la spesa di modelli e strumenti sul set di test per il numero di risultati accettati, quindi riportare separatamente il tempo di correzione e i fallimenti irrisolti. Usare quel risultato osservato per decidere quali task giustificano Astra.
Come ridurre i costi API di GPT-6 Astra
- Mantenere le richieste di routine sotto i 272K token di input quando possibile, così che un piccolo aumento del contesto non inneschi la tariffazione long-context per l’intera richiesta.
- Progettare prefissi di prompt stabili per il caching. Istruzioni di sistema, mappe del repository, policy, schemi e documentazione statica sono candidati migliori per la cache rispetto a prompt ricostruiti ripetutamente.
- Usare il routing dei modelli. Riservare GPT-6 Astra per richieste la cui complessità ne beneficia realmente, indirizzando invece estrazione prevedibile, sintesi, coding leggero e classificazione verso modelli meno costosi.
- Scegliere il tier di elaborazione appropriato. Batch o Flex possono dimezzare le tariffe dei token per carichi di lavoro che non richiedono risultati immediati.
- Misurare l’intera traiettoria dell’agente. Un’ottimizzazione che rimuove il 20% dei token ma causa più esecuzioni fallite può rendere il sistema più costoso anziché più economico.
- Gestire attivamente lo storico con riassunti, retrieval, sotto-agenti con scope definito e conservazione selettiva dei risultati degli strumenti per evitare che la crescita del contesto diventi un problema di prezzo silente.
FAQ
Astra è più costoso di altri modelli?
Le sue tariffe Standard short-context per token sono 2,5× quelle di Sol e corrispondono ai prezzi headline di Fable per input/output. Gemini Flash è in una fascia di prezzo inferiore. I confronti sopra mostrano perché l’uso della cache e il costo per task accettato possono cambiare il ranking pratico.
Una richiesta piccola paga per l’intera finestra di contesto?
No. La fattura riflette i token elaborati. La fascia long-context si applica quando l’input supera 272.000 token; scegliere un modello con una finestra grande non attiva di per sé quella fascia.
Come dovrei stimare i risparmi con CometAPI?
Applicare le tariffe del provider per input, output, letture cache e scritture cache corrispondenti alla stessa composizione di token. La differenza del 20% indicata si applica a tali categorie; aggiungere separatamente eventuali altri addebiti prima di confrontare i conti totali.
Considerazioni finali
Il prezzo di Astra è più facile da giustificare quando le sue capacità migliorano un workflow difficile abbastanza da compensare tariffe più alte. Iniziare con un test rappresentativo, misurare i risultati accettati e confrontare la spesa totale e il tempo di correzione con una baseline adeguata.
Tenere sotto controllo la crescita del contesto, progettare prefissi riutilizzabili per il caching e selezionare un tier di elaborazione che si adatti al requisito di latenza. Usare l’API GPT-6 Astra in CometAPI quando le tariffe pubblicate e le funzionalità disponibili si adattano al carico di lavoro.
