GPT-6 Astra is now live on CometAPI →
ai-model/Ricerca CometAPI

Che cos'è GPT-6 Astra? Specifiche, benchmark, prezzi e accesso alle API

GPT-6 Astra: contesto da 1.05M, output da 128K, tariffe API, miglioramenti nei benchmark, limitazioni e confronti con GPT-5.6 Sol, Claude Fable 5.1, Gemini 3.8 Flash.

CometAPI
Mia MarenTeam di ricerca su modelli AI e API
Aggiornato Sep 4, 2026 17 min di lettura
Che cos'è GPT-6 Astra? Specifiche, benchmark, prezzi e accesso alle API
Usa questo schema

Esegui la prima chiamata API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Rispondi prima

GPT-6 Astra è il nuovo modello di punta di OpenAI per lavori difficili end-to-end. OpenAI ha rilasciato GPT-6 Astra il 3 settembre 2026, posizionandolo su ragionamento complesso, uso del computer, coding, ricerca, lavoro scientifico e creazione professionale di artefatti. Il modello API ha una finestra di contesto da 1.05M token e un output massimo di 128K, accetta input di testo e immagini e supporta lo sforzo di ragionamento da low fino a max. La tariffazione API Standard parte da $10 input / $50 output per milione di token. Il cambiamento pratico più importante non è un salto uniforme in ogni benchmark di intelligenza generale: i maggiori guadagni di Astra appaiono nell’esecuzione agentica, nell’uso del computer, nel recupero in contesto lungo, nei flussi di lavoro di coding, nella scienza e nella cybersecurity.

Questo è importante perché il vecchio articolo di CometAPI GPT-6 Is Coming Soon — What Will It Look Like? era necessariamente speculativo. Ora che Astra è pubblico, questa guida si concentra sul comportamento confermato del modello, sui compromessi dei benchmark, sull’economia dell’API e su dove il modello è effettivamente una scelta migliore rispetto alle alternative di frontiera più economiche.

Che cos’è GPT-6 Astra?

GPT-6 Astra è il successore del modello di punta GPT-5.6 Sol di OpenAI. OpenAI descrive Astra come il suo modello più capace per i lavori end-to-end più difficili, con enfasi su flussi di lavoro che richiedono al modello di ragionare, usare strumenti, interagire con il software, rivedere il lavoro intermedio e portare un’attività da una richiesta iniziale a un risultato finito. Questo posizionamento è importante: Astra non è semplicemente un modello di chat più grande. È progettato per agire come il motore di ragionamento all’interno di agenti che lavorano su browser, terminali, documenti, fogli di calcolo, ambienti di sviluppo e software enterprise.

Il post di lancio evidenzia risultati allo stato dell’arte su uso del computer, browsing, ingegneria del software, cybersecurity, scienza e lavoro professionale. Riporta 97.6% / 99.9% / 100% su FrontierMath Tier 4, ARC-AGI-3 ed ExploitBench rispettivamente. Questi punteggi di rilievo sono notevoli, ma non dovrebbero essere interpretati come “Astra vince ogni benchmark.” Sull’Artificial Analysis Intelligence Index utilizzato nella tabella comparativa di OpenAI, Astra ottiene 61.2 mentre Claude Fable 5.1 raggiunge 65.7. Il rilascio va quindi compreso meglio come un cambio di passo nell’esecuzione e nel lavoro agentico più che come una vittoria netta su tutte le misure di intelligenza.

Cosa è cambiato rispetto a GPT-5.6 Sol?

L’uso del computer è diventato una capacità di prima classe

Il guadagno generazionale più chiaro di Astra è l’uso del computer. Su OSWorld 2.0, OpenAI riporta 72.6% per Astra contro 65.7% per GPT-5.6 Sol. Nella stessa simulazione di latenza, Astra ha completato i compiti in circa 40 minuti rispetto a circa 75 minuti per Sol, una riduzione di circa il 47%. Combinato con un harness Codex aggiornato, OpenAI riporta un completamento 1.9× più veloce su Mind2Web. Il punto pratico non è solo che Astra può vedere uno schermo; può mantenere coerente più a lungo un compito software a più passi, facendo meno deviazioni costose.

La creazione di artefatti professionali è più ponderata

OpenAI ha esplicitamente addestrato Astra per flussi di lavoro professionali che terminano in artefatti utilizzabili piuttosto che in semplice prosa. I materiali di lancio descrivono prestazioni più forti su documenti, fogli di calcolo, presentazioni, analisi dei dati, lavoro di design e aderenza ai template. Astra è anche migliore nel mantenere l’orientamento quando i requisiti cambiano a metà attività, quindi un messaggio di steering ha meno probabilità di sovrascrivere l’obiettivo originale. Questo è particolarmente utile negli agenti enterprise di lunga durata, dove nuove istruzioni spesso arrivano dopo l’avvio del flusso di lavoro.

Le sessioni lunghe mantengono più contesto di lavoro utile

Per le lunghe sessioni di coding, Astra introduce un nuovo modo per Codex di preservare e recuperare note dopo che il contesto attivo si riempie. Gli approcci precedenti si basavano fortemente sulla compattazione, che può omettere il motivo per cui una correzione tentata è fallita o quali vincoli sono già stati testati. OpenAI afferma che Astra può mantenere note tra finestre di contesto, migliorando la continuità durante grandi refactoring e sessioni di debugging.

Lo sforzo di ragionamento ora si estende fino a max

Gli sviluppatori possono scegliere low, medium, high, xhigh o max come sforzo di ragionamento. Questo crea una curva qualità-costo più ampia rispetto a trattare Astra come un singolo punto operativo fisso. Le linee guida ufficiali del modello consigliano di selezionare il livello di sforzo più basso che soddisfi il target di valutazione, perché la migliore economia del modello spesso deriva dall’efficienza in token piuttosto che dall’esecuzione costante al massimo ragionamento.

Prestazioni di benchmark di GPT-6 Astra

OpenAI ha pubblicato un ampio confronto che abbraccia uso del computer, lavoro professionale, coding, ragionamento accademico, salute, cybersecurity, contesto lungo e allineamento. Il modo più utile per leggere la tabella è separare “intelligenza generale” da “capacità di completare lavoro usando strumenti”. Astra è solo marginalmente sopra Sol sull’Artificial Analysis Intelligence Index nella tabella di OpenAI, ma è nettamente avanti su diversi benchmark agentici e operativi.

BenchmarkGPT-6 AstraGPT-5.6 SolCosa suggerisce il delta
AutomationBench41.4%18.1%Grande guadagno nei flussi di lavoro aziendali end-to-end
OSWorld 2.072.6%65.7%Migliore interazione con il computer e completamento dei compiti
Terminal-Bench 4.057.9%37.3%Grande guadagno nel coding agentico basato su terminale
Terminal-Bench Science 0.164.6%22.4%Grande guadagno nei flussi scientifici usando codice/strumenti
FrontierMath Tier 4 v297.6%83.0%Ragionamento matematico di frontiera più forte
ExploitBench100.0%78.5%Capacità di cybersecurity di classe Critical
SRE-Bench, one attempt88.0%55.9%Lavoro di reverse engineering / SRE molto più forte
MRCR v2, 512K-1M96.3%73.8%Migliorato il recupero in contesto molto lungo
AA Intelligence Index v4.1.161.260.9L’intelligenza generale è sostanzialmente piatta vs Sol

Il pattern è insolitamente chiaro. Il vantaggio di Astra è maggiore quando un benchmark richiede un’interazione sostenuta con uno strumento o un ambiente. AutomationBench sale da 18.1% a 41.4%; Terminal-Bench Science aumenta da 22.4% a 64.6%; e l’MRCR su contesti lunghi migliora da 73.8% a 96.3% nella banda 512K–1M. Per contro, l’Artificial Analysis Intelligence Index passa da 60.9 a 61.2. Ecco perché descrivere Astra come “2,5× più costoso ma leggermente più intelligente” manca la reale proposta di valore del prodotto.

Che cos'è GPT-6 Astra? Specifiche, benchmark, prezzi e accesso alle API

Fonte: grafico OpenAI AutomationBench (immagine originale, non ridisegnata)

Benchmark indipendenti: GPT-6 Astra è un salto generazionale?

I test indipendenti aggiungono un importante controllo di realtà. Artificial Analysis riporta un punteggio Intelligence Index di 61, pari a GPT-5.6 Sol a sforzo massimo. Allo stesso tempo, Astra migliora fortemente sul Coding Agent Index e usa sensibilmente meno token nel coding agentico. Artificial Analysis ha misurato una riduzione di circa tre volte nell’uso di token rispetto a GPT-5.6 Sol a sforzo massimo nel suo harness Codex, consentendo ad Astra di ottenere punteggi più alti a circa lo stesso costo per compito di coding-agent.

L’economia appare meno favorevole sull’intelligenza generale. Astra usa circa il 10% di token di output in meno rispetto a Sol nell’Intelligence Index a sforzo massimo, ma l’aumento di prezzo per token di 2,5× domina quel guadagno di efficienza; Artificial Analysis stima che Astra sia circa il 75% più costoso per compito a sforzo massimo. Riporta anche una riduzione del tasso di allucinazioni dal 92% al 51% su AA-Omniscience mentre l’accuratezza è aumentata di quattro punti.

La conclusione utile è specifica per il carico di lavoro: GPT-6 Astra appare più generazionale dove un agente deve agire, iterare, usare strumenti e portare a termine un lavoro complicato. Per ragionamento ordinario o generazione di testo ad alto volume, il premio di prezzo può essere molto più difficile da recuperare.

GPT-6 Astra vs GPT-5.6 Sol vs Claude Fable 5.1 vs Gemini 3.8 Flash

Un confronto pratico di selezione modello dovrebbe includere capacità, multimodalità, contesto, esecuzione agentica e prezzo. I modelli sotto non sono intercambiabili: Astra ottimizza per l’esecuzione end-to-end difficile, Claude Fable 5.1 guida alcune misure di intelligenza generale e Gemini 3.8 Flash offre prezzi per token molto più bassi con modalità di input native più ampie.

Che cos'è GPT-6 Astra? Specifiche, benchmark, prezzi e accesso alle API

MetricaGPT-6 AstraGPT-5.6 SolClaude Fable 5.1Gemini 3.8 Flash
Finestra di contesto1.05M1.05M1M1.048M
Output massimo128K128K128K65.5K
Modalità di inputTesto, immagineTesto, immagineTesto, immagine/PDFTesto, immagine, audio, video, PDF
AA Intelligence Index61.260.965.758.7
AutomationBench41.4%18.1%31.4%
Terminal-Bench 4.057.9%37.3%55.8%19.1%
DeepSWE 1.174.1%72.7%67.4%73.8%
FrontierMath Tier 4 v297.6%83.0%87.8%
HLE with tools57.2%65.0%
HealthBench Professional63.4%60.5%58.1%52.1%
Prezzo ufficiale standard input$10/M$4/M$10/M$0.75/M
Prezzo ufficiale standard output$50/M$20/M$50/M$3.75/M

Quando GPT-6 Astra è la scelta migliore

Scegli Astra quando il compito è costoso perché gli umani devono salvare esecuzioni agentiche fallite: grandi modifiche di coding, automazione su browser/desktop, ricerca approfondita che attraversa strumenti, creazione di artefatti tecnici o flussi di lavoro scientifici e operativi complessi. Il suo premio si giustifica più facilmente quando meno retry, meno correzioni manuali e minore uso di token di output contano più del prezzo per token.

Quando Claude Fable 5.1 è la scelta migliore

Claude Fable 5.1 resta un concorrente di frontiera serio. Nella tabella di lancio di OpenAI, ottiene 65.7 sull’Artificial Analysis Intelligence Index contro i 61.2 di Astra e 65.0 su Humanity’s Last Exam con strumenti contro i 57.2 di Astra. Ciò significa che Astra non dovrebbe essere commercializzato come un vincitore universale di intelligenza. Se il tuo set di valutazione assomiglia più a ragionamento long-form che a esecuzione di uso del computer, Claude Fable 5.1 può ancora essere la scelta più forte.

Quando Gemini 3.8 Flash è la scelta migliore

Gemini 3.8 Flash punta a un diverso punto di frontiera. Supporta input di testo, immagine, audio, video e PDF con una finestra di contesto di circa 1M token, mentre il prezzo introduttivo ufficiale è molto inferiore ad Astra. Per estrazione multimodale ad alto volume, comprensione video/audio, agenti di routine o carichi di lavoro in cui l’economia di token $10/$50 è difficile da giustificare, Gemini 3.8 Flash è spesso la scelta di produzione più economica.

Perché la valutazione di cybersecurity di GPT-6 Astra è importante

Astra è il primo modello di OpenAI ampiamente distribuito a raggiungere la soglia di capacità di cybersecurity Critical secondo il Preparedness Framework dell’azienda. OpenAI afferma che il modello può identificare vulnerabilità di sicurezza precedentemente sconosciute e sviluppare strategie di exploit su sistemi hardenizzati quando dispone degli strumenti e dell’accesso giusti. Nelle valutazioni di lancio, Astra ha ottenuto 100% su ExploitBench, 42.4% su ExploitGym e 88.0% su SRE-Bench in un tentativo.

Questa capacità comporta controlli di deployment più severi. OpenAI afferma che le salvaguardie di produzione possono rallentare, mettere in pausa o fermare lavori legittimi, in particolare nei contesti cyber a rischio più elevato. ChatGPT o Codex possono chiedere a un utente di rivedere un’azione prima di continuare, mentre un compito API può fermarsi. Il deployment predefinito di Astra rifiuta anche richieste più avanzate di creazione di exploit; il programma Daybreak fornisce accesso separato e verificato per alcuni flussi di lavoro difensivi.

La system card documenta un compromesso di monitorabilità: Astra è generalmente meglio allineato di Sol, ma il suo ragionamento scritto può essere più difficile da monitorare in condizioni di valutazione avversariali. OpenAI distribuisce quindi un monitoraggio di misallineamento più ampio attorno all’inferenza di Astra che usa strumenti. I team enterprise dovrebbero trattare permessi degli agenti, confini di approvazione, log di audit e accesso agli strumenti con privilegi minimi come parte dell’architettura del modello e non come componenti opzionali.

Che cos'è GPT-6 Astra? Specifiche, benchmark, prezzi e accesso alle API

Fonte: grafico ufficiale OpenAI ExploitGym honeypot safety (immagine originale, non ridisegnata)

Prezzi di GPT-6 Astra

La pagina attuale dei prezzi API di OpenAI separa richieste a contesto corto e lungo. Per l’elaborazione Standard, le tariffe a contesto corto sono $10 input, $1 input in cache, $12.50 cache write e $50 output per milione di token. Le richieste sopra 272K token di input usano il listino a contesto lungo: $20 input, $2 input in cache, $25 cache write e $75 output per milione di token.

Elaborazione / contestoInputInput in cache / cache writeOutput
Standard, contesto corto$10/M$1/M / $12.50/M$50/M
Standard, contesto lungo (>272K input)$20/M$2/M / $25/M$75/M
Batch / Flex, contesto corto$5/M$0.50/M / $6.25/M$25/M
Batch / Flex, contesto lungo$10/M$1/M / $12.50/M$37.50/M
Fast mode, contesto corto$20/M$2/M / $25/M$100/M
Fast mode, contesto lungo$40/M$4/M / $50/M$150/M

Rispetto a GPT-5.6 Sol, i prezzi per token Standard a contesto corto di Astra sono 2,5× più alti ($10/$50 contro $4/$20). Questo premio non significa automaticamente un costo per compito completato 2,5× più alto. Nel coding agentico, OpenAI e Artificial Analysis riportano entrambi un minor uso di token di output per Astra in alcune configurazioni. L’unità corretta per la valutazione è quindi il costo per compito riuscito, non il costo per token da solo.

Come accedere a GPT-6 Astra

OpenAI ha iniziato un rollout a fasi il 3 settembre 2026. Astra è programmato per raggiungere gli utenti ChatGPT Plus, Pro, Business ed Enterprise, l’API OpenAI e AWS nei giorni successivi. Gli amministratori Enterprise possono abilitare Astra per workspace e l’accesso è disabilitato per impostazione predefinita al lancio.

Chiamare GPT-6 Astra con le OpenAI Responses API

from openai import OpenAI
client = OpenAI()

response = client.responses.create(
    model="gpt-6-astra",
    reasoning={"effort": "high"},
    input=(
        "Esamina l'architettura di questo repository. Individua il problema di "
        "progettazione a rischio più elevato, spiega le evidenze e proponi un piano di migrazione."
    ),
)

print(response.output_text)

L’ID del modello è gpt-6-astra. Per i flussi di lavoro ricchi di strumenti, le Responses API sono il punto di partenza naturale perché Astra supporta function calling, output strutturati, web search, file search, code interpreter, hosted shell, apply patch, uso del computer, MCP e tool search. Il fine-tuning non è attualmente supportato.

Casi d’uso reali di GPT-6 Astra

Sviluppo di giochi e flussi di lavoro software visuali

Playco ha testato Astra all’interno di Playbot, un IDE alimentato da AI che lavora direttamente in Unity e Godot. OpenAI riporta il 50% di correzioni manuali in meno rispetto al modello precedente e tre prototipi a tema costruiti da una singola base grey-box. Questo esempio è importante perché l’attività richiede più della generazione di codice sorgente: il modello deve ragionare sul layout spaziale, giocare, testare modifiche, identificare bug e iterare all’interno di un ambiente visivo.

Revisione di documenti legali e finanziari

OpenAI posiziona Astra per flussi di lavoro professionali a più passi che producono documenti, fogli di calcolo e analisi rifiniti. Nella revisione legale e finanziaria, il suo valore pratico è mantenere lo stato del compito su molti file, verificare incrociando le evidenze e restituire un artefatto finito piuttosto che rispondere a una domanda isolata. Restano necessari validazione esperta, controlli di approvazione e accesso ai dati a privilegi minimi.

Agenti ingegneristici a lungo orizzonte

La combinazione di risultati su Terminal-Bench, DeepSWE, migrazione di database, uso del computer e contesto lungo rende Astra particolarmente rilevante per l’ingegneria a scala di repository. Un pattern di deployment utile è fornire ad Astra un ambiente di sviluppo vincolato, un issue o un obiettivo di migrazione, test e accesso agli strumenti; quindi valutare il successo sulla qualità del compito unito, numero di iterazioni fallite, tempo di revisione umana e costo totale. Questa è una metrica di produzione migliore rispetto a un singolo punteggio di benchmark di coding.

Limitazioni di GPT-6 Astra

  • Prezzo per token premium. Astra costa 2,5× GPT-5.6 Sol per token nella tariffazione Standard a contesto corto, quindi chat di routine, classificazione, estrazione e drafting semplice sono spesso antieconomici.
  • Il contesto lungo ha una sovrattassa. Le richieste con più di 272K token di input passano a tariffe più alte per l’intera richiesta, quindi “contesto 1.05M” non va interpretato come memoria a prezzo fisso.
  • Nessun input audio o video nativo nel modello. Astra accetta testo e immagini e produce testo; Gemini 3.8 Flash è più flessibile quando la comprensione audio/video nativa è centrale per il carico di lavoro.
  • Nessun fine-tuning. La pagina ufficiale del modello attualmente elenca il fine-tuning come non supportato, quindi la personalizzazione si basa su prompting, strumenti, retrieval e design del flusso di lavoro.
  • Le salvaguardie cyber possono interrompere i flussi di lavoro. OpenAI avverte esplicitamente che controlli di sicurezza aggiuntivi possono mettere in pausa o fermare lavori legittimi in contesti a rischio più elevato.
  • Non è un vincitore universale di benchmark. Claude Fable 5.1 guida Astra sull’Artificial Analysis Intelligence Index e sulle figure HLE-with-tools incluse nel confronto di lancio di OpenAI.

FAQ

GPT-6 Astra è ufficialmente rilasciato?

Sì. OpenAI ha iniziato il rollout il 3 settembre 2026. La disponibilità è scaglionata tra organizzazioni, piani a pagamento di ChatGPT, accesso API e AWS, piuttosto che apparire per ogni account nello stesso momento.

Qual è la finestra di contesto di GPT-6 Astra?

La pagina ufficiale del modello elenca una finestra di contesto da 1.05M token e un output massimo di 128K token. Le richieste oltre 272K token di input usano il listino a contesto lungo.

Quanto costa GPT-6 Astra?

La tariffazione Standard a contesto corto è $10 input / $50 output per milione di token, con $1 input in cache e $12.50 cache write. Contesto lungo, Batch/Flex e Fast mode hanno tariffe diverse, quindi le stime di produzione dovrebbero usare il tier che corrisponde alla richiesta effettiva.

GPT-6 Astra è migliore di Claude Fable 5.1?

Dipende dal carico di lavoro. Astra guida diverse valutazioni su uso del computer, coding-agent, scienza, cyber e lavoro professionale, mentre Claude Fable 5.1 supera Astra sull’Artificial Analysis Intelligence Index e su HLE con strumenti nella comparativa pubblicata da OpenAI. Usa le tue valutazioni di agente/compito invece di presumere che un modello domini ogni categoria.

GPT-6 Astra è AGI?

Le pagine prodotto ufficiali di OpenAI descrivono Astra come una nuova generazione di intelligenza e il suo modello più capace ampiamente distribuito, ma non definiscono il prodotto stesso come “AGI”. La saturazione dei benchmark su alcuni compiti non è equivalente a una definizione di AGI universale e consolidata.

Conclusione

GPT-6 Astra va compreso come un modello di frontiera focalizzato sull’esecuzione. La prova più forte dei suoi progressi non è il piccolo movimento da 60.9 a 61.2 rispetto a GPT-5.6 Sol sull’Artificial Analysis Intelligence Index; è il miglioramento molto più grande nell’uso del computer, nel coding agentico, nei flussi di lavoro scientifici, nel recupero su contesti lunghi, nel completamento di compiti professionali e nella cybersecurity. La finestra di contesto da 1.05M e lo stack di strumenti profondo danno agli sviluppatori più spazio per costruire agenti che restano utili oltre una singola risposta.

Il compromesso è il prezzo. La tariffazione Standard $10/$50 è premium, le richieste a contesto lungo costano di più e i test indipendenti mostrano che Astra può essere significativamente più costoso di Sol nei carichi di lavoro di intelligenza generale. Il modello si guadagna quel premio quando migliori tassi di completamento e minori correzioni umane superano il costo dei token. Per carichi di lavoro più semplici o ad alto volume, GPT-5.6, Claude Fable 5.1 e soprattutto Gemini 3.8 Flash restano alternative rilevanti piuttosto che predecessori obsoleti.

Continua a imparare

Collega questo articolo alla prossima decisione.

Vedi tutti gli argomenti
Pubblicato il Sep 4, 2026
Ultimo aggiornamento Sep 4, 2026
19 visualizzazioni
Revisionato per chiarezza, attribuzione delle fonti e terminologia API aggiornata.

Pronto a ridurre i costi di sviluppo AI del 20%?

Inizia gratuitamente in pochi minuti. Crediti di prova gratuiti inclusi. Nessuna carta di credito richiesta.

Leggi di più