Claude Haiku 5.5 and Nano Banana 2.1 are now live on CometAPI →
ai-model/Ricerca CometAPI

GPT-6.1 Sol Price: Prezzi dell'API, Token memorizzati nella cache, Contesto lungo e Costo di CometAPI

请提供需要翻译成意大利语的原文内容。

CometAPI
Deon GoodwinTeam di ricerca su modelli AI e API
Aggiornato Oct 10, 2026 16 min di lettura
GPT-6.1 Sol Price: Prezzi dell'API, Token memorizzati nella cache, Contesto lungo e Costo di CometAPI
Usa questo schema

Esegui la prima chiamata API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

GPT-6.1 Sol è il modello di ragionamento di OpenAI per coding complesso, uso del computer e flussi di lavoro professionali. Mantiene le tariffe ufficiali Standard di GPT-6 Sol per input nuovo e output a $2/$10 per milione di token, riducendo però le letture da cache del contesto breve da $0.20 a $0.10. Il riutilizzo riuscito della cache può abbassare i costi del contesto ripetuto. Un input superiore a 272K token attiva tariffe più alte per l’intera richiesta, quindi stima ogni richiesta prima di aggregare un conto. CometAPI ha un tariffario di gateway separato.

Key Takeaways

  • Separa input nuovo, letture cache, scritture cache e output fatturato; l’output include i token di ragionamento.
  • Usa la fascia di contesto corretta per ogni richiesta. Una capacità di contesto di 1,05M non implica prezzi da contesto breve.
  • Confronta OpenAI e CometAPI usando la stessa composizione di token e i termini di fatturazione applicabili al tuo account.
  • Scegli la modalità di elaborazione in base a latenza, disponibilità e supporto della rotta.
  • Valuta l’economia dell’agente in base al costo totale per task accettato, includendo i tentativi non riusciti.

What Is the GPT-6.1 Sol Price at a Glance?

Tutti i prezzi dei token sottostanti sono USD per milione di token. La tabella prezzi ufficiale dei token fornisce il riferimento OpenAI; le letture e le scritture cache sono categorie di fatturazione separate. Le fasce di contesto si riferiscono ai token di input in una singola richiesta.

Modalità OpenAI / fascia di inputInput nuovoLettura cacheScrittura cacheOutput
Standard: al massimo 272K$2.00$0.10$2.50$10.00
Standard: sopra 272K$4.00$0.20$5.00$15.00
Batch/Flex: al massimo 272K$1.00$0.05$1.25$5.00
Batch/Flex: sopra 272K$2.00$0.10$2.50$7.50
Fast: al massimo 272K$4.00$0.20$5.00$20.00
Fast: sopra 272K$8.00$0.40$10.00$30.00
Ultrafast: al massimo 272K$12.00$0.60$15.00$60.00
Ultrafast: sopra 272K$24.00$1.20$30.00$90.00

Tariffe dei livelli di elaborazione OpenAI verificate il 9 ottobre 2026; il confronto con CometAPI mantiene il tariffario del gateway dell’articolo di origine. Queste sono tariffe dei livelli di elaborazione OpenAI, non una garanzia che ogni livello sia esposto tramite un gateway. L’elaborazione regionale aggiunge il 10% dove applicabile. Conferma il servizio selezionato e i termini del tuo account prima di pianificare il budget.

Per gli sviluppatori che accedono a GPT-6.1 Sol tramite CometAPI, la tariffa a contesto Standard è inferiore al prezzo Standard diretto di OpenAI.

Categoria tokenCometAPIOpenAI StandardDifferenza
Input / 1M$1.60$2.0020% in meno
Input in cache / 1M$0.08$0.1020% in meno
Scrittura cache / 1M$2.00$2.5020% in meno
Output / 1M$8.00$10.0020% in meno

Per richieste a contesto lungo, l’API di GPT-6.1 Sol in CometAPI utilizza:

Token a contesto lungoCometAPIOpenAI
Input / 1M$3.20$4.00
Input in cache / 1M$0.16$0.20
Scrittura cache / 1M$4.00$5.00
Output / 1M$12.00$15.00

Questo preserva una differenza di prezzo di circa il 20% nelle principali categorie di token. Ai fini del budget, è importante perché un carico di lavoro in produzione raramente consiste solo di token di input nuovo. Una volta inclusi contesto in cache, generazione di output e richieste a contesto lungo, confrontare solo la tariffa di input pubblicizzata può sottostimare significativamente la differenza tra le rotte.

Il tariffario dei token di CometAPI fornisce il riferimento del gateway. Con 100K di input nuovo e 10K di output fatturato, OpenAI Standard costa $0.30; il corrispondente tariffario CometAPI costa $0.24. Con 10.000 richieste identiche, i totali solo token sono $3,000 e $2,400. Questo confronto esclude strumenti, scritture cache, retry e sovrapprezzi.

GPT-6.1 Sol è posizionato per coding complesso, uso del computer e flussi di lavoro professionali. La finestra di contesto da 1,050,000 token e l’output massimo da 128,000 token sono limiti di capacità, non una promessa di fatturazione da contesto breve: richieste sopra 272K token di input usano tariffe più alte. Accetta testo e immagini e produce testo; usa la Responses API per la chiamata degli strumenti, mentre Chat Completions supporta richieste senza strumenti. Verifica separatamente il supporto degli strumenti del gateway e i livelli di elaborazione quando scegli una rotta.

Additional GPT-6.1 Sol Agent Expenses

Il budget di un agente include anche strumenti ospitati, ambienti di esecuzione, storage e addebiti per servizi esterni. OpenAI elenca le chiamate di ricerca web a $10 per 1,000 chiamate. Il contenuto recuperato dalla ricerca è fatturato alle tariffe dei token del modello. Le chiamate di file-search costano $2.50 per 1,000; lo storage è $0.10 per GB al giorno dopo l’inclusione gratuita di 1 GB.

Hosted Shell e Code Interpreter usano addebiti separati per i container sotto lo stesso tariffario OpenAI citato sopra. La tariffa pubblicata per 1 GB è $0.03 per sessione di 20 minuti per container; le sessioni idonee usano fatturazione al minuto con un minimo di cinque minuti. Usa i termini effettivi degli strumenti e dell’esecuzione del gateway selezionato invece di presumere che questi addebiti del servizio diretto si applichino invariati.

Reasoning Effort and Total GPT-6.1 Sol Spend

Lo sforzo di ragionamento non è una tariffa separata nella tabella dei token, ma può modificare l’output fatturato, l’uso degli strumenti, la lunghezza della traiettoria e i retry. Confronta gli sforzi supportati da low a max sullo stesso set di task. Registra l’uso invece di stimare il costo del ragionamento solo dalla lunghezza visibile della risposta.

How Does the 272K Threshold Change GPT-6.1 Sol Cost?

Quando l’input supera 272K token, OpenAI applica tariffe da contesto lungo all’intera richiesta: input e tariffe della cache raddoppiano, mentre l’output aumenta del 50%. La soglia di input si applica anche quando gran parte dell’input è servita dalla cache.

Carico di lavoroInput nuovoOutput fatturatoOpenAI StandardCatalogo CometAPI
Piccola analisi20K2K$0.06$0.048
Revisione documento100K10K$0.30$0.24
Sotto la soglia270K10K$0.64$0.512
Sopra la soglia280K10K$1.27$1.016
Analisi repository300K20K$1.50$1.20
270K input: 0.27 x $2 + 0.01 x $10 = $0.64
280K input: 0.28 x $4 + 0.01 x $15 = $1.27
Input cresce di circa 3,7%; il costo dei token cresce di circa 98,4%.

Queste sono richieste indipendenti senza addebiti per cache, strumenti, retry o sovrapprezzi. L’effetto soglia è il motivo per cui la selezione del contesto conta anche quando il modello ha abbastanza capacità per l’intero repository.

How Does Prompt Caching Change GPT-6.1 Sol Input Costs?

Nel contesto breve Standard, le letture da cache costano $0.10/M rispetto a $2/M per l’input nuovo. Una lettura riuscita è quindi più economica del 95% per quella categoria di token. Una scrittura nella cache costa $2.50/M. I risparmi dipendono dal riuso riuscito del prefisso memorizzato nella cache, non semplicemente dal ripetere testo simile.

Considera dieci richieste che condividono un prefisso da 100K token. Ciascuna resta nella fascia di contesto breve. Il caso controllato con cache scrive l’intero prefisso una volta e lo legge con successo nove volte, senza scritture aggiuntive. Il prefisso da 100K token della prima richiesta è fatturato solo alla tariffa di scrittura cache; gli stessi token non sono anche addebitati come input nuovo.

Costo del prefisso ripetutoNessuna cacheUna scrittura + nove letture
Input di prefisso nuovo10 x 0.1 x $2 = $2.00$0.00
Scrittura cache$0.000.1 x $2.50 = $0.25
Letture cache$0.009 x 0.1 x $0.10 = $0.09
Subtotale prefisso$2.00$0.34

La riduzione di $1.66 è l’83% di questo costo del prefisso ripetuto. Non è una riduzione dell’83% in una tipica fattura API totale. Se ciascuna richiesta genera anche 2K token di output fatturato, l’output aggiunge $0.20 sulle dieci richieste: i totali diventano $2.20 e $0.54, una riduzione di circa il 75,5%. Nuovo input, mancate hit, scritture extra, strumenti e fasce di contesto lungo cambiano il risultato.

Sotto queste ipotesi semplificate di contesto breve, una scrittura una volta più N-1 letture costa 0.25 + 0.01(N-1) dollari per un prefisso da 100K, rispetto a 0.20N senza caching. Due richieste sono sufficienti per rendere più economico il caso con cache modellato, a condizione che la seconda richiesta effettivamente colpisca e che nessun altro costo cambi.

How Does GPT-6.1 Sol Pricing Compare with GPT-6 Sol and GPT-6 Astra?

OpenAI documenta le specifiche di GPT-6 Sol. La riduzione della lettura cache è un confronto di tariffe, non la prova di un costo totale per task inferiore.

Confronto ufficiale Standard a contesto breveGPT-6.1 SolGPT-6 SolGPT-6 Astra
Input nuovo / 1M token$2.00$2.00$10.00
Lettura cache / 1M token$0.10$0.20$1.00
Scrittura cache / 1M token$2.50$2.50$12.50
Output / 1M token$10.00$10.00$50.00
Finestra di contesto / output massimo1.05M / 128K1.05M / 128K1.05M / 128K

GPT-6.1 Sol dimezza la tariffa di lettura cache nel contesto breve. Input nuovo, scritture e output restano invariati. Il beneficio massimo dipende da quanta parte della tua fattura consiste in letture cache riuscite. Riesamina impostazioni di sforzo, cicli di strumenti e risultati dei task durante la migrazione.

Rispetto a GPT-6 Sol, GPT-6.1 Sol mantiene le stesse tariffe per input nuovo, scrittura cache e output, riducendo del 50% le tariffe di lettura cache. Rispetto a GPT-6 Astra, usa le tariffe sopra insieme alla qualità misurata del task e al costo totale della traiettoria.

Il tariffario di GPT-6 Astra colloca Astra in una fascia di prezzo per token più alta.

GPT-6.1 Sol è più economico dell’80% per input nuovo, scritture cache e output, e del 90% per letture cache in questa fascia. Questi rapporti non stabiliscono qualità equivalenti. Astra può valere il suo premio se risultati accettati migliori compensano la spesa aggiuntiva; GPT-6.1 Sol può essere preferibile quando raggiunge lo stesso target di accettazione a costo inferiore.

Confronta separatamente patch di repository, analisi di documenti e task di uso del computer. Mantieni costanti prompt, permessi degli strumenti, impostazioni di sforzo, limiti di retry e controlli di accettazione. Registra i fallimenti irrisolti oltre ai risultati riusciti; non inferire una classifica universale per coding o ricerca dai prezzi dei token.

What Does GPT-6.1 Sol Cost for Real API Workloads?

Calcola il costo per richiesta con la sua fascia e modalità di elaborazione effettive, quindi somma i risultati. L’input nuovo esclude le letture cache; non addebitare gli stessi token di input sia come nuovi sia come in cache. Usa i registri di utilizzo del provider per distinguere le scritture dalle altre voci di input. Nella formula seguente, fresh_input esclude sia cache_reads sia cache_writes. I token addebitati alla tariffa di scrittura cache non devono essere conteggiati anche come input nuovo. Tratta tutte e tre le quantità come categorie di fatturazione mutuamente esclusive e riconciliale con i registri di utilizzo del provider.

request_token_cost =
  fresh_input / 1_000_000 * fresh_rate
+ cache_reads / 1_000_000 * read_rate
+ cache_writes / 1_000_000 * write_rate
+ billed_output / 1_000_000 * output_rate

period_total = sum(request_token_cost) + other_charges

Aggregate Usage Across Multiple Short Requests

Dieci richieste che usano ciascuna 100K di input nuovo e 20K di output fatturato aggregano a 1M di input e 200K di output. Ogni richiesta individuale resta sotto 272K di input e sotto il limite di output di 128K. OpenAI Standard totalizza $4.00; CometAPI $3.20. La differenza del 20% si applica solo a queste categorie di token modellate. Questa non è una singola richiesta con 1M di input e 200K di output.

A Cache-Heavy Period With Separately Billed Writes

Supponi che un periodo registri 1M di input nuovo, 5M di letture cache, 500K di output fatturato e 500K di scritture cache. Tutte le richieste componenti restano nella fascia Standard a contesto breve. OpenAI costa $2.00 + $0.50 + $5.00 + $1.25 = $8.75. CometAPI costa $1.60 + $0.40 + $4.00 + $1.00 = $7.00. Queste categorie sono quantità di fatturazione distinte; l’esempio non presume che tutto l’input ripetuto sia un hit di cache.

One Long-Context Request

Una richiesta con 400K di input nuovo e 100K di output fatturato usa tariffe da contesto lungo. OpenAI Standard costa 0.4 x $4 + 0.1 x $15 = $3.10. CometAPI costa 0.4 x $3.20 + 0.1 x $12 = $2.48. Entrambi escludono nuove scritture cache e addebiti non basati su token. La quantità di output da 100K include il ragionamento e deve rientrare nel budget di output del modello.

How Do Standard, Batch, Flex, Fast, and Ultrafast Change GPT-6.1 Sol Cost?

Per una richiesta con 300K di input nuovo e 20K di output fatturato, usa la fascia a contesto lungo.

Modalità OpenAICosto inputCosto outputSubtotale token
Batch/Flex$0.60$0.15$0.75
Standard$1.20$0.30$1.50
Fast$2.40$0.60$3.00
Ultrafast$7.20$1.80$9.00

Calcolo Ultrafast: 0.30M di input nuovo x $24/M + 0.02M di output fatturato x $90/M = $7.20 + $1.80 = $9.00. Questo usa la fascia a contesto lungo ed esclude cache, strumenti e addebiti regionali.

Batch si adatta a valutazioni offline, arricchimento, backfill e processi di documenti in blocco. Flex offre tariffe inferiori per carichi idonei che tollerano elaborazione e disponibilità variabili. Standard è la base per richieste interattive. Fast raddoppia le tariffe dei token applicabili; selezionalo quando la riduzione dell’attesa ha un valore misurabile.

Ultrafast privilegia la latenza a un prezzo per token più alto. Per GPT-6.1 Sol, imposta service_tier su ultrafast nelle richieste Responses. OpenAI consiglia WebSockets per cicli rapidi di strumenti dell’agente; verifica i limiti specifici del livello e il supporto del gateway prima di instradare traffico di produzione. Le tariffe provengono dalla tabella prezzi ufficiale di OpenAI.

Queste tariffe non dimostrano che ogni livello sia abilitato per il tuo account gateway. Verifica il routing supportato e i vincoli regionali prima del rollout. Non pianificare a budget un’opzione di elaborazione non prezzata o non disponibile come se avesse già la tariffa Standard.

Why Is Cost per Successful GPT-6.1 Sol Task the Better Metric?

Dividi la spesa totale misurata per modello, strumenti ed esecuzione su un set di valutazione per risultati accettati. Includi i tentativi falliti nel numeratore. Riporta separatamente il tempo di correzione umana e i fallimenti irrisolti in modo che il costo non migliori semplicemente abbandonando i task più difficili.

observed_cost_per_accepted_task =
  all_evaluation_model_tool_execution_cost / accepted_tasks

A titolo illustrativo, un tentativo da $0.40 con una probabilità di successo del 60% ha un costo atteso di $0.40 / 0.60 = circa $0.67 fino al successo. Un tentativo da $0.55 con una probabilità dell’85% costa circa $0.65 sotto lo stesso modello. Queste sono cifre ipotetiche, non risultati di benchmark o affermazioni su un particolare modello.

Questa stima presume retry indipendenti con costo e probabilità di successo invariati, continuando fino al successo. Non aggiungere una seconda franchigia di retry: la divisione tiene già conto delle ripetizioni. Fallimenti correlati, retry limitati, diversa difficoltà dei task, strumenti e intervento umano possono rendere questo modello inadatto. Usa il costo osservato per task accettato nelle decisioni di produzione.

How Can You Reduce GPT-6.1 Sol API Costs?

Massimizza i prefissi di prompt riutilizzabili. Metti istruzioni di sistema stabili, definizioni degli strumenti, schemi e contesto di background in prefissi riutilizzabili. Il prezzo di $0.10/M per input in cache di GPT-6.1 Sol rende il contesto ripetuto poco costoso rispetto all’input nuovo.

Mantieni le richieste sotto 272K quando il contesto completo non è necessario. Superare 272K token di input cambia la tariffazione per l’intera richiesta. Retrieval, compressione del contesto e caricamento selettivo dei file possono quindi ridurre i costi anche quando il modello supporta tecnicamente una finestra di contesto da 1.05M.

Usa Batch per workflow asincroni in blocco. Valutazioni offline, arricchimento, backfill e processi di documenti in massa possono usare Batch quando i risultati non devono tornare immediatamente.

Usa Flex per richieste a bassa priorità che tollerano risposte più lente e occasionali indisponibilità di risorse. Pianifica ritardi e retry; verifica i carichi idonei e il supporto della rotta. Batch e Flex usano ciascuno le tariffe inferiori mostrate sopra, ma servono esigenze di elaborazione diverse.

Misura il costo per task accettato. Registra token di input nuovo, token di input in cache, scritture cache, token di output, modalità di elaborazione, addebiti degli strumenti, retry e successo del task. Quindi calcola il costo reale per completamento riuscito.

Instrada i task più semplici verso modelli più economici. Non ogni richiesta richiede un livello di ragionamento Sol. Classificazione, instradamento, estrazione semplice e altri task altamente verificabili possono adattarsi a un modello a costo inferiore, mentre GPT-6.1 Sol gestisce i task in cui un ragionamento più forte migliora materialmente il tasso di completamento.

Questo è particolarmente importante per gli agenti perché un’esecuzione fallita da $0.50 seguita da due retry può essere più costosa di una singola esecuzione riuscita da $1.00.

Usa limiti espliciti di completamento, limiti dei cicli di strumenti e budget di retry. Esamina i registri di utilizzo per input nuovo, letture cache, scritture, output di ragionamento, livello, fascia di contesto e addebiti degli strumenti. Confronta i risparmi con la qualità dei task accettati dopo ogni modifica.

Conclusion

GPT-6.1 Sol è attraente quando un workflow richiede ragionamento complesso a prezzi di livello Sol e può riutilizzare un contesto stabile. Mantiene le tariffe Standard headline di GPT-6 Sol di $2/$10 riducendo le letture cache del contesto breve a $0.10/M. Astra ha tariffe per token più alte, ma la scelta dovrebbe seguire la qualità del carico di lavoro e il costo per task accettato.

Inizia con stime per richiesta, separa le scritture cache dalle letture e presta attenzione alla soglia di 272K. Quindi misura l’intera traiettoria dell’agente e scegli un livello di elaborazione che si adatti a latenza e disponibilità. CometAPI fornisce un tariffario separato; conferma i termini effettivi del tuo account e degli strumenti prima di scalare.

FAQ

How Should GPT-6.1 Sol Budgets Handle Failed or Cancelled Requests?

Traccia separatamente l’uso del provider per richieste completate, incomplete, fallite e annullate. Non presumere che ogni richiesta non riuscita sia gratuita o che ogni annullamento lato client impedisca il lavoro lato server. Riconcilia gli identificatori di richiesta e l’utilizzo con i registri di fatturazione, quindi includi il lavoro non riuscito ma fatturato nel calcolo del costo per task accettato. Conferma le regole specifiche di addebito e rimborso del provider invece di inferirle dallo status HTTP.

How Should Teams Forecast GPT-6.1 Sol Costs for Variable Traffic?

Segmenta il traffico per fascia di input, livello di elaborazione, composizione della cache e carico di lavoro. Usa distribuzioni misurate di token e completamenti piuttosto che un prompt medio. Costruisci un forecast di base e scenari per tassi di hit inferiori, più retry e output più lunghi; monitora anche la quota che supera 272K. Aggiorna il forecast man mano che il mix di task cambia.

How Can Teams Reconcile GPT-6.1 Sol Forecasts With Invoices?

Scegli un periodo di fatturazione completato e raggruppa le richieste per rotta, livello di elaborazione e fascia di input. Riconcilia l’uso registrato con le categorie di fattura e i crediti, incluse rettifiche, addebiti degli strumenti e qualsiasi imposta o conversione di valuta applicabile. Indaga le discrepanze usando identificatori di richiesta e timestamp di fatturazione invece di applicare un fattore correttivo inspiegato. Conferma la reportistica ritardata e le regole di arrotondamento del provider prima di modificare il forecast.

Continua a imparare

Collega questo articolo alla prossima decisione.

Vedi tutti gli argomenti
Pubblicato il Oct 10, 2026
Ultimo aggiornamento Oct 10, 2026
0 visualizzazioni
Revisionato per chiarezza, attribuzione delle fonti e terminologia API aggiornata.

Leggi di più