TL;DR Il pricing della Grok API non è solo una tabella di token. L’attuale lineup API di xAI ora include grok-4.5 a $2 / $0.50 / $6 per 1M token di input/input in cache/output, grok-4.3 a $1.25 / $0.20 / $2.50, e grok-build-0.1 per il codice a $1.00 / $0.20 / $2.00.
Il costo nascosto è tutto ciò che circonda la riga del modello base: Web Search, X Search, Code Execution, Imagine, Voice, elaborazione prioritaria, modalità batch, storage, retry e commissioni per violazione delle linee guida d’uso possono tutti cambiare il conto finale.
Per i builder, la domanda pratica non è “Grok è economico?” ma: Quale modello Grok, quali strumenti e quale livello di servizio producono il costo più basso per attività riuscita?
Panorama dei prezzi della Grok API
| Voce | Dettaglio API xAI attuale |
|---|---|
| Modello di punta più recente | grok-4.5 |
| Percorso chat a costo inferiore | grok-4.3 |
| Modello per il codice | grok-build-0.1 |
| Migliori primi test | Chat, agenti per il codice, workflow basati sulla ricerca, generazione di immagini/video |
| Contesto Grok 4.5 | 500k token |
| Contesto Grok 4.3 | 1M token |
| Contesto Grok Build | 256k token |
| Prezzo Grok 4.5 | $2.00 input / $0.50 input in cache / $6.00 output per 1M token |
| Prezzo Grok 4.3 | $1.25 input / $0.20 input in cache / $2.50 output per 1M token |
| Prezzo Grok Build | $1.00 input / $0.20 input in cache / $2.00 output per 1M token |
| Avvertenza sui costi degli strumenti | Web Search, X Search e Code Execution costano ciascuno $5 / 1k chiamate |
| Avvertenza sui costi di priorità | L’elaborazione prioritaria costa 2x il pricing token standard quando applicata |
| Telemetria richiesta | tokens, cached tokens, reasoning tokens, tool calls, priority tier, cost_in_usd_ticks, success rate |
I tre numeri che cambiano il tuo conto Grok
- $0.20-$0.50 input in cache per 1M token: la cache del prompt può incidere con prompt lunghi ripetuti.
- $5 / 1k chiamate Web Search, X Search o Code Execution: agenti ricchi di strumenti possono spendere più per gli strumenti che per i token.
- Prezzi token 2x in priorità: l’elaborazione prioritaria è una funzione di latenza, non un’impostazione predefinita.
Perché il costo della Grok API è più del pricing a token
La tariffa headline sui token spiega solo una parte del conto Grok. I workflow basati sulla ricerca e quelli agentici possono includere commissioni per strumenti lato server, mentre elaborazione prioritaria, generazione media, storage, retry e commissioni per violazione delle linee guida d’uso cambiano il costo effettivo per attività riuscita.
Cosa è stato effettivamente rilasciato
La documentazione e la pagina prezzi di xAI per Grok 4.5 elencano grok-4.5 come il modello di punta più recente, con una finestra di contesto da 500k e prezzi di $2 input, $0.50 input in cache e $6 output per 1M token. La pagina dei modelli posiziona Grok 4.5 come il percorso di punta per codice, tool calling e knowledge work, mentre Grok 4.3 resta un percorso a costo inferiore con 1M di contesto e Grok Build rimane rilevante per i test focalizzati sul codice.

Fonte: xAI Grok 4.5 documentation
Il cambiamento chiave per i builder è che “latest” e “best route” non coincidono più. Grok 4.5 è la nuova opzione frontier, ma Grok 4.3 può ancora essere il percorso a costo migliore per carichi a lungo contesto o ad alto volume. Per un’analisi più approfondita dell’ultima release, l’overview su architettura, timeline di rilascio e disponibilità è in CometAPI’s Grok 4.5 architecture.
Di cosa discutono i builder
Le discussioni pubbliche qui citate si concentrano meno sulla tariffa headline e più sull’uso composto, le chiamate a strumenti, la velocità e i costi legati alle policy. La discussione su Hacker News di Grok 4.3 e la discussione sul pricing della Grok API su r/grok sono segnali operativi utili, ma le cifre in questa guida seguono la documentazione ufficiale di xAI.
Tabella prezzi della Grok API
La documentazione dei prezzi di xAI elenca i prezzi in USD e separa code, chat, Imagine, Voice, strumenti, batch ed elaborazione prioritaria.
| Area API | Modello o modalità | Contesto / unità | Prezzo |
|---|---|---|---|
| Code API | grok-build-0.1 | 256k contesto | $1.00 input / $0.20 input in cache / $2.00 output per 1M token |
| Chat API | grok-4.5 | 500k contesto | $2.00 input / $0.50 input in cache / $6.00 output per 1M token |
| Chat API | grok-4.3 | 1M contesto | $1.25 input / $0.20 input in cache / $2.50 output per 1M token |
| Chat API | grok-4.20-multi-agent-0309 | 1M contesto | $1.25 input / $0.20 input in cache / $2.50 output per 1M token |
| Chat API | grok-4.20-0309-reasoning | 1M contesto | $1.25 input / $0.20 input in cache / $2.50 output per 1M token |
| Chat API | grok-4.20-0309-non-reasoning | 1M contesto | $1.25 input / $0.20 input in cache / $2.50 output per 1M token |
| Voice API | Realtime Text Input | per messaggio | $0.004 per messaggio |
| Voice API | Realtime | per minuto / ora | $0.05 per minuto, o $3.00 per ora |
| Voice API | Text to Speech | caratteri | $15.00 per 1M caratteri |
| Voice API | Speech to Text | ora audio | $0.10 / hr REST, $0.20 / hr streaming |
Grok 4.5 vs altri prezzi API mainstream
La riga base sui token fa sembrare Grok 4.5 più economico di alcuni percorsi frontier ma più costoso di Grok 4.3. Il confronto sotto usa prezzi testuali dalle pagine ufficiali dei provider al 10 luglio 2026 ed è da trattare come una fotografia, non come una decisione di routing a sé stante.
| Provider | Model | Input price | Cached input | Output price | Nota sui prezzi |
|---|---|---|---|---|---|
| xAI | grok-4.5 | $2.00 / 1M | $0.50 / 1M | $6.00 / 1M | Ultimo Grok flagship |
| xAI | grok-4.3 | $1.25 / 1M | $0.20 / 1M | $2.50 / 1M | Percorso chat Grok a costo inferiore |
| OpenAI | gpt-5.6 | $5.00 / 1M | $0.50 / 1M | $30.00 / 1M | Prezzi standard a contesto breve; Batch/Flex sono inferiori del 50% |
| Anthropic | claude-sonnet-5 | $2.00 intro, poi $3.00 / 1M | $0.20 intro, poi $0.30 / 1M cached read | $10.00 intro, poi $15.00 / 1M | Prezzi introduttivi fino al 31 agosto 2026 |
| gemini-3.1-pro-preview | $1.25 / 1M, o $2.50 oltre 200k prompt | $0.125 / 1M, o $0.25 oltre 200k prompt | $10.00 / 1M, o $15.00 oltre 200k prompt | L’output include token di “thinking” |
La conclusione è semplice: Grok 4.5 non è il percorso Grok più economico, ma il suo prezzo di output è sotto diversi modelli testuali high-end. In produzione, confronta il costo totale per attività riuscita, non solo le righe input/output.
Per la generazione di immagini e video, l’unità di prezzo passa dai token alle immagini o ai secondi:
| Imagine model | Input cost | Output cost |
|---|---|---|
| grok-imagine-image-quality | $0.01 / immagine di input | $0.05 / immagine 1K, $0.07 / immagine 2K |
| grok-imagine-image | $0.002 / immagine di input | $0.02 / immagine 1K o 2K |
| grok-imagine-video-1.5 | $0.01 / immagine di input | $0.08 / sec a 480p, $0.14 / sec a 720p, $0.25 / sec a 1080p |
| grok-imagine-video | $0.002 / immagine di input, $0.01 / sec di input | $0.05 / sec a 480p, $0.07 / sec a 720p |
Per i team che testano workflow media più che chat testuale, la pagina modello della Grok Imagine Video API di CometAPI è un passo successivo migliore rispetto alla sola tabella prezzi dei modelli chat.
Il livello di costo nascosto: strumenti lato server
La Grok API può usare strumenti lato server, e quegli strumenti non sono gratuiti. La pagina prezzi afferma che le richieste che usano strumenti forniti da xAI vengono fatturate da due componenti: uso token del modello e invocazioni degli strumenti.
| Tool | Tool name | Cost |
|---|---|---|
| Web Search | web_search | $5 / 1k calls |
| X Search | x_search | $5 / 1k calls |
| Code Execution | code_execution, code_interpreter | $5 / 1k calls |
| File Attachments | attachment_search | $10 / 1k calls |
| Collections Search | collections_search, file_search | $2.50 / 1k calls |
| Image Understanding | view_image | Basato su token |
| X Video Understanding | view_x_video | Basato su token |
| Remote MCP Tools | Tool name set by each MCP server | Nessuna commissione di invocazione; uso token fatturato |
Questa è la parte più importante per i team che costruiscono app basate sulla ricerca o agentiche. Una risposta semplice può essere economica. Una risposta ricca di strumenti può includere token di input, token di ragionamento, token di output, chiamate di ricerca, chiamate di esecuzione codice, chiamate di ricerca file e token di prompt in cache.
Usa questa lente di pianificazione pratica:
Costo del workflow = costi della richiesta + costi di retry della richiesta + costi di storage e download + commissioni applicabili per violazione delle linee guida d’uso
Per ogni richiesta, il pricing dei token, le chiamate a strumenti lato server, la cache del prompt e qualsiasi premium di priorità applicato sono già riflessi in cost_in_usd_ticks.
Se un workflow usa Web Search e X Search a ogni turno, la riga delle chiamate agli strumenti può contare quanto la riga del modello.
I documenti di pricing di xAI elencano anche una commissione per violazione delle linee guida d’uso: se una richiesta è ritenuta in violazione delle linee guida, la richiesta può essere comunque addebitata; per le violazioni intercettate prima della generazione nella Responses API, xAI elenca una commissione di $0.05 per richiesta. Per app rivolte al pubblico, questo dovrebbe far parte del piano su costi e sicurezza, non un ripensamento.
Non dimenticare i costi di storage e download
Le chiamate agli strumenti non sono l’unico costo non legato ai token. xAI attualmente elenca l’archiviazione file a $0.025 per GiB al giorno, l’archiviazione delle collection a $0.10 per GiB al giorno e i download a $0.20 per GiB trasferito.
Questi costi difficilmente domineranno una semplice app di chat, ma possono contare per sistemi RAG pesanti di documenti, workflow persistenti su file e applicazioni che mantengono grandi collection nel tempo.
Esempio: quanto costa una richiesta Grok basata sulla ricerca?
Ecco un esempio illustrativo semplice usando i prezzi di Grok 4.3 e due chiamate Web Search:
| Componente di costo | Assunzione | Calcolo | Costo |
|---|---|---|---|
| Token di input | 2,000 token non in cache | 2,000 / 1M x $1.25 | $0.0025 |
| Token di output | 1,000 token di output | 1,000 / 1M x $2.50 | $0.0025 |
| Chiamate Web Search riuscite | 2 chiamate | 2 / 1,000 x $5.00 | $0.0100 |
| Costo totale della richiesta | token + strumenti | $0.0050 + $0.0100 | $0.0150 |
In questo esempio, l’uso dei token costa solo $0.005, mentre due chiamate Web Search costano $0.01. Significa che gli strumenti rappresentano circa il 67% del costo della richiesta ancora prima di retry, elaborazione prioritaria, ricerca file, storage o commissioni per violazione delle linee guida d’uso. I numeri esatti cambieranno in base al carico, ma la lezione è stabile: per agenti basati sulla ricerca, conta prima le chiamate agli strumenti.
Batch, priorità e cache: tre leve di costo
1. L’input in cache è la prima leva
L’attuale tabella prezzi elenca l’input in cache a $0.50 / 1M token per Grok 4.5 e $0.20 / 1M token per Grok 4.3, Grok Build e le varianti Grok 4.20 elencate. Questo conta per lunghi system prompt, contesto di retrieval ripetuto, istruzioni condivise e harness di valutazione.
Usa l’input in cache quando:
- lo stesso system prompt si ripete su molte chiamate
- l’app invia una policy lunga, uno schema di strumenti o un catalogo prodotti
- il workflow valuta molti task simili
- il pattern di richieste è abbastanza stabile da riutilizzare blocchi di prompt
2. La Batch API è per i volumi offline
I documenti di xAI dicono che la Batch API elabora grandi volumi in modo asincrono, di solito entro 24 ore, e i modelli testuali Grok 4.3 / Grok 4.20 elencati ricevono uno sconto batch del 20%. I documenti notano anche che la generazione di immagini e video può usare la Batch API ma viene fatturata a tariffe standard.
Usa batch per:
- classificazione offline
- arricchimento notturno
- generazione di dati sintetici
- riassunti in bulk
- grandi run di valutazione
Non usare batch per flussi di prodotto a bassa latenza.
3. L’elaborazione prioritaria è un trade-off di latenza
Le note di rilascio hanno introdotto l’elaborazione prioritaria a giugno 2026, e la pagina prezzi dice che le richieste testuali prioritarie vengono fatturate con un premio 2x quando la risposta conferma service_tier: "priority".
Usa la priorità solo quando la latenza vale il premium:
- chat lato utente durante i picchi di traffico
- escalation del supporto clienti
- esperienze dei piani a pagamento
- orchestrazione di agenti sensibile al tempo
Non attivare la priorità globalmente a meno che dati su latenza e margine non la giustifichino.
Come tracciare il costo reale della Grok API
La documentazione di tracciamento dei costi di xAI dice che ogni risposta di inferenza include cost_in_usd_ticks nell’oggetto usage su chat completions, Responses API, generazione di immagini e generazione di video. Afferma anche che le richieste ricche di strumenti includono i costi dei token e delle invocazioni degli strumenti lato server in quel valore restituito.
Questo rende Grok insolito in modo utile: puoi misurare il costo reale della richiesta senza ricostruire tu stesso l’intera formula di fatturazione.
Traccia questi campi:
input_tokensoutput_tokens- token di ragionamento, dove disponibili
- token di prompt in cache
- numero di chiamate a strumenti lato server
service_tiercost_in_usd_ticks- retry
- esito finale (successo o fallimento)
Per l’analitica dell’app, converti i tick in dollari:
cost_usd = cost_in_usd_ticks / 10,000,000,000
Quindi riporta:
cost per successful task = total Grok request cost / successful tasks

Fonte: xAI cost tracking documentation
Quale modello Grok dovresti usare?
La guida ai modelli di xAI ora indica Grok 4.5 come modello di punta per codice e tutto il resto, mentre Grok 4.3 resta utile come percorso a lungo contesto e costo inferiore. Tratta la tabella sotto come punto di partenza, poi verifica con i tuoi dati sul costo per task riuscito.
| Carico di lavoro | Parti da | Perché |
|---|---|---|
| Chat ad alta criticità, codice, tool use o ragionamento | grok-4.5 | Percorso di punta più recente, ragionamento configurabile, obiettivo di capacità più ampio |
| Chat a lungo contesto o sensibile ai costi | grok-4.3 | 1M di contesto e prezzo token più basso rispetto a Grok 4.5 |
| Test di costo dedicati al coding | grok-build-0.1 | Prezzo token di input/output inferiore; ancora da testare contro Grok 4.5 |
| Generazione o editing di immagini | grok-imagine-image o grok-imagine-image-quality | Prezzi per immagine, non per token |
| Generazione o editing di video | grok-imagine-video o grok-imagine-video-1.5 | Prezzi per secondo di output |
| Voice agent | Voice API realtime | Prezzo al minuto |
| Risposta basata sulla ricerca | grok-4.5 o grok-4.3 con strumenti | Includi le commissioni Web/X Search nel modello di costo |
Cosa i builder dovrebbero ritestare
Non scegliere Grok solo dalla riga token base. Ritesta:
- Se Grok 4.5 riduce i retry abbastanza da giustificare il prezzo token più alto rispetto a Grok 4.3.
- Se Grok Build è più economico per i task di coding rispetto a usare Grok 4.5.
- Se Web Search e X Search servono a ogni turno o solo in caso di incertezza.
- Se l’input in cache riduce abbastanza il costo da giustificare l’ingegneria della prompt cache.
- Se l’elaborazione prioritaria migliora la p95 di latenza abbastanza da valere il 2x.
- Se i costi video di Imagine hanno senso per asset generato, non per richiesta.
- Se le commissioni per violazione delle linee guida d’uso influenzano i margini dei chatbot pubblici.
Una valutazione pratica dei costi Grok API
Usa un set di valutazione da 30 task:
- 10 task di chat generale o ragionamento
- 5 task di coding
- 5 task basati sulla ricerca
- 5 task di generazione immagine o video
- 5 task di supporto o classificazione
Esegui ogni carico con:
- Grok 4.5
- Grok 4.3
- Grok Build per i task di coding
- il tuo modello predefinito attuale
- un modello di fallback più economico
- un modello di fallback più potente
Misura:
- pass/fail
- costo totale della richiesta
- invocazioni di strumenti
- retry
- latenza p50/p95
- risparmi da input in cache
- uso della priorità
- modifiche umane necessarie
Cosa osservare in seguito
Osserva nelle prossime settimane:
- Se xAI cambia gli alias dei modelli Grok 4.5, Grok 4.3 o Grok Build.
- Se l’elaborazione prioritaria diventa un’aspettativa predefinita per app a bassa latenza.
- Se le app Grok ricche di strumenti riportano costi prevedibili con
cost_in_usd_ticks. - Se la qualità video di Grok Imagine migliora abbastanza da giustificare il prezzo al secondo.
- Se benchmark indipendenti confermano le affermazioni prezzo/prestazioni di Grok 4.5 su carichi reali.
FAQ
Quanto costa la Grok API?
Grok 4.5 costa $2.00 per 1M token di input, $0.50 per 1M token di input in cache e $6.00 per 1M token di output. Grok 4.3 costa $1.25 input, $0.20 input in cache e $2.50 output per 1M token. Grok Build 0.1 costa $1.00 input, $0.20 input in cache e $2.00 output per 1M token.
Il pricing della Grok API è solo a token?
No. Le richieste testuali sono a token, ma gli strumenti lato server aggiungono commissioni di invocazione, Imagine usa prezzi per immagine o al secondo per il video, Voice usa prezzi al minuto o per carattere, l’elaborazione prioritaria può aggiungere un premium 2x e alcune violazioni delle linee guida d’uso possono generare commissioni per richiesta.
Qual è il modello Grok più economico per il codice?
Per il codice, xAI ora posiziona Grok 4.5 come modello di punta, ma grok-build-0.1 è ancora il percorso specifico per il coding più economico da testare. Usa Grok 4.5 quando qualità o affidabilità nell’uso degli strumenti contano più della riga dei token; usa Grok Build quando il costo è il primo vincolo.
Grok addebita per Web Search o X Search?
Sì. Web Search e X Search sono elencati a $5 per 1,000 chiamate, oltre a qualsiasi uso di token del modello.
La Grok API mostra il costo effettivo di ogni richiesta?
Sì. I documenti di tracciamento dei costi di xAI dicono che le risposte API includono cost_in_usd_ticks, che può essere convertito in dollari dividendo per 10,000,000,000.
Dovrei usare l’elaborazione prioritaria?
Solo quando la latenza vale il costo extra. L’elaborazione prioritaria viene fatturata al 2x del pricing token standard quando la priorità è effettivamente applicata.
Testare i costi della Grok API con CometAPI
Puoi usare CometAPI per testare carichi in stile Grok accanto a GPT, Claude, Gemini, DeepSeek e altri modelli in un unico workflow di valutazione. I team che confrontano i percorsi possono consultare la pagina prezzi di CometAPI prima di eseguire la propria valutazione. Per i pattern di setup tra agenti di coding, strumenti di automazione e framework di valutazione, il CometAPI Cookbook è un punto di partenza pratico. Inizia con un benchmark piccolo, registra il costo per attività riuscita e scegli il percorso modello che vince sul tuo carico.
