DeepSeek V4 Pro 0813 is now live on CometAPI →

Grok 4.6 è qui: risultati dei benchmark a livello GPT-5.6 e prestazioni di programmazione

CometAPI
AnnaAug 13, 2026
Grok 4.6 è qui: risultati dei benchmark a livello GPT-5.6 e prestazioni di programmazione

TL; DR xAI ha rilasciato ufficialmente Grok 4.6 il 12 agosto 2026 e lo ha reso disponibile tramite xAI API, Cursor e Grok Build. Dispone di una finestra di contesto da 500.000 token, accetta testo e immagini, offre quattro livelli di sforzo di ragionamento e ha un knowledge cutoff al 1 febbraio 2026. Secondo l’annuncio ufficiale di xAI su Grok 4.6, eguaglia GPT-5.6 Sol sull’Artificial Analysis Intelligence Index, un composito di nove valutazioni.

Il pricing API parte da $2 per milione di token in input, $0,50 per milione di token in input in cache e $6 per milione di token in output per prompt inferiori a 200.000 token. Una volta che un prompt raggiunge 200.000 token, l’intera richiesta viene fatturata alle tariffe long-context di $4 input, $1 input in cache e $12 output per milione di token. Per gli sviluppatori che cercano un accesso flessibile multi-modello, piattaforme come CometAPI semplificano l’integrazione di Grok 4.6 accanto ad altri modelli di frontiera,Il prezzo dell’API è pari all’80% del prezzo di xAI.

Punti chiave

  • xAI ha rilasciato ufficialmente Grok 4.6 il 12 agosto 2026; i precedenti report sulla finestra di rilascio sono ora obsoleti.
  • L’ID del modello API è , e il modello è disponibile anche in Cursor e Grok Build.grok-4.6
  • La sua finestra di contesto è di 500K token, con input di testo e immagini e output solo testuale.
  • Il pricing standard sotto i 200K token di prompt è $2/M input, $0,50/M input in cache e $6/M output.
  • Un prompt da 200K token o più attiva tariffe più alte per tutti i token di quella richiesta, non solo per quelli sopra la soglia.
  • Lo sforzo di ragionamento può essere impostato su low, medium, high o xhigh; è il valore predefinito documentato.
  • Grok 4.6 eguaglia GPT-5.6 Sol sull’Artificial Analysis Intelligence Index (punteggio 61) e mostra forti incrementi rispetto a Grok 4.5 in coding agentico, knowledge work e task a lungo raggio.
  • Grok Imagine Image 2.0 è un’API separata per la generazione di immagini. Grok 4.6 può comprendere immagini ma non restituisce immagini generate.

Specifiche e prezzo di Grok 4.6 a colpo d’occhio

Le seguenti specifiche sono confermate nella documentazione dei modelli di xAI e nelle note di rilascio del 12 agosto.

SpecificationGrok 4.6
Official release dateAugust 12, 2026
API model IDgrok-4.6
PositioningFlagship model for coding, agents and general workloads
Context window500,000 tokens
InputsText and images
OutputText
Documented text-output limitNo text-output limit stated by xAI
Reasoning controlsLow, medium, high and xhigh
Default reasoning effortHigh
Knowledge cutoffFebruary 1, 2026
Native API accessAvailable
Coding-tool accessCursor and Grok Build
Current-events accessRequires Web Search or X Search tools

Prezzi ufficiali API xAI

La tabella prezzi attuale di xAI separa richieste short-context e long-context.

Prompt sizeInput per 1M tokensCached input per 1M tokensOutput per 1M tokens
Below 200,000 tokens$2.00$0.50$6.00
200,000 tokens or more$4.00$1.00$12.00

La soglia è particolarmente importante per gli agenti su codebase. Quando il prompt della richiesta raggiunge 200.000 token, xAI applica la tariffa long-context per tutti i token di quella richiesta, non solo per la parte che supera la soglia. Una richiesta contenente 199.000 token di prompt può quindi costare sensibilmente meno di una contenente 200.000, anche se le dimensioni sono quasi identiche.

Nella documentazione prezzi attuale di xAI non è indicato alcuno sconto batch per Grok 4.6. I team non dovrebbero presumere che i job offline ricevano gli sconti disponibili per alcuni altri modelli xAI.

Che cos’è Grok 4.6?

Grok 4.6 è l’ultimo modello linguistico di punta di SpaceXAI, rilasciato il 12 agosto 2026. Si basa direttamente su Grok 4.5 applicando un periodo addizionale di addestramento focalizzato su dati curati generati dal modello per ragionamento avanzato e concetti tecnici, dataset ingegneristici di alta qualità, un ottimizzatore migliorato ed un RL ampliato per scenari di coding e knowledge work.

Il modello mantiene la stessa base da 1.5 trilioni di parametri del suo predecessore; i guadagni derivano principalmente dal post-training piuttosto che da un aumento della scala dei parametri. È progettato specificamente per rimanere efficace su molti passaggi—sia che si tratti di ricercare un argomento, analizzare grandi quantità di informazioni, navigare e modificare una codebase sconosciuta, o trasformare un’idea di alto livello in un’applicazione o in un artefatto di lavoro rifinito. SpaceXAI enfatizza un miglior comportamento di auto-verifica su progetti a lungo raggio e prestazioni più robuste su lavori interattivi e visivi.

La differenza rispetto a un chatbot tradizionale è importante.

Un flusso di lavoro LLM convenzionale è:

Prompt → Genera risposta

Grok 4.6 è progettato per flussi di lavoro più vicini a:

Obiettivo → Pianifica → Ricerca → Usa strumenti → Modifica il codice → Testa → Valuta → Continua

L’attuale posizionamento di xAI enfatizza la capacità del modello di restare su progetti complessi più a lungo, lavorare su codebase, ricercare argomenti sconosciuti, costruire applicazioni e verificare il proprio lavoro.

Questo rende Grok 4.6 particolarmente rilevante per il mercato in rapida espansione degli agent di coding e agent autonomi.

Quali sono le principali funzionalità di Grok 4.6?

Capacità per agent a lunga esecuzione

Il miglioramento più importante di Grok 4.6 è il focus sui task a lunga esecuzione.

Invece di ottimizzare solo per risposte one-shot, il modello è progettato per mantenere i progressi attraverso molteplici fasi di un progetto.

Esempi tipici includono:

  • Costruire un’applicazione
  • Eseguire il debug di un grande repository
  • Ricercare un argomento sconosciuto
  • Modificare diversi componenti
  • Eseguire test
  • Indagare sui failure
  • Rivedere l’implementazione
  • Controllare il risultato finale

Questo è un obiettivo fondamentalmente diverso dai benchmark tradizionali di instruction-following.

Prestazioni avanzate nel coding

Il coding è una delle aree di miglioramento più evidenti di Grok 4.6.

I report di benchmark attuali indicano:

  • 65,9% su DeepSWE 1.1
  • 69,9% su CursorBench 3.2
  • 61,3% su FrontierCode 1.1 Extended

Queste valutazioni sono particolarmente rilevanti perché misurano il comportamento di agent di coding piuttosto che il semplice completamento di codice.

Il miglioramento da Grok 4.5 a Grok 4.6 su DeepSWE 1.1 è particolarmente notevole, salendo da circa 54% a 65,9% nel confronto riportato.

Input multimodale

Grok 4.6 supporta input di testo e immagini, consentendo agli sviluppatori di combinare informazioni visive con ragionamento.

Applicazioni possibili includono:

  • Debug di screenshot
  • Analisi UI
  • Interpretazione di grafici
  • Comprensione di documenti
  • Ricerca visiva
  • Task di coding basati su immagini

Questo rende Grok 4.6 più flessibile di un modello di coding puramente testuale.

L’accesso alla ricerca è una parte significativa dell’ecosistema di Grok.

L’API supporta:

  • Web search
  • X search
  • Function calling
  • Esecuzione di codice

La documentazione API attuale di Grok 4.5 conferma queste capacità di strumenti nell’ambiente Grok API.

Per gli agent di ricerca, ciò significa che il modello può potenzialmente passare dalla conoscenza pre-addestrata statica a recupero di informazioni aggiornate più ragionamento.

Ragionamento configurabile

L’API di Grok espone uno sforzo di ragionamento configurabile.

Questo consente agli sviluppatori di bilanciare:

velocità / costo ↔ profondità di ragionamento

Per task semplici, un livello inferiore può ridurre computazione non necessaria.

Per task complessi di coding o ricerca, un livello superiore può fornire una soluzione più deliberata.

Prestazioni di frontiera a costi competitivi

Il pricing di Grok 4.6 è probabilmente uno dei suoi più forti vantaggi commerciali.

Il prezzo API standard riportato è:

  • $2 / 1M token in input
  • $6 / 1M token in output

È lo stesso pricing riportato per Grok 4.5, nonostante i significativi miglioramenti di capacità.

Questo crea una proposta costo/prestazioni insolitamente aggressiva per un modello di frontiera.


Come si comporta Grok 4.6 nei benchmark?

I dati di benchmark più utili attualmente si concentrano su intelligenza agentica e coding.

BenchmarkGrok 4.6Cosa misura
Artificial Analysis Intelligence Index61Intelligenza dei modelli di frontiera (composito)
CursorBench 3.269,9%Prestazioni degli agent di coding
DeepSWE 1.165,9%Agent di ingegneria del software
FrontierCode 1.1 Extended61,3%Coding avanzato
GDPVal-AA v21.753 EloPrestazioni nei compiti di knowledge work

Il punteggio 61 sull’Artificial Analysis Intelligence Index colloca secondo i report Grok 4.6 allo stesso livello di GPT-5.6 Sol su quell’indice.

Il punteggio 1.753 Elo su GDPVal-AA v2 è significativo perché GDPVal valuta compiti professionali di knowledge work piuttosto che il semplice question answering accademico.

La considerazione principale sui benchmark

L’evidenza più forte per Grok 4.6 non è un singolo punteggio in stile MMLU.

Il suo profilo di benchmark punta verso:

coding + agent + knowledge work + esecuzione a lungo raggio

È esattamente lì che si sta muovendo lo sviluppo moderno dell’AI.

Per un sito come CometAPI, questa è una distinzione importante da preservare: Grok 4.6 dovrebbe essere promosso principalmente come modello di frontiera agentico, non come l’ennesimo chatbot generico.

Come si confronta Grok 4.6 con il suo predecessore e i concorrenti?

Grok 4.6 vs Grok 4.5

FeatureGrok 4.5Grok 4.6
Primary focusGeneral reasoning + agentsLong-running agents + coding
Context500K-class deployment500K
InputText + imageText + image
Web searchYesYes
X searchYesYes
Code executionYesYes
Function callingYesYes
Input price$2/M$2/M
Output price$6/M$6/M
DeepSWE 1.1~54%65,9%
Intelligence Index~5661

Il punto importante è che Grok 4.6 non sembra essere una semplice sostituzione di fascia di prezzo per Grok 4.5. È un upgrade di capacità mirato più pesantemente ai flussi di lavoro agent a lungo raggio.

La documentazione attuale di Grok 4.5 elenca il modello a $2/$6 per milione di token, con ragionamento configurabile e supporto agli strumenti.

Tabella di confronto: Grok 4.6 vs concorrenti chiave

AspectGrok 4.6GPT-5.6 SolClaude Fable 5 / Opus 5Notes
AA Intelligence Index616162 / 63Composite score
Input / Output $/1M$2 / $6~$5 / $30~$5 / $25Grok far cheaper on output
Context Window500KUp to 1M+Often 1M
StrengthsAgents, coding efficiency, costBroad reasoning, codingLong-horizon, safety
Cursor IntegrationNative, strongAvailableAvailableGrok optimized for Cursor
Turn EfficiencyHigh (fewer steps)CompetitiveHigher step counts reportedImportant for agents
AvailabilityAPI + Cursor + partnersOfficial + partnersOfficial + partnersCometAPI unifies access

Dati tratti dall’annuncio di SpaceXAI, Artificial Analysis e model card pubbliche al 13 agosto 2026.

Il confronto attuale di Artificial Analysis è particolarmente interessante.

Secondo i report, Grok 4.6 ottiene 61 sull’Intelligence Index, in linea con GPT-5.6 Sol. Ma l’economia è molto diversa.

Il pricing esatto delle varianti GPT concorrenti va verificato rispetto ai listini attuali dei provider prima della pubblicazione, ma l’osservazione chiave di mercato è chiara: Grok 4.6 compete a livello di frontiera sui benchmark mantenendo un prezzo per token relativamente aggressivo.

Ciò rende Grok 4.6 particolarmente attraente per applicazioni in cui l’esecuzione ad alto volume di agent renderebbe altrimenti costosi i modelli di frontiera premium.

Quali sono le limitazioni di Grok 4.6?

Il contesto da 500K è più piccolo di alcuni concorrenti con 1M

Il contesto da 500K di Grok 4.6 è ampio, ma non è la finestra di contesto più grande disponibile nel mercato dei modelli di frontiera.

Per repository molto grandi o raccolte documentali enormi, un modello con contesto da 1M può avere un vantaggio.

Modello proprietario

A differenza di MiMo-V2.5-Pro, Grok 4.6 non è un modello a pesi aperti.

Gli sviluppatori non possono scaricare il modello e distribuirlo in modo indipendente.

I confronti di benchmark richiedono cautela

Benchmark di coding differenti utilizzano harness, prompt, strumenti e procedure di valutazione diversi.

Ad esempio, SWE-Bench Pro è progettato specificamente attorno a problemi realistici di ingegneria del software a lungo raggio, e i risultati possono variare sostanzialmente a seconda dell’impalcatura dell’agent.

Pertanto, il 69,9% su CursorBench non va interpretato come “Grok 4.6 è migliore del 69,9% rispetto a un altro modello.”

L’interpretazione corretta è che ha raggiunto quel punteggio sotto il particolare setup di valutazione del benchmark.

Il costo di un agent può essere superiore a quanto suggerito dal prezzo per token

Il prezzo $2/$6 è attraente, ma un agent autonomo può consumare numeri enormi di token tramite:

  • Chiamate a strumenti
  • Ricerche ripetute
  • Esecuzione di codice
  • Tentativi falliti
  • Contesti lunghi
  • Auto-verifica

La reale unit economics dipende quindi dal costo per task completato con successo, non semplicemente dal costo per milione di token.

Prezzo e accesso

Prezzi ufficiali (tier standard, sotto ~200K token di prompt):

  • Input: $2,00 per 1M token
  • Cached input: circa $0,50 per 1M token
  • Output: $6,00 per 1M token

Una variante più veloce è prezzata al doppio di queste tariffe. Le tariffe possono raddoppiare per contesti molto lunghi (≥200K). Si raccomanda fortemente la cache dei prompt per i loop degli agent per mantenere bassi i costi.

Disponibilità:

  • Cursor e Grok Build (2× uso incluso per la prima settimana)
  • SpaceXAI API (grok-4.6)
  • Partner: OpenRouter, Vercel, Cloudflare e altri
  • SuperGrok chat/app (tramite selettore del modello)

Raccomandazione CometAPI: Per gli sviluppatori che già usano (o intendono usare) più modelli di frontiera, CometAPI offre accesso fluido a Grok 4.6 tramite un endpoint compatibile con OpenAI (https://api.cometapi.com/v1). Ottieni billing unificato, analytics d’uso, tariffe effettive competitive su oltre 500 modelli (inclusi GPT, Claude, Gemini, DeepSeek e varianti Grok) e la possibilità di cambiare modello con una riga. Questo è particolarmente utile quando si fa A/B test di Grok 4.6 rispetto ad altri modelli di coding o agent, o quando si costruiscono sistemi di produzione che beneficiano di routing e fallback dei modelli. Iscriviti su cometapi.com per ottenere una API key gratuita ed esplorare il catalogo live.

Dovresti passare a Grok 4.6?

Sì, se:

  • Lavori intensamente in Cursor o costruisci agent di coding/knowledge a lunga esecuzione e vuoi forte affidabilità multi-step a costo competitivo.
  • L’economia dei token conta—Grok 4.6 offre intelligenza quasi alla pari con GPT-5.6 Sol a circa un quinto del prezzo per token di output delle opzioni di frontiera più costose.
  • Valorizzi l’efficienza per turno (meno passaggi e token per completare task complessi).
  • Vuoi accesso immediato a un modello addestrato esplicitamente per i flussi di lavoro interattivi, visivi e agentici comuni nello sviluppo moderno.

Valuta di restare con o mescolare altri modelli se:

  • Il tuo carico principale è programmazione competitiva pura o punti di forza specifici di modelli chiusi (ad es., alcuni scenari a lungo contesto o di safety tuning di Claude).
  • Richiedi i punteggi assolutamente più alti su ogni singolo benchmark di ingegneria del software indipendentemente dal costo.
  • Hai bisogno di finestre di contesto più grandi di 500K per workload a chiamata singola (alcuni concorrenti offrono 1M+).

La maggior parte dei team trarrà beneficio dal valutare Grok 4.6 fianco a fianco con il proprio stack attuale. Poiché è disponibile tramite aggregatori come CometAPI, il costo di switching è basso—basta cambiare il nome del modello e misurare tassi di completamento dei task, latenza e costi reali sui tuoi workload.

Conclusione

Grok 4.6 rappresenta un passo avanti significativo per SpaceXAI: intelligenza a livello di frontiera su benchmark compositi e agentici, miglioramenti tangibili nelle prestazioni di coding e knowledge work a lunga esecuzione, e pricing aggressivo che sottocosta molti concorrenti closed-source. La sua disponibilità nativa in Cursor, combinata con una forte affidabilità multi-step, lo rende particolarmente attraente per sviluppatori che costruiscono agent software reali e applicazioni interattive.

Che tu vi acceda direttamente, tramite Cursor/Grok Build o attraverso un gateway unificato come CometAPI, Grok 4.6 è pronto per la valutazione in produzione oggi. Visita l’annuncio ufficiale su x.ai/news/grok-4-6 per i dettagli completi e la model card, esplora il catalogo live su cometapi.com per confrontarlo fianco a fianco con altri modelli leader e inizia subito a costruire con le nuove capacità.

Fonti principali

Verifica sempre prezzi, limiti di rate e numeri di benchmark più recenti sulle pagine ufficiali, dato che il panorama dell’AI evolve rapidamente.

0 visualizzazioni
Revisionato per chiarezza, attribuzione delle fonti e terminologia API aggiornata.

Pronto a ridurre i costi di sviluppo AI del 20%?

Inizia gratuitamente in pochi minuti. Crediti di prova gratuiti inclusi. Nessuna carta di credito richiesta.

Leggi di più