GPT-6 Sol, GPT-6 Luna, and Claude Opus 5.5 are now live on CometAPI →
technology/Ricerca CometAPI

Grok 4.7: Benchmark, prezzi, funzionalità e accesso alle API

Scopri che cos'è Grok 4.7, tra cui la finestra di contesto da 500K, i benchmark, i prezzi, le modalità di ragionamento, le capacità degli agenti, il confronto con Grok 4.6 e l'accesso.

CometAPI
Deon GoodwinTeam di ricerca su modelli AI e API
Aggiornato Sep 22, 2026 13 min di lettura
Grok 4.7: Benchmark, prezzi, funzionalità e accesso alle API
Usa questo schema

Esegui la prima chiamata API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Grok 4.7 è il modello di frontiera di SpaceXAI per il coding, i workflow agentici e il lavoro professionale basato sulla conoscenza, rilasciato il 21 settembre 2026. Combina una finestra di contesto da 500.000 token, input di testo e immagini, ragionamento configurabile, chiamate di funzione, ricerca sul web e su X, ed esecuzione di codice.

Per prompt inferiori a 200.000 token, l’API ufficiale di xAI indica $2 per milione di token di input, $0.50 per milione di token di input in cache e $6 per milione di token di output. CometAPI attualmente indica Grok 4.7 a $1.60 per l’input, $0.40 per l’input in cache e $4.80 per l’output per milione di token nello stesso livello—una riduzione del 20% rispetto alle tariffe ufficiali mostrate sulla sua pagina del modello.

La proposta di valore concreta non è il primato universale sui benchmark. Grok 4.7 è più interessante quando un carico di lavoro combina attività di ingegneria, lunghi cicli agentici, uso di strumenti, contesti di lavoro ampi e sensibilità al costo dei token di output. I team dovrebbero convalidarlo sui propri repository e workflow prima dell’instradamento in produzione.

Punti chiave

  • Grok 4.7 utilizza un modello base più grande rispetto a Grok 4.6, un reinforcement learning più lungo su compiti più duri della durata di molte ore e una verifica interna più robusta.
  • L’API supporta una finestra di contesto da 500.000 token, input di testo e immagini, output testuale, quattro livelli di ragionamento, output strutturato, function calling, ricerca sul web e su X, ed esecuzione di codice.
  • SpaceXAI riporta 46.3% su CursorBench 4.0, 71.0% su DeepSWE v1.1 e 38.0% su Terminal-Bench 4.0. Si tratta di risultati pubblicati dal fornitore, non di prova di leadership universale.
  • CometAPI indica Grok 4.7 come disponibile, con un endpoint compatibile con OpenAI e prezzi inferiori del 20% rispetto alle tariffe xAI ufficiali mostrate nel suo catalogo attuale.
  • Scegli Grok 4.7 per agenti di ingegneria sensibili al prezzo e uso prolungato di strumenti; scegli alternative quando contesti molto lunghi o un dominio critico per i benchmark contano più del prezzo unitario.

Che cos’è Grok 4.7?

Grok 4.7 è l’ultimo modello LLM di frontiera di SpaceXAI, posizionato per coding, compiti di agenti autonomi e lavoro professionale basato sulla conoscenza. Il rilascio si focalizza su attività che richiedono interazione sostenuta, uso di strumenti, verifica e revisione, più che semplici risposte one-shot.

SpaceXAI afferma che Grok 4.7 è stato addestrato con un run di reinforcement learning più lungo su un mix di compiti più difficili, ponderato verso problemi che possono richiedere molte ore per essere completati. Questa direzione di training è particolarmente rilevante per ingegneria software a livello di repository, debugging, ricerca, creazione di documenti, analisi ingegneristiche e automazioni multi-step.

In che modo Grok 4.7 è diverso da—e migliore di—Grok 4.6?

Un modello base più grande

Grok 4.7 passa a un modello base più grande rispetto a Grok 4.6. SpaceXAI non ha divulgato un conteggio dei parametri pubblico e definitivo, quindi la conclusione difendibile è un aumento della capacità del modello base—non una stima specifica dei parametri.

Reinforcement learning più lungo su compiti più difficili

La fase di reinforcement learning è stata estesa e orientata verso problemi più difficili e di orizzonte più lungo. SpaceXAI enfatizza compiti che possono richiedere ore di lavoro, allineando il modello a coding autonomo, ricerca e workflow agentici professionali.

Auto-verifica più robusta

Grok 4.7 è addestrato a ispezionare il proprio lavoro con maggiore attenzione. Questo è importante nell’ingegneria del software perché un agente affidabile deve ispezionare, modificare, testare, diagnosticare i fallimenti, revisionare e validare ripetutamente—non solo generare una prima risposta.

Miglioramenti misurati rispetto a Grok 4.6

DimensioneGrok 4.6Grok 4.7Variazione
CursorBench 4.040.4%46.3%+5.9 pts
DeepSWE v1.165.2%71.0%+5.8 pts
EEBench53.0%64.0%+11.0 pts
AA Briefcase v1.11,5461,657+111
Terminal-Bench 4.020.3%38.0%+17.7 pts
Harvey Legal Agent Benchmark15.8%19.6%+3.8 pts
HealthBench Professional48.5%56.7%+8.2 pts

Nel set pubblicato al lancio, Grok 4.7 migliora rispetto a Grok 4.6 in ogni risultato elencato. Il guadagno assoluto più grande è su Terminal-Bench 4.0, coerente con l’enfasi del rilascio su workflow a riga di comando di lunga durata e uso di strumenti. Questi numeri restano pubblicati dal fornitore e andrebbero testati su compiti reali prima di una decisione di migrazione.

Quanto è valido Grok 4.7 nei benchmark?

La valutazione di lancio di SpaceXAI copre ingegneria del software, lavoro su terminale, compiti da ufficio professionali, lavoro legale, ragionamento clinico e ingegneria elettrica. Si tratta di risultati pubblicati dal fornitore e dovrebbero essere convalidati rispetto ai workload di produzione prima di decisioni di procurement o instradamento.

BenchmarkGrok 4.7 xHighGrok 4.6 HighGPT-5.6 Sol MaxFable 5.1 Max
CursorBench 4.046.3%40.4%41.7%51.8%
DeepSWE v1.171.0%*65.2%72.7%70.0%
EEBench64.0%53.0%39.4%56.4%
AA Briefcase v1.11,6571,5461,4871,678
Terminal-Bench 4.038.0%20.3%37.3%57.9%
Harvey Legal Agent Benchmark19.6%15.8%2.5%6.7%
HealthBench Professional56.7%48.5%60.5%62.1%

Nei risultati di lancio di Grok 4.7, SpaceXAI indica il 71.0% su DeepSWE v1.1 come sforzo di ragionamento elevato.

L’annuncio di lancio non divulga ogni harness per benchmark, configurazione degli strumenti, conteggio dei run o ambiente di valutazione. Trattate questi valori come risultati pubblicati dal fornitore e convalidate il modello sui vostri repository, strumenti, obiettivi di latenza e criteri di failure prima di instradare il lavoro di produzione.

Cosa mostra il profilo dei benchmark di Grok 4.7?

Ingegneria del software

CursorBench 4.0 sale da 40.4% su Grok 4.6 a 46.3% su Grok 4.7, mentre DeepSWE v1.1 sale da 65.2% a 71.0%. Ciò supporta il posizionamento di Grok 4.7 come modello per agenti di coding più che solo assistenza conversazionale al coding.

Lavori da terminale di lunga durata

Terminal-Bench 4.0 mostra uno dei cambiamenti generazionali più ampi: 20.3% per Grok 4.6 contro 38.0% per Grok 4.7. Il guadagno assoluto di 17.7 punti è coerente con l’enfasi di SpaceXAI su reinforcement learning a orizzonte lungo e auto-verifica.

Ingegneria elettrica

Su EEBench, Grok 4.7 raggiunge 64.0%, rispetto al 53.0% di Grok 4.6. Tra i confronti pubblicati, questo è uno dei risultati relativi più forti di Grok 4.7.

Lavoro professionale basato sulla conoscenza

AA Briefcase v1.1 sale da 1,546 a 1,657. Questi compiti sono progettati per riflettere lavoro professionale di più ore che coinvolge artefatti come documenti, presentazioni, analisi e altri deliverable strutturati.

Grok 4.7 vs GPT-5.6 Sol vs Fable 5.1: come si confrontano?

Verifiche dei prezzi nativi del provider: OpenAI indica GPT-5.6 Sol a $4 per milione di token di input e $20 per milione di token di output, mentre Anthropic indica Claude Fable 5.1 a $10 per milione di token di input e $50 per milione di token di output.

DimensioneGrok 4.7GPT-5.6 SolClaude Fable 5.1
Posizionamento principaleCoding, compiti agentici, lavoro basato sulla conoscenzaRagionamento professionale complesso e codingAgenti di lunga durata, coding e lavoro basato sulla conoscenza
Finestra di contesto500,000 token1,050,000 token1,000,000 token
ModalitàInput di testo e immagini; output testualeInput di testo e immagini; output testualeInput di testo e immagini; output testuale
Controllo del ragionamentoLow, medium, high, xhighNone through maxAdaptive thinking con sforzo configurabile
Stato API del providerDisponibile sulla xAI API pubblicaDisponibile tramite OpenAI Chat Completions and ResponsesDisponibile tramite la Claude API e marketplace cloud supportati
Prezzo input / 1M token$2$4$10
Prezzo output / 1M token$6$20$50
CursorBench 4.046.3%41.7%51.8%
DeepSWE v1.171.0%72.7%70.0%
Casi d’uso idealiAgenti di ingegneria sensibili al prezzo e uso prolungato di strumentiAmpio ragionamento professionale con contesto molto lungoMassime prestazioni per agenti di lunga durata e workflow di conoscenza

Quale modello dovresti scegliere?

  • Scegli Grok 4.7 quando priorità sono workload di ingegneria, uso prolungato di strumenti, ragionamento configurabile e costo dei token di output più basso. È particolarmente interessante per agenti di repository, workflow da terminale e ricerche a contesto ampio che restano sotto la soglia di prezzo dei 200K.
  • Scegli GPT-5.6 Sol quando il compito richiede un ragionamento professionale più ampio, una finestra di contesto sopra il milione di token o quando il suo risultato più forte su una valutazione critica per il business come DeepSWE o il ragionamento clinico è stato convalidato nel tuo harness.
  • Scegli Claude Fable 5.1 quando le massime prestazioni di agenti di lunga durata, qualità del coding, esecuzione da terminale o ragionamento clinico giustificano il prezzo per token più elevato.
  • Usa instradamento dei modelli quando i workload variano. Instrada i passaggi di agenti di ingegneria di routine e ad alto volume al modello più conveniente qualificato, e riserva un modello più costoso per i compiti in cui i tassi di successo misurati giustificano il premio.

La scelta corretta dipende dal successo del compito end-to-end, dalla latenza, dai retry, dall’accuratezza delle chiamate agli strumenti e dal rifacimento umano—non da un singolo benchmark o dal prezzo di listino per i token di input.

Quanto costa l’API di Grok 4.7?

La tabella seguente confronta le tariffe xAI ufficiali con i prezzi visualizzati sulla pagina del modello Grok 4.7 di CometAPI il 22 settembre 2026. CometAPI dichiara uno sconto del 20%; verificate i prezzi live prima della produzione perché i prezzi dei gateway e i termini promozionali possono cambiare.

Livello di promptTipo di prezzoxAI ufficialeCometAPIDifferenza
Sotto 200K token di promptInput / 1M$2.00$1.6020% lower
Cached input / 1M$0.50$0.4020% lower
Output / 1M$6.00$4.8020% lower
Sopra 200K token di promptInput / 1M$4.00$3.2020% lower
Cached input / 1M$1.00$0.8020% lower
Output / 1M$12.00$9.6020% lower

Prezzi per contesto standard per prompt fino a 200.000 token

Per richieste il cui prompt non supera i 200.000 token, Grok 4.7 costa $2 per milione di token di input, $0.50 per milione di token di input in cache e $6 per milione di token di output. L’input in cache è la categoria meno costosa, quindi applicazioni con istruzioni di sistema ripetute o contesto riutilizzabile possono ridurre il costo quando quei token rientrano nella cache.

Per un esempio semplice, una richiesta che usa 100,000 token di input non in cache e produce 10,000 token di output costerebbe circa $0.26 prima di altri addebiti di piattaforma: $0.20 per l’input più $0.06 per l’output.

Prezzi per contesti lunghi oltre 200.000 token di prompt

Una volta che il prompt supera i 200.000 token, le tariffe raddoppiano a $4 per milione di token di input, $1 per milione di token di input in cache e $12 per milione di token di output. Il livello più alto si applica a causa della lunghezza del prompt, quindi i team dovrebbero monitorare la cronologia di conversazione accumulata, le tracce degli strumenti, i documenti recuperati e il contesto del repository prima di inviare ogni richiesta.

La decisione di costo pratica non riguarda quindi solo quanti token usa un compito, ma se il prompt supera la soglia dei 200.000 token. Riassumere il lavoro completato, rimuovere output di strumenti obsoleto e recuperare solo i file più rilevanti può mantenere i workload adatti nel livello standard senza sacrificare il contesto necessario.

Le note di rilascio di SpaceXAI documentano questa soglia. I budget di produzione dovrebbero anche tenere conto di retry, cicli degli agenti, chiamate agli strumenti fallite e lunghezza dell’output, invece di confrontare i provider solo per il prezzo di listino dei token di input.

Cosa rende Grok 4.7 utile per gli agenti AI?

  • Finestra di contesto da 500K: contiene codice sorgente, specifiche, output di strumenti, log e cronologia di conversazione in un unico contesto di lavoro. È utile per coding a livello di repository e analisi multi-documento, anche se il contesto va comunque gestito attivamente.
  • Ragionamento configurabile: le applicazioni possono selezionare low, medium, high o xhigh, scambiando latenza e calcolo con ragionamento più profondo in base alla difficoltà del compito.
  • Chiamate di funzione e output strutturato: gli agenti possono interrogare database, eseguire test, ispezionare documenti, chiamare API interne e restituire risultati leggibili dalle macchine.
  • Ricerca sul web e su X: gli strumenti di ricerca possono recuperare informazioni aggiornate quando i dati di training del modello sono insufficienti. I contenuti recuperati vanno comunque trattati come input non affidabile e verificati.
  • Esecuzione di codice: il modello può convalidare calcoli, trasformare dati e testare le soluzioni generate anziché affidarsi solo all’inferenza del modello linguistico.
  • Focus su workflow a lungo orizzonte: l’enfasi del training su compiti di molte ore, gestione del contesto e auto-verifica è mirata a cicli agentici che accumulano tracce di strumenti e richiedono recovery dopo i fallimenti.

In che modo Grok 4.7 migliora la sicurezza?

SpaceXAI afferma che Grok 4.7 introduce un nuovo stack di salvaguardie e riporta una maggiore resistenza ai jailbreak e una migliore sicurezza dual-use. Nell’annuncio di lancio, l’azienda riporta 62.4% sul benchmark di biosicurezza di LatchBio e afferma che solo il 3.3% dei prompt a rischio dual-use è stato consentito su HackerBench v0.3.

Queste cifre sono valutazioni pubblicate dal fornitore. Sono utili per comprendere le affermazioni del rilascio, ma non vanno considerate una misura universale delle prestazioni di sicurezza nel mondo reale.

Come possono gli sviluppatori usare l’API di Grok 4.7?

Grok 4.7 è attualmente disponibile tramite CometAPI con l’ID modello grok-4.7. CometAPI fornisce un endpoint compatibile con OpenAI, una sola chiave API e un flusso di fatturazione unificato su più provider di modelli, test e instradamento tra modelli affiancati più semplici e prezzi per token attualmente elencati inferiori del 20% rispetto alle tariffe xAI ufficiali. Prima dell’uso in produzione, confermate la pagina del modello live, la salute dell’endpoint, i parametri supportati, i prezzi e i requisiti di gestione dei dati.

Esempio di richiesta CometAPI:

curl "https://api.cometapi.com/v1/responses" \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $COMETAPI_KEY" \
  -d '{
    "model": "grok-4.7",
    "input": "Explain how a distributed task queue handles worker failure."
  }'

Vale la pena passare a Grok 4.7?

Per gli utenti esistenti di Grok 4.6 che dipendono da agenti di coding o workflow professionali di lunga durata, Grok 4.7 è un aggiornamento rilevante perché il set di benchmark di lancio migliora in ogni dimensione riportata, mentre il prezzo standard per token resta allo stesso livello $2/$6 sotto la soglia di contesto lungo.

Per gli utenti di altri modelli di frontiera, la decisione è specifica per il workload. Grok 4.7 è particolarmente interessante quando il costo dei token di output, i workload di ingegneria, i contesti ampi e l’uso prolungato di strumenti contano. Laddove un altro modello è più forte in un dominio critico, l’instradamento dei modelli può essere più razionale che sostituire ogni modello con un solo provider.

Conclusione

Grok 4.7 è più di un aggiornamento numerico di routine rispetto a Grok 4.6. Il rilascio è esplicitamente orientato a lavoro di lunga durata eseguito tramite strumenti, verifica ripetuta, contesti ampi e passaggi di esecuzione multipli.

I guadagni generazionali più forti compaiono dove quella direzione di training dovrebbe contare: Terminal-Bench 4.0 sale da 20.3% a 38.0%, EEBench da 53.0% a 64.0% e CursorBench 4.0 da 40.4% a 46.3%, mentre il prezzo standard sotto la soglia di 200K token di prompt resta a $2/M per l’input e $6/M per l’output.

La proposta di valore pratica non è quindi “Grok 4.7 vince ogni benchmark”. È che Grok 4.7 riduce il divario tra capacità agentica di classe frontiera e inferenza a costo inferiore, rendendolo particolarmente rilevante per agenti di coding, sistemi di ricerca e workflow professionali che devono operare per molti passaggi invece di rispondere una sola volta.

Continua a imparare

Collega questo articolo alla prossima decisione.

Vedi tutti gli argomenti
Pubblicato il Sep 22, 2026
Ultimo aggiornamento Sep 22, 2026
19 visualizzazioni
Revisionato per chiarezza, attribuzione delle fonti e terminologia API aggiornata.

Pronto a ridurre i costi di sviluppo AI del 20%?

Inizia gratuitamente in pochi minuti. Crediti di prova gratuiti inclusi. Nessuna carta di credito richiesta.

Leggi di più