TL;DR Grok 4.7 è il modello di frontiera di SpaceXAI per il coding, i workflow agentici e il lavoro professionale basato sulla conoscenza, rilasciato il 21 settembre 2026. Combina una finestra di contesto da 500.000 token, input di testo e immagini, ragionamento configurabile, chiamate di funzione, ricerca sul web e su X, ed esecuzione di codice.
Per prompt inferiori a 200.000 token, l’API ufficiale di xAI indica $2 per milione di token di input, $0.50 per milione di token di input in cache e $6 per milione di token di output. CometAPI attualmente indica Grok 4.7 a $1.60 per l’input, $0.40 per l’input in cache e $4.80 per l’output per milione di token nello stesso livello—una riduzione del 20% rispetto alle tariffe ufficiali mostrate sulla sua pagina del modello.
La proposta di valore concreta non è il primato universale sui benchmark. Grok 4.7 è più interessante quando un carico di lavoro combina attività di ingegneria, lunghi cicli agentici, uso di strumenti, contesti di lavoro ampi e sensibilità al costo dei token di output. I team dovrebbero convalidarlo sui propri repository e workflow prima dell’instradamento in produzione.
Punti chiave
- Grok 4.7 utilizza un modello base più grande rispetto a Grok 4.6, un reinforcement learning più lungo su compiti più duri della durata di molte ore e una verifica interna più robusta.
- L’API supporta una finestra di contesto da 500.000 token, input di testo e immagini, output testuale, quattro livelli di ragionamento, output strutturato, function calling, ricerca sul web e su X, ed esecuzione di codice.
- SpaceXAI riporta 46.3% su CursorBench 4.0, 71.0% su DeepSWE v1.1 e 38.0% su Terminal-Bench 4.0. Si tratta di risultati pubblicati dal fornitore, non di prova di leadership universale.
- CometAPI indica Grok 4.7 come disponibile, con un endpoint compatibile con OpenAI e prezzi inferiori del 20% rispetto alle tariffe xAI ufficiali mostrate nel suo catalogo attuale.
- Scegli Grok 4.7 per agenti di ingegneria sensibili al prezzo e uso prolungato di strumenti; scegli alternative quando contesti molto lunghi o un dominio critico per i benchmark contano più del prezzo unitario.
Che cos’è Grok 4.7?
Grok 4.7 è l’ultimo modello LLM di frontiera di SpaceXAI, posizionato per coding, compiti di agenti autonomi e lavoro professionale basato sulla conoscenza. Il rilascio si focalizza su attività che richiedono interazione sostenuta, uso di strumenti, verifica e revisione, più che semplici risposte one-shot.
SpaceXAI afferma che Grok 4.7 è stato addestrato con un run di reinforcement learning più lungo su un mix di compiti più difficili, ponderato verso problemi che possono richiedere molte ore per essere completati. Questa direzione di training è particolarmente rilevante per ingegneria software a livello di repository, debugging, ricerca, creazione di documenti, analisi ingegneristiche e automazioni multi-step.
In che modo Grok 4.7 è diverso da—e migliore di—Grok 4.6?
Un modello base più grande
Grok 4.7 passa a un modello base più grande rispetto a Grok 4.6. SpaceXAI non ha divulgato un conteggio dei parametri pubblico e definitivo, quindi la conclusione difendibile è un aumento della capacità del modello base—non una stima specifica dei parametri.
Reinforcement learning più lungo su compiti più difficili
La fase di reinforcement learning è stata estesa e orientata verso problemi più difficili e di orizzonte più lungo. SpaceXAI enfatizza compiti che possono richiedere ore di lavoro, allineando il modello a coding autonomo, ricerca e workflow agentici professionali.
Auto-verifica più robusta
Grok 4.7 è addestrato a ispezionare il proprio lavoro con maggiore attenzione. Questo è importante nell’ingegneria del software perché un agente affidabile deve ispezionare, modificare, testare, diagnosticare i fallimenti, revisionare e validare ripetutamente—non solo generare una prima risposta.
Miglioramenti misurati rispetto a Grok 4.6
| Dimensione | Grok 4.6 | Grok 4.7 | Variazione |
|---|---|---|---|
| CursorBench 4.0 | 40.4% | 46.3% | +5.9 pts |
| DeepSWE v1.1 | 65.2% | 71.0% | +5.8 pts |
| EEBench | 53.0% | 64.0% | +11.0 pts |
| AA Briefcase v1.1 | 1,546 | 1,657 | +111 |
| Terminal-Bench 4.0 | 20.3% | 38.0% | +17.7 pts |
| Harvey Legal Agent Benchmark | 15.8% | 19.6% | +3.8 pts |
| HealthBench Professional | 48.5% | 56.7% | +8.2 pts |
Nel set pubblicato al lancio, Grok 4.7 migliora rispetto a Grok 4.6 in ogni risultato elencato. Il guadagno assoluto più grande è su Terminal-Bench 4.0, coerente con l’enfasi del rilascio su workflow a riga di comando di lunga durata e uso di strumenti. Questi numeri restano pubblicati dal fornitore e andrebbero testati su compiti reali prima di una decisione di migrazione.
Quanto è valido Grok 4.7 nei benchmark?
La valutazione di lancio di SpaceXAI copre ingegneria del software, lavoro su terminale, compiti da ufficio professionali, lavoro legale, ragionamento clinico e ingegneria elettrica. Si tratta di risultati pubblicati dal fornitore e dovrebbero essere convalidati rispetto ai workload di produzione prima di decisioni di procurement o instradamento.
| Benchmark | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
Nei risultati di lancio di Grok 4.7, SpaceXAI indica il 71.0% su DeepSWE v1.1 come sforzo di ragionamento elevato.
L’annuncio di lancio non divulga ogni harness per benchmark, configurazione degli strumenti, conteggio dei run o ambiente di valutazione. Trattate questi valori come risultati pubblicati dal fornitore e convalidate il modello sui vostri repository, strumenti, obiettivi di latenza e criteri di failure prima di instradare il lavoro di produzione.
Cosa mostra il profilo dei benchmark di Grok 4.7?
Ingegneria del software
CursorBench 4.0 sale da 40.4% su Grok 4.6 a 46.3% su Grok 4.7, mentre DeepSWE v1.1 sale da 65.2% a 71.0%. Ciò supporta il posizionamento di Grok 4.7 come modello per agenti di coding più che solo assistenza conversazionale al coding.
Lavori da terminale di lunga durata
Terminal-Bench 4.0 mostra uno dei cambiamenti generazionali più ampi: 20.3% per Grok 4.6 contro 38.0% per Grok 4.7. Il guadagno assoluto di 17.7 punti è coerente con l’enfasi di SpaceXAI su reinforcement learning a orizzonte lungo e auto-verifica.
Ingegneria elettrica
Su EEBench, Grok 4.7 raggiunge 64.0%, rispetto al 53.0% di Grok 4.6. Tra i confronti pubblicati, questo è uno dei risultati relativi più forti di Grok 4.7.
Lavoro professionale basato sulla conoscenza
AA Briefcase v1.1 sale da 1,546 a 1,657. Questi compiti sono progettati per riflettere lavoro professionale di più ore che coinvolge artefatti come documenti, presentazioni, analisi e altri deliverable strutturati.
Grok 4.7 vs GPT-5.6 Sol vs Fable 5.1: come si confrontano?
Verifiche dei prezzi nativi del provider: OpenAI indica GPT-5.6 Sol a $4 per milione di token di input e $20 per milione di token di output, mentre Anthropic indica Claude Fable 5.1 a $10 per milione di token di input e $50 per milione di token di output.
| Dimensione | Grok 4.7 | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Posizionamento principale | Coding, compiti agentici, lavoro basato sulla conoscenza | Ragionamento professionale complesso e coding | Agenti di lunga durata, coding e lavoro basato sulla conoscenza |
| Finestra di contesto | 500,000 token | 1,050,000 token | 1,000,000 token |
| Modalità | Input di testo e immagini; output testuale | Input di testo e immagini; output testuale | Input di testo e immagini; output testuale |
| Controllo del ragionamento | Low, medium, high, xhigh | None through max | Adaptive thinking con sforzo configurabile |
| Stato API del provider | Disponibile sulla xAI API pubblica | Disponibile tramite OpenAI Chat Completions and Responses | Disponibile tramite la Claude API e marketplace cloud supportati |
| Prezzo input / 1M token | $2 | $4 | $10 |
| Prezzo output / 1M token | $6 | $20 | $50 |
| CursorBench 4.0 | 46.3% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0% | 72.7% | 70.0% |
| Casi d’uso ideali | Agenti di ingegneria sensibili al prezzo e uso prolungato di strumenti | Ampio ragionamento professionale con contesto molto lungo | Massime prestazioni per agenti di lunga durata e workflow di conoscenza |
Quale modello dovresti scegliere?
- Scegli Grok 4.7 quando priorità sono workload di ingegneria, uso prolungato di strumenti, ragionamento configurabile e costo dei token di output più basso. È particolarmente interessante per agenti di repository, workflow da terminale e ricerche a contesto ampio che restano sotto la soglia di prezzo dei 200K.
- Scegli GPT-5.6 Sol quando il compito richiede un ragionamento professionale più ampio, una finestra di contesto sopra il milione di token o quando il suo risultato più forte su una valutazione critica per il business come DeepSWE o il ragionamento clinico è stato convalidato nel tuo harness.
- Scegli Claude Fable 5.1 quando le massime prestazioni di agenti di lunga durata, qualità del coding, esecuzione da terminale o ragionamento clinico giustificano il prezzo per token più elevato.
- Usa instradamento dei modelli quando i workload variano. Instrada i passaggi di agenti di ingegneria di routine e ad alto volume al modello più conveniente qualificato, e riserva un modello più costoso per i compiti in cui i tassi di successo misurati giustificano il premio.
La scelta corretta dipende dal successo del compito end-to-end, dalla latenza, dai retry, dall’accuratezza delle chiamate agli strumenti e dal rifacimento umano—non da un singolo benchmark o dal prezzo di listino per i token di input.
Quanto costa l’API di Grok 4.7?
La tabella seguente confronta le tariffe xAI ufficiali con i prezzi visualizzati sulla pagina del modello Grok 4.7 di CometAPI il 22 settembre 2026. CometAPI dichiara uno sconto del 20%; verificate i prezzi live prima della produzione perché i prezzi dei gateway e i termini promozionali possono cambiare.
| Livello di prompt | Tipo di prezzo | xAI ufficiale | CometAPI | Differenza |
|---|---|---|---|---|
| Sotto 200K token di prompt | Input / 1M | $2.00 | $1.60 | 20% lower |
| Cached input / 1M | $0.50 | $0.40 | 20% lower | |
| Output / 1M | $6.00 | $4.80 | 20% lower | |
| Sopra 200K token di prompt | Input / 1M | $4.00 | $3.20 | 20% lower |
| Cached input / 1M | $1.00 | $0.80 | 20% lower | |
| Output / 1M | $12.00 | $9.60 | 20% lower |
Prezzi per contesto standard per prompt fino a 200.000 token
Per richieste il cui prompt non supera i 200.000 token, Grok 4.7 costa $2 per milione di token di input, $0.50 per milione di token di input in cache e $6 per milione di token di output. L’input in cache è la categoria meno costosa, quindi applicazioni con istruzioni di sistema ripetute o contesto riutilizzabile possono ridurre il costo quando quei token rientrano nella cache.
Per un esempio semplice, una richiesta che usa 100,000 token di input non in cache e produce 10,000 token di output costerebbe circa $0.26 prima di altri addebiti di piattaforma: $0.20 per l’input più $0.06 per l’output.
Prezzi per contesti lunghi oltre 200.000 token di prompt
Una volta che il prompt supera i 200.000 token, le tariffe raddoppiano a $4 per milione di token di input, $1 per milione di token di input in cache e $12 per milione di token di output. Il livello più alto si applica a causa della lunghezza del prompt, quindi i team dovrebbero monitorare la cronologia di conversazione accumulata, le tracce degli strumenti, i documenti recuperati e il contesto del repository prima di inviare ogni richiesta.
La decisione di costo pratica non riguarda quindi solo quanti token usa un compito, ma se il prompt supera la soglia dei 200.000 token. Riassumere il lavoro completato, rimuovere output di strumenti obsoleto e recuperare solo i file più rilevanti può mantenere i workload adatti nel livello standard senza sacrificare il contesto necessario.
Le note di rilascio di SpaceXAI documentano questa soglia. I budget di produzione dovrebbero anche tenere conto di retry, cicli degli agenti, chiamate agli strumenti fallite e lunghezza dell’output, invece di confrontare i provider solo per il prezzo di listino dei token di input.
Cosa rende Grok 4.7 utile per gli agenti AI?
- Finestra di contesto da 500K: contiene codice sorgente, specifiche, output di strumenti, log e cronologia di conversazione in un unico contesto di lavoro. È utile per coding a livello di repository e analisi multi-documento, anche se il contesto va comunque gestito attivamente.
- Ragionamento configurabile: le applicazioni possono selezionare low, medium, high o xhigh, scambiando latenza e calcolo con ragionamento più profondo in base alla difficoltà del compito.
- Chiamate di funzione e output strutturato: gli agenti possono interrogare database, eseguire test, ispezionare documenti, chiamare API interne e restituire risultati leggibili dalle macchine.
- Ricerca sul web e su X: gli strumenti di ricerca possono recuperare informazioni aggiornate quando i dati di training del modello sono insufficienti. I contenuti recuperati vanno comunque trattati come input non affidabile e verificati.
- Esecuzione di codice: il modello può convalidare calcoli, trasformare dati e testare le soluzioni generate anziché affidarsi solo all’inferenza del modello linguistico.
- Focus su workflow a lungo orizzonte: l’enfasi del training su compiti di molte ore, gestione del contesto e auto-verifica è mirata a cicli agentici che accumulano tracce di strumenti e richiedono recovery dopo i fallimenti.
In che modo Grok 4.7 migliora la sicurezza?
SpaceXAI afferma che Grok 4.7 introduce un nuovo stack di salvaguardie e riporta una maggiore resistenza ai jailbreak e una migliore sicurezza dual-use. Nell’annuncio di lancio, l’azienda riporta 62.4% sul benchmark di biosicurezza di LatchBio e afferma che solo il 3.3% dei prompt a rischio dual-use è stato consentito su HackerBench v0.3.
Queste cifre sono valutazioni pubblicate dal fornitore. Sono utili per comprendere le affermazioni del rilascio, ma non vanno considerate una misura universale delle prestazioni di sicurezza nel mondo reale.
Come possono gli sviluppatori usare l’API di Grok 4.7?
Grok 4.7 è attualmente disponibile tramite CometAPI con l’ID modello grok-4.7. CometAPI fornisce un endpoint compatibile con OpenAI, una sola chiave API e un flusso di fatturazione unificato su più provider di modelli, test e instradamento tra modelli affiancati più semplici e prezzi per token attualmente elencati inferiori del 20% rispetto alle tariffe xAI ufficiali. Prima dell’uso in produzione, confermate la pagina del modello live, la salute dell’endpoint, i parametri supportati, i prezzi e i requisiti di gestione dei dati.
Esempio di richiesta CometAPI:
curl "https://api.cometapi.com/v1/responses" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-d '{
"model": "grok-4.7",
"input": "Explain how a distributed task queue handles worker failure."
}'
Vale la pena passare a Grok 4.7?
Per gli utenti esistenti di Grok 4.6 che dipendono da agenti di coding o workflow professionali di lunga durata, Grok 4.7 è un aggiornamento rilevante perché il set di benchmark di lancio migliora in ogni dimensione riportata, mentre il prezzo standard per token resta allo stesso livello $2/$6 sotto la soglia di contesto lungo.
Per gli utenti di altri modelli di frontiera, la decisione è specifica per il workload. Grok 4.7 è particolarmente interessante quando il costo dei token di output, i workload di ingegneria, i contesti ampi e l’uso prolungato di strumenti contano. Laddove un altro modello è più forte in un dominio critico, l’instradamento dei modelli può essere più razionale che sostituire ogni modello con un solo provider.
Conclusione
Grok 4.7 è più di un aggiornamento numerico di routine rispetto a Grok 4.6. Il rilascio è esplicitamente orientato a lavoro di lunga durata eseguito tramite strumenti, verifica ripetuta, contesti ampi e passaggi di esecuzione multipli.
I guadagni generazionali più forti compaiono dove quella direzione di training dovrebbe contare: Terminal-Bench 4.0 sale da 20.3% a 38.0%, EEBench da 53.0% a 64.0% e CursorBench 4.0 da 40.4% a 46.3%, mentre il prezzo standard sotto la soglia di 200K token di prompt resta a $2/M per l’input e $6/M per l’output.
La proposta di valore pratica non è quindi “Grok 4.7 vince ogni benchmark”. È che Grok 4.7 riduce il divario tra capacità agentica di classe frontiera e inferenza a costo inferiore, rendendolo particolarmente rilevante per agenti di coding, sistemi di ricerca e workflow professionali che devono operare per molti passaggi invece di rispondere una sola volta.
