Specifiche tecniche di Grok 4.6
| Elemento | Grok 4.6 |
|---|---|
| Provider | xAI |
| Model ID | grok-4.6 |
| Model type | Modello di frontiera per il ragionamento multimodale e l'intelligenza agentica |
| Primary strengths | Agenti a esecuzione prolungata, coding, lavoro di conoscenza, creazione di app interattive/visive |
| Input modalities | Testo e immagini |
| Output modality | Testo |
| Context window | 500,000 tokens |
| Knowledge cutoff | 1 febbraio 2026 |
| Output limit | Nessun limite di output testuale pubblicato da xAI |
| Reasoning | low, medium, high (default), xhigh |
| APIs | Responses API, Chat Completions |
| Tools | Function calling, web search, X search, code execution |
| API pricing | $2 / 1M input tokens; $6 / 1M output tokens |
| Fast variant | Disponibile a 2× il prezzo standard |
| Released | 12 agosto 2026 |
Che cos’è Grok 4.6?
Grok 4.6 è il più recente modello di frontiera di xAI, incentrato sull’intelligenza agentica.
La differenza rispetto a un chatbot tradizionale è significativa.
xAI enfatizza la capacità del modello di rimanere su progetti complessi più a lungo, lavorare su codebase, ricercare argomenti non familiari, creare applicazioni e verificare il proprio lavoro.
Questo rende Grok 4.6 particolarmente rilevante per il mercato in rapida espansione degli agent di coding e degli agent autonomi.
Caratteristiche principali di Grok 4.6
- Esecuzione di agent a lungo termine: Grok 4.6 è addestrato per sostenere lavori complessi su molti passaggi invece di ottimizzare solo per risposte a singolo turno.
- Agentic coding: Mira all’ingegneria del software a livello di repository, generazione di codice, debugging, test iterativi e ambienti di coding specifici di dominio.
- Ricerca per il lavoro di conoscenza: Il modello può esplorare domini non familiari, organizzare informazioni, ragionare su requisiti complessi e trasformare i risultati in un deliverable concreto.
- Creazione di applicazioni visive e interattive: xAI riporta risultati migliori al primo tentativo per progetti visivi e interattivi, inclusa la trasformazione di un’idea di prodotto in un’app funzionante e il suo perfezionamento tramite cicli di feedback.
- Auto-test e verifica: Su traiettorie più lunghe, xAI ha osservato più comportamenti in cui il modello controlla il proprio lavoro prima di proseguire.
- Uso nativo degli strumenti: Grok 4.6 supporta function calling, web search, X search ed esecuzione di codice tramite l’API.
- Ragionamento configurabile: Gli sviluppatori possono scegliere l’impegno di ragionamento
low,medium,highoxhigh, rendendo il modello adattabile a workload sensibili alla latenza e a compiti di ragionamento profondo.
Prestazioni nei benchmark di Grok 4.6
xAI riporta che Grok 4.6 eguaglia GPT-5.6 Sol sull’Artificial Analysis Intelligence Index, un composito di nove benchmark. I risultati più forti pubblicati includono:
| Benchmark | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Claude Fable 5 Max |
|---|---|---|---|---|
| Artificial Analysis Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54.0% | 73.0% | 70.0% |
| FrontierCode v1.1 (Extended) | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26.0% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | — | 58.8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
Queste cifre provengono dall’annuncio di lancio del 12 agosto di xAI. xAI osserva che le cifre di terze parti sono tratte da system card per sviluppatori o da leaderboard pubblici dei benchmark, quindi i risultati tra modelli dovrebbero essere interpretati tenendo conto della metodologia di valutazione e delle impostazioni dei modelli.
Grok 4.6 vs Grok 4.5 vs GPT-5.6 Sol vs Claude Fable 5
| Modello | Posizionamento principale | Contesto | AA Intelligence | Profilo di coding/agentico |
|---|---|---|---|---|
| Grok 4.6 | Agenti a lunga esecuzione, coding, lavoro di conoscenza | 500K | 61 | Solidi flussi di lavoro agentici per coding e progetti interattivi |
| Grok 4.5 | Modello generalista di frontiera veloce e per il coding | 500K | 56 | Solida base per il coding e i flussi di lavoro degli agent |
| GPT-5.6 Sol | Ragionamento generale di frontiera e lavoro agentico | Il contesto pubblicato dal concorrente varia per deployment | 61 | Risultati forti su DeepSWE e Terminal-Bench |
| Claude Fable 5 | Lavoro di conoscenza e coding di frontiera | Il contesto pubblicato dal concorrente varia per deployment | 62 | CursorBench, FrontierCode, APEX-SWE molto forti |
Grok 4.6 è più convincente quando il carico di lavoro richiede esecuzione sostenuta anziché una singola risposta di alta qualità. È particolarmente interessante per gli sviluppatori che costruiscono agent capaci di ricercare ripetutamente, chiamare strumenti, modificare codice, testare risultati e proseguire dal contesto accumulato. Claude Fable 5 mantiene un vantaggio su diversi benchmark pubblicati di coding e agent, mentre GPT-5.6 Sol supera Grok 4.6 su DeepSWE e Terminal-Bench nel confronto di xAI.
Limitazioni e considerazioni
- I risultati dei benchmark dipendono dal compito: Grok 4.6 non è uniformemente il modello con il punteggio più alto. I risultati pubblicati mostrano punti di forza e debolezze chiare tra diverse valutazioni agentiche.
- I workload di lunga durata possono consumare un gran numero di token: Una finestra di contesto ampia e l’uso iterativo degli strumenti possono aumentare il consumo totale di inferenza anche quando il prezzo per token è competitivo.
- La configurazione degli strumenti è importante: Web search, X search, esecuzione di codice e function calling richiedono un’architettura applicativa in grado di gestire in sicurezza permessi degli strumenti e dati restituiti.
- Knowledge cutoff: Il cutoff documentato è 1 febbraio 2026. Per informazioni più recenti, gli sviluppatori dovrebbero usare strumenti di retrieval o web search appropriati invece di fare affidamento sulla conoscenza statica del modello.
- La cache richiede una configurazione intenzionale: xAI raccomanda
prompt_cache_keyper la Responses API ex-grok-conv-idper Chat Completions per migliorare l’affidabilità degli hit di cache.
Casi d’uso di Grok 4.6
- Agent autonomi di coding — analisi del repository, implementazione, debugging, test e correzioni iterative.
- Prototipazione di prodotto — trasformazione di requisiti di prodotto ampi in applicazioni interattive funzionanti.
- Agent di ricerca tecnica — esplorazione di domini tecnici non familiari e produzione di deliverable strutturati.
- Copilot per sviluppatori — generazione di codice, revisione, debugging e flussi di sviluppo multi-step.
- Automazione del lavoro di conoscenza — analisi di documenti, sintesi di informazioni, pianificazione e generazione di output strutturati.
- Assistenti che usano strumenti — applicazioni che combinano il ragionamento del modello con web search, X search, esecuzione di codice e function calling personalizzati.
Come accedere all’API di Grok 4.6
Per le applicazioni che già usano il layer API unificato di CometAPI, utilizzare l’ID modello Grok 4.6 esposto da CometAPI e seguire l’endpoint/schema corrente nella documentazione API di CometAPI. Questo può ridurre il lavoro di integrazione specifico del provider quando un’applicazione deve passare tra LLM di frontiera.
Un flusso di lavoro tipico è:
- Crea o accedi a un account CometAPI.
- Crea un token API nella console CometAPI.
- Seleziona l’endpoint del modello
grok-4.6. - Invia le richieste tramite l’endpoint CometAPI usando lo schema di richiesta documentato per il modello.
- Elabora nel tuo software il testo restituito, le chiamate agli strumenti o l’output strutturato.