GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
new/Ricerca CometAPI

Gemini 4 ha già superato GPT-6 e Claude Fable 5.1? I benchmark trapelati spiegati

Gemini 4 supererà GPT-6 Astra di OpenAI e Claude Fable 5.1 di Anthropic nei principali benchmark relativi ad agenti e programmazione, con alcuni che collegano tali miglioramenti a RSI.

CometAPI
AnnaTeam di ricerca su modelli AI e API
Aggiornato Sep 20, 2026 13 min di lettura
Gemini 4 ha già superato GPT-6 e Claude Fable 5.1? I benchmark trapelati spiegati
Usa questo schema

Esegui la prima chiamata API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR Benchmark trapelati e test in incognito su Arena.ai a metà settembre 2026 collocano il non ancora rilasciato Gemini 4 Pro di Google come nuovo leader alla frontiera, superando GPT-6 Astra e Claude Fable 5.1 in ingegneria del software, attività basate su agenti, lavoro della conoscenza, ragionamento e benchmark multimodali.

Punti chiave

  • Gemini 4 Pro guida le valutazioni trapelate su DeepSWE v1.1 (88.7%), GDPval-AA v2 (2064 Elo), Terminal-bench 2.1 (95.3%), OSWorld-2.0 (86.8%) e molte altre suite di agenti/ragionamento.
  • Ha prezzi inferiori a GPT-6 Astra ($12/$60) e Claude Fable 5.1 ($10/$50) sul listino, pur eguagliando o superando le loro finestre di contesto di classe 1M.
  • Test in incognito su Arena.ai con nomi segnaposto (es., gemini-3.8-flash) hanno prodotto demo di spicco in SVG, Three.js e programmazione basata su agenti.
  • Circolano voci su RSI (recursive self-improvement), ma manca evidenza pubblica di miglioramento autonomo a ciclo chiuso per Gemini 4 stesso.
  • Google ha confermato un forte investimento in un modello base Gemini 4 più grande; il timing del lancio pubblico non è ufficiale.
  • Piattaforme come CometAPI aggregano già Gemini, GPT-6 Astra, Claude Fable/Opus e centinaia di altri modelli dietro un unico endpoint compatibile con OpenAI a tariffe competitive—ideale per benchmark della nuova frontiera non appena sarà disponibile.

Cosa sappiamo di Gemini 4? (Leak, fonti e contesto verificato)

Al 20 settembre 2026, Gemini 4 Pro non ha ricevuto un annuncio ufficiale di Google, una model card o un endpoint API pubblico. Tutto oltre alle precedenti dichiarazioni di Google sull’investimento in un “modello base Gemini 4 più grande” (utili di luglio 2026) proviene da leak della community, test alla cieca su Arena.ai e tabelle di benchmark circolanti.

Fonti e affermazioni chiave includono:

  • Il leaker Pankaj Kumar e post successivi (tra inizio e metà settembre) hanno fatto riferimento a un checkpoint interno Pro con rilascio pubblico atteso per ottobre e una possibile variante Flash-Lite prima.
  • Più sviluppatori hanno riportato di aver richiamato un modello ad alta capacità etichettato “gemini-3.8-flash” (o segnaposto simili) su Arena.ai. Gli output includevano generazione complessa di SVG (es., un pellicano su una bicicletta, farfalle meccaniche in Three.js), generazione di JSON lunghi non ripetitivi e forte comportamento basato su agenti. Alcuni utenti hanno affermato dettagli di backend come contesto da milioni di token, limiti di output di 256k, memoria tra sessioni e capacità native di strumenti/internet.
  • Una tabella comparativa ampiamente condivisa mette a confronto Gemini 4 Pro con Gemini 4 Flash, Gemini 4 Flash-Lite, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5 e GPT-5.6 Sol.
  • Google non ha confermato i test su Arena o la tabella. Lo schema storico mostra che l’azienda spesso esegue valutazioni in incognito su piattaforme pubbliche settimane prima dei lanci formali.

Gemini 4 ha già superato GPT-6 e Claude Fable 5.1? I benchmark trapelati spiegati

Finestra di contesto

La tabella trapelata mostra 2M token massimi di input per la famiglia Gemini 4—il doppio dell’1M di GPT-6 Astra e ben oltre i 200k della linea Claude Fable/Opus 5 (alcune varianti di Claude hanno offerto finestre effettive più grandi tramite altri meccanismi). Affermazioni separate di ghost-routing hanno ipotizzato limiti di 10M; restano non verificate.

Prezzo di Gemini 4 (dati trapelati)

La tabella circolante riporta:

  • Gemini 4 Pro: $2.25 input / $11.25 output per 1M token (nessuna cache).
  • Gemini 4 Flash: $0.75 / $3.75.
  • Gemini 4 Flash-Lite: $0.35 / $1.75.

Queste cifre sono sostanzialmente inferiori ai $12/$60 riportati per GPT-6 Astra e ai $10/$50 di Claude Fable 5.1 (Fable 5.1 offre sconti aggressivi sulle letture da cache che possono ridurre il costo effettivo per carichi agentici). I prezzi ufficiali attuali di Gemini 3.x Pro si collocano tra $2–$4 in input / $12–$18 in output a seconda della lunghezza del contesto, quindi i numeri trapelati per la versione Pro sono plausibili come aggiustamento di nuova generazione.

I prezzi pubblici effettivi saranno noti solo al lancio. Storicamente Google ha utilizzato tariffe per token competitive e livelli gratuiti per favorire l’adozione.

Prestazioni di Gemini 4 Pro: approfondimento dei benchmark trapelati

La tabella circolante colloca Gemini 4 Pro in cima a quasi ogni categoria. Questi numeri sono non ufficiali e non verificati da Google o laboratori indipendenti al momento della stesura. Devono essere trattati come segnali direzionali e non come classifiche definitive.

Ingegneria del software e programmazione basata su agenti

  • DeepSWE v1.1 (ingegneria del software a lungo orizzonte): 88.7% (vs. GPT-6 Astra 86.9%, Claude Fable 5.1 69.1%, Claude Opus 5 75.0%).
  • Terminal-bench 2.1 (programmazione agentica da terminale): 95.3% (vs. Astra 94.1%, Fable 92.8%).
  • Terminal-bench 4.0 (capacità generali degli agenti): 69.7% (il più ampio divario relativo rispetto a Flash e concorrenti).

Lavoro della conoscenza e attività professionali

  • GDPval-AA v2 (Elo, lavoro della conoscenza): 2064 (unico modello sopra 2000; Astra 1994, Fable 1853).
  • Vals Finance Agent v2: 74.2%.
  • Harvey’s Legal Agent Benchmark (flussi di lavoro legali complessi, tasso di superamento totale): 18.7%.

Ragionamento, multimodalità e specializzazione

  • CharXiv Reasoning (sintesi di informazioni da grafici complessi, senza strumenti): 94.7%.
  • LVBench (comprensione di video lunghi): 95.8% agentico / 95.0% statico.
  • HLE-Verified (ragionamento multidisciplinare esperto): 72.1%.
  • OSWorld-2.0 (uso del computer basato su agenti, punteggio parziale, strumenti batch abilitati): 86.8%.
  • BioMysteryBench & LABBench2 (bioinformatica e flussi di lavoro di ricerca in biologia): punteggi leader sia sui sottoinsiemi risolvibili dagli umani sia su quelli difficili.

Questi risultati, se direzionalmente accurati, mostrano particolare forza su carichi agentici a lungo orizzonte, multi-step, con uso di strumenti—esattamente l’area in cui GPT-6 Astra e Claude Fable 5.1 erano posizionati come leader dopo i loro rilasci di inizio settembre.

I test qualitativi su Arena rafforzano il quadro: generazioni complesse in SVG e Three.js dal modello in incognito sono state giudicate superiori o altamente competitive rispetto ad Astra in confronti fianco a fianco della community.

Come funzionerà Gemini 4?

Gemini 4 (Pro) non è ancora stato rilasciato, quindi qualsiasi descrizione di “come funzionerà” si basa necessariamente sulle dichiarazioni ufficiali di Google, sui limitati dettagli trapelati su un checkpoint interno precoce, sulla traiettoria della serie Gemini 3.x e su ragionevoli inferenze ingegneristiche. Nulla di quanto segue deve essere trattato come specifiche confermate.

Addestramento di base e approccio alla scala

Google ha descritto Gemini 4 come il suo “run di pre-training più ambizioso finora”, costruito su un modello base significativamente più grande rispetto alle generazioni precedenti. L’obiettivo esplicito è rimanere competitivo alla frontiera, specialmente in ambito coding e agenti autonomi.

Ciò implica:

  • Un numero di parametri maggiore o una capacità più efficace (via mixture-of-experts, maggiore sparsità o scaling più denso).
  • Maggiore investimento computazionale durante il pre-training.
  • Enfasi continua su dati di addestramento multimodali (testo, immagine, video, audio, codice, traiettorie di uso di strumenti).

Il modello dovrebbe fungere da nuovo baseline ad alta capacità da cui derivare successivamente varianti veloci in stile Flash.

Inferenza e stile di ragionamento

Descrizioni trapelate di un checkpoint iniziale “argon” menzionano una modalità a elevato sforzo di pensiero che impiegava circa 2.4 minuti per una singola generazione e supportava un limite di output drasticamente più alto (riportato a 256k token contro i precedenti ~64k).

Questo indica:

  • Percorsi di ragionamento opzionali e intensivi in termini di calcolo (in spirito simili a modalità di pensiero esteso o “massimo sforzo” in modelli concorrenti).
  • La capacità di dedicare più calcolo interno a problemi difficili prima di produrre una risposta.
  • Migliore supporto per output lunghi e coerenti come codebase complete, piani multi-step o report estesi.

È probabile che gli utenti possano controllare il compromesso tra velocità/costo e profondità di ragionamento, così come oggi con i modelli Gemini Flash che offrono livelli di pensiero basso/medio/alto.

Aree chiave di focalizzazione delle capacità

  1. Coding e ingegneria del software Prestazioni a lungo orizzonte più solide: refactoring multi-file, debug su repository, loop di autocorrezione e tassi di completamento più elevati su task software realistici.
  2. Comportamento autonomo/agentico Migliore capacità di pianificare, usare strumenti, osservare risultati intermedi, recuperare dagli errori e proseguire verso un obiettivo per molti step. Ciò si basa direttamente sulle funzionalità di uso del computer e agentiche già presenti in Gemini 3.5/3.8 Flash.
  3. Affidabilità del lungo contesto La community menziona target nell’ordine di 1.5 milioni di token (o più). L’obiettivo pratico non è solo finestre più grandi ma migliore fedeltà di recupero e minore degrado quando si lavora con documenti molto lunghi, codebase o tracce di agenti di molte ore.
  4. Comprensione e generazione multimodale Gestione nativa di testo + immagine + video + audio, con attesi miglioramenti nel ragionamento spaziale, nella comprensione video e nelle interazioni voce/agente in tempo reale (sulla scia dei modelli Gemini 3.8 Live di settembre 2026).
  5. Uso di strumenti e output strutturati Chiamate di funzione più robuste, esecuzione di codice, ricerca con grounding e output strutturati in stile JSON/XML per un’integrazione affidabile in applicazioni e agenti.

In cosa differisce da Gemini 3.x

  • Scala: Modello base esplicitamente più grande, piuttosto che un raffinamento incrementale.
  • Capacità di output: Limiti di token più elevati trapelati abilitano generazioni più lunghe in un singolo passaggio.
  • Profondità di ragionamento: Modalità ad alto sforzo più pronunciate per problemi difficili.
  • Focus agentico: Maggiore enfasi su lavoro autonomo sostenuto e multi-step anziché su task a singolo turno o a breve orizzonte.
  • Posizionamento: Inteso come nuovo modello Pro di frontiera, mentre la linea Flash continua una rapida iterazione per velocità ed efficienza dei costi.

Relazione con il Recursive Self-Improvement (RSI)

I dirigenti di Google hanno collegato pubblicamente l’elevata spesa in capitale per l’IA all’obiettivo a più lungo termine del recursive self-improvement—sistemi che possono migliorare significativamente se stessi o i processi che producono la generazione successiva. Ricerca correlata (come il paper Dream-RSI) mostra agenti che migliorano le proprie strategie di esplorazione senza modificare i pesi del modello.

Gemini 4 Pro supererà GPT-6 e Claude Fable 5.1?

CategoriaGemini 4 ProGPT-6 AstraClaude Fable 5.1Note
Prezzo input / output$2.25 / $11.25$12.00 / $60.00$10.00 / $50.00Gemini 4 Pro ~5× più economico di Astra
Finestra di contesto2M1M200kVantaggio significativo per Gemini
DeepSWE v1.188.7%86.9%69.1%Forte vantaggio nel coding
GDPval-AA v2 (Elo)206419941853Leader nel lavoro della conoscenza
Terminal-bench 4.069.7%66.4%57.9%Capacità generali degli agenti
OSWorld-2.086.8%84.5%77.9%Uso del computer
HLE-Verified72.1%67.3%62.1%Ragionamento esperto
LVBench (video)95.8% / 95.0%93.8%90.4%Punto di forza multimodale
Bio / LAB researchPunteggi più altiForteCompetitivoFlussi di lavoro scientifici

Gemini 4 Pro è in cima a ogni riga principale della tabella, spesso con un margine significativo, mentre il prezzo dichiarato è molto più aggressivo rispetto a GPT-6 Astra o Claude Fable 5.1.

Importanti avvertenze

  • Questa tabella non è un rilascio ufficiale di Google. Al 20 settembre 2026, Google non ha ancora pubblicato una model card, un endpoint API, prezzi o benchmark confermati per Gemini 4 Pro. I numeri provengono da fonti della community / avvistamenti su Arena / leak di checkpoint interni (codename correlato ad “argon”).
  • Alcuni fogli circolati in precedenza sono stati successivamente etichettati come predittivi o parzialmente copiati. Trattare ogni percentuale e i prezzi come non verificati finché Google non li conferma.
  • La finestra di contesto di Claude Fable 5.1 è qui indicata come 200k, inferiore alla cifra di 1M comunemente riportata nella documentazione ufficiale di Anthropic. Ciò può riflettere un’impostazione specifica di valutazione o un errore nel foglio trapelato.
  • GPT-6 Astra e Claude Fable 5.1 restano gli unici modelli di frontiera pienamente pubblici e valutati indipendentemente al momento. Artificial Analysis e altri tracker di terze parti li mostrano ancora come molto vicini nel complesso (con punti di forza differenti).

Situazione pratica attuale (20 settembre 2026)

ModelloStatoIdeale perLivello di prezzo
Gemini 4 ProNon rilasciato (prestazioni dichiarate elevate)Lungo contesto, coding, agenti, multimodalità, costoMolto aggressivo (dichiarato)
GPT-6 AstraRilasciatoMatematica, uso del computer, terminale, automazione, cyberPremium
Claude Fable 5.1RilasciatoAgenti a lungo orizzonte, ragionamento, qualità del coding, efficienza della cachePremium
Gemini 4 Flash / Flash-LiteVarianti dichiarateCarichi sensibili a velocità e costoEstremamente basso

Punti chiave rapidi

  • Dominante a tutto tondo: Gemini 4 Pro è #1 in ogni categoria elencata, spesso con un margine chiaro.
  • Punti di forza particolari: Coding/agenti a lungo orizzonte (DeepSWE, Terminal-bench), lavoro della conoscenza, multimodalità (video + grafici) e domini specializzati (finanza, legale, biologia, uso del computer).
  • Posizionamento di prezzo: Circa 1/5 del prezzo di GPT-6 Astra e Claude Fable 5.1 su input e output, pur offrendo punteggi più elevati.

Astra enfatizza uso del computer, soglie di cybersecurity e scoperta scientifica; Fable 5.1 enfatizza lavoro della conoscenza di lunga durata e coding con salvaguardie raffinate e costi di lettura da cache inferiori. Il profilo trapelato di Gemini 4 Pro appare più forte nell’ingegneria del software agentica a largo spettro e nel ragionamento multimodale.

Come possono prepararsi gli sviluppatori: raccomandazioni CometAPI

In attesa dell’accesso ufficiale a Gemini 4 Pro, i team traggono vantaggio da un gateway unificato che già supporta l’attuale frontiera (serie Gemini 3.x, GPT-6 Astra, Claude Fable 5.1 / Opus 5 e 500+ altri modelli). CometAPI offre esattamente questo: un singolo endpoint compatibile con OpenAI, una sola API key, fatturazione pay-as-you-go tipicamente 20–40% inferiore alle tariffe dirette dei vendor, e la possibilità di cambiare modello con un singolo parametro.

Flusso di lavoro pratico:

  1. Prototipare pipeline agentiche sugli attuali Gemini Flash/Pro, GPT-6 Astra e Claude Fable 5.1 tramite CometAPI.
  2. Eseguire benchmark degli stessi prompt tra i modelli per stabilire baseline.
  3. Quando Gemini 4 Pro (e le sue varianti Flash) appariranno nel catalogo CometAPI—storicamente la piattaforma aggiunge rapidamente i nuovi modelli Google—sostituire l’ID del modello e rieseguire le valutazioni con minime modifiche al codice.
  4. Usare la dashboard dei costi per tracciare la spesa in token tra i provider e instradare il traffico ad alto volume o sensibile alla latenza verso il modello più economico e capace.

Questo approccio elimina la gestione di più chiavi, riduce il rischio di lock-in al fornitore e mette i team in posizione di adottare Gemini 4 Pro dal giorno uno della disponibilità pubblica.

Gemini 4 Pro, se i leak risultassero direzionalmente corretti, rappresenta il tentativo più forte di Google per riconquistare la frontiera nell’ingegneria del software agentica e nel ragionamento multimodale a lungo contesto. La combinazione di prestazioni dichiarate, ampio contesto e prezzi aggressivi lo renderebbe una considerazione predefinita per molti carichi in produzione. Fino al lancio ufficiale e a valutazioni indipendenti, la via prudente è un benchmarking continuo sugli attuali modelli di frontiera—facilmente realizzabile tramite piattaforme che già unificano l’accesso. Restate sintonizzati per l’annuncio formale; le prossime settimane chiariranno probabilmente quanto dell’hype si tradurrà in realtà produttiva.

FAQ

Gemini 4 Pro è stato rilasciato?

No. In base all’ultimo catalogo e alle dichiarazioni di Google (metà/fine settembre 2026), non è stato rilasciato pubblicamente né elencato con un ID modello ufficiale.

Qual è la data di rilascio prevista per Gemini 4 Pro?

I leaker indicano ottobre 2026 (con qualche speculazione per fine settembre). Google non ha fornito una data ufficiale. Trattarla come una finestra temporale in attesa di conferma tramite catalogo API o post sul blog.

Google ha raggiunto l’RSI con Gemini 4 Pro?

Evidenze pubbliche mostrano un uso avanzato di loop agentici per il raffinamento del modello e ricerca su miglioramenti ricorsivi a livello di strategia (es., Dream-RSI). Affermazioni di RSI completo che abbia prodotto il modello non sono supportate da verifiche indipendenti.

Come si confronta con GPT-6 Astra e Claude Fable 5.1 sui benchmark?

Grafici della community trapelati affermano vantaggi su diverse suite di agenti/coding. Punteggi indipendenti ufficiali per un Gemini 4 Pro rilasciato non esistono ancora. I dati pubblici attuali favoriscono la valutazione dei modelli live (Astra e Fable 5.1) sui propri task.

Devo aspettare Gemini 4 Pro prima di costruire?

No. Rilasciare oggi con i modelli più forti disponibili (accessibili via CometAPI o API dirette), mantenere set di valutazione pronti e adottare il nuovo modello se e quando test indipendenti e interni giustificano il passaggio.

Dove posso accedere facilmente agli attuali modelli di frontiera?

Provider unificati come CometAPI offrono accesso compatibile con OpenAI a modelli della classe GPT-6 Astra, Claude Fable 5.1, gli attuali modelli Gemini e altri, con fatturazione semplificata e switching. Controllare l’elenco dei modelli live e la documentazione per gli ID e i prezzi più recenti.

Continua a imparare

Collega questo articolo alla prossima decisione.

Vedi tutti gli argomenti
Pubblicato il Sep 20, 2026
Ultimo aggiornamento Sep 20, 2026
1 visualizzazioni
Revisionato per chiarezza, attribuzione delle fonti e terminologia API aggiornata.

Pronto a ridurre i costi di sviluppo AI del 20%?

Inizia gratuitamente in pochi minuti. Crediti di prova gratuiti inclusi. Nessuna carta di credito richiesta.

Leggi di più