GPT-6.1 Sol are now live on CometAPI →
new/Ricerca CometAPI

Gemini 4 Argon: benchmark, funzionalità, prezzo e accesso alle API

Esplora i benchmark di Gemini 4 Argon, l'output da 1M di token, la sicurezza, il prezzo, la disponibilità e il confronto con GPT-6 Astra e Claude Opus 5.

CometAPI
AnnaTeam di ricerca su modelli AI e API
Aggiornato Oct 1, 2026 14 min di lettura
Gemini 4 Argon: benchmark, funzionalità, prezzo e accesso alle API
Usa questo schema

Esegui la prima chiamata API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR: Il 30 settembre 2026, Google DeepMind ha annunciato Gemini 4 Argon, il suo nuovo modello frontier e l’inizio della serie Gemini 4. Offre prestazioni all’avanguardia nell’ingegneria del software a lungo termine (77.9% su DeepSWE v1.1), nel lavoro di conoscenza enterprise (in testa al Vals Index con 68.9%) e nella cybersecurity difensiva. Gli aggiornamenti chiave includono un limite di output leader di settore di 1 milione di token (in aumento rispetto a 64K).

Punti chiave

  • Gemini 4 Argon è il modello più capace di Google finora, ottimizzato per flussi di lavoro complessi e a più fasi nel coding, nel lavoro di conoscenza legale/finanziaria e nella difesa cyber.
  • Argon è progettato per un ragionamento sostenuto su flussi di lavoro lunghi e a più fasi, piuttosto che per la normale chat breve. Google enfatizza l’ingegneria del software reale, il lavoro legale e finanziario, la comprensione multimodale e la difesa nella cybersecurity.
  • Google ha ampliato l’output massimo dal precedente livello di 64K token a 1 milione di token. Google non ha ancora pubblicato una specifica pubblica completa dell’API Gemini per il contesto di input di Argon, le modalità, il comportamento degli endpoint o i limiti di frequenza.
  • Nella tabella comparativa di Google, Argon ottiene 68.9% sul Vals Index, 77.9% su DeepSWE v1.1, 91.7% su LVBench e 68% su CWE-bench v1. Non guida ogni test: GPT-6 Astra vince FrontierSWE v2 e Terminal-Bench Science, mentre Claude Opus 5.5 guida Terminal-Bench 4.0 e PostTrainBench.
  • Il prezzo introduttivo dell’API di Google è di 2 $ per milione di token in input e 10 $ per milione di token in output. Dopo il periodo introduttivo, i prezzi salgono rispettivamente a 4 $ e 20 $. L’input in cache è pubblicizzato a un prezzo inferiore del 95% rispetto al prezzo per token in input applicabile.
  • Il catalogo pubblico di CometAPI ha elencato gemini-4-argon come disponibile, e non in arrivo, il 1º ottobre 2026.

Google ha riconquistato una posizione di leadership nella corsa all’AI frontier con il lancio di Gemini 4 Argon. Annunciato il 30 settembre 2026, questo modello segna l’inizio dell’era Gemini 4 ed è esplicitamente posizionato come la “prossima era dell’intelligenza frontier” di Google. Punta ai carichi di lavoro reali più difficili: coding agentico sostenuto, lavoro di conoscenza enterprise ad alto rischio (legale, finanza, fiscale) e cybersecurity difensiva.

A differenza dei precedenti aggiornamenti incrementali, Argon introduce un cambiamento fondamentale nella profondità delle capacità grazie a un output drasticamente ampliato e a un addestramento specializzato per compiti a lungo termine. Migliaia di dipendenti Google lo stanno già utilizzando internamente per il lavoro di ingegneria in produzione, mentre l’accesso esterno inizia in modo ristretto con partner di cybersecurity selezionati.

Che cos’è Gemini 4 Argon?

Gemini 4 Argon è l’ultimo modello language frontier di Google DeepMind e la prima versione della famiglia Gemini 4. È progettato specificamente per sostenere un ragionamento profondo su flussi di lavoro complessi, a più fasi e a lungo termine che i modelli precedenti faticavano a completare affidabilmente in una singola traiettoria.

Secondo Google, Argon “offre prestazioni frontier in flussi di lavoro complessi nell’ingegneria del software reale, nel lavoro di conoscenza enterprise come legale e finanza, e nella difesa della cybersecurity.” Si basa sulle lezioni dei progetti Gemini 3.5 Pro ritardati o cancellati all’inizio del 2026 e sul successivo focus sulla serie Gemini 3.8 Flash.

Il modello enfatizza capacità agentiche—pianificazione autonoma, uso di strumenti, generazione e modifica di codice, scoperta e correzione di vulnerabilità, analisi multi-documento e comprensione di video lunghi—integrando sistemi di sicurezza più solidi per potenza a livello frontier.

Internamente, Argon sta già fornendo un impatto misurabile alla scala di Google:

  • I team di calcolo quantistico lo hanno utilizzato per ottimizzare le risorse spaziotemporali (qubit × gate), superando i baseline pubblicati del 40% in pochi minuti.
  • I team di agent hanno analizzato la telemetria sull’intera fleet e hanno applicato autonomamente ottimizzazioni della memoria, liberando oltre 300 TiB di memoria nei data center (con un risparmio totale stimato tra 500 TiB e 1 PiB).
  • Sono in corso migrazioni di codice su larga scala da C/C++ a Rust, incluse decine di migliaia di righe in librerie core (re2, libgav1) e oltre 800.000 righe nel kernel Fuchsia Zircon. Un risultato degno di nota: un decoder video memory-safe (libgav1) che è 2,7× più veloce del precedente porting in Rust dopo ottimizzazione guidata da profili.

Queste implementazioni reali evidenziano che Argon non è solo un campione di benchmark ma un moltiplicatore di produttività pratico per organizzazioni ingegneristiche complesse.

Accessibilità di Gemini 4 Argon al 1º ottobre

Google sta adottando un approccio deliberatamente graduale al rilascio a causa delle capacità avanzate del modello. Attualmente è in distribuzione a un insieme di difensori cyber di fiducia attraverso il Fairwind Program (che ha arruolato oltre 650 organizzazioni, incluse grandi società di sicurezza). Google partecipa anche al processo volontario di accesso pre-rilascio del governo degli Stati Uniti. Una disponibilità più ampia per sviluppatori, imprese e consumatori—partendo dai clienti API a pagamento e dagli abbonati Google AI Ultra—è prevista “il prima possibile” dopo ulteriori iterazioni sulle barriere di sicurezza basate sui primi feedback.

Caratteristiche principali di Gemini 4 Argon

1. Ragionamento a lungo termine con fino a 1M token di output

Google afferma che l’output massimo di Argon è 1 milione di token, rispetto ai 64.000 token della generazione precedente. Si tratta di un limite massimo di generazione, non di un’indicazione che ogni risposta debba essere enorme. Dà al modello spazio per traiettorie di ragionamento lunghe, generazione di codice multi-file, ricerche dettagliate o lavoro esteso di agent senza dover forzare una nuova richiesta ogni pochi passaggi.

Gemini 4 Argon: benchmark, funzionalità, prezzo e accesso alle API

2. Ingegneria del software nel mondo reale

Il punteggio di Argon del 77.9% su DeepSWE v1.1 è il valore più alto nella tabella comparativa di Google. DeepSWE si concentra su lavoro di ingegneria del software a lungo termine, che si adatta meglio ad agent di coding autonomi rispetto ai test brevi di completamento del codice. Il modello raggiunge anche il 91.9% su Vibe Code Bench.

Il quadro non è a senso unico. GPT-6 Astra ottiene 65.5% su FrontierSWE v2 contro il 55.0% di Argon, e Claude Opus 5.5 ottiene 66.4% su Terminal-Bench 4.0 contro il 57.4% di Argon. Gli acquirenti dovrebbero quindi testare separatamente la modifica dei repository, l’uso della shell, il debugging e il lavoro di migrazione, invece di fare affidamento su un unico punteggio “di coding”.

Gemini 4 Argon: benchmark, funzionalità, prezzo e accesso alle API

3. Lavoro di conoscenza enterprise

Google riporta Argon al 68.9% sul Vals Index, che pesa finanza, coding, legale e lavoro fiscale in base al contributo al PIL degli Stati Uniti. Inoltre guida i modelli confrontati su Vals Finance Agent v2, il benchmark Legal Agent di Harvey e AutomationBench.

Queste valutazioni rendono Argon particolarmente rilevante per flussi di lavoro ricchi di ricerca: due diligence, revisione contrattuale, analisi finanziaria, ricerca fiscale e sintesi tra documenti. Non eliminano la necessità di verificare le fonti o di una revisione professionale. Un vantaggio al benchmark misura la performance sotto un particolare harness; non stabilisce l’idoneità a decisioni legali o finanziarie non supervisionate.

4. Comprensione multimodale e di video lunghi

Argon ottiene 71.6% su Chartography e 91.7% su LVBench, superando di poco GPT-6 Astra nella comprensione dei grafici e in modo più netto nella comprensione di video lunghi. Google descrive anche flussi di lavoro in cui Argon interpreta una sequenza di documenti e agisce sul risultato.

Questa combinazione è utile quando il solo testo è insufficiente: analizzare grafici sugli utili insieme a filing, estrarre evidenze da ore di video, rivedere screenshot di prodotto con requisiti scritti o riconciliare dati tra PDF e report visivi.

5. Cybersecurity difensiva

Google ha addestrato Argon a scoprire, convalidare e correggere vulnerabilità critiche. Su CWE-bench v1, Argon e GPT-6 Astra ottengono entrambi 68%, mentre Claude Opus 5.5 ottiene 67%. Google afferma che Argon supera anche Gemini 3.8 Flash Cyber nelle valutazioni interne su scoperta di vulnerabilità e penetration test black-box.

L’accesso iniziale riflette il rischio. Difensori cyber di fiducia possono usare il modello attraverso il Fairwind Program, e Google afferma che Wiz ha utilizzato Argon nella sua iniziativa Scan for Good per identificare una vulnerabilità critica che interessava software sanitari. Una distribuzione ristretta dà a Google il tempo di raccogliere evidenze prima di esporre più ampiamente capacità cyber avanzate.

6. Il tasso di allucinazione è sceso al 10%.

Gemini 4 Argon ha un tasso di allucinazione incredibilmente basso su Artificial Analysis. 15%. Arena riporta una stima di allucinazione degli strumenti pari a 0.10% +/- 0.48% per Gemini 4 Argon High, rispetto a 0.16% +/- 0.09% per Gemini 3.8 Flash High. La stima puntuale è più bassa, il che suggerisce un miglioramento. Tuttavia, gli intervalli di incertezza si sovrappongono in misura sostanziale e l’intervallo di Argon è molto più ampio.

Gemini 4 Argon: benchmark, funzionalità, prezzo e accesso alle API

Prestazioni ai benchmark di Gemini 4 Argon

Le seguenti cifre provengono dalla tabella comparativa di Google DeepMind. Google collega un documento di metodologia separato e afferma che i punteggi sono pass@1 salvo diversa indicazione. Trattali come risultati pubblicati dal fornitore e validali rispetto ai carichi di lavoro privati.

BenchmarkWorkloadGemini 4 ArgonGPT-6 AstraClaude Opus 5.5Leader
Vals IndexLavoro di conoscenza ponderato sul PIL68.9%63.1%67.0%Argon
AutomationBenchAutomazione end-to-end del business51.3%41.4%42.5%Argon
Vals Finance Agent v2Ricerca finanziaria a più fasi65.4%53.5%58.6%Argon
Harvey Legal AgentRicerca legale e redazione19.6%5.4%3.8%Argon
DeepSWE v1.1Ingegneria del software a lungo termine77.9%74.1%74.2%Argon
FrontierSWE v2Coding agentico55.0%65.5%62.3%Astra
Terminal-Bench 4.0Lavoro agentico basato su terminale57.4%58.2%66.4%Opus
Terminal-Bench Science 0.1Agenti per scienza e matematica57.6%68.1%63.3%Astra
GraphWalks, 256K-1MTraversal di grafi a lungo contesto, F184.2%71.8%66.8%Argon
Agent's Last ExamUso del computer39.5%34.2%38.2%Argon
OSWorld 2.0 offline subsetUso del computer, punteggio parziale69.2%72.6%Not reportedAstra
ChartographyComprensione dei grafici71.6%71.0%66.3%Argon
LVBenchComprensione di video lunghi91.7%87.5%83.7%Argon
CWE-bench v1Correzione di vulnerabilità68.0%68.0%67.0%Parità

Come leggere i risultati

Il vantaggio più evidente di Argon è l’ampiezza attraverso lavoro di conoscenza professionale, lungo contesto, analisi di grafici e video lunghi. Il suo risultato da legal-agent del 19.6% è più di tre volte il 5.4% di Astra, sebbene tutti e tre i punteggi assoluti mostrino che il benchmark resta difficile. Argon guida anche AutomationBench di 8.8 punti rispetto a Opus 5.5.

Il coding richiede una conclusione più sfumata. Argon guida DeepSWE e Vibe Code Bench, ma Astra guida FrontierSWE e Opus guida Terminal-Bench 4.0. Per il lavoro terminale orientato alla scienza, Astra guida Argon di 10.5 punti. Il titolo corretto non è “Argon vince ogni benchmark.” È che Argon è eccezionalmente forte nei flussi di lavoro enterprise a lungo termine mentre i concorrenti mantengono importanti vantaggi specifici per compito.

Gemini 4 Argon: benchmark, funzionalità, prezzo e accesso alle API

L’evidenza dei benchmark è forte ma non universale. GPT-6 Astra resta in vantaggio su diverse misure di scienza, coding e uso del computer, mentre Claude Opus 5.5 guida importanti test di terminal e ML-engineering. Le evidenze indipendenti sono ugualmente sfumate: Artificial Analysis classifica Argon all’8º posto su 223 modelli nella sua classe di confronto, e Arena posiziona Gemini 4 Argon High all’8º posto su 46 modelli agent ponendolo primo per pilotabilità. Il maggiore vantaggio di Argon è la combinazione di ragionamento a lungo termine, performance nei domini enterprise e profondità multimodale a un prezzo annunciato aggressivo.

Gemini 4 Argon è disponibile?

Alla data dell’annuncio (30 settembre 2026) e della copertura successiva, no—non per il pubblico generale o per gli sviluppatori standard. L’accesso è limitato a:

  • Membri fidati del Fairwind Program (difensori cyber, governi, partner di infrastrutture critiche).
  • Team interni di Google.
  • Partecipanti al processo volontario di accesso pre-rilascio del governo degli Stati Uniti.

Google afferma che espanderà “il prima possibile” dopo aver raccolto feedback e iterato sulle barriere di sicurezza, iniziando con i clienti API a pagamento e gli abbonati Google AI Ultra, quindi un accesso più ampio per sviluppatori, imprese e consumatori. Non è stata fornita una data pubblica fissa.

Prezzi dell’API di Gemini 4 Argon

Il prezzo introduttivo di Google è 2 $ per milione di token in input e 10 $ per milione di token in output. La tariffa post-introduttiva è 4 $ in input e 20 $ in output. L’input memorizzato in cache è prezzato con uno sconto del 95% rispetto alla tariffa per token in input applicabile, il che implica 0.10 $ per milione durante il periodo introduttivo e 0.20 $ successivamente se la politica è applicata esattamente come annunciato.

Il prezzo è interessante rispetto ad altri modelli frontier premium, ma il costo per token non è il costo per task completato. Un modello che genera centinaia di migliaia di token di output o effettua molte chiamate a strumenti può comunque creare un conto elevato. Imposta limiti di output, monitora i loop di strumenti e misura il costo per risultato accettato.

Come accedere all’API di Gemini 4 Argon tramite CometAPI

Una volta che Google aprirà un accesso API più ampio, le piattaforme che aggregano modelli frontier diventano il modo più rapido e spesso più conveniente per gli sviluppatori di sperimentare e andare in produzione.

CometAPI fornisce un endpoint unificato, compatibile con OpenAI, a oltre 500 modelli di OpenAI, Anthropic, Google e altri. Ciò significa che puoi passare tra modelli Gemini, varianti GPT-6 e modelli Claude cambiando solo il parametro model—senza gestire più account, sistemi di fatturazione o SDK.

Passi consigliati per prepararsi e accedere via CometAPI:

  1. Iscriviti su cometapi.com e genera una chiave API dalla dashboard (inizia con sk-).
  2. Usa la base URL https://api.cometapi.com/v1.
  3. Chiama i modelli con lo standard SDK di OpenAI o il formato nativo Gemini.

CometAPI supporta già la famiglia Gemini (incluse le precedenti versioni Pro e Flash) con prezzi competitivi, crediti di prova gratuiti e switching senza soluzione di continuità. Controlla regolarmente la pagina Models di CometAPI per la disponibilità di Gemini 4 Argon. Questo approccio evita l’attrito di onboarding su Google Cloud e consente A/B test facili contro Claude Opus 5.5 o GPT-6 Astra nello stesso codebase.

Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5

CategoriaGemini 4 ArgonGPT-6 AstraClaude Opus 5.5
FornitoreGoogleOpenAIAnthropic
Stato di rilascio al 1º ott. 2026Rollout limitato a tester fidati; accesso più ampio in arrivoModello API attivoUltimo modello attivo; rilasciato il 22 set. 2026
Best fitLavoro di conoscenza a lungo termine, analisi multimodale, cyber difensiva, grandi outputRagionamento complesso, scienza, uso del computer, ampio ecosistema di strumentiCoding agentico e lavoro di conoscenza a lunga durata
Contesto di inputNon ancora pubblicato come specifica pubblica API definitiva1,050,000 token1,000,000 token
Output massimo1,000,000 token128,000 token128,000 sincroni; 300,000 Batch beta
Input e outputCapacità multimodali dichiarate; matrice API pubblica dettagliata in attesaTesto e immagini in input; testo in outputTesto e immagini in input; testo in output
Controllo del ragionamentoRagionamento a lungo termine; controlli dell’API pubblica in attesaSforzo di ragionamento da low a maxPensiero adattivo sempre attivo; sforzo predefinito medio
Prezzo standard per 1M tokenIntro: 2 $ input / 10 $ output; poi 4 $ / 20 $10 $ input / 50 $ output4 $ input / 20 $ output
Vittorie di rilievo nella tabella di GoogleVals, AutomationBench, DeepSWE, lungo contesto, LVBenchFrontierSWE, lavoro terminale scientifico, subset OSWorldTerminal-Bench 4.0, PostTrainBench
Caveat principaleLa disponibilità API ampia e le specifiche complete sono ancora in rolloutPrezzo di listino più alto tra i treNon guida la tabella di lavoro di conoscenza di Google; il pensiero adattivo non può essere disattivato

Qual è il modello migliore?

Scegli Gemini 4 Argon quando il lavoro di conoscenza a lungo contesto, le evidenze multimodali, la cybersecurity difensiva o artefatti generati insolitamente grandi dominano il carico di lavoro. Scegli GPT-6 Astra quando serve una superficie di strumenti OpenAI matura, prestazioni forti come agent scientifico o i suoi specifici punti di forza nell’uso del computer. Scegli Claude Opus 5.5 per coding agentico nativo Claude e flussi di lavoro su terminale, soprattutto quando il suo comportamento già rende bene nel tuo harness di valutazione.

Per la maggior parte delle aziende, la strategia migliore non è una decisione permanente con un singolo modello. Instrada le richieste di routine su un modello a costo più basso, valuta Argon, Astra e Opus sui casi difficili in coda, e conserva un fallback. CometAPI è utile qui perché un solo strato di integrazione può rendere più facile il testing cross-model e l’instradamento controllato.

Conclusione

Gemini 4 Argon segna la più forte ri-entrata di Google nell’assoluto frontier, riconquistando la leadership su diversi benchmark critici per l’enterprise e a lungo termine, introducendo al contempo avanzamenti pratici come 1M token di output e prezzi introduttivi aggressivi. Il rollout graduale e orientato alla sicurezza dà priorità a una distribuzione responsabile di potenti capacità di difesa cyber.

Continua a imparare

Collega questo articolo alla prossima decisione.

Vedi tutti gli argomenti
Pubblicato il Oct 1, 2026
Ultimo aggiornamento Oct 1, 2026
0 visualizzazioni
Revisionato per chiarezza, attribuzione delle fonti e terminologia API aggiornata.

Leggi di più