TLDR L’ultimo rilascio di Gemini di Google non è il tanto atteso Gemini 3.5 Pro. Invece, Google ha distribuito tre modelli orientati all’efficienza: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite e Gemini 3.5 Flash Cyber. Il messaggio pratico è chiaro: Google sta dando priorità all’economia degli agenti, alla latenza, all’efficienza dei token e all’automazione della sicurezza specializzata, mentre il modello Pro di punta è ancora in fase di test.
Per gli sviluppatori, la mossa migliore non è aspettare passivamente Gemini 3.5 Pro. Usa Gemini 3.6 Flash come candidato di upgrade predefinito per agenti complessi e workflow di coding, usa Gemini 3.5 Flash-Lite per estrazione e instradamento ad alto volume e mantieni una strategia di fallback multi-modello per i compiti di ragionamento di frontiera. CometAPI fornisce accesso unificato a oltre 500 modelli tramite una sola chiave API compatibile con OpenAI, così Gemini può essere testato insieme a GPT, Claude, DeepSeek, Kimi, Qwen e altri modelli senza ricostruire l’integrazione.
Punti chiave
- Google ha annunciato Gemini 3.6 Flash, Gemini 3.5 Flash-Lite e Gemini 3.5 Flash Cyber il 21 luglio 2026. Gemini 3.5 Pro non è stato rilasciato in questo lancio. Google afferma che è in test con partner e sarà disponibile su larga scala quando pronto.
- Gemini 3.6 Flash è generalmente disponibile nella Gemini API, in Google AI Studio, nella Gemini Enterprise Agent Platform, nell’app Gemini e in Google Antigravity. Gemini 3.5 Flash-Lite è generalmente disponibile nella Gemini API e mira a workflow ad alto throughput e basso costo.
- Gemini 3.5 Flash Cyber ha accesso limitato, progettato per rilevazione, validazione e creazione di patch di vulnerabilità all’interno di CodeMender.
- Google riporta che Gemini 3.6 Flash usa il 17% di token di output in meno rispetto a 3.5 Flash in Artificial Analysis e fino al 65% in meno nei test in stile DeepSWE.
- Artificial Analysis riferisce indipendentemente Gemini 3.6 Flash con un punteggio di Intelligence Index pari a 50, 251.3 token di output/s e una riduzione del costo medio per attività da $0.59 a $0.50 rispetto a Gemini 3.5 Flash.
- DeepSWE elenca Gemini 3.6 Flash al 49% pass@1 con $3.53 di costo medio per attività, rispetto a Gemini 3.5 Flash al 37% pass@1 e $7.34 di costo medio per attività.
- CometAPI attualmente elenca Gemini 3.6 Flash a $1.20/M input e $6.00/M output, e Gemini 3.5 Flash-Lite a $0.24/M input e $2.016/M output. Controlla la dashboard live prima di pubblicare prezzi nell’interfaccia prodotto.
Cosa ha rilasciato Google?
Gemini 3.6 Flash
Gemini 3.6 Flash è il modello più importante del rilascio per gli sviluppatori generali. È un modello di fascia Flash stabile costruito per agenti di produzione, coding, workflow multimodali, analisi di documenti, ragionamento a lungo contesto e lavoro di conoscenza.
Google descrive Gemini 3.6 Flash come un cavallo di battaglia che offre prestazioni migliori in coding, lavoro di conoscenza e multimodale rispetto a Gemini 3.5 Flash, migliorando al contempo l’efficienza dei token. La pagina ufficiale della Gemini API afferma che il modello è progettato per l’era degli agenti ed è particolarmente efficace per cicli rapidi di coding e iterazione.
L’ID pubblico del modello è:
gemini-3.6-flash
Per le specifiche principali vedi la pagina del modello Gemini 3.6 Flash.
Gemini 3.5 Flash-Lite
Gemini 3.5 Flash-Lite è il modello dell’efficienza del rilascio. Google lo posiziona come il modello di classe 3.5 più veloce e conveniente, ottimizzato per esecuzione ad alto throughput, parsing di documenti, traduzione, classificazione, instradamento e semplice estrazione dati.
L’ID pubblico del modello è:
gemini-3.5-flash-lite
Per le specifiche principali vedi la pagina del modello Gemini 3.5 Flash-Lite.
La distinzione chiave non è la finestra di contesto. Flash-Lite mantiene lo stesso profilo 1M in input e 64K in output di 3.6 Flash. La differenza è l’intento di instradamento: Flash-Lite è per throughput e controllo dei costi; 3.6 Flash è per attività più difficili in cui qualità e affidabilità degli strumenti contano di più.
Gemini 3.5 Flash Cyber
Gemini 3.5 Flash Cyber è un modello di cybersecurity specializzato costruito su Gemini 3.5 Flash e ottimizzato per scoperta di vulnerabilità, validazione e generazione di patch.
Questo non è un normale modello API pubblico. Google dice che sarà disponibile per governi e partner fidati tramite CodeMender come parte di un programma pilota a accesso limitato. Questa limitazione conta per gli sviluppatori: non progettare una roadmap SaaS pubblica basata su accesso diretto a Flash Cyber a meno che tu non faccia parte di quel pilota o di un programma di sicurezza difensiva verificato.
Il modello è comunque importante perché mostra la direzione in cui Google sta portando Gemini: modelli specialistici efficienti coordinati da infrastrutture di agenti. Invece di far fare tutto a un unico modello di frontiera, Google sta costruendo sistemi più piccoli e specializzati che possono eseguire scansioni ripetute, combinare report e applicare patch al codice a costi inferiori.
Dovresti saltare Gemini 3.5 Pro?
La risposta pratica
Per la maggior parte dei team di produzione, sì: inizia a valutare Gemini 3.6 Flash e Gemini 3.5 Flash-Lite ora invece di aspettare Gemini 3.5 Pro o Gemini 4 Pro.
Questo non significa che Gemini 3.5 Pro sarà poco importante. Significa che i modelli più recenti disponibili coprono già una larga parte dei carichi di lavoro AI ad alto volume: agenti di coding, agenti di retrieval, workflow documentali, parsing multimodale, estrazione dati, instradamento dei prompt, automazione UI, revisione a lungo contesto ed esecuzione di sottocompiti dell’agente.
L’annuncio stesso di Google afferma che Gemini 3.5 Pro è ancora in test con partner e sarà rilasciato su larga scala quando pronto. Non è necessaria alcuna pagina API pubblica gemini-3.5-pro, tabella prezzi finale o scheda modello per iniziare a migliorare l’economia di produzione oggi.
Quando ha ancora senso aspettare Gemini 3.5 Pro
Dovresti comunque seguire Gemini 3.5 Pro o Gemini 4 Pro se il tuo carico di lavoro richiede più ragionamento di frontiera che throughput. Esempi includono sintesi di ricerca avanzata, ingegneria altamente complessa su più file, matematica difficile, ragionamento scientifico, analisi enterprise ad alto impatto e attività in cui un modello Flash fallisce ancora dopo un attento design di prompt e strumenti.
La strategia di modelli più solida non è “aspettare il Pro” o “sostituire tutto con Flash”. È un instradamento a livelli:
- Usa Gemini 3.5 Flash-Lite per sottocompiti a basso costo e alto volume.
- Usa Gemini 3.6 Flash per coding, analisi multimodale, revisione di documenti, sintesi a lungo contesto e workflow agentici.
- Instrada le richieste più difficili o a rischio più elevato a un modello di ragionamento di frontiera tramite CometAPI.
- Aggiungi Gemini 3.5 Pro alla suite di benchmark quando Google e CometAPI lo renderanno disponibile.
Benchmark di Gemini 3.6 Flash: cosa è migliorato?
Tabella dei benchmark di Google DeepMind
La pagina di Gemini 3.6 Flash di Google DeepMind elenca i seguenti confronti rispetto a Gemini 3.5 Flash:
| Benchmark | Cosa misura | Gemini 3.6 Flash | Gemini 3.5 Flash | Variazione |
|---|---|---|---|---|
| SWE-Bench Pro | Compiti di coding agentico diversificati | 58.7% | 55.1% | +3.6 pt |
| DeepSWE v1.1 | Ingegneria del software di lungo respiro | 49% | 37% | +12 pt |
| Terminal-Bench 2.1 | Coding da terminale agentico | 78.0% | 76.2% | +1.8 pt |
| MLE-Bench | Ingegneria di machine learning | 63.9% | 49.7% | +14.2 pt |
| GDPval-AA v2 | Elo sul lavoro di conoscenza | 1421 | 1349 | +72 Elo |
| OSWorld-Verified | Uso del computer agentico | 83.0% | 78.4% | +4.6 pt |
| CharXiv reasoning, no tools | Sintesi di grafici e informazioni | 85.2% | 84.2% | +1.0 pt |
| CharXiv reasoning, with tools | Sintesi di grafici e informazioni | 89.4% | 84.9% | +4.5 pt |
| GDM-MRCR v2, 128K average | Recupero su contesti lunghi | 91.8% | 77.3% | +14.5 pt |
| GDM-MRCR v2, 1M pointwise | Recupero su contesti lunghi | 54.0% | 26.6% | +27.4 pt |
I guadagni maggiori sono esattamente nelle aree che contano per gli agenti: coding di lungo respiro, ingegneria di machine learning, recupero a lungo contesto e uso del computer. I guadagni più piccoli in Terminal-Bench e CharXiv mostrano che non si tratta di un rilascio uniforme “raddoppiato su tutto”. È un miglioramento mirato in affidabilità, efficienza dei token ed esecuzione multi-step difficile.
Dati indipendenti da Artificial Analysis
Artificial Analysis fornisce un utile contrappeso alle tabelle di benchmark del fornitore. La sua analisi di luglio 2026 afferma che Gemini 3.6 Flash mantiene lo stesso punteggio di Intelligence Index di Gemini 3.5 Flash: 50. Questo è importante perché suggerisce che Gemini 3.6 Flash non è necessariamente un salto di “intelligenza grezza”.
Il grande miglioramento è l’efficienza:
| Metrica | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| Artificial Analysis Intelligence Index | 50 | 50 |
| Tempo medio per attività | 1.3 minuti | 2.7 minuti |
| Costo medio per attività | $0.50 | $0.59 |
| Velocità di output | 251.3 token/s | Non in questa tabella |
| Tempo al primo token | 14.00s | Non in questa tabella |
Ecco perché il miglior titolo non è “Gemini 3.6 Flash è più intelligente di tutto”. Un titolo più accurato è: Gemini 3.6 Flash rende i carichi di lavoro degli agenti più economici e veloci senza sacrificare il livello di intelligenza di Gemini 3.5 Flash.
DeepSWE: dati sul coding di lungo respiro
DeepSWE di Datacurve è particolarmente rilevante perché si concentra su attività originali di ingegneria del software di lungo respiro. La sua leaderboard descrive 113 task in 91 repository e 5 lingue.
Nella leaderboard del 21 luglio 2026:
| Modello | Pass@1 | Costo medio | Token di output | Step dell’agente |
|---|---|---|---|---|
| Gemini 3.6 Flash high | 49% ±5 | $3.53 | 97K | 108 |
| Gemini 3.5 Flash medium | 37% ±2 | $7.34 | 276K | 86 |
Il numero più interessante non è solo il guadagno di 12 punti nel pass@1. È il calo dei token di output: 97K contro 276K. Sono circa il 65% in meno di token di output, in linea con l’affermazione di lancio di Google. Per gli agenti di coding, meno token di output possono significare minore deriva, meno loop di correzione prolissi, meno inquinamento del contesto e costo inferiore per problema risolto.

Fonte: Gemini
Benchmark di Gemini 3.5 Flash-Lite: perché è importante
Flash-Lite è il modello per il throughput
Gemini 3.5 Flash-Lite è progettato per l’esecuzione ad alto volume. È il modello da testare quando il tuo sistema deve elaborare migliaia o milioni di attività piccole o medie:
- estrazione da ricevute,
- parsing di cataloghi prodotto,
- etichettatura di chunk di documenti,
- traduzione,
- classificazione,
- sintesi dei risultati di ricerca,
- riscrittura di query,
- instradamento di chiamate agli strumenti,
- attività di coding leggere,
- esecuzione di sottocompiti dell’agente,
- estrazione di dati multimodale.
Google afferma che Flash-Lite raggiunge 350 token di output al secondo secondo Artificial Analysis ed è prezzato a $0.30/M token in input e $2.50/M token in output sul livello standard della Gemini API.
Confronto tra Flash-Lite e Gemini 3.1 Flash-Lite
La scheda modello di Google DeepMind mostra grandi progressi rispetto a Gemini 3.1 Flash-Lite:
| Benchmark | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite | Variazione |
|---|---|---|---|
| SWE-Bench Pro | 54.2% | 38.3% | +15.9 pt |
| Terminal-Bench 2.1 | 54.0% | 31.0% | +23.0 pt |
| MLE-Bench | 39.2% | 22.0% | +17.2 pt |
| GDPval-AA v2 | 1140 | 642 | +498 Elo |
| OSWorld-Verified | 74.0% | 54.3% | +19.7 pt |
| CharXiv, no tools | 74.5% | 73.2% | +1.3 pt |
| CharXiv, with tools | 76.5% | 75.6% | +0.9 pt |
| GDM-MRCR v2, 128K average | 72.2% | 60.1% | +12.1 pt |
| GDM-MRCR v2, 1M pointwise | 21.3% | 12.3% | +9.0 pt |
Artificial Analysis riporta anche un salto dell’Intelligence Index da 25 per Gemini 3.1 Flash-Lite a 36 per Gemini 3.5 Flash-Lite, mentre il tempo per attività scende da 1.0 minuto a 0.6 minuti. Il compromesso è che il costo per attività è aumentato da $0.04 a $0.09 in quel set di benchmark perché il nuovo modello ha un prezzo più alto di 3.1 Flash-Lite.

Fonte: Gemini
Quel compromesso è accettabile se la qualità migliorata riduce i retry a valle, la revisione umana o l’escalation a un modello più costoso. È meno attraente se il tuo carico di lavoro è già risolto perfettamente da Gemini 3.1 Flash-Lite. Testa prima di migrare tutto il traffico.
Il significato della release di Gemini
Conferma il passaggio da “modello più grande” a “miglior cavallo di battaglia”
Il mercato dell’AI spesso si concentra sui modelli di punta di frontiera. Gemini 3.6 Flash indica una direzione diversa: i sistemi AI di produzione hanno bisogno di modelli affidabili, veloci ed economici che possano completare molti compiti reali senza sprechi.
Ecco perché il rilascio enfatizza l’efficienza dei token, meno chiamate agli strumenti, latenza inferiore e meno loop di revisione. Per gli sviluppatori, queste non sono metriche secondarie. Determinano se un agente AI può funzionare su scala senza sorprendere il team finance.
Offre a Google un modello di produzione più solido mentre Gemini 3.5 Pro attende
Gemini 3.5 Pro è ancora in test con partner. Invece di aspettare il Pro, Google ha rilasciato un modello Flash più forte e un modello Flash-Lite più economico. Questo dà agli sviluppatori due opzioni immediate:
- Gemini 3.6 Flash per un’intelligenza da cavallo di battaglia più forte.
- Gemini 3.5 Flash-Lite per esecuzione economica e veloce ad alto volume.
È una strategia di prodotto pratica. Molte aziende non hanno bisogno del modello più costoso per ogni richiesta. Hanno bisogno di un portafoglio di modelli e di logiche di instradamento.
Rende l’instradamento dei modelli più importante
Gemini 3.6 Flash non dovrebbe essere usato ovunque. Nemmeno Flash-Lite. I migliori sistemi AI del 2026 instraderanno dinamicamente:
- Partire economici quando il compito è semplice.
- Usare Gemini 3.6 Flash quando contano ragionamento, comprensione multimodale o uso degli strumenti.
- Escalare solo quando una richiesta fallisce le soglie di confidenza.
- Mettere in cache i contesti lunghi ripetuti.
- Monitorare il costo per attività completata con successo, non solo il costo per token.
FAQs
Gemini 3.5 Pro è disponibile ora?
Non come modello Gemini API pubblico generalmente disponibile al momento della stesura, a luglio 2026. Google afferma che Gemini 3.5 Pro è in test con partner e sarà rilasciato su larga scala quando pronto.
Gemini 3.6 Flash è migliore di Gemini 3.5 Flash?
Per molti workflow di agenti di produzione e coding, sì. Google riporta risultati di benchmark migliori e un uso di token di output inferiore. Artificial Analysis riporta una qualità simile in termini di Intelligence Index ma tempi per attività e costi per attività inferiori.
Per cosa è migliore Gemini 3.5 Flash-Lite?
Gemini 3.5 Flash-Lite è ideale per carichi di lavoro ad alto volume, sensibili alla latenza e ai costi, come estrazione, classificazione, traduzione, ricerca, instradamento e esecuzione di sottoagenti.
Posso usare Gemini 3.5 Flash Cyber tramite la Gemini API pubblica?
Google descrive Gemini 3.5 Flash Cyber come un modello a accesso limitato disponibile per governi e partner fidati tramite CodeMender. Non è posizionato come modello API pubblico standard.
Quanto costa Gemini 3.6 Flash?
Il listino standard della Gemini API di Google indica Gemini 3.6 Flash a $1.50 per 1M token in input e $7.50 per 1M token in output. CometAPI attualmente lo elenca a $1.20/M in input e $6.00/M in output. Verifica sempre i prezzi live prima del rollout in produzione.
Quanto costa Gemini 3.5 Flash-Lite?
Il listino standard della Gemini API di Google indica Gemini 3.5 Flash-Lite a $0.30 per 1M token in input e $2.50 per 1M token in output. CometAPI attualmente lo elenca a $0.24/M in input e $2.016/M in output. Verifica sempre i prezzi live prima del rollout in produzione.
Gli sviluppatori dovrebbero aspettare Gemini 3.5 Pro?
La maggior parte dei team non dovrebbe aspettare. Inizia a testare subito Gemini 3.6 Flash per workflow complessi e Gemini 3.5 Flash-Lite per sottocompiti ad alto volume. Aggiungi Gemini 3.5 Pro alla suite di benchmark quando saranno confermati specifiche pubbliche, prezzi e disponibilità.
Verdetto finale
Il rilascio di Gemini di luglio 2026 va inteso come un rilascio sull’efficienza, non un rilascio “flagship-Pro”. Gemini 3.6 Flash non elimina la necessità di un futuro Gemini 3.5 Pro, ma offre agli sviluppatori qualcosa di immediatamente utile: un modello generalmente disponibile con prestazioni solide in coding, multimodale, lungo contesto e agentico a un costo di token di output inferiore rispetto a Gemini 3.5 Flash.
Gemini 3.5 Flash-Lite copre l’altra metà dello stack di produzione. È il modello economico e veloce per sottocompiti che non richiedono la massima profondità di ragionamento. Gemini 3.5 Flash Cyber indica un futuro di agenti specializzati per la sicurezza difensiva, ma il suo accesso limitato lo rende oggi più rilevante come segnale strategico che come strumento generale per sviluppatori.
