TL;DR
Gemini 3.6 Flash costa $1.50/M input e $7.50/M output, con prezzi di output più bassi e migliori prestazioni dichiarate su coding e agent rispetto a Gemini 3.5 Flash. In produzione, usa 3.6 Flash per ragionamento complesso e agenti, instradando i carichi semplici e ad alto volume al più economico Gemini 3.5 Flash-Lite.
Gemini 3.6 Flash è più di un semplice aggiornamento dell’ID del modello.
Per gli sviluppatori che già usano Gemini 3.5 Flash, il cambiamento più grande è economico. Google ha mantenuto il prezzo di input invariato a $1.50 per milione di token, ha ridotto il prezzo di output da $9.00 a $7.50 e riporta prestazioni migliori su diversi benchmark di coding e agentic.
La domanda pratica è se questi miglioramenti siano sufficienti a giustificare lo spostamento dei carichi di lavoro di produzione.
La risposta dipende dal carico. Agenti per il coding, analisi multimodale e uso di strumenti multi-step possono beneficiare più di semplici attività di estrazione o classificazione. La migrazione richiede anche alcuni controlli di compatibilità dell’API che è facile perdere se ci si limita a cambiare il nome del modello.
Questa guida copre il pricing dell’API di Gemini 3.6 Flash, l’accesso al free tier, i risultati dei benchmark, le modifiche di migrazione, esempi in Python e cosa testare prima di spostare il traffico di produzione.
What Is Gemini 3.6 Flash?
Gemini 3.6 Flash è il nuovo modello Flash di Google per coding, ragionamento multimodale e workflow di agenti multi-step. Rilasciato il 21 luglio 2026, è progettato per carichi di produzione che necessitano di un ragionamento più solido e prestazioni degli agenti migliori, rimanendo all’interno del tier dei modelli Flash di Google.
Le sue specifiche principali includono:
| Item | Gemini 3.6 Flash |
|---|---|
| Model ID | gemini-3.6-flash |
| Standard input price | $1.50 / 1M tokens |
| Standard output price | $7.50 / 1M tokens |
| Standard cached input | $0.15 / 1M tokens |
| Default thinking level | medium |
| Input context | 1,048,576 tokens |
| Maximum output | 65,536 tokens |
| Inputs | Testo, immagine, video, audio, PDF |
| Output | Testo |
| Best suited for | Coding, ragionamento multimodale, agenti complessi |
Google posiziona Gemini 3.6 Flash per carichi di lavoro come coding, ragionamento spaziale e multimodale e task agentici multi-step.
Il modello supporta anche funzionalità come function calling, output strutturati, esecuzione di codice, context caching, File Search, contesto da URL, grounding con Google Search e grounding con Google Maps.
Puoi consultare le specifiche più recenti e le indicazioni per la migrazione nella guida più recente ai modelli Gemini.
Per gli sviluppatori che provengono dalla generazione precedente, la guida all’API di Gemini 3.5 Flash di CometAPI offre una baseline utile per l’integrazione.
How Much Does the Gemini 3.6 Flash API Cost?
Gemini 3.6 Flash costa $1.50 per milione di token di input e $7.50 per milione di token di output sul tier a pagamento Standard di Google.
Rispetto a Gemini 3.5 Flash, il prezzo di input rimane invariato, mentre il prezzo di output scende da $9.00 a $7.50 per milione di token, una riduzione del 16,7%.
Google offre anche elaborazione Batch, Flex e Priority.
| Gemini 3.6 Flash Tier | Input / 1M | Cached Input / 1M | Output / 1M |
|---|---|---|---|
| Standard | $1.50 | $0.15 | $7.50 |
| Batch | $0.75 | $0.075 | $3.75 |
| Flex | $0.75 | $0.075 | $3.75 |
| Priority | $2.70 | $0.27 | $13.50 |
Important:** I token di thinking sono fatturati alla tariffa dei token di output. Una risposta visibile breve può quindi consumare più token di output fatturabili di quanto suggerisca la lunghezza della risposta finale.
Il context caching può fare una differenza significativa per le applicazioni che inviano ripetutamente lo stesso ampio system prompt, contesto del repository, set di documenti o cronologia della conversazione.
Sul tier Standard a pagamento, l’input in cache di Gemini 3.6 Flash costa $0.15 per milione di token, rispetto a $1.50 per l’input normale.
Example: 15,000 Input Tokens + 8,000 Output Tokens
Consideriamo un’attività che utilizza 15,000 token di input e 8,000 token di output.
| Model | Estimated Cost |
|---|---|
| Gemini 3.5 Flash | $0.0945 |
| Gemini 3.6 Flash at the same token volume | $0.0825 |
| Gemini 3.6 Flash with 17% fewer output tokens | $0.0723 |
| Gemini 3.5 Flash-Lite at the same token volume | $0.0245 |
A parità di utilizzo dei token, in questo esempio Gemini 3.6 Flash è circa il 12,7% più economico di Gemini 3.5 Flash.
Google riporta inoltre che Gemini 3.6 Flash ha utilizzato il 17% di token di output in meno su Artificial Analysis Index. Se un carico di produzione riproducesse quella riduzione, il risparmio modellato in questo esempio aumenterebbe a circa 23,5%.
Google riporta separatamente riduzioni dei token di output fino al 65% su DeepSWE. Queste cifre misurano carichi di lavoro diversi e non devono essere considerate intercambiabili: il 17% si riferisce ad Artificial Analysis Index, mentre il 65% proviene da uno specifico benchmark di coding.
Il calcolo di base del costo in token è:
Request cost =
(input tokens x input price + output tokens x output price) / 1,000,000
Per gli agenti, il costo reale è più ampio:
Total task cost =
initial model call
+ retries
+ fallback calls
+ paid tools
+ grounding or search costs
Ecco perché il modello più economico per token non è sempre il più economico per completare un’attività.
Is Gemini 3.6 Flash Free?
Sì. L’attuale pricing della Gemini Developer API di Google elenca l’accesso Free Tier per l’uso Standard di Gemini 3.6 Flash.
La disponibilità del free tier non significa capacità di produzione illimitata. I limiti API dipendono dal progetto e dal tier di utilizzo, quindi gli sviluppatori dovrebbero verificare i rate limit applicati al proprio progetto invece di fare affidamento su una cifra fissa di richieste al minuto da un articolo di terze parti.
Per la pianificazione della produzione, usa il pricing corrente della Gemini API e la documentazione sui rate limit per stimare la capacità.
Gli sviluppatori possono accedere a Gemini 3.6 Flash tramite la Gemini API e Google AI Studio. I team che utilizzano un workflow multi-modello unificato possono anche testare il modello tramite la pagina del modello Gemini 3.6 Flash su CometAPI.
How Does Gemini 3.6 Flash Compare With Gemini 3.5 Flash?
I risultati pubblicati da Google mostrano i maggiori miglioramenti in coding, esecuzione agentica, uso del computer e knowledge work.
| Benchmark | Gemini 3.6 Flash | Gemini 3.5 Flash | Change |
|---|---|---|---|
| DeepSWE | 49.00% | 37.00% | +12.0 points |
| MLE-Bench | 63.90% | 49.70% | +14.2 points |
| OSWorld-Verified | 83.00% | 78.40% | +4.6 points |
| GDPval-AA v2 | 1,421 | 1,349 | 72 |
Google afferma anche che Gemini 3.6 Flash completa i workflow multi-step con meno passaggi di ragionamento, turni conversazionali e chiamate a strumenti rispetto a Gemini 3.5 Flash.
L’azienda riporta:
- 17% di token di output in meno su Artificial Analysis Index.
- Fino al 65% di token di output in meno su DeepSWE.
- Meno modifiche di codice indesiderate e loop di esecuzione.
- Miglioramento del ragionamento multimodale e spaziale.
I risultati originali sono disponibili nell’annuncio di lancio di Gemini 3.6 Flash di Google.
Questi benchmark rendono 3.6 Flash un forte candidato alla valutazione, in particolare per carichi in cui una richiesta può trasformarsi in diversi round di ragionamento, chiamate a strumenti e correzioni.
Tuttavia, non dovrebbero sostituire i test sulla tua applicazione.
Google osserva anche che 3.6 Flash può eseguire un’ispezione programmatica più upfront prima di apportare modifiche al codice. Su un repository grande, ciò può migliorare l’accuratezza. Su una modifica di frontend a portata limitata, potrebbe semplicemente aggiungere esplorazione non necessaria.
Confini dei file chiari, criteri di accettazione e istruzioni di implementazione restano importanti.
Gemini 3.6 Flash vs Gemini 3.5 Flash-Lite: Which Should You Use?
Una volta deciso che Gemini 3.6 Flash merita un test, la domanda successiva è se ogni richiesta ne abbia davvero bisogno.
Per molti sistemi di produzione, la risposta sarà no.
Gemini 3.5 Flash-Lite è sostanzialmente più economico e può essere un default migliore per carichi prevedibili e ad alto volume.
| Item | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| Standard input price | $1.50 / 1M tokens | $0.30 / 1M tokens |
| Standard output price | $7.50 / 1M tokens | $2.50 / 1M tokens |
| Standard cached input | $0.15 / 1M tokens | $0.03 / 1M tokens |
| Default thinking level | medium | minimal |
| Best suited for | Ragionamento complesso, coding, agenti | Estrazione, routing, classificazione |
A prezzi Standard, Flash-Lite è 5× più economico sull’input e 3× più economico sull’output rispetto a Gemini 3.6 Flash.
Inizia con Gemini 3.5 Flash-Lite per:
- Classificazione
- Instradamento delle richieste
- Estrazione JSON e strutturata
- Elaborazione documenti
- Trasformazione dati
- Traduzione su larga scala
- Sottagenti leggeri
- Attività ripetibili ad alto volume
Una strategia di instradamento pratica potrebbe essere questa:
| Workload | First Route | Escalation |
|---|---|---|
| Classification or routing | Gemini 3.5 Flash-Lite | 3.6 Flash dopo un errore di validazione |
| Structured extraction | Gemini 3.5 Flash-Lite | 3.6 Flash per documenti complessi |
| Lightweight subagent | Gemini 3.5 Flash-Lite | Alza il livello di thinking o usa 3.6 Flash |
| Multi-file coding | Gemini 3.6 Flash | Fallback più forte se irrisolto |
| Complex tool workflow | Gemini 3.6 Flash | Fallback dopo errore di tool o validazione |
| Multimodal reasoning | Gemini 3.6 Flash | Fallback specifico per il task |
Per traffico di produzione misto, la metrica più utile è:
Cost per successful task =
(model calls + retries + tools + fallbacks) / accepted tasks
Una chiamata iniziale economica diventa meno attraente se fallisce ripetutamente e alla fine richiede comunque un modello più forte.
Il contrario è altrettanto importante. Ha poco senso inviare milioni di richieste di classificazione prevedibili a Gemini 3.6 Flash se Flash-Lite soddisfa già l’accuratezza richiesta.
Per le applicazioni che necessitano di questo tipo di instradamento, vedi la nostra guida su come chiamare più modelli di AI tramite una base URL compatibile con OpenAI.
What Changes When Migrating to Gemini 3.6 Flash?
Passare da Gemini 3.5 Flash a Gemini 3.6 Flash comporta più del cambio dell’ID del modello.
Gli sviluppatori dovrebbero rivedere cinque aree prima di spostare il traffico di produzione: parametri di campionamento deprecati, controlli di thinking, candidate_count, turni del modello precompilati e stato del function calling.
1. Remove temperature, top_p, and top_k
Google ha deprecato questi controlli di campionamento per Gemini 3.6 Flash e Gemini 3.5 Flash-Lite:
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40,
}
I nuovi modelli attualmente ignorano questi parametri. Google afferma che le future generazioni dei modelli Gemini potrebbero restituire un errore HTTP 400 quando vengono forniti.
Per formati di output prevedibili, usa istruzioni di sistema più chiare e output strutturati.
2. Replace thinking_budget With thinking_level
Gemini 3.6 Flash imposta di default medium thinking.
Le linee guida di migrazione di Google consigliano di passare da configurazioni numeriche thinking_budget a thinking_level.
Gemini 3.5 Flash-Lite imposta di default minimal, appropriato per molti carichi di estrazione, classificazione e instradamento ad alto volume.
Livelli di thinking più alti dovrebbero essere testati quando il task comporta ragionamento multi-step, esecuzione di codice o uso di strumenti.
3. Remove candidate_count
Google indica candidate_count come non supportato in Gemini 3.x.
Questo può essere facile da perdere quando più modelli condividono la stessa configurazione di generazione. Rimuovilo prima di migrare le richieste di produzione.
4. Stop Prefilling Model Turns
Le richieste non possono più terminare con un turno model non vuoto.
Un’applicazione più vecchia potrebbe usare un payload come:
{
"contents": [
{
"role": "user",
"parts": [{"text": "Translate 'Hello world' to Spanish."}]
},
{
"role": "model",
"parts": [{"text": "Translation:"}]
}
]
}
Questo schema ora può restituire HTTP 400.
Se in precedenza usavi il prefilling per forzare un formato di risposta, sposta il requisito in system_instruction o usa output strutturati.
5. Retest Function Calling and Multi-Turn State
Gli agenti che usano strumenti necessitano di test di migrazione separati.
Google consiglia di usare previous_interaction_id per lo stato multi-turno lato server nell’Interactions API.
Quando restituisci un risultato di funzione, preserva sia il nome della funzione sia l’ID della chiamata originale:
final_interaction = client.interactions.create(
model="gemini-3.6-flash",
previous_interaction_id=interaction.id,
tools=tools,
input=[
{
"type": "function_result",
"name": step.name,
"call_id": step.id,
"result": [
{
"type": "text",
"text": json.dumps(result),
}
],
}
],
)
Le applicazioni che usano generateContent dovrebbero anche verificare i payload FunctionResponse e monitorare gli errori di tool-call dopo la migrazione.
Consulta la guida di migrazione all’ultimo modello e la documentazione sul function calling di Google per i dettagli di implementazione aggiornati.
How Do You Call Gemini 3.6 Flash in Python?
Installa o aggiorna l’SDK GenAI di Google:
pip install -U google-genai
Imposta la tua API key:
export GEMINI_API_KEY="your-api-key"
Poi chiama Gemini 3.6 Flash:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input=(
"Review this migration plan and list the three "
"highest-risk compatibility issues."
),
)
print(interaction.output_text)
Per un task che richiede più ragionamento, configura il livello di thinking:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Analyze this multi-step debugging problem.",
generation_config={
"thinking_level": "medium",
},
)
print(interaction.output_text)
La principale differenza di migrazione può essere riassunta così:
# Older shared configuration
old_config = {
"temperature": 0.2,
"top_p": 0.9,
"top_k": 40,
"candidate_count": 1,
"thinking_budget": 4096,
}
# Gemini 3.6 Flash
new_config = {
"thinking_level": "medium",
}
Non dare per scontato che un livello di thinking più alto sia sempre migliore. Misura latenza, consumo di token e tasso di completamento sui tuoi task.
How Should You Test Gemini 3.6 Flash Before Production?
Non ti serve una grande suite di benchmark pubblici per decidere se Gemini 3.6 Flash debba entrare nel tuo stack di produzione.
Un punto di partenza migliore sono 30-50 task recenti che somiglino al tuo traffico reale.
Includi un mix di:
- Coding e debugging
- Uso di strumenti multi-step
- Documenti multimodali
- Estrazione dati
- Classificazione e instradamento
Esegui gli stessi input tramite:
- Il tuo modello di produzione attuale
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
Mantieni invariati prompt, strumenti, validator e criteri di accettazione.
Rileva:
- Token di input
- Token di output e thinking
- Latenza
- Chiamate agli strumenti
- Retry
- Errori di function-call
- Tasso di superamento dei validator
- Tempo di correzione umana
- Successo finale del task
Quindi confronta il costo totale necessario per produrre un risultato accettato.
Una richiesta di coding che costa $0.08 e riesce al primo tentativo può essere più economica di una richiesta da $0.02 che fallisce due volte e alla fine richiede escalation.
Allo stesso tempo, pagare i prezzi di Gemini 3.6 Flash per un semplice task di classificazione ha poco senso se Flash-Lite lo gestisce in modo affidabile.
L’obiettivo non è trovare un unico modello per ogni richiesta. È usare il modello più forte solo dove la sua capacità aggiuntiva cambia davvero l’esito.
Gli sviluppatori possono confrontare gli attuali percorsi Gemini 3.6 Flash e Gemini 3.5 Flash-Lite tramite CometAPI usando lo stesso set di valutazione.
FAQ
How much does the Gemini 3.6 Flash API cost?
La tariffa Standard a pagamento di Google è $1.50 per milione di token di input e $7.50 per milione di token di output. L’input in cache Standard costa $0.15/M. Batch e Flex costano $0.75/M di input e $3.75/M di output.
Is Gemini 3.6 Flash free?
Sì. L’attuale pricing della Gemini Developer API di Google elenca l’uso Standard Free Tier per Gemini 3.6 Flash. L’accesso gratuito rimane soggetto ai rate limit del progetto e del tier di utilizzo.
Is Gemini 3.6 Flash generally available?
Sì. Google ha rilasciato gemini-3.6-flash il 21 luglio 2026 e lo elenca come modello di produzione nella documentazione della Gemini API.
What is the Gemini 3.6 Flash context window?
Gemini 3.6 Flash supporta fino a 1,048,576 token di input e 65,536 token di output. Accetta input di testo, immagine, video, audio e PDF e produce output testuali.
Is Gemini 3.6 Flash cheaper than Gemini 3.5 Flash?
Sì per i token di output. Entrambi i modelli costano $1.50/M per i token di input standard, mentre Gemini 3.6 Flash riduce il prezzo di output da $9.00/M a $7.50/M.
Should I use Gemini 3.6 Flash or Gemini 3.5 Flash-Lite?
Usa Gemini 3.6 Flash quando la qualità del coding, il ragionamento multimodale o l’esecuzione di agenti complessi possono ridurre fallimenti e retry. Inizia con Flash-Lite per estrazione, classificazione, instradamento e altri carichi prevedibili ad alto volume in cui un costo inferiore conta di più.
What should I change before migrating to Gemini 3.6 Flash?
Rimuovi temperature, top_p, top_k e candidate_count; sostituisci thinking_budget con thinking_level; rimuovi i turni precompilati del modello; e ritesta function calling e gestione dello stato multi-turno.
Final Take
Gemini 3.6 Flash merita un benchmark se già usi Gemini 3.5 Flash per coding, lavoro multimodale o workflow di agenti.
Il suo prezzo di output è più basso e i risultati iniziali di Google suggeriscono che alcuni carichi potrebbero richiedere anche meno token e meno step di esecuzione. Per gli agenti che ragionano ripetutamente, chiamano strumenti e ritentano azioni fallite, questi risparmi possono contare più della differenza di prezzo a colpo d’occhio.
Ma ciò non significa che ogni richiesta debba passare a 3.6 Flash.
Gemini 3.5 Flash-Lite è sostanzialmente più economico e potrebbe essere tutto ciò di cui hai bisogno per lavoro prevedibile come estrazione, classificazione e instradamento.
La strategia di produzione migliore è usare ogni modello dove ha senso economicamente: Flash-Lite per task semplici e ad alto volume; 3.6 Flash dove un ragionamento più forte può aumentare la probabilità di concludere correttamente al primo tentativo.
Quindi misura il risultato che conta davvero: il costo totale per ottenere una risposta accettata.
Per confrontare entrambi i modelli attraverso lo stesso workflow, vedi la pagina del modello Gemini 3.6 Flash e la pagina del modello Gemini 3.5 Flash-Lite su CometAPI, o consulta i percorsi dei modelli correnti sulla pagina dei prezzi CometAPI.
