TL;DR
Gemini 3.6 Flash kost $1.50/M input en $7.50/M output, met lagere outputprijzen en betere gerapporteerde prestaties voor coderen en agents dan Gemini 3.5 Flash. Gebruik in productie 3.6 Flash voor complex redeneren en agents, en routeer eenvoudigere, grootschalige workloads naar het goedkopere Gemini 3.5 Flash-Lite.
Gemini 3.6 Flash is meer dan alleen een update van de model-ID.
Voor ontwikkelaars die al Gemini 3.5 Flash gebruiken, is de grootste verandering economisch. Google hield de inputprijs ongewijzigd op $1.50 per miljoen tokens, verlaagde de outputprijs van $9.00 naar $7.50, en rapporteert betere prestaties op verschillende codeer- en agent-benchmarks.
De praktische vraag is of die verbeteringen groot genoeg zijn om productie-workloads te migreren.
Het antwoord hangt af van de workload. Codeeragents, multimodale analyse en meerstaps toolgebruik kunnen meer profiteren dan eenvoudige extractie of classificatie. Migratie vereist ook een paar API-compatibiliteitscontroles die je gemakkelijk mist als je alleen de modelnaam wijzigt.
Deze gids behandelt Gemini 3.6 Flash API-prijzen, Free Tier-toegang, benchmarkresultaten, migratiewijzigingen, Python-voorbeelden en wat je moet testen voordat je productieverkeer overschakelt.
Wat is Gemini 3.6 Flash?
Gemini 3.6 Flash is Google’s nieuwere Flash-model voor coderen, multimodaal redeneren en meerstaps agent-workflows. Uitgebracht op 21 juli 2026, is het ontworpen voor productie-workloads die sterkere redeneer- en agentprestaties nodig hebben, terwijl het binnen Google’s Flash-modeltier blijft.
De belangrijkste specificaties zijn:
| Item | Gemini 3.6 Flash |
|---|---|
| Model ID | gemini-3.6-flash |
| Standard input price | $1.50 / 1M tokens |
| Standard output price | $7.50 / 1M tokens |
| Standard cached input | $0.15 / 1M tokens |
| Default thinking level | medium |
| Input context | 1,048,576 tokens |
| Maximum output | 65,536 tokens |
| Inputs | Tekst, afbeelding, video, audio, PDF |
| Output | Tekst |
| Best suited for | Coderen, multimodaal redeneren, complexe agents |
Google positioneert Gemini 3.6 Flash voor workloads zoals coderen, ruimtelijk en multimodaal redeneren, en meerstaps agenttaken.
Het model ondersteunt ook functies zoals functieaanroepen, gestructureerde outputs, code-uitvoering, contextcaching, File Search, URL context, Google Search grounding en Google Maps grounding.
Je kunt de nieuwste specificaties en migratierichtlijnen bekijken in Google’s laatste Gemini-modelgids.
Voor ontwikkelaars die van de vorige generatie komen, biedt de CometAPI Gemini 3.5 Flash API-gids een nuttige integratiebasislijn.
Wat kost de Gemini 3.6 Flash API?
Gemini 3.6 Flash kost $1.50 per miljoen inputtokens en $7.50 per miljoen outputtokens in Google’s Standard betaalde laag.
Vergeleken met Gemini 3.5 Flash blijft de inputprijs ongewijzigd, terwijl de outputprijs daalt van $9.00 naar $7.50 per miljoen tokens - een daling van 16,7%.
Google biedt ook Batch-, Flex- en Priority-verwerking.
| Gemini 3.6 Flash-tier | Input / 1M | Cached Input / 1M | Output / 1M |
|---|---|---|---|
| Standard | $1.50 | $0.15 | $7.50 |
| Batch | $0.75 | $0.075 | $3.75 |
| Flex | $0.75 | $0.075 | $3.75 |
| Priority | $2.70 | $0.27 | $13.50 |
Belangrijk:** Denk-tokens worden gefactureerd tegen het tarief voor output-tokens. Een kort zichtbaar antwoord kan daardoor meer factureerbare outputtokens verbruiken dan de uiteindelijke antwoordlengte doet vermoeden.
Contextcaching kan ook een wezenlijk verschil maken voor applicaties die herhaaldelijk dezelfde grote systeemprompt, repositorycontext, documentset of gespreksgeschiedenis verzenden.
In de Standard betaalde laag kost Gemini 3.6 Flash cache-input $0.15 per miljoen tokens, vergeleken met $1.50 voor normale input.
Voorbeeld: 15,000 inputtokens + 8,000 outputtokens
Beschouw een taak met 15,000 inputtokens en 8,000 outputtokens.
| Model | Geschatte kosten |
|---|---|
| Gemini 3.5 Flash | $0.0945 |
| Gemini 3.6 Flash bij hetzelfde tokenvolume | $0.0825 |
| Gemini 3.6 Flash met 17% minder outputtokens | $0.0723 |
| Gemini 3.5 Flash-Lite bij hetzelfde tokenvolume | $0.0245 |
Bij identiek tokengebruik is Gemini 3.6 Flash in dit voorbeeld ongeveer 12.7% goedkoper dan Gemini 3.5 Flash.
Google rapporteert ook dat Gemini 3.6 Flash 17% minder outputtokens gebruikte op de Artificial Analysis Index. Als een productie-workload die reductie zou reproduceren, zou de gemodelleerde besparing in dit voorbeeld oplopen tot ongeveer 23.5%.
Google rapporteert afzonderlijk outputtoken-reducties tot 65% op DeepSWE. Deze cijfers meten verschillende workloads en moeten niet als uitwisselbaar worden beschouwd: 17% verwijst naar de Artificial Analysis Index, terwijl 65% afkomstig is van een specifieke codeerbenchmark.
De basiskostenberekening per token is:
Request cost =
(input tokens x input price + output tokens x output price) / 1,000,000
Voor agents is de werkelijke kost breder:
Total task cost =
initial model call
+ retries
+ fallback calls
+ paid tools
+ grounding or search costs
Dit is waarom het goedkoopste model per token niet altijd het goedkoopste model is om een taak te voltooien.
Is Gemini 3.6 Flash gratis?
Ja. Google’s huidige Gemini Developer API-prijzen vermelden Free Tier-toegang voor Gemini 3.6 Flash Standard-gebruik.
Free Tier-beschikbaarheid betekent niet onbeperkte productiecapaciteit. API-limieten zijn afhankelijk van het project en de gebruikstier, dus ontwikkelaars moeten de verzoeklimieten controleren die op hun eigen project van toepassing zijn, in plaats van te vertrouwen op een vast aantal verzoeken per minuut uit een artikel van derden.
Voor productieplanning gebruik je Google’s huidige Gemini API-prijzen en documentatie over rate limits bij het schatten van capaciteit.
Ontwikkelaars hebben toegang tot Gemini 3.6 Flash via de Gemini API en Google AI Studio. Teams met een uniforme multi-modelworkflow kunnen het model ook testen via de CometAPI Gemini 3.6 Flash-modelpagina.
Hoe verhoudt Gemini 3.6 Flash zich tot Gemini 3.5 Flash?
Door Google gepubliceerde resultaten tonen de grootste verbeteringen in coderen, agentische uitvoering, computergebruik en kenniswerk.
| Benchmark | Gemini 3.6 Flash | Gemini 3.5 Flash | Verschil |
|---|---|---|---|
| DeepSWE | 49.00% | 37.00% | +12.0 punten |
| MLE-Bench | 63.90% | 49.70% | +14.2 punten |
| OSWorld-Verified | 83.00% | 78.40% | +4.6 punten |
| GDPval-AA v2 | 1,421 | 1,349 | 72 |
Google zegt ook dat Gemini 3.6 Flash meerstaps workflows voltooit met minder redeneerstappen, gespreksslagen en toolaanroepen dan Gemini 3.5 Flash.
Het bedrijf meldt:
- 17% minder outputtokens op de Artificial Analysis Index.
- Tot 65% minder outputtokens op DeepSWE.
- Minder ongewenste codebewerkingen en uitvoeringslussen.
- Verbeterd multimodaal en ruimtelijk redeneren.
De oorspronkelijke resultaten zijn beschikbaar in Google’s aankondiging van de lancering van Gemini 3.6 Flash.
Deze benchmarks maken 3.6 Flash een sterke kandidaat voor evaluatie, vooral voor workloads waarbij één verzoek kan uitmonden in meerdere rondes redeneren, toolaanroepen en correcties.
Ze mogen echter geen vervanging zijn voor testen op je eigen applicatie.
Google merkt ook op dat 3.6 Flash mogelijk meer voorafgaande programmatische inspectie uitvoert voordat het codewijzigingen doorvoert. Op een grote repository kan dat de nauwkeurigheid verbeteren. Bij een smal afgebakende frontendedit kan het simpelweg onnodige verkenning toevoegen.
Duidelijke bestandsgrenzen, acceptatiecriteria en implementatie-instructies blijven belangrijk.
Gemini 3.6 Flash vs Gemini 3.5 Flash-Lite: welke moet je gebruiken?
Als je hebt besloten dat Gemini 3.6 Flash het testen waard is, is de volgende vraag of elke aanvraag het daadwerkelijk nodig heeft.
Voor veel productiesystemen is het antwoord nee.
Gemini 3.5 Flash-Lite is aanzienlijk goedkoper en kan een betere standaard zijn voor voorspelbare workloads met hoog volume.
| Kenmerk | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| Standard input price | $1.50 / 1M tokens | $0.30 / 1M tokens |
| Standard output price | $7.50 / 1M tokens | $2.50 / 1M tokens |
| Standard cached input | $0.15 / 1M tokens | $0.03 / 1M tokens |
| Default thinking level | medium | minimal |
| Best suited for | Complex redeneren, coderen, agents | Extractie, routering, classificatie |
Tegen Standard-prijzen is Flash-Lite 5× goedkoper op input en 3× goedkoper op output dan Gemini 3.6 Flash.
Begin met Gemini 3.5 Flash-Lite voor:
- Classificatie
- Verzoekroutering
- JSON en gestructureerde extractie
- Documentverwerking
- Datatransformatie
- Vertaling op schaal
- Lichte subagents
- Grootschalige, herhaalbare taken
Een praktische routeringsstrategie kan er zo uitzien:
| Workload | Eerste route | Escalatie |
|---|---|---|
| Classificatie of routering | Gemini 3.5 Flash-Lite | 3.6 Flash na validatiefout |
| Gestructureerde extractie | Gemini 3.5 Flash-Lite | 3.6 Flash voor complexe documenten |
| Lichte subagent | Gemini 3.5 Flash-Lite | Denkniveau verhogen of 3.6 Flash gebruiken |
| Coderen met meerdere files | Gemini 3.6 Flash | Sterkere fallback indien onopgelost |
| Complexe toolworkflow | Gemini 3.6 Flash | Fallback na tool- of validatiefout |
| Multimodaal redeneren | Gemini 3.6 Flash | Taakspecifieke fallback |
Voor gemengd productieverkeer is de nuttigere metric:
Cost per successful task =
(model calls + retries + tools + fallbacks) / accepted tasks
Een goedkope eerste aanroep wordt minder aantrekkelijk als deze herhaaldelijk faalt en uiteindelijk toch een sterker model vereist.
Het omgekeerde is even belangrijk. Er is weinig reden om miljoenen voorspelbare classificatieverzoeken naar Gemini 3.6 Flash te sturen als Flash-Lite al de vereiste nauwkeurigheid haalt.
Voor applicaties die dit soort routering nodig hebben, zie onze gids voor het aanroepen van meerdere AI-modellen via een OpenAI-compatibele basis-URL.
Wat verandert er bij migratie naar Gemini 3.6 Flash?
Overstappen van Gemini 3.5 Flash naar Gemini 3.6 Flash is meer dan het wijzigen van de model-ID.
Ontwikkelaars moeten vijf gebieden beoordelen voordat ze productieverkeer overschakelen: afgeschafte samplingparameters, denkontrols, candidate_count, voorgevulde modelbeurten en de staat van functieaanroepen.
1. Verwijder temperature, top_p en top_k
Google heeft deze samplingcontrols afgeschaft voor Gemini 3.6 Flash en Gemini 3.5 Flash-Lite:
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40,
}
De nieuwe modellen negeren deze parameters momenteel. Google zegt dat toekomstige Gemini-modelgeneraties een HTTP 400-fout kunnen retourneren wanneer ze worden meegegeven.
Gebruik in plaats daarvan duidelijkere systeem-instructies en gestructureerde outputs voor voorspelbare outputformaten.
2. Vervang thinking_budget door thinking_level
Gemini 3.6 Flash gebruikt standaard medium denken.
Google’s migratierichtlijnen raden aan om van numerieke thinking_budget-configuraties over te stappen op thinking_level.
Gemini 3.5 Flash-Lite gebruikt standaard minimal, wat geschikt is voor veel grootschalige extractie-, classificatie- en routeringstaken.
Hogere denkniveaus moeten worden getest wanneer de taak meerstaps redeneren, code-uitvoering of toolgebruik omvat.
3. Verwijder candidate_count
Google vermeldt candidate_count als niet-ondersteund in Gemini 3.x.
Dit is gemakkelijk te missen wanneer meerdere modellen dezelfde generatieconfiguratie delen. Verwijder het voordat je productieverzoeken migreert.
4. Stop met vooraf invullen van modelbeurten
Aanvragen kunnen niet langer eindigen met een niet-lege beurt met de rol model.
Een oudere applicatie gebruikte mogelijk een payload zoals:
{
"contents": [
{
"role": "user",
"parts": [{"text": "Translate 'Hello world' to Spanish."}]
},
{
"role": "model",
"parts": [{"text": "Translation:"}]
}
]
}
Dat patroon kan nu HTTP 400 retourneren.
Als je eerder prefilling gebruikte om een antwoordformaat af te dwingen, verplaats de eis dan naar system_instruction of gebruik in plaats daarvan gestructureerde outputs.
5. Test functieaanroepen en toestand over meerdere beurten opnieuw
Agents die tools gebruiken hebben afzonderlijke migratietests nodig.
Google raadt aan previous_interaction_id te gebruiken voor server-side toestand over meerdere beurten in de Interactions API.
Wanneer je een functieresultaat retourneert, bewaar zowel de functienaam als de oorspronkelijke call-ID:
final_interaction = client.interactions.create(
model="gemini-3.6-flash",
previous_interaction_id=interaction.id,
tools=tools,
input=[
{
"type": "function_result",
"name": step.name,
"call_id": step.id,
"result": [
{
"type": "text",
"text": json.dumps(result),
}
],
}
],
)
Applicaties die generateContent gebruiken, moeten ook hun FunctionResponse-payloads verifiëren en tool-aanroepfouten monitoren na migratie.
Zie Google’s gids voor de nieuwste modellen en migratie en de documentatie over functieaanroepen voor actuele implementatiedetails.
Hoe roep je Gemini 3.6 Flash aan in Python?
Installeer of update Google’s GenAI SDK:
pip install -U google-genai
Stel je API-sleutel in:
export GEMINI_API_KEY="your-api-key"
Roep vervolgens Gemini 3.6 Flash aan:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input=(
"Review this migration plan and list the three "
"highest-risk compatibility issues."
),
)
print(interaction.output_text)
Voor een taak die meer redeneren vereist, configureer het denkniveau:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Analyze this multi-step debugging problem.",
generation_config={
"thinking_level": "medium",
},
)
print(interaction.output_text)
Het belangrijkste migratieverschil kan als volgt worden samengevat:
# Older shared configuration
old_config = {
"temperature": 0.2,
"top_p": 0.9,
"top_k": 40,
"candidate_count": 1,
"thinking_budget": 4096,
}
# Gemini 3.6 Flash
new_config = {
"thinking_level": "medium",
}
Ga er niet vanuit dat een hoger denkniveau altijd beter is. Meet latency, tokenverbruik en voltooiingsratio op je eigen taken.
Hoe test je Gemini 3.6 Flash voordat je naar productie gaat?
Je hebt geen grote openbare benchmark-suite nodig om te beslissen of Gemini 3.6 Flash in je productiestack past.
Een beter startpunt is 30-50 recente taken die lijken op je daadwerkelijke verkeer.
Neem een mix op van:
- Coderen en debuggen
- Meerstaps toolgebruik
- Multimodale documenten
- Data-extractie
- Classificatie en routering
Voer dezelfde inputs uit via:
- Je huidige productiemodel
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
Houd prompts, tools, validators en acceptatiecriteria ongewijzigd.
Volg:
- Inputtokens
- Output- en denk-tokens
- Latency
- Toolaanroepen
- Retries
- Fouten bij functieaanroepen
- Validator-slaagpercentage
- Tijd voor menselijke correctie
- Eindsucces van de taak
Vergelijk vervolgens de totale kosten die nodig zijn om een geaccepteerd resultaat te produceren.
Een codeerverzoek dat $0.08 kost en bij de eerste poging slaagt, kan goedkoper zijn dan een verzoek van $0.02 dat twee keer faalt en uiteindelijk wordt opgeschaald.
Tegelijkertijd heeft het weinig zin om prijzen van Gemini 3.6 Flash te betalen voor een eenvoudige classificatietaak als Flash-Lite deze betrouwbaar afhandelt.
Het doel is niet om één model voor elk verzoek te vinden. Het is om het sterkere model alleen daar te gebruiken waar de extra capaciteit daadwerkelijk de uitkomst verandert.
Ontwikkelaars kunnen de huidige routes Gemini 3.6 Flash en Gemini 3.5 Flash-Lite via CometAPI vergelijken met dezelfde evaluatieset.
FAQ
Wat kost de Gemini 3.6 Flash API?
Google’s Standard betaald tarief is $1.50 per miljoen inputtokens en $7.50 per miljoen outputtokens. Standaard cache-input kost $0.15/M. Batch en Flex kosten $0.75/M input en $3.75/M output.
Is Gemini 3.6 Flash gratis?
Ja. Google’s huidige Gemini Developer API-prijzen vermelden Free Tier Standard-gebruik voor Gemini 3.6 Flash. Gratis toegang is nog steeds onderhevig aan project- en gebruikstier-verzoeklimieten.
Is Gemini 3.6 Flash algemeen beschikbaar?
Ja. Google bracht gemini-3.6-flash uit op 21 juli 2026 en vermeldt het als een productiemodel in de Gemini API-documentatie.
Wat is het contextvenster van Gemini 3.6 Flash?
Gemini 3.6 Flash ondersteunt tot 1,048,576 inputtokens en 65,536 outputtokens. Het accepteert tekst-, afbeelding-, video-, audio- en PDF-inputs en produceert tekstoutput.
Is Gemini 3.6 Flash goedkoper dan Gemini 3.5 Flash?
Ja voor outputtokens. Beide modellen kosten $1.50/M standaard inputtokens, terwijl Gemini 3.6 Flash de outputprijs verlaagt van $9.00/M naar $7.50/M.
Moet ik Gemini 3.6 Flash of Gemini 3.5 Flash-Lite gebruiken?
Gebruik Gemini 3.6 Flash wanneer codeerkwaliteit, multimodaal redeneren of complexe agentuitvoering falen en retries kan verminderen. Begin met Flash-Lite voor grootschalige extractie, classificatie, routering en andere voorspelbare workloads waar een lagere kost belangrijker is.
Wat moet ik wijzigen voordat ik naar Gemini 3.6 Flash migreer?
Verwijder temperature, top_p, top_k en candidate_count; vervang thinking_budget door thinking_level; verwijder voorgevulde modelbeurten; en test functieaanroepen en toestand over meerdere beurten opnieuw.
Conclusie
Gemini 3.6 Flash is het waard om te benchmarken als je al Gemini 3.5 Flash gebruikt voor coderen, multimodaal werk of agent-workflows.
De outputprijs is lager, en Google’s vroege resultaten suggereren dat sommige workloads ook minder tokens en minder uitvoeringsstappen kunnen vereisen. Voor agents die herhaaldelijk redeneren, tools aanroepen en mislukte acties opnieuw proberen, kunnen die besparingen belangrijker zijn dan het verschil in headline-prijs.
Maar dat betekent niet dat elk verzoek moet worden verplaatst naar 3.6 Flash.
Gemini 3.5 Flash-Lite is aanzienlijk goedkoper en kan voldoende zijn voor voorspelbaar werk zoals extractie, classificatie en routering.
De betere productiestrategie is om elk model te gebruiken waar het economisch zinvol is: Flash-Lite voor eenvoudige taken met hoog volume; 3.6 Flash waar sterker redeneren de kans vergroot om in één keer correct af te ronden.
Meet vervolgens het resultaat dat er echt toe doet - de totale kosten om een geaccepteerd antwoord te krijgen.
Om beide modellen via dezelfde workflow te vergelijken, zie de Gemini 3.6 Flash-modelpagina en de Gemini 3.5 Flash-Lite-modelpagina op CometAPI, of bekijk de huidige modelroutes op de CometAPI-prijzenpagina.
