GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
ai-model/CometAPI research

Gemini 3.6 Flash API-prijzen & migratiegids (2026)

Gemini 3.6 Flash kost $1.50/M voor invoer en $7.50/M voor uitvoer. Zie API-prijzen, benchmarks, migratiewijzigingen, Python-voorbeelden en richtlijnen voor productie.

CometAPI
Mia MarenOnderzoeksteam voor AI-modellen en API
Bijgewerkt Sep 3, 2026 13 min leestijd
Gemini 3.6 Flash API-prijzen & migratiegids (2026)
Gebruik dit patroon

Doe de eerste API-aanroep.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Gemini 3.6 Flash kost $1.50/M input en $7.50/M output, met lagere outputprijzen en betere gerapporteerde prestaties voor coderen en agents dan Gemini 3.5 Flash. Gebruik in productie 3.6 Flash voor complex redeneren en agents, en routeer eenvoudigere, grootschalige workloads naar het goedkopere Gemini 3.5 Flash-Lite.

Gemini 3.6 Flash is meer dan alleen een update van de model-ID.

Voor ontwikkelaars die al Gemini 3.5 Flash gebruiken, is de grootste verandering economisch. Google hield de inputprijs ongewijzigd op $1.50 per miljoen tokens, verlaagde de outputprijs van $9.00 naar $7.50, en rapporteert betere prestaties op verschillende codeer- en agent-benchmarks.

De praktische vraag is of die verbeteringen groot genoeg zijn om productie-workloads te migreren.

Het antwoord hangt af van de workload. Codeeragents, multimodale analyse en meerstaps toolgebruik kunnen meer profiteren dan eenvoudige extractie of classificatie. Migratie vereist ook een paar API-compatibiliteitscontroles die je gemakkelijk mist als je alleen de modelnaam wijzigt.

Deze gids behandelt Gemini 3.6 Flash API-prijzen, Free Tier-toegang, benchmarkresultaten, migratiewijzigingen, Python-voorbeelden en wat je moet testen voordat je productieverkeer overschakelt.

Wat is Gemini 3.6 Flash?

Gemini 3.6 Flash is Google’s nieuwere Flash-model voor coderen, multimodaal redeneren en meerstaps agent-workflows. Uitgebracht op 21 juli 2026, is het ontworpen voor productie-workloads die sterkere redeneer- en agentprestaties nodig hebben, terwijl het binnen Google’s Flash-modeltier blijft.

De belangrijkste specificaties zijn:

ItemGemini 3.6 Flash
Model IDgemini-3.6-flash
Standard input price$1.50 / 1M tokens
Standard output price$7.50 / 1M tokens
Standard cached input$0.15 / 1M tokens
Default thinking levelmedium
Input context1,048,576 tokens
Maximum output65,536 tokens
InputsTekst, afbeelding, video, audio, PDF
OutputTekst
Best suited forCoderen, multimodaal redeneren, complexe agents

Google positioneert Gemini 3.6 Flash voor workloads zoals coderen, ruimtelijk en multimodaal redeneren, en meerstaps agenttaken.

Het model ondersteunt ook functies zoals functieaanroepen, gestructureerde outputs, code-uitvoering, contextcaching, File Search, URL context, Google Search grounding en Google Maps grounding.

Je kunt de nieuwste specificaties en migratierichtlijnen bekijken in Google’s laatste Gemini-modelgids.

Voor ontwikkelaars die van de vorige generatie komen, biedt de CometAPI Gemini 3.5 Flash API-gids een nuttige integratiebasislijn.

Wat kost de Gemini 3.6 Flash API?

Gemini 3.6 Flash kost $1.50 per miljoen inputtokens en $7.50 per miljoen outputtokens in Google’s Standard betaalde laag.

Vergeleken met Gemini 3.5 Flash blijft de inputprijs ongewijzigd, terwijl de outputprijs daalt van $9.00 naar $7.50 per miljoen tokens - een daling van 16,7%.

Google biedt ook Batch-, Flex- en Priority-verwerking.

Gemini 3.6 Flash-tierInput / 1MCached Input / 1MOutput / 1M
Standard$1.50$0.15$7.50
Batch$0.75$0.075$3.75
Flex$0.75$0.075$3.75
Priority$2.70$0.27$13.50

Belangrijk:** Denk-tokens worden gefactureerd tegen het tarief voor output-tokens. Een kort zichtbaar antwoord kan daardoor meer factureerbare outputtokens verbruiken dan de uiteindelijke antwoordlengte doet vermoeden.

Contextcaching kan ook een wezenlijk verschil maken voor applicaties die herhaaldelijk dezelfde grote systeemprompt, repositorycontext, documentset of gespreksgeschiedenis verzenden.

In de Standard betaalde laag kost Gemini 3.6 Flash cache-input $0.15 per miljoen tokens, vergeleken met $1.50 voor normale input.

Voorbeeld: 15,000 inputtokens + 8,000 outputtokens

Beschouw een taak met 15,000 inputtokens en 8,000 outputtokens.

ModelGeschatte kosten
Gemini 3.5 Flash$0.0945
Gemini 3.6 Flash bij hetzelfde tokenvolume$0.0825
Gemini 3.6 Flash met 17% minder outputtokens$0.0723
Gemini 3.5 Flash-Lite bij hetzelfde tokenvolume$0.0245

Bij identiek tokengebruik is Gemini 3.6 Flash in dit voorbeeld ongeveer 12.7% goedkoper dan Gemini 3.5 Flash.

Google rapporteert ook dat Gemini 3.6 Flash 17% minder outputtokens gebruikte op de Artificial Analysis Index. Als een productie-workload die reductie zou reproduceren, zou de gemodelleerde besparing in dit voorbeeld oplopen tot ongeveer 23.5%.

Google rapporteert afzonderlijk outputtoken-reducties tot 65% op DeepSWE. Deze cijfers meten verschillende workloads en moeten niet als uitwisselbaar worden beschouwd: 17% verwijst naar de Artificial Analysis Index, terwijl 65% afkomstig is van een specifieke codeerbenchmark.

De basiskostenberekening per token is:

Request cost =
(input tokens x input price + output tokens x output price) / 1,000,000

Voor agents is de werkelijke kost breder:

Total task cost =
initial model call
+ retries
+ fallback calls
+ paid tools
+ grounding or search costs

Dit is waarom het goedkoopste model per token niet altijd het goedkoopste model is om een taak te voltooien.

Is Gemini 3.6 Flash gratis?

Ja. Google’s huidige Gemini Developer API-prijzen vermelden Free Tier-toegang voor Gemini 3.6 Flash Standard-gebruik.

Free Tier-beschikbaarheid betekent niet onbeperkte productiecapaciteit. API-limieten zijn afhankelijk van het project en de gebruikstier, dus ontwikkelaars moeten de verzoeklimieten controleren die op hun eigen project van toepassing zijn, in plaats van te vertrouwen op een vast aantal verzoeken per minuut uit een artikel van derden.

Voor productieplanning gebruik je Google’s huidige Gemini API-prijzen en documentatie over rate limits bij het schatten van capaciteit.

Ontwikkelaars hebben toegang tot Gemini 3.6 Flash via de Gemini API en Google AI Studio. Teams met een uniforme multi-modelworkflow kunnen het model ook testen via de CometAPI Gemini 3.6 Flash-modelpagina.

Hoe verhoudt Gemini 3.6 Flash zich tot Gemini 3.5 Flash?

Door Google gepubliceerde resultaten tonen de grootste verbeteringen in coderen, agentische uitvoering, computergebruik en kenniswerk.

BenchmarkGemini 3.6 FlashGemini 3.5 FlashVerschil
DeepSWE49.00%37.00%+12.0 punten
MLE-Bench63.90%49.70%+14.2 punten
OSWorld-Verified83.00%78.40%+4.6 punten
GDPval-AA v21,4211,34972

Google zegt ook dat Gemini 3.6 Flash meerstaps workflows voltooit met minder redeneerstappen, gespreksslagen en toolaanroepen dan Gemini 3.5 Flash.

Het bedrijf meldt:

  • 17% minder outputtokens op de Artificial Analysis Index.
  • Tot 65% minder outputtokens op DeepSWE.
  • Minder ongewenste codebewerkingen en uitvoeringslussen.
  • Verbeterd multimodaal en ruimtelijk redeneren.

De oorspronkelijke resultaten zijn beschikbaar in Google’s aankondiging van de lancering van Gemini 3.6 Flash.

Deze benchmarks maken 3.6 Flash een sterke kandidaat voor evaluatie, vooral voor workloads waarbij één verzoek kan uitmonden in meerdere rondes redeneren, toolaanroepen en correcties.

Ze mogen echter geen vervanging zijn voor testen op je eigen applicatie.

Google merkt ook op dat 3.6 Flash mogelijk meer voorafgaande programmatische inspectie uitvoert voordat het codewijzigingen doorvoert. Op een grote repository kan dat de nauwkeurigheid verbeteren. Bij een smal afgebakende frontendedit kan het simpelweg onnodige verkenning toevoegen.

Duidelijke bestandsgrenzen, acceptatiecriteria en implementatie-instructies blijven belangrijk.

Gemini 3.6 Flash vs Gemini 3.5 Flash-Lite: welke moet je gebruiken?

Als je hebt besloten dat Gemini 3.6 Flash het testen waard is, is de volgende vraag of elke aanvraag het daadwerkelijk nodig heeft.

Voor veel productiesystemen is het antwoord nee.

Gemini 3.5 Flash-Lite is aanzienlijk goedkoper en kan een betere standaard zijn voor voorspelbare workloads met hoog volume.

KenmerkGemini 3.6 FlashGemini 3.5 Flash-Lite
Standard input price$1.50 / 1M tokens$0.30 / 1M tokens
Standard output price$7.50 / 1M tokens$2.50 / 1M tokens
Standard cached input$0.15 / 1M tokens$0.03 / 1M tokens
Default thinking levelmediumminimal
Best suited forComplex redeneren, coderen, agentsExtractie, routering, classificatie

Tegen Standard-prijzen is Flash-Lite 5× goedkoper op input en 3× goedkoper op output dan Gemini 3.6 Flash.

Begin met Gemini 3.5 Flash-Lite voor:

  • Classificatie
  • Verzoekroutering
  • JSON en gestructureerde extractie
  • Documentverwerking
  • Datatransformatie
  • Vertaling op schaal
  • Lichte subagents
  • Grootschalige, herhaalbare taken

Een praktische routeringsstrategie kan er zo uitzien:

WorkloadEerste routeEscalatie
Classificatie of routeringGemini 3.5 Flash-Lite3.6 Flash na validatiefout
Gestructureerde extractieGemini 3.5 Flash-Lite3.6 Flash voor complexe documenten
Lichte subagentGemini 3.5 Flash-LiteDenkniveau verhogen of 3.6 Flash gebruiken
Coderen met meerdere filesGemini 3.6 FlashSterkere fallback indien onopgelost
Complexe toolworkflowGemini 3.6 FlashFallback na tool- of validatiefout
Multimodaal redenerenGemini 3.6 FlashTaakspecifieke fallback

Voor gemengd productieverkeer is de nuttigere metric:

Cost per successful task =
(model calls + retries + tools + fallbacks) / accepted tasks

Een goedkope eerste aanroep wordt minder aantrekkelijk als deze herhaaldelijk faalt en uiteindelijk toch een sterker model vereist.

Het omgekeerde is even belangrijk. Er is weinig reden om miljoenen voorspelbare classificatieverzoeken naar Gemini 3.6 Flash te sturen als Flash-Lite al de vereiste nauwkeurigheid haalt.

Voor applicaties die dit soort routering nodig hebben, zie onze gids voor het aanroepen van meerdere AI-modellen via een OpenAI-compatibele basis-URL.

Wat verandert er bij migratie naar Gemini 3.6 Flash?

Overstappen van Gemini 3.5 Flash naar Gemini 3.6 Flash is meer dan het wijzigen van de model-ID.

Ontwikkelaars moeten vijf gebieden beoordelen voordat ze productieverkeer overschakelen: afgeschafte samplingparameters, denkontrols, candidate_count, voorgevulde modelbeurten en de staat van functieaanroepen.

1. Verwijder temperature, top_p en top_k

Google heeft deze samplingcontrols afgeschaft voor Gemini 3.6 Flash en Gemini 3.5 Flash-Lite:

generation_config = {
    "temperature": 0.7,
    "top_p": 0.9,
    "top_k": 40,
}

De nieuwe modellen negeren deze parameters momenteel. Google zegt dat toekomstige Gemini-modelgeneraties een HTTP 400-fout kunnen retourneren wanneer ze worden meegegeven.

Gebruik in plaats daarvan duidelijkere systeem-instructies en gestructureerde outputs voor voorspelbare outputformaten.

2. Vervang thinking_budget door thinking_level

Gemini 3.6 Flash gebruikt standaard medium denken.

Google’s migratierichtlijnen raden aan om van numerieke thinking_budget-configuraties over te stappen op thinking_level.

Gemini 3.5 Flash-Lite gebruikt standaard minimal, wat geschikt is voor veel grootschalige extractie-, classificatie- en routeringstaken.

Hogere denkniveaus moeten worden getest wanneer de taak meerstaps redeneren, code-uitvoering of toolgebruik omvat.

3. Verwijder candidate_count

Google vermeldt candidate_count als niet-ondersteund in Gemini 3.x.

Dit is gemakkelijk te missen wanneer meerdere modellen dezelfde generatieconfiguratie delen. Verwijder het voordat je productieverzoeken migreert.

4. Stop met vooraf invullen van modelbeurten

Aanvragen kunnen niet langer eindigen met een niet-lege beurt met de rol model.

Een oudere applicatie gebruikte mogelijk een payload zoals:

{
  "contents": [
    {
      "role": "user",
      "parts": [{"text": "Translate 'Hello world' to Spanish."}]
    },
    {
      "role": "model",
      "parts": [{"text": "Translation:"}]
    }
  ]
}

Dat patroon kan nu HTTP 400 retourneren.

Als je eerder prefilling gebruikte om een antwoordformaat af te dwingen, verplaats de eis dan naar system_instruction of gebruik in plaats daarvan gestructureerde outputs.

5. Test functieaanroepen en toestand over meerdere beurten opnieuw

Agents die tools gebruiken hebben afzonderlijke migratietests nodig.

Google raadt aan previous_interaction_id te gebruiken voor server-side toestand over meerdere beurten in de Interactions API.

Wanneer je een functieresultaat retourneert, bewaar zowel de functienaam als de oorspronkelijke call-ID:

final_interaction = client.interactions.create(
    model="gemini-3.6-flash",
    previous_interaction_id=interaction.id,
    tools=tools,
    input=[
        {
            "type": "function_result",
            "name": step.name,
            "call_id": step.id,
            "result": [
                {
                    "type": "text",
                    "text": json.dumps(result),
                }
            ],
        }
    ],
)

Applicaties die generateContent gebruiken, moeten ook hun FunctionResponse-payloads verifiëren en tool-aanroepfouten monitoren na migratie.

Zie Google’s gids voor de nieuwste modellen en migratie en de documentatie over functieaanroepen voor actuele implementatiedetails.

Hoe roep je Gemini 3.6 Flash aan in Python?

Installeer of update Google’s GenAI SDK:

pip install -U google-genai

Stel je API-sleutel in:

export GEMINI_API_KEY="your-api-key"

Roep vervolgens Gemini 3.6 Flash aan:

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input=(
        "Review this migration plan and list the three "
        "highest-risk compatibility issues."
    ),
)

print(interaction.output_text)

Voor een taak die meer redeneren vereist, configureer het denkniveau:

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input="Analyze this multi-step debugging problem.",
    generation_config={
        "thinking_level": "medium",
    },
)

print(interaction.output_text)

Het belangrijkste migratieverschil kan als volgt worden samengevat:

# Older shared configuration
old_config = {
    "temperature": 0.2,
    "top_p": 0.9,
    "top_k": 40,
    "candidate_count": 1,
    "thinking_budget": 4096,
}

# Gemini 3.6 Flash
new_config = {
    "thinking_level": "medium",
}

Ga er niet vanuit dat een hoger denkniveau altijd beter is. Meet latency, tokenverbruik en voltooiingsratio op je eigen taken.

Hoe test je Gemini 3.6 Flash voordat je naar productie gaat?

Je hebt geen grote openbare benchmark-suite nodig om te beslissen of Gemini 3.6 Flash in je productiestack past.

Een beter startpunt is 30-50 recente taken die lijken op je daadwerkelijke verkeer.

Neem een mix op van:

  1. Coderen en debuggen
  2. Meerstaps toolgebruik
  3. Multimodale documenten
  4. Data-extractie
  5. Classificatie en routering

Voer dezelfde inputs uit via:

  • Je huidige productiemodel
  • Gemini 3.6 Flash
  • Gemini 3.5 Flash-Lite

Houd prompts, tools, validators en acceptatiecriteria ongewijzigd.

Volg:

  • Inputtokens
  • Output- en denk-tokens
  • Latency
  • Toolaanroepen
  • Retries
  • Fouten bij functieaanroepen
  • Validator-slaagpercentage
  • Tijd voor menselijke correctie
  • Eindsucces van de taak

Vergelijk vervolgens de totale kosten die nodig zijn om een geaccepteerd resultaat te produceren.

Een codeerverzoek dat $0.08 kost en bij de eerste poging slaagt, kan goedkoper zijn dan een verzoek van $0.02 dat twee keer faalt en uiteindelijk wordt opgeschaald.

Tegelijkertijd heeft het weinig zin om prijzen van Gemini 3.6 Flash te betalen voor een eenvoudige classificatietaak als Flash-Lite deze betrouwbaar afhandelt.

Het doel is niet om één model voor elk verzoek te vinden. Het is om het sterkere model alleen daar te gebruiken waar de extra capaciteit daadwerkelijk de uitkomst verandert.

Ontwikkelaars kunnen de huidige routes Gemini 3.6 Flash en Gemini 3.5 Flash-Lite via CometAPI vergelijken met dezelfde evaluatieset.

FAQ

Wat kost de Gemini 3.6 Flash API?

Google’s Standard betaald tarief is $1.50 per miljoen inputtokens en $7.50 per miljoen outputtokens. Standaard cache-input kost $0.15/M. Batch en Flex kosten $0.75/M input en $3.75/M output.

Is Gemini 3.6 Flash gratis?

Ja. Google’s huidige Gemini Developer API-prijzen vermelden Free Tier Standard-gebruik voor Gemini 3.6 Flash. Gratis toegang is nog steeds onderhevig aan project- en gebruikstier-verzoeklimieten.

Is Gemini 3.6 Flash algemeen beschikbaar?

Ja. Google bracht gemini-3.6-flash uit op 21 juli 2026 en vermeldt het als een productiemodel in de Gemini API-documentatie.

Wat is het contextvenster van Gemini 3.6 Flash?

Gemini 3.6 Flash ondersteunt tot 1,048,576 inputtokens en 65,536 outputtokens. Het accepteert tekst-, afbeelding-, video-, audio- en PDF-inputs en produceert tekstoutput.

Is Gemini 3.6 Flash goedkoper dan Gemini 3.5 Flash?

Ja voor outputtokens. Beide modellen kosten $1.50/M standaard inputtokens, terwijl Gemini 3.6 Flash de outputprijs verlaagt van $9.00/M naar $7.50/M.

Moet ik Gemini 3.6 Flash of Gemini 3.5 Flash-Lite gebruiken?

Gebruik Gemini 3.6 Flash wanneer codeerkwaliteit, multimodaal redeneren of complexe agentuitvoering falen en retries kan verminderen. Begin met Flash-Lite voor grootschalige extractie, classificatie, routering en andere voorspelbare workloads waar een lagere kost belangrijker is.

Wat moet ik wijzigen voordat ik naar Gemini 3.6 Flash migreer?

Verwijder temperature, top_p, top_k en candidate_count; vervang thinking_budget door thinking_level; verwijder voorgevulde modelbeurten; en test functieaanroepen en toestand over meerdere beurten opnieuw.

Conclusie

Gemini 3.6 Flash is het waard om te benchmarken als je al Gemini 3.5 Flash gebruikt voor coderen, multimodaal werk of agent-workflows.

De outputprijs is lager, en Google’s vroege resultaten suggereren dat sommige workloads ook minder tokens en minder uitvoeringsstappen kunnen vereisen. Voor agents die herhaaldelijk redeneren, tools aanroepen en mislukte acties opnieuw proberen, kunnen die besparingen belangrijker zijn dan het verschil in headline-prijs.

Maar dat betekent niet dat elk verzoek moet worden verplaatst naar 3.6 Flash.

Gemini 3.5 Flash-Lite is aanzienlijk goedkoper en kan voldoende zijn voor voorspelbaar werk zoals extractie, classificatie en routering.

De betere productiestrategie is om elk model te gebruiken waar het economisch zinvol is: Flash-Lite voor eenvoudige taken met hoog volume; 3.6 Flash waar sterker redeneren de kans vergroot om in één keer correct af te ronden.

Meet vervolgens het resultaat dat er echt toe doet - de totale kosten om een geaccepteerd antwoord te krijgen.

Om beide modellen via dezelfde workflow te vergelijken, zie de Gemini 3.6 Flash-modelpagina en de Gemini 3.5 Flash-Lite-modelpagina op CometAPI, of bekijk de huidige modelroutes op de CometAPI-prijzenpagina.

Verder leren

Koppel dit artikel aan de volgende beslissing.

Alle onderwerpen bekijken
Gepubliceerd op Jul 22, 2026
Laatst bijgewerkt Sep 3, 2026
459 weergaven
Gecontroleerd op duidelijkheid, bronvermelding en actuele API-terminologie.

Klaar om de AI-ontwikkelingskosten met 20% te verlagen?

Start gratis in enkele minuten. Gratis proeftegoeden inbegrepen. Geen creditcard vereist.

Lees Meer