TL;DR
Gemini 3.6 Flash koster $1.50/M inndata og $7.50/M utdata, med lavere utdatapris og bedre rapportert kode- og agentytelse enn Gemini 3.5 Flash. I produksjon: bruk 3.6 Flash til kompleks resonnering og agenter, og rout enklere høytvolums-arbeidslaster til den rimeligere Gemini 3.5 Flash-Lite.
Gemini 3.6 Flash er mer enn en ny modell-ID-oppdatering.
For utviklere som allerede bruker Gemini 3.5 Flash, er den største endringen økonomisk. Google holdt inndataprisen uendret på $1.50 per million tokener, senket utdataprisen fra $9.00 til $7.50, og rapporterer bedre ytelse på flere kode- og agent-benchmarker.
Det praktiske spørsmålet er om forbedringene er store nok til å rettferdiggjøre å flytte produksjonsarbeidslaster.
Svaret avhenger av arbeidslasten. Kodeagenter, multimodal analyse og flertrinns verktøybruk kan dra mer nytte enn enkel ekstraksjon eller klassifisering. Migrering krever også noen API-kompatibilitetssjekker som er lette å overse hvis du bare endrer modellnavnet.
Denne veiledningen dekker Gemini 3.6 Flash API-priser, gratisnivåtilgang, benchmarkresultater, migreringsendringer, Python-eksempler og hva du bør teste før du flytter produksjonstrafikk.
Hva er Gemini 3.6 Flash?
Gemini 3.6 Flash er Googles nyere Flash-modell for koding, multimodal resonnering og flertrinns agent-arbeidsflyter. Lansert 21. juli 2026, er den laget for produksjonsarbeidslaster som trenger sterkere resonnerings- og agentytelse, samtidig som den forblir innenfor Googles Flash-modellnivå.
Hovedspesifikasjonene inkluderer:
| Element | Gemini 3.6 Flash |
|---|---|
| Model ID | gemini-3.6-flash |
| Standard input price | $1.50 / 1M tokens |
| Standard output price | $7.50 / 1M tokens |
| Standard cached input | $0.15 / 1M tokens |
| Default thinking level | medium |
| Input context | 1,048,576 tokens |
| Maximum output | 65,536 tokens |
| Inputs | Tekst, bilde, video, lyd, PDF |
| Output | Tekst |
| Best suited for | Koding, multimodal resonnering, komplekse agenter |
Google posisjonerer Gemini 3.6 Flash for arbeidslaster som koding, romlig og multimodal resonnering, og flertrinns agentoppgaver.
Modellen støtter også funksjoner som funksjonskalling, strukturerte utdata, kodekjøring, kontekstbufring, File Search, URL context, Google Search grounding og Google Maps grounding.
Du kan se de siste spesifikasjonene og migreringsveiledningen i Googles siste Gemini-modellguide.
For utviklere som kommer fra forrige generasjon, gir CometAPI Gemini 3.5 Flash API-veiledningen en nyttig integrasjonsreferanse.
Hvor mye koster Gemini 3.6 Flash API?
Gemini 3.6 Flash koster $1.50 per million inndata-tokener og $7.50 per million utdata-tokener på Googles Standard betalte nivå.
Sammenlignet med Gemini 3.5 Flash forblir inndataprisen uendret, mens utdataprisen faller fra $9.00 til $7.50 per million tokener – en reduksjon på 16,7 %.
Google tilbyr også Batch, Flex og Priority behandling.
| Gemini 3.6 Flash Tier | Input / 1M | Cached Input / 1M | Output / 1M |
|---|---|---|---|
| Standard | $1.50 | $0.15 | $7.50 |
| Batch | $0.75 | $0.075 | $3.75 |
| Flex | $0.75 | $0.075 | $3.75 |
| Priority | $2.70 | $0.27 | $13.50 |
Viktig:** Thinking-tokener faktureres til satsen for utdata-tokener. Et kort synlig svar kan derfor bruke flere fakturerbare utdata-tokener enn sluttlengden antyder.
Kontekstbufring kan også gjøre en merkbar forskjell for applikasjoner som gjentatte ganger sender den samme store systemprompten, depotkonteksten, dokumentsettet eller samtalehistorikken.
På Standard betalt nivå koster Gemini 3.6 Flash bufret inndata $0.15 per million tokener, sammenlignet med $1.50 for normal inndata.
Eksempel: 15,000 inndata-tokener + 8,000 utdata-tokener
Tenk deg en oppgave som bruker 15,000 inndata-tokener og 8,000 utdata-tokener.
| Modell | Anslått kostnad |
|---|---|
| Gemini 3.5 Flash | $0.0945 |
| Gemini 3.6 Flash ved samme tokenvolum | $0.0825 |
| Gemini 3.6 Flash med 17% færre utdata-tokener | $0.0723 |
| Gemini 3.5 Flash-Lite ved samme tokenvolum | $0.0245 |
Ved identisk tokenbruk er Gemini 3.6 Flash omtrent 12,7 % billigere enn Gemini 3.5 Flash i dette eksemplet.
Google rapporterer også at Gemini 3.6 Flash brukte 17 % færre utdata-tokener på Artificial Analysis Index. Hvis en produksjonsarbeidslast gjentok den reduksjonen, ville den modellerte besparelsen i dette eksemplet øke til omtrent 23,5 %.
Google rapporterer separat reduksjoner i utdata-tokener på opptil 65 % på DeepSWE. Disse tallene måler ulike arbeidslaster og bør ikke behandles som utskiftbare: 17 % refererer til Artificial Analysis Index, mens 65 % kommer fra en spesifikk kodebenchmark.
Den grunnleggende token-kostnadsberegningen er:
Request cost =
(input tokens x input price + output tokens x output price) / 1,000,000
For agenter er den reelle kostnaden bredere:
Total task cost =
initial model call
+ retries
+ fallback calls
+ paid tools
+ grounding or search costs
Dette er grunnen til at den billigste modellen per token ikke alltid er den billigste for å fullføre en oppgave.
Er Gemini 3.6 Flash gratis?
Ja. Googles nåværende Gemini Developer API-priser oppgir Free Tier-tilgang for Gemini 3.6 Flash Standard-bruk.
Gratisnivå-tilgjengelighet betyr ikke ubegrenset produksjonskapasitet. API-begrensninger avhenger av prosjektet og bruksnivået, så utviklere bør sjekke hastighetsbegrensningene som gjelder for deres eget prosjekt i stedet for å stole på et fast antall forespørsler per minutt fra en tredjepartsartikkel.
For produksjonsplanlegging, bruk Googles gjeldende Gemini API-priser og dokumentasjon for hastighetsgrenser når du estimerer kapasitet.
Utviklere kan få tilgang til Gemini 3.6 Flash via Gemini API og Google AI Studio. Team som bruker en samlet multimodell-arbeidsflyt kan også teste modellen via CometAPI-siden for Gemini 3.6 Flash-modellen.
Hvordan sammenlignes Gemini 3.6 Flash med Gemini 3.5 Flash?
Googles publiserte resultater viser de største forbedringene i koding, agentutførelse, datamaskinbruk og kunnskapsarbeid.
| Benchmark | Gemini 3.6 Flash | Gemini 3.5 Flash | Endring |
|---|---|---|---|
| DeepSWE | 49.00% | 37.00% | +12.0 poeng |
| MLE-Bench | 63.90% | 49.70% | +14.2 poeng |
| OSWorld-Verified | 83.00% | 78.40% | +4.6 poeng |
| GDPval-AA v2 | 1,421 | 1,349 | 72 |
Google sier også at Gemini 3.6 Flash fullfører flertrinns arbeidsflyter med færre resonneringstrinn, færre samtalerunder og færre verktøykall enn Gemini 3.5 Flash.
Selskapet rapporterer:
- 17 % færre utdata-tokener på Artificial Analysis Index.
- Opptil 65 % færre utdata-tokener på DeepSWE.
- Færre uønskede kodeendringer og kjøringssløyfer.
- Forbedret multimodal og romlig resonnering.
De opprinnelige resultatene er tilgjengelige i Googles lanseringskunngjøring for Gemini 3.6 Flash.
Disse benchmarkene gjør 3.6 Flash til en sterk kandidat for evaluering, spesielt for arbeidslaster der én forespørsel kan bli til flere runder med resonnering, verktøykall og korreksjoner.
De bør imidlertid ikke erstatte testing på din egen applikasjon.
Google bemerker også at 3.6 Flash kan utføre mer programmatisk inspeksjon på forhånd før kodeendringer. På et stort depot kan det forbedre nøyaktigheten. På en snevert avgrenset frontend-endring kan det bare legge til unødvendig utforskning.
Tydelige filgrenser, akseptansekriterier og implementasjonsinstruksjoner er fortsatt viktige.
Gemini 3.6 Flash vs Gemini 3.5 Flash-Lite: Hvilken bør du bruke?
Når du har bestemt deg for at Gemini 3.6 Flash er verdt å teste, er neste spørsmål om hver forespørsel faktisk trenger den.
For mange produksjonssystemer er svaret nei.
Gemini 3.5 Flash-Lite er vesentlig billigere og kan være et bedre standardvalg for forutsigbare arbeidslaster med høyt volum.
| Element | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| Standard input price | $1.50 / 1M tokens | $0.30 / 1M tokens |
| Standard output price | $7.50 / 1M tokens | $2.50 / 1M tokens |
| Standard cached input | $0.15 / 1M tokens | $0.03 / 1M tokens |
| Default thinking level | medium | minimal |
| Best suited for | Kompleks resonnering, koding, agenter | Ekstraksjon, routing, klassifisering |
På Standard-prising er Flash-Lite 5× billigere på inndata og 3× billigere på utdata enn Gemini 3.6 Flash.
Start med Gemini 3.5 Flash-Lite for:
- Klassifisering
- Forespørselsrouting
- JSON og strukturert ekstraksjon
- Dokumentprosessering
- Datatransformasjon
- Oversettelse i skala
- Lettere underagenter
- Høyt volum av repeterbare oppgaver
En praktisk routingsstrategi kan se slik ut:
| Arbeidslast | Første rute | Eskalering |
|---|---|---|
| Klassifisering eller routing | Gemini 3.5 Flash-Lite | 3.6 Flash etter valideringsfeil |
| Strukturert ekstraksjon | Gemini 3.5 Flash-Lite | 3.6 Flash for komplekse dokumenter |
| Lett underagent | Gemini 3.5 Flash-Lite | Øk thinking-nivå eller bruk 3.6 Flash |
| Koding på flere filer | Gemini 3.6 Flash | Sterkere fallback hvis uløst |
| Kompleks verktøyflyt | Gemini 3.6 Flash | Fallback etter verktøy- eller valideringsfeil |
| Multimodal resonnering | Gemini 3.6 Flash | Oppgavespesifikk fallback |
For blandet produksjonstrafikk er den mer nyttige metrikken:
Cost per successful task =
(model calls + retries + tools + fallbacks) / accepted tasks
Et billig første kall blir mindre attraktivt hvis det feiler gjentatte ganger og til slutt krever en sterkere modell uansett.
Det motsatte er like viktig. Det er liten grunn til å sende millioner av forutsigbare klassifiseringsforespørsler til Gemini 3.6 Flash hvis Flash-Lite allerede møter den nødvendige nøyaktigheten.
For applikasjoner som trenger denne typen routing, se vår veiledning for å kalle flere AI-modeller via en OpenAI-kompatibel base-URL.
Hva endres når du migrerer til Gemini 3.6 Flash?
Å gå fra Gemini 3.5 Flash til Gemini 3.6 Flash handler om mer enn å endre modell-ID.
Utviklere bør gjennomgå fem områder før de bytter produksjonstrafikk: utgåtte sampling-parametere, thinking-kontroller, candidate_count, forhåndsutfylte modell-omganger og funksjonskall-tilstand.
1. Fjern temperature, top_p og top_k
Google har avviklet disse sampling-kontrollene for Gemini 3.6 Flash og Gemini 3.5 Flash-Lite:
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40,
}
De nye modellene ignorerer for øyeblikket disse parameterne. Google sier at fremtidige Gemini-modellgenerasjoner kan returnere en HTTP 400-feil når de oppgis.
For forutsigbare utdataformater, bruk tydeligere systeminstruksjoner og strukturerte utdata i stedet.
2. Bytt thinking_budget med thinking_level
Gemini 3.6 Flash har medium thinking som standard.
Googles migreringsveiledning anbefaler å gå fra numeriske thinking_budget-konfigurasjoner til thinking_level.
Gemini 3.5 Flash-Lite har minimal som standard, noe som er passende for mange høytvolums-arbeidslaster innen ekstraksjon, klassifisering og routing.
Høyere thinking-nivåer bør testes når oppgaven innebærer flertrinns resonnering, kodekjøring eller verktøybruk.
3. Fjern candidate_count
Google oppgir candidate_count som ikke støttet i Gemini 3.x.
Dette kan være lett å overse når flere modeller deler samme generasjonskonfigurasjon. Fjern den før du migrerer produksjonsforespørsler.
4. Slutt å forhåndsfylle modell-omganger
Forespørsler kan ikke lenger slutte med en ikke-tom model-rolleomgang.
En eldre applikasjon kan ha brukt en payload som:
{
"contents": [
{
"role": "user",
"parts": [{"text": "Translate 'Hello world' to Spanish."}]
},
{
"role": "model",
"parts": [{"text": "Translation:"}]
}
]
}
Det mønsteret kan nå returnere HTTP 400.
Hvis du tidligere brukte forhåndsutfylling for å tvinge et svarformat, flytt kravet inn i system_instruction eller bruk strukturerte utdata i stedet.
5. Retest funksjonskalling og fleromgangstilstand
Verktøybrukende agenter trenger separat migreringstesting.
Google anbefaler å bruke previous_interaction_id for server-side fleromgangstilstand i Interactions API.
Når du returnerer et funksjonsresultat, bevar både funksjonsnavnet og den opprinnelige kall-ID-en:
final_interaction = client.interactions.create(
model="gemini-3.6-flash",
previous_interaction_id=interaction.id,
tools=tools,
input=[
{
"type": "function_result",
"name": step.name,
"call_id": step.id,
"result": [
{
"type": "text",
"text": json.dumps(result),
}
],
}
],
)
Applikasjoner som bruker generateContent bør også verifisere sine FunctionResponse-payloads og overvåke verktøykallfeil etter migrering.
Se Googles veiledning for migrering til siste modell og dokumentasjon for funksjonskalling for gjeldende implementasjonsdetaljer.
Hvordan kaller du Gemini 3.6 Flash i Python?
Installer eller oppdater Googles GenAI SDK:
pip install -U google-genai
Sett API-nøkkelen din:
export GEMINI_API_KEY="your-api-key"
Kall deretter Gemini 3.6 Flash:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input=(
"Review this migration plan and list the three "
"highest-risk compatibility issues."
),
)
print(interaction.output_text)
For en oppgave som trenger mer resonnering, konfigurer thinking-nivået:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Analyze this multi-step debugging problem.",
generation_config={
"thinking_level": "medium",
},
)
print(interaction.output_text)
Den viktigste migreringsforskjellen kan oppsummeres som:
# Older shared configuration
old_config = {
"temperature": 0.2,
"top_p": 0.9,
"top_k": 40,
"candidate_count": 1,
"thinking_budget": 4096,
}
# Gemini 3.6 Flash
new_config = {
"thinking_level": "medium",
}
Ikke anta at et høyere thinking-nivå alltid er bedre. Mål latens, tokenforbruk og fullføringsrate på dine egne oppgaver.
Hvordan bør du teste Gemini 3.6 Flash før produksjon?
Du trenger ikke en stor offentlig benchmark-suite for å avgjøre om Gemini 3.6 Flash hører hjemme i produksjonsstakken din.
Et bedre utgangspunkt er 30–50 nylige oppgaver som ligner på din faktiske trafikk.
Ta med en blanding av:
- Koding og debugging
- Flertrinns verktøybruk
- Multimodale dokumenter
- Dataekstraksjon
- Klassifisering og routing
Kjør de samme inndataene gjennom:
- Din nåværende produksjonsmodell
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
Hold prompt, verktøy, validatorer og akseptansekriterier uendret.
Følg med på:
- Inndata-tokener
- Utdata- og thinking-tokener
- Latens
- Verktøykall
- Retries
- Feil i funksjonskall
- Validatorens bestått-rate
- Menneskelig korrigeringstid
- Endelig oppgavesuksess
Sammenlign deretter den totale kostnaden som kreves for å produsere et akseptert resultat.
En kodeforespørsel som koster $0.08 og lykkes på første forsøk kan være billigere enn en $0.02-forespørsel som feiler to ganger og til slutt eskalerer.
Samtidig gir det lite mening å betale Gemini 3.6 Flash-priser for en enkel klassifiseringsoppgave hvis Flash-Lite håndterer den pålitelig.
Målet er ikke å finne én modell for hver forespørsel. Det er å bruke den sterkere modellen bare der dens ekstra kapasitet faktisk endrer utfallet.
Utviklere kan sammenligne de nåværende Gemini 3.6 Flash- og Gemini 3.5 Flash-Lite-rutene via CometAPI ved hjelp av samme evalueringssett.
Vanlige spørsmål
Hvor mye koster Gemini 3.6 Flash API?
Googles Standard betalte sats er $1.50 per million inndata-tokener og $7.50 per million utdata-tokener. Standard bufret inndata koster $0.15/M. Batch og Flex koster $0.75/M inndata og $3.75/M utdata.
Er Gemini 3.6 Flash gratis?
Ja. Googles nåværende Gemini Developer API-priser oppgir Free Tier Standard-bruk for Gemini 3.6 Flash. Gratis tilgang er fortsatt underlagt prosjekt- og brukernivåets hastighetsgrenser.
Er Gemini 3.6 Flash generelt tilgjengelig?
Ja. Google lanserte gemini-3.6-flash 21. juli 2026 og oppgir den som en produksjonsmodell i Gemini API-dokumentasjonen.
Hva er kontekstvinduet til Gemini 3.6 Flash?
Gemini 3.6 Flash støtter opptil 1,048,576 inndata-tokener og 65,536 utdata-tokener. Den aksepterer tekst, bilde, video, lyd og PDF som inndata og produserer tekst som utdata.
Er Gemini 3.6 Flash billigere enn Gemini 3.5 Flash?
Ja, for utdata-tokener. Begge modellene koster $1.50/M standard inndata-tokener, mens Gemini 3.6 Flash reduserer utdataprisen fra $9.00/M til $7.50/M.
Bør jeg bruke Gemini 3.6 Flash eller Gemini 3.5 Flash-Lite?
Bruk Gemini 3.6 Flash når kodekvalitet, multimodal resonnering eller kompleks agentutførelse kan redusere feil og retries. Start med Flash-Lite for høytvolums ekstraksjon, klassifisering, routing og andre forutsigbare arbeidslaster der lavere kostnad betyr mer.
Hva bør jeg endre før migrering til Gemini 3.6 Flash?
Fjern temperature, top_p, top_k og candidate_count; erstatt thinking_budget med thinking_level; fjern forhåndsut fylte modell-omganger; og retest funksjonskalling og fleromgangstilstand.
Konklusjon
Gemini 3.6 Flash er verdt å benchmarke hvis du allerede bruker Gemini 3.5 Flash til koding, multimodalt arbeid eller agent-arbeidsflyter.
Utdataprisen er lavere, og Googles tidlige resultater tyder på at noen arbeidslaster også kan kreve færre tokener og færre utføringstrinn. For agenter som gjentatte ganger resonerer, kaller verktøy og prøver mislykkede handlinger på nytt, kan disse besparelsene bety mer enn prisforskjellen i overskriften.
Men det betyr ikke at hver forespørsel bør flyttes til 3.6 Flash.
Gemini 3.5 Flash-Lite er vesentlig billigere og kan være alt du trenger for forutsigbart arbeid som ekstraksjon, klassifisering og routing.
Den bedre produksjonsstrategien er å bruke hver modell der det er økonomisk fornuftig: Flash-Lite for enkle oppgaver med høyt volum; 3.6 Flash der sterkere resonnering kan øke sjansen for å bli ferdig riktig på første forsøk.
Mål deretter resultatet som faktisk betyr noe – den totale kostnaden for å få et akseptert svar.
For å sammenligne begge modellene gjennom samme arbeidsflyt, se siden for Gemini 3.6 Flash-modellen og siden for Gemini 3.5 Flash-Lite-modellen på CometAPI, eller se gjennom gjeldende modellruter på CometAPI-prissiden.
