TL;DR
Gemini 3.6 Flash koster $1.50/M inndata og $7.50/M utdata, med lavere utdatapris og bedre rapportert kode- og agentytelse enn Gemini 3.5 Flash. I produksjon: bruk 3.6 Flash til kompleks resonnering og agenter, og rout enklere hรธytvolums-arbeidslaster til den rimeligere Gemini 3.5 Flash-Lite.
Gemini 3.6 Flash er mer enn en ny modell-ID-oppdatering.
For utviklere som allerede bruker Gemini 3.5 Flash, er den stรธrste endringen รธkonomisk. Google holdt inndataprisen uendret pรฅ $1.50 per million tokener, senket utdataprisen fra $9.00 til $7.50, og rapporterer bedre ytelse pรฅ flere kode- og agent-benchmarker.
Det praktiske spรธrsmรฅlet er om forbedringene er store nok til รฅ rettferdiggjรธre รฅ flytte produksjonsarbeidslaster.
Svaret avhenger av arbeidslasten. Kodeagenter, multimodal analyse og flertrinns verktรธybruk kan dra mer nytte enn enkel ekstraksjon eller klassifisering. Migrering krever ogsรฅ noen API-kompatibilitetssjekker som er lette รฅ overse hvis du bare endrer modellnavnet.
Denne veiledningen dekker Gemini 3.6 Flash API-priser, gratisnivรฅtilgang, benchmarkresultater, migreringsendringer, Python-eksempler og hva du bรธr teste fรธr du flytter produksjonstrafikk.
Hva er Gemini 3.6 Flash?
Gemini 3.6 Flash er Googles nyere Flash-modell for koding, multimodal resonnering og flertrinns agent-arbeidsflyter. Lansert 21. juli 2026, er den laget for produksjonsarbeidslaster som trenger sterkere resonnerings- og agentytelse, samtidig som den forblir innenfor Googles Flash-modellnivรฅ.
Hovedspesifikasjonene inkluderer:
| Element | Gemini 3.6 Flash |
|---|---|
| Model ID | gemini-3.6-flash |
| Standard input price | $1.50 / 1M tokens |
| Standard output price | $7.50 / 1M tokens |
| Standard cached input | $0.15 / 1M tokens |
| Default thinking level | medium |
| Input context | 1,048,576 tokens |
| Maximum output | 65,536 tokens |
| Inputs | Tekst, bilde, video, lyd, PDF |
| Output | Tekst |
| Best suited for | Koding, multimodal resonnering, komplekse agenter |
Google posisjonerer Gemini 3.6 Flash for arbeidslaster som koding, romlig og multimodal resonnering, og flertrinns agentoppgaver.
Modellen stรธtter ogsรฅ funksjoner som funksjonskalling, strukturerte utdata, kodekjรธring, kontekstbufring, File Search, URL context, Google Search grounding og Google Maps grounding.
Du kan se de siste spesifikasjonene og migreringsveiledningen i Googles siste Gemini-modellguide.
For utviklere som kommer fra forrige generasjon, gir CometAPI Gemini 3.5 Flash API-veiledningen en nyttig integrasjonsreferanse.
Hvor mye koster Gemini 3.6 Flash API?
Gemini 3.6 Flash koster $1.50 per million inndata-tokener og $7.50 per million utdata-tokener pรฅ Googles Standard betalte nivรฅ.
Sammenlignet med Gemini 3.5 Flash forblir inndataprisen uendret, mens utdataprisen faller fra $9.00 til $7.50 per million tokener โ en reduksjon pรฅ 16,7 %.
Google tilbyr ogsรฅ Batch, Flex og Priority behandling.
| Gemini 3.6 Flash Tier | Input / 1M | Cached Input / 1M | Output / 1M |
|---|---|---|---|
| Standard | $1.50 | $0.15 | $7.50 |
| Batch | $0.75 | $0.075 | $3.75 |
| Flex | $0.75 | $0.075 | $3.75 |
| Priority | $2.70 | $0.27 | $13.50 |
Viktig:** Thinking-tokener faktureres til satsen for utdata-tokener. Et kort synlig svar kan derfor bruke flere fakturerbare utdata-tokener enn sluttlengden antyder.
Kontekstbufring kan ogsรฅ gjรธre en merkbar forskjell for applikasjoner som gjentatte ganger sender den samme store systemprompten, depotkonteksten, dokumentsettet eller samtalehistorikken.
Pรฅ Standard betalt nivรฅ koster Gemini 3.6 Flash bufret inndata $0.15 per million tokener, sammenlignet med $1.50 for normal inndata.
Eksempel: 15,000 inndata-tokener + 8,000 utdata-tokener
Tenk deg en oppgave som bruker 15,000 inndata-tokener og 8,000 utdata-tokener.
| Modell | Anslรฅtt kostnad |
|---|---|
| Gemini 3.5 Flash | $0.0945 |
| Gemini 3.6 Flash ved samme tokenvolum | $0.0825 |
| Gemini 3.6 Flash med 17% fรฆrre utdata-tokener | $0.0723 |
| Gemini 3.5 Flash-Lite ved samme tokenvolum | $0.0245 |
Ved identisk tokenbruk er Gemini 3.6 Flash omtrent 12,7 % billigere enn Gemini 3.5 Flash i dette eksemplet.
Google rapporterer ogsรฅ at Gemini 3.6 Flash brukte 17 % fรฆrre utdata-tokener pรฅ Artificial Analysis Index. Hvis en produksjonsarbeidslast gjentok den reduksjonen, ville den modellerte besparelsen i dette eksemplet รธke til omtrent 23,5 %.
Google rapporterer separat reduksjoner i utdata-tokener pรฅ opptil 65 % pรฅ DeepSWE. Disse tallene mรฅler ulike arbeidslaster og bรธr ikke behandles som utskiftbare: 17 % refererer til Artificial Analysis Index, mens 65 % kommer fra en spesifikk kodebenchmark.
Den grunnleggende token-kostnadsberegningen er:
Request cost =
(input tokens x input price + output tokens x output price) / 1,000,000
For agenter er den reelle kostnaden bredere:
Total task cost =
initial model call
+ retries
+ fallback calls
+ paid tools
+ grounding or search costs
Dette er grunnen til at den billigste modellen per token ikke alltid er den billigste for รฅ fullfรธre en oppgave.
Er Gemini 3.6 Flash gratis?
Ja. Googles nรฅvรฆrende Gemini Developer API-priser oppgir Free Tier-tilgang for Gemini 3.6 Flash Standard-bruk.
Gratisnivรฅ-tilgjengelighet betyr ikke ubegrenset produksjonskapasitet. API-begrensninger avhenger av prosjektet og bruksnivรฅet, sรฅ utviklere bรธr sjekke hastighetsbegrensningene som gjelder for deres eget prosjekt i stedet for รฅ stole pรฅ et fast antall forespรธrsler per minutt fra en tredjepartsartikkel.
For produksjonsplanlegging, bruk Googles gjeldende Gemini API-priser og dokumentasjon for hastighetsgrenser nรฅr du estimerer kapasitet.
Utviklere kan fรฅ tilgang til Gemini 3.6 Flash via Gemini API og Google AI Studio. Team som bruker en samlet multimodell-arbeidsflyt kan ogsรฅ teste modellen via CometAPI-siden for Gemini 3.6 Flash-modellen.
Hvordan sammenlignes Gemini 3.6 Flash med Gemini 3.5 Flash?
Googles publiserte resultater viser de stรธrste forbedringene i koding, agentutfรธrelse, datamaskinbruk og kunnskapsarbeid.
| Benchmark | Gemini 3.6 Flash | Gemini 3.5 Flash | Endring |
|---|---|---|---|
| DeepSWE | 49.00% | 37.00% | +12.0 poeng |
| MLE-Bench | 63.90% | 49.70% | +14.2 poeng |
| OSWorld-Verified | 83.00% | 78.40% | +4.6 poeng |
| GDPval-AA v2 | 1,421 | 1,349 | 72 |
Google sier ogsรฅ at Gemini 3.6 Flash fullfรธrer flertrinns arbeidsflyter med fรฆrre resonneringstrinn, fรฆrre samtalerunder og fรฆrre verktรธykall enn Gemini 3.5 Flash.
Selskapet rapporterer:
- 17 % fรฆrre utdata-tokener pรฅ Artificial Analysis Index.
- Opptil 65 % fรฆrre utdata-tokener pรฅ DeepSWE.
- Fรฆrre uรธnskede kodeendringer og kjรธringsslรธyfer.
- Forbedret multimodal og romlig resonnering.
De opprinnelige resultatene er tilgjengelige i Googles lanseringskunngjรธring for Gemini 3.6 Flash.
Disse benchmarkene gjรธr 3.6 Flash til en sterk kandidat for evaluering, spesielt for arbeidslaster der รฉn forespรธrsel kan bli til flere runder med resonnering, verktรธykall og korreksjoner.
De bรธr imidlertid ikke erstatte testing pรฅ din egen applikasjon.
Google bemerker ogsรฅ at 3.6 Flash kan utfรธre mer programmatisk inspeksjon pรฅ forhรฅnd fรธr kodeendringer. Pรฅ et stort depot kan det forbedre nรธyaktigheten. Pรฅ en snevert avgrenset frontend-endring kan det bare legge til unรธdvendig utforskning.
Tydelige filgrenser, akseptansekriterier og implementasjonsinstruksjoner er fortsatt viktige.
Gemini 3.6 Flash vs Gemini 3.5 Flash-Lite: Hvilken bรธr du bruke?
Nรฅr du har bestemt deg for at Gemini 3.6 Flash er verdt รฅ teste, er neste spรธrsmรฅl om hver forespรธrsel faktisk trenger den.
For mange produksjonssystemer er svaret nei.
Gemini 3.5 Flash-Lite er vesentlig billigere og kan vรฆre et bedre standardvalg for forutsigbare arbeidslaster med hรธyt volum.
| Element | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| Standard input price | $1.50 / 1M tokens | $0.30 / 1M tokens |
| Standard output price | $7.50 / 1M tokens | $2.50 / 1M tokens |
| Standard cached input | $0.15 / 1M tokens | $0.03 / 1M tokens |
| Default thinking level | medium | minimal |
| Best suited for | Kompleks resonnering, koding, agenter | Ekstraksjon, routing, klassifisering |
Pรฅ Standard-prising er Flash-Lite 5ร billigere pรฅ inndata og 3ร billigere pรฅ utdata enn Gemini 3.6 Flash.
Start med Gemini 3.5 Flash-Lite for:
- Klassifisering
- Forespรธrselsrouting
- JSON og strukturert ekstraksjon
- Dokumentprosessering
- Datatransformasjon
- Oversettelse i skala
- Lettere underagenter
- Hรธyt volum av repeterbare oppgaver
En praktisk routingsstrategi kan se slik ut:
| Arbeidslast | Fรธrste rute | Eskalering |
|---|---|---|
| Klassifisering eller routing | Gemini 3.5 Flash-Lite | 3.6 Flash etter valideringsfeil |
| Strukturert ekstraksjon | Gemini 3.5 Flash-Lite | 3.6 Flash for komplekse dokumenter |
| Lett underagent | Gemini 3.5 Flash-Lite | รk thinking-nivรฅ eller bruk 3.6 Flash |
| Koding pรฅ flere filer | Gemini 3.6 Flash | Sterkere fallback hvis ulรธst |
| Kompleks verktรธyflyt | Gemini 3.6 Flash | Fallback etter verktรธy- eller valideringsfeil |
| Multimodal resonnering | Gemini 3.6 Flash | Oppgavespesifikk fallback |
For blandet produksjonstrafikk er den mer nyttige metrikken:
Cost per successful task =
(model calls + retries + tools + fallbacks) / accepted tasks
Et billig fรธrste kall blir mindre attraktivt hvis det feiler gjentatte ganger og til slutt krever en sterkere modell uansett.
Det motsatte er like viktig. Det er liten grunn til รฅ sende millioner av forutsigbare klassifiseringsforespรธrsler til Gemini 3.6 Flash hvis Flash-Lite allerede mรธter den nรธdvendige nรธyaktigheten.
For applikasjoner som trenger denne typen routing, se vรฅr veiledning for รฅ kalle flere AI-modeller via en OpenAI-kompatibel base-URL.
Hva endres nรฅr du migrerer til Gemini 3.6 Flash?
ร gรฅ fra Gemini 3.5 Flash til Gemini 3.6 Flash handler om mer enn รฅ endre modell-ID.
Utviklere bรธr gjennomgรฅ fem omrรฅder fรธr de bytter produksjonstrafikk: utgรฅtte sampling-parametere, thinking-kontroller, candidate_count, forhรฅndsutfylte modell-omganger og funksjonskall-tilstand.
1. Fjern temperature, top_p og top_k
Google har avviklet disse sampling-kontrollene for Gemini 3.6 Flash og Gemini 3.5 Flash-Lite:
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40,
}
De nye modellene ignorerer for รธyeblikket disse parameterne. Google sier at fremtidige Gemini-modellgenerasjoner kan returnere en HTTP 400-feil nรฅr de oppgis.
For forutsigbare utdataformater, bruk tydeligere systeminstruksjoner og strukturerte utdata i stedet.
2. Bytt thinking_budget med thinking_level
Gemini 3.6 Flash har medium thinking som standard.
Googles migreringsveiledning anbefaler รฅ gรฅ fra numeriske thinking_budget-konfigurasjoner til thinking_level.
Gemini 3.5 Flash-Lite har minimal som standard, noe som er passende for mange hรธytvolums-arbeidslaster innen ekstraksjon, klassifisering og routing.
Hรธyere thinking-nivรฅer bรธr testes nรฅr oppgaven innebรฆrer flertrinns resonnering, kodekjรธring eller verktรธybruk.
3. Fjern candidate_count
Google oppgir candidate_count som ikke stรธttet i Gemini 3.x.
Dette kan vรฆre lett รฅ overse nรฅr flere modeller deler samme generasjonskonfigurasjon. Fjern den fรธr du migrerer produksjonsforespรธrsler.
4. Slutt รฅ forhรฅndsfylle modell-omganger
Forespรธrsler kan ikke lenger slutte med en ikke-tom model-rolleomgang.
En eldre applikasjon kan ha brukt en payload som:
{
"contents": [
{
"role": "user",
"parts": [{"text": "Translate 'Hello world' to Spanish."}]
},
{
"role": "model",
"parts": [{"text": "Translation:"}]
}
]
}
Det mรธnsteret kan nรฅ returnere HTTP 400.
Hvis du tidligere brukte forhรฅndsutfylling for รฅ tvinge et svarformat, flytt kravet inn i system_instruction eller bruk strukturerte utdata i stedet.
5. Retest funksjonskalling og fleromgangstilstand
Verktรธybrukende agenter trenger separat migreringstesting.
Google anbefaler รฅ bruke previous_interaction_id for server-side fleromgangstilstand i Interactions API.
Nรฅr du returnerer et funksjonsresultat, bevar bรฅde funksjonsnavnet og den opprinnelige kall-ID-en:
final_interaction = client.interactions.create(
model="gemini-3.6-flash",
previous_interaction_id=interaction.id,
tools=tools,
input=[
{
"type": "function_result",
"name": step.name,
"call_id": step.id,
"result": [
{
"type": "text",
"text": json.dumps(result),
}
],
}
],
)
Applikasjoner som bruker generateContent bรธr ogsรฅ verifisere sine FunctionResponse-payloads og overvรฅke verktรธykallfeil etter migrering.
Se Googles veiledning for migrering til siste modell og dokumentasjon for funksjonskalling for gjeldende implementasjonsdetaljer.
Hvordan kaller du Gemini 3.6 Flash i Python?
Installer eller oppdater Googles GenAI SDK:
pip install -U google-genai
Sett API-nรธkkelen din:
export GEMINI_API_KEY="your-api-key"
Kall deretter Gemini 3.6 Flash:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input=(
"Review this migration plan and list the three "
"highest-risk compatibility issues."
),
)
print(interaction.output_text)
For en oppgave som trenger mer resonnering, konfigurer thinking-nivรฅet:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Analyze this multi-step debugging problem.",
generation_config={
"thinking_level": "medium",
},
)
print(interaction.output_text)
Den viktigste migreringsforskjellen kan oppsummeres som:
# Older shared configuration
old_config = {
"temperature": 0.2,
"top_p": 0.9,
"top_k": 40,
"candidate_count": 1,
"thinking_budget": 4096,
}
# Gemini 3.6 Flash
new_config = {
"thinking_level": "medium",
}
Ikke anta at et hรธyere thinking-nivรฅ alltid er bedre. Mรฅl latens, tokenforbruk og fullfรธringsrate pรฅ dine egne oppgaver.
Hvordan bรธr du teste Gemini 3.6 Flash fรธr produksjon?
Du trenger ikke en stor offentlig benchmark-suite for รฅ avgjรธre om Gemini 3.6 Flash hรธrer hjemme i produksjonsstakken din.
Et bedre utgangspunkt er 30โ50 nylige oppgaver som ligner pรฅ din faktiske trafikk.
Ta med en blanding av:
- Koding og debugging
- Flertrinns verktรธybruk
- Multimodale dokumenter
- Dataekstraksjon
- Klassifisering og routing
Kjรธr de samme inndataene gjennom:
- Din nรฅvรฆrende produksjonsmodell
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
Hold prompt, verktรธy, validatorer og akseptansekriterier uendret.
Fรธlg med pรฅ:
- Inndata-tokener
- Utdata- og thinking-tokener
- Latens
- Verktรธykall
- Retries
- Feil i funksjonskall
- Validatorens bestรฅtt-rate
- Menneskelig korrigeringstid
- Endelig oppgavesuksess
Sammenlign deretter den totale kostnaden som kreves for รฅ produsere et akseptert resultat.
En kodeforespรธrsel som koster $0.08 og lykkes pรฅ fรธrste forsรธk kan vรฆre billigere enn en $0.02-forespรธrsel som feiler to ganger og til slutt eskalerer.
Samtidig gir det lite mening รฅ betale Gemini 3.6 Flash-priser for en enkel klassifiseringsoppgave hvis Flash-Lite hรฅndterer den pรฅlitelig.
Mรฅlet er ikke รฅ finne รฉn modell for hver forespรธrsel. Det er รฅ bruke den sterkere modellen bare der dens ekstra kapasitet faktisk endrer utfallet.
Utviklere kan sammenligne de nรฅvรฆrende Gemini 3.6 Flash- og Gemini 3.5 Flash-Lite-rutene via CometAPI ved hjelp av samme evalueringssett.
Vanlige spรธrsmรฅl
Hvor mye koster Gemini 3.6 Flash API?
Googles Standard betalte sats er $1.50 per million inndata-tokener og $7.50 per million utdata-tokener. Standard bufret inndata koster $0.15/M. Batch og Flex koster $0.75/M inndata og $3.75/M utdata.
Er Gemini 3.6 Flash gratis?
Ja. Googles nรฅvรฆrende Gemini Developer API-priser oppgir Free Tier Standard-bruk for Gemini 3.6 Flash. Gratis tilgang er fortsatt underlagt prosjekt- og brukernivรฅets hastighetsgrenser.
Er Gemini 3.6 Flash generelt tilgjengelig?
Ja. Google lanserte gemini-3.6-flash 21. juli 2026 og oppgir den som en produksjonsmodell i Gemini API-dokumentasjonen.
Hva er kontekstvinduet til Gemini 3.6 Flash?
Gemini 3.6 Flash stรธtter opptil 1,048,576 inndata-tokener og 65,536 utdata-tokener. Den aksepterer tekst, bilde, video, lyd og PDF som inndata og produserer tekst som utdata.
Er Gemini 3.6 Flash billigere enn Gemini 3.5 Flash?
Ja, for utdata-tokener. Begge modellene koster $1.50/M standard inndata-tokener, mens Gemini 3.6 Flash reduserer utdataprisen fra $9.00/M til $7.50/M.
Bรธr jeg bruke Gemini 3.6 Flash eller Gemini 3.5 Flash-Lite?
Bruk Gemini 3.6 Flash nรฅr kodekvalitet, multimodal resonnering eller kompleks agentutfรธrelse kan redusere feil og retries. Start med Flash-Lite for hรธytvolums ekstraksjon, klassifisering, routing og andre forutsigbare arbeidslaster der lavere kostnad betyr mer.
Hva bรธr jeg endre fรธr migrering til Gemini 3.6 Flash?
Fjern temperature, top_p, top_k og candidate_count; erstatt thinking_budget med thinking_level; fjern forhรฅndsut fylte modell-omganger; og retest funksjonskalling og fleromgangstilstand.
Konklusjon
Gemini 3.6 Flash er verdt รฅ benchmarke hvis du allerede bruker Gemini 3.5 Flash til koding, multimodalt arbeid eller agent-arbeidsflyter.
Utdataprisen er lavere, og Googles tidlige resultater tyder pรฅ at noen arbeidslaster ogsรฅ kan kreve fรฆrre tokener og fรฆrre utfรธringstrinn. For agenter som gjentatte ganger resonerer, kaller verktรธy og prรธver mislykkede handlinger pรฅ nytt, kan disse besparelsene bety mer enn prisforskjellen i overskriften.
Men det betyr ikke at hver forespรธrsel bรธr flyttes til 3.6 Flash.
Gemini 3.5 Flash-Lite er vesentlig billigere og kan vรฆre alt du trenger for forutsigbart arbeid som ekstraksjon, klassifisering og routing.
Den bedre produksjonsstrategien er รฅ bruke hver modell der det er รธkonomisk fornuftig: Flash-Lite for enkle oppgaver med hรธyt volum; 3.6 Flash der sterkere resonnering kan รธke sjansen for รฅ bli ferdig riktig pรฅ fรธrste forsรธk.
Mรฅl deretter resultatet som faktisk betyr noe โ den totale kostnaden for รฅ fรฅ et akseptert svar.
For รฅ sammenligne begge modellene gjennom samme arbeidsflyt, se siden for Gemini 3.6 Flash-modellen og siden for Gemini 3.5 Flash-Lite-modellen pรฅ CometAPI, eller se gjennom gjeldende modellruter pรฅ CometAPI-prissiden.
