Gemini 3.6 Flash and 3.5 Flash Lite are now live on CometAPI โ†’

Gemini 3.6 Flash API-priser & migreringsveiledning (2026)

CometAPI
Mia MarenJul 22, 2026
Gemini 3.6 Flash API-priser & migreringsveiledning (2026)

TL;DR

Gemini 3.6 Flash koster $1.50/M inndata og $7.50/M utdata, med lavere utdatapris og bedre rapportert kode- og agentytelse enn Gemini 3.5 Flash. I produksjon: bruk 3.6 Flash til kompleks resonnering og agenter, og rout enklere hรธytvolums-arbeidslaster til den rimeligere Gemini 3.5 Flash-Lite.

Gemini 3.6 Flash er mer enn en ny modell-ID-oppdatering.

For utviklere som allerede bruker Gemini 3.5 Flash, er den stรธrste endringen รธkonomisk. Google holdt inndataprisen uendret pรฅ $1.50 per million tokener, senket utdataprisen fra $9.00 til $7.50, og rapporterer bedre ytelse pรฅ flere kode- og agent-benchmarker.

Det praktiske spรธrsmรฅlet er om forbedringene er store nok til รฅ rettferdiggjรธre รฅ flytte produksjonsarbeidslaster.

Svaret avhenger av arbeidslasten. Kodeagenter, multimodal analyse og flertrinns verktรธybruk kan dra mer nytte enn enkel ekstraksjon eller klassifisering. Migrering krever ogsรฅ noen API-kompatibilitetssjekker som er lette รฅ overse hvis du bare endrer modellnavnet.

Denne veiledningen dekker Gemini 3.6 Flash API-priser, gratisnivรฅtilgang, benchmarkresultater, migreringsendringer, Python-eksempler og hva du bรธr teste fรธr du flytter produksjonstrafikk.

Hva er Gemini 3.6 Flash?

Gemini 3.6 Flash er Googles nyere Flash-modell for koding, multimodal resonnering og flertrinns agent-arbeidsflyter. Lansert 21. juli 2026, er den laget for produksjonsarbeidslaster som trenger sterkere resonnerings- og agentytelse, samtidig som den forblir innenfor Googles Flash-modellnivรฅ.

Hovedspesifikasjonene inkluderer:

ElementGemini 3.6 Flash
Model IDgemini-3.6-flash
Standard input price$1.50 / 1M tokens
Standard output price$7.50 / 1M tokens
Standard cached input$0.15 / 1M tokens
Default thinking levelmedium
Input context1,048,576 tokens
Maximum output65,536 tokens
InputsTekst, bilde, video, lyd, PDF
OutputTekst
Best suited forKoding, multimodal resonnering, komplekse agenter

Google posisjonerer Gemini 3.6 Flash for arbeidslaster som koding, romlig og multimodal resonnering, og flertrinns agentoppgaver.

Modellen stรธtter ogsรฅ funksjoner som funksjonskalling, strukturerte utdata, kodekjรธring, kontekstbufring, File Search, URL context, Google Search grounding og Google Maps grounding.

Du kan se de siste spesifikasjonene og migreringsveiledningen i Googles siste Gemini-modellguide.

For utviklere som kommer fra forrige generasjon, gir CometAPI Gemini 3.5 Flash API-veiledningen en nyttig integrasjonsreferanse.

Hvor mye koster Gemini 3.6 Flash API?

Gemini 3.6 Flash koster $1.50 per million inndata-tokener og $7.50 per million utdata-tokener pรฅ Googles Standard betalte nivรฅ.

Sammenlignet med Gemini 3.5 Flash forblir inndataprisen uendret, mens utdataprisen faller fra $9.00 til $7.50 per million tokener โ€“ en reduksjon pรฅ 16,7 %.

Google tilbyr ogsรฅ Batch, Flex og Priority behandling.

Gemini 3.6 Flash TierInput / 1MCached Input / 1MOutput / 1M
Standard$1.50$0.15$7.50
Batch$0.75$0.075$3.75
Flex$0.75$0.075$3.75
Priority$2.70$0.27$13.50

Viktig:** Thinking-tokener faktureres til satsen for utdata-tokener. Et kort synlig svar kan derfor bruke flere fakturerbare utdata-tokener enn sluttlengden antyder.

Kontekstbufring kan ogsรฅ gjรธre en merkbar forskjell for applikasjoner som gjentatte ganger sender den samme store systemprompten, depotkonteksten, dokumentsettet eller samtalehistorikken.

Pรฅ Standard betalt nivรฅ koster Gemini 3.6 Flash bufret inndata $0.15 per million tokener, sammenlignet med $1.50 for normal inndata.

Eksempel: 15,000 inndata-tokener + 8,000 utdata-tokener

Tenk deg en oppgave som bruker 15,000 inndata-tokener og 8,000 utdata-tokener.

ModellAnslรฅtt kostnad
Gemini 3.5 Flash$0.0945
Gemini 3.6 Flash ved samme tokenvolum$0.0825
Gemini 3.6 Flash med 17% fรฆrre utdata-tokener$0.0723
Gemini 3.5 Flash-Lite ved samme tokenvolum$0.0245

Ved identisk tokenbruk er Gemini 3.6 Flash omtrent 12,7 % billigere enn Gemini 3.5 Flash i dette eksemplet.

Google rapporterer ogsรฅ at Gemini 3.6 Flash brukte 17 % fรฆrre utdata-tokener pรฅ Artificial Analysis Index. Hvis en produksjonsarbeidslast gjentok den reduksjonen, ville den modellerte besparelsen i dette eksemplet รธke til omtrent 23,5 %.

Google rapporterer separat reduksjoner i utdata-tokener pรฅ opptil 65 % pรฅ DeepSWE. Disse tallene mรฅler ulike arbeidslaster og bรธr ikke behandles som utskiftbare: 17 % refererer til Artificial Analysis Index, mens 65 % kommer fra en spesifikk kodebenchmark.

Den grunnleggende token-kostnadsberegningen er:

Request cost =
(input tokens x input price + output tokens x output price) / 1,000,000

For agenter er den reelle kostnaden bredere:

Total task cost =
initial model call
+ retries
+ fallback calls
+ paid tools
+ grounding or search costs

Dette er grunnen til at den billigste modellen per token ikke alltid er den billigste for รฅ fullfรธre en oppgave.

Er Gemini 3.6 Flash gratis?

Ja. Googles nรฅvรฆrende Gemini Developer API-priser oppgir Free Tier-tilgang for Gemini 3.6 Flash Standard-bruk.

Gratisnivรฅ-tilgjengelighet betyr ikke ubegrenset produksjonskapasitet. API-begrensninger avhenger av prosjektet og bruksnivรฅet, sรฅ utviklere bรธr sjekke hastighetsbegrensningene som gjelder for deres eget prosjekt i stedet for รฅ stole pรฅ et fast antall forespรธrsler per minutt fra en tredjepartsartikkel.

For produksjonsplanlegging, bruk Googles gjeldende Gemini API-priser og dokumentasjon for hastighetsgrenser nรฅr du estimerer kapasitet.

Utviklere kan fรฅ tilgang til Gemini 3.6 Flash via Gemini API og Google AI Studio. Team som bruker en samlet multimodell-arbeidsflyt kan ogsรฅ teste modellen via CometAPI-siden for Gemini 3.6 Flash-modellen.

Hvordan sammenlignes Gemini 3.6 Flash med Gemini 3.5 Flash?

Googles publiserte resultater viser de stรธrste forbedringene i koding, agentutfรธrelse, datamaskinbruk og kunnskapsarbeid.

BenchmarkGemini 3.6 FlashGemini 3.5 FlashEndring
DeepSWE49.00%37.00%+12.0 poeng
MLE-Bench63.90%49.70%+14.2 poeng
OSWorld-Verified83.00%78.40%+4.6 poeng
GDPval-AA v21,4211,34972

Google sier ogsรฅ at Gemini 3.6 Flash fullfรธrer flertrinns arbeidsflyter med fรฆrre resonneringstrinn, fรฆrre samtalerunder og fรฆrre verktรธykall enn Gemini 3.5 Flash.

Selskapet rapporterer:

  • 17 % fรฆrre utdata-tokener pรฅ Artificial Analysis Index.
  • Opptil 65 % fรฆrre utdata-tokener pรฅ DeepSWE.
  • Fรฆrre uรธnskede kodeendringer og kjรธringsslรธyfer.
  • Forbedret multimodal og romlig resonnering.

De opprinnelige resultatene er tilgjengelige i Googles lanseringskunngjรธring for Gemini 3.6 Flash.

Disse benchmarkene gjรธr 3.6 Flash til en sterk kandidat for evaluering, spesielt for arbeidslaster der รฉn forespรธrsel kan bli til flere runder med resonnering, verktรธykall og korreksjoner.

De bรธr imidlertid ikke erstatte testing pรฅ din egen applikasjon.

Google bemerker ogsรฅ at 3.6 Flash kan utfรธre mer programmatisk inspeksjon pรฅ forhรฅnd fรธr kodeendringer. Pรฅ et stort depot kan det forbedre nรธyaktigheten. Pรฅ en snevert avgrenset frontend-endring kan det bare legge til unรธdvendig utforskning.

Tydelige filgrenser, akseptansekriterier og implementasjonsinstruksjoner er fortsatt viktige.

Gemini 3.6 Flash vs Gemini 3.5 Flash-Lite: Hvilken bรธr du bruke?

Nรฅr du har bestemt deg for at Gemini 3.6 Flash er verdt รฅ teste, er neste spรธrsmรฅl om hver forespรธrsel faktisk trenger den.

For mange produksjonssystemer er svaret nei.

Gemini 3.5 Flash-Lite er vesentlig billigere og kan vรฆre et bedre standardvalg for forutsigbare arbeidslaster med hรธyt volum.

ElementGemini 3.6 FlashGemini 3.5 Flash-Lite
Standard input price$1.50 / 1M tokens$0.30 / 1M tokens
Standard output price$7.50 / 1M tokens$2.50 / 1M tokens
Standard cached input$0.15 / 1M tokens$0.03 / 1M tokens
Default thinking levelmediumminimal
Best suited forKompleks resonnering, koding, agenterEkstraksjon, routing, klassifisering

Pรฅ Standard-prising er Flash-Lite 5ร— billigere pรฅ inndata og 3ร— billigere pรฅ utdata enn Gemini 3.6 Flash.

Start med Gemini 3.5 Flash-Lite for:

  • Klassifisering
  • Forespรธrselsrouting
  • JSON og strukturert ekstraksjon
  • Dokumentprosessering
  • Datatransformasjon
  • Oversettelse i skala
  • Lettere underagenter
  • Hรธyt volum av repeterbare oppgaver

En praktisk routingsstrategi kan se slik ut:

ArbeidslastFรธrste ruteEskalering
Klassifisering eller routingGemini 3.5 Flash-Lite3.6 Flash etter valideringsfeil
Strukturert ekstraksjonGemini 3.5 Flash-Lite3.6 Flash for komplekse dokumenter
Lett underagentGemini 3.5 Flash-Liteร˜k thinking-nivรฅ eller bruk 3.6 Flash
Koding pรฅ flere filerGemini 3.6 FlashSterkere fallback hvis ulรธst
Kompleks verktรธyflytGemini 3.6 FlashFallback etter verktรธy- eller valideringsfeil
Multimodal resonneringGemini 3.6 FlashOppgavespesifikk fallback

For blandet produksjonstrafikk er den mer nyttige metrikken:

Cost per successful task =
(model calls + retries + tools + fallbacks) / accepted tasks

Et billig fรธrste kall blir mindre attraktivt hvis det feiler gjentatte ganger og til slutt krever en sterkere modell uansett.

Det motsatte er like viktig. Det er liten grunn til รฅ sende millioner av forutsigbare klassifiseringsforespรธrsler til Gemini 3.6 Flash hvis Flash-Lite allerede mรธter den nรธdvendige nรธyaktigheten.

For applikasjoner som trenger denne typen routing, se vรฅr veiledning for รฅ kalle flere AI-modeller via en OpenAI-kompatibel base-URL.

Hva endres nรฅr du migrerer til Gemini 3.6 Flash?

ร… gรฅ fra Gemini 3.5 Flash til Gemini 3.6 Flash handler om mer enn รฅ endre modell-ID.

Utviklere bรธr gjennomgรฅ fem omrรฅder fรธr de bytter produksjonstrafikk: utgรฅtte sampling-parametere, thinking-kontroller, candidate_count, forhรฅndsutfylte modell-omganger og funksjonskall-tilstand.

1. Fjern temperature, top_p og top_k

Google har avviklet disse sampling-kontrollene for Gemini 3.6 Flash og Gemini 3.5 Flash-Lite:

generation_config = {
    "temperature": 0.7,
    "top_p": 0.9,
    "top_k": 40,
}

De nye modellene ignorerer for รธyeblikket disse parameterne. Google sier at fremtidige Gemini-modellgenerasjoner kan returnere en HTTP 400-feil nรฅr de oppgis.

For forutsigbare utdataformater, bruk tydeligere systeminstruksjoner og strukturerte utdata i stedet.

2. Bytt thinking_budget med thinking_level

Gemini 3.6 Flash har medium thinking som standard.

Googles migreringsveiledning anbefaler รฅ gรฅ fra numeriske thinking_budget-konfigurasjoner til thinking_level.

Gemini 3.5 Flash-Lite har minimal som standard, noe som er passende for mange hรธytvolums-arbeidslaster innen ekstraksjon, klassifisering og routing.

Hรธyere thinking-nivรฅer bรธr testes nรฅr oppgaven innebรฆrer flertrinns resonnering, kodekjรธring eller verktรธybruk.

3. Fjern candidate_count

Google oppgir candidate_count som ikke stรธttet i Gemini 3.x.

Dette kan vรฆre lett รฅ overse nรฅr flere modeller deler samme generasjonskonfigurasjon. Fjern den fรธr du migrerer produksjonsforespรธrsler.

4. Slutt รฅ forhรฅndsfylle modell-omganger

Forespรธrsler kan ikke lenger slutte med en ikke-tom model-rolleomgang.

En eldre applikasjon kan ha brukt en payload som:

{
  "contents": [
    {
      "role": "user",
      "parts": [{"text": "Translate 'Hello world' to Spanish."}]
    },
    {
      "role": "model",
      "parts": [{"text": "Translation:"}]
    }
  ]
}

Det mรธnsteret kan nรฅ returnere HTTP 400.

Hvis du tidligere brukte forhรฅndsutfylling for รฅ tvinge et svarformat, flytt kravet inn i system_instruction eller bruk strukturerte utdata i stedet.

5. Retest funksjonskalling og fleromgangstilstand

Verktรธybrukende agenter trenger separat migreringstesting.

Google anbefaler รฅ bruke previous_interaction_id for server-side fleromgangstilstand i Interactions API.

Nรฅr du returnerer et funksjonsresultat, bevar bรฅde funksjonsnavnet og den opprinnelige kall-ID-en:

final_interaction = client.interactions.create(
    model="gemini-3.6-flash",
    previous_interaction_id=interaction.id,
    tools=tools,
    input=[
        {
            "type": "function_result",
            "name": step.name,
            "call_id": step.id,
            "result": [
                {
                    "type": "text",
                    "text": json.dumps(result),
                }
            ],
        }
    ],
)

Applikasjoner som bruker generateContent bรธr ogsรฅ verifisere sine FunctionResponse-payloads og overvรฅke verktรธykallfeil etter migrering.

Se Googles veiledning for migrering til siste modell og dokumentasjon for funksjonskalling for gjeldende implementasjonsdetaljer.

Hvordan kaller du Gemini 3.6 Flash i Python?

Installer eller oppdater Googles GenAI SDK:

pip install -U google-genai

Sett API-nรธkkelen din:

export GEMINI_API_KEY="your-api-key"

Kall deretter Gemini 3.6 Flash:

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input=(
        "Review this migration plan and list the three "
        "highest-risk compatibility issues."
    ),
)

print(interaction.output_text)

For en oppgave som trenger mer resonnering, konfigurer thinking-nivรฅet:

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input="Analyze this multi-step debugging problem.",
    generation_config={
        "thinking_level": "medium",
    },
)

print(interaction.output_text)

Den viktigste migreringsforskjellen kan oppsummeres som:

# Older shared configuration
old_config = {
    "temperature": 0.2,
    "top_p": 0.9,
    "top_k": 40,
    "candidate_count": 1,
    "thinking_budget": 4096,
}

# Gemini 3.6 Flash
new_config = {
    "thinking_level": "medium",
}

Ikke anta at et hรธyere thinking-nivรฅ alltid er bedre. Mรฅl latens, tokenforbruk og fullfรธringsrate pรฅ dine egne oppgaver.

Hvordan bรธr du teste Gemini 3.6 Flash fรธr produksjon?

Du trenger ikke en stor offentlig benchmark-suite for รฅ avgjรธre om Gemini 3.6 Flash hรธrer hjemme i produksjonsstakken din.

Et bedre utgangspunkt er 30โ€“50 nylige oppgaver som ligner pรฅ din faktiske trafikk.

Ta med en blanding av:

  1. Koding og debugging
  2. Flertrinns verktรธybruk
  3. Multimodale dokumenter
  4. Dataekstraksjon
  5. Klassifisering og routing

Kjรธr de samme inndataene gjennom:

  • Din nรฅvรฆrende produksjonsmodell
  • Gemini 3.6 Flash
  • Gemini 3.5 Flash-Lite

Hold prompt, verktรธy, validatorer og akseptansekriterier uendret.

Fรธlg med pรฅ:

  • Inndata-tokener
  • Utdata- og thinking-tokener
  • Latens
  • Verktรธykall
  • Retries
  • Feil i funksjonskall
  • Validatorens bestรฅtt-rate
  • Menneskelig korrigeringstid
  • Endelig oppgavesuksess

Sammenlign deretter den totale kostnaden som kreves for รฅ produsere et akseptert resultat.

En kodeforespรธrsel som koster $0.08 og lykkes pรฅ fรธrste forsรธk kan vรฆre billigere enn en $0.02-forespรธrsel som feiler to ganger og til slutt eskalerer.

Samtidig gir det lite mening รฅ betale Gemini 3.6 Flash-priser for en enkel klassifiseringsoppgave hvis Flash-Lite hรฅndterer den pรฅlitelig.

Mรฅlet er ikke รฅ finne รฉn modell for hver forespรธrsel. Det er รฅ bruke den sterkere modellen bare der dens ekstra kapasitet faktisk endrer utfallet.

Utviklere kan sammenligne de nรฅvรฆrende Gemini 3.6 Flash- og Gemini 3.5 Flash-Lite-rutene via CometAPI ved hjelp av samme evalueringssett.

Vanlige spรธrsmรฅl

Hvor mye koster Gemini 3.6 Flash API?

Googles Standard betalte sats er $1.50 per million inndata-tokener og $7.50 per million utdata-tokener. Standard bufret inndata koster $0.15/M. Batch og Flex koster $0.75/M inndata og $3.75/M utdata.

Er Gemini 3.6 Flash gratis?

Ja. Googles nรฅvรฆrende Gemini Developer API-priser oppgir Free Tier Standard-bruk for Gemini 3.6 Flash. Gratis tilgang er fortsatt underlagt prosjekt- og brukernivรฅets hastighetsgrenser.

Er Gemini 3.6 Flash generelt tilgjengelig?

Ja. Google lanserte gemini-3.6-flash 21. juli 2026 og oppgir den som en produksjonsmodell i Gemini API-dokumentasjonen.

Hva er kontekstvinduet til Gemini 3.6 Flash?

Gemini 3.6 Flash stรธtter opptil 1,048,576 inndata-tokener og 65,536 utdata-tokener. Den aksepterer tekst, bilde, video, lyd og PDF som inndata og produserer tekst som utdata.

Er Gemini 3.6 Flash billigere enn Gemini 3.5 Flash?

Ja, for utdata-tokener. Begge modellene koster $1.50/M standard inndata-tokener, mens Gemini 3.6 Flash reduserer utdataprisen fra $9.00/M til $7.50/M.

Bรธr jeg bruke Gemini 3.6 Flash eller Gemini 3.5 Flash-Lite?

Bruk Gemini 3.6 Flash nรฅr kodekvalitet, multimodal resonnering eller kompleks agentutfรธrelse kan redusere feil og retries. Start med Flash-Lite for hรธytvolums ekstraksjon, klassifisering, routing og andre forutsigbare arbeidslaster der lavere kostnad betyr mer.

Hva bรธr jeg endre fรธr migrering til Gemini 3.6 Flash?

Fjern temperature, top_p, top_k og candidate_count; erstatt thinking_budget med thinking_level; fjern forhรฅndsut fylte modell-omganger; og retest funksjonskalling og fleromgangstilstand.

Konklusjon

Gemini 3.6 Flash er verdt รฅ benchmarke hvis du allerede bruker Gemini 3.5 Flash til koding, multimodalt arbeid eller agent-arbeidsflyter.

Utdataprisen er lavere, og Googles tidlige resultater tyder pรฅ at noen arbeidslaster ogsรฅ kan kreve fรฆrre tokener og fรฆrre utfรธringstrinn. For agenter som gjentatte ganger resonerer, kaller verktรธy og prรธver mislykkede handlinger pรฅ nytt, kan disse besparelsene bety mer enn prisforskjellen i overskriften.

Men det betyr ikke at hver forespรธrsel bรธr flyttes til 3.6 Flash.

Gemini 3.5 Flash-Lite er vesentlig billigere og kan vรฆre alt du trenger for forutsigbart arbeid som ekstraksjon, klassifisering og routing.

Den bedre produksjonsstrategien er รฅ bruke hver modell der det er รธkonomisk fornuftig: Flash-Lite for enkle oppgaver med hรธyt volum; 3.6 Flash der sterkere resonnering kan รธke sjansen for รฅ bli ferdig riktig pรฅ fรธrste forsรธk.

Mรฅl deretter resultatet som faktisk betyr noe โ€“ den totale kostnaden for รฅ fรฅ et akseptert svar.

For รฅ sammenligne begge modellene gjennom samme arbeidsflyt, se siden for Gemini 3.6 Flash-modellen og siden for Gemini 3.5 Flash-Lite-modellen pรฅ CometAPI, eller se gjennom gjeldende modellruter pรฅ CometAPI-prissiden.

Klar til รฅ redusere AI-utviklingskostnadene med 20 %?

Kom i gang gratis pรฅ minutter. Gratis prรธvekreditter inkludert. Ingen kredittkort nรธdvendig.

Les mer