TL;DR
Gemini 3.6 Flash koster $1.50/M input og $7.50/M output, med lavere outputpriser og bedre rapporteret kodnings- og agent-ydelse end Gemini 3.5 Flash. Til produktion: brug 3.6 Flash til kompleks ræsonnering og agenter, og rout simple, højvolumen-workloads til det billigere Gemini 3.5 Flash-Lite.
Gemini 3.6 Flash er mere end endnu en model-ID-opdatering.
For udviklere, der allerede bruger Gemini 3.5 Flash, er den større ændring økonomisk. Google har beholdt inputprisen uændret på $1.50 pr. million tokens, sænket outputprisen fra $9.00 til $7.50, og rapporterer bedre resultater på flere kode- og agent-benchmarks.
Det praktiske spørgsmål er, om forbedringerne er store nok til at retfærdiggøre at flytte produktions-workloads.
Svaret afhænger af workloaden. Kodningsagenter, multimodal analyse og multitrins-værktøjsbrug kan have større fordel end simpel ekstraktion eller klassifikation. Migration kræver også et par API-kompatibilitetstjek, der er nemme at overse, hvis du kun ændrer modelnavnet.
Denne guide dækker Gemini 3.6 Flash API-priser, gratisadgang, benchmarkresultater, migrationsændringer, Python-eksempler og hvad du bør teste, før du skifter produktionstrafik.
Hvad er Gemini 3.6 Flash?
Gemini 3.6 Flash er Googles nyere Flash-model til kodning, multimodal ræsonnering og multitrins agent-workflows. Udgivet den 21. juli 2026, designet til produktions-workloads, der har brug for stærkere ræsonnering og agentisk ydelse, mens de forbliver inden for Googles Flash-modelniveau.
Dens vigtigste specifikationer omfatter:
| Element | Gemini 3.6 Flash |
|---|---|
| Model-ID | gemini-3.6-flash |
| Standard inputpris | $1.50 / 1M tokens |
| Standard outputpris | $7.50 / 1M tokens |
| Standard cached input | $0.15 / 1M tokens |
| Standard-tænkeniveau | medium |
| Inputkontekst | 1,048,576 tokens |
| Maksimalt output | 65,536 tokens |
| Inputs | Tekst, billede, video, lyd, PDF |
| Output | Tekst |
| Bedst egnet til | Kodning, multimodal ræsonnering, komplekse agenter |
Google positionerer Gemini 3.6 Flash til workloads såsom kodning, rumlig og multimodal ræsonnering og multitrins agentiske opgaver.
Modellen understøtter også funktioner som funktionskald, strukturerede output, kodekørsel, kontekst-caching, File Search, URL-kontekst, Google Search-forankring og Google Maps-forankring.
Du kan se de seneste specifikationer og migrationsvejledning i Googles seneste Gemini-modelguide: https://ai.google.dev/gemini-api/docs/latest-model
For udviklere fra den forrige generation giver CometAPI Gemini 3.5 Flash API-guiden en nyttig integrationsbaseline: https://www.cometapi.com/how-to-use-gemini-3-5-flash-api/
Hvad koster Gemini 3.6 Flash API?
Gemini 3.6 Flash koster $1.50 pr. million inputtokens og $7.50 pr. million outputtokens på Googles Standard betalingsniveau.
Sammenlignet med Gemini 3.5 Flash er inputprisen uændret, mens outputprisen falder fra $9.00 til $7.50 pr. million tokens – en reduktion på 16.7%.
Google tilbyder også Batch, Flex og Priority-behandling.
| Gemini 3.6 Flash-niveau | Input / 1M | Cached input / 1M | Output / 1M |
|---|---|---|---|
| Standard | $1.50 | $0.15 | $7.50 |
| Batch | $0.75 | $0.075 | $3.75 |
| Flex | $0.75 | $0.075 | $3.75 |
| Priority | $2.70 | $0.27 | $13.50 |
Vigtigt:** Tænkningstokens faktureres til outputtoken-satsen. Et kort synligt svar kan derfor bruge flere fakturerbare outputtokens, end den endelige svarlængde antyder.
Kontekst-caching kan også gøre en mærkbar forskel for applikationer, der gentagne gange sender den samme store systemprompt, repository-kontekst, dokumentmængde eller samtalehistorik.
På Standard betalingsniveau koster Gemini 3.6 Flash cached input $0.15 pr. million tokens sammenlignet med $1.50 for normalt input.
Eksempel: 15,000 inputtokens + 8,000 outputtokens
Overvej en opgave med 15,000 inputtokens og 8,000 outputtokens.
| Model | Anslået pris |
|---|---|
| Gemini 3.5 Flash | $0.0945 |
| Gemini 3.6 Flash ved samme tokenmængde | $0.0825 |
| Gemini 3.6 Flash med 17% færre outputtokens | $0.0723 |
| Gemini 3.5 Flash-Lite ved samme tokenmængde | $0.0245 |
Ved identisk tokenforbrug er Gemini 3.6 Flash ca. 12.7% billigere end Gemini 3.5 Flash i dette eksempel.
Google rapporterer også, at Gemini 3.6 Flash brugte 17% færre outputtokens på Artificial Analysis Index. Hvis en produktions-workload reproducerede den reduktion, ville den modellerede besparelse i dette eksempel stige til cirka 23.5%.
Google rapporterer separat outputtoken-reduktioner på op til 65% på DeepSWE. Disse tal måler forskellige workloads og bør ikke behandles som udskiftelige: 17% refererer til Artificial Analysis Index, mens 65% kommer fra en specifik kodningsbenchmark.
Den grundlæggende token-omkostningsberegning er:
Request cost =
(input tokens x input price + output tokens x output price) / 1,000,000
For agenter er den reelle pris bredere:
Total task cost =
initial model call
+ retries
+ fallback calls
+ paid tools
+ grounding or search costs
Derfor er den billigste model pr. token ikke altid den billigste til at fuldføre en opgave.
Er Gemini 3.6 Flash gratis?
Ja. Googles aktuelle Gemini Developer API-priser angiver Free Tier-adgang til Gemini 3.6 Flash Standard-brug.
Gratisniveau-tilgængelighed betyder ikke ubegrænset produktionskapacitet. API-grænser afhænger af projekt og brugerniveau, så udviklere bør tjekke de hastighedsgrænser, der gælder for deres eget projekt i stedet for at stole på en fast anmodninger-pr.-minut-figur fra en tredjepartsartikel.
Til produktionsplanlægning: brug Googles aktuelle Gemini API-priser og dokumentation for rate limits ved kapacitetsestimering: https://ai.google.dev/gemini-api/docs/pricing
Udviklere kan få adgang til Gemini 3.6 Flash via Gemini API og Google AI Studio. Teams, der bruger en samlet multi-model workflow, kan også teste modellen via CometAPI Gemini 3.6 Flash-modellsiden: https://www.cometapi.com/models/google/gemini-3-6-flash/
Hvordan sammenlignes Gemini 3.6 Flash med Gemini 3.5 Flash?
Googles offentliggjorte resultater viser de største forbedringer i kodning, agentisk eksekvering, computerbrug og vidensarbejde.
| Benchmark | Gemini 3.6 Flash | Gemini 3.5 Flash | Ændring |
|---|---|---|---|
| DeepSWE | 49.00% | 37.00% | +12.0 point |
| MLE-Bench | 63.90% | 49.70% | +14.2 point |
| OSWorld-Verified | 83.00% | 78.40% | +4.6 point |
| GDPval-AA v2 | 1,421 | 1,349 | 72 |
Google siger også, at Gemini 3.6 Flash fuldfører multitrins-workflows med færre ræsonneringstrin, samtaleture og værktøjskald end Gemini 3.5 Flash.
Virksomheden rapporterer:
- 17% færre outputtokens på Artificial Analysis Index.
- Op til 65% færre outputtokens på DeepSWE.
- Færre uønskede kodeændringer og eksekveringssløjfer.
- Forbedret multimodal og rumlig ræsonnering.
De originale resultater findes i Googles lancering af Gemini 3.6 Flash: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
Disse benchmarks gør 3.6 Flash til en stærk kandidat til evaluering, især for workloads hvor én forespørgsel kan blive til flere runder af ræsonnering, værktøjskald og korrektioner.
De bør dog ikke erstatte test på din egen applikation.
Google bemærker også, at 3.6 Flash kan udføre mere forudgående programmatisk inspektion, før der laves kodeændringer. På et stort repository kan det forbedre nøjagtigheden. Ved en snævert afgrænset frontend-ændring kan det blot tilføje unødvendig udforskning.
Tydelige filgrænser, acceptkriterier og implementeringsinstruktioner er stadig vigtige.
Gemini 3.6 Flash vs Gemini 3.5 Flash-Lite: Hvilken bør du bruge?
Når du har besluttet, at Gemini 3.6 Flash er værd at teste, er det næste spørgsmål, om hver forespørgsel faktisk har brug for den.
For mange produktionssystemer er svaret nej.
Gemini 3.5 Flash-Lite er væsentligt billigere og kan være et bedre standardvalg til forudsigelige, højvolumen-workloads.
| Element | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| Standard inputpris | $1.50 / 1M tokens | $0.30 / 1M tokens |
| Standard outputpris | $7.50 / 1M tokens | $2.50 / 1M tokens |
| Standard cached input | $0.15 / 1M tokens | $0.03 / 1M tokens |
| Standard-tænkeniveau | medium | minimal |
| Bedst egnet til | Kompleks ræsonnering, kodning, agenter | Ekstraktion, routing, klassifikation |
Ved Standard-priser er Flash-Lite 5× billigere på input og 3× billigere på output end Gemini 3.6 Flash.
Start med Gemini 3.5 Flash-Lite til:
- Klassifikation
- Forespørgsels-routing
- JSON og struktureret ekstraktion
- Dokumentbehandling
- Datatransformation
- Oversættelse i skala
- Letvægts-underagenter
- Højvolumen, gentagelige opgaver
En praktisk routingstrategi kan se sådan ud:
| Workload | Første rute | Eskalering |
|---|---|---|
| Klassifikation eller routing | Gemini 3.5 Flash-Lite | 3.6 Flash efter valideringsfejl |
| Struktureret ekstraktion | Gemini 3.5 Flash-Lite | 3.6 Flash til komplekse dokumenter |
| Letvægts-underagent | Gemini 3.5 Flash-Lite | Hæv tænkeniveau eller brug 3.6 Flash |
| Kodning på tværs af filer | Gemini 3.6 Flash | Stærkere fallback hvis uløst |
| Kompleks værktøjs-workflow | Gemini 3.6 Flash | Fallback efter værktøjs- eller valideringsfejl |
| Multimodal ræsonnering | Gemini 3.6 Flash | Opgavespecifik fallback |
For blandet produktionstrafik er den mere nyttige metrik:
Cost per successful task =
(model calls + retries + tools + fallbacks) / accepted tasks
Et billigt første kald bliver mindre attraktivt, hvis det fejler gentagne gange og i sidste ende kræver en stærkere model alligevel.
Det omvendte er lige så vigtigt. Der er lille grund til at sende millioner af forudsigelige klassifikationsforespørgsler til Gemini 3.6 Flash, hvis Flash-Lite allerede opfylder den krævede nøjagtighed.
For applikationer, der har brug for denne slags routing, se vores guide til at kalde flere AI-modeller via en OpenAI-kompatibel base-URL: https://www.cometapi.com/how-to-call-multiple-ai-models-using-an-openai-compatible-base-url/
Hvad ændrer sig ved migrering til Gemini 3.6 Flash?
At gå fra Gemini 3.5 Flash til Gemini 3.6 Flash indebærer mere end at ændre model-ID'et.
Udviklere bør gennemgå fem områder, før de skifter produktionstrafik: udfasede samplingparametre, tænkningskontroller, candidate_count, forudfyldte modelreplikker og funktionskaldstilstand.
1. Fjern temperature, top_p og top_k
Google har udfaset disse samplingkontroller for Gemini 3.6 Flash og Gemini 3.5 Flash-Lite:
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40,
}
De nye modeller ignorerer aktuelt disse parametre. Google siger, at fremtidige Gemini-modelgenerationer kan returnere en HTTP 400-fejl, når de leveres.
For forudsigelige outputformater: brug tydeligere systeminstruktioner og strukturerede output i stedet.
2. Erstat thinking_budget med thinking_level
Gemini 3.6 Flash er som standard medium tænkning.
Googles migrationsvejledning anbefaler at flytte fra numeriske thinking_budget-konfigurationer til thinking_level.
Gemini 3.5 Flash-Lite har som standard minimal, hvilket er passende for mange højvolumen-ekstraktions-, klassifikations- og routing-workloads.
Højere tænkeniveauer bør testes, når opgaven involverer multitrins-ræsonnering, kodeeksekvering eller værktøjsbrug.
3. Fjern candidate_count
Google angiver candidate_count som ikke-understøttet i Gemini 3.x.
Dette kan være let at overse, når flere modeller deler samme genereringskonfiguration. Fjern den, før du migrerer produktionsforespørgsler.
4. Stop med at forudfylde modelreplikker
Forespørgsler kan ikke længere slutte med en ikke-tom model-rolle-replik.
En ældre applikation kunne bruge en payload som:
{
"contents": [
{
"role": "user",
"parts": [{"text": "Translate 'Hello world' to Spanish."}]
},
{
"role": "model",
"parts": [{"text": "Translation:"}]
}
]
}
Det mønster kan nu returnere HTTP 400.
Hvis du tidligere brugte forudfyldning til at tvinge et svarformat, flyt kravet til system_instruction eller brug strukturerede output i stedet.
5. Retest funktionskald og fler-turs-tilstand
Værktøjsbrugende agenter kræver separat migrationstest.
Google anbefaler at bruge previous_interaction_id til serverside fler-turs-tilstand i Interactions API.
Når du returnerer et funktionsresultat, bevar både funktionsnavn og det oprindelige call-ID:
final_interaction = client.interactions.create(
model="gemini-3.6-flash",
previous_interaction_id=interaction.id,
tools=tools,
input=[
{
"type": "function_result",
"name": step.name,
"call_id": step.id,
"result": [
{
"type": "text",
"text": json.dumps(result),
}
],
}
],
)
Applikationer, der bruger generateContent, bør også verificere deres FunctionResponse-payloads og overvåge værktøjskaldsfejl efter migration.
Se Googles seneste-model migrationsguide: https://ai.google.dev/gemini-api/docs/latest-model og dokumentation for funktionskald: https://ai.google.dev/gemini-api/docs/function-calling for aktuelle implementeringsdetaljer.
Hvordan kalder man Gemini 3.6 Flash i Python?
Installer eller opdater Googles GenAI SDK:
pip install -U google-genai
Sæt din API-nøgle:
export GEMINI_API_KEY="your-api-key"
Kald derefter Gemini 3.6 Flash:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input=(
"Review this migration plan and list the three "
"highest-risk compatibility issues."
),
)
print(interaction.output_text)
Til en opgave, der kræver mere ræsonnering, konfigurer tænkeniveauet:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Analyze this multi-step debugging problem.",
generation_config={
"thinking_level": "medium",
},
)
print(interaction.output_text)
Den vigtigste migrationsforskel kan sammenfattes som:
# Older shared configuration
old_config = {
"temperature": 0.2,
"top_p": 0.9,
"top_k": 40,
"candidate_count": 1,
"thinking_budget": 4096,
}
# Gemini 3.6 Flash
new_config = {
"thinking_level": "medium",
}
Antag ikke, at et højere tænkeniveau altid er bedre. Mål latenstid, tokenforbrug og gennemførelsesrate på dine egne opgaver.
Hvordan bør du teste Gemini 3.6 Flash før produktion?
Du behøver ikke en stor offentlig benchmarksuite for at afgøre, om Gemini 3.6 Flash hører hjemme i din produktionsstack.
Et bedre udgangspunkt er 30-50 nylige opgaver, der ligner din faktiske trafik.
Inkludér en blanding af:
- Kodning og debugging
- Multitrins værktøjsbrug
- Multimodale dokumenter
- Dataekstraktion
- Klassifikation og routing
Kør de samme input gennem:
- Din nuværende produktionsmodel
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
Hold prompts, værktøjer, validatorer og acceptkriterier uændrede.
Spor:
- Inputtokens
- Output- og tænkningstokens
- Latenstid
- Værktøjskald
- Retries
- Funktionskaldsfejl
- Validator-godkendelsesrate
- Menneskelig rettetid
- Endelig opgave-succes
Sammenlign derefter den samlede pris, der kræves for at producere et godkendt resultat.
En kodningsforespørgsel, der koster $0.08 og lykkes i første forsøg, kan være billigere end en til $0.02, der fejler to gange og til sidst eskalerer.
Samtidig giver det lidt mening at betale Gemini 3.6 Flash-priser for en simpel klassifikationsopgave, hvis Flash-Lite håndterer den pålideligt.
Målet er ikke at finde én model til hver forespørgsel. Det er at bruge den stærkere model kun dér, hvor dens ekstra kapabilitet faktisk ændrer udfaldet.
Udviklere kan sammenligne de aktuelle Gemini 3.6 Flash- og Gemini 3.5 Flash-Lite-ruter via CometAPI med samme evalueringssæt:
- Gemini 3.6 Flash: https://www.cometapi.com/models/google/gemini-3-6-flash/
- Gemini 3.5 Flash-Lite: https://www.cometapi.com/models/google/gemini-3-5-flash-lite/
FAQ
Hvor meget koster Gemini 3.6 Flash API?
Googles Standard betalingssats er $1.50 pr. million inputtokens og $7.50 pr. million outputtokens. Standard cached input koster $0.15/M. Batch og Flex koster $0.75/M input og $3.75/M output.
Er Gemini 3.6 Flash gratis?
Ja. Googles aktuelle Gemini Developer API-priser angiver Free Tier Standard-brug for Gemini 3.6 Flash. Gratis adgang er fortsat underlagt projekt- og brugerniveaus hastighedsgrænser.
Er Gemini 3.6 Flash generelt tilgængelig?
Ja. Google udgav gemini-3.6-flash den 21. juli 2026 og angiver den som en produktionsmodel i Gemini API-dokumentationen.
Hvad er Gemini 3.6 Flash kontekstvinduet?
Gemini 3.6 Flash understøtter op til 1,048,576 inputtokens og 65,536 outputtokens. Den accepterer tekst, billede, video, lyd og PDF som input og producerer tekstoutput.
Er Gemini 3.6 Flash billigere end Gemini 3.5 Flash?
Ja for outputtokens. Begge modeller koster $1.50/M standard inputtokens, mens Gemini 3.6 Flash reducerer outputprisen fra $9.00/M til $7.50/M.
Skal jeg bruge Gemini 3.6 Flash eller Gemini 3.5 Flash-Lite?
Brug Gemini 3.6 Flash, når kodekvalitet, multimodal ræsonnering eller kompleks agent-eksekvering kan reducere fejl og retries. Start med Flash-Lite til højvolumen ekstraktion, klassifikation, routing og andre forudsigelige workloads, hvor lavere pris betyder mere.
Hvad skal jeg ændre, før jeg migrerer til Gemini 3.6 Flash?
Fjern temperature, top_p, top_k og candidate_count; erstat thinking_budget med thinking_level; fjern forudfyldte modelreplikker; og retest funktionskald og fler-turs-tilstandshåndtering.
Endelig konklusion
Gemini 3.6 Flash er værd at benchmarke, hvis du allerede bruger Gemini 3.5 Flash til kodning, multimodalt arbejde eller agent-workflows.
Dens outputpris er lavere, og Googles tidlige resultater antyder, at nogle workloads også kan kræve færre tokens og færre eksekveringstrin. For agenter, der gentagne gange ræsonnerer, kalder værktøjer og prøver igen efter fejl, kan disse besparelser betyde mere end prisforskellen på papiret.
Men det betyder ikke, at hver forespørgsel bør flyttes til 3.6 Flash.
Gemini 3.5 Flash-Lite er væsentligt billigere og kan være alt, hvad du behøver, til forudsigeligt arbejde som ekstraktion, klassifikation og routing.
Den bedre produktionsstrategi er at bruge hver model, hvor det giver økonomisk mening: Flash-Lite til simple, højvolumen-opgaver; 3.6 Flash dér, hvor stærkere ræsonnering kan øge chancen for at blive korrekt færdig i første forsøg.
Mål derefter det, der faktisk betyder noget – den samlede pris for at få et accepteret svar.
For at sammenligne begge modeller i samme workflow, se Gemini 3.6 Flash-modellsiden og Gemini 3.5 Flash-Lite-modellsiden på CometAPI, eller gennemgå aktuelle modelruter på CometAPI-prissiden:
