TL;DR
Gemini 3.6 Flash kostet $1.50/M Eingabe und $7.50/M Ausgabe, mit niedrigeren Ausgabepreisen und laut Berichten besserer Code- und Agent-Performance als Gemini 3.5 Flash. Für Produktion: 3.6 Flash für komplexes Reasoning und Agenten einsetzen, während einfachere, hochvolumige Workloads auf das günstigere Gemini 3.5 Flash-Lite geroutet werden.
Gemini 3.6 Flash ist mehr als nur ein weiteres Model-ID-Update.
Für Entwickler, die bereits Gemini 3.5 Flash nutzen, ist die größere Veränderung wirtschaftlicher Natur. Google hat den Eingabepreis bei $1.50 pro Million Tokens belassen, den Ausgabepreis von $9.00 auf $7.50 gesenkt und berichtet über bessere Ergebnisse in mehreren Coding- und agentischen Benchmarks.
Die praktische Frage ist, ob diese Verbesserungen groß genug sind, um Produktions-Workloads zu migrieren.
Die Antwort hängt vom Workload ab. Coding-Agenten, multimodale Analyse und mehrstufige Tool-Nutzung profitieren möglicherweise stärker als einfache Extraktion oder Klassifikation. Die Migration erfordert außerdem einige API-Kompatibilitätsprüfungen, die leicht übersehen werden, wenn nur der Modellname geändert wird.
Dieser Leitfaden behandelt Gemini 3.6 Flash API-Preise, Free-Tier-Zugang, Benchmark-Ergebnisse, Migrationsänderungen, Python-Beispiele und was vor der Umstellung von Produktionstraffic zu testen ist.
What Is Gemini 3.6 Flash?
Gemini 3.6 Flash ist Googles neueres Flash-Modell für Coding, multimodales Reasoning und mehrstufige Agent-Workflows. Veröffentlicht am 21. Juli 2026, ist es für Produktions-Workloads ausgelegt, die stärkeres Reasoning und agentische Performance benötigen, dabei aber innerhalb von Googles Flash-Modellstufe bleiben.
Die wichtigsten Spezifikationen umfassen:
| Item | Gemini 3.6 Flash |
|---|---|
| Model ID | gemini-3.6-flash |
| Standard input price | $1.50 / 1M tokens |
| Standard output price | $7.50 / 1M tokens |
| Standard cached input | $0.15 / 1M tokens |
| Default thinking level | medium |
| Input context | 1,048,576 tokens |
| Maximum output | 65,536 tokens |
| Inputs | Text, image, video, audio, PDF |
| Output | Text |
| Best suited for | Coding, multimodal reasoning, complex agents |
Google positioniert Gemini 3.6 Flash für Workloads wie Coding, räumliches und multimodales Reasoning sowie mehrstufige agentische Aufgaben.
Das Modell unterstützt außerdem Funktionen wie Function Calling, strukturierte Ausgaben, Codeausführung, Kontext-Caching, File Search, URL-Kontext, Google Search Grounding und Google Maps Grounding.
Die neuesten Spezifikationen und Migrationshinweise finden Sie im latest Gemini model guide von Google.
Für Entwickler aus der vorherigen Generation bietet der CometAPI Gemini 3.5 Flash API guide eine nützliche Integrationsgrundlage.
How Much Does the Gemini 3.6 Flash API Cost?
Gemini 3.6 Flash kostet $1.50 pro Million Eingabetokens und $7.50 pro Million Ausgabetokens auf Googles Standard-Bezahlstufe.
Im Vergleich zu Gemini 3.5 Flash bleibt der Eingabepreis unverändert, während der Ausgabepreis von $9.00 auf $7.50 pro Million Tokens fällt – eine Reduzierung um 16.7%.
Google bietet außerdem Batch-, Flex- und Priority-Verarbeitung.
| Gemini 3.6 Flash Tier | Input / 1M | Cached Input / 1M | Output / 1M |
|---|---|---|---|
| Standard | $1.50 | $0.15 | $7.50 |
| Batch | $0.75 | $0.075 | $3.75 |
| Flex | $0.75 | $0.075 | $3.75 |
| Priority | $2.70 | $0.27 | $13.50 |
Wichtig:** Thinking-Tokens werden zum Ausgabetoken-Satz berechnet. Eine kurze sichtbare Antwort kann daher mehr abrechenbare Ausgabetokens verbrauchen, als die endgültige Antwortlänge vermuten lässt.
Kontext-Caching kann ebenfalls einen spürbaren Unterschied machen für Anwendungen, die wiederholt denselben großen System-Prompt, Repository-Kontext, Dokumentensatz oder Verlauf senden.
Auf der Standard-Bezahlstufe kosten gecachte Eingaben bei Gemini 3.6 Flash $0.15 pro Million Tokens, verglichen mit $1.50 für normale Eingaben.
Example: 15,000 Input Tokens + 8,000 Output Tokens
Betrachten wir eine Aufgabe mit 15,000 Eingabetokens und 8,000 Ausgabetokens.
| Model | Estimated Cost |
|---|---|
| Gemini 3.5 Flash | $0.0945 |
| Gemini 3.6 Flash at the same token volume | $0.0825 |
| Gemini 3.6 Flash with 17% fewer output tokens | $0.0723 |
| Gemini 3.5 Flash-Lite at the same token volume | $0.0245 |
Bei identischer Token-Nutzung ist Gemini 3.6 Flash in diesem Beispiel etwa 12.7% günstiger als Gemini 3.5 Flash.
Google berichtet außerdem, dass Gemini 3.6 Flash auf dem Artificial Analysis Index 17% weniger Ausgabetokens verwendet hat. Wenn ein Produktions-Workload diese Reduktion reproduziert, würde die modellierte Ersparnis in diesem Beispiel auf etwa 23.5% steigen.
Google berichtet separat von Ausgabetoken-Reduktionen von bis zu 65% auf DeepSWE. Diese Zahlen messen unterschiedliche Workloads und sind nicht austauschbar: 17% beziehen sich auf den Artificial Analysis Index, während 65% aus einem spezifischen Coding-Benchmark stammen.
Die grundlegende Token-Kostenberechnung lautet:
Request cost =
(input tokens x input price + output tokens x output price) / 1,000,000
Für Agenten ist die tatsächliche Kostenrechnung umfassender:
Total task cost =
initial model call
+ retries
+ fallback calls
+ paid tools
+ grounding or search costs
Deshalb ist das günstigste Modell pro Token nicht immer das günstigste Modell zur Erledigung einer Aufgabe.
Is Gemini 3.6 Flash Free?
Ja. Googles aktuelle Gemini Developer API-Preise führen Free-Tier-Zugang für die Standard-Nutzung von Gemini 3.6 Flash auf.
Free-Tier-Verfügbarkeit bedeutet jedoch keine unbegrenzte Produktionskapazität. API-Limits hängen vom Projekt und der Nutzungsstufe ab, daher sollten Entwickler die für ihr eigenes Projekt geltenden Ratenlimits prüfen, statt sich auf eine fixe Requests-pro-Minute-Angabe aus einem Drittartikel zu verlassen.
Für die Produktionsplanung nutzen Sie die aktuellen Gemini API pricing und die Rate-Limit-Dokumentation von Google zur Kapazitätsschätzung.
Entwickler können auf Gemini 3.6 Flash über die Gemini API und Google AI Studio zugreifen. Teams mit einem einheitlichen Multi-Modell-Workflow können das Modell außerdem über die CometAPI Gemini 3.6 Flash model page testen.
How Does Gemini 3.6 Flash Compare With Gemini 3.5 Flash?
Googles veröffentlichte Ergebnisse zeigen die größten Verbesserungen bei Coding, agentischer Ausführung, Computerbedienung und Wissensarbeit.
| Benchmark | Gemini 3.6 Flash | Gemini 3.5 Flash | Change |
|---|---|---|---|
| DeepSWE | 49.00% | 37.00% | +12.0 points |
| MLE-Bench | 63.90% | 49.70% | +14.2 points |
| OSWorld-Verified | 83.00% | 78.40% | +4.6 points |
| GDPval-AA v2 | 1,421 | 1,349 | 72 |
Google sagt außerdem, dass Gemini 3.6 Flash mehrstufige Workflows mit weniger Reasoning-Schritten, weniger Gesprächsrunden und weniger Tool-Aufrufen abschließt als Gemini 3.5 Flash.
Das Unternehmen berichtet:
- 17% weniger Ausgabetokens auf dem Artificial Analysis Index.
- Bis zu 65% weniger Ausgabetokens auf DeepSWE.
- Weniger unerwünschte Code-Änderungen und Ausführungsschleifen.
- Verbesserte multimodale und räumliche Fähigkeiten im Reasoning.
Die Originalergebnisse sind in Googles Gemini 3.6 Flash launch announcement verfügbar.
Diese Benchmarks machen 3.6 Flash zu einem starken Kandidaten für die Evaluation, insbesondere bei Workloads, in denen eine Anfrage mehrere Runden Reasoning, Tool-Aufrufe und Korrekturen nach sich ziehen kann.
Sie sollten jedoch nicht die Tests an Ihrer eigenen Anwendung ersetzen.
Google weist auch darauf hin, dass 3.6 Flash möglicherweise vor Änderungen am Code mehr upfront programmatische Inspektion vornimmt. Bei einem großen Repository kann das die Genauigkeit verbessern. Bei einem eng abgegrenzten Frontend-Edit könnte es einfach unnötige Exploration hinzufügen.
Klare Dateigrenzen, Akzeptanzkriterien und Implementierungsanweisungen bleiben entscheidend.
Gemini 3.6 Flash vs Gemini 3.5 Flash-Lite: Which Should You Use?
Sobald entschieden ist, dass Gemini 3.6 Flash einen Test wert ist, stellt sich die nächste Frage, ob jede Anfrage es tatsächlich braucht.
Für viele Produktionssysteme lautet die Antwort: nein.
Gemini 3.5 Flash-Lite ist deutlich günstiger und kann für vorhersehbare, hochvolumige Workloads die bessere Voreinstellung sein.
| Item | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| Standard input price | $1.50 / 1M tokens | $0.30 / 1M tokens |
| Standard output price | $7.50 / 1M tokens | $2.50 / 1M tokens |
| Standard cached input | $0.15 / 1M tokens | $0.03 / 1M tokens |
| Default thinking level | medium | minimal |
| Best suited for | Complex reasoning, coding, agents | Extraction, routing, classification |
Beim Standard-Preis ist Flash-Lite 5× günstiger bei Eingaben und 3× günstiger bei Ausgaben als Gemini 3.6 Flash.
Start with Gemini 3.5 Flash-Lite for:
- Klassifikation
- Request-Routing
- JSON und strukturierte Extraktion
- Dokumentenverarbeitung
- Datenumwandlung
- Übersetzung im großen Maßstab
- Leichtgewichtige Subagenten
- Hochvolumige, wiederholbare Aufgaben
Eine praktische Routing-Strategie könnte so aussehen:
| Workload | First Route | Escalation |
|---|---|---|
| Classification or routing | Gemini 3.5 Flash-Lite | 3.6 Flash nach Validierungsfehler |
| Structured extraction | Gemini 3.5 Flash-Lite | 3.6 Flash für komplexe Dokumente |
| Lightweight subagent | Gemini 3.5 Flash-Lite | Denkstufe erhöhen oder 3.6 Flash nutzen |
| Multi-file coding | Gemini 3.6 Flash | Stärkeres Fallback, falls ungelöst |
| Complex tool workflow | Gemini 3.6 Flash | Fallback nach Tool- oder Validierungsfehler |
| Multimodal reasoning | Gemini 3.6 Flash | Aufgabenspezifisches Fallback |
Für gemischten Produktionstraffic ist die nützlichere Kennzahl:
Cost per successful task =
(model calls + retries + tools + fallbacks) / accepted tasks
Ein günstiger erster Aufruf wird unattraktiver, wenn er wiederholt scheitert und schließlich doch ein stärkeres Modell benötigt.
Die Umkehrung ist ebenso wichtig. Es gibt wenig Gründe, Millionen vorhersehbarer Klassifikationsanfragen an Gemini 3.6 Flash zu senden, wenn Flash-Lite die erforderliche Genauigkeit bereits erfüllt.
Für Anwendungen, die dieses Routing benötigen, siehe unseren Leitfaden zum calling multiple AI models through an OpenAI-compatible base URL.
What Changes When Migrating to Gemini 3.6 Flash?
Der Wechsel von Gemini 3.5 Flash zu Gemini 3.6 Flash umfasst mehr als das Ändern der Model-ID.
Entwickler sollten fünf Bereiche prüfen, bevor Produktionstraffic umgestellt wird: veraltete Sampling-Parameter, Thinking-Steuerung, candidate_count, vorbefüllte Modellrunden und Function-Calling-State.
1. Remove temperature, top_p, and top_k
Google hat diese Sampling-Controls für Gemini 3.6 Flash und Gemini 3.5 Flash-Lite abgekündigt:
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40,
}
Die neuen Modelle ignorieren diese Parameter derzeit. Google sagt, dass zukünftige Gemini-Generationen einen HTTP-400-Fehler zurückgeben können, wenn sie übergeben werden.
Für vorhersehbare Ausgabeformate nutzen Sie stattdessen klarere Systemanweisungen und strukturierte Ausgaben.
2. Replace thinking_budget With thinking_level
Gemini 3.6 Flash verwendet standardmäßig medium.
Googles Migrationsleitfaden empfiehlt, von numerischen thinking_budget-Konfigurationen zu thinking_level zu wechseln.
Gemini 3.5 Flash-Lite nutzt standardmäßig minimal, was für viele hochvolumige Extraktions-, Klassifikations- und Routing-Workloads passend ist.
Höhere Denkstufen sollten getestet werden, wenn die Aufgabe mehrstufiges Reasoning, Codeausführung oder Tool-Nutzung umfasst.
3. Remove candidate_count
Google führt candidate_count als nicht unterstützt in Gemini 3.x.
Das kann leicht übersehen werden, wenn mehrere Modelle dieselbe Generierungskonfiguration teilen. Entfernen Sie es vor der Migration von Produktionsanfragen.
4. Stop Prefilling Model Turns
Anfragen dürfen nicht mehr mit einer nicht-leeren model-Rollenrunde enden.
Eine ältere Anwendung könnte eine Payload wie diese verwendet haben:
{
"contents": [
{
"role": "user",
"parts": [{"text": "Translate 'Hello world' to Spanish."}]
},
{
"role": "model",
"parts": [{"text": "Translation:"}]
}
]
}
Dieses Muster kann jetzt HTTP 400 zurückgeben.
Wenn Sie Prefilling bisher genutzt haben, um ein Antwortformat zu erzwingen, verschieben Sie die Anforderung in system_instruction oder verwenden Sie stattdessen strukturierte Ausgaben.
5. Retest Function Calling and Multi-Turn State
Tool-nutzende Agenten benötigen separate Migrations-Tests.
Google empfiehlt die Verwendung von previous_interaction_id für serverseitigen Multi-Turn-State in der Interactions API.
Beim Zurückgeben eines Funktionsresultats erhalten Sie sowohl den Funktionsnamen als auch die ursprüngliche Call-ID:
final_interaction = client.interactions.create(
model="gemini-3.6-flash",
previous_interaction_id=interaction.id,
tools=tools,
input=[
{
"type": "function_result",
"name": step.name,
"call_id": step.id,
"result": [
{
"type": "text",
"text": json.dumps(result),
}
],
}
],
)
Anwendungen, die generateContent verwenden, sollten zudem ihre FunctionResponse-Payloads verifizieren und nach der Migration Tool-Call-Fehler überwachen.
Siehe Googles latest-model migration guide und die function-calling documentation für die aktuellen Implementierungsdetails.
How Do You Call Gemini 3.6 Flash in Python?
Installieren oder aktualisieren Sie Googles GenAI-SDK:
pip install -U google-genai
Setzen Sie Ihren API-Schlüssel:
export GEMINI_API_KEY="your-api-key"
Dann rufen Sie Gemini 3.6 Flash auf:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input=(
"Review this migration plan and list the three "
"highest-risk compatibility issues."
),
)
print(interaction.output_text)
Für eine Aufgabe, die mehr Reasoning benötigt, konfigurieren Sie die Denkstufe:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Analyze this multi-step debugging problem.",
generation_config={
"thinking_level": "medium",
},
)
print(interaction.output_text)
Der wichtigste Migrationsunterschied lässt sich so zusammenfassen:
# Older shared configuration
old_config = {
"temperature": 0.2,
"top_p": 0.9,
"top_k": 40,
"candidate_count": 1,
"thinking_budget": 4096,
}
# Gemini 3.6 Flash
new_config = {
"thinking_level": "medium",
}
Gehen Sie nicht davon aus, dass eine höhere Denkstufe immer besser ist. Messen Sie Latenz, Tokenverbrauch und Erfolgsrate bei Ihren eigenen Aufgaben.
How Should You Test Gemini 3.6 Flash Before Production?
Sie benötigen keine große öffentliche Benchmark-Suite, um zu entscheiden, ob Gemini 3.6 Flash in Ihren Produktions-Stack gehört.
Ein besserer Startpunkt sind 30–50 aktuelle Aufgaben, die Ihrem tatsächlichen Traffic ähneln.
Nehmen Sie eine Mischung aus:
- Coding und Debugging
- Mehrstufiger Tool-Nutzung
- Multimodalen Dokumenten
- Datenextraktion
- Klassifikation und Routing
Führen Sie dieselben Eingaben durch:
- Ihr aktuelles Produktionsmodell
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
Belassen Sie Prompts, Tools, Validatoren und Akzeptanzkriterien unverändert.
Tracken Sie:
- Eingabetokens
- Ausgabe- und Thinking-Tokens
- Latenz
- Tool-Aufrufe
- Retries
- Function-Call-Fehler
- Validator-Passrate
- Zeit für menschliche Korrekturen
- Endgültigen Aufgabenerfolg
Vergleichen Sie anschließend die Gesamtkosten, die erforderlich sind, um ein akzeptiertes Ergebnis zu produzieren.
Eine Coding-Anfrage, die $0.08 kostet und beim ersten Versuch gelingt, kann günstiger sein als eine $0.02-Anfrage, die zweimal scheitert und schließlich eskaliert.
Gleichzeitig ergibt es wenig Sinn, Preise von Gemini 3.6 Flash für eine einfache Klassifikationsaufgabe zu zahlen, wenn Flash-Lite sie zuverlässig erledigt.
Ziel ist nicht, ein Modell für jede Anfrage zu finden. Ziel ist, das stärkere Modell nur dort einzusetzen, wo seine zusätzliche Fähigkeit das Ergebnis tatsächlich verändert.
Entwickler können die aktuellen Routen Gemini 3.6 Flash und Gemini 3.5 Flash-Lite über CometAPI mit demselben Evaluationssatz vergleichen.
FAQ
How much does the Gemini 3.6 Flash API cost?
Googles Standardtarif beträgt $1.50 pro Million Eingabetokens und $7.50 pro Million Ausgabetokens. Standard gecachte Eingaben kosten $0.15/M. Batch und Flex kosten $0.75/M Eingabe und $3.75/M Ausgabe.
Is Gemini 3.6 Flash free?
Ja. Googles aktuelle Gemini Developer API-Preise führen Free-Tier-Standardnutzung für Gemini 3.6 Flash. Der freie Zugang unterliegt weiterhin projekt- und stufenabhängigen Ratenlimits.
Is Gemini 3.6 Flash generally available?
Ja. Google hat gemini-3.6-flash am 21. Juli 2026 veröffentlicht und es in der Gemini-API-Dokumentation als Produktionsmodell gelistet.
What is the Gemini 3.6 Flash context window?
Gemini 3.6 Flash unterstützt bis zu 1,048,576 Eingabetokens und 65,536 Ausgabetokens. Es akzeptiert Text-, Bild-, Video-, Audio- und PDF-Eingaben und produziert Textausgabe.
Is Gemini 3.6 Flash cheaper than Gemini 3.5 Flash?
Ja, bei Ausgabetokens. Beide Modelle kosten $1.50/M Standard-Eingabetokens, während Gemini 3.6 Flash den Ausgabepreis von $9.00/M auf $7.50/M senkt.
Should I use Gemini 3.6 Flash or Gemini 3.5 Flash-Lite?
Nutzen Sie Gemini 3.6 Flash, wenn Codequalität, multimodales Reasoning oder komplexe Agentausführung Fehlversuche und Retries reduzieren können. Starten Sie mit Flash-Lite für hochvolumige Extraktion, Klassifikation, Routing und andere vorhersehbare Workloads, bei denen geringere Kosten wichtiger sind.
What should I change before migrating to Gemini 3.6 Flash?
Entfernen Sie temperature, top_p, top_k und candidate_count; ersetzen Sie thinking_budget durch thinking_level; entfernen Sie vorbefüllte Modellrunden; und testen Sie Function Calling und Multi-Turn-State-Management erneut.
Final Take
Gemini 3.6 Flash lohnt sich für Benchmarks, wenn Sie bereits Gemini 3.5 Flash für Coding, multimodale Arbeit oder Agent-Workflows einsetzen.
Der Ausgabepreis ist niedriger, und Googles frühe Ergebnisse deuten darauf hin, dass einige Workloads auch weniger Tokens und weniger Ausführungsschritte benötigen. Für Agenten, die wiederholt schlussfolgern, Tools aufrufen und fehlgeschlagene Aktionen erneut versuchen, können diese Einsparungen wichtiger sein als der Preisunterschied auf dem Papier.
Das bedeutet jedoch nicht, dass jede Anfrage auf 3.6 Flash umgestellt werden sollte.
Gemini 3.5 Flash-Lite ist deutlich günstiger und kann für vorhersehbare Aufgaben wie Extraktion, Klassifikation und Routing völlig ausreichen.
Die bessere Produktionsstrategie ist, jedes Modell dort einzusetzen, wo es wirtschaftlich Sinn ergibt: Flash-Lite für einfache, hochvolumige Aufgaben; 3.6 Flash dort, wo stärkeres Reasoning die Chance erhöht, beim ersten Versuch korrekt abzuschließen.
Messen Sie dann die Kennzahl, die tatsächlich zählt – die Gesamtkosten, um eine akzeptierte Antwort zu erhalten.
Um beide Modelle im selben Workflow zu vergleichen, siehe die Gemini 3.6 Flash model page und die Gemini 3.5 Flash-Lite model page auf CometAPI oder prüfen Sie die aktuellen Modellrouten auf der CometAPI pricing page.
