TLDR Googles jüngstes Gemini-Release ist nicht das langerwartete Gemini 3.5 Pro. Stattdessen hat Google drei auf Effizienz fokussierte Modelle ausgeliefert: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite und Gemini 3.5 Flash Cyber. Die praktische Botschaft ist klar: Google priorisiert Agentenökonomie, Latenz, Token-Effizienz und spezialisierte Sicherheitsautomatisierung, während das Flaggschiff-Pro-Modell weiterhin getestet wird.
Für Entwickler gilt: Warten Sie nicht passiv auf Gemini 3.5 Pro. Nutzen Sie Gemini 3.6 Flash als Standard-Upgrade-Kandidaten für komplexe Agenten und Coding-Workflows, verwenden Sie Gemini 3.5 Flash-Lite für hochvolumige Extraktion und Routing und halten Sie eine modellübergreifende Fallback-Strategie für Frontier-Reasoning-Aufgaben bereit. CometAPI bietet über einen einzigen OpenAI-kompatiblen API-Schlüssel einheitlichen Zugriff auf 500+ Modelle, sodass Gemini neben GPT, Claude, DeepSeek, Kimi, Qwen und anderen Modellen getestet werden kann, ohne Ihre Integration neu schreiben zu müssen.
Wichtigste Erkenntnisse
- Google kündigte am 21. Juli 2026 Gemini 3.6 Flash, Gemini 3.5 Flash-Lite und Gemini 3.5 Flash Cyber an. Gemini 3.5 Pro wurde in diesem Launch nicht veröffentlicht. Google sagt, es werde mit Partnern getestet und sei breit verfügbar, wenn es bereit ist.
- Gemini 3.6 Flash ist allgemein verfügbar in der Gemini API, Google AI Studio, Gemini Enterprise Agent Platform, Gemini App und Google Antigravity. Gemini 3.5 Flash-Lite ist allgemein in der Gemini API verfügbar und zielt auf Workflows mit hohem Durchsatz und niedrigen Kosten.
- Gemini 3.5 Flash Cyber ist nur eingeschränkt zugänglich und für Verwundbarkeits-Erkennung, -Validierung und -Patchen innerhalb von CodeMender ausgelegt.
- Laut Google verwendet Gemini 3.6 Flash 17% weniger Ausgabetokens als 3.5 Flash bei Artificial Analysis und bis zu 65% weniger Ausgabetokens in DeepSWE-ähnlichen Tests.
- Artificial Analysis berichtet unabhängig über Gemini 3.6 Flash mit einem Intelligence-Index von 50, 251.3 Ausgabetokens/s und einer durchschnittlichen Aufgaben-Kostenreduktion von $0.59 auf $0.50 im Vergleich zu Gemini 3.5 Flash.
- DeepSWE listet Gemini 3.6 Flash mit 49% pass@1 und $3.53 durchschnittlichen Kosten pro Aufgabe, verglichen mit Gemini 3.5 Flash mit 37% pass@1 und $7.34 durchschnittlichen Kosten pro Aufgabe.
- CometAPI führt derzeit Gemini 3.6 Flash mit $1.20/M Eingabe und $6.00/M Ausgabe und Gemini 3.5 Flash-Lite mit $0.24/M Eingabe und $2.016/M Ausgabe. Prüfen Sie das Live-Dashboard, bevor Sie Preise in der Produkt-UI veröffentlichen.
Was hat Google veröffentlicht?
Gemini 3.6 Flash
Gemini 3.6 Flash ist das wichtigste Modell dieses Releases für allgemeine Entwickler. Es ist ein stabiles Flash-Tier-Modell, gebaut für Produktions-Agenten, Coding, multimodale Workflows, Dokumentenanalysen, Langkontext-Reasoning und Wissensarbeit.
Google beschreibt Gemini 3.6 Flash als Arbeitspferd, das besseres Coding, bessere Wissensarbeit und bessere multimodale Performance als Gemini 3.5 Flash liefert und gleichzeitig die Token-Effizienz verbessert. Die offizielle Gemini-API-Seite sagt, das Modell sei für das agentische Zeitalter konzipiert und besonders effektiv für schnelle Coding- und Iterationsschleifen.
Die öffentliche Modell-ID lautet:
gemini-3.6-flash
Kernspezifikationen siehe Gemini 3.6 Flash model page.
Gemini 3.5 Flash-Lite
Gemini 3.5 Flash-Lite ist das Effizienzmodell des Releases. Google positioniert es als das schnellste und kostengünstigste Modell der 3.5-Klasse, optimiert für Hochdurchsatz-Ausführung, Dokumenten-Parsing, Übersetzung, Klassifikation, Routing und einfache Datenextraktion.
Die öffentliche Modell-ID lautet:
gemini-3.5-flash-lite
Kernspezifikationen siehe Gemini 3.5 Flash-Lite model page.
Der entscheidende Unterschied ist nicht das Kontextfenster. Flash-Lite behält dasselbe Profil mit 1M Eingabe und 64K Ausgabe wie 3.6 Flash. Der Unterschied liegt im Routing-Zweck: Flash-Lite ist für Durchsatz und Kostenkontrolle gedacht; 3.6 Flash ist für schwierigere Aufgaben, bei denen Qualität und Tool-Zuverlässigkeit wichtiger sind.
Gemini 3.5 Flash Cyber
Gemini 3.5 Flash Cyber ist ein spezialisiertes Cybersecurity-Modell auf Basis von Gemini 3.5 Flash, feinabgestimmt auf Schwachstellenentdeckung, -validierung und Patch-Generierung.
Dies ist kein normales öffentliches API-Modell. Google sagt, es werde Regierungen und vertrauenswürdigen Partnern über CodeMender im Rahmen eines Programms mit eingeschränktem Zugang bereitgestellt. Diese Einschränkung ist für Entwickler wichtig: Planen Sie keine öffentliche SaaS-Roadmap rund um den direkten Zugriff auf Flash Cyber, es sei denn, Sie sind Teil dieses Piloten oder eines geprüften defensiven Sicherheitsprogramms.
Das Modell ist dennoch wichtig, weil es zeigt, wohin Google mit Gemini geht: effiziente Spezialistenmodelle, koordiniert durch Agenteninfrastruktur. Anstatt ein einziges Frontier-Modell alles erledigen zu lassen, baut Google kleinere, spezialisierte Systeme, die wiederholte Scans durchführen, Berichte kombinieren und Code zu geringeren Kosten patchen können.
Sollten Sie Gemini 3.5 Pro überspringen?
Die praktische Antwort
Für die meisten Produktionsteams ja: Beginnen Sie jetzt mit der Evaluierung von Gemini 3.6 Flash und Gemini 3.5 Flash-Lite, statt auf Gemini 3.5 Pro oder Gemini 4 Pro zu warten.
Das heißt nicht, dass Gemini 3.5 Pro unwichtig sein wird. Es bedeutet, dass die neuesten verfügbaren Modelle bereits einen großen Teil der hochvolumigen KI-Workloads abdecken: Coding-Agenten, Retrieval-Agenten, Dokumenten-Workflows, multimodales Parsing, Datenextraktion, Prompt-Routing, UI-Automatisierung, Langkontext-Review und Agenten-Subtask-Ausführung.
Googles eigene Ankündigung sagt, Gemini 3.5 Pro werde noch mit Partnern getestet und bei Verfügbarkeit breit veröffentlicht. Keine öffentliche gemini-3.5-pro-API-Modellseite, keine endgültige Preistabelle oder Modellkarte ist nötig, um die Produktionseffizienz schon heute zu verbessern.
Wann das Warten auf Gemini 3.5 Pro weiterhin sinnvoll ist
Behalten Sie Gemini 3.5 Pro oder Gemini 4 Pro im Blick, wenn Ihr Workload mehr Frontier-Reasoning als Durchsatz benötigt. Beispiele sind fortgeschrittene Forschungssynthese, hochkomplexe Engineering-Aufgaben über viele Dateien, schwierige Mathematik, wissenschaftliches Reasoning, unternehmenskritische Analysen und Aufgaben, bei denen ein Flash-Modell trotz sorgfältigen Prompt- und Tool-Designs noch scheitert.
Die stärkste Modellstrategie ist nicht „auf Pro warten“ oder „alles durch Flash ersetzen“. Es ist ein gestuftes Routing:
- Verwenden Sie Gemini 3.5 Flash-Lite für kostengünstige, hochvolumige Subtasks.
- Verwenden Sie Gemini 3.6 Flash für Coding, multimodale Analyse, Dokumentenreview, Langkontext-Synthese und agentische Workflows.
- Routen Sie die härtesten oder risikoreichsten Anfragen über CometAPI an ein Frontier-Reasoning-Modell.
- Fügen Sie Gemini 3.5 Pro der Benchmark-Suite hinzu, sobald Google und CometAPI es verfügbar machen.
Gemini 3.6 Flash Benchmarks: Was hat sich verbessert?
Benchmark-Tabelle von Google DeepMind
Die Gemini 3.6 Flash-Seite von Google DeepMind listet folgende Vergleiche gegenüber Gemini 3.5 Flash:
| Benchmark | Was es misst | Gemini 3.6 Flash | Gemini 3.5 Flash | Änderung |
|---|---|---|---|---|
| SWE-Bench Pro | Diverse agentische Coding-Aufgaben | 58.7% | 55.1% | +3.6 Punkte |
| DeepSWE v1.1 | Langhorizont-Softwareentwicklung | 49% | 37% | +12 Punkte |
| Terminal-Bench 2.1 | Agentische Terminal-Programmierung | 78.0% | 76.2% | +1.8 Punkte |
| MLE-Bench | Machine-Learning-Engineering | 63.9% | 49.7% | +14.2 Punkte |
| GDPval-AA v2 | Elo für Wissensarbeit | 1421 | 1349 | +72 Elo |
| OSWorld-Verified | Agentische Computernutzung | 83.0% | 78.4% | +4.6 Punkte |
| CharXiv Reasoning, ohne Tools | Diagramm- und Informationssynthese | 85.2% | 84.2% | +1.0 Punkt |
| CharXiv Reasoning, mit Tools | Diagramm- und Informationssynthese | 89.4% | 84.9% | +4.5 Punkte |
| GDM-MRCR v2, 128K Durchschnitt | Langkontext-Retrieval | 91.8% | 77.3% | +14.5 Punkte |
| GDM-MRCR v2, 1M punktweise | Langkontext-Retrieval | 54.0% | 26.6% | +27.4 Punkte |
Die größten Zuwächse liegen genau in den Bereichen, die für Agenten wichtig sind: Langhorizont-Coding, Machine-Learning-Engineering, Langkontext-Retrieval und Computernutzung. Die kleineren Zuwächse bei Terminal-Bench und CharXiv zeigen, dass dies kein uniformes „alles hat sich verdoppelt“-Release ist. Es ist eine gezielte Verbesserung bei Zuverlässigkeit, Token-Effizienz und schwieriger mehrstufiger Ausführung.
Unabhängige Daten von Artificial Analysis
Artificial Analysis bietet ein nützliches Gegengewicht zu Anbieter-Benchmarks. Im Bericht vom Juli 2026 heißt es, Gemini 3.6 Flash halte denselben Intelligence-Index wie Gemini 3.5 Flash: 50. Das ist wichtig, weil es nahelegt, dass Gemini 3.6 Flash nicht unbedingt einen Sprung bei der Rohintelligenz darstellt.
Die große Verbesserung ist die Effizienz:
| Metrik | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| Artificial Analysis Intelligence Index | 50 | 50 |
| Durchschnittliche Zeit pro Aufgabe | 1.3 Minuten | 2.7 Minuten |
| Durchschnittliche Kosten pro Aufgabe | $0.50 | $0.59 |
| Ausgabegeschwindigkeit | 251.3 Tokens/s | Nicht in dieser Tabelle |
| Zeit bis zum ersten Token | 14.00s | Nicht in dieser Tabelle |
Darum ist die treffendere Überschrift nicht „Gemini 3.6 Flash ist schlauer als alles andere“. Treffender ist: Gemini 3.6 Flash macht Agenten-Workloads billiger und schneller, ohne das Intelligenzniveau von Gemini 3.5 Flash zu opfern.
DeepSWE: Langhorizont-Coding-Daten
DeepSWE von Datacurve ist besonders relevant, weil es sich auf originale, langhorizontige Software-Engineering-Aufgaben konzentriert. Das Leaderboard beschreibt 113 Aufgaben über 91 Repositories und 5 Sprachen.
Auf dem Leaderboard vom 21. Juli 2026:
| Modell | Pass@1 | Durchschnittskosten | Ausgabetokens | Agentenschritte |
|---|---|---|---|---|
| Gemini 3.6 Flash high | 49% ±5 | $3.53 | 97K | 108 |
| Gemini 3.5 Flash medium | 37% ±2 | $7.34 | 276K | 86 |
Die interessanteste Zahl ist nicht nur der Pass@1-Zuwachs um 12 Punkte. Es ist der Rückgang der Ausgabetokens: 97K versus 276K. Das sind grob 65% weniger Ausgabetokens und deckt sich mit Googles Launch-Aussage. Für Coding-Agenten können weniger Ausgabetokens weniger Drift, weniger ausufernde Reparaturschleifen, weniger Kontextverschmutzung und geringere Kosten pro erledigtem Issue bedeuten.

Quelle: Gemini
Gemini 3.5 Flash-Lite Benchmarks: Warum es wichtig ist
Flash-Lite ist das Durchsatz-Modell
Gemini 3.5 Flash-Lite ist für hochvolumige Ausführung konzipiert. Es ist das Modell, das Sie testen sollten, wenn Ihr System Tausende oder Millionen kleiner oder mittlerer Aufgaben verarbeiten muss:
- Belegerfassung,
- Produktkatalog-Parsing,
- Dokumenten-Chunk-Labeling,
- Übersetzung,
- Klassifikation,
- Synthese von Suchergebnissen,
- Query-Rewriting,
- Tool-Call-Routing,
- leichte Coding-Aufgaben,
- Agenten-Subtask-Ausführung,
- multimodale Datenextraktion.
Google sagt, Flash-Lite erreicht laut Artificial Analysis 350 Ausgabetokens pro Sekunde und ist auf der Standard-Gemini-API-Stufe mit $0.30/M Eingabetokens und $2.50/M Ausgabetokens bepreist.
Flash-Lite vs. Gemini 3.1 Flash-Lite
Die Modellkarte von Google DeepMind zeigt deutliche Zuwächse gegenüber Gemini 3.1 Flash-Lite:
| Benchmark | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite | Änderung |
|---|---|---|---|
| SWE-Bench Pro | 54.2% | 38.3% | +15.9 Punkte |
| Terminal-Bench 2.1 | 54.0% | 31.0% | +23.0 Punkte |
| MLE-Bench | 39.2% | 22.0% | +17.2 Punkte |
| GDPval-AA v2 | 1140 | 642 | +498 Elo |
| OSWorld-Verified | 74.0% | 54.3% | +19.7 Punkte |
| CharXiv, ohne Tools | 74.5% | 73.2% | +1.3 Punkte |
| CharXiv, mit Tools | 76.5% | 75.6% | +0.9 Punkte |
| GDM-MRCR v2, 128K Durchschnitt | 72.2% | 60.1% | +12.1 Punkte |
| GDM-MRCR v2, 1M punktweise | 21.3% | 12.3% | +9.0 Punkte |
Artificial Analysis berichtet außerdem über einen Sprung im Intelligence Index von 25 für Gemini 3.1 Flash-Lite auf 36 für Gemini 3.5 Flash-Lite, während die Zeit pro Aufgabe von 1.0 Minute auf 0.6 Minuten sinkt. Der Trade-off ist, dass die Kosten pro Aufgabe in diesem Benchmark-Set von $0.04 auf $0.09 stiegen, da das neue Modell höher bepreist ist als 3.1 Flash-Lite.

Quelle: Gemini
Dieser Trade-off ist akzeptabel, wenn die bessere Qualität nachgelagerte Retries, manuelle Reviews oder Eskalationen zu einem teureren Modell reduziert. Er ist weniger attraktiv, wenn Ihr Workload bereits mit Gemini 3.1 Flash-Lite perfekt gelöst ist. Testen Sie, bevor Sie den gesamten Traffic migrieren.
Die Bedeutung des Gemini-Release
Es bestätigt den Wandel vom "größten Modell" zum "besten Arbeitspferd"
Der KI-Markt fokussiert sich oft auf Frontier-Flaggschiffmodelle. Gemini 3.6 Flash weist in eine andere Richtung: Produktions-KI-Systeme brauchen zuverlässige, schnelle, kosteneffiziente Modelle, die viele reale Aufgaben ohne Verschwendung erledigen können.
Darum betont das Release Token-Effizienz, weniger Tool-Aufrufe, geringere Latenz und weniger Überarbeitungsschleifen. Für Entwickler sind das keine sekundären Metriken. Sie entscheiden darüber, ob ein KI-Agent in großem Maßstab laufen kann, ohne das Finanzteam zu überraschen.
Es verschafft Google ein stärkeres Produktionsmodell, während Gemini 3.5 Pro wartet
Gemini 3.5 Pro befindet sich weiterhin im Partnertest. Statt auf Pro zu warten, hat Google ein stärkeres Flash-Modell und ein günstigeres Flash-Lite-Modell veröffentlicht. Das gibt Entwicklern zwei sofortige Optionen:
- Gemini 3.6 Flash für stärkere Arbeitspferd-Intelligenz.
- Gemini 3.5 Flash-Lite für günstigere, schnellere Hochvolumen-Ausführung.
Das ist eine praktische Produktstrategie. Viele Unternehmen brauchen nicht bei jeder Anfrage das teuerste Modell. Sie brauchen ein Modellportfolio und Routing-Logik.
Es macht Model-Routing wichtiger
Gemini 3.6 Flash sollte nicht überall eingesetzt werden. Flash-Lite ebenso wenig. Die besten KI-Systeme 2026 routen dynamisch:
- Starten Sie günstig, wenn die Aufgabe einfach ist.
- Verwenden Sie Gemini 3.6 Flash, wenn Reasoning, multimodales Verständnis oder Tool-Nutzung zählt.
- Eskalieren Sie nur, wenn eine Anfrage Vertrauensschwellen verfehlt.
- Cachen Sie wiederholten Langkontext.
- Überwachen Sie die Kosten pro erfolgreich erledigter Aufgabe, nicht nur die Kosten pro Token.
Das ist die stärkste CometAPI-Empfehlung in diesem Artikel: Wählen Sie nicht ein Modell als gesamte KI-Strategie. Bauen Sie einen Router und lassen Sie jedes Modell seinen Traffic verdienen.
FAQs
Ist Gemini 3.5 Pro jetzt verfügbar?
Zum Zeitpunkt der Erstellung (Juli 2026) nicht als allgemein verfügbares Modell in der Gemini API. Google sagt, Gemini 3.5 Pro werde mit Partnern getestet und breit veröffentlicht, sobald es bereit ist.
Ist Gemini 3.6 Flash besser als Gemini 3.5 Flash?
Für viele Produktions-Agenten- und Coding-Workflows ja. Google berichtet von besseren Benchmark-Ergebnissen und geringerem Ausgabetoken-Verbrauch. Artificial Analysis meldet eine ähnliche Intelligence-Index-Qualität, aber geringere Zeit pro Aufgabe und geringere Kosten pro Aufgabe.
Wofür ist Gemini 3.5 Flash-Lite am besten geeignet?
Gemini 3.5 Flash-Lite ist am besten für hochvolumige, latenz- und kostenempfindliche Workloads wie Extraktion, Klassifikation, Übersetzung, Suche, Routing und Subagenten-Ausführung geeignet.
Kann ich Gemini 3.5 Flash Cyber über die öffentliche Gemini API nutzen?
Google beschreibt Gemini 3.5 Flash Cyber als Modell mit eingeschränktem Zugang für Regierungen und vertrauenswürdige Partner über CodeMender. Es ist nicht als Standardmodell für die öffentliche API positioniert.
Wie viel kostet Gemini 3.6 Flash?
Die Standardpreise der Gemini API von Google listen Gemini 3.6 Flash mit $1.50 pro 1M Eingabetokens und $7.50 pro 1M Ausgabetokens. CometAPI führt es derzeit mit $1.20/M Eingabe und $6.00/M Ausgabe. Überprüfen Sie stets die Live-Preise, bevor Sie in die Produktion gehen.
Wie viel kostet Gemini 3.5 Flash-Lite?
Die Standardpreise der Gemini API von Google listen Gemini 3.5 Flash-Lite mit $0.30 pro 1M Eingabetokens und $2.50 pro 1M Ausgabetokens. CometAPI führt es derzeit mit $0.24/M Eingabe und $2.016/M Ausgabe. Überprüfen Sie stets die Live-Preise, bevor Sie in die Produktion gehen.
Sollten Entwickler auf Gemini 3.5 Pro warten?
Die meisten Teams sollten nicht warten. Testen Sie jetzt Gemini 3.6 Flash für komplexe Workflows und Gemini 3.5 Flash-Lite für hochvolumige Subtasks. Fügen Sie Gemini 3.5 Pro Ihrer Benchmark-Suite hinzu, sobald öffentliche Spezifikationen, Preise und Verfügbarkeit bestätigt sind.
Fazit
Googles Gemini-Release vom Juli 2026 ist am besten als Effizienz-Release zu verstehen, nicht als Flaggschiff-Pro-Release. Gemini 3.6 Flash eliminiert nicht die Notwendigkeit eines zukünftigen Gemini 3.5 Pro, gibt Entwicklern aber etwas unmittelbar Nützliches: ein allgemein verfügbares Modell mit starker Coding-, multimodaler, Langkontext- und agentischer Performance zu geringeren Ausgabetoken-Kosten als Gemini 3.5 Flash.
Gemini 3.5 Flash-Lite füllt die andere Hälfte des Produktionsstacks. Es ist das günstige, schnelle Modell für Subtasks, die keine maximale Reasoning-Tiefe benötigen. Gemini 3.5 Flash Cyber weist in eine Zukunft spezialisierter defensiver Sicherheitsagenten, aber der eingeschränkte Zugang macht es heute eher zu einem strategischen Signal als zu einem allgemeinen Entwicklerwerkzeug.
