Technische Spezifikationen von Gemini 3.5 Flash-Lite
| Element | Gemini 3.5 Flash-Lite |
|---|---|
| Anbieter | Google DeepMind |
| Modell-ID | gemini-3.5-flash-lite |
| Modellfamilie | Gemini 3.5 |
| Verfügbarkeit | Allgemein verfügbar (GA) |
| Eingabetypen | Text, Bild, Video, Audio, PDF |
| Ausgabetypen | Text |
| Kontextfenster | 1,048,576 Tokens |
| Maximale Ausgabe | 65,536 Tokens |
| Denken | Unterstützt (Standard: minimal; außerdem medium und high) |
| Function calling | Ja |
| Code execution | Ja |
| File Search | Ja |
| URL Context | Ja |
| Search Grounding | Ja |
| Structured Output | Ja |
| Computer Use | Nicht unterstützt |
| Caching | Unterstützt |
| Primärer Fokus | Hoher Durchsatz, geringe Latenz, kostengünstige Inferenz |
Was ist Gemini 3.5 Flash-Lite?
Gemini 3.5 Flash-Lite ist das schnellste und kosteneffizienteste Modell in Googles Gemini-3.5-Familie. Es ist für Workloads optimiert, bei denen Latenz, Durchsatz und API-Kosten wichtiger sind als maximale Reasoning-Leistung. Typische Anwendungen umfassen Dokumenten-Parsing, Extraktion strukturierter Daten, Routing, leichte Programmieraufgaben sowie autonome Subagenten im großen Maßstab. Google positioniert es als den empfohlenen Upgrade-Pfad von Gemini 3.1 Flash-Lite und Gemini 2.5 Flash für Produktionsumgebungen.
Hauptfunktionen von Gemini 3.5 Flash-Lite
- Optimiert für hochvolumige, kostengünstige Inferenz.
- Unterstützt ein 1-Million-Token-Kontextfenster für lange Dokumente und Repositorien.
- Native multimodale Eingaben, einschließlich Text, Bilder, Video, Audio und PDF.
- Unterstützt Function Calling, Code Execution, File Search, URL Context, Search Grounding und strukturierte Ausgaben.
- Konfigurierbare Denkstufen (
minimal,medium,high), um Geschwindigkeit und Reasoning-Qualität auszubalancieren. - Verbessert Programmierung, Reasoning und agentische Workflows gegenüber Gemini 3.1 Flash-Lite deutlich bei sehr niedriger Latenz.
Benchmark-Leistung von Gemini 3.5 Flash-Lite
Google gibt an, dass Gemini 3.5 Flash-Lite frühere Flash-Lite-Generationen in den Bereichen Programmierung, Dokumentverständnis und agentische Workflows deutlich übertrifft und gleichzeitig das günstigste Modell der Gemini-3.5-Reihe bleibt. Gemini 3.5 Flash-Lite erzielte 54% im Terminal-Bench 2.1-Test, eine deutliche Verbesserung gegenüber dem Vorgänger mit 31%.
Seine Stärken liegen in Klassifikation, Extraktion, Chat-Antworten und einfachen Retrieval-gestützten Antworten. Genau dort können schnelle, kostengünstige Modelle glänzen.
Gemini 3.5 Flash-Lite vs Gemini 3.6 Flash vs Gemini 3.5 Flash
| Aspekt | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|---|
| Positionierung | Am schnellsten und günstigsten für hochvolumige Alltagsaufgaben (z. B. Dokumentverarbeitung, Suche) | Aktuelles Flaggschiff der Flash-Reihe: beste Balance aus Intelligenz, Effizienz und agentischer Leistung | Starkes agentisches/Programmierungsmodell (nun weitgehend von 3.6 abgelöst) |
| Am besten geeignet für | Workflows mit hohem Durchsatz und niedrigen Kosten | Programmierung, Multimodal, komplexe Agenten, Wissensarbeit | Allgemeine agentische Aufgaben und Programmierung |
| Intelligenz/Leistung | Gut (übertrifft ältere Lite-Modelle; wettbewerbsfähig bei vielen agentischen Aufgaben) | Am höchsten der drei (spürbare Zugewinne bei Programmierung und agentischen Aufgaben) | Stark (nahe am Spitzenfeld der Flash-Serie) |
| Wesentliche Benchmarks | - Terminal-Bench: ~54% - Stark bei Dokumenten- und hochvolumigen Aufgaben | - DeepSWE: 49% (vs 37%) - MLE-Bench: 63.9% (vs 49.7%) - OSWorld: 83% (vs 78.4%) | - Terminal-Bench: 76.2% - Unter 3.6 bei den meisten Programmier-/agentischen Aufgaben |
| Geschwindigkeit | Am schnellsten (~350 output tokens/sec) | Sehr schnell (~280 t/s) | Schnell |
| Effizienz | Hervorragend für hohes Volumen | Am besten (im Durchschnitt 17% weniger Ausgabetokens; bis zu 65% bei Programmierung) | Gut |
| Multimodal | Text + Bild + Video + Audio | Text + Bild + Video + Audio (stärkeres Reasoning) | Text + Bild + Video + Audio |
| Kontextfenster | ~1M Tokens | ~1M Tokens | ~1M Tokens |
| Max. Ausgabetokens | ~64k | ~64k | ~64k |
| Preis (pro 1M Tokens) | Am günstigsten: ~$0.30 Eingabe / $2.50 Ausgabe | $1.50 Eingabe / $7.50 Ausgabe | $1.50 Eingabe / $9.00 Ausgabe |
| Effektive Kosten | Am niedrigsten pro Aufgabe bei einfachen Arbeiten | Niedriger als 3.5 aufgrund von Effizienzgewinnen | Höher als 3.6 |
Zusammenfassende Empfehlungen
- Wählen Sie 3.5 Flash-Lite — wenn Sie maximale Geschwindigkeit und minimale Kosten für hochvolumige oder einfache Aufgaben benötigen.
- Wählen Sie 3.6 Flash — für die meisten Nutzer und Entwickler (aktuell die beste Gesamtwahl).
- Wählen Sie 3.5 Flash — nur wenn Ihre bestehenden Workflows daran gebunden sind (Upgrade auf 3.6 einplanen).
Einschränkungen von Gemini 3.5 Flash-Lite
- Für Effizienz statt für Reasoning auf Spitzen-Niveau optimiert.
- Computer Use wird nicht unterstützt.
- Native Bild- und Audiogenerierung ist nicht verfügbar.
- Fine-Tuning wird derzeit nicht unterstützt.
- Komplexe Reasoning-Aufgaben mit mehreren Schritten sind in der Regel besser für Gemini 3.5 Flash oder Gemini 3.6 Flash geeignet.