Technische Spezifikationen von Gemini 3.5 Flash-Lite
| Eintrag | Gemini 3.5 Flash-Lite |
|---|---|
| Anbieter | Google DeepMind |
| Modell-ID | gemini-3.5-flash-lite |
| Modellfamilie | Gemini 3.5 |
| Verfügbarkeit | Allgemeine Verfügbarkeit (GA) |
| Eingabetypen | Text, Bild, Video, Audio, PDF |
| Ausgabetypen | Text |
| Kontextfenster | 1,048,576 tokens |
| Maximale Ausgabe | 65,536 tokens |
| Denken | Unterstützt (Standard: minimal; auch medium und high) |
| Function Calling | Ja |
| Code Execution | Ja |
| File Search | Ja |
| URL Context | Ja |
| Search Grounding | Ja |
| Structured Output | Ja |
| Computer Use | Nicht unterstützt |
| Caching | Unterstützt |
| Hauptfokus | Inferenz mit hohem Durchsatz, niedriger Latenz und geringen Kosten |
Was ist Gemini 3.5 Flash-Lite?
Gemini 3.5 Flash-Lite ist das schnellste und kosteneffektivste Modell der Gemini 3.5-Familie von Google. Es ist für Workloads optimiert, bei denen Latenz, Durchsatz und API-Kosten wichtiger sind als maximale Reasoning-Performance. Typische Anwendungsfälle sind das Parsen von Dokumenten, die Extraktion strukturierter Daten, Routing, leichtgewichtiges Coding sowie der Betrieb autonomer Subagenten im großen Maßstab. Google positioniert es als den empfohlenen Upgrade-Pfad von Gemini 3.1 Flash-Lite und Gemini 2.5 Flash für Produktionsumgebungen.
Hauptfunktionen von Gemini 3.5 Flash-Lite
- Optimiert für hochvolumige, kostengünstige Inferenz.
- Unterstützt ein Kontextfenster mit 1 Million tokens für lange Dokumente und Repositorien.
- Native multimodale Eingaben einschließlich Text, Bilder, Video, Audio und PDF.
- Unterstützt Function Calling, Code Execution, File Search, URL Context, Search Grounding und Structured Outputs.
- Konfigurierbare Denkstufen (
minimal,medium,high), um Geschwindigkeit und Reasoning-Qualität auszubalancieren. - Deutlich verbesserte Coding-, Reasoning- und agentische Workflows im Vergleich zu Gemini 3.1 Flash-Lite bei weiterhin sehr niedriger Latenz.
Benchmark-Leistung von Gemini 3.5 Flash-Lite
Laut Google übertrifft Gemini 3.5 Flash-Lite frühere Flash-Lite-Generationen in den Bereichen Coding, Dokumentenverständnis und agentische Workflows deutlich, bleibt dabei jedoch das kostengünstigste Modell innerhalb der Gemini 3.5-Reihe. Gemini 3.5 Flash-Lite erzielte 54% im Terminal-Bench 2.1-Test, eine erhebliche Verbesserung gegenüber dem Vorgänger mit 31%.
Seine Stärken liegen in Klassifikation, Extraktion, Chat-Antworten und einfachen retrieval-gestützten Antworten. Genau dort können schnelle, kostengünstige Modelle glänzen.
Gemini 3.5 Flash-Lite vs Gemini 3.6 Flash vs Gemini 3.5 Flash
| Aspekt | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|---|
| Positionierung | Schnellstes & günstigstes für alltägliche Aufgaben mit hohem Volumen (z. B. Dokumentenverarbeitung, Suche) | Aktuelles Flash-Flaggschiff: Bester Ausgleich aus Intelligenz, Effizienz & agentischer Performance | Starkes agentisches/Coding-Modell (nun weitgehend von 3.6 abgelöst) |
| Am besten geeignet für | Workflows mit hohem Durchsatz und niedrigen Kosten | Coding, multimodal, komplexe Agenten, Wissensarbeit | Allgemeine agentische & Coding-Aufgaben |
| Intelligenz/Leistung | Gut (übertrifft ältere Lite-Modelle; konkurrenzfähig bei vielen agentischen Aufgaben) | Am höchsten der drei (spürbare Zuwächse bei Coding & agentisch) | Stark (nahe der Spitze der Flash-Serie) |
| Wichtigste Benchmarks | - Terminal-Bench: ~54%- Stark bei Dokumenten & Aufgaben mit hohem Volumen | - DeepSWE: 49% (vs 37%)- MLE-Bench: 63.9% (vs 49.7%)- OSWorld: 83% (vs 78.4%) | - Terminal-Bench: 76.2%- Niedriger als 3.6 bei den meisten Coding-/agentischen |
| Geschwindigkeit | Am schnellsten (~350 output tokens/sec) | Sehr schnell (~280 t/s) | Schnell |
| Effizienz | Exzellent für Volumen | Am besten (im Schnitt 17% weniger Output-Token; bis zu 65% beim Coding) | Gut |
| Multimodal | Text + Bild + Video + Audio | Text + Bild + Video + Audio (stärkeres Reasoning) | Text + Bild + Video + Audio |
| Kontextfenster | ~1M tokens | ~1M tokens | ~1M tokens |
| Max Output Tokens | ~64k | ~64k | ~64k |
| Preisgestaltung (pro 1M tokens) | Am günstigsten: ~$0.30 Eingabe / $2.50 Ausgabe | $1.50 Eingabe / $7.50 Ausgabe | $1.50 Eingabe / $9.00 Ausgabe |
| Effektive Kosten | Am niedrigsten pro Aufgabe bei einfacher Arbeit | Niedriger als 3.5 dank Effizienzgewinnen | Höher als 3.6 |
Zusammenfassende Empfehlungen
- Wählen Sie 3.5 Flash-Lite — wenn Sie maximale Geschwindigkeit und minimale Kosten für hohes Volumen oder einfache Aufgaben benötigen.
- Wählen Sie 3.6 Flash — für die meisten Nutzer und Entwickler (derzeit die insgesamt beste Wahl).
- Wählen Sie 3.5 Flash — nur wenn Sie bestehende Workflows daran gebunden haben (planen Sie ein Upgrade auf 3.6).
Einschränkungen von Gemini 3.5 Flash-Lite
- Für Effizienz statt Frontier-Level-Reasoning optimiert.
- Computer Use wird nicht unterstützt.
- Native Bild- und Audiogenerierung ist nicht verfügbar.
- Fine-tuning wird derzeit nicht unterstützt.
- Komplexe mehrstufige Reasoning-Aufgaben sind in der Regel besser mit Gemini 3.5 Flash oder Gemini 3.6 Flash aufgehoben.