Specyfikacja techniczna Gemini 3.5 Flash-Lite
| Parametr | Gemini 3.5 Flash-Lite |
|---|---|
| Dostawca | Google DeepMind |
| ID modelu | gemini-3.5-flash-lite |
| Rodzina modelu | Gemini 3.5 |
| Dostępność | General Availability (GA) |
| Typy wejściowe | Text, Image, Video, Audio, PDF |
| Typy wyjścia | Text |
| Okno kontekstu | 1,048,576 tokenów |
| Maksymalna liczba tokenów wyjściowych | 65,536 tokenów |
| Myślenie | Obsługiwane (domyślnie: minimal; także medium i high) |
| Wywoływanie funkcji | Yes |
| Wykonywanie kodu | Yes |
| Wyszukiwanie plików | Yes |
| Kontekst URL | Yes |
| Grounding wyszukiwania | Yes |
| Strukturyzowane dane wyjściowe | Yes |
| Używanie komputera | Not supported |
| Buforowanie | Supported |
| Główny nacisk | Wnioskowanie o wysokiej przepustowości, niskich opóźnieniach i niskim koszcie |
Czym jest Gemini 3.5 Flash-Lite?
Gemini 3.5 Flash-Lite to najszybszy i najbardziej opłacalny kosztowo model Google w rodzinie Gemini 3.5. Jest zoptymalizowany pod kątem obciążeń, w których opóźnienie, przepustowość i koszt API są ważniejsze niż maksymalna wydajność rozumowania. Typowe zastosowania obejmują parsowanie dokumentów, ekstrakcję danych strukturalnych, routowanie, lekkie/proste kodowanie oraz autonomicznych podagentów działających na dużą skalę. Google pozycjonuje go jako zalecaną ścieżkę aktualizacji z Gemini 3.1 Flash-Lite i Gemini 2.5 Flash dla wdrożeń produkcyjnych.
Główne funkcje Gemini 3.5 Flash-Lite
- Zoptymalizowany pod wnioskowanie o dużej skali i niskim koszcie.
- Obsługuje okno kontekstu o wielkości 1 miliona tokenów dla długich dokumentów i repozytoriów.
- Natywne wejścia multimodalne, w tym tekst, obrazy, wideo, audio i PDF.
- Obsługuje wywoływanie funkcji, wykonywanie kodu, wyszukiwanie plików, kontekst URL, grounding wyszukiwania oraz strukturyzowane dane wyjściowe.
- Konfigurowalne poziomy myślenia (
minimal,medium,high) w celu zrównoważenia szybkości i jakości rozumowania. - Znacznie poprawia kodowanie, rozumowanie i przepływy pracy agentowe w porównaniu z Gemini 3.1 Flash-Lite, utrzymując bardzo niskie opóźnienia.
Wyniki benchmarków Gemini 3.5 Flash-Lite
Google podaje, że Gemini 3.5 Flash-Lite znacząco przewyższa poprzednie generacje Flash-Lite w kodowaniu, rozumieniu dokumentów i przepływach agentowych, pozostając najtańszym modelem w linii Gemini 3.5. Gemini 3.5 Flash-Lite uzyskał 54% w teście Terminal-Bench 2.1, co stanowi znaczną poprawę względem wyniku 31% jego poprzednika.
Jego mocne strony to klasyfikacja, ekstrakcja, odpowiedzi czatowe oraz proste odpowiedzi wspierane wyszukiwaniem. To właśnie obszary, w których szybkie, niskokosztowe modele mogą się wyróżniać.
Gemini 3.5 Flash-Lite vs Gemini 3.6 Flash vs Gemini 3.5 Flash
| Aspekt | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|---|
| Pozycjonowanie | Najszybszy i najtańszy do zadań codziennych o dużej skali (np. przetwarzanie dokumentów, wyszukiwanie) | Aktualny flagowy model Flash: najlepsza równowaga inteligencji, efektywności i wydajności agentowej | Silny model agentowy/kodowania (obecnie w dużej mierze zastąpiony przez 3.6) |
| Najlepsze do | Przepływy pracy o wysokiej przepustowości i niskim koszcie | Kodowanie, multimodalność, złożone agenty, prace wymagające wiedzy | Ogólne zadania agentowe i kodowania |
| Inteligencja / wydajność | Dobra (przewyższa starsze wersje Lite; konkurencyjna w wielu zadaniach agentowych) | Najwyższa spośród trzech (wyraźne zyski w kodowaniu i zadaniach agentowych) | Silna (blisko granicy możliwości serii Flash) |
| Kluczowe benchmarki | - Terminal-Bench: ~54%- Mocny w zadaniach dokumentowych i wysokoskalowych | - DeepSWE: 49% (vs 37%)- MLE-Bench: 63.9% (vs 49.7%)- OSWorld: 83% (vs 78.4%) | - Terminal-Bench: 76.2%- Niższa niż 3.6 w większości zadań kodowania/agentowych |
| Szybkość | Najszybszy (~350 tokenów wyjściowych/sec) | Bardzo szybki (~280 t/s) | Szybki |
| Efektywność | Doskonała dla dużej skali | Najlepsza (średnio o 17% mniej tokenów wyjściowych; do 65% w kodowaniu) | Dobra |
| Multimodalność | Tekst + Obraz + Wideo + Audio | Tekst + Obraz + Wideo + Audio (silniejsze rozumowanie) | Tekst + Obraz + Wideo + Audio |
| Okno kontekstu | ~1M tokenów | ~1M tokenów | ~1M tokenów |
| Maksymalna liczba tokenów wyjściowych | ~64k | ~64k | ~64k |
| Cennik (za 1M tokenów) | Najtańszy: ~$0.30 wejście / $2.50 wyjście | $1.50 wejście / $7.50 wyjście | $1.50 wejście / $9.00 wyjście |
| Efektywny koszt | Najniższy koszt na zadanie dla prostych prac | Niższy niż 3.5 dzięki zwiększonej efektywności | Wyższy niż 3.6 |
Podsumowanie rekomendacji
- Wybierz 3.5 Flash-Lite — gdy potrzebujesz maksymalnej szybkości i minimalnego kosztu dla zadań o dużej skali lub prostych.
- Wybierz 3.6 Flash — dla większości użytkowników i deweloperów (obecnie najlepszy ogólny wybór).
- Wybierz 3.5 Flash — tylko jeśli masz istniejące przepływy pracy powiązane z tym modelem (zaplanuj aktualizację do 3.6).
Ograniczenia Gemini 3.5 Flash-Lite
- Zoptymalizowany pod kątem efektywności, a nie rozumowania na poziomie czołowych modeli.
- Używanie komputera nie jest obsługiwane.
- Natywne generowanie obrazów i dźwięku jest niedostępne.
- Dostrajanie nie jest obecnie obsługiwane.
- Złożone zadania wieloetapowego rozumowania są na ogół lepiej obsługiwane przez Gemini 3.5 Flash lub Gemini 3.6 Flash.