Specyfikacje techniczne modelu Gemini 3.7 Flash
| Element | Gemini 3.7 Flash |
|---|---|
| Identyfikator modelu | gemini-3.7-flash |
| Dostawca | |
| Kontekst | 1,048,576 tokenów |
| Maksymalna liczba tokenów wyjściowych | 65,536 tokenów |
| Wejście | Tekst / Obraz / Wideo / Audio / PDF |
| Myślenie | Niski / Średni / Wysoki |
| Wywoływanie funkcji | ✅ |
| Wykonywanie kodu | ✅ |
| Powiązanie z wyszukiwaniem | ✅ |
| Powiązanie z Google Maps | ✅ |
| Kontekst URL | ✅ |
| Wyszukiwanie plików | ✅ |
| Użycie komputera | Wersja zapoznawcza |
| Data odcięcia wiedzy | marzec 2026 |
| Wydanie | 13 sierpnia 2026 |
Czym jest Gemini 3.7 Flash?
Gemini 3.7 Flash to iteracja z 13 sierpnia 2026 r. w linii Gemini 3 Flash firmy Google. Google przedstawia go jako najbardziej inteligentną jak dotąd „jednostkę roboczą” Flash do kodowania i agentów AI, z ulepszeniami skoncentrowanymi na inżynierii oprogramowania, tworzeniu stron WWW, złożonej pracy z wiedzą oraz wieloetapowych przepływach pracy. Pojawił się trzy tygodnie po Gemini 3.6 Flash i jest opisywany jako rezultat opinii deweloperów oraz innowacji algorytmicznych.
Główne funkcje
- Kontekst 1M tokenów: Obsługuje duże repozytoria, długie dokumenty, rozbudowane rozmowy i wieloetapowe historie agentów.
- Wielomodalne rozumowanie: Przyjmuje wejścia tekstowe, obrazy, wideo, audio oraz PDF.
- Konfigurowalne myślenie: Obsługuje tryby NISKI, ŚREDNI i WYSOKI;
MINIMALnie jest obsługiwany. - Kodowanie agentowe: Znaczne postępy w debugowaniu, rozwiązywaniu problemów, trafności kodu przy pierwszym podejściu oraz inżynierii oprogramowania w długim horyzoncie.
- Tworzenie stron i interfejsów: Większa zgodność ze zrzutami ekranu, obrazami i systemami projektowymi.
- Przepływy pracy oparte na narzędziach: Wywoływanie funkcji, wykonywanie kodu, powiązanie z wyszukiwaniem, powiązanie z Google Maps, kontekst URL, wyszukiwanie plików i użycie komputera w wersji zapoznawczej.
- Praca z dużą liczbą dokumentów: Lepsza wydajność w finansach, prawie, naukach biologicznych, rozumieniu PDF oraz automatyzacji przedsiębiorstw.
Wydajność w benchmarkach
| Benchmark | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| Artificial Analysis Intelligence Index | 56 | 52 | 55 | 57 |
| FrontierCode 1.1 Main | 43.6% | 34.4% | 42.7% | 41.3% |
| DeepSWE v1.1 | 65.3% | 49.0% | — | — |
| GDM-MRCR v2 (8-needle, 128K) | 97.0% | 91.8% | 81.5% | 93.5% |
| OSWorld-2.0 | 47.9% | 33.8% | — | 50.2% |
| Agent's Last Exam | 26.3% | 24.2% | 33.3% | 28.0% |
| HLE-Verified | 53.6% | 51.2% | 31.0% | 51.1% |
| LABBench2 | 82.1% | 76.1% | 80.1% | 81.2% |
Google podaje także wyniki GDP.pdf na poziomie 34.0% wobec 22.0%, AutomationBench 30.4% wobec 17.0% oraz WebDev Arena Elo 1588 wobec 1538 dla Gemini 3.6 Flash.
Gemini 3.7 Flash vs Gemini 3.6 Flash vs Claude Sonnet 5
| Model | Pozycjonowanie | Kontekst | Kluczowe mocne strony |
|---|---|---|---|
| Gemini 3.7 Flash | Wydajna jednostka robocza do zadań agentowych | 1.05M | Kodowanie, tworzenie stron, agenci multimodalni, przepływy pracy z długim kontekstem |
| Gemini 3.6 Flash | Poprzednia jednostka robocza Flash | 1M | Ogólne zadania agentowe i zastosowania multimodalne |
| Claude Sonnet 5 | Model z wyższej półki w zakresie rozumowania/kodowania | Zmienny | Kodowanie, praca wiedzochłonna, rozumowanie |
Gemini 3.7 Flash jest szczególnie atrakcyjny, gdy aplikacja potrzebuje równowagi między możliwościami z najwyższej półki, przetwarzaniem multimodalnym, długim kontekstem, użyciem narzędzi i kosztami wnioskowania.
Ograniczenia
MINIMALnie jest dostępny.- Generowanie obrazów nie jest obsługiwane; wyjście ma postać tekstu.
- Gemini Live API nie jest obsługiwane.
- Data odcięcia wiedzy to marzec 2026 r.
- Google zauważa możliwe halucynacje, sporadyczne spowolnienia i problemy z przekroczeniem limitu czasu.
- Użycie komputera jest obecnie funkcją w wersji zapoznawczej.
Przypadki użycia
- Agenci do kodowania i inżynieria oprogramowania w skali repozytoriów.
- Tworzenie stron na podstawie zrzutów ekranu, obrazów lub systemów projektowych.
- Agenci do dokumentów i wiedzy na poziomie przedsiębiorstwa.
- Automatyzacja przepływów pracy multimodalnych.
- Agenci korzystający z narzędzi: wyszukiwanie, wykonywanie kodu i wywoływanie funkcji.
- Analiza z długim kontekstem dla dużych baz kodu i zbiorów dokumentów.
- Ustrukturyzowana automatyzacja w przedsiębiorstwach.