TL;DR
Gemini 3.6 Flash kosztuje $1.50/M input i $7.50/M output, oferując niższe ceny wyjścia oraz lepsze raportowane wyniki w kodowaniu i pracy agentów niż Gemini 3.5 Flash. W produkcji używaj 3.6 Flash do złożonego rozumowania i agentów, a prostsze, wysokowolumenowe zadania kieruj do tańszego Gemini 3.5 Flash-Lite.
Gemini 3.6 Flash to coś więcej niż kolejna aktualizacja identyfikatora modelu.
Dla deweloperów już korzystających z Gemini 3.5 Flash większa zmiana ma charakter ekonomiczny. Google pozostawiło cenę wejścia bez zmian na poziomie $1.50 za milion tokenów, obniżyło cenę wyjścia z $9.00 do $7.50 oraz raportuje lepsze wyniki na kilku benchmarkach związanych z kodowaniem i pracą agentów.
Praktyczne pytanie brzmi, czy te usprawnienia są na tyle duże, by uzasadnić migrację obciążeń produkcyjnych.
Odpowiedź zależy od rodzaju pracy. Agenci kodujący, analiza multimodalna oraz wieloetapowe użycie narzędzi mogą skorzystać bardziej niż proste zadania ekstrakcji czy klasyfikacji. Migracja wymaga też kilku kontroli kompatybilności API, które łatwo pominąć, jeśli zmienisz tylko nazwę modelu.
Ten przewodnik omawia ceny API Gemini 3.6 Flash, dostęp w ramach Free Tier, wyniki benchmarków, zmiany migracyjne, przykłady w Pythonie oraz to, co przetestować przed przełączeniem ruchu produkcyjnego.
Czym jest Gemini 3.6 Flash?
Gemini 3.6 Flash to nowszy model Google z rodziny Flash do kodowania, rozumowania multimodalnego i wieloetapowych przepływów pracy agentów. Wydany 21 lipca 2026 r., jest zaprojektowany do obciążeń produkcyjnych wymagających silniejszego rozumowania i wydajności agentów, przy jednoczesnym pozostaniu w warstwie modeli Flash Google.
Główne specyfikacje obejmują:
| Pozycja | Gemini 3.6 Flash |
|---|---|
| Model ID | gemini-3.6-flash |
| Standard input price | $1.50 / 1M tokens |
| Standard output price | $7.50 / 1M tokens |
| Standard cached input | $0.15 / 1M tokens |
| Default thinking level | medium |
| Input context | 1,048,576 tokens |
| Maximum output | 65,536 tokens |
| Inputs | Text, image, video, audio, PDF |
| Output | Text |
| Best suited for | Coding, multimodal reasoning, complex agents |
Google pozycjonuje Gemini 3.6 Flash pod kątem takich obciążeń jak kodowanie, rozumowanie przestrzenne i multimodalne oraz wieloetapowe zadania agentowe.
Model obsługuje również funkcje takie jak function calling, structured outputs, wykonywanie kodu, context caching, File Search, kontekst z URL, Google Search grounding oraz Google Maps grounding.
Aktualne specyfikacje i wskazówki migracyjne znajdziesz w najnowszym przewodniku po modelach Gemini.
Dla deweloperów przechodzących z poprzedniej generacji przydatnym punktem odniesienia jest przewodnik CometAPI po Gemini 3.5 Flash API.
Ile kosztuje API Gemini 3.6 Flash?
Gemini 3.6 Flash kosztuje $1.50 za milion tokenów wejściowych oraz $7.50 za milion tokenów wyjściowych w płatnym poziomie Standard Google.
W porównaniu z Gemini 3.5 Flash cena wejścia pozostaje bez zmian, natomiast cena wyjścia spada z $9.00 do $7.50 za milion tokenów — redukcja o 16.7%.
Google oferuje także przetwarzanie Batch, Flex i Priority.
| Poziom Gemini 3.6 Flash | Input / 1M | Cached Input / 1M | Output / 1M |
|---|---|---|---|
| Standard | $1.50 | $0.15 | $7.50 |
| Batch | $0.75 | $0.075 | $3.75 |
| Flex | $0.75 | $0.075 | $3.75 |
| Priority | $2.70 | $0.27 | $13.50 |
Ważne:** Tokeny "thinking" są rozliczane po stawce dla tokenów wyjściowych. Krótka widoczna odpowiedź może więc zużyć więcej rozliczanych tokenów wyjściowych, niż sugeruje długość finalnej odpowiedzi.
Context caching może również realnie obniżyć koszty w aplikacjach, które wielokrotnie wysyłają ten sam duży system prompt, kontekst repozytorium, zestaw dokumentów lub historię rozmowy.
W płatnym poziomie Standard Gemini 3.6 Flash cached input kosztuje $0.15 za milion tokenów, w porównaniu z $1.50 za normalny input.
Przykład: 15,000 tokenów wejściowych + 8,000 tokenów wyjściowych
Rozważmy zadanie z 15,000 tokenami wejściowymi i 8,000 tokenami wyjściowymi.
| Model | Szacowany koszt |
|---|---|
| Gemini 3.5 Flash | $0.0945 |
| Gemini 3.6 Flash przy tej samej liczbie tokenów | $0.0825 |
| Gemini 3.6 Flash z o 17% mniejszą liczbą tokenów wyjściowych | $0.0723 |
| Gemini 3.5 Flash-Lite przy tej samej liczbie tokenów | $0.0245 |
Przy identycznym zużyciu tokenów, Gemini 3.6 Flash jest w tym przykładzie ok. 12.7% tańszy niż Gemini 3.5 Flash.
Google raportuje również, że Gemini 3.6 Flash zużył o 17% mniej tokenów wyjściowych na Artificial Analysis Index. Jeśli produkcyjny workload odtworzy tę redukcję, modelowana oszczędność w tym przykładzie wzrosłaby do ok. 23.5%.
Google oddzielnie raportuje redukcje tokenów wyjściowych o nawet 65% na DeepSWE. Te liczby dotyczą różnych obciążeń i nie należy ich traktować zamiennie: 17% odnosi się do Artificial Analysis Index, natomiast 65% pochodzi z konkretnego benchmarku kodowania.
Podstawowy wzór obliczania kosztu tokenów to:
Request cost =
(input tokens x input price + output tokens x output price) / 1,000,000
Dla agentów realny koszt jest szerszy:
Total task cost =
initial model call
+ retries
+ fallback calls
+ paid tools
+ grounding or search costs
Dlatego najtańszy model w przeliczeniu na token nie zawsze jest najtańszy do ukończenia zadania.
Czy Gemini 3.6 Flash jest darmowy?
Tak. Aktualny cennik Gemini Developer API Google przewiduje dostęp w ramach Free Tier dla użycia Gemini 3.6 Flash w poziomie Standard.
Dostęp w Free Tier nie oznacza nieograniczonej pojemności produkcyjnej. Limity API zależą od projektu i poziomu użycia, więc deweloperzy powinni sprawdzać limity szybkości przypisane do własnego projektu, zamiast polegać na stałych wartościach żądań na minutę z artykułów firm trzecich.
Do planowania produkcyjnego korzystaj z aktualnych cen Gemini API oraz dokumentacji limitów szybkości.
Deweloperzy mogą uzyskać dostęp do Gemini 3.6 Flash przez Gemini API i Google AI Studio. Zespoły używające ujednoliconego, wielomodelowego przepływu mogą również przetestować model przez stronę modelu Gemini 3.6 Flash na CometAPI.
Jak Gemini 3.6 Flash wypada na tle Gemini 3.5 Flash?
Opublikowane przez Google wyniki pokazują największe poprawy w kodowaniu, wykonaniu agentowym, obsłudze komputera i pracy wiedzochłonnej.
| Benchmark | Gemini 3.6 Flash | Gemini 3.5 Flash | Zmiana |
|---|---|---|---|
| DeepSWE | 49.00% | 37.00% | +12.0 pkt |
| MLE-Bench | 63.90% | 49.70% | +14.2 pkt |
| OSWorld-Verified | 83.00% | 78.40% | +4.6 pkt |
| GDPval-AA v2 | 1,421 | 1,349 | 72 |
Google podaje także, że Gemini 3.6 Flash realizuje wieloetapowe workflowy z mniejszą liczbą kroków rozumowania, tur konwersacji i wywołań narzędzi niż Gemini 3.5 Flash.
Firma raportuje:
- o 17% mniej tokenów wyjściowych na Artificial Analysis Index,
- do 65% mniej tokenów wyjściowych na DeepSWE,
- mniej niepożądanych edycji kodu i pętli wykonania,
- lepsze rozumowanie multimodalne i przestrzenne.
Oryginalne wyniki są dostępne w zapowiedzi premiery Gemini 3.6 Flash.
Te benchmarki czynią 3.6 Flash mocnym kandydatem do ewaluacji, zwłaszcza dla obciążeń, gdzie jedno żądanie może przerodzić się w kilka rund rozumowania, wywołań narzędzi i poprawek.
Nie powinny one jednak zastępować testów na Twojej własnej aplikacji.
Google zaznacza też, że 3.6 Flash może wykonywać więcej wstępnej inspekcji programistycznej przed wprowadzaniem zmian w kodzie. W dużym repozytorium może to poprawić trafność. W wąsko zakrojonym froncie może po prostu dodać niepotrzebnej eksploracji.
Jasne granice plików, kryteria akceptacji i instrukcje implementacji nadal mają znaczenie.
Gemini 3.6 Flash vs Gemini 3.5 Flash-Lite: którego używać?
Gdy zdecydujesz, że warto przetestować Gemini 3.6 Flash, kolejne pytanie brzmi, czy każde żądanie faktycznie go potrzebuje.
Dla wielu systemów produkcyjnych odpowiedź brzmi: nie.
Gemini 3.5 Flash-Lite jest znacząco tańszy i może być lepszym domyślnym wyborem dla przewidywalnych, wysokowolumenowych obciążeń.
| Pozycja | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| Standard input price | $1.50 / 1M tokens | $0.30 / 1M tokens |
| Standard output price | $7.50 / 1M tokens | $2.50 / 1M tokens |
| Standard cached input | $0.15 / 1M tokens | $0.03 / 1M tokens |
| Default thinking level | medium | minimal |
| Best suited for | Complex reasoning, coding, agents | Extraction, routing, classification |
W poziomie Standard Flash-Lite jest 5× tańszy na wejściu i 3× tańszy na wyjściu niż Gemini 3.6 Flash.
Zacznij od Gemini 3.5 Flash-Lite dla:
- Klasyfikacji
- Routingu żądań
- JSON i ekstrakcji struktur
- Przetwarzania dokumentów
- Transformacji danych
- Tłumaczenia na dużą skalę
- Lekkich subagentów
- Wysokowolumenowych, powtarzalnych zadań
Praktyczna strategia routingu może wyglądać tak:
| Workload | Pierwsza ścieżka | Eskalacja |
|---|---|---|
| Klasyfikacja lub routing | Gemini 3.5 Flash-Lite | 3.6 Flash po nieudanej walidacji |
| Strukturalna ekstrakcja | Gemini 3.5 Flash-Lite | 3.6 Flash dla złożonych dokumentów |
| Lekki subagent | Gemini 3.5 Flash-Lite | Podnieś poziom thinking lub użyj 3.6 Flash |
| Kodowanie wieloplikowe | Gemini 3.6 Flash | Mocniejszy fallback, jeśli nierozwiązane |
| Złożony workflow narzędzi | Gemini 3.6 Flash | Fallback po błędzie narzędzia lub walidacji |
| Rozumowanie multimodalne | Gemini 3.6 Flash | Fallback zależny od zadania |
Dla mieszanego ruchu produkcyjnego bardziej użyteczna metryka to:
Cost per successful task =
(model calls + retries + tools + fallbacks) / accepted tasks
Tani pierwszy call staje się mniej atrakcyjny, jeśli wielokrotnie się nie udaje i ostatecznie wymaga mocniejszego modelu.
Odwrotność jest równie ważna. Nie ma sensu wysyłać milionów przewidywalnych żądań klasyfikacyjnych do Gemini 3.6 Flash, jeśli Flash-Lite już spełnia wymaganą dokładność.
Dla aplikacji wymagających takiego routingu zobacz nasz przewodnik po wywoływaniu wielu modeli AI przez kompatybilny z OpenAI base URL.
Co się zmienia przy migracji do Gemini 3.6 Flash?
Przejście z Gemini 3.5 Flash na Gemini 3.6 Flash to coś więcej niż zmiana identyfikatora modelu.
Przed przełączeniem ruchu produkcyjnego deweloperzy powinni przejrzeć pięć obszarów: przestarzałe parametry próbkowania, kontrolę thinking, candidate_count, prefillowanie tur modelu oraz stan function callingu.
1. Usuń temperature, top_p i top_k
Google wycofało te kontrolki próbkowania dla Gemini 3.6 Flash i Gemini 3.5 Flash-Lite:
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40,
}
Nowe modele obecnie ignorują te parametry. Google zapowiada, że przyszłe generacje modeli Gemini mogą zwracać błąd HTTP 400, gdy są one przekazywane.
Dla przewidywalnych formatów wyjścia lepiej użyć jaśniejszych instrukcji systemowych i structured outputs.
2. Zastąp thinking_budget parametrem thinking_level
Gemini 3.6 Flash domyślnie używa medium thinking.
Wskazówki migracyjne Google rekomendują przejście z numerycznych konfiguracji thinking_budget na thinking_level.
Gemini 3.5 Flash-Lite domyślnie używa minimal, co jest odpowiednie dla wielu wysokowolumenowych zadań ekstrakcji, klasyfikacji i routingu.
Wyższe poziomy thinking należy testować, gdy zadanie obejmuje wieloetapowe rozumowanie, wykonywanie kodu lub użycie narzędzi.
3. Usuń candidate_count
Google wymienia candidate_count jako nieobsługiwany w Gemini 3.x.
Łatwo to przeoczyć, gdy kilka modeli współdzieli tę samą konfigurację generowania. Usuń go przed migracją żądań produkcyjnych.
4. Zatrzymaj prefillowanie tur modelu
Żądania nie mogą już kończyć się turą roli model z niepustą zawartością.
Starsza aplikacja mogła używać ładunku jak:
{
"contents": [
{
"role": "user",
"parts": [{"text": "Przetłumacz 'Hello world' na hiszpański."}]
},
{
"role": "model",
"parts": [{"text": "Tłumaczenie:"}]
}
]
}
Ten wzorzec może teraz zwrócić HTTP 400.
Jeśli wcześniej używałeś prefillingu do wymuszenia formatu odpowiedzi, przenieś wymaganie do system_instruction albo użyj structured outputs.
5. Przetestuj ponownie function calling i stan w rozmowie wieloturowej
Agenci korzystający z narzędzi wymagają osobnych testów migracyjnych.
Google zaleca użycie previous_interaction_id dla serwerowego stanu rozmowy wieloturowej w Interactions API.
Zwracając wynik funkcji, zachowaj zarówno nazwę funkcji, jak i oryginalne ID wywołania:
final_interaction = client.interactions.create(
model="gemini-3.6-flash",
previous_interaction_id=interaction.id,
tools=tools,
input=[
{
"type": "function_result",
"name": step.name,
"call_id": step.id,
"result": [
{
"type": "text",
"text": json.dumps(result),
}
],
}
],
)
Aplikacje używające generateContent powinny również zweryfikować swoje ładunki FunctionResponse i monitorować błędy wywołań narzędzi po migracji.
Zobacz przewodnik migracyjny dla najnowszych modeli Google oraz dokumentację function callingu po aktualne szczegóły implementacyjne.
Jak wywołać Gemini 3.6 Flash w Pythonie?
Zainstaluj lub zaktualizuj SDK Google GenAI:
pip install -U google-genai
Ustaw klucz API:
export GEMINI_API_KEY="your-api-key"
Następnie wywołaj Gemini 3.6 Flash:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input=(
"Przejrzyj ten plan migracji i wypisz trzy "
"najbardziej ryzykowne kwestie kompatybilności."
),
)
print(interaction.output_text)
Dla zadania wymagającego więcej rozumowania skonfiguruj poziom thinking:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Przeanalizuj ten wieloetapowy problem debugowania.",
generation_config={
"thinking_level": "medium",
},
)
print(interaction.output_text)
Główną różnicę migracyjną można podsumować tak:
# Starsza współdzielona konfiguracja
old_config = {
"temperature": 0.2,
"top_p": 0.9,
"top_k": 40,
"candidate_count": 1,
"thinking_budget": 4096,
}
# Gemini 3.6 Flash
new_config = {
"thinking_level": "medium",
}
Nie zakładaj, że wyższy poziom thinking zawsze jest lepszy. Mierz opóźnienie, zużycie tokenów i odsetek udanych ukończeń dla własnych zadań.
Jak testować Gemini 3.6 Flash przed produkcją?
Nie potrzebujesz dużego publicznego zestawu benchmarków, by zdecydować, czy Gemini 3.6 Flash pasuje do Twojego stosu produkcyjnego.
Lepszym punktem startu jest 30–50 ostatnich zadań, które przypominają Twój faktyczny ruch.
Uwzględnij miks:
- Kodowanie i debugowanie
- Wieloetapowe użycie narzędzi
- Dokumenty multimodalne
- Ekstrakcja danych
- Klasyfikacja i routing
Uruchom te same wejścia przez:
- Twój aktualny model produkcyjny
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
Nie zmieniaj promptów, narzędzi, walidatorów i kryteriów akceptacji.
Śledź:
- Tokeny wejściowe
- Tokeny wyjściowe i thinking
- Latencję
- Wywołania narzędzi
- Ponowienia (retries)
- Błędy wywołań funkcji
- Wskaźnik przejścia walidatorów
- Czas korekty przez człowieka
- Finalny sukces zadania
Następnie porównaj całkowity koszt wymagany do uzyskania zaakceptowanego rezultatu.
Żądanie kodu, które kosztuje $0.08 i kończy się powodzeniem za pierwszym razem, może być tańsze niż żądanie za $0.02, które nie powiedzie się dwa razy i ostatecznie wymaga eskalacji.
Jednocześnie płacenie stawek Gemini 3.6 Flash za proste zadanie klasyfikacji nie ma sensu, jeśli Flash-Lite radzi sobie z nim niezawodnie.
Celem nie jest znalezienie jednego modelu do każdego żądania. Chodzi o użycie mocniejszego modelu tylko tam, gdzie jego dodatkowe możliwości faktycznie zmieniają wynik.
Deweloperzy mogą porównać aktualne ścieżki Gemini 3.6 Flash i Gemini 3.5 Flash-Lite przez CometAPI na tym samym zestawie ewaluacyjnym.
FAQ
Ile kosztuje API Gemini 3.6 Flash?
Standardowa stawka płatna Google to $1.50 za milion tokenów wejściowych i $7.50 za milion tokenów wyjściowych. Standardowy cached input kosztuje $0.15/M. Batch i Flex kosztują $0.75/M na wejściu i $3.75/M na wyjściu.
Czy Gemini 3.6 Flash jest darmowy?
Tak. Aktualny cennik Gemini Developer API Google przewiduje Free Tier dla użycia Standard Gemini 3.6 Flash. Darmowy dostęp nadal podlega limitom szybkości zależnym od projektu i poziomu użycia.
Czy Gemini 3.6 Flash jest ogólnie dostępny?
Tak. Google wydało gemini-3.6-flash 21 lipca 2026 r. i wymienia go jako model produkcyjny w dokumentacji Gemini API.
Jakie jest okno kontekstu Gemini 3.6 Flash?
Gemini 3.6 Flash obsługuje do 1,048,576 tokenów wejściowych i 65,536 tokenów wyjściowych. Akceptuje wejścia tekstowe, obrazy, wideo, audio i PDF, a zwraca tekst.
Czy Gemini 3.6 Flash jest tańszy niż Gemini 3.5 Flash?
Tak w przypadku tokenów wyjściowych. Oba modele kosztują $1.50/M za standardowe tokeny wejściowe, natomiast Gemini 3.6 Flash obniża cenę wyjścia z $9.00/M do $7.50/M.
Czy używać Gemini 3.6 Flash czy Gemini 3.5 Flash-Lite?
Używaj Gemini 3.6 Flash, gdy jakość kodowania, rozumowanie multimodalne lub złożone wykonanie agentów może zredukować błędy i ponowienia. Zacznij od Flash-Lite dla wysokowolumenowej ekstrakcji, klasyfikacji, routingu i innych przewidywalnych zadań, gdzie niższy koszt ma większe znaczenie.
Co zmienić przed migracją do Gemini 3.6 Flash?
Usuń temperature, top_p, top_k i candidate_count; zastąp thinking_budget parametrem thinking_level; usuń prefillowanie tur modelu; oraz ponownie przetestuj function calling i zarządzanie stanem wieloturowym.
Podsumowanie
Gemini 3.6 Flash warto zbenchmarkować, jeśli już używasz Gemini 3.5 Flash do kodowania, pracy multimodalnej lub workflowów agentów.
Ma niższą cenę wyjścia, a wstępne wyniki Google sugerują, że niektóre obciążenia mogą też wymagać mniej tokenów i mniej kroków wykonania. Dla agentów, którzy wielokrotnie rozumują, wywołują narzędzia i ponawiają nieudane działania, te oszczędności mogą być ważniejsze niż różnica w cenie nagłówkowej.
To jednak nie znaczy, że każde żądanie powinno przejść na 3.6 Flash.
Gemini 3.5 Flash-Lite jest znacznie tańszy i może w pełni wystarczyć do przewidywalnych zadań, takich jak ekstrakcja, klasyfikacja i routing.
Lepszą strategią produkcyjną jest używać każdego modelu tam, gdzie ma to sens ekonomiczny: Flash-Lite do prostych, wysokowolumenowych zadań; 3.6 Flash tam, gdzie silniejsze rozumowanie zwiększa szansę poprawnego ukończenia za pierwszym podejściem.
Następnie mierz wynik, który naprawdę się liczy — całkowity koszt uzyskania zaakceptowanej odpowiedzi.
Aby porównać oba modele w tym samym przepływie, zobacz stronę modelu Gemini 3.6 Flash i stronę modelu Gemini 3.5 Flash-Lite na CometAPI lub sprawdź aktualne trasy modeli na stronie cen CometAPI.
