GPT-6 Astra is now live on CometAPI →
ai-model/Badania CometAPI

Gemini 3.6 Flash Cennik API & Przewodnik migracji (2026)

Gemini 3.6 Flash kosztuje $1.50/M wejścia i $7.50/M wyjścia. Zobacz cennik API, benchmarki, zmiany migracyjne, przykłady w Pythonie oraz wytyczne produkcyjne.

CometAPI
Mia MarenZespół badań AI modeli i API
Zaktualizowano Sep 3, 2026 13 min czyt.
Gemini 3.6 Flash Cennik API & Przewodnik migracji (2026)
Użyj tego wzorca

Wykonaj pierwsze wywołanie API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Gemini 3.6 Flash kosztuje $1.50/M input i $7.50/M output, oferując niższe ceny wyjścia oraz lepsze raportowane wyniki w kodowaniu i pracy agentów niż Gemini 3.5 Flash. W produkcji używaj 3.6 Flash do złożonego rozumowania i agentów, a prostsze, wysokowolumenowe zadania kieruj do tańszego Gemini 3.5 Flash-Lite.

Gemini 3.6 Flash to coś więcej niż kolejna aktualizacja identyfikatora modelu.

Dla deweloperów już korzystających z Gemini 3.5 Flash większa zmiana ma charakter ekonomiczny. Google pozostawiło cenę wejścia bez zmian na poziomie $1.50 za milion tokenów, obniżyło cenę wyjścia z $9.00 do $7.50 oraz raportuje lepsze wyniki na kilku benchmarkach związanych z kodowaniem i pracą agentów.

Praktyczne pytanie brzmi, czy te usprawnienia są na tyle duże, by uzasadnić migrację obciążeń produkcyjnych.

Odpowiedź zależy od rodzaju pracy. Agenci kodujący, analiza multimodalna oraz wieloetapowe użycie narzędzi mogą skorzystać bardziej niż proste zadania ekstrakcji czy klasyfikacji. Migracja wymaga też kilku kontroli kompatybilności API, które łatwo pominąć, jeśli zmienisz tylko nazwę modelu.

Ten przewodnik omawia ceny API Gemini 3.6 Flash, dostęp w ramach Free Tier, wyniki benchmarków, zmiany migracyjne, przykłady w Pythonie oraz to, co przetestować przed przełączeniem ruchu produkcyjnego.

Czym jest Gemini 3.6 Flash?

Gemini 3.6 Flash to nowszy model Google z rodziny Flash do kodowania, rozumowania multimodalnego i wieloetapowych przepływów pracy agentów. Wydany 21 lipca 2026 r., jest zaprojektowany do obciążeń produkcyjnych wymagających silniejszego rozumowania i wydajności agentów, przy jednoczesnym pozostaniu w warstwie modeli Flash Google.

Główne specyfikacje obejmują:

PozycjaGemini 3.6 Flash
Model IDgemini-3.6-flash
Standard input price$1.50 / 1M tokens
Standard output price$7.50 / 1M tokens
Standard cached input$0.15 / 1M tokens
Default thinking levelmedium
Input context1,048,576 tokens
Maximum output65,536 tokens
InputsText, image, video, audio, PDF
OutputText
Best suited forCoding, multimodal reasoning, complex agents

Google pozycjonuje Gemini 3.6 Flash pod kątem takich obciążeń jak kodowanie, rozumowanie przestrzenne i multimodalne oraz wieloetapowe zadania agentowe.

Model obsługuje również funkcje takie jak function calling, structured outputs, wykonywanie kodu, context caching, File Search, kontekst z URL, Google Search grounding oraz Google Maps grounding.

Aktualne specyfikacje i wskazówki migracyjne znajdziesz w najnowszym przewodniku po modelach Gemini.

Dla deweloperów przechodzących z poprzedniej generacji przydatnym punktem odniesienia jest przewodnik CometAPI po Gemini 3.5 Flash API.

Ile kosztuje API Gemini 3.6 Flash?

Gemini 3.6 Flash kosztuje $1.50 za milion tokenów wejściowych oraz $7.50 za milion tokenów wyjściowych w płatnym poziomie Standard Google.

W porównaniu z Gemini 3.5 Flash cena wejścia pozostaje bez zmian, natomiast cena wyjścia spada z $9.00 do $7.50 za milion tokenów — redukcja o 16.7%.

Google oferuje także przetwarzanie Batch, Flex i Priority.

Poziom Gemini 3.6 FlashInput / 1MCached Input / 1MOutput / 1M
Standard$1.50$0.15$7.50
Batch$0.75$0.075$3.75
Flex$0.75$0.075$3.75
Priority$2.70$0.27$13.50

Ważne:** Tokeny "thinking" są rozliczane po stawce dla tokenów wyjściowych. Krótka widoczna odpowiedź może więc zużyć więcej rozliczanych tokenów wyjściowych, niż sugeruje długość finalnej odpowiedzi.

Context caching może również realnie obniżyć koszty w aplikacjach, które wielokrotnie wysyłają ten sam duży system prompt, kontekst repozytorium, zestaw dokumentów lub historię rozmowy.

W płatnym poziomie Standard Gemini 3.6 Flash cached input kosztuje $0.15 za milion tokenów, w porównaniu z $1.50 za normalny input.

Przykład: 15,000 tokenów wejściowych + 8,000 tokenów wyjściowych

Rozważmy zadanie z 15,000 tokenami wejściowymi i 8,000 tokenami wyjściowymi.

ModelSzacowany koszt
Gemini 3.5 Flash$0.0945
Gemini 3.6 Flash przy tej samej liczbie tokenów$0.0825
Gemini 3.6 Flash z o 17% mniejszą liczbą tokenów wyjściowych$0.0723
Gemini 3.5 Flash-Lite przy tej samej liczbie tokenów$0.0245

Przy identycznym zużyciu tokenów, Gemini 3.6 Flash jest w tym przykładzie ok. 12.7% tańszy niż Gemini 3.5 Flash.

Google raportuje również, że Gemini 3.6 Flash zużył o 17% mniej tokenów wyjściowych na Artificial Analysis Index. Jeśli produkcyjny workload odtworzy tę redukcję, modelowana oszczędność w tym przykładzie wzrosłaby do ok. 23.5%.

Google oddzielnie raportuje redukcje tokenów wyjściowych o nawet 65% na DeepSWE. Te liczby dotyczą różnych obciążeń i nie należy ich traktować zamiennie: 17% odnosi się do Artificial Analysis Index, natomiast 65% pochodzi z konkretnego benchmarku kodowania.

Podstawowy wzór obliczania kosztu tokenów to:

Request cost =
(input tokens x input price + output tokens x output price) / 1,000,000

Dla agentów realny koszt jest szerszy:

Total task cost =
initial model call
+ retries
+ fallback calls
+ paid tools
+ grounding or search costs

Dlatego najtańszy model w przeliczeniu na token nie zawsze jest najtańszy do ukończenia zadania.

Czy Gemini 3.6 Flash jest darmowy?

Tak. Aktualny cennik Gemini Developer API Google przewiduje dostęp w ramach Free Tier dla użycia Gemini 3.6 Flash w poziomie Standard.

Dostęp w Free Tier nie oznacza nieograniczonej pojemności produkcyjnej. Limity API zależą od projektu i poziomu użycia, więc deweloperzy powinni sprawdzać limity szybkości przypisane do własnego projektu, zamiast polegać na stałych wartościach żądań na minutę z artykułów firm trzecich.

Do planowania produkcyjnego korzystaj z aktualnych cen Gemini API oraz dokumentacji limitów szybkości.

Deweloperzy mogą uzyskać dostęp do Gemini 3.6 Flash przez Gemini API i Google AI Studio. Zespoły używające ujednoliconego, wielomodelowego przepływu mogą również przetestować model przez stronę modelu Gemini 3.6 Flash na CometAPI.

Jak Gemini 3.6 Flash wypada na tle Gemini 3.5 Flash?

Opublikowane przez Google wyniki pokazują największe poprawy w kodowaniu, wykonaniu agentowym, obsłudze komputera i pracy wiedzochłonnej.

BenchmarkGemini 3.6 FlashGemini 3.5 FlashZmiana
DeepSWE49.00%37.00%+12.0 pkt
MLE-Bench63.90%49.70%+14.2 pkt
OSWorld-Verified83.00%78.40%+4.6 pkt
GDPval-AA v21,4211,34972

Google podaje także, że Gemini 3.6 Flash realizuje wieloetapowe workflowy z mniejszą liczbą kroków rozumowania, tur konwersacji i wywołań narzędzi niż Gemini 3.5 Flash.

Firma raportuje:

  • o 17% mniej tokenów wyjściowych na Artificial Analysis Index,
  • do 65% mniej tokenów wyjściowych na DeepSWE,
  • mniej niepożądanych edycji kodu i pętli wykonania,
  • lepsze rozumowanie multimodalne i przestrzenne.

Oryginalne wyniki są dostępne w zapowiedzi premiery Gemini 3.6 Flash.

Te benchmarki czynią 3.6 Flash mocnym kandydatem do ewaluacji, zwłaszcza dla obciążeń, gdzie jedno żądanie może przerodzić się w kilka rund rozumowania, wywołań narzędzi i poprawek.

Nie powinny one jednak zastępować testów na Twojej własnej aplikacji.

Google zaznacza też, że 3.6 Flash może wykonywać więcej wstępnej inspekcji programistycznej przed wprowadzaniem zmian w kodzie. W dużym repozytorium może to poprawić trafność. W wąsko zakrojonym froncie może po prostu dodać niepotrzebnej eksploracji.

Jasne granice plików, kryteria akceptacji i instrukcje implementacji nadal mają znaczenie.

Gemini 3.6 Flash vs Gemini 3.5 Flash-Lite: którego używać?

Gdy zdecydujesz, że warto przetestować Gemini 3.6 Flash, kolejne pytanie brzmi, czy każde żądanie faktycznie go potrzebuje.

Dla wielu systemów produkcyjnych odpowiedź brzmi: nie.

Gemini 3.5 Flash-Lite jest znacząco tańszy i może być lepszym domyślnym wyborem dla przewidywalnych, wysokowolumenowych obciążeń.

PozycjaGemini 3.6 FlashGemini 3.5 Flash-Lite
Standard input price$1.50 / 1M tokens$0.30 / 1M tokens
Standard output price$7.50 / 1M tokens$2.50 / 1M tokens
Standard cached input$0.15 / 1M tokens$0.03 / 1M tokens
Default thinking levelmediumminimal
Best suited forComplex reasoning, coding, agentsExtraction, routing, classification

W poziomie Standard Flash-Lite jest 5× tańszy na wejściu i 3× tańszy na wyjściu niż Gemini 3.6 Flash.

Zacznij od Gemini 3.5 Flash-Lite dla:

  • Klasyfikacji
  • Routingu żądań
  • JSON i ekstrakcji struktur
  • Przetwarzania dokumentów
  • Transformacji danych
  • Tłumaczenia na dużą skalę
  • Lekkich subagentów
  • Wysokowolumenowych, powtarzalnych zadań

Praktyczna strategia routingu może wyglądać tak:

WorkloadPierwsza ścieżkaEskalacja
Klasyfikacja lub routingGemini 3.5 Flash-Lite3.6 Flash po nieudanej walidacji
Strukturalna ekstrakcjaGemini 3.5 Flash-Lite3.6 Flash dla złożonych dokumentów
Lekki subagentGemini 3.5 Flash-LitePodnieś poziom thinking lub użyj 3.6 Flash
Kodowanie wieloplikoweGemini 3.6 FlashMocniejszy fallback, jeśli nierozwiązane
Złożony workflow narzędziGemini 3.6 FlashFallback po błędzie narzędzia lub walidacji
Rozumowanie multimodalneGemini 3.6 FlashFallback zależny od zadania

Dla mieszanego ruchu produkcyjnego bardziej użyteczna metryka to:

Cost per successful task =
(model calls + retries + tools + fallbacks) / accepted tasks

Tani pierwszy call staje się mniej atrakcyjny, jeśli wielokrotnie się nie udaje i ostatecznie wymaga mocniejszego modelu.

Odwrotność jest równie ważna. Nie ma sensu wysyłać milionów przewidywalnych żądań klasyfikacyjnych do Gemini 3.6 Flash, jeśli Flash-Lite już spełnia wymaganą dokładność.

Dla aplikacji wymagających takiego routingu zobacz nasz przewodnik po wywoływaniu wielu modeli AI przez kompatybilny z OpenAI base URL.

Co się zmienia przy migracji do Gemini 3.6 Flash?

Przejście z Gemini 3.5 Flash na Gemini 3.6 Flash to coś więcej niż zmiana identyfikatora modelu.

Przed przełączeniem ruchu produkcyjnego deweloperzy powinni przejrzeć pięć obszarów: przestarzałe parametry próbkowania, kontrolę thinking, candidate_count, prefillowanie tur modelu oraz stan function callingu.

1. Usuń temperature, top_p i top_k

Google wycofało te kontrolki próbkowania dla Gemini 3.6 Flash i Gemini 3.5 Flash-Lite:

generation_config = {
    "temperature": 0.7,
    "top_p": 0.9,
    "top_k": 40,
}

Nowe modele obecnie ignorują te parametry. Google zapowiada, że przyszłe generacje modeli Gemini mogą zwracać błąd HTTP 400, gdy są one przekazywane.

Dla przewidywalnych formatów wyjścia lepiej użyć jaśniejszych instrukcji systemowych i structured outputs.

2. Zastąp thinking_budget parametrem thinking_level

Gemini 3.6 Flash domyślnie używa medium thinking.

Wskazówki migracyjne Google rekomendują przejście z numerycznych konfiguracji thinking_budget na thinking_level.

Gemini 3.5 Flash-Lite domyślnie używa minimal, co jest odpowiednie dla wielu wysokowolumenowych zadań ekstrakcji, klasyfikacji i routingu.

Wyższe poziomy thinking należy testować, gdy zadanie obejmuje wieloetapowe rozumowanie, wykonywanie kodu lub użycie narzędzi.

3. Usuń candidate_count

Google wymienia candidate_count jako nieobsługiwany w Gemini 3.x.

Łatwo to przeoczyć, gdy kilka modeli współdzieli tę samą konfigurację generowania. Usuń go przed migracją żądań produkcyjnych.

4. Zatrzymaj prefillowanie tur modelu

Żądania nie mogą już kończyć się turą roli model z niepustą zawartością.

Starsza aplikacja mogła używać ładunku jak:

{
  "contents": [
    {
      "role": "user",
      "parts": [{"text": "Przetłumacz 'Hello world' na hiszpański."}]
    },
    {
      "role": "model",
      "parts": [{"text": "Tłumaczenie:"}]
    }
  ]
}

Ten wzorzec może teraz zwrócić HTTP 400.

Jeśli wcześniej używałeś prefillingu do wymuszenia formatu odpowiedzi, przenieś wymaganie do system_instruction albo użyj structured outputs.

5. Przetestuj ponownie function calling i stan w rozmowie wieloturowej

Agenci korzystający z narzędzi wymagają osobnych testów migracyjnych.

Google zaleca użycie previous_interaction_id dla serwerowego stanu rozmowy wieloturowej w Interactions API.

Zwracając wynik funkcji, zachowaj zarówno nazwę funkcji, jak i oryginalne ID wywołania:

final_interaction = client.interactions.create(
    model="gemini-3.6-flash",
    previous_interaction_id=interaction.id,
    tools=tools,
    input=[
        {
            "type": "function_result",
            "name": step.name,
            "call_id": step.id,
            "result": [
                {
                    "type": "text",
                    "text": json.dumps(result),
                }
            ],
        }
    ],
)

Aplikacje używające generateContent powinny również zweryfikować swoje ładunki FunctionResponse i monitorować błędy wywołań narzędzi po migracji.

Zobacz przewodnik migracyjny dla najnowszych modeli Google oraz dokumentację function callingu po aktualne szczegóły implementacyjne.

Jak wywołać Gemini 3.6 Flash w Pythonie?

Zainstaluj lub zaktualizuj SDK Google GenAI:

pip install -U google-genai

Ustaw klucz API:

export GEMINI_API_KEY="your-api-key"

Następnie wywołaj Gemini 3.6 Flash:

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input=(
        "Przejrzyj ten plan migracji i wypisz trzy "
        "najbardziej ryzykowne kwestie kompatybilności."
    ),
)

print(interaction.output_text)

Dla zadania wymagającego więcej rozumowania skonfiguruj poziom thinking:

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input="Przeanalizuj ten wieloetapowy problem debugowania.",
    generation_config={
        "thinking_level": "medium",
    },
)

print(interaction.output_text)

Główną różnicę migracyjną można podsumować tak:

# Starsza współdzielona konfiguracja
old_config = {
    "temperature": 0.2,
    "top_p": 0.9,
    "top_k": 40,
    "candidate_count": 1,
    "thinking_budget": 4096,
}

# Gemini 3.6 Flash
new_config = {
    "thinking_level": "medium",
}

Nie zakładaj, że wyższy poziom thinking zawsze jest lepszy. Mierz opóźnienie, zużycie tokenów i odsetek udanych ukończeń dla własnych zadań.

Jak testować Gemini 3.6 Flash przed produkcją?

Nie potrzebujesz dużego publicznego zestawu benchmarków, by zdecydować, czy Gemini 3.6 Flash pasuje do Twojego stosu produkcyjnego.

Lepszym punktem startu jest 30–50 ostatnich zadań, które przypominają Twój faktyczny ruch.

Uwzględnij miks:

  1. Kodowanie i debugowanie
  2. Wieloetapowe użycie narzędzi
  3. Dokumenty multimodalne
  4. Ekstrakcja danych
  5. Klasyfikacja i routing

Uruchom te same wejścia przez:

  • Twój aktualny model produkcyjny
  • Gemini 3.6 Flash
  • Gemini 3.5 Flash-Lite

Nie zmieniaj promptów, narzędzi, walidatorów i kryteriów akceptacji.

Śledź:

  • Tokeny wejściowe
  • Tokeny wyjściowe i thinking
  • Latencję
  • Wywołania narzędzi
  • Ponowienia (retries)
  • Błędy wywołań funkcji
  • Wskaźnik przejścia walidatorów
  • Czas korekty przez człowieka
  • Finalny sukces zadania

Następnie porównaj całkowity koszt wymagany do uzyskania zaakceptowanego rezultatu.

Żądanie kodu, które kosztuje $0.08 i kończy się powodzeniem za pierwszym razem, może być tańsze niż żądanie za $0.02, które nie powiedzie się dwa razy i ostatecznie wymaga eskalacji.

Jednocześnie płacenie stawek Gemini 3.6 Flash za proste zadanie klasyfikacji nie ma sensu, jeśli Flash-Lite radzi sobie z nim niezawodnie.

Celem nie jest znalezienie jednego modelu do każdego żądania. Chodzi o użycie mocniejszego modelu tylko tam, gdzie jego dodatkowe możliwości faktycznie zmieniają wynik.

Deweloperzy mogą porównać aktualne ścieżki Gemini 3.6 Flash i Gemini 3.5 Flash-Lite przez CometAPI na tym samym zestawie ewaluacyjnym.

FAQ

Ile kosztuje API Gemini 3.6 Flash?

Standardowa stawka płatna Google to $1.50 za milion tokenów wejściowych i $7.50 za milion tokenów wyjściowych. Standardowy cached input kosztuje $0.15/M. Batch i Flex kosztują $0.75/M na wejściu i $3.75/M na wyjściu.

Czy Gemini 3.6 Flash jest darmowy?

Tak. Aktualny cennik Gemini Developer API Google przewiduje Free Tier dla użycia Standard Gemini 3.6 Flash. Darmowy dostęp nadal podlega limitom szybkości zależnym od projektu i poziomu użycia.

Czy Gemini 3.6 Flash jest ogólnie dostępny?

Tak. Google wydało gemini-3.6-flash 21 lipca 2026 r. i wymienia go jako model produkcyjny w dokumentacji Gemini API.

Jakie jest okno kontekstu Gemini 3.6 Flash?

Gemini 3.6 Flash obsługuje do 1,048,576 tokenów wejściowych i 65,536 tokenów wyjściowych. Akceptuje wejścia tekstowe, obrazy, wideo, audio i PDF, a zwraca tekst.

Czy Gemini 3.6 Flash jest tańszy niż Gemini 3.5 Flash?

Tak w przypadku tokenów wyjściowych. Oba modele kosztują $1.50/M za standardowe tokeny wejściowe, natomiast Gemini 3.6 Flash obniża cenę wyjścia z $9.00/M do $7.50/M.

Czy używać Gemini 3.6 Flash czy Gemini 3.5 Flash-Lite?

Używaj Gemini 3.6 Flash, gdy jakość kodowania, rozumowanie multimodalne lub złożone wykonanie agentów może zredukować błędy i ponowienia. Zacznij od Flash-Lite dla wysokowolumenowej ekstrakcji, klasyfikacji, routingu i innych przewidywalnych zadań, gdzie niższy koszt ma większe znaczenie.

Co zmienić przed migracją do Gemini 3.6 Flash?

Usuń temperature, top_p, top_k i candidate_count; zastąp thinking_budget parametrem thinking_level; usuń prefillowanie tur modelu; oraz ponownie przetestuj function calling i zarządzanie stanem wieloturowym.

Podsumowanie

Gemini 3.6 Flash warto zbenchmarkować, jeśli już używasz Gemini 3.5 Flash do kodowania, pracy multimodalnej lub workflowów agentów.

Ma niższą cenę wyjścia, a wstępne wyniki Google sugerują, że niektóre obciążenia mogą też wymagać mniej tokenów i mniej kroków wykonania. Dla agentów, którzy wielokrotnie rozumują, wywołują narzędzia i ponawiają nieudane działania, te oszczędności mogą być ważniejsze niż różnica w cenie nagłówkowej.

To jednak nie znaczy, że każde żądanie powinno przejść na 3.6 Flash.

Gemini 3.5 Flash-Lite jest znacznie tańszy i może w pełni wystarczyć do przewidywalnych zadań, takich jak ekstrakcja, klasyfikacja i routing.

Lepszą strategią produkcyjną jest używać każdego modelu tam, gdzie ma to sens ekonomiczny: Flash-Lite do prostych, wysokowolumenowych zadań; 3.6 Flash tam, gdzie silniejsze rozumowanie zwiększa szansę poprawnego ukończenia za pierwszym podejściem.

Następnie mierz wynik, który naprawdę się liczy — całkowity koszt uzyskania zaakceptowanej odpowiedzi.

Aby porównać oba modele w tym samym przepływie, zobacz stronę modelu Gemini 3.6 Flash i stronę modelu Gemini 3.5 Flash-Lite na CometAPI lub sprawdź aktualne trasy modeli na stronie cen CometAPI.

Kontynuuj naukę

Połącz ten artykuł z następną decyzją.

Zobacz wszystkie tematy
Opublikowano Jul 22, 2026
Ostatnia aktualizacja Sep 3, 2026
429 wyświetleń
Sprawdzone pod kątem przejrzystości, atrybucji źródeł i aktualnej terminologii API.

Gotowy na obniżenie kosztów rozwoju AI o 20%?

Zacznij za darmo w kilka minut. Dołączone kredyty na bezpłatny okres próbny. Karta kredytowa nie jest wymagana.

Czytaj więcej