Podstawowe funkcje
- Tekst → obraz: pełne generowanie oparte na promptach z wysoką zgodnością z poleceniem.
- Obraz → obraz (edycje): precyzyjne, ukierunkowane edycje z zachowaniem spójności postaci/bohatera w wielu edycjach.
- Maksymalna rozdzielczość wyjściowa: do 4K (przykłady i dokładne wspierane rozmiary w pikselach zależą od proporcji; API udostępnia presety 1K/2K/4K)
- Planowanie iteracyjne i autokorekta: wewnętrzny „wielostopniowy” pipeline, który wykrywa i koryguje typowe błędy wizualne (perspektywa, tekst, drobna geometria).
- Zaawansowane renderowanie tekstu w obrazie: wyraźny, czytelny wielojęzyczny tekst (od krótkich podpisów po długie akapity) odpowiedni do plakatów, makiet i infografik.
- 5 postaci oraz wierność dla maksymalnie 14 obiektów/obrazów referencyjnych w jednym przebiegu.
- Znakowanie wodne/pochodzenie: wszystkie generowane obrazy zawierają znak wodny SynthID; model osadza metadane C2PA dotyczące pochodzenia w niektórych integracjach produktowych.
Wersje i nazewnictwo Gemini 3 Pro Image
gemini-3-pro-image-previewgemini-3-pro-image
Szczegóły techniczne
Architektura
- Pochodzenie/rdzeń: Nano Banana Pro jest zbudowany na ewoluującym stosie obrazów Gemini — konkretnie na nowej architekturze Gemini 3 Pro Image / GEMPIX 2 (wysokopojemnościowy multimodalny framework obraz+tekst). To ewolucja względem Gemini 2.5 Flash Image (oryginalnego „nano-banana”) do natywnie multimodalnego modelu obrazu z rozszerzonymi możliwościami rozumienia wizji i języka.
- Zachowanie modelu: natywna multimodalność (obraz + tekst + wiedza o świecie), jawne potoki dla łączenia wielu obrazów oraz wewnętrzny etapowy planer, który dopracowuje wyniki w wielu przebiegach zamiast tworzyć pojedynczą statyczną próbkę. Wczesne doniesienia wskazują na silniejsze rozumowanie geometryczne/optyczne (szkło, refrakcja) względem wcześniejszych wersji.
- Myślenie/udoskonalanie wewnętrzne: model wykorzystuje widoczny proces „myślenia” do wewnętrznego dopracowywania kompozycji (API dokumentuje to zachowanie i zaznacza, że te wewnętrzne kroki nie są naliczane jako końcowe tokeny obrazu).
- Grounding i narzędzia: Obsługuje Search grounding (może włączać fakty z sieci do generowania diagramów/infografik). Obsługuje także instrukcje systemowe dla bardziej deterministycznej kontroli.
Kluczowe parametry API:
thinking_level(low / high) do kompromisu między opóźnieniem a głębokością rozumowania;media_resolution(low/medium/high) do sterowania tokenami odczytu detali/OCR obrazu;generationConfig.imageConfigdo kontroli proporcji/rozdzielczości w wynikowych obrazach.
Limity dotyczące obrazów:
- Obsługiwane tryby wejścia: tekst i obrazy (model nie akceptuje audio ani wideo jako wejść do generowania obrazów).
- Maksymalna liczba obrazów na prompt: 14 (dla Gemini 3 Pro Image preview).
- Maksymalny rozmiar obrazu (upload): 7 MB na obraz wejściowy.
- Obsługiwane proporcje obrazu: 1:1, 3:2, 16:9, 9:16, 21:9, itd.
Obrazy wyjściowe/tokeny: wysokie limity, z obsługą 4K/4096px.
Wyniki benchmarków
Krótko: publiczne/wczesne benchmarki są dotąd głównie jakościowe/społecznościowe, ale konsekwentnie wskazują na istotne poprawy w rozdzielczości, redukcji artefaktów i wierności fizycznej względem oryginalnego nano-banana (Gemini 2.5 Flash Image). Konkretne nazwane „wyzwania” wykazały wyraźne zyski wizualne, ale nie ma jeszcze (publicznych) ustandaryzowanych tabel liczbowych od Google porównujących v1 → v2 w standardowych metrykach generowania obrazów.
- Jakościowe testy społeczności: Czystsze krawędzie, ostrzejsze mikroszczegóły, wierniejsze kolory oraz lepsza zgodność z promptem (mniej halucynowanych rekwizytów, bardziej spójne postacie). Popularne nieformalne testy obejmują tzw. „Wine Glass Test” i „Glass Burger Challenge”, w których GEMPIX2 (Nano Banana Pro) znacznie lepiej radzi sobie z transparentnością i refrakcją niż wcześniejsze wersje.
- Obsługa tekstu: Nano Banana Pro wykazuje widocznie lepszą typografię i umieszczanie tekstu w obrazach (utrzymująca się słabość wielu modeli). Porównania społeczności wskazują mniej zniekształconych renderowanych glifów.
- Przepustowość/UX: szybsze tempo iteracji i UX wykonujący wieloetapowe dopracowanie na zapleczu, dzięki czemu użytkownicy widzą bardziej wiarygodne wyniki już w pierwszym podejściu (mniej ręcznych ponowień).
Ograniczenia i ryzyka
- Filtry treści i wykrywanie: Platformy integrujące model (np. Whisk/aplikacje firm trzecich) mogą włączać surowe wykrywanie celebrytów lub podobizn i blokować określone wyniki, co wpływa na procesy twórcze opierające się na realistycznych podobiznach celebrytów.
- Halucynacje/przypadki brzegowe rozumowania: choć ograniczone, model wciąż może tworzyć fizycznie nierealistyczne artefakty, zwłaszcza przy gęstym symbolicznym tekście w obrazach lub bardzo technicznych diagramach — choć NB2 wydaje się ograniczać te błędy względem wcześniejszych wersji.
- Bezpieczeństwo i nadużycia: generatywne modele obrazów mogą być używane do tworzenia problematycznych lub szkodliwych treści. Google stosuje ograniczenia, filtry treści i znak wodny SynthID, aby wspierać weryfikowalność pochodzenia; mimo to dochodziło do nadużyć (głośna kontrowersja związana z obrazem wygenerowanym przez Nano Banana w politycznie wrażliwym kontekście).
Jak Nano Banana Pro wypada na tle innych modeli
- Nano Banana Pro (GEMPIX 2 / Gemini 3 Pro Image) — mocna integracja mobilna, łączenie wielu obrazów, iteracyjna autokorekta, natywne 2K/podnoszenie rozdzielczości do 4K, ścisła integracja z aplikacjami Google (Search, Photos, Workspace/Gemini). Najlepszy do przepływów pracy wymagających niezawodnych edycji, ciągłości i integracji z usługami Google.
- Midjourney — wyróżnia się stylizowanymi, artystycznymi wynikami i społecznościowym podejściem do prompt engineeringu; zwykle nie jest kierowany na foto-realistyczne łączenie wielu obrazów ani głębokie multimodalne pipeline’y edycyjne.
- Stable Diffusion / open weights — w pełni otwarty, wysoce konfigurowalny i możliwy do hostowania lokalnie; ekosystem checkpointów i fine-tuningu to decydująca przewaga w badaniach i pracy offline. Mniej „jednoklikowej” integracji mobilnej i mniejsza spójność edycji wielu obrazów domyślnie niż w Nano Banana Pro.
- Seedream 4.0 (ByteDance) — ostatnio pozycjonowany wprost jako konkurent Nano Banana, akcentujący ultrazaszybkie renderowanie, wyjścia 2K i wsparcie wielu obrazów referencyjnych (do sześciu). Pozycjonowany jako alternatywa dla profesjonalistów/kreatorów.
(Te porównania są wysokopoziomowe; wybierz zwycięzcę, dopasowując narzędzie do swojego workflow: otwartość/konfigurowalność → Stable Diffusion; stylizowana sztuka → Midjourney; zintegrowana, konsekwentna edycja mobilna z agresywną iteracją → Nano Banana Pro/ rodzina Gemini 3 Pro Image.)
Praktyczne zastosowania
- Mobilna edycja zdjęć i kreatywne filtry (integracje z Google Photos — restylizacja, łączenie tła, rekonstrukcja/rekadrowanie portretu).
- Materiały marketingowe i reklamowe — szybkie generowanie koncepcji, spójne postacie marki w wielu kadrach/kątach.
- Concept art i storyboardy — łączenie wielu obrazów pomaga utrzymać ciągłość postaci między panelami.
- E‑commerce/makiety produktów — generowanie spójnych zdjęć produktów w różnych kontekstach/warunkach oświetleniowych.
- Szybkie prototypowanie zasobów AR/VR — wysokiej jakości wyjścia 2K/4K, które można przeskalować do zastosowań immersyjnych.
- Jak uzyskać dostęp do API gemini-3-pro-image (Nano Banana Pro)
Wymagane kroki
- Zaloguj się do cometapi.com. Jeśli nie jesteś jeszcze naszym użytkownikiem, najpierw zarejestruj się.
- Uzyskaj poświadczenie — klucz API interfejsu. Kliknij „Add Token” przy API token w centrum osobistym, pobierz klucz tokena: sk-xxxxx i zatwierdź.
- Uzyskaj adres URL tej witryny:
https://api.cometapi.com/
Sposób użycia
- Wybierz endpoint „
gemini-3-pro-image”, aby wysłać żądanie API i ustaw body żądania. Metodę żądania i body żądania znajdziesz w dokumentacji API na naszej stronie. Nasza strona udostępnia również test w Apifox dla wygody. - Zastąp <YOUR_API_KEY> swoim rzeczywistym kluczem CometAPI z konta.
- Wstaw swoje pytanie lub prośbę do pola content — na to odpowie model.
- Przetwórz odpowiedź API, aby uzyskać wygenerowaną odpowiedź.
CometAPI udostępnia w pełni kompatybilne REST API — dla płynnej migracji. Kluczowe informacje:
- Base URL: https://api.cometapi.com/v1beta/models/gemini-3-pro-image-preview:generateContent
- Model Names:
gemini-3-pro-image - Authentication:
Bearer YOUR_CometAPI_API_KEYheader - Content-Type:
application/json.