Grunnleggende funksjoner
- Tekst → Bilde: full prompt-styrt generering med sterk etterlevelse av prompten.
- Bilde → Bilde (redigeringer): fine, målrettede redigeringer med bevart motiv-/figurkonsistens på tvers av flere redigeringer.
- Maksimal utgangsoppløsning: opptil 4K (eksempler og støttede nøyaktige pikselstørrelser avhenger av sideforhold; API-et tilbyr 1K/2K/4K-forhåndsinnstillinger)
- Iterativ planlegging og selvkorrigering: en intern «flertrinns» pipeline som oppdager og retter vanlige visuelle feil (perspektiv, tekst, fin geometri).
- Avansert tekstgjengivelse i bilde: klar, leselig flerspråklig tekst (fra korte bildetekster til lange avsnitt) egnet for plakater, mockups og infografikk.
- 5 figurer og trofasthet for opptil 14 objekter/referansebilder i én enkelt arbeidsflyt.
- Vannmerking / proveniens: alle genererte bilder inkluderer et SynthID-vannmerke; modellen innebygger C2PA-metadata for proveniens i noen produktintegrasjoner.
Gemini 3 Pro Image-versjoner og navngivning
gemini-3-pro-image-previewgemini-3-pro-image
Tekniske detaljer
Arkitektur
- Avstamning / ryggrad: Nano Banana Pro er bygget på Googles utviklende Gemini-bildestack — spesifikt den nye Gemini 3 Pro Image / GEMPIX 2-arkitekturen (et multimodalt bilde+tekst-rammeverk med høyere kapasitet). Det er en videreutvikling fra Gemini 2.5 Flash Image (den opprinnelige “nano-banana”) til en naturlig multimodal bildemodell med utvidede visjon-språk-resonneringskapabiliteter.
- Modellatferd: innebygd multimodalitet (bilde + tekst + verdenskunnskap), eksplisitte prosesskjeder for sammenslåing av flere bilder, og en intern trinnvis planlegger som forfiner utdata over flere gjennomløp i stedet for å produsere én enkelt statisk prøve. Tidlige rapporter indikerer sterkere geometrisk/optisk resonnering (glass, refraksjon) sammenlignet med tidligere versjoner.
- Tenkning / intern forfining: Modellen bruker en synlig “thinking”-prosess internt for å forfine komposisjon (API-et dokumenterer denne atferden og bemerker at disse interne trinnene ikke belastes som endelige bildetokens).
- Grounding og verktøy: Støtter Search grounding (kan inkorporere nettfakta i generering av diagram/infografikk). Støtter også systeminstruksjoner for mer deterministisk kontroll.
Viktige API-parametere:
thinking_level(lav / høy) for å avveie latens mot resonneringsdybde;media_resolution(lav/middels/høy) for å kontrollere tokens for bilde-OCR/detaljlesing;generationConfig.imageConfigfor å styre sideforhold/oppløsning i bildegenereringens utdata.
Begrensninger for bilder:
- Støttede inndatamodaliteter: Tekst og bilder (modellen aksepterer ikke lyd eller video som inndata for bildegenerering).
- Maks antall bilder per prompt: 14 (for Gemini 3 Pro Image preview).
- Maks bildefilstørrelse (opplasting): 7 MB per inndata-bilde.
- Støttede sideforhold: 1:1, 3:2, 16:9, 9:16, 21:9, osv.
Utgangsbilder / tokens: høye grenser, med 4K/4096px støttet.
Benchmark-ytelse
Kort oppsummering: offentlige/tidlige benchmarker så langt er stort sett kvalitative / drevet av fellesskapet, men rapporterer konsekvent betydelige forbedringer i oppløsning, reduksjon av artefakter og fysisk trofasthet sammenlignet med den opprinnelige nano-banana (Gemini 2.5 Flash Image). Spesifikke navngitte utfordringer har vist klare visuelle gevinster, men det finnes ennå ikke (offentlige) standardiserte numeriske benchmark-tabeller fra Google som sammenligner v1 → v2 på tvers av standard metrikker for bildegenerering.
- Kvalitative tester fra fellesskapet: Renere kanter, skarpere mikrodetaljer, riktigere farger og mer trofast etterlevelse av prompt (færre hallusinerte rekvisitter, mer konsistente figurer). Populære uformelle tester inkluderer den såkalte “Wine Glass Test” og “Glass Burger Challenge”, der GEMPIX2 (Nano Banana Pro) håndterer transparens og refraksjon merkbart bedre enn tidligere bygg.
- Teksthåndtering: Nano Banana Pro viser synlig forbedret typografi og tekstplassering inne i bilder (en vedvarende svakhet for mange bildemodeller). Sammenligninger fra fellesskapet indikerer færre forvrengte gjengitte tegn.
- Gjennomstrømming / UX: raskere iterasjonshastighet og en UX som utfører flertrinns forfining i backend slik at brukere ser mer pålitelige førstegangsresultater (reduserer manuelle nykjøringer).
Begrensninger og risikoer
- Innholdsfiltre og gjenkjenning: Plattformer som integrerer modellen (f.eks. Whisk/tredjepartsapper) kan aktivere streng kjendis- eller likhetsgjenkjenning og blokkere visse utdata, noe som påvirker kreative arbeidsflyter som er avhengige av realistiske kjendislikheter.
- Hallusinasjon / resonnement i randtilfeller: selv om forbedret, kan modellen fortsatt produsere fysisk urealistiske artefakter, spesielt med tett symbolsk tekst inne i bilder eller svært tekniske diagrammer — selv om NB2 ser ut til å redusere disse feilene sammenlignet med tidligere versjoner.
- Sikkerhet og misbruk: generative bildemodeller kan brukes til å skape problematisk eller skadelig innhold. Google anvender begrensninger, innholdsfiltre og SynthID-vannmerke for å hjelpe med proveniens; likevel har misbruk forekommet (høyt profilert kontrovers knyttet til et Nano Banana-generert bilde i en politisk sensitiv setting).
Hvordan Nano Banana Pro står seg mot andre modeller
- Nano Banana Pro (GEMPIX 2 / Gemini 3 Pro Image) — sterk mobilintegrasjon, flerbilde-fusjon, iterativ selvkorrigering, 2K native/4K oppskalering, tett integrert i Google-apper (Search, Photos, Workspace/Gemini). Best egnet for arbeidsflyter som trenger pålitelige redigeringer, kontinuitet og integrasjon med Google-tjenester.
- Midjourney — utmerker seg på stiliserte kunstneriske utdata og fellesskapsdrevet prompt-ingeniørkunst; ikke typisk rettet mot fotonøyaktig flerbilde-fusjon eller dype multimodale redigeringspipeliner.
- Stable Diffusion / open weights — fullt åpen, svært tilpassbar og kan kjøres lokalt; økosystemet av sjekkpunkter og finjustering er en avgjørende fordel for forskning og frakoblet bruk. Mindre “ett-klikk” mobilintegrasjon og mindre konsistent flerbilde-redigeringssammenheng rett ut av boksen enn Nano Banana Pro.
- Seedream 4.0 (ByteDance) — nylig posisjonert eksplisitt som en Nano Banana-konkurrent, med vekt på ultraraske gjengivelser, 2K-utdata og støtte for mange referansebilder (opptil seks). Posisjonert som et alternativ for proff/skapere.
(Disse sammenligningene er på høyt nivå; velg en vinner ved å matche verktøyet til arbeidsflyten din: åpenhet/tilpasningsmulighet → Stable Diffusion; stilisert kunst → Midjourney; integrert, konsistent mobil redigering med aggressiv iterasjon → Nano Banana Pro/ Gemini 3 Pro image family.)
Virkelige bruksområder
- Mobil bilderedigering og kreative filtre (Google Photos-integrasjoner — restyling, bakgrunnsfusjon, portrettrekomponering).
- Markedsføring og annonsemateriell — rask konseptgenerering, konsistente merkevarefigurer på tvers av flere rammer/vinkler.
- Konseptkunst og storyboard — flerbilde-fusjon hjelper med å opprettholde figurkontinuitet på tvers av paneler.
- E-handel / produktmockups — generer konsistente produktbilder i ulike kontekster/lysforhold.
- Rask prototyping for AR/VR-ressurser — høykvalitets 2K/4K-utdata som kan oppskaleres for immersive bruksområder.
- Hvordan få tilgang til gemini-3-pro-image(Nano Banana Pro) API
Påkrevde trinn
- Logg inn på cometapi.com. Hvis du ikke er bruker hos oss ennå, registrer deg først
- Hent tilgangslegitimasjonens API-nøkkel for grensesnittet. Klikk “Add Token” ved API token i personlige senter, hent token-nøkkelen: sk-xxxxx og send inn.
- Hent URL-en til dette nettstedet:
https://api.cometapi.com/
Bruksmåte
- Velg “
gemini-3-pro-image”-endepunktet for å sende API-forespørselen og sett request body. Metode og request body hentes fra API-dokumentasjonen på nettstedet vårt. Nettstedet vårt tilbyr også Apifox-test for enkelhets skyld. - Erstatt <YOUR_API_KEY> med din faktiske CometAPI-nøkkel fra kontoen din.
- Sett inn spørsmålet eller forespørselen i content-feltet—det er dette modellen vil svare på.
- . Behandle API-responsen for å få det genererte svaret.
CometAPI tilbyr et fullt kompatibelt REST-API — for sømløs migrering. Viktige detaljer :
- Base-URL: https://api.cometapi.com/v1beta/models/gemini-3-pro-image-preview:generateContent
- Modellnavn:
gemini-3-pro-image - Autentisering:
Bearer YOUR_CometAPI_API_KEYheader - Content-Type:
application/json