Fitur dasar
- Teks → Gambar: generasi sepenuhnya berbasis prompt dengan kepatuhan terhadap prompt yang kuat.
- Gambar → Gambar (penyuntingan): penyuntingan halus dan terarah dengan menjaga konsistensi subjek/karakter di berbagai penyuntingan.
- Resolusi keluaran maksimum: hingga 4K (contoh dan ukuran piksel yang didukung tergantung rasio aspek; API menyediakan preset 1K/2K/4K)
- Perencanaan iteratif & koreksi mandiri: pipeline internal “multi-tahap” yang mendeteksi dan mengoreksi kesalahan visual umum (perspektif, teks, geometri halus).
- Perenderan teks tingkat lanjut di dalam gambar: teks multi-bahasa yang jelas dan mudah dibaca (dari caption pendek hingga paragraf panjang) cocok untuk poster, mockup, dan infografik.
- 5 karakter dan fidelitas hingga 14 objek/gambar referensi dalam satu alur kerja.
- Watermarking / provenance: semua gambar yang dihasilkan menyertakan watermark SynthID; model menyematkan metadata C2PA untuk provenance di beberapa integrasi produk.
Versi & penamaan Gemini 3 Pro Image
gemini-3-pro-image-previewgemini-3-pro-image
Detail teknis
Arsitektur
- Keturunan / backbone: Nano Banana Pro dibangun di atas tumpukan gambar Gemini milik Google yang terus berevolusi — secara spesifik arsitektur Gemini 3 Pro Image / GEMPIX 2 (kerangka multimodal gambar+teks berkapasitas lebih tinggi). Ini merupakan evolusi dari Gemini 2.5 Flash Image ( “nano-banana” asli ) menjadi model gambar multimodal native dengan kemampuan penalaran visi-bahasa yang diperluas.
- Perilaku model: multimodalitas native (gambar + teks + pengetahuan dunia), pipeline eksplisit untuk penggabungan multi-gambar, dan perencana bertahap internal yang menyempurnakan keluaran dalam beberapa pass alih-alih menghasilkan sampel statis tunggal. Laporan awal menunjukkan penalaran geometris/optik yang lebih kuat (kaca, refraksi) dibandingkan versi sebelumnya.
- Pemikiran / penyempurnaan internal: Model menggunakan proses “berpikir” yang terlihat secara internal untuk menyempurnakan komposisi (API mendokumentasikan perilaku ini dan mencatat langkah internal tidak dikenai biaya sebagai token gambar final).
- Grounding & alat: Mendukung Search grounding (dapat menggabungkan fakta web ke dalam pembuatan diagram/infografik). Juga mendukung instruksi sistem untuk kontrol yang lebih deterministik.
Parameter API utama:
thinking_level(low / high) untuk menukar latensi vs kedalaman penalaran;media_resolution(low/medium/high) untuk mengontrol token pembacaan OCR/detail gambar;generationConfig.imageConfiguntuk mengontrol rasio aspek/resolusi pada keluaran gambar.
Batasan gambar:
- Modalitas input yang didukung: Teks dan gambar (model tidak menerima audio atau video sebagai input pembuatan gambar).
- Jumlah maksimum gambar per prompt: 14 (untuk pratinjau Gemini 3 Pro Image).
- Ukuran maksimum gambar (unggah): 7 MB per gambar input.
- Rasio aspek yang didukung: 1:1, 3:2, 16:9, 9:16, 21:9, dll.
Gambar / token keluaran: batas tinggi, dengan dukungan 4K/4096px.
Performa benchmark
Ringkasan singkat: benchmark publik/awal sejauh ini sebagian besar bersifat kualitatif / didorong komunitas, namun secara konsisten melaporkan peningkatan substansial dalam resolusi, pengurangan artefak, dan fidelitas fisik dibandingkan nano-banana asli (Gemini 2.5 Flash Image). Tantangan bernama tertentu menunjukkan peningkatan visual yang jelas, tetapi belum ada tabel benchmark numerik standar (publik) dari Google yang membandingkan v1 → v2 di seluruh metrik pembuatan gambar standar.
- Uji komunitas kualitatif: Tepi lebih bersih, detail mikro lebih tajam, warna lebih akurat, dan kepatuhan terhadap prompt yang lebih setia (lebih sedikit properti yang dihalusinasi, karakter lebih konsisten). Uji informal populer termasuk “Wine Glass Test” dan “Glass Burger Challenge”, di mana GEMPIX2 (Nano Banana Pro) menangani transparansi dan refraksi secara signifikan lebih baik dibandingkan versi sebelumnya.
- Penanganan teks: Nano Banana Pro menunjukkan tipografi dan penempatan teks di dalam gambar yang terlihat meningkat (kelemahan yang persisten untuk banyak model gambar). Perbandingan komunitas menunjukkan lebih sedikit glyph yang dirender secara acak/teracak.
- Throughput / UX: kecepatan iterasi lebih cepat dan UX yang melakukan penyempurnaan bertahap di backend sehingga pengguna melihat hasil pass pertama yang lebih andal (mengurangi re-roll manual).
Keterbatasan & risiko
- Filter konten & deteksi: Platform yang mengintegrasikan model (misalnya, Whisk/aplikasi pihak ketiga) dapat mengaktifkan deteksi ketat selebriti atau kemiripan dan memblokir keluaran tertentu, yang memengaruhi alur kreatif yang bergantung pada kemiripan selebriti realistis.
- Halusinasi / kasus batas penalaran: meski meningkat, model masih dapat menghasilkan artefak yang tidak realistis secara fisik, terutama dengan teks simbolik yang padat di dalam gambar atau diagram yang sangat teknis — meskipun NB2 tampak mengurangi kesalahan ini dibandingkan build sebelumnya.
- Keamanan & penyalahgunaan: model gambar generatif dapat digunakan untuk membuat konten yang bermasalah atau berbahaya. Google menerapkan batasan, filter konten, dan watermark SynthID untuk membantu provenance; namun demikian, penyalahgunaan telah terjadi (kontroversi profil tinggi terkait gambar yang dihasilkan Nano Banana dalam konteks sensitif secara politik).
Bagaimana Nano Banana Pro dibandingkan dengan model lain
- Nano Banana Pro (GEMPIX 2 / Gemini 3 Pro Image) — integrasi seluler yang kuat, penggabungan multi-gambar, koreksi mandiri iteratif, native 2K/upscaling 4K, terintegrasi erat ke aplikasi Google (Search, Photos, Workspace/Gemini). Terbaik untuk alur kerja yang membutuhkan penyuntingan andal, kontinuitas, dan integrasi dengan layanan Google.
- Midjourney — unggul dalam keluaran artistik bergaya dan prompt engineering berbasis komunitas; biasanya tidak ditujukan untuk fusi multi-gambar yang foto-akurat atau pipeline penyuntingan multimodal yang mendalam.
- Stable Diffusion / open weights — sepenuhnya terbuka, sangat dapat disesuaikan, dan dapat di-host secara lokal; ekosistem checkpoint dan fine-tuning adalah keunggulan menentukan untuk riset dan penggunaan offline. Integrasi seluler “satu klik” lebih sedikit dan koherensi penyuntingan multi-gambar yang kurang konsisten out-of-the-box dibandingkan Nano Banana Pro.
- Seedream 4.0 (ByteDance) — baru-baru ini diposisikan secara eksplisit sebagai pesaing Nano Banana, menekankan rendering ultra-cepat, keluaran 2K, dan dukungan untuk banyak gambar referensi (hingga enam). Diposisikan sebagai alternatif pro/creator.
(Perbandingan ini level tinggi; pilih pemenang dengan mencocokkan alat ke alur kerja Anda: keterbukaan/kustomisasi → Stable Diffusion; seni bergaya → Midjourney; penyuntingan seluler terintegrasi dan konsisten dengan iterasi agresif → keluarga Nano Banana Pro/Gemini 3 Pro Image.)
Kasus penggunaan dunia nyata
- Penyuntingan foto seluler & filter kreatif (integrasi Google Photos — restyling, penggabungan latar belakang, komposisi ulang potret).
- Aset pemasaran & iklan — generasi konsep cepat, karakter merek konsisten di berbagai frame/sudut.
- Seni konsep & storyboard — penggabungan multi-gambar membantu menjaga kontinuitas karakter di seluruh panel.
- E-commerce / mockup produk — menghasilkan jepretan produk yang konsisten dalam berbagai konteks/kondisi pencahayaan.
- Prototipe cepat untuk aset AR/VR — keluaran 2K/4K berkualitas tinggi yang dapat di-upscale untuk penggunaan imersif.
- Cara mengakses API gemini-3-pro-image (Nano Banana Pro)
Langkah yang diperlukan
- Masuk ke cometapi.com. Jika Anda belum menjadi pengguna kami, silakan daftar terlebih dahulu
- Dapatkan kredensial akses kunci API antarmuka. Klik “Add Token” pada token API di pusat personal, dapatkan kunci token: sk-xxxxx dan kirimkan.
- Dapatkan URL situs ini:
https://api.cometapi.com/
Metode penggunaan
- Pilih endpoint “
gemini-3-pro-image” untuk mengirim permintaan API dan setel body permintaan. Metode permintaan dan body permintaan diperoleh dari dokumentasi API situs web kami. Situs kami juga menyediakan pengujian Apifox untuk kenyamanan Anda. - Ganti <YOUR_API_KEY> dengan kunci CometAPI aktual dari akun Anda.
- Masukkan pertanyaan atau permintaan Anda ke bidang konten—ini yang akan direspons oleh model.
- . Proses respons API untuk mendapatkan jawaban yang dihasilkan.
CometAPI menyediakan REST API yang sepenuhnya kompatibel—untuk migrasi tanpa hambatan. Rincian utama :
- Base URL: https://api.cometapi.com/v1beta/models/gemini-3-pro-image-preview:generateContent
- Model Names:
gemini-3-pro-image - Authentication:
Bearer YOUR_CometAPI_API_KEYheader - Content-Type:
application/json.