基本功能
- 文字 → 圖像:完全由提示驅動的生成,對提示高度遵從。
- 圖像 → 圖像(編輯):細緻、精準的定向編輯,並在多次編輯中保持主體/角色的一致性。
- **最大輸出解析度:**最高可達 4K(範例與支援的精確像素尺寸取決於長寬比;API 提供 1K/2K/4K 預設)
- 迭代規劃與自我校正:內部採用「多階段」流程,能檢測並修正常見視覺錯誤(透視、文字、精細幾何)。
- 進階圖中文字渲染:清晰易讀的多語文字(從短註解到長段落),適用於海報、模型稿與資訊圖表。
- 在單一流程中可處理 5 個角色,並對最多 14 個物件/參考圖像保持高保真。
- **浮水印/來源溯源:**所有生成圖像均包含 SynthID 浮水印;模型在部分產品整合中嵌入 C2PA 中繼資料以標示來源。
Gemini 3 Pro Image 版本與命名
gemini-3-pro-image-previewgemini-3-pro-image
技術細節
架構
- 譜系/骨幹:Nano Banana Pro 建立於 Google 不斷演進的 Gemini 圖像技術堆疊之上 — 具體而言是全新的 Gemini 3 Pro Image / GEMPIX 2 架構(更高容量的圖像+文字多模態框架)。它由 Gemini 2.5 Flash Image(最初的「nano-banana」)演進而來,成為原生多模態且具備增強視覺-語言推理能力的圖像模型。
- 模型行為:原生多模態(圖像 + 文字 + 世界知識),具備多圖融合的明確管線,並採用內部分階段規劃器,通過多次迭代精修輸出,而非一次產出靜態樣本。早期回報顯示,相較於先前版本,在幾何/光學推理(玻璃、折射)方面更強。
- 思考/內部精修:模型在內部使用可見的「思考」過程來優化構圖(API 有記載此行為,並說明這些內部步驟不會計入最終圖像代幣計費)。
- 對齊/工具:支援 Search grounding(可將網路事實納入圖表/資訊圖產生)。亦支援系統指令以獲得更具決定性的控制。
關鍵 API 參數:
thinking_level(low / high):在延遲與推理深度之間取捨;media_resolution(low/medium/high):控制圖像 OCR/細節讀取的代幣用量;generationConfig.imageConfig:控制輸出圖像的長寬比/解析度。
圖像限制:
- **支援的輸入模態:**文字與圖像(模型不接受音訊或影片作為圖像生成的輸入)。
- **每次提示的最大圖像數:**14(適用於 Gemini 3 Pro Image 預覽)。
- **最大圖像大小(上傳):**每張輸入圖像 7 MB。
- **支援的長寬比:**1:1、3:2、16:9、9:16、21:9 等。
**輸出圖像/代幣:**上限較高,支援 4K/4096px。
基準表現
**簡短總結:**目前公開/早期基準多為質化、由社群推動,但一致指出相較於原始 nano-banana(Gemini 2.5 Flash Image),在解析度、偽影減少與物理真實度方面有顯著提升。若干具名「挑戰」測試顯示了明確的視覺增益,但 Google 尚未(公開)提供在標準圖像生成指標上對 v1 → v2 的標準化數值對照表。
- 質化社群測試:邊緣更乾淨、微觀細節更銳利、色彩更準確,且對提示的遵從度更高(更少臆造道具、角色一致性更佳)。常見的非正式測試包括所謂的「Wine Glass Test」與「Glass Burger Challenge」,其中 GEMPIX2(Nano Banana Pro)在處理透明度與折射方面明顯優於早期版本。
- 文字處理:Nano Banana Pro 在圖中排版與文本布局上有顯著改進(這一直是許多圖像模型的弱項)。社群對比顯示,渲染字形的錯亂情況更少。
- 吞吐/使用體驗:迭代速度更快,且後端執行多階段精修,讓使用者在首輪即看到更可靠的結果(減少手動重試)。
限制與風險
- 內容過濾與偵測:整合此模型的平台(如 Whisk/第三方應用)可能啟用嚴格的名人或肖像相似度偵測並阻擋特定輸出,影響依賴真實名人肖像的創作流程。
- 幻覺/推理邊界情形:儘管已有改進,模型仍可能產生物理上不合理的偽影,特別是在圖中含密集符號文本或高度技術性的圖表時——不過相較早期版本,NB2 似乎已降低此類錯誤。
- **安全與濫用:**生成式圖像模型可能被用來製作具爭議或有害內容。Google 施加限制、內容過濾與 SynthID 浮水印以協助來源追溯;然而,濫用情況仍曾發生(曾有 Nano Banana 生成圖像在政治敏感情境中引發高關注爭議)。
Nano Banana Pro 與其他模型的比較
- Nano Banana Pro (GEMPIX 2 / Gemini 3 Pro Image) — 行動端整合強、多圖融合、迭代式自我校正、原生 2K/4K 放大,與 Google 應用(Search、Photos、Workspace/Gemini)緊密整合。適用於需要可靠編輯、連貫性與 Google 服務整合的工作流程。
- Midjourney — 擅長風格化藝術輸出與社群驅動的提示工程;通常不以照片級多圖融合或深度多模態編輯管線為目標。
- Stable Diffusion / 開源權重 — 完全開放、高度可自訂,且可在本地部署;豐富的檢查點與微調生態對研究與離線使用是決定性優勢。相較 Nano Banana Pro,開箱即用的一鍵行動整合較弱,多圖編輯的一致性也較低。
- Seedream 4.0 (ByteDance) — 近期明確定位為 Nano Banana 的競品,強調極速渲染、2K 輸出與多參考圖支援(最多六張)。定位為專業/創作者的替代方案。
(以上比較為高層次概述;請依你的工作流程選擇最適工具:開放性/可自訂性 → Stable Diffusion;風格化藝術 → Midjourney;整合完善、連貫的行動編輯與積極迭代 → Nano Banana Pro / Gemini 3 Pro Image 系列。)
真實世界使用情境
- 行動相片編輯與創意濾鏡(Google Photos 整合 — 風格重塑、背景融合、人像重構)。
- 行銷與廣告素材 — 快速概念生成,於多個畫面/角度維持一致的品牌角色。
- 概念藝術與分鏡 — 多圖融合有助於在多個畫面中保持角色連貫性。
- 電商/產品模型稿 — 在不同情境/光照條件下生成一致的產品照片。
- AR/VR 素材快速原型 — 高品質 2K/4K 輸出,可進一步放大用於沉浸式體驗。
- 如何存取 gemini-3-pro-image(Nano Banana Pro)API
必要步驟
- 登入 cometapi.com。若您尚未成為我們的使用者,請先註冊
- 取得介面的存取憑證 API 金鑰。在個人中心的 API token 項下點擊「Add Token」,取得 token 金鑰:sk-xxxxx 並提交。
- 取得本網站的 URL:
https://api.cometapi.com/
使用方法
- 選擇「
gemini-3-pro-image」端點發送 API 請求並設定請求本文。請求方法與請求本文可於我們網站的 API 文件取得。我們亦提供 Apifox 測試以利使用。 - 將 <YOUR_API_KEY> 替換為您帳戶中的實際 CometAPI 金鑰。
- 將您的問題或請求填入 content 欄位—模型將對此做出回應。
- 處理 API 回應以取得生成的答案。
CometAPI 提供完全相容的 REST API — 以便無縫遷移。關鍵細節:
- 基底 URL:https://api.cometapi.com/v1beta/models/gemini-3-pro-image-preview:generateContent
- 模型名稱:
gemini-3-pro-image - 驗證:
Bearer YOUR_CometAPI_API_KEY標頭 - Content-Type:
application/json。