คุณสมบัติพื้นฐาน
- Text → Image: การสร้างภาพแบบขับเคลื่อนด้วยพรอมป์อย่างเต็มรูปแบบ พร้อมความสอดคล้องตามพรอมป์สูง
- Image → Image (edits): การแก้ไขแบบละเอียด เจาะจง พร้อมรักษาความสอดคล้องของวัตถุ/ตัวละครตลอดหลายรอบการแก้ไข
- Maximum output resolution: สูงสุดถึง 4K (ตัวอย่างและขนาดพิกเซลที่รองรับขึ้นกับอัตราส่วนภาพ; API มีพรีเซ็ต 1K/2K/4K)
- Iterative planning & self-correction: ไปป์ไลน์ภายในแบบ “หลายขั้นตอน” ที่ตรวจจับและแก้ไขข้อผิดพลาดเชิงภาพที่พบบ่อย (มุมมอง ตัวอักษร เรขาคณิตละเอียด)
- Advanced in-image text rendering: แสดงผลข้อความหลายภาษาในภาพได้คมชัด อ่านง่าย ตั้งแต่คำบรรยายสั้นถึงย่อหน้าที่ยาว เหมาะกับโปสเตอร์ ม็อกอัป และอินโฟกราฟิก
- 5 characters และความซื่อสัตย์เชิงภาพสำหรับสูงสุด 14 objects/reference images ในเวิร์กโฟลว์เดียว
- Watermarking / provenance: ภาพทั้งหมดที่สร้างจะมีลายน้ำ SynthID; โมเดลฝังเมทาดาต้า C2PA เพื่อการตรวจสอบที่มาในบางอินทิเกรชันของผลิตภัณฑ์
เวอร์ชันและการตั้งชื่อของ Gemini 3 Pro Image
gemini-3-pro-image-previewgemini-3-pro-image
รายละเอียดทางเทคนิค
สถาปัตยกรรม
- Lineage / backbone: Nano Banana Pro พัฒนาบนสแต็กภาพ Gemini ของ Google ที่ต่อยอดอย่างต่อเนื่อง — โดยเฉพาะสถาปัตยกรรมใหม่ Gemini 3 Pro Image / GEMPIX 2 (กรอบงานมัลติโหมดัลภาพ+ข้อความความจุสูงกว่า) ซึ่งวิวัฒน์มาจาก Gemini 2.5 Flash Image (“nano-banana” ดั้งเดิม) สู่โมเดลภาพแบบมัลติโหมดัลโดยกำเนิดที่เพิ่มศักยภาพการให้เหตุผลด้านวิสัยทัศน์-ภาษา
- พฤติกรรมของโมเดล: มัลติโหมดัลโดยกำเนิด (ภาพ + ข้อความ + ความรู้โลก) มีไปป์ไลน์ชัดเจนสำหรับการผสานหลายภาพ และตัววางแผนแบบแบ่งขั้นที่ปรับแต่งผลลัพธ์หลายพาสแทนการสุ่มครั้งเดียว รายงานช่วงแรกชี้ถึงเหตุผลเชิงเรขาคณิต/ออปติคที่แข็งแรงขึ้น (แก้ว การหักเห) เมื่อเทียบกับเวอร์ชันก่อน
- Thinking / internal refinement: โมเดลใช้กระบวนการ “คิด” ที่มองเห็นได้ภายในเพื่อปรับแต่งองค์ประกอบ โดย API ระบุพฤติกรรมนี้และชี้ว่าไม่คิดค่าโทเค็นภาพขั้นสุดท้ายสำหรับขั้นตอนภายในดังกล่าว
- Grounding & tools: รองรับ Search grounding (ผสานข้อเท็จจริงจากเว็บในการสร้างไดอะแกรม/อินโฟกราฟิก) และรองรับ system instructions เพื่อการควบคุมที่กำหนดได้มากขึ้น
พารามิเตอร์ API หลัก:
thinking_level(low / high) สำหรับปรับสมดุลความหน่วงเทียบกับความลึกของเหตุผลmedia_resolution(low/medium/high) เพื่อควบคุมโทเค็นการอ่านรายละเอียด/OCR ของภาพgenerationConfig.imageConfigเพื่อกำหนดอัตราส่วน/ความละเอียดของเอาต์พุตภาพ
ขีดจำกัดของภาพ:
- Input modalities ที่รองรับ: ข้อความและภาพ (โมเดลไม่รับเสียงหรือวิดีโอเป็นอินพุตสำหรับการสร้างภาพ)
- จำนวนภาพสูงสุดต่อพรอมป์: 14 (สำหรับ Gemini 3 Pro Image preview)
- ขนาดภาพสูงสุด (อัปโหลด): 7 MB ต่อภาพอินพุต
- อัตราส่วนภาพที่รองรับ: 1:1, 3:2, 16:9, 9:16, 21:9 เป็นต้น
Output images / tokens: ขีดจำกัดสูง รองรับ 4K/4096px
ประสิทธิภาพในการทดสอบมาตรฐาน
สรุปสั้นๆ: มาตรฐานสาธารณะ/ช่วงต้นส่วนใหญ่ยังเป็นเชิงคุณภาพ/ชุมชนเป็นหลัก แต่รายงานสม่ำเสมอว่ามีการปรับปรุงอย่างชัดเจนด้านความละเอียด การลดอาร์ติแฟกต์ และความสมจริงทางกายภาพเมื่อเทียบกับ nano-banana ดั้งเดิม (Gemini 2.5 Flash Image) มี “ความท้าทาย” ที่มีชื่อเรียกหลายรายการแสดงให้เห็นความก้าวหน้าเชิงภาพชัดเจน แต่ยังไม่มีตารางตัวเลขมาตรฐาน (สาธารณะ) จาก Google ที่เปรียบเทียบ v1 → v2 บนเมตริกการสร้างภาพมาตรฐาน
- การทดสอบเชิงคุณภาพโดยชุมชน: ขอบภาพสะอาดขึ้น รายละเอียดจุลภาคคมชัด สีแม่นยำขึ้น และยึดตามพรอมป์ได้ซื่อสัตย์มากขึ้น (ลดการจินตนาการพร็อพ ลดความไม่สอดคล้องของตัวละคร) การทดสอบที่นิยมเช่น “Wine Glass Test” และ “Glass Burger Challenge” ที่ GEMPIX2 (Nano Banana Pro) จัดการความโปร่งใสและการหักเหได้ดีกว่าเวอร์ชันก่อนอย่างเห็นได้ชัด
- การจัดการข้อความ: Nano Banana Pro แสดงให้เห็นถึงการพิมพ์และการจัดวางข้อความในภาพที่ดีขึ้นอย่างชัดเจน (ซึ่งเป็นจุดอ่อนถาวรของหลายโมเดลภาพ) การเปรียบเทียบโดยชุมชนชี้ว่ากลไกการเรนเดอร์อักษรผิดเพี้ยนลดลง
- Throughput / UX: ความเร็วรอบการทำงานสูงขึ้น และ UX ที่ทำการปรับแต่งหลายขั้นตอนด้านหลังบ้าน ทำให้ผู้ใช้ได้ผลครั้งแรกที่เชื่อถือได้มากขึ้น (ลดการสุ่มใหม่ด้วยมือ)
ข้อจำกัดและความเสี่ยง
- ตัวกรองเนื้อหา & การตรวจจับ: แพลตฟอร์มที่ผสานโมเดล (เช่น Whisk/แอปของบุคคลที่สาม) อาจเปิดใช้งานการตรวจจับบุคคลมีชื่อเสียงหรือความคล้ายคลึงอย่างเข้มงวดและบล็อกผลลัพธ์บางอย่าง ซึ่งกระทบเวิร์กโฟลว์สร้างสรรค์ที่อาศัยภาพเหมือนบุคคลมีชื่อเสียงอย่างสมจริง
- การจินตนาการ / เคสเหตุผลที่ปลายสุด: แม้จะดีขึ้น แต่โมเดลยังคงอาจสร้างอาร์ติแฟกต์ที่ไม่สมจริงทางกายภาพ โดยเฉพาะกับข้อความเชิงสัญลักษณ์หนาแน่นในภาพหรือไดอะแกรมทางเทคนิคขั้นสูง — อย่างไรก็ดี NB2 ดูเหมือนลดข้อผิดพลาดเหล่านี้เมื่อเทียบเวอร์ชันก่อน
- ความปลอดภัย & การใช้งานผิดวัตถุประสงค์: โมเดลสร้างภาพสามารถถูกใช้สร้างเนื้อหาที่มีปัญหาหรือเป็นอันตราย Google ใช้ข้อจำกัด ตัวกรองเนื้อหา และลายน้ำ SynthID เพื่อช่วยด้านที่มา อย่างไรก็ตามยังมีกรณีการใช้งานผิดวัตถุประสงค์เกิดขึ้น (กรณีอื้อฉาวระดับสูงที่เชื่อมโยงกับภาพจาก Nano Banana ที่ถูกสร้างในบริบทอ่อนไหวทางการเมือง)
Nano Banana Pro เมื่อเทียบกับโมเดลอื่น
- Nano Banana Pro (GEMPIX 2 / Gemini 3 Pro Image) — จุดแข็งด้านการผสานบนมือถือ การผสานหลายภาพ การแก้ไขตนเองเชิงวนซ้ำ เอาต์พุต 2K ดั้งเดิม/อัปสเกล 4K ผสานแน่นกับแอป Google (Search, Photos, Workspace/Gemini) เหมาะสำหรับเวิร์กโฟลว์ที่ต้องการการแก้ไขที่เชื่อถือได้ ความต่อเนื่อง และการผสานบริการของ Google
- Midjourney — เด่นด้านงานศิลป์เชิงสไตล์และการวิศวกรรมพรอมป์ที่ขับเคลื่อนโดยชุมชน ไม่ได้มุ่งที่การผสานหลายภาพแบบโฟโต้เรียลหรือไปป์ไลน์แก้ไขมัลติโหมดัลเชิงลึกโดยตรง
- Stable Diffusion / open weights — เปิดเต็มรูปแบบ ปรับแต่งได้สูง และโฮสต์บนเครื่องได้ ระบบนิเวศของเช็คพอยต์และไฟน์จูนคือข้อได้เปรียบสำหรับงานวิจัยและการใช้งานออฟไลน์ ความผสานมือถือแบบ “คลิกเดียว” และความสอดคล้องของการแก้ไขหลายภาพนอกกล่องอาจน้อยกว่า Nano Banana Pro
- Seedream 4.0 (ByteDance) — วางตำแหน่งแข่งขันกับ Nano Banana อย่างชัดเจน เน้นการเรนเดอร์ความเร็วสูงมาก เอาต์พุต 2K และรองรับภาพอ้างอิงจำนวนมาก (สูงสุดหก) วางตัวเป็นทางเลือกสำหรับสายโปร/ครีเอเตอร์
(การเปรียบเทียบเหล่านี้เป็นภาพรวมระดับสูง เลือกเครื่องมือให้ตรงกับเวิร์กโฟลว์: ความเปิดกว้าง/การปรับแต่ง → Stable Diffusion; งานศิลป์เชิงสไตล์ → Midjourney; การแก้ไขบนมือถือที่สอดคล้องและวนซ้ำรวดเร็ว → Nano Banana Pro/Gemini 3 Pro Image)
กรณีใช้งานจริง
- การแก้ไขภาพบนมือถือและฟิลเตอร์สร้างสรรค์ (ผสานกับ Google Photos — ปรับสไตล์ หลอมพื้นหลัง จัดองค์ประกอบภาพบุคคล)
- ทรัพย์สินด้านการตลาด & โฆษณา — สร้างคอนเซ็ปต์อย่างรวดเร็ว ตัวละครแบรนด์ที่สอดคล้องกันข้ามหลายเฟรม/มุม
- คอนเซ็ปต์อาร์ต & สตอรีบอร์ด — การผสานหลายภาพช่วยคงความต่อเนื่องของตัวละครข้ามพาเนล
- อีคอมเมิร์ซ / ม็อกอัประหว่างผลิตภัณฑ์ — สร้างภาพสินค้าที่สอดคล้องในบริบท/สภาพแสงต่างๆ
- การต้นแบบอย่างรวดเร็วสำหรับสินทรัพย์ AR/VR — เอาต์พุต 2K/4K คุณภาพสูงที่สามารถอัปสเกลสำหรับงานเสมือนจริงได้
- วิธีเข้าถึง API gemini-3-pro-image(Nano Banana Pro)
ขั้นตอนที่ต้องทำ
- เข้าสู่ระบบที่ cometapi.com หากยังไม่เป็นผู้ใช้ โปรดลงทะเบียนก่อน
- รับคีย์รับรองความถูกต้อง API ของอินเทอร์เฟซ คลิก “Add Token” ในส่วน API token ของศูนย์ส่วนบุคคล รับ token key: sk-xxxxx และส่ง
- รับ url ของไซต์นี้:
https://api.cometapi.com/
วิธีใช้งาน
- เลือกปลายทาง “
gemini-3-pro-image” เพื่อส่งคำขอ API และตั้งค่า request body วิธีและรูปแบบ request body สามารถดูได้จากเอกสาร API บนเว็บไซต์ของเรา เว็บไซต์ยังมีการทดสอบผ่าน Apifox เพื่อความสะดวก - แทนที่ <YOUR_API_KEY> ด้วย CometAPI key จริงจากบัญชีของคุณ
- ใส่คำถามหรือคำขอของคุณในฟิลด์ content — โมเดลจะตอบกลับตามนั้น
- ประมวลผลการตอบกลับของ API เพื่อรับคำตอบที่สร้างขึ้น
CometAPI มี REST API ที่เข้ากันได้อย่างสมบูรณ์ — เพื่อการย้ายระบบอย่างไร้รอยต่อ รายละเอียดสำคัญ:
- Base URL: https://api.cometapi.com/v1beta/models/gemini-3-pro-image-preview:generateContent
- ชื่อโมเดล:
gemini-3-pro-image - การตรวจสอบสิทธิ์:
Bearer YOUR_CometAPI_API_KEYheader - Content-Type:
application/json.