الميزات الأساسية
- نص → صورة: توليد كامل قائم على الموجه مع التزام قوي بالموجه.
- صورة → صورة (تعديلات): تعديلات دقيقة وموجهة مع الحفاظ على اتساق الموضوع/الشخصية عبر عدة تعديلات.
- الحد الأقصى لدقة المخرجات: حتى 4K (تعتمد الأمثلة وأحجام البكسل الدقيقة المدعومة على نسبة العرض إلى الارتفاع؛ تكشف واجهة API إعدادات مسبقة 1K/2K/4K)
- التخطيط التكراري والتصحيح الذاتي: خط أنابيب داخلي "متعدد المراحل" يكتشف الأخطاء البصرية الشائعة ويصححها (المنظور، النص، الهندسة الدقيقة).
- عرض نص متقدم داخل الصورة: نص واضح ومقروء متعدد اللغات (من التسميات القصيرة إلى الفقرات الطويلة) مناسب للملصقات والنماذج والصور المعلوماتية.
- 5 شخصيات وموثوقية حتى 14 كائناً/صورة مرجعية في سير عمل واحد.
- وضع علامات مائية/إثبات المصدر: تتضمن جميع الصور المُنشأة علامة مائية SynthID؛ يضمّن النموذج بيانات C2PA الوصفية لإثبات المصدر في بعض تكاملات المنتجات.
إصدارات Gemini 3 Pro Image وأسماؤها
gemini-3-pro-image-previewgemini-3-pro-image
التفاصيل التقنية
البنية المعمارية
- السلالة/العمود الفقري: يعتمد Nano Banana Pro على حزمة صور Gemini المتطورة من Google — تحديداً البنية الجديدة Gemini 3 Pro Image / GEMPIX 2 (إطار متعدد الوسائط عالي السعة للصورة+النص). وهو تطور من Gemini 2.5 Flash Image (الـ "nano-banana" الأصلي) إلى نموذج متعدد الوسائط أصلاً مع قدرات موسعة في الاستدلال بين الرؤية واللغة.
- سلوك النموذج: تعدد وسائط أصلي (صورة + نص + معرفة بالعالم)، خطوط أنابيب صريحة لدمج الصور المتعددة، ومخطط داخلي على مراحل يصقل المخرجات عبر عدة تمريرات بدلاً من إنتاج عينة ثابتة واحدة. تشير التقارير المبكرة إلى استدلال هندسي/بصري أقوى (الزجاج، الانكسار) مقارنة بالإصدارات السابقة.
- التفكير/التنقيح الداخلي: يستخدم النموذج عملية "تفكير" مرئية داخلياً لتحسين التركيب (توثق واجهة API هذا السلوك وتُشير إلى أن هذه الخطوات الداخلية لا تُحتسب كرموز صورة نهائية).
- الإرساء والأدوات: يدعم الإرساء عبر البحث (يمكنه إدراج حقائق من الويب في توليد المخططات/الصور المعلوماتية). كما يدعم تعليمات النظام لمزيد من التحكم الحتمي.
معلمات واجهة API الأساسية:
thinking_level(منخفض/مرتفع) للمفاضلة بين زمن الاستجابة وعمق الاستدلال;media_resolution(منخفض/متوسط/مرتفع) للتحكم في رموز قراءة تفاصيل/OCR الصورة;generationConfig.imageConfigللتحكم في نسبة العرض إلى الارتفاع/الدقة في مخرجات الصور.
حدود الصور:
- أنماط الإدخال المدعومة: النص والصور (النموذج لا يقبل الصوت أو الفيديو كمدخلات لتوليد الصور).
- الحد الأقصى للصور لكل موجه: 14 (للمعاينة Gemini 3 Pro Image).
- الحد الأقصى لحجم الصورة (رفع): 7 MB لكل صورة مُدخلة.
- نسب العرض إلى الارتفاع المدعومة: 1:1، 3:2، 16:9، 9:16، 21:9، إلخ.
صور الإخراج/الرموز: حدود مرتفعة، مع دعم 4K/4096px.
أداء القياس المرجعي
ملخص قصير: القياسات العامة/المبكرة حتى الآن غالباً نوعية/مدفوعة من المجتمع، لكنها تُبلغ بشكل متسق عن تحسينات كبيرة في الدقة وتقليل الشوائب والدقة الفيزيائية مقارنة بـ nano-banana الأصلي (Gemini 2.5 Flash Image). أظهرت "تحديات" مسماة محددة مكاسب بصرية واضحة، لكن لا توجد بعد جداول قياس مرجعي رقمية (علنية) من Google تقارن v1 → v2 عبر مقاييس توليد الصور القياسية.
- اختبارات نوعية من المجتمع: حواف أنظف، تفاصيل دقيقة أكثر حدة، ألوان أكثر صدقاً، والتزام أوفى بالموجه (عناصر متخيلة أقل وشخصيات أكثر اتساقاً). تشمل الاختبارات غير الرسمية الشائعة ما يُسمى "اختبار كأس النبيذ" و"تحدي برغر الزجاج"، حيث يتعامل GEMPIX2 (Nano Banana Pro) مع الشفافية والانكسار بشكل أفضل بكثير من الإصدارات السابقة.
- معالجة النص: يُظهر Nano Banana Pro تحسّناً ملحوظاً في الطباعة ووضع النص داخل الصور (وهي نقطة ضعف مستمرة لدى العديد من نماذج الصور). تُشير مقارنات المجتمع إلى أشكال محرف مرسومة مشوّهة أقل.
- الإنتاجية/تجربة المستخدم: سرعة تكرار أعلى وتجربة تُجري تنقيحاً متعدد المراحل في الخلفية بحيث يرى المستخدمون نتائج أكثر موثوقية من المحاولة الأولى (تقليل عمليات إعادة التوليد اليدوية).
القيود والمخاطر
- مرشحات المحتوى والكشف: قد تُفعّل المنصات التي تدمج النموذج (مثل Whisk/تطبيقات الطرف الثالث) كشفاً صارماً للمشاهير أو التشابه وتحظر مخرجات معينة، مما يؤثر على سير العمل الإبداعي الذي يعتمد على تشابه واقعي للمشاهير.
- الهلوسة/حالات حافة الاستدلال: رغم التحسّن، لا يزال النموذج قد يُنتج شوائب غير واقعية فيزيائياً، خصوصاً مع النصوص الرمزية الكثيفة داخل الصور أو المخططات التقنية للغاية — رغم أن NB2 يبدو أنه يقلّل هذه الأخطاء مقارنة بالبُنى السابقة.
- السلامة وسوء الاستخدام: يمكن استخدام نماذج توليد الصور لإنتاج محتوى إشكالي أو ضار. تطبق Google قيوداً ومرشحات محتوى وعلامة SynthID المائية للمساعدة في إثبات المصدر؛ ومع ذلك، حدث سوء استخدام (جدل بارز مرتبط بصورة مولدة بـ Nano Banana في سياق حساس سياسياً).
موقع Nano Banana Pro مقارنة بنماذج أخرى
- Nano Banana Pro (GEMPIX 2 / Gemini 3 Pro Image) — تكامل قوي مع الهواتف، دمج متعدد الصور، تصحيح ذاتي تكراري، دقة أصلية 2K/ترقية إلى 4K، ومُدمج بإحكام في تطبيقات Google (Search، Photos، Workspace/Gemini). الأفضل لتدفقات عمل تحتاج تعديلات موثوقة واستمرارية وتكامل مع خدمات Google.
- Midjourney — يتفوّق في المخرجات الفنية المُصمّمة والأسلوبية؛ لا يُستهدف عادةً للدمج متعدد الصور بدقة فوتوغرافية أو خطوط تحرير متعددة الوسائط عميقة.
- Stable Diffusion / open weights — مفتوح بالكامل، قابل للتخصيص بدرجة عالية، وقابل للاستضافة محلياً؛ نظام بيئي لنقاط التحقق والضبط الدقيق يُعد ميزة حاسمة للبحث والاستخدام دون اتصال. تكامل أقل بلمسة واحدة على الهاتف واتساق أقل في تحرير متعدد الصور دون ضبط إضافي مقارنةً بـ Nano Banana Pro.
- Seedream 4.0 (ByteDance) — موضعه بوضوح كمنافس لـ Nano Banana، مع التركيز على العرض فائق السرعة، مخرجات 2K، ودعم لعدد كبير من الصور المرجعية (حتى ستّة). متموضع كبديل للمحترفين/المبدعين.
(هذه المقارنات عالية المستوى؛ اختر الأداة الأنسب عبر مطابقة الأداة مع سير عملك: الانفتاح/قابلية التخصيص → Stable Diffusion؛ الفن المُصمّم والأسلوبي → Midjourney؛ تحرير متناغم ومتكامل على الهاتف مع تكرار عدواني → Nano Banana Pro/ عائلة Gemini 3 Pro Image.)
حالات استخدام واقعية
- تحرير الصور على الهاتف والفلاتر الإبداعية (تكاملات Google Photos — إعادة تصميم، دمج الخلفيات، إعادة تركيب الصور الشخصية).
- التسويق وأصول الإعلانات — توليد سريع للأفكار، شخصيات علامة تجارية متسقة عبر إطارات/زوايا متعددة.
- فن المفهوم ولوحات القصص — يساعد دمج الصور المتعددة على الحفاظ على استمرارية الشخصية عبر اللوحات.
- التجارة الإلكترونية/نماذج المنتجات — توليد لقطات منتج متسقة في سياقات/ظروف إضاءة مختلفة.
- نماذج أولية سريعة لأصول الواقع المعزز/الواقع الافتراضي — مخرجات عالية الجودة 2K/4K يمكن ترقيتها للاستخدامات الغامرة.
- كيفية الوصول إلى واجهة gemini-3-pro-image (Nano Banana Pro) API
الخطوات المطلوبة
- سجّل الدخول إلى cometapi.com. إن لم تكن مستخدمنا بعد، يرجى التسجيل أولاً
- احصل على بيانات اعتماد الوصول لمفتاح واجهة API. انقر "Add Token" عند قسم API token في المركز الشخصي، واحصل على مفتاح الرمز: sk-xxxxx ثم أرسله.
- احصل على عنوان هذا الموقع:
https://api.cometapi.com/
طريقة الاستخدام
- اختر نقطة النهاية "
gemini-3-pro-image" لإرسال طلب واجهة API واضبط جسم الطلب. تُستمد طريقة الطلب وجسم الطلب من وثائق API على موقعنا. يوفر موقعنا أيضاً اختبار Apifox لراحتك. - استبدل <YOUR_API_KEY> بمفتاح CometAPI الفعلي من حسابك.
- أدخل سؤالك أو طلبك في حقل المحتوى — هذا ما سيستجيب له النموذج.
- . عالج استجابة واجهة API للحصول على الإجابة المُولّدة.
توفر CometAPI واجهة REST متوافقة بالكامل — لانتقال سلس. تفاصيل أساسية:
- عنوان الأساس: https://api.cometapi.com/v1beta/models/gemini-3-pro-image-preview:generateContent
- أسماء النماذج:
gemini-3-pro-image - المصادقة:
Bearer YOUR_CometAPI_API_KEYالترويسة - نوع المحتوى:
application/json