ما هي واجهة برمجة تطبيقات GPT-Image-1.5؟
GPT-Image-1.5 هو أحدث عضو في عائلة صور GPT والنموذج وراء تجربة Images المُعاد تصميمها في ChatGPT. صُمم لنقل توليد الصور من تجارب جديدة إلى أدوات إبداعية بمستوى الإنتاج: واقعية فوتوغرافية أعلى، تحكم أدق للتعديلات التكرارية، واستدلال أسرع لدعم التدفقات التفاعلية ومهام المؤسسات.
إن gpt-image-1.5 API نقطة نهاية نموذج صور متعددة الوسائط تقبل إدخال صورة واحدة أو أكثر (معرفات ملفات أو بايتات) بالإضافة إلى مطالبة نصية وتُرجِع صورًا مُولّدة أو مُعدّلة. وهي تدعم:
- توليد الصور من النص (إنشاء من المطالبة)،
- تحرير الصور / الطلاء الداخلي / التركيب (تطبيق التعليمات على الصور الموجودة، مع السماح بإدخالات صور متعددة)، و
- تدفقات تحرير تكرارية ومتعددة الدور عبر Responses API (تمكّن واجهات “tweak & iterate”).
تتعامل واجهة برمجة التطبيقات مع مطالبات الصور بشكل مختلف عن حدود DALL·E القديمة: تقبل نماذج GPT للصور مطالبات نصية أطول بكثير (إرشاد 32k-character)، مما يجعل التعليمات المعقدة والمقيدة ممكنة.
الميزات الرئيسية (عملية)
- تحسين قابلية التحرير / اتساق متعدد الأدوار: يحافظ على مظهر الشخصية والإضاءة والسمات البصرية الرئيسية عبر التعديلات التكرارية. هذا يجعل "نفس النموذج، تعديلات متكررة" أكثر موثوقية لتدفقات العمل مثل كتالوجات المنتجات أو أصول العلامة التجارية.
- معدل مرور أسرع — تحسينات سرعة 4× مقارنةً بـ GPT Image 1، بهدف خفض زمن الاستجابة للتدفقات الإبداعية التكرارية.
- تحسينات التكلفة — خفض تكاليف إدخال/إخراج الصور بنحو 20% مقارنةً بـ GPT Image 1، مما يقلل تكلفة كل تكرار صورة للمستخدمين ذوي الحجم العالي.
- تركيب متعدد الصور والرجوع إلى الأسلوب — قبول عدة صور مرجعية لتركيب المشاهد أو نقل الأسلوب/الإضاءة.
- مفاتيح جودة/إخلاص — معاملات في واجهة برمجة التطبيقات تُوازن بين السرعة والإخلاص (استخدم جودة أقل للتوليد بالجملة؛ جودة أعلى للأصول الإنتاجية).
- تحرير متعدد الأدوار / تكامل Responses API — يمكّن تدفقات عمل خطوة بخطوة (طلب تغييرات، ثم "إجراء تعديلات" مع الحفاظ على الحالة).
القدرات التقنية
- حد مطالبة النص (نماذج الصور): حتى 32,000 حرف (ملاحظة: توثق OpenAI هذا كسماح طول النص لنماذج صور GPT). استخدم هذا للمطالبات الطويلة ذات القيود الكثيفة.
- مدخلات الصور: يقبل File IDs (مفضلة للتدفقات متعددة الأدوار) أو البايتات الخام؛ يمكن توفير صور متعددة للتركيب والمرجع.
- المخرجات: PNG/JPEG أو عناصر صور المنصة الافتراضية التي تُعاد بواسطة واجهة برمجة التطبيقات (أو كمرفقات داخل ChatGPT). يمكن أن تتضمن المخرجات صورًا مرشحة متعددة وتدعم الطلبات التكرارية لتنقيح الناتج.
- أوضاع التوليد: من نص إلى صورة، تحرير الصور (طلاء داخلي/تمديد بالتعليمات)، ومتغيرات. يدعم التحرير متعدد الأدوار تعليمات من نمط "إضافة/طرح/دمج".
- تحرير واعٍ بالتعليمات: النماذج مُحسَّنة لالتزام التعليمات (مع الحفاظ على الثوابت المحددة مثل "لا تغيّر الشعار"، "حافظ على الوضعية والإضاءة"). أنماط هندسة المطالبات (تكرار الثوابت صراحةً في كل تكرار) تقلل الانحراف الدلالي.
أداء القياس المقارن
- الموضع في لوحة المتصدرين: ذكر تقرير تجميعي أن GPT Image 1.5 يتصدر ترتيب النص إلى صورة بـ ∼1264 نقطة على لوحة Artificial Analysis، متقدمًا على النموذج التالي بهامش ملحوظ.
- مقاييس على مستوى المهمة (التحرير والحفظ): يوضح ملخص مقاييس التقييم من Microsoft Foundry تحقيق GPT-Image-1.5 نجاح تعديل ثنائي شبه كامل (100% على BinaryEval أحادي الدور) ودرجات قوية لحفظ الوجوه (حوالي 90% على مقاييس AuraFace) في جدول المقارنة مقابل المنافسين والنماذج السابقة من OpenAI. تضع تلك المقاييس المقارنة GPT-Image-1.5 أمام بعض المنافسين في الحفظ وإخلاص التحرير.

كيف يقارن GPT-Image-1.5 بالنظراء
- مقارنةً بـ GPT Image 1 (الجيل السابق من OpenAI): أسرع (حتى 4×)، أرخص (~20% تكلفة إدخال/إخراج صور أقل)، وإخلاص تحرير أقوى — يستهدف الانتقال من "نموذج أولي/عرض" إلى تدفقات صور مناسبة للإنتاج.
- مقارنةً بنماذج الصور Nano Banana Pro / Gemini من Google: تُعد عائلة GPT-Image-1.5 ونماذج Nano Banana Pro / Gemini 3 من Google منافسين متقاربين — لكل منهما نقاط قوة في فئات مطالبات مختلفة. تؤكد رسائل OpenAI على إخلاص التحرير وسرعة التكرار؛ وقد حظي عرض Google بالثناء على الواقعية بمستوى الاستوديو في بعض الأمثلة.
- مقارنةً بـ Qwen Image ونماذج أخرى مفتوحة/مغلقة: أداء GPT-Image-1.5 يتفوق على Qwen Image في عدة مقاييس للتحرير والحفظ في تقييمات أحادية الدور، لكن الفروقات تضيق في التحرير متعدد الأدوار أو الاختبارات الخاصة بمجالات أخرى.
أين يتفوق GPT-Image-1.5
- تصوير منتجات التجارة الإلكترونية: إنشاء متغيرات بالجملة، تبديل الخلفيات، كتالوجات منتجات متسقة من صورة واحدة (الحفاظ على العلامة/الشعار).
- إنتاج الأصول الإبداعية والتسويقية: دورات مفاهيم سريعة، نماذج أولية فوتوغرافية، تحويلات أسلوبية مضبوطة.
- تنقيح الصور وتدفقات العمل التحريرية: تجارب واقعية للملابس/قصات الشعر، تنقيح انتقائي يحافظ على الهوية والإضاءة.
- تكامل أدوات التصميم: ربط بمنصات التصميم أو أنظمة إدارة المحتوى لإصدار متغيرات عند الطلب (مفاتيح الإخلاص تساعد في التحكم بالتكلفة).
- خطوط أنابيب تركيب متعددة الخطوات: تسمح المدخلات متعددة الصور بالتركيب والتوليد المستند إلى المرجع للمشاهد المعقدة.
كيفية الوصول إلى واجهة برمجة تطبيقات GPT Image 1.5
الخطوة 1: التسجيل للحصول على مفتاح API
سجّل الدخول إلى cometapi.com. إذا لم تكن مستخدمًا لدينا بعد، يرجى التسجيل أولًا. سجّل الدخول إلى CometAPI console. احصل على بيانات اعتماد الوصول لمفتاح واجهة برمجة التطبيقات. انقر "Add Token" عند رمز API في المركز الشخصي، واحصل على مفتاح الرمز: sk-xxxxx ثم أرسِل.
الخطوة 2: إرسال الطلبات إلى GPT Image 1.5 API
اختر نقطة النهاية “gpt-image-1.5” لإرسال طلب واجهة برمجة التطبيقات واضبط جسم الطلب. يتم الحصول على طريقة الطلب وجسم الطلب من وثائق واجهة برمجة التطبيقات على موقعنا. يوفّر موقعنا أيضًا اختبار Apifox لراحتك. استبدل <YOUR_API_KEY> بمفتاح CometAPI الفعلي من حسابك. عنوان الأساس هو Images (https://api.cometapi.com/v1/images/generations) و [تحرير الصور]
أدرِج سؤالك أو طلبك في حقل المحتوى — هذا ما سيستجيب له النموذج. عالج استجابة واجهة برمجة التطبيقات للحصول على الإجابة المُولّدة.
الخطوة 3: استرجاع النتائج والتحقق منها
عالج استجابة واجهة برمجة التطبيقات للحصول على الإجابة المُولّدة. بعد المعالجة، تستجيب واجهة برمجة التطبيقات بحالة المهمة وبيانات الإخراج.
اطلع أيضًا على Gemini 3 Pro Preview API