المواصفات الفنية لـ GPT-Realtime-2
| المواصفة | التفاصيل |
|---|---|
| تاريخ الإصدار | May 7, 2026 |
| API | Realtime API (GA) |
| المدخلات | الصوت، النص، الصور |
| المخرجات | الصوت، النص |
| الاستدلال | بمستوى GPT-5 |
| البث المتدفق | نعم |
| ثنائي الاتجاه بالكامل | نعم |
| استدعاء الدوال | نعم |
| متعدد الوسائط | نعم |
| المقاطعات | مدعومة |
| كمون منخفض | نعم |
| SLA للمؤسسات | نعم |
| جاهز للإنتاج | نعم |
ما هو GPT-Realtime-2
يمثل GPT-Realtime-2 خطوة كبيرة إلى الأمام في الذكاء الاصطناعي للمحادثة من خلال تجاوز خطوط معالجة الكلام التقليدية إلى بنية موحدة أصلية للصوت مع استدلال بمستوى GPT-5. ودعمه للبث الصوتي، والمدخلات متعددة الوسائط، واستدعاء الأدوات/الدوال، والنشر على مستوى المؤسسات يجعله مناسبًا لوكلاء الصوت من الجيل التالي، ودعم العملاء، والرعاية الصحية، والتعليم، والمساعدين الأذكياء.
الميزات وأبرز ما يميز GPT-Realtime-2
1. استدلال بمستوى GPT-5
على عكس نماذج الزمن الحقيقي السابقة، يمكن لـ GPT-Realtime-2 حل:
- مهام متعددة الخطوات
- استفسارات كثيفة الاستدلال
- التخطيط
- الجدولة
- المحادثات المعقدة
بدلاً من مجرد توليد كلام طليق.
2. كمون منخفض للغاية
مُصمَّم لـ:
- وكلاء الهاتف
- المساعدات الصوتية
- خدمة العملاء
- مرافقو الذكاء الاصطناعي
قلّص تحديث يوليو 2026 كمون p95 بما لا يقل عن 25%.
3. استدعاء الأدوات
أثناء المحادثة المباشرة، يمكن للنموذج:
- البحث في قواعد البيانات
- التحقق من المخزون
- الاستعلام عن أنظمة CRM
- استدعاء/استرجاع المستندات
- تنفيذ واجهات برمجة التطبيقات
- استدعاء دوال مخصصة
دون إنهاء المحادثة.
4. كلام طبيعي
يدعم النموذج:
- المقاطعات
- التوقفات الطبيعية
- إيقاع المحادثة
- كلمات الحشو
- توقيتًا واعيًا بالعاطفة
- سرعة كلام ديناميكية
ما يجعل المحادثات أقرب بكثير إلى الحوار البشري.
5. فهم متعدد الوسائط
قد تشمل المدخلات:
- الصوت
- النص
- الصور
ممّا يتيح سيناريوهات مثل:
"انظر إلى هذه الصورة بينما أشرح المشكلة."
6. موثوقية على مستوى الإنتاج
واجهة Realtime API في الإصدار GA تضيف:
- دعم SLA
- حِزَم SDK مستقرة
- نقاط نهاية إنتاجية
- نشرًا على مستوى المؤسسات
متجاوزةً الخدمة التجريبية المبكرة السابقة.
أداء المقاييس المعيارية لـ GPT-Realtime-2
ركّزت OpenAI على التحسينات النوعية بدلًا من نشر حزمة معايير شاملة لـ GPT-Realtime-2. تشمل المقاييس المعلنة علنًا ما يلي:
| المقياس | GPT-Realtime-2 |
|---|---|
| تحويل كلام إلى كلام | أصلي |
| استدلال بمستوى GPT-5 | نعم |
| استدعاء الأدوات | نعم |
| فهم الصور | نعم |
| البث المتدفق | نعم |
| SLA للإنتاج | نعم |
| المقاطعات | أصلي |
| تحسين كمون p95 (v2.1) | ≥25% |
مقارنة GPT-Realtime-2 مع نماذج الصوت الأخرى
| الميزة | GPT-Realtime-2 | GPT-4o Realtime | Gemini Live | ElevenLabs Conversational AI |
|---|---|---|---|---|
| أصلي للصوت | ✅ | جزئي | نعم | لا |
| استدلال بمستوى GPT-5 | ✅ | لا | لا | لا |
| استدعاء الدوال | ✅ | محدود | محدود | لا |
| إدخال الصور | ✅ | نعم | نعم | لا |
| واجهة للمؤسسات | ✅ | تجريبي | نعم | نعم |
| البث المتدفق | ✅ | نعم | نعم | نعم |
| ثنائي الاتجاه بالكامل | ✅ | جزئي | نعم | لا |
| SLA للإنتاج | ✅ | لا | نعم | غير متاح |
يتميز GPT-Realtime-2 بجمعه بين الاستدلال المتقدم والتفاعل الصوتي منخفض الكمون ضمن واجهة جاهزة للإنتاج.
القيود
- تكلفة الرموز الصوتية أعلى من الاستدلال النصي فقط.
- الجلسات الصوتية طويلة الأمد تتطلب إدارة دقيقة لعرض النطاق الترددي والكمون.
- على الرغم من التعرّف على الإشارات الصوتية، تشير أبحاث مستقلة إلى أن السياق العاطفي لا ينعكس دائمًا بشكل متسق في القرارات اللاحقة، لذا تظل الرقابة البشرية مهمة في التطبيقات الحساسة.
كيفية استخدام واجهة برمجة تطبيقات GPT-Realtime-2 على CometAPI
توفر CometAPI بوابة واجهات موحّدة تُمكّن المطورين من الوصول إلى نماذج ذكاء اصطناعي متعددة — بما في ذلك نماذج الزمن الحقيقي المتوافقة مع OpenAI — عبر واجهة متسقة (تعتمد الإتاحة على كتالوج المزوّد المدعوم).
سير عمل نموذجي هو:
الخطوة 1: إنشاء حساب
سجّل في منصة CometAPI واحصل على مفتاح API.
الخطوة 2: تهيئة المصادقة
قم بتضمين مفتاح API الخاص بك في ترويسة الطلب:
Authorization: Bearer YOUR_API_KEY
الخطوة 3: اختيار النموذج
حدد معرّف نموذج الزمن الحقيقي (على سبيل المثال، اسم نموذج GPT-Realtime-2 المدعوم في حساب CometAPI لديك).
الخطوة 4: إنشاء جلسة زمن حقيقي
افتح اتصال WebSocket أو اتصال زمن حقيقي مدعومًا من الواجهة لبث الصوت ثنائي الاتجاه.
الخطوة 5: بث الصوت
أرسل صوت الميكروفون بشكل مستمر وتلقَّ ردودًا صوتية متدفقة، ما يتيح محادثات منخفضة الكمون.
الخطوة 6: تمكين الميزات المتقدمة
اعتمادًا على تنفيذ CometAPI، يمكنك تهيئة:
- استدعاء الدوال/الأدوات
- ذاكرة المحادثة
- إدخالات الصور
- اكتشاف نشاط الصوت
- التعامل مع المقاطعات
- مستوى الاستدلال (حيثما كان مدعومًا)
قبل التنفيذ، راجع الوثائق الحالية لـ CometAPI للتحقق من أسماء النماذج، ونقاط النهاية، والمصادقة، وتفاصيل بروتوكول الزمن الحقيقي، إذ قد تتطور هذه بشكل مستقل عن واجهة OpenAI الرسمية.