المواصفات التقنية لـ GPT-Realtime-2.1
| المواصفة | التفاصيل |
|---|---|
| اسم النموذج | GPT-Realtime-2.1 |
| المزوّد | OpenAI |
| عائلة النموذج | سلسلة GPT-Realtime |
| نوع النموذج | نموذج استدلال صوتي متعدد الوسائط في الزمن الحقيقي |
| القدرة الأساسية | وكلاء ذكاء اصطناعي صوت-إلى-صوت |
| وسائط الإدخال | نص، صوت، صورة |
| وسائط الإخراج | نص، صوت |
| نافذة السياق | 128,000 رموز |
| الحد الأقصى لرموز الإخراج | 32,000 رموز |
| دعم الاستدلال | جهد استدلال قابل للتهيئة |
| استدعاء الدوال | مدعوم |
| المخرجات المهيكلة | غير مدعومة |
| الضبط الدقيق | غير مدعوم |
| إدخال الفيديو | غير مدعوم |
| نقطة نهاية API الرئيسية | Realtime API |
| حد المعرفة | 30 سبتمبر 2024 |
المصدر: وثائق نموذج OpenAI GPT-Realtime-2.1.
ما هو GPT-Realtime-2.1؟
GPT-Realtime-2.1 هو نموذج صوتي متقدم من OpenAI مصمم لبناء وكلاء ذكاء اصطناعي حواريين يمكنهم الاستماع والاستدلال والاستجابة بشكل طبيعي عبر الصوت.
مقارنةً بالمساعدات الصوتية التقليدية التي تعتمد على خطوط معالجة منفصلة لتحويل الكلام إلى نص وفهم اللغة وتحويل النص إلى كلام، يوفّر GPT-Realtime-2.1 تفاعلاً صوتياً أصيلاً من صوت إلى صوت، ممّا يمكّن محادثات أقل زمناً للاستجابة مع معالجة أفضل للمقاطعة وفهماً سياقياً محسّناً.
تم تحسين النموذج لتطبيقات الصوت الإنتاجية بما في ذلك وكلاء خدمة العملاء، ومساعدو الذكاء الاصطناعي، وأتمتة المبيعات، ومنصات التعليم، والتجارب الصوتية التفاعلية.
أداء المعايير القياسية لـ GPT-Realtime-2.1
تُركّز تحسينات GPT-Realtime-2.1 على مقاييس التفاعل العملي الفوري:
| القدرة | التحسين |
|---|---|
| التعامل مع المقاطعات الصوتية | محسّن |
| مقاومة الضوضاء | محسّن |
| التعرّف على الأحرف والأرقام | محسّن |
| أُطر عمل صوتية قائمة على الأدوات | مدعوم |
| تفاعل صوت-إلى-صوت | مدعوم |
الميزات الرئيسية لـ GPT-Realtime-2.1
1. تفاعل صوتي أصيل من صوت إلى صوت
يلغي GPT-Realtime-2.1 الحاجة إلى خطوط معالجة منفصلة للتعرّف على الكلام وتحويل النص إلى كلام.
البنية التقليدية للصوت:
User Voice
↓
Speech-to-Text
↓
LLM Processing
↓
Text-to-Speech
↓
Voice Response
GPT-Realtime-2.1:
User Voice
↓
GPT-Realtime-2.1
↓
Voice Response
هذا يقلّل زمن الاستجابة ويحسّن سلاسة المحادثة.
2. جودة محادثة صوتية محسّنة
يحسّن GPT-Realtime-2.1 عدة تحديات صوتية في العالم الحقيقي:
معالجة أفضل للمقاطعة
يمكن للمستخدمين مقاطعة الذكاء الاصطناعي بشكل طبيعي أثناء حديثه.
مثال:
المستخدم:
"احجز لي رحلة إلى—في الواقع، غيّر ذلك إلى طوكيو."
يمكن للنموذج التعافي من تغيّرات المحادثة دون إعادة بدء التفاعل.
تعامل أفضل مع الصمت والضوضاء
تم تحسين النموذج للبيئات التي تكون فيها جودة الصوت غير مثالية:
- مراكز الاتصال
- الأجهزة المحمولة
- الأماكن العامة
- الأجهزة الذكية
3. استخدام متقدم للأدوات بواسطة الوكلاء الصوتيين
يدعم GPT-Realtime-2.1 استدعاء الأدوات، مما يسمح للوكلاء الصوتيين بتنفيذ إجراءات.
أمثلة:
خدمة العملاء:
User:
"Where is my order?"
AI:
→ Calls order database API
→ Retrieves status
→ Responds by voice
سير عمل مؤسسي:
Voice command
↓
Reasoning
↓
API execution
↓
Voice confirmation
هذا يجعل GPT-Realtime-2.1 مناسباً للوكلاء الصوتيين الذاتيين.
4. قدرة استدلال قابلة للتهيئة
على خلاف نماذج الصوت الفورية السابقة المُحسّنة أساساً للسرعة، يقدّم GPT-Realtime-2.1 جهداً استدلالياً قابلاً للتهيئة.
يمكن للمطورين الموازنة بين:
- زمن استجابة الرد
- الدقة
- تعقيد المهمة
استدلال منخفض:
- محادثات بسيطة
- مساعدو الأسئلة المتكررة
استدلال أعلى:
- طلبات العملاء المعقّدة
- أُطر عمل متعددة الخطوات
- العمليات التجارية
5. تعرّف أفضل على الأرقام والمعلومات التقنية
كثيراً ما يواجه الوكلاء الصوتيون صعوبة مع:
- أرقام الحسابات
- الأرقام التسلسلية
- العناوين
- رموز المنتجات
- المعلومات المالية
يحسّن GPT-Realtime-2.1 التعرّف على الأحرف والأرقام، مما يجعله أكثر ملاءمة لأنظمة الصوت المؤسسية.
6. دعم الإدخال متعدد الوسائط
يدعم GPT-Realtime-2.1:
| الإدخال | الدعم |
|---|---|
| نص | ✅ |
| صوت | ✅ |
| صورة | ✅ |
| فيديو | ❌ |
يتيح إدخال الصور سيناريوهات مثل:
- دعم عملاء بصري
- تفسير المستندات
- مساعدون يعتمدون على الكاميرا
مقارنة GPT-Realtime-2.1 مع GPT-Realtime-2 ومع GPT-4o Realtime
| النموذج | نقاط القوة | أفضل استخدام |
|---|---|---|
| GPT-Realtime-2.1 | أفضل استدلال فوري + قدرات الوكلاء الصوتيين | وكلاء صوتيون للإنتاج |
| GPT-Realtime-2 | استدلال صوتي فوري قوي | تطبيقات محادثة متقدمة |
| GPT-4o Realtime | تفاعل متعدد الوسائط سريع | مساعدات صوتية عامة |
مقارنة GPT-Realtime-2.1 مع GPT-Realtime-2
يحسّن GPT-Realtime-2.1:
- التعافي من المقاطعة الصوتية
- التعامل مع الضوضاء
- دقة التعرّف
- متانة المحادثة
يشترك كلا النموذجين في:
- بنية صوت-إلى-صوت
- استدعاء الأدوات
- دعم الاستدلال
- الوصول إلى Realtime API
مقارنة GPT-Realtime-2.1 مع GPT-4o Realtime
يتموضع GPT-Realtime-2.1 لأُطر عمل وكيل أكثر تقدماً.
بالمقارنة مع GPT-4o Realtime:
| القدرة | GPT-Realtime-2.1 | GPT-4o Realtime |
|---|---|---|
| الاستدلال | أقوى | عام |
| السياق | 128K | 32K |
| استخدام الأدوات | مدعوم | مدعوم |
| الوكلاء الصوتيون | متقدم | عام |
| أُطر عمل معقّدة | أنسب | مناسب |
كيفية استخدام GPT-Realtime-2.1 API مع CometAPI
تم تصميم GPT-Realtime-2.1 لتطبيقات الوكلاء الصوتيين منخفضة زمن الاستجابة. وهو يدعم التفاعل الفوري صوت-إلى-صوت، إدخال/إخراج الصوت، إدخال الصور، جهداً استدلالياً قابلاً للتهيئة، واستدعاء الدوال لأُطر عمل صوتية ممكّنة بالأدوات. تعرضه OpenAI عبر Realtime API، بما في ذلك طرق اتصال فورية تعتمد على WebRTC وWebSocket وSIP.
توفر CometAPI طبقة API موحّدة لدمج نماذج الذكاء الاصطناعي المتقدمة، مما يسمح للمطورين بالوصول إلى أُطر عمل على نمط GPT-Realtime-2.1 دون الحاجة إلى إدارة مصادقة موفّرين منفصلة ومنطق SDK وبنية تحتية مستقلة.
الخطوة 1: احصل على مفتاح API الخاص بـ CometAPI
أنشئ حساباً على CometAPI وأنشئ رمز API من وحدة تحكم المطوّرين.
يجب أن تتضمن طلبات API الخاصة بك:
Authorization: Bearer YOUR_COMETAPI_API_KEY
Content-Type: application/json
يقوم مفتاح API بمصادقة طلباتك ويسمح لتطبيقك باستدعاء نماذج الذكاء الاصطناعي المتاحة عبر CometAPI.
الخطوة 2: أنشئ جلسة GPT-Realtime-2.1
يعمل GPT-Realtime-2.1 من خلال جلسة فورية مستمرة بدلاً من إكمال الدردشة التقليدي القائم على الطلب-الاستجابة.
تحافظ الجلسة الفورية على:
- بث إدخال الصوت
- استجابات النموذج
- حالة المحادثة
- استدعاءات الأدوات
- المقاطعات
يدعم Realtime API من OpenAI الاتصال الفوري عبر واجهات WebRTC وWebSocket وSIP.
مثال:
curl https://api.cometapi.com/v1/realtime/sessions \
-H "Authorization: Bearer YOUR_COMETAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '
{
"model": "gpt-realtime-2.1",
"modalities": [
"audio",
"text"
],
"voice": "alloy",
"instructions": "You are a helpful customer support voice assistant."
}
'
استجابة مثال:
{
"id": "sess_xxxxx",
"model": "gpt-realtime-2.1",
"status": "active"
}
الخطوة 3: أرسل إدخالاً صوتياً إلى GPT-Realtime-2.1
بعد إنشاء الجلسة، قم ببث صوت المستخدم.
سير عمل نموذجي:
User microphone
|
↓
Audio stream
|
↓
GPT-Realtime-2.1
|
↓
Generated voice response
يمكن أن يشمل الإدخال الصوتي:
- مكالمات هاتفية
- أوامر صوتية
- مكالمات دعم العملاء
- مساعدون تفاعليون
يحسّن GPT-Realtime-2.1 التفاعل الصوتي من خلال كشف أفضل للصمت والتعامل مع الضوضاء وسلوك المقاطعة مقارنةً بالنماذج الفورية السابقة.
الخطوة 4: استلم استجابات صوتية فورية
يعيد النموذج الاستجابات الصوتية المُولَّدة عبر الاتصال الفوري.
حدث مثال:
{
"type": "response.audio.delta",
"delta": "base64_audio_chunk"
}
يمكن لتطبيقك تشغيل أجزاء الصوت المستلمة فوراً.
التنفيذات النموذجية:
- تطبيقات صوتية عبر WebRTC
- مساعدون قائمون على المتصفح
- تطبيقات صوتية على الأجهزة المحمولة
- وكلاء هاتف بالذكاء الاصطناعي
الخطوة 5: أضف استدعاء الدوال للوكلاء الصوتيين
يدعم GPT-Realtime-2.1 استدعاء الدوال، مما يسمح للوكلاء الصوتيين بتنفيذ إجراءات خارجية.
مثال:
{
"tools": [
{
"type": "function",
"name": "check_order_status",
"description": "Retrieve customer order information",
"parameters": {
"type": "object",
"properties": {
"order_id": {
"type": "string"
}
}
}
}
]
}
أُطر عمل محتملة للوكلاء الصوتيين:
- "أين طردي؟"
- "احجز لي اجتماعاً غداً."
- "ألغِ اشتراكي."
- "تحقق من رصيد حسابي."
يمكن للنموذج التعرف على الطلب، واستدعاء الأداة المناسبة، ومواصلة المحادثة بشكل طبيعي.
الخطوة 6: اضبط الاستدلال والتعليمات
يدعم GPT-Realtime-2.1 جهداً استدلالياً قابلاً للتهيئة.
مثال:
{
"model": "gpt-realtime-2.1",
"reasoning": {
"effort": "medium"
},
"instructions": "Act as a professional travel assistant."
}
الإعدادات الموصى بها:
| التطبيق | مستوى الاستدلال |
|---|---|
| أوامر صوتية بسيطة | منخفض |
| دعم العملاء | متوسط |
| وكلاء أُطر عمل معقّدة | عالٍ |