المواصفات التقنية لـ Eleven v4
| العنصر | المواصفة |
|---|---|
| اسم النموذج | Eleven v4 |
| معرّف نموذج CometAPI | eleven_v4 |
| المزوّد الأصلي | ElevenLabs |
| فئة النموذج | تحويل النص إلى كلام (TTS) |
| صيغة واجهة API الأساسية | واجهة تحويل النص إلى كلام متوافقة مع Runway |
| نقطة نهاية CometAPI | POST /runwayml/v1/text_to_speech |
| الإدخال | موجّه نصي وتكوين صوت مُسبق الإعداد |
| الإخراج | صوت كلام مُولَّد؛ CometAPI تعلن عن مخرجات MP3 |
| حد نص CometAPI | حتى 2,500 حرف لكل طلب، وفقًا لإعلانها بتاريخ 10 أكتوبر 2026 |
| حد النص الأصلي لدى ElevenLabs | 10,000 حرف لكل طلب |
| دعم اللغات | أكثر من 90 لغة في النموذج الأصلي Eleven v4 |
| عناصر التحكم بالصوت | الثبات، تعزيز التشابه، الأسلوب، السرعة وتعزيز المتحدث، رهناً بدعم البوابة |
| عناصر تحكم تعبيرية | وسوم مثل [laughs] و[whispers] و[pause] |
| حوار متعدد المتحدثين | مدعوم بواسطة النموذج الأصلي Eleven v4 عبر واجهة Text to Dialogue API |
| المعالجة | إرسال مهام بشكل غير متزامن واستطلاع الحالة عبر CometAPI |
| صيغة الصوت | مخرجات MP3 على حد إعلان CometAPI؛ يرجى تأكيد خيارات الصيغ المتاحة في مخطط نقطة النهاية الحالي |
المصادر: إعلان نموذج CometAPI وتوثيق واجهة CometAPI لـ Runway لتحويل النص إلى كلام. القدرات الأصلية للنموذج موثّقة من قبل ElevenLabs.
ما هو Eleven v4؟
Eleven v4 هو نموذج التخليق الصوتي التعبيري لدى ElevenLabs، صُمّم لإنتاج كلام طبيعي بنبرة إنسانية مع إلقاء غني بالعاطفة ووعي سياقي واتساق قوي في الصوت. وهو مناسب بشكل خاص للسرد، والتعليق الصوتي للشخصيات، والكتب الصوتية، والحوار حيث تَهم طريقة أداء الجملة بقدر الكلمات نفسها.
من خلال CometAPI، يتوفر النموذج باستخدام المعرّف eleven_v4 عبر واجهة تحويل النص إلى كلام متوافقة مع Runway. تضيف البوابة صيغة طلب وقيودًا خاصة بها، لذا ينبغي اعتماد حد الأحرف الموثّق لدى CometAPI عند التكامل مع النموذج بدلاً من افتراض انطباق حد واجهة ElevenLabs الأصلية.
الميزات الرئيسية لـ Eleven v4
- تخليق صوتي تعبيري: ينتج كلامًا بتفاصيل عاطفية دقيقة، وتشديد، وإيقاع، وأداء، ما يجعله مناسبًا للنصوص التعبيرية أكثر من السرد الرتيب الموحد.
- أداء صوتي طبيعي: يولّد كلامًا يشبه البشر للشخصيات، وسرد القصص، والتعليق الصوتي المهني، والحوار التفاعلي.
- توليد متعدد اللغات: يدعم النموذج الأصلي أكثر من 90 لغة، بما في ذلك الإنجليزية، اليابانية، الصينية المندرينية، الكورية، الفرنسية والإسبانية.
- تحكم دقيق في الصوت: تتضمن المعلمات المدعومة الثبات، تعزيز التشابه، الأسلوب، السرعة وتعزيز المتحدث، ما يتيح للمطورين ضبط الأداء واتساق الصوت.
- وسوم للعاطفة والأداء: يمكن لوسوم مثل
[laughs]و[whispers]و[pause]توجيه الأداء التعبيري في الطلبات المدعومة. - تكامل غير متزامن عبر الواجهة: تقبل CometAPI مهمة توليد الكلام وتُرجع معرّف مهمة يمكن استخدامه لاستعلام الحالة واسترجاع الصوت الناتج.
قد تختلف إتاحة الميزات وحدود الإدخال بين نقاط النهاية الأصلية لـ ElevenLabs وبوابة CometAPI.
مقارنة بين Eleven v4 وEleven v4 Turbo وEleven v3
| النموذج | نقطة القوة الرئيسية | أفضل حالة استخدام |
|---|---|---|
| Eleven v4 (eleven_v4) | تعبير عاطفي غني وكلام عالي الدقة | الكتب الصوتية، السرد، التحريك، وحوار الشخصيات |
| Eleven v4 Turbo (eleven_v4_turbo) | كلام تعبيري مُحسن لانخفاض زمن الاستجابة؛ زمن الاستدلال الوسطي الأصلي حوالي 100 مللي ثانية | تطبيقات صوتية تفاعلية ووكلاء بالزمن الحقيقي |
| Eleven v3 (eleven_v3) | كلام تعبيري مع أداء درامي وتحكم بوسوم الصوت | أداءات صوتية كثيفة الانفعال ومشاهد الشخصيات |
| Eleven Multilingual v2 (eleven_multilingual_v2) | جودة كلام متعددة اللغات مستقرة، خصوصًا للمحتوى الطويل | سرد متسق وإنتاج متعدد اللغات |
تصف هذه المقارنات نماذج ElevenLabs الأصلية. تتعلق الإتاحة والأداء عبر CometAPI بنقطة النهاية المعروضة والتنفيذ.
حالات استخدام ممثلة
- إنتاج الكتب الصوتية: توليد سرد تعبيري بإيقاع طبيعي وتمييز بين الشخصيات.
- التحريك والألعاب: إنشاء حوارات شخصيات مع إشارات عاطفية وتوقفات وأداء متنوع.
- التعليقات الصوتية للفيديو: إنتاج سرد لفيديوهات ترويجية، شروحات، وثائقيات ومواد تفسيرية.
- محتوى متعدد اللغات: توليد كلام لعمليات المحتوى الدولية عبر اللغات المدعومة.
- سرد إبداعي: إنتاج قراءات درامية، مشاهد حوار، وصوتيات تتمحور حول الشخصيات.
- إنتاج محتوى تلقائي: دمج توليد الكلام في خطوط النشر باستخدام سير مهام CometAPI غير المتزامن.
القيود والملاحظات التنفيذية
- حد الأحرف الخاص بالبوابة: أعلنت CometAPI في 10 أكتوبر 2026 عن حد 2,500 حرف لكل طلب لـ Eleven v4. هذا أقل من حد ElevenLabs الأصلي البالغ 10,000 حرف. قسّم النصوص الأطول إلى مقاطع مترابطة وتحقق من قواعد التحقق الحالية لدى البوابة.
- التعبيرية تتطلب ضبطًا: قد لا يلائم الأداء عالي الانفعال كل نص. اختبر إعدادات الثبات والأسلوب حيثما كانت مدعومة.
- النطق يحتاج مراجعة: قد تتطلب الأسماء والاختصارات والأرقام والنصوص متعددة اللغات تطبيعًا أو تهجئة معدّلة.
- استمرارية المقاطع: عند تقسيم النصوص الطويلة، استخدم الحقول المدعومة
previousTextوnextTextحيثما كانت متاحة للمساعدة في الحفاظ على انتقالات مترابطة. - توفر الأصوات يعتمد على البوابة: استخدم معرّفات الأصوات المسبقة التي تعرضها CometAPI. لا تفترض أن كل صوت في مكتبة ElevenLabs الأصلية متاح عبر هذه الواجهة.
- المعالجة غير المتزامنة: نجاح إرسال المهمة لا يعني أن الصوت جاهز فورًا. خزّن معرّف المهمة، واستطلع الاكتمال وتعامل مع حالات الفشل.
- ليس نموذجًا للتعرّف على الكلام: Eleven v4 يولّد كلامًا من النص؛ ليس مخصصًا لنسخ الصوت الوارد.
كيفية الوصول إلى واجهة Eleven v4 عبر CometAPI
نقطة النهاية الموثّقة هي POST /runwayml/v1/text_to_speech، باستخدام مصادقة Bearer وإدخال بصيغة JSON. تُرجع CometAPI معرّف مهمة يمكن استخدامه للتحقق من الحالة واسترجاع الصوت الناتج.