المواصفات التقنية لواجهة Seed 1.8 API
| البند | المواصفات/ملاحظات |
|---|---|
| اسم النموذج/العائلة | Doubao-Seed-1.8 (Seed1.8) — ByteDance Seed / Volcano Engine |
| الوسائط المدعومة | نص، صور، فيديو (قدرات VLM متعددة الوسائط)، أدوات صوت ضمن المنظومة (نماذج منفصلة لتوليد الصوت/الفيديو). |
| نافذة السياق (نص) | 256K رمز |
| قدرات الفيديو/الرؤية | مُصمَّم للاستدلال على الفيديوهات الطويلة، يدعم الترميز البصري الفعّال وميزانيات كبيرة لرموز الفيديو (تذكر بطاقة النموذج تجارب رموز الفيديو ومعايير الفيديو الطويل). |
| تنسيقات الإدخال | مطالبات نص حر؛ تحميل الصور (لقطات شاشة، مخططات، صور فوتوغرافية)؛ الفيديو كإطارات مُحوّلة إلى رموز/أدوات فيديو لفحص المقاطع؛ تحميل الملفات (مستندات). |
| تنسيقات الإخراج | نص باللغة الطبيعية، مخرجات مُهيكلة (structured-output beta)، استدعاءات وظائف/أدوات، كود، ومخرجات متعددة الوسائط عبر الأوركسترة. |
| أنماط التفكير/الاستدلال | no_think, think-low, think-medium, think-high — موازنة الدقة مقابل زمن الاستجابة/التكلفة. |
ما هو Doubao Seed 1.8؟
Doubao Seed 1.8 هو إصدار 1.8 من فريق Seed: نموذج موحَّد LLM+VLM يستهدف بشكل صريح الوكيلية العامة في العالم الحقيقي — أي الإدراك (صور/فيديو)، والاستدلال، وأوركسترة الأدوات (بحث، استدعاءات دوال، تنفيذ كود، الربط بواجهة المستخدم الرسومية GUI) واتخاذ القرار متعدد الخطوات داخل نموذج واحد. يركّز التصميم على “أنماط تفكير” قابلة للتهيئة (مفاضلات بين زمن الاستجابة والعمق)، وترميز بصري فعّال، ودعم أصيل للسياق الطويل والمدخلات متعددة الوسائط بحيث يمكن للنموذج أن يعمل كمساعد/وكيل مستقل في سير عمل الإنتاج.
الميزات الرئيسية لواجهة Seed 1.8 API
- نموذج موحَّد متعدد الوسائط قائم على الوكلاء. يدمج الإدراك (صورة/فيديو)، والاستدلال (LLM)، والفعل (استدعاءات الأدوات/G U I، وتنفيذ الكود) في نموذج واحد بدل خط أنابيب مُجزّأ. يتيح ذلك سير عمل وكيلًا مدمجًا وتخفيض تعقيد الأوركسترة.
- سياق فائق الطول وتعامل مع الفيديو الطويل. سياق طويل (دعم منتجي حتى 256k رمز) ومعايير محددة للفيديو الطويل (يُظهر Seed1.8 كفاءة عالية في رموز الفيديو الطويل). يدعم النموذج أدوات فيديو انتقائية (VideoCut) لتركيز الاستدلال على الطوابع الزمنية.
- أتمتة GUI واستخدام الأدوات القائمين على الوكلاء. تُظهر المعايير والاختبارات الداخلية (OSWorld، AndroidWorld، LiveCodeBench، معايير الربط بواجهة المستخدم) تحسينات في مهام وكلاء GUI والأتمتة متعددة الخطوات. يمكن للنموذج إخراج أوامر ربط GUI والعمل داخل بيئات نظام/ويب/جوال مُحاكاة.
- أنماط تفكير قابلة للتهيئة للتحكم في زمن الاستجابة/التكلفة. تسمح أربعة أنماط استدلال للمطورين بضبط الحوسبة وقت الاختبار للمهام التفاعلية مقابل مهام الدفعات عالية الجودة. هذا مفيد للأنظمة الإنتاجية ذات قيود زمن الاستجابة الصارمة.
- كفاءة رموز محسّنة (متعددة الوسائط). يُظهر Seed 1.8 كفاءة أقوى في الرموز على معايير متعددة الوسائط مقارنة بسوابفه (Seed-1.5/1.6)، محققًا دقة عالية بميزانيات رموز أصغر في عدة مهام فيديو طويلة.
- أنماط تفكير قابلة للتهيئة: الموازنة بين عمق الاستدلال وزمن الاستجابة/التكلفة عبر أنماط متميزة (
no_think→think-high) للضبط للاستخدام الإنتاجي التفاعلي. - القدرات التقنية
- كفاءة الرموز: يُظهر Seed1.8 كفاءة ملحوظة في الرموز مقارنة بسوابفه (Seed-1.5/1.6)، مقدّمًا دقة أقوى بميزانيات رموز أقل في مهام الفيديو الطويل (على سبيل المثال، تحقيق دقة تنافسية حتى عند 32K من رموز الفيديو). يمكّن هذا من خفض تكلفة الاستدلال للمدخلات الطويلة.
- الاستدلال متعدد الوسائط والإدراك: يحقق النموذج SOTA على عدة مهام VQA متعددة الصور ومهام الحركة/الإدراك ويحصل على المركز الثاني أو قريب من SOTA في العديد من معايير الاستدلال متعددة الوسائط؛ تحديدًا يتفوق على سلفه في كل بُعد تقريبًا متعلق بالرؤية/الفيديو المُقاس.
- استخدام الأدوات القائم على الوكلاء والربط بـGUI: دعم موثق للربط بواجهة المستخدم والعمل المعتمد على الشاشة (ScreenSpot-Pro، وكلاء GUI) مع درجات ربط قوية (على سبيل المثال، تحسينات مقارنة بـ Seed-1.5-VL على ScreenSpot-Pro).
- استدلال متوازٍ/متدرّج: زيادة الحوسبة وقت الاختبار (التفكير المتوازي) تُفضي إلى مكاسب قابلة للقياس في الرياضيات والبرمجة والاستدلال متعدد الوسائط
أبرز نتائج المعايير العامة المختارة لـ Seed1.8
- VCRBench (المنطق الشائع البصري): حقق Seed1.8 نتيجة 59.8 (Pass@1 كما ورد في جدول بطاقة النموذج)، وهو تحسّن مقارنة بـ Seed-1.5-VL وتنافسية مع النماذج الأعلى
- VideoHolmes (استدلال الفيديو): حقق Seed1.8 65.5، متفوّقًا على Seed-1.5-VL ومقتربًا من نماذج منافسة احترافية.
- MMLB-NIAH (سياق طويل متعدد الوسائط، 128k): حقق Seed1.8 72.2 Pass@1 عند سياق 128k في MMLB-NIAH، متجاوزًا بعض النماذج الاحترافية المعاصرة.
- حزمة الحركة والإدراك: SOTA في 5 من بين 6 مهام مُقيمة؛ أمثلة تشمل TVBench وTempCompass وTOMATO حيث يُظهر Seed1.8 مكاسب كبيرة في الإدراك الزمني.
- سير العمل القائم على الوكلاء: على BrowseComp ومعايير بحث/كود أخرى قائمة على الوكلاء، غالبًا ما يحتل Seed1.8 مراتب قريبة أو أعلى من نماذج احترافية منافسة
Seed 1.8 مقابل Gemini 3 Pro / GPT-5.x
- Seed1.8 مقابل Seed-1.5-VL / Seed-1.6: تحسينات واضحة في الإدراك متعدد الوسائط، وكفاءة الرموز للفيديوهات الطويلة، والتنفيذ القائم على الوكلاء.
- Seed1.8 مقابل Gemini 3 Pro / GPT-5.x: في العديد من معايير متعددة الوسائط، Seed1.8 يطابق أو يتفوق على Gemini 3 Pro (SOTA في عدة مهام VQA/الحركة؛ أفضل على تشغيل 128k في MMLB-NIAH). ومع ذلك، تُظهر البطاقة أيضًا مجالات تحتفظ فيها عائلة Gemini بأفضليات في بعض مهام المعارف التخصصية — لذا الترتيب النسبي يعتمد على المعيار.
- متغير Seed-Code (Doubao-Seed-Code): مُتخصص لمهام البرمجة/الكود القائم على الوكلاء (سياق كبير لأسس الشيفرة؛ معايير SWE متخصصة). Seed1.8 هو النموذج العام متعدد الوسائط القائم على الوكلاء، بينما Seed-Code هو المتغير المُركّز على البرمجة.
حالات استخدام عملية بواسطة واجهة Seedream 4.5 على CometAPI
- مساعدو بحث متعدد الوسائط وتحليل المستندات: استخراج وتلخيص والاستدلال عبر مستندات طويلة، عروض تقديمية، وتقارير متعددة الصفحات.
- استيعاب الفيديو الطويل والمراقبة: تحليلات بث أمني/رياضي، تلخيص الاجتماعات الطويلة، والتحليل المتدفق حيث تهم كفاءة رموز الفيديو الطويل للنموذج.
- سير عمل قائم على الوكلاء/أتمتة: بحث ويب متعدد الخطوات + تنفيذ كود + سيناريوهات استخراج بيانات (مثل تحليل تنافسي مؤتمت، تخطيط السفر، مسارات بحث مُثبتة في الاختبارات الداخلية).
- أدوات المطورين (عند استخدام Seed-Code): تحليل قواعد كود كبيرة، مساعدين IDE، وتنفيذ كود قائم على الوكلاء للاختبار والإصلاح (Seed-Code هو المتغير المتخصص المُوصى به).
- أتمتة GUI وRPA: تشير معايير ربط الشاشة ووكلاء GUI إلى أن النموذج يمكنه أداء مهام GUI مُنظّمة أفضل من إصدارات Seed السابقة.
كيفية استخدام doubao Seed 1.8 API عبر CometAPI
يُتاح Doubao Seed1.8 تجاريًا عبر CometAPI كواجهة استدلال مُستضافة الآن. تدعم الواجهة حمولة متعددة الوسائط (نص + صور + مقاطع/طوابع زمنية للفيديو) وأنماط استدلال قابلة للتهيئة للموازنة بين زمن الاستجابة والحوسبة مقابل جودة الإجابة.
أنماط الاستدعاء: تدعم الواجهة طلبات بأسلوب الدردشة/الإكمال القياسي، استجابات متدفقة، وتدفقات قائمة على الوكلاء حيث يصدر النموذج استدعاءات أدوات (بحث، تنفيذ كود، إجراءات GUI) ويستوعب مخرجات الأدوات كسياق لاحق.
البث ومعالجة السياق الطويل: تدعم الواجهة البث وتحتوي على بدائيات لإدارة السياق للجلسات الطويلة (لتمكين سياقات 100K+ / آثار وكيلة متعددة الخطوات).
الخطوة 1: التسجيل للحصول على مفتاح API
سجّل الدخول إلى cometapi.com. إذا لم تكن مستخدمًا لدينا بعد، يُرجى التسجيل أولًا. سجّل الدخول إلى وحدة تحكم CometAPI. احصل على بيانات اعتماد الوصول لمفتاح API للواجهة. انقر على “Add Token” ضمن رمز API في المركز الشخصي، واحصل على مفتاح الرمز: sk-xxxxx ثم أرسل.
الخطوة 2: إرسال الطلبات إلى واجهة doubao Seed 1.8 API
حدّد نقطة النهاية “doubao-seed-1-8-251228 ” لإرسال طلب واجهة برمجة التطبيقات واضبط جسم الطلب. يتم الحصول على طريقة الطلب وجسم الطلب من وثائق واجهة API على موقعنا. يوفر موقعنا أيضًا Apifox للاختبار لراحتك. استبدل <YOUR_API_KEY> بمفتاح CometAPI الحقيقي من حسابك. التوافق مع واجهات Chat APIs.
أدرج سؤالك أو طلبك في حقل المحتوى — هذا ما سيستجيب له النموذج. عالج استجابة الواجهة للحصول على الإجابة المُولّدة.
الخطوة 3: استرجاع النتائج والتحقق منها
عالج استجابة الواجهة للحصول على الإجابة المُولّدة. بعد المعالجة، تستجيب الواجهة بحالة المهمة وبيانات المخرجات.