المواصفات التقنية لواجهة برمجة تطبيقات Seed 1.8
| البند | المواصفة / ملاحظة |
|---|---|
| اسم النموذج / العائلة | Doubao-Seed-1.8 (Seed1.8) — ByteDance Seed / Volcano Engine |
| الأنماط المدعومة | نص، صور، فيديو (قدرات VLM متعددة الوسائط)، أدوات صوتية ضمن النظام البيئي (نماذج منفصلة لتوليد الصوت/الفيديو). |
| نافذة السياق (نص) | 256K tokens |
| قدرة الفيديو/الرؤية | مصمم للاستدلال على الفيديو الطويل، يدعم ترميزاً بصرياً فعالاً وحصصاً كبيرة من رموز الفيديو (تقرير بطاقة النموذج يذكر تجارب رموز الفيديو ومعايير الفيديو الطويل). |
| تنسيقات الإدخال | مطالبات نصية حرة؛ تحميل الصور (لقطات شاشة، مخططات، صور)؛ فيديو على شكل إطارات مرمَّزة كرموز/أدوات فيديو لفحص المقاطع؛ تحميل الملفات (مستندات). |
| تنسيقات الإخراج | نص باللغة الطبيعية، مخرجات منظمة (structured-output beta)، استدعاءات وظائف/أدوات، كود، ومخرجات متعددة الوسائط عبر التنسيق. |
| أنماط التفكير/الاستدلال | no_think, think-low, think-medium, think-high — موازنة الدقة مقابل الكمون/التكلفة. |
ما هو Doubao Seed 1.8؟
Doubao Seed 1.8 هو إصدار الفريق Seed 1.8: نموذج موحّد LLM+VLM يستهدف صراحة الوكالة العامة في العالم الواقعي — أي الإدراك (صور/فيديو)، والاستدلال، وتنظيم استخدام الأدوات (البحث، استدعاءات الوظائف، تنفيذ الكود، GUI grounding) واتخاذ القرار متعدد الخطوات ضمن نموذج واحد. يركّز التصميم على “أنماط تفكير” قابلة للتهيئة (مقايضات بين الكمون والعمق)، وترميز بصري فعّال ودعم أصيل للسياقات الطويلة ومدخلات متعددة الوسائط لكي يعمل النموذج كمساعد/وكيل مستقل في مسارات العمل الإنتاجية.
الميزات الرئيسية لواجهة برمجة تطبيقات Seed 1.8
- نموذج وكيل متعدد الوسائط موحّد. يدمج الإدراك (صورة/فيديو)، والاستدلال (LLM)، والتنفيذ (استدعاءات أدوات/G U I، تنفيذ الكود) في نموذج واحد بدلاً من خط أنابيب منفصل. يمكّن ذلك مسارات عمل وكيلية مدمجة ويقلّل تعقيد التنسيق.
- سياق فائق الطول والتعامل مع الفيديو الطويل. سياق طويل (دعم المنتج حتى 256k tokens) ومعايير محددة للفيديو الطويل (Seed1.8 يُظهر كفاءة عالية في رموز الفيديو الطويل). يدعم النموذج أدوات فيديو انتقائية (VideoCut) للتركيز بالاستدلال على الطوابع الزمنية.
- أتمتة GUI وكيلية واستخدام الأدوات. تُظهر المعايير والاختبارات الداخلية (OSWorld, AndroidWorld, LiveCodeBench, GUI grounding benchmarks) تحسينات في مهام وكلاء واجهة المستخدم والأتمتة متعددة الخطوات. يمكن للنموذج إخراج أوامر GUI grounding والعمل ضمن سياقات نظام/ويب/جوال محاكاة.
- أنماط تفكير قابلة للتهيئة للتحكم في الكمون/التكلفة. أربعة أنماط استدلال تتيح للمطورين ضبط الحوسبة وقت الاختبار لمهام تفاعلية مقابل دفعات عالية الجودة. هذا مفيد للأنظمة الإنتاجية ذات ميزانيات كمون صارمة.
- كفاءة محسّنة للرموز (متعددة الوسائط). يُظهر Seed 1.8 كفاءة أقوى في الرموز على معايير متعددة الوسائط مقارنة بسابقيه (Seed-1.5/1.6)، محققاً دقة عالية بميزانيات رموز أصغر في عدة مهام فيديو طويلة.
- أنماط تفكير قابلة للتهيئة: موازنة عمق الاستدلال مقابل الكمون/التكلفة بأنماط مميّزة (
no_think→think-high) للضبط وفق الاستخدام التفاعلي في الإنتاج. - القدرات التقنية
- كفاءة الرموز: يُظهر Seed1.8 كفاءة ملحوظة في الرموز مقارنة بالسوابق (Seed-1.5/1.6)، مقدّماً دقة أقوى عند ميزانيات رموز أقل في مهام الفيديو الطويل (مثلاً تحقيق دقة تنافسية حتى عند 32K video tokens). يمكّن ذلك من خفض تكلفة الاستدلال للمدخلات الطويلة.
- الاستدلال والإدراك متعدد الوسائط: يحقق النموذج SOTA على عدة مهام VQA متعددة الصور ومهام الحركة/الإدراك، ويحرز مركزاً ثانياً أو قريباً من SOTA على العديد من معايير الاستدلال متعدد الوسائط؛ وبشكل خاص يتفوق على سابقه في معظم أبعاد الرؤية/الفيديو المقاسة.
- استخدام الأدوات الوكيلية وGUI grounding: دعم موثّق لـ GUI grounding ومعايير التشغيل المعتمدة على الشاشة (ScreenSpot-Pro, GUI agenting) مع درجات ربط قوية (مثلاً تحسينات على Seed-1.5-VL في ScreenSpot-Pro).
- استدلال متوازي/متدرّج: زيادة الحوسبة وقت الاختبار (تفكير متوازٍ) تؤدي إلى مكاسب قابلة للقياس في معايير الرياضيات والبرمجة والاستدلال متعدد الوسائط.
أبرز نتائج المعايير العامة لـ Seed1.8
- VCRBench (الاستدلال على المعرفة البديهية البصرية): حقق Seed1.8 نتيجة 59.8 (Pass@1 كما هو مذكور في جدول بطاقة النموذج)، وهو تحسّن على Seed-1.5-VL ومنافس للنماذج العليا.
- VideoHolmes (استدلال الفيديو): Seed1.8 65.5، متفوقاً على Seed-1.5-VL ومقترباً من نماذج محترفة منافسة.
- MMLB-NIAH (سياق طويل متعدد الوسائط، 128k): حقق Seed1.8 72.2 Pass@1 عند سياق 128k في MMLB-NIAH، متجاوزاً بعض النماذج الاحترافية المعاصرة.
- حزمة الحركة والإدراك: SOTA في 5 من أصل 6 مهام مقيمة؛ أمثلة تشمل TVBench وTempCompass وTOMATO حيث يُظهر Seed1.8 مكاسب كبيرة في الإدراك الزمني.
- مسارات العمل الوكيلية: على BrowseComp وغيرها من معايير البحث/البرمجة الوكيلية، غالباً ما يحتل Seed1.8 مراكز قريبة من أو أعلى من نماذج احترافية منافسة.
Seed 1.8 مقابل Gemini 3 Pro / GPT-5.x
- Seed1.8 مقابل Seed-1.5-VL / Seed-1.6: تحسّنات واضحة في الإدراك متعدد الوسائط، وكفاءة الرموز للفيديو الطويل، والتنفيذ الوكيلي.
- Seed1.8 مقابل Gemini 3 Pro / GPT-5.x: على العديد من معايير متعددة الوسائط، Seed1.8 يماثل أو يتفوق على Gemini 3 Pro (SOTA في عدة مهام VQA/الحركة؛ أفضل على تشغيل 128k لـ MMLB-NIAH). ومع ذلك تُظهر البطاقة أيضاً مجالات تحتفظ فيها نماذج Gemini بأفضلية في بعض مهام المعرفة التخصصية — لذا الترتيب النسبي يعتمد على المعيار.
- متغير Seed-Code (Doubao-Seed-Code): متخصص لمهام البرمجة/الكود الوكيلية (سياقات كبيرة لأسس الشيفرات؛ معايير SWE متخصصة). Seed1.8 هو النموذج العام متعدد الوسائط الوكيلي، بينما Seed-Code هو المتغير الموجه للبرمجة.
حالات استخدام عملية عبر Seedream 4.5 API على CometAPI
- مساعدو أبحاث متعددة الوسائط وتحليل المستندات: استخراج وتلخيص والاستدلال عبر مستندات طويلة، عروض تقديمية، وتقارير متعددة الصفحات.
- فهم ومراقبة الفيديو الطويل: تحليلات البث الأمني/الرياضي، تلخيص الاجتماعات الطويلة، والتحليل المتدفق حيث تهم كفاءة رموز الفيديو الطويلة للنموذج.
- مسارات عمل/أتمتة وكيلية: سيناريوهات متعددة الخطوات للبحث عبر الويب + تنفيذ الكود + استخراج البيانات (مثل تحليلات تنافسية مؤتمتة، تخطيط السفر، سلاسل أبحاث موثّقة في معايير داخلية).
- أدوات المطورين (عند استخدام Seed-Code): تحليل قواعد شيفرات كبيرة، مساعدين داخل IDE، وتنفيذ كود وكيلية للاختبار والإصلاح (Seed-Code هو المتغير المتخصص الموصى به).
- أتمتة GUI وRPA: تشير معايير تأريض الشاشة ووكلاء GUI إلى أن النموذج يؤدي مهام GUI منظمة بشكل أفضل من إصدارات Seed السابقة.
كيفية استخدام doubao Seed 1.8 API عبر CometAPI
يُطرح Doubao seed1.8 تجارياً عبر CometAPI كواجهة استدلال مُستضافة الآن. تدعم الواجهة حمولات متعددة الوسائط (نص + صور + مقاطع/طوابع زمنية للفيديو) وأنماط استدلال قابلة للتهيئة لموازنة الكمون والحوسبة مقابل جودة الإجابة.
أنماط النداء: تدعم الواجهة طلبات بأسلوب الدردشة/الإكمال القياسية، واستجابات متدفقة، وتدفقات وكيلية حيث يصدر النموذج استدعاءات أدوات (بحث، تنفيذ كود، إجراءات GUI) ويتناول مخرجات الأدوات كجزء لاحق من السياق.
البث والتعامل مع السياق الطويل: تدعم الواجهة البث وتحتوي على بدائيات لإدارة السياق للجلسات الطويلة (لتمكين سياقات تتجاوز 100K/آثار وكلاء متعددة الخطوات).
الخطوة 1: التسجيل للحصول على مفتاح API
سجّل الدخول إلى cometapi.com. إذا لم تكن مستخدماً لدينا بعد، يُرجى التسجيل أولاً. سجّل الدخول إلى CometAPI console. احصل على مفتاح اعتماد الوصول للواجهة. انقر “Add Token” عند رمز API في المركز الشخصي، واحصل على مفتاح الرمز: sk-xxxxx ثم أرسل.
الخطوة 2: إرسال الطلبات إلى doubao Seed 1.8 API
اختر نقطة النهاية “doubao-seed-1-8-251228” لإرسال طلب API واضبط جسم الطلب. يتم الحصول على طريقة الطلب وجسمه من توثيق API على موقعنا. يوفّر موقعنا أيضاً اختبار Apifox لراحتك. استبدل <YOUR_API_KEY> بمفتاح CometAPI الفعلي من حسابك. متوافق مع واجهات Chat APIs.
أدرِج سؤالك أو طلبك في حقل المحتوى — هذا ما سيردّ عليه النموذج. عالج استجابة API للحصول على الإجابة المولدة.
الخطوة 3: استرجاع النتائج والتحقق منها
عالج استجابة API للحصول على الإجابة المولدة. بعد المعالجة، تستجيب الواجهة بحالة المهمة وبيانات المخرجات.