المواصفات التقنية لـ hunyuan-turbos-vision
hunyuan-turbos-vision هو معرّف نموذج لدى CometAPI لنموذج من Tencent Hunyuan مزوّد بقدرات رؤية ضمن عائلة Tencent HY متعددة الوسائط الأوسع. تصف Tencent كلًا من Hunyuan/Tencent HY بأنه عائلة نماذج متعددة الأغراض ومتعددة الوسائط مطوّرة ذاتيًا تغطي الصورة ووسائط أخرى، مع إتاحة الوصول عبر واجهات برمجة التطبيقات لحالات الاستخدام المؤسسية.
| المواصفة | التفاصيل |
|---|---|
| معرّف النموذج | hunyuan-turbos-vision |
| المزوّد/العائلة | Tencent Hunyuan / عائلة نماذج متعددة الوسائط Tencent HY. |
| الوسائط | نموذج فهم متعدد الوسائط مزوّد بقدرات الرؤية للتفاعل بين الصورة والنص. تتضمن تشكيلة Hunyuan لدى Tencent نماذج للفهم البصري وخدمات متعددة الوسائط. |
| الاستخدام الأساسي | فهم الصور، والإجابة المرئية على الأسئلة، والتعرّف على الأشياء/المشاهد، وتفسير المخططات والمستندات، والاستدلال متعدد الوسائط. يستند هذا التوصيف إلى تموضع نماذج الرؤية المنشور من Tencent وأوصاف منتجاتهم متعددة الوسائط. |
| نمط الوصول | الوصول عبر واجهات برمجة التطبيقات من خلال واجهات Tencent HY / Hunyuan؛ تشير وثائق Tencent إلى استدعاء Hunyuan عبر واجهات مثل ChatCompletions وسير عمل API Explorer. |
| توجّه النشر | خدمة سحابية بمستوى مؤسسي مع دعم الاستدعاء عبر واجهات برمجة التطبيقات. |
| نقاط القوة المعلنة من المورّد | استجابة سريعة، ودقة محسّنة في الإدراك/التعرّف البصري، واستدلال أقوى وفهم أفضل للمخططات ضمن كتالوج نماذج الرؤية الحالي لدى Tencent. |
ما هو hunyuan-turbos-vision؟
hunyuan-turbos-vision هو نموذج متعدد الوسائط مزوّد بقدرات الرؤية ومكشوف عبر CometAPI تحت معرّف خاص بالمنصة، ويُطابق منظومة الفهم البصري لدى Tencent Hunyuan. في المواد العامة لـ Tencent، يتم تموضع Hunyuan/Tencent HY كعائلة نماذج متعددة الوسائط ومطوّرة ذاتيًا تمتد عبر النص والصورة و3D وسيناريوهات الذكاء الاصطناعي المؤسسية ذات الصلة.
استنادًا إلى قوائم النماذج الرسمية للفهم البصري لدى Tencent، تركز العائلة على سرعة الاستجابة للصور، ودقة أعلى في التعرّف والإدراك البصري، واستدلال منطقي أقوى على محتوى الصور والرسومات والمخططات. يجعل ذلك من hunyuan-turbos-vision خيارًا عمليًا للتطبيقات التي تحتاج إلى تحليل الصور المُحمّلة مع مطالبات باللغة الطبيعية، مثل المساعدات البصرية، وقارئات المستندات، وأتمتة الدعم، وخطوط ضبط المحتوى، أو أنظمة الأسئلة والأجوبة المعتمدة على الصور.
نظرًا لأن CometAPI تستخدم معرّف نموذج ثابتًا خاصًا بها، ينبغي التعامل مع السلسلة الدقيقة hunyuan-turbos-vision باعتبارها هدف التكامل في طلبات واجهة برمجة التطبيقات، حتى لو اختلفت التسمية العامة لدى Tencent عبر صفحات المنتجات أو كتالوجات النماذج. هذا تعيين على طبقة التكامل وليس تناقضًا. تظل القدرة الأساسية مرتبطة برُزمة الرؤية متعددة الوسائط لدى Tencent Hunyuan.
الميزات الرئيسية لـ hunyuan-turbos-vision
- فهم متعدد الوسائط للصور: يدعم السيناريوهات التي يرسل فيها المستخدم صورة مع تعليمات نصية، ثم يتلقى إجابة مؤسَّسة على المحتوى البصري. يتماشى ذلك مع تموضع Tencent Hunyuan في الفهم البصري والمتعدد الوسائط.
- سلوك استجابة سريع: يبرز كتالوج نماذج الفهم البصري الحالي لدى Tencent سرعة الاستجابة لإدخالات الصور، وهو ما يفيد المساعدات التفاعلية وتجارب المستخدمين في الزمن الحقيقي.
- دقة محسّنة في التعرّف البصري: تصف Tencent قدرات أقوى في الإدراك والتعرّف على الأشياء/المحتوى ضمن خط نماذج الرؤية، ما يجعله مناسبًا لفهم المشاهد والإجابة عن الأسئلة المعتمدة على الصور.
- الاستدلال على المخططات والمرئيات المعقّدة: تُبرز Tencent استدلالًا منطقيًا أقوى وفهمًا أفضل للمخططات، وهو ما يفيد لوحات التحليلات والتقارير والأدوات التعليمية.
- فائدة متصلة بالمستندات وOCR: بينما تقدّم Tencent أيضًا نماذج OCR مخصّصة، تُظهر منظومة الرؤية الأوسع دعمًا لاستخراج المعلومات المهيكلة من المستندات المصوّرة والجداول والصيغ وتفسيرها.
- قابلية وصول مؤسسية عبر API: تُقدَّم Tencent HY كخدمة سحابية موجهة لواجهات برمجة التطبيقات، ما يجعلها مناسبة للتكامل في الأنظمة الإنتاجية والأدوات الداخلية وخطوط الأتمتة.
- جزء من منظومة متعددة الوسائط أكبر: يستفيد
hunyuan-turbos-visionمن انتمائه إلى عائلة Hunyuan/Tencent HY التي تغطي وسائط متعددة وحالات استخدام مؤسسية، بدلًا من كونه نموذجًا متخصصًا منفردًا.
كيفية الوصول إلى hunyuan-turbos-vision ودمجه
الخطوة 1: التسجيل للحصول على مفتاح API
سجّل في CometAPI وأنشئ مفتاح API من لوحة التحكم. بعد إنشائه، احفظ مفتاحك بأمان وحمِّله عبر متغيّر بيئة مثل COMETAPI_API_KEY. سيُستخدم هذا المفتاح لمصادقة كل طلب ترسله إلى واجهة hunyuan-turbos-vision.
الخطوة 2: إرسال طلبات إلى واجهة hunyuan-turbos-vision
استخدم نقطة CometAPI المتوافقة مع OpenAI وحدّد الحقل model إلى hunyuan-turbos-vision.
curl https://api.cometapi.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $COMETAPI_API_KEY" \
-d '{
"model": "hunyuan-turbos-vision",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe this image in detail." },
{ "type": "image_url", "image_url": { "url": "https://example.com/sample.jpg" } }
]
}
]
}'
يمكنك أيضًا استدعاء النموذج نفسه من Python باستخدام صيغة OpenAI SDK:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_COMETAPI_KEY",
base_url="https://api.cometapi.com/v1"
)
response = client.chat.completions.create(
model="hunyuan-turbos-vision",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "What objects are visible in this image?"},
{"type": "image_url", "image_url": {"url": "https://example.com/sample.jpg"}}
]
}
]
)
print(response)
الخطوة 3: استرجاع النتائج والتحقق منها
بعد إرسال طلبك، قم بتحليل استجابة JSON واقرأ مخرجات النموذج من الخيار الأول. لاستخدامات الإنتاج، ينبغي أيضًا التحقق من تطابق المحتوى المعاد مع الصورة المُقدَّمة، وتطبيق أي فحوصات أمان أو قواعد عمل مطلوبة، وتسجيل بيانات التعريف الخاصة بالاستجابة لأغراض المراقبة وتصحيح الأخطاء.