hunyuan-vision کی تکنیکی خصوصیات
| خصوصیت | تفصیل |
|---|---|
| Model ID | hunyuan-vision |
| فراہم کنندہ | Tencent Hunyuan |
| ماڈل کی قسم | ویژن-لینگویج / ملٹی موڈل چیٹ ماڈل برائے تصویری فہم اور بصری سوال و جواب |
| بنیادی صلاحیت | تصویر اور متن پر مشتمل ان پٹ قبول کرتا ہے اور تصویر کے مواد کے بارے میں قدرتی زبان میں جوابات لوٹاتا ہے |
| API طرز | OpenAI-مطابق Chat Completions API |
| بنیادی URL | https://api.hunyuan.cloud.tencent.com/v1 |
| اینڈ پوائنٹ | POST /chat/completions |
| ان پٹ فارمیٹ | messages array جس میں text اور image_url پر مشتمل مخلوط مواد کے حصے ہوں؛ مثالوں میں image URL یا base64 data URL کی سپورٹ ہے |
| توثیق | Bearer API key (HUNYUAN_API_KEY) |
| SDK مطابقت | base_url اور api_key تبدیل کر کے OpenAI SDKs کے ساتھ کال کیا جا سکتا ہے |
| بلنگ نوٹ | تصویری ان پٹ کے لیے، Tencent کے مطابق hunyuan-vision کے امیج ٹوکنز تصویر کے سائز کے لحاظ سے مختلف ہوتے ہیں، تقریباً 256–1280 ٹوکن فی تصویر؛ اصل استعمال ماڈل سائیڈ کیلکولیشن پر مبنی ہوتا ہے |
hunyuan-vision کیا ہے؟
hunyuan-vision، Tencent Hunyuan کا ملٹی موڈل تصویری فہم ماڈل ہے جو OpenAI-مطابق API کے ذریعے فراہم کیا جاتا ہے۔ Tencent کی آفیشل مثالوں میں، اسے “image-to-text” طرز کے کاموں میں استعمال کیا جاتا ہے، جہاں صارف ایک تصویر کے ساتھ پرامپٹ بھیجتا ہے اور ماڈل تصویر میں دکھائے گئے مناظر وغیرہ سے متعلق سوالات کے جوابات دیتا ہے۔
عملی طور پر، اس سے وہ ایپلی کیشنز فائدہ اٹھاتی ہیں جنہیں چیٹ ورک فلو میں بصری استدلال درکار ہو، جیسے امیج کیپشننگ، مناظر کی تفصیل، UI یا اسکرین شاٹ کی تشریح، پروڈکٹ امیج تجزیہ، اور عمومی بصری سوال و جواب۔ اس کا انضمامی پیٹرن ان ٹیموں کے لیے سہل ہے جو پہلے سے OpenAI طرز کے کلائنٹس استعمال کر رہی ہیں، کیونکہ Tencent کے مطابق ڈویلپرز صرف endpoint اور API key کی ترتیب بدل کر سوئچ کر سکتے ہیں۔
hunyuan-vision کی اہم خصوصیات
- متعدد طریقہ ہائے فہمِ تصویر:
hunyuan-visionایک ہی درخواست میں متن اور تصویر دونوں کو قبول کرتا ہے، جس سے اپلوڈ کی گئی بصریات کے بارے میں آگاہ گفتگو اور سوال و جواب ممکن ہوتا ہے۔ - OpenAI-مطابق انٹرفیس: Tencent اسے Chat Completions جیسی درخواست ساخت کے ساتھ مہیا کرتا ہے، جس سے موجودہ AI ایپلی کیشنز کی مائیگریشن کی محنت کم ہو جاتی ہے۔
- لچکدار امیج ان پٹ طریقے: آفیشل مثالیں معیاری ریموٹ امیج URLs اور base64-انکوڈڈ data URLs دونوں کی سپورٹ دکھاتی ہیں، جو پبلک اثاثوں یا مقامی طور پر پروسیس فائلوں کے ساتھ کام کرنے میں مدد دیتی ہیں۔
- SDK کے لیے موزوں انضمام: Tencent نے Python، Node.js، Go اور cURL طرز کی HTTP درخواستوں کے ساتھ OpenAI SDKs کے استعمال کی دستاویزات دی ہیں، جس سے بیک اینڈ سروسز میں ایمبیڈ کرنا آسان ہو جاتا ہے۔
- چیٹ پر مبنی ورک فلو: چونکہ اسے چیٹ کمپلیشن ماڈل کے طور پر پیش کیا جاتا ہے، یہ ان مکالماتی ایپس، اسسٹنٹس اور ٹول چینز میں فطری طور پر فِٹ بیٹھتا ہے جو اپنی درخواستیں
messagesکے گرد مرتب کرتی ہیں۔ - استعمال پر مبنی امیج ٹوکن اکاؤنٹنگ: Tencent کے مطابق تصویر کی لاگت تصویر کے سائز پر منحصر ہوتی ہے، اور فی تصویر ٹوکن استعمال ایک مقررہ عدد کے بجائے رینج کی صورت میں دستاویزی ہے۔
hunyuan-vision تک رسائی اور انضمام کا طریقہ
مرحلہ 1: API کلید کے لیے سائن اپ کریں
hunyuan-vision تک رسائی کے لیے پہلے فراہم کنندہ کے کنسول سے اپنی API کلید بنائیں اور محفوظ رکھیں۔ Tencent، OpenAI-مطابق Hunyuan API کے لیے API-key پر مبنی رسائی کی دستاویز دیتا ہے، اور کلید کو درخواستوں میں Bearer ٹوکن کے طور پر بھیجا جاتا ہے۔ کلید کو HUNYUAN_API_KEY جیسے ماحول متغیر میں رکھیں اور اسے کلائنٹ سائیڈ کوڈ یا عوامی ریپوزٹریز میں افشا نہ کریں۔
مرحلہ 2: hunyuan-vision API کو درخواستیں بھیجیں
OpenAI-مطابق endpoint استعمال کریں اور ماڈل نام کے طور پر hunyuan-vision متعین کریں۔
curl --location 'https://api.hunyuan.cloud.tencent.com/v1/chat/completions' \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $HUNYUAN_API_KEY" \
--data '{
"model": "hunyuan-vision",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "What is in this image?"
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
}
}
]
}
]
}'
آپ OpenAI-مطابق SDKs بھی استعمال کر سکتے ہیں، بس کلائنٹ کو Hunyuan کے base URL کی طرف پوائنٹ کریں:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("HUNYUAN_API_KEY"),
base_url="https://api.hunyuan.cloud.tencent.com/v1",
)
response = client.chat.completions.create(
model="hunyuan-vision",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Describe this image."},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
},
},
],
}
],
)
print(response.choices[0].message.content)
یہ درخواست ساخت hunyuan-vision کے لیے Tencent کی آفیشل OpenAI-مطابق مثالوں کے مطابق ہے۔
مرحلہ 3: نتائج حاصل کریں اور توثیق کریں
OpenAI-مطابق SDK استعمال کرتے ہوئے عموماً response.choices[0].message.content سے پہلا جواب پڑھیں۔ پروڈکشن میں، اس بات کی تصدیق کریں کہ امیج URL قابلِ رسائی ہے یا آپ کا base64 پیلوڈ معتبر ہے، پھر لوٹائے گئے بیان کو اپنی ایپلیکیشن کی درستی، سیفٹی اور فارمیٹنگ کے تقاضوں کے مطابق جانچیں۔ Tencent کی مثالیں معیاری چیٹ کمپلیشنز ریسپانس ہینڈلنگ دکھاتی ہیں، اس لیے موجودہ ویلیڈیشن اور لاگنگ پائپ لائنز عموماً کم سے کم تبدیلی کے ساتھ دوبارہ استعمال کی جا سکتی ہیں۔