کلیدی خصوصیات
- ملٹی موڈل جنریشن (ویڈیو + آڈیو) — Sora-2-Pro ویڈیو فریمز کو ہم آہنگ آڈیو (مکالمہ، ماحول کی آواز، SFX) کے ساتھ ایک ساتھ تیار کرتا ہے، بجائے اس کے کہ ویڈیو اور آڈیو کو الگ الگ تیار کیے جائیں۔
- اعلیٰ وفاداری / “Pro” ٹئیر — Sora-2 (نان پرو) کے مقابلے میں زیادہ بصری وفاداری، مشکل شاٹس (پیچیدہ حرکت، اوکلوژن، اور جسمانی تعاملات)، اور فی منظر زیادہ دیر تک تسلسل کے لیے ٹونڈ ہے۔ یہ معیاری Sora-2 ماڈل کے مقابلے میں رینڈر کرنے میں زیادہ وقت لے سکتا ہے۔
- ان پٹ میں تنوع — خالص ٹیکسٹ پرامپٹس کی حمایت کرتا ہے، اور کمپوزیشن کی رہنمائی کے لیے امیج ان پٹ فریمز یا ریفرنس امیجز قبول کر سکتا ہے (input_reference ورک فلو)۔
- Cameos / likeness انجیکشن — ایپ میں رضامندی کے ورک فلو کے ساتھ صارف کی ریکارڈ شدہ شباہت کو تیار کردہ مناظر میں داخل کر سکتا ہے۔
- جسمانی معقولیت: آبجیکٹ پرمننس اور حرکت کی وفاداری میں بہتری (مثلاً مومنٹم، بویانسی)، پہلے کے نظاموں میں عام غیر حقیقی “ٹیلی پورٹنگ” آثار کو کم کرتی ہے۔
- قابو پذیری: ساختہ پرامپٹس اور شاٹ سطح کی ہدایات کی حمایت کرتا ہے تاکہ تخلیق کار کیمرہ، لائٹنگ، اور ملٹی شاٹ سیکوئنسز متعین کر سکیں۔
تکنیکی تفصیلات اور انضمامی سطح
ماڈل فیملی: Sora 2 (بیس) اور Sora 2 Pro (اعلیٰ معیار کا ویرینٹ)۔
ان پٹ موڈالیٹیز: ٹیکسٹ پرامپٹس، امیج ریفرنس، اور لائکنس کے لیے مختصر ریکارڈ شدہ کیمیو ویڈیو/آڈیو۔
آؤٹ پٹ موڈالیٹیز: انکوڈڈ ویڈیو (آڈیو کے ساتھ) — پیرا میٹرز /v1/videos اینڈپوائنٹس کے ذریعے فراہم کیے جاتے ہیں (ماڈل کا انتخاب model: "sora-2-pro" کے ذریعے)۔ API سطح بنانا/حاصل کرنا/لسٹ کرنا/حذف کرنا آپریشنز کے لیے OpenAI کی ویڈیوز اینڈپوائنٹس فیملی کی پیروی کرتی ہے۔
ٹریننگ اور آرکیٹیکچر (عوامی خلاصہ): OpenAI کے مطابق Sora 2 کو بڑے پیمانے کی ویڈیو ڈیٹا پر ٹرین کیا گیا ہے اور ورلڈ سمیولیشن بہتر بنانے کے لیے پوسٹ ٹریننگ کی گئی ہے؛ مخصوص تفصیلات (ماڈل سائز، عین ڈیٹاسیٹس، اور ٹوکنائزیشن) لائن بہ لائن عوامی طور پر درج نہیں۔ بھاری کمپیوٹ، خصوصی ویڈیو ٹوکنائزرز/آرکیٹیکچرز اور ملٹی موڈل الائنمنٹ کمپوننٹس متوقع ہیں۔
API اینڈپوائنٹس اور ورک فلو: جاب پر مبنی ورک فلو دکھائیں: ایک POST تخلیقی درخواست جمع کریں (model="sora-2-pro")، جاب آئی ڈی یا لوکیشن حاصل کریں، پھر تکمیل کے لیے پول کریں یا انتظار کریں اور نتیجے میں ملنے والی فائل(ز) ڈاؤن لوڈ کریں۔ شائع شدہ مثالوں میں عام پیرا میٹرز میں prompt, seconds/duration, size/resolution, اور امیج گائیڈڈ آغاز کے لیے input_reference شامل ہوتے ہیں۔
عام پیرا میٹرز :
model:"sora-2-pro"prompt: فطری زبان میں منظر کی وضاحت، اختیاری طور پر مکالمے کے اشاروں کے ساتھseconds/duration: ہدف کلپ کی طوالت (Pro دستیاب دورانیوں میں اعلیٰ ترین کوالٹی کی حمایت کرتا ہے)size/resolution: کمیونٹی رپورٹس کے مطابق Pro کئی استعمالات میں زیادہ سے زیادہ 1080p تک سپورٹ کرتا ہے۔
مواد کی ان پٹس: امیج فائلیں (JPEG/PNG/WEBP) بطور فریم یا ریفرنس فراہم کی جا سکتی ہیں؛ استعمال کی صورت میں، امیج ہدف ریزولوشن سے مماثل ہو اور کمپوزیشن اینکر کا کردار ادا کرے۔
رینڈرنگ کا برتاؤ: Pro کو فریم بہ فریم ہم آہنگی اور حقیقی جسمانیات کو ترجیح دینے کے لیے ٹون کیا گیا ہے؛ اس کا مطلب عموماً زیادہ کمپیوٹ وقت اور نان پرو ویرینٹس کے مقابلے میں فی کلپ زیادہ لاگت ہوتا ہے۔
بینچ مارک کارکردگی
کیفیاتی مضبوطیاں: OpenAI نے پچھلے ویڈیو ماڈلز کے مقابلے میں حقیقت پذیری، جسمانی مطابقت، اور ہم آہنگ آڈیو** میں بہتری کی ہے۔ دیگر VBench نتائج سے ظاہر ہوتا ہے کہ Sora-2 اور اس کی مشتقات عصری کلوز سورس اور وقتی ہم آہنگی کے سرِفہرست کے قریب ہیں۔
آزاد ٹائمنگ/تھروپٹ (مثالی بینچ): Sora-2-Pro نے 20 سیکنڈ، 1080p کلپس کے لیے اوسطاً ~2.1 منٹ لیے، جبکہ ایک مقابل (Runway Gen-3 Alpha Turbo) اسی کام پر تیز تھا (~1.7 منٹ) — کوالٹی بمقابلہ رینڈر لیٹنسی اور پلیٹ فارم آپٹیمائزیشن کے مابین توازن۔
حدود (عملی اور حفاظتی)
- ناقص نہ سہی مگر کامل بھی نہیں — جسمانیات/تسلسل بہتر مگر بے عیب نہیں؛ آثار، غیر فطری حرکت، یا آڈیو سنک کی غلطیاں اب بھی ہو سکتی ہیں۔
- دورانیہ اور کمپیوٹ پابندیاں — طویل کلپس کمپیوٹ کے لحاظ سے بھاری ہوتی ہیں؛ عملی ورک فلو اکثر کلپس کو مختصر دورانیوں (مثلاً چند سے چند درجن سیکنڈز) تک محدود کرتے ہیں۔
- پرائیویسی / رضامندی کے خدشات — likeness انجیکشن (“کیمیوز”) رضامندی اور غلط معلومات کے خطرات بڑھاتا ہے؛ OpenAI کے ایپ میں واضح حفاظتی کنٹرولز اور ری وکیشن میکانزم موجود ہیں، مگر ذمہ دارانہ انضمام ضروری ہے۔
- لاگت اور تاخیر — Pro معیار کے رینڈر ہلکے ماڈلز یا حریفوں کے مقابلے میں مہنگے اور سست ہو سکتے ہیں؛ فی سیکنڈ/فی رینڈر بلنگ اور کیوئنگ کو پیشِ نظر رکھیں۔
- حفاظتی مواد کی فلٹرنگ — مضر یا کاپی رائٹڈ مواد کی جنریشن محدود ہے؛ ماڈل اور پلیٹ فارم میں حفاظتی تہیں اور ماڈریشن شامل ہیں۔
عام اور تجویز کردہ استعمال کے کیسز
استعمالات:
- مارکیٹنگ اور اشتہارات کے پروٹوٹائپس — سینیمیٹک پروف آف کانسیپٹ تیزی سے تیار کریں۔
- پری ویژولائزیشن — اسٹوری بورڈز، کیمرہ بلاکنگ، شاٹ ویژولائزیشن۔
- مختصر سوشل مواد — ہم آہنگ مکالمے اور SFX کے ساتھ اسٹائلائزڈ کلپس۔
- Sora 2 Pro API تک کیسے رسائی حاصل کریں
مرحلہ 1: API کلید کے لیے سائن اپ کریں
cometapi.com میں لاگ ان کریں۔ اگر آپ ابھی تک ہمارے صارف نہیں ہیں تو پہلے رجسٹر کریں۔ اپنے CometAPI کنسول میں سائن ان کریں۔ انٹرفیس کی ایکسیس اسناد API کلید حاصل کریں۔ پرسنل سینٹر میں API ٹوکن پر “Add Token” پر کلک کریں، ٹوکن کلید حاصل کریں: sk-xxxxx اور جمع کرائیں۔

مرحلہ 2: Sora 2 Pro API کو درخواستیں بھیجیں
API درخواست بھیجنے کے لیے “sora-2-pro” اینڈپوائنٹ منتخب کریں اور ریکویسٹ باڈی سیٹ کریں۔ درخواست کا طریقہ اور ریکویسٹ باڈی ہماری ویب سائٹ کی API ڈاک سے حاصل کیے جاتے ہیں۔ آپ کی سہولت کے لیے ہماری ویب سائٹ Apifox ٹیسٹ بھی فراہم کرتی ہے۔ <YOUR_API_KEY> کو اپنے اکاؤنٹ کی اصل CometAPI کلید سے بدلیں۔ بیس url is office ویڈیو بنائیں
اپنا سوال یا درخواست کنٹینٹ فیلڈ میں درج کریں—یہی وہ ہے جس کا ماڈل جواب دے گا ۔ جنریٹڈ جواب حاصل کرنے کے لیے API ریسپانس کو پراسیس کریں۔
مرحلہ 3: نتائج حاصل کریں اور توثیق کریں
جنریٹڈ جواب حاصل کرنے کے لیے API ریسپانس کو پراسیس کریں۔ پراسیسنگ کے بعد، API ٹاسک کا اسٹیٹس اور آؤٹ پٹ ڈیٹا کے ساتھ جواب دیتی ہے۔
- اندرونی ٹریننگ / سمیولیشن — RL یا روبوٹکس تحقیق کے لیے منظرنامہ ویژولز تیار کریں (احتیاط کے ساتھ)۔
- تخلیقی پروڈکشن — جب انسانی ایڈیٹنگ کے ساتھ ملایا جائے (مختصر کلپس جوڑنا، گریڈ، آڈیو تبدیل کرنا)۔