TLDR Kimi K3، Moonshot AI کا تازہ ترین فلیگ شپ ماڈل ہے، جو جولائی 2026 میں لانچ ہوا، طویل افق والی کوڈنگ، گہری استدلالی صلاحیت، ملٹی موڈل سمجھ بوجھ، اور اینڈ ٹو اینڈ علمی کام کے لیے بنایا گیا ہے۔ Moonshot کے مطابق یہ 2.8 ٹریلین پیرامیٹرز والا اوپن 3T کلاس ماڈل ہے، جس میں نیٹو وژن اور 10 لاکھ ٹوکن کا کانٹیکسٹ ونڈو ہے۔
ڈویلپرز جو الگ الگ پرووائیڈر اکاؤنٹس کے بغیر تیز رسائی چاہتے ہیں اُن کے لیے CometAPI نے Kimi K3 کو ماڈل آئی ڈی kimi-k3 کے تحت لائیو درج کیا ہے، جو OpenAI-مطابقت رکھنے والے /v1/chat/completions اینڈ پوائنٹ اور بیس URL https://api.cometapi.com/v1. کا استعمال کرتا ہے۔ CometAPI کے لائیو Kimi K3 کی ان پٹ قیمت $2.40 فی 1M ٹوکن اور آؤٹ پٹ قیمت $12.00 فی 1M ٹوکن درج ہے، جبکہ آفیشل Kimi API کی قیمتیں $3.00 (کیچ-مس ان پٹ) اور $15.00 (آؤٹ پٹ) ہیں۔ چونکہ Kimi K3 کی مانگ نے Moonshot پر عارضی سبسکرپشن گیٹنگ پیدا کر دی ہے، اس لیے پروڈکشن ٹیموں کو CometAPI نہ صرف آسان سیٹ اپ بلکہ ماڈل موازنہ، یوزج مانیٹرنگ، اور فال بیک روٹنگ کے لیے بھی استعمال کرنا چاہیے۔
کلیدی نکات
- پروڈکشن میں، ملٹی ٹرن ورک فلو میں اسسٹنٹ کے مکمل میسجز محفوظ رکھیں،
max_completion_tokensکو محدود کریں، ٹوکن یوزج ٹریک کریں، اور فال بیک روٹس بنائیں۔ - Kimi K3، Moonshot AI کا 2.8T پیرامیٹرز والا Mixture-of-Experts ماڈل ہے جس میں 1M ٹوکن کانٹیکسٹ ونڈو اور نیٹو بصری سمجھ بوجھ ہے۔
- CometAPI کے Kimi k3 کی ماڈل آئی ڈی
kimi-k3ہے؛ مرکزی اینڈ پوائنٹ ہےPOSThttps://api.cometapi.com/v1/chat/completions۔ - K3 ہمیشہ ریزننگ کرتا ہے۔
reasoning_effortکوlow،highیاmaxکے ساتھ استعمال کریں؛max، Kimi کی ڈاکیومنٹیشن میں ڈیفالٹ ہے۔ - طویل کوڈنگ، تحقیق، اور تجزیاتی کاموں کے لیے اسٹریمنگ سختی سے تجویز کی جاتی ہے کیونکہ صارفین ماڈل کے کام کرتے ہوئے جزوی آؤٹ پٹ دیکھ سکتے ہیں۔
- وژن ان پٹ کو ملٹی موڈل
contentارریز سے دینا ہوگا۔ Kimi کی ڈاکیومنٹیشن کے مطابق Kimi کے وژن روٹس کے لیے عوامی امیج URLs سپورٹ نہیں ہیں؛ base64 یا اپلوڈ کی گئی فائل ریفرنسز استعمال کریں۔ - Kimi K3 ساختہ آؤٹ پٹ، JSON موڈ، ٹول کالنگ،
tool_choice، ڈائنامک ٹول لوڈنگ، اور کانٹیکسٹ کیچنگ سپورٹ کرتا ہے۔
CometAPI، GPT، Claude، Gemini، DeepSeek، Qwen اور دیگر ماڈلز کے ساتھ Kimi K3 کا ایک ہی API لیئر سے عملی موازنہ کرنے کا طریقہ ہے۔
Kimi K3 کیا ہے: Moonshot AI کا فلیگ شپ ماڈل
Moonshot AI نے 16 جولائی 2026 کو Kimi K3 جاری کیا، جو اب تک کا اس کا سب سے باصلاحیت ماڈل ہے — ایک سپارس Mixture-of-Experts (MoE) آرکیٹیکچر جس میں تقریباً 2.8 ٹریلین کل پیرامیٹرز ہیں (ہر ٹوکن پر 896 میں سے 16 ایکسپرٹس فعال)۔ اس میں Kimi Delta Attention شامل ہے جو ملین-ٹوکن کانٹیکسٹس میں 6.3x تک تیز ڈیکوڈنگ فراہم کرتا ہے، اور Attention Residuals جو تربیتی افادیت میں ~25% اضافہ لاتے ہیں۔
اہم خصوصیات (آفیشل اور آزاد ذرائع سے ماخوذ):
| صلاحیت | Kimi K3 کی تفصیلات |
|---|---|
| ماڈل آئی ڈی | kimi-k3 |
| کانٹیکسٹ ونڈو | 1,048,576 ٹوکن (1M) |
| پیرامیٹرز | 2.8T کل (MoE) |
| ان پٹ | متن + نیٹو وژن (تصاویر) |
| ریزننگ | ہمیشہ فعال، لانچ پر زیادہ سے زیادہ کوشش |
| خصوصیات | ٹول کالنگ، ساختہ/JSON آؤٹ پٹ، اسٹریمنگ |
| اوپن ویٹس | 27 جولائی 2026 تک وعدہ (Modified MIT) |
یہ طویل افق کوڈنگ، ایجنٹک ٹاسکس، بصری سمجھ بوجھ، اور علمی کام میں بہترین کارکردگی دکھاتا ہے۔ آزاد بینچ مارکس کے مطابق یہ مقابلتاً مضبوط ہے (مثلاً Artificial Analysis Intelligence Index پر 57.1، فرنٹ اینڈ کوڈنگ میدانوں میں عمدہ کارکردگی)۔
تازہ خبر کا سیاق businessinsider: لانچ کے بعد طلب اتنی بڑھی کہ Moonshot نے عارضی طور پر نئی سبسکرپشنز روک دیں۔ یہ چین کی اوپن ویٹس فرَنٹیئر ماڈلز کی دوڑ میں پیش قدمی کی علامت ہے، جبکہ Moonshot ایک بڑے IPO کی تیاری کر رہا ہے۔
مکمل ویٹس 27 جولائی 2026 کو متوقع
Moonshot کی Kimi K3 ڈاکیومنٹیشن کے مطابق مکمل ماڈل ویٹس 27 جولائی 2026 تک جاری کیے جائیں گے۔ جب تک یہ ریلیز مکمل نہیں ہوتی اور تھرڈ پارٹی ڈپلائمنٹ ٹولنگ پختہ نہیں ہو جاتی، زیادہ تر ٹیموں کے لیے ہوسٹڈ API تک رسائی تیز ترین عملی راستہ رہے گا۔ ویٹس دستیاب ہونے کے بعد بھی 2.8T پیرامیٹرز والے MoE ماڈل کو سرور کرنا کسی چھوٹے اوپن ماڈل کو ایک ورک سٹیشن پر چلانے جیسا نہیں۔ Moonshot کے ٹیکنیکل بلاگ کے مطابق K3 ڈپلائمنٹ کے لیے 64 یا زیادہ ایکسلریٹرز والی سپرنوڈ کنفیگریشنز کی سفارش کی جاتی ہے، اس لیے بہت سی SaaS ٹیموں، ایجنسیوں، اندرونی ٹولز بنانے والوں اور AI پروڈکٹ ٹیموں کے لیے ہوسٹڈ API ہی عمومی انتخاب رہے گا۔
بینچ مارک کارکردگی: ڈیٹا، ذرائع، اور تجزیہ
Kimi K3 سرحدی سطح کے نتائج دیتا ہے، خاص طور پر کوڈنگ اور ایجنٹک شعبوں میں، جبکہ مجموعی طور پر بھی مسابقتی ہے۔ Artificial Analysis جیسے آزاد ادارے وینڈر کے دعووں کی کچھ احتیاطی نوٹس کے ساتھ توثیق کرتے ہیں (مثلاً ہیلوسینیشن ریٹس)۔
مجموعی ذہانت
- Artificial Analysis Intelligence Index v4.1: 57.1 (مجموعی طور پر چوتھا؛ Fable 5 ~60 اور GPT-5.6 Sol ~59 سے پیچھے؛ Claude Opus 4.8 ~55.7 سے آگے)۔
- GDPval-AA v2 Elo: 1,668 (K2.6 کے 1,190 سے بڑا اضافہ؛ Opus 4.8 کو پیچھے چھوڑتا ہے، Fable 5 سے پیچھے)۔

ماخذ: reddit
کوڈنگ بینچ مارکس (وینڈر + آزاد)
K3 یہاں چمکتا ہے، Frontend Code Arena میں ٹاپ (1,679 Elo، #1، Fable 5 اور Sol سے آگے)۔

ماخذ: Kimi
Coding Index (Artificial Analysis): مضبوط ~76، رہنماؤں کے شانہ بشانہ۔
K3 ریپو اسکیل کام، بصری تکرار کے ساتھ فرنٹ اینڈ، اور ٹول استعمال کرنے والے ایجنٹس میں نمایاں ہے۔ ڈویلپرز کے مطابق یہ بہت سے کوڈنگ کاموں کے لیے "Opus 4.8+ لیول" ہے۔
Kimi K3 API کیا ہے؟
سادہ ڈویلپر اصطلاحات میں Kimi K3
Kimi K3 API ڈویلپرز کو چیٹ-کمپلیشنز اسٹائل انٹرفیس کے ذریعے Moonshot AI کے K3 ماڈل تک ہوسٹڈ رسائی دیتا ہے۔ ایک عام درخواست میں پیغامات کی فہرست بھیجی جاتی ہے، model: "kimi-k3" منتخب کیا جاتا ہے، اور اسسٹنٹ کا جواب وصول ہوتا ہے۔ بنیادی چیٹ فارمیٹ سے آگے، K3 پروڈکشن کے لیے اہم فیچرز دیتا ہے: قابلِ تشکیل سوچنے کی کوشش، طویل کانٹیکسٹ، بصری ان پٹ، اسٹریمنگ، JSON اور اسکیما-محدود آؤٹ پٹ، ٹول کالنگ، اور کانٹیکسٹ کیچنگ۔
Kimi K3 کو "سستا جنرل چیٹ بوٹ" سمجھنا درست نہیں۔ اس کی اصل قدر بھاری کام میں ہے۔ اگر آپ کی پروڈکٹ کو کسی بڑے ریپوزٹری، طویل دستاویزات کے پیک، گھنے اسپریڈشیٹ ایکسپورٹ، متعدد اسکرین شاٹس، ڈیبگنگ ٹرانسکرپٹ، یا پیچیدہ ٹول پلان کو ماڈل میں فیڈ کرنے کی ضرورت ہو، تو K3 اسی نوعیت کے سیشن کے لیے ڈیزائن کیا گیا ہے۔ اگر آپ کی ایپ کو صرف مختصر FAQ جوابات یا نہایت چھوٹے ان پٹس پر کلاسیفیکیشن چاہیے، تو کوئی چھوٹا ماڈل زیادہ لاگت مؤثر ہو سکتا ہے۔
K3 کی نئی API خصوصیات اور استعمال
Kimi K3 پچھلے Kimi ماڈلز پر فرنٹیئر سطح کی بہتریاں لاتا ہے:
- 1M کانٹیکسٹ: پورے ریپوزٹریز، کتابیں، یا طویل گفتگو بغیر ٹرنکیشن کے پروسس کریں۔
- نیٹو وژن: پیغامات میں تصاویر کو براہِ راست تحلیل کریں (base64 یا URLs)۔
- ہمیشہ فعال ریزننگ: ڈیفالٹ میں زیادہ سے زیادہ کوشش؛ ساختہ سوچنے کے ٹریسز سپورٹ (اسٹریمنگ ڈیلٹاز ظاہر کرتی ہے)۔
- ٹول کالنگ اور ایجنٹس: پیچیدہ ورک فلو کے لیے مکمل OpenAI طرز فنکشن کالنگ۔
- ساختہ آؤٹ پٹ: قابلِ بھروسہ پارسنگ کے لیے JSON موڈ۔
- کیچنگ: بار بار آنے والے کانٹیکسٹس کے لیے آٹومیٹک پری فکس کیچنگ لاگت کم کرتی ہے (کوڈنگ میں 90%+ ہٹس رپورٹ)۔
CometAPI پر Kimi K3 API کی کلیدی صلاحیتیں
1M-ٹوکن کانٹیکسٹ طویل دستاویزات اور بڑے کوڈ بیس کے لیے
CometAPI Kimi K3 کو 1,000k ٹوکن کانٹیکسٹ ونڈو کے ساتھ درج کرتا ہے۔ یہ سائز ڈویلپرز کے ورک فلو ڈیزائن کرنے کا طریقہ بدل دیتا ہے۔ ہر دستاویز کو متعدد حصوں میں بانٹنے کے بجائے، آپ ایسے ورک فلو آزما سکتے ہیں جو زیادہ بڑا کانٹیکسٹ ایک ہی درخواست میں رکھتے ہیں: آرکیٹیکچر ڈاکس کے ساتھ کوڈ کے اقتباسات، پروڈکٹ ضروریات کے ساتھ بگ رپورٹس، تحقیقی مقالات کے ساتھ نوٹس، یا طویل کسٹمر سپورٹ ہسٹریز۔
اس کا مطلب یہ نہیں کہ ہر درخواست میں مکمل کانٹیکسٹ استعمال ہو۔ طویل کانٹیکسٹ مہنگا ہو سکتا ہے اور فرسٹ-ٹوکن لیٹنسی سست کر سکتا ہے۔ اسے تب استعمال کریں جب ماڈل کو عالمی منظرنامے کی ضرورت ہو، نہ کہ صاف ستھرے رِٹریول ڈیزائن کے متبادل کے طور پر۔ CometAPI کا مضبوط پروڈکشن پیٹرن ہائبرڈ روٹنگ ہے: ایمبیڈنگز یا سرچ سے متعلق ترین حصے واپس لائیں، مگر K3 کو اُن کم یاب کاموں کے لیے دستیاب رکھیں جہاں وسیع کانٹیکسٹ واقعی جواب کے معیار میں بہتری لاتا ہے۔
قابلِ تشکیل reasoning_effort کے ساتھ ہمیشہ فعال ریزننگ
Kimi کی ڈاکیومنٹیشن کے مطابق K3 ہمیشہ ریزننگ کرتا ہے اور اوپری سطح کے reasoning_effort فیلڈ کو low، high، اور max کے ساتھ سپورٹ کرتا ہے۔ ہلکے کاموں کے لیے کم کوشش رکھیں جہاں لیٹنسی اور لاگت اہم ہوں؛ ڈیبگنگ، ریاضیاتی اخذ، آرکیٹیکچر ریویو، کوڈ مائیگریشن، طویل دستاویزاتی ترکیب، اور ملٹی-ٹول پلاننگ جیسے کاموں کے لیے high یا max استعمال کریں۔
CometAPI پر، جب Kimi K3 روٹ پرووائیڈر-اسپیسفک پیرامیٹرز سپورٹ کرے تو Chat Completions درخواست میں reasoning_effort پاس کریں۔ اگر آپ کا SDK ورژن اوپری سطح کا فیلڈ قبول نہیں کرتا، تو اسے extra_body کے ذریعے بھیجیں یا خام HTTPS استعمال کریں۔
بہتر یوزر ایکسپیرینس کے لیے اسٹریمنگ ریسپانسز
Kimi کی اسٹریمنگ ڈاکس وضاحت کرتی ہیں کہ اسٹریمنگ، مکمل جواب کا انتظار کرنے کے بجائے Server-Sent Events کے ذریعے ٹوکنز بھیجتی ہے۔ یہ K3 کے لیے خاص طور پر مفید ہے کیونکہ گہری ریزننگ اور طویل آؤٹ پٹ چھوٹے چیٹ کاموں سے زیادہ وقت لے سکتے ہیں۔ ڈویلپر ٹول میں، پہلے پلان اسٹریمنگ کریں، پھر کوڈ۔ ریسرچ اسسٹنٹ میں، سیکشن سمریز اسٹریمنگ کریں۔ اندرونی اینالیٹکس ایپ میں، حتمی ساختہ جواب بننے تک ابتدائی مشاہدات اسٹریمنگ کریں۔
اسکرین شاٹس، چارٹس، اور ویڈیوز کے لیے وژن ان پٹ
Kimi K3 بصری سمجھ بوجھ رکھتا ہے۔ Kimi کی وژن ڈاکس بتاتی ہیں کہ K3 تصویر اور ویڈیو مواد سمجھ سکتا ہے، اور وژن میسجز کو content ارریز کے ساتھ image_url یا video_url پارٹس استعمال کرنا چاہیے۔ انہی ڈاکیومنٹس کے مطابق URL-فارمیٹڈ تصاویر سپورٹ نہیں؛ base64 ڈیٹا URLs یا اپلوڈ فائل ریفرنسز استعمال کریں۔ CometAPI صارفین کے لیے، اسٹیجنگ میں base64 امیج ان پٹ سے شروع کریں کیونکہ یہ سادہ، پورٹ ایبل، اور محفوظ لاگنگ کے لیے آسان ہے، بغیر کسی عوامی امیج ہوسٹ پر انحصار کے۔
ساختہ آؤٹ پٹ، JSON موڈ، اور ٹول کالنگ
Kimi K3 response_format کے ذریعے ساختہ آؤٹ پٹ، اور JSON اسکیما فنکشن ڈکلیریشنز کے ذریعے ٹول کالنگ سپورٹ کرتا ہے۔ K3 کی نئی API خصوصیات میں tool_choice اور ڈائنامک ٹول لوڈنگ شامل ہیں۔ یہ ایجنٹ پروڈکٹس کے لیے اہم ہیں کیونکہ ٹول انوینٹری بہت بڑی ہو سکتی ہے۔ ہر درخواست پر ہر ٹول کی تعریف بھیجنے کی بجائے، آپ کی ایپ پہلے ایک چھوٹا search_tools فنکشن ایکسپوز کر سکتی ہے، صرف متعلقہ ٹولز حاصل کر سکتی ہے، اور ان ٹول ڈیفینیشنز کو ڈائنامکلی گفتگو میں شامل کر سکتی ہے۔
عملی فیصلہ سادہ ہے: صرف بینچ مارک ٹیبل دیکھ کر انتخاب نہ کریں۔ CometAPI کے ساتھ اپنی حقیقی پرامپٹس سے قابلِ تکرار ایویلیویشن سیٹ بنائیں۔ کم از کم 20 سے 50 حقیقی کام شامل کریں: بگ فکسز، ایکسٹریکشن جابز، اسکرین شاٹس، PDFs، کسٹمر سوالات، ٹول کال ٹریسز، اور لاگت حساس درخواستیں۔ Kimi K3 کو اُن کاموں کی طرف بھیجیں جہاں اس کا طویل کانٹیکسٹ، ریزننگ، اور وژن سپورٹ اپنی لاگت وصول کر لیں۔
API قیمتیں: Kimi K3 کی لاگت
CometAPI Kimi K3 قیمتیں
CometAPI کے Kimi K3 ماڈل صفحے پر درج ہے:
| پرووائیڈر روٹ | ان پٹ قیمت | آؤٹ پٹ قیمت | کانٹیکسٹ | ماڈل آئی ڈی |
|---|---|---|---|---|
| CometAPI Kimi K3 | $2.40 فی 1M ٹوکن | $12.00 فی 1M ٹوکن | 1,000k ٹوکن | kimi-k3 |
اسی صفحے پر یہ اعداد و شمار آفیشل قیمتوں کے ساتھ موازنہ دکھاتے ہیں: فی 1M ٹوکن $3.00 ان پٹ اور $15.00 آؤٹ پٹ، یعنی لائیو CometAPI لسٹنگ پر 20% ڈسکاؤنٹ۔ قیمتیں بدل سکتی ہیں، اس لیے ہائی-ٹریفق پرائسنگ کاپی شائع کرنے یا پروڈکشن بجٹ فائنل کرنے سے پہلے CometAPI کے لائیو ماڈل صفحے سے تصدیق کریں۔
آفیشل Kimi API قیمتیں
Moonshot کے ٹیکنیکل بلاگ میں Kimi API کی قیمتیں درج ہیں: فی 1M کیچ-ہٹ ان پٹ ٹوکن $0.30، فی 1M کیچ-مس ان پٹ ٹوکن $3.00، اور فی 1M آؤٹ پٹ ٹوکن $15.00۔ یہ بھی کہا گیا ہے کہ آفیشل Kimi API کوڈنگ ورک لوڈز میں 90% سے زیادہ کیچ ہٹ ریٹ حاصل کرتی ہے۔ اس 90% کو پرووائیڈر-رپورٹڈ اور ورک لوڈ-اسپیسفک دعویٰ سمجھیں، نہ کہ ہر ایپ کے لیے گارنٹی۔ آپ کی کیچ ہٹ ریٹ آپ کے پرامپٹس، ٹول ڈیفینیشنز، ریپوزٹری پری فکسز، اور سیشن ہسٹریز کی استحکام پر منحصر ہے۔
CometAPI پر سادہ لاگت کی مثالیں
| مثال درخواست | ان پٹ ٹوکنز | آؤٹ پٹ ٹوکنز | متوقع CometAPI لاگت |
|---|---|---|---|
| مختصر کوڈ ریویو | 20,000 | 2,000 | $0.072 |
| اوسط ریپوزٹری سوال | 100,000 | 5,000 | $0.300 |
| بڑی دستاویز کا تجزیہ | 500,000 | 20,000 | $1.440 |
| قریب-مکمل-کانٹیکسٹ ترکیب | 950,000 | 50,000 | $2.880 |
فارمولہ: (input_tokens / 1,000,000 * 2.40) + (output_tokens / 1,000,000 * 12.00)۔
دو باتیں اہم ہیں۔ اول، ریزننگ ٹوکنز عام طور پر ریزننگ ماڈلز میں آؤٹ پٹ ٹوکنز کے طور پر بل ہوتے ہیں، لہٰذا max_completion_tokens سوچ سمجھ کر سیٹ کریں۔ دوم، طویل کانٹیکسٹ دانستہ ہونا چاہیے۔ 500,000 ٹوکن بھیجنا طاقتور ہے، مگر شاذ و نادر ہی دانشمندانہ ہوتا ہے جب 20,000 اعلیٰ اشارتی ٹوکنز وہی جواب دے سکتے ہوں۔
CometAPI میں Kimi K3 API کیسے استعمال کریں
مرحلہ 1: ایک CometAPI کلید بنائیں
اپنا CometAPI اکاؤنٹ بنائیں یا سائن اِن کریں، API کلید صفحہ کھولیں، اور ایک کلید بنائیں۔ اسے سرور-سائیڈ ماحول متغیر کے طور پر COMETAPI_KEY نام سے رکھیں۔ پروڈکشن کلیدیں براوزر جاوا اسکرپٹ، موبائل ایپس، عوامی ریپوزٹریز، اسکرین شاٹس، یا کلائنٹ-سائیڈ لاگز میں نہ ڈالیں۔
PowerShell:
$env:COMETAPI_KEY = "your_cometapi_key_here"
macOS یا Linux:
export COMETAPI_KEY="your_cometapi_key_here"
مرحلہ 2: OpenAI SDK انسٹال کریں
CometAPI، OpenAI-مطابقت رکھنے والے SDKs سپورٹ کرتا ہے۔ Python میں، SDK ایک بار انسٹال کریں:
python -m pip install --upgrade openai
مرحلہ 3: اپنی پہلی Kimi K3 API کال کریں
CometAPI کا بیس URL اور kimi-k3 ماڈل آئی ڈی استعمال کریں:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "system",
"content": "You are a precise technical assistant for API developers.",
},
{
"role": "user",
"content": "Explain when I should use Kimi K3 for a coding agent.",
},
],
max_completion_tokens=1200,
)
print(completion.choices[0].message.content)
print(completion.usage)
متبادل cURL درخواست:
curl https://api.cometapi.com/v1/chat/completions \
-H "Authorization: Bearer $COMETAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [
{"role": "system", "content": "You are a precise technical assistant for API developers."},
{"role": "user", "content": "Explain Kimi K3 in one paragraph."}
],
"max_completion_tokens": 800
}'
K3 کی نئی API خصوصیات اور استعمال
سوچنے کی کوشش
reasoning_effort استعمال کریں تاکہ K3 کتنی ریزننگ بجٹ لگائے اسے کنٹرول کیا جا سکے۔ Kimi کی ڈاکیومنٹیشن low، high، اور max درج کرتی ہے، جس میں max ڈیفالٹ ہے۔ پروڈکشن میں، کام کی نوعیت کے مطابق انتخاب کریں:
| کام کی قسم | تجویز کردہ کوشش | وجہ |
|---|---|---|
| مختصر خلاصے، ری رائٹنگ، سادہ سوال و جواب | low | کم خطرہ والے کاموں کے لیے تیز اور کم لاگت |
| کوڈ ریویو، ایکسٹریکشن، پلاننگ، تجزیہ | high | معیار اور لاگت کا بہتر توازن |
| پیچیدہ ڈیبگنگ، ریاضی، ایجنٹک کام، طویل-کانٹیکسٹ ریزننگ | max | جب گہری ریزننگ کی لاگت اور لیٹنسی کے بدلے بہترین معیار درکار ہو |
Python مثال:
completion = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="high",
messages=[
{
"role": "user",
"content": (
"Review this migration plan for hidden risks. "
"Return the top 5 issues and a safer rollout sequence."
),
}
],
max_completion_tokens=2000,
)
message = completion.choices[0].message
print(message.content)
اگر آپ کا OpenAI SDK ورژن reasoning_effort کو نامی آرگیومنٹ کے طور پر قبول نہیں کرتا، تو اسے extra_body کے ذریعے پاس کریں:
completion = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Solve this scheduling problem."}],
extra_body={"reasoning_effort": "high"},
)
اہم نفاذی تفصیل: Kimi کی سوچنے سے متعلق ڈاکس کہتی ہیں کہ ملٹی ٹرن K3 گفتگو میں API سے واپس آنے والا مکمل اسسٹنٹ میسج محفوظ رکھنا چاہیے، جن میں reasoning_content اور tool_calls جیسے فیلڈز شامل ہیں۔ اگر آپ صرف نظر آنے والا content اسٹور کریں گے تو طویل سیشنز میں ریزننگ کی تسلسل کم ہو سکتی ہے۔
اسٹریمنگ ریسپانسز
اسٹریمنگ اس وقت استعمال کریں جب جواب طویل ہو سکتا ہے، لیٹنسی اہم ہو، یا آپ چیٹ UI میں پیش رفت دکھانا چاہیں۔
stream = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "user",
"content": "Create a detailed refactor plan for a 200k-line monolith.",
}
],
stream=True,
stream_options={"include_usage": True},
max_completion_tokens=3000,
)
for chunk in stream:
choice = chunk.choices[0]
delta = choice.delta
reasoning = getattr(delta, "reasoning_content", None)
if reasoning:
# In most products, store reasoning securely or hide it from end users.
pass
if delta.content:
print(delta.content, end="", flush=True)
usage = getattr(choice, "usage", None)
if usage:
print("\n\nUsage:", usage)
Kimi کی اسٹریمنگ ڈاکس زور دیتی ہیں کہ SSE اسٹریمز data: [DONE] پر ختم ہوتی ہیں۔ خام SSE کلائنٹ میں، جب تک یہ مارکر نہ آئے اسٹریم کو مکمل نہ سمجھیں۔
وژن ان پٹ
Kimi K3 تصاویر اور ویڈیوز کا تجزیہ کر سکتا ہے۔ CometAPI کی پہلی محفوظ آزمائش base64 امیج درخواست ہے۔ ملٹی موڈل content اررے استعمال کریں، نہ کہ ایسا JSON سٹرنگ جس میں اررے ہو۔
import base64
import mimetypes
from pathlib import Path
image_path = Path("dashboard-screenshot.png")
mime_type = mimetypes.guess_type(image_path.name)[0] or "image/png"
image_b64 = base64.b64encode(image_path.read_bytes()).decode("utf-8")
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": {
"url": f"data:{mime_type};base64,{image_b64}",
},
},
{
"type": "text",
"text": (
"Review this dashboard screenshot. "
"Identify UX issues, missing states, and data-quality risks."
),
},
],
}
],
max_completion_tokens=1800,
)
print(completion.choices[0].message.content)
Kimi کی وژن ڈاکس سپورٹڈ امیج فارمیٹس (جیسے PNG، JPEG، WebP، GIF) اور ویڈیو فارمیٹس (جیسے MP4، MOV، AVI، WebM، وغیرہ) کی فہرست دیتی ہیں۔ وہ یہ بھی تجویز کرتی ہیں کہ امیج ریزولیوشن 4K یا اس سے کم اور ویڈیو ریزولیوشن FHD یا اس سے کم رکھیں کیونکہ زیادہ ریزولیوشن بغیر سمجھ میں اضافہ کیے پروسیسنگ وقت بڑھا سکتا ہے۔
JSON اسکیما کے ساتھ ساختہ آؤٹ پٹ
پروڈکشن پائپ لائنز کے لیے، اگر اگلا قدم ساختہ ڈیٹا چاہتا ہے تو آزادانہ نثری متن پارس نہ کریں۔ جب روٹ سپورٹ کرے تو response_format کے ساتھ JSON اسکیما استعمال کریں۔
import json
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "user",
"content": (
"Extract implementation tasks from this request: "
"Add SSO, migrate billing webhooks, and create admin audit logs."
),
}
],
response_format={
"type": "json_schema",
"json_schema": {
"name": "implementation_tasks",
"strict": True,
"schema": {
"type": "object",
"properties": {
"tasks": {
"type": "array",
"items": {
"type": "object",
"properties": {
"title": {"type": "string"},
"risk": {"type": "string"},
"owner": {"type": "string"},
},
"required": ["title", "risk", "owner"],
"additionalProperties": False,
},
}
},
"required": ["tasks"],
"additionalProperties": False,
},
},
},
)
data = json.loads(completion.choices[0].message.content)
print(data["tasks"])
ٹول کالنگ اور tool_choice
K3 کی ٹول-کالنگ بہترین طریقہ کار کی ڈاکس ایک ہی درخواست میں بہت بڑے ٹول انوینٹری سے گریز کا مشورہ دیتی ہیں۔ پیٹرن یہ ہے: پہلے ایک ٹول-سرچ فنکشن ایکسپوز کریں، پہلی ٹرن پر tool_choice: "required" کے ساتھ لازمی رِٹریول کرائیں، پھر صرف اُن ٹولز کی تعریفیں ڈائنامکلی شامل کریں جن کی ماڈل کو ضرورت ہو۔
کم سے کم موسم-انداز مثال:
import json
tools = [
{
"type": "function",
"function": {
"name": "get_order_status",
"description": "Look up a customer's order status.",
"parameters": {
"type": "object",
"properties": {
"order_id": {"type": "string"},
},
"required": ["order_id"],
"additionalProperties": False,
},
},
}
]
messages = [
{"role": "user", "content": "Where is order A1024?"},
]
first = client.chat.completions.create(
model="kimi-k3",
messages=messages,
tools=tools,
tool_choice="required",
)
assistant_message = first.choices[0].message
messages.append(assistant_message.model_dump(exclude_none=True))
for call in assistant_message.tool_calls or []:
args = json.loads(call.function.arguments)
result = {"order_id": args["order_id"], "status": "Shipped", "eta": "2026-07-24"}
messages.append(
{
"role": "tool",
"tool_call_id": call.id,
"content": json.dumps(result),
}
)
final = client.chat.completions.create(
model="kimi-k3",
messages=messages,
tools=tools,
)
print(final.choices[0].message.content)
پروڈکشن ٹیموں کے لیے Kimi K3 بہترین طریقہ کار
وہاں استعمال کریں جہاں اس کی قوتیں واضح ہوں
Kimi K3 ریپوزٹری تجزیہ، فرنٹ اینڈ کوڈنگ، بگ ری پروڈکشن، طویل دستاویزاتی ترکیب، اسپریڈشیٹ ریزننگ، وژن-مدد یافتہ QA، اور ٹولز درکار ایجنٹک ورک فلو کے لیے مضبوط امیدوار ہے۔ مختصر کاپی جنریشن، سادہ کلاسیفیکیشن، یا کم-خطرہ سپورٹ میکروز کے لیے یہ ضرورت سے زیادہ ہو سکتا ہے۔ CometAPI پر، ماڈل-روٹنگ قواعد بنائیں تاکہ K3 مشکل کام سنبھالے جبکہ کم لاگت ماڈلز معمول کی ٹریفک سنبھالیں۔
فال بیکس بنائیں کیونکہ لانچ پر کیپیسٹی محدود ہے
AP کی رپورٹ کہ Moonshot نے نئی سبسکرپشنز روکی ہیں یاد دلاتی ہے کہ دستیابی ماڈل انتخاب کا حصہ ہے۔ ایپلیکیشن سطح پر فال بیکس بنائیں۔ اگر Kimi K3 پرووائیڈر-کیپیسٹی ایرر دے تو کسی دوسرے CometAPI ماڈل کی طرف روٹ کریں جس میں ملتی جلتی طاقتیں ہوں، کانٹیکسٹ سائز کم کریں، یا بیک آف کے ساتھ ری ٹرائی کریں۔ یوزر ایکسپیرینس کو خوشگوار رکھیں: پیش رفت دکھائیں، ڈرافٹس محفوظ رکھیں، اور ناکامیوں کو قابلِ بازیافت بنائیں۔
ملٹی ٹرن سیشنز میں کانٹیکسٹ احتیاط سے محفوظ کریں
Kimi K3 کو محفوظ سوچنے کی ہسٹری کے ساتھ ٹرین کیا گیا ہے۔ Moonshot کے ٹیکنیکل بلاگ کے مطابق سیشن کے بیچ میں K3 پر سوئچ کرنا یا مکمل تاریخی اسسٹنٹ میسج پاس نہ کرنا استحکام کم کر سکتا ہے۔ عمل میں، ڈویلپر ٹولز اور ایجنٹس کے لیے API سے واپس آنے والا مکمل اسسٹنٹ میسج آبجیکٹ ذخیرہ کریں۔ tool_calls یا پرووائیڈر-اسپیسفک ریزننگ فیلڈز کو کمپریس نہ کریں جب تک کہ آپ نے اس کے اثرات نہ جانچے ہوں۔
آؤٹ پٹ اور ریزننگ لاگت کو قابو میں رکھیں
ہمیشہ max_completion_tokens سیٹ کریں۔ Kimi کی API ریفرنس کہتی ہے کہ K3 کا ڈیفالٹ 131,072 میکس کمپلیشن ٹوکنز ہے اور اسے 1,048,576 تک سیٹ کیا جا سکتا ہے، ماڈل کانٹیکسٹ حد کے تابع۔ یہ طاقت ور ہے مگر اگر آپ کا پرامپٹ بہت بڑے جواب کی دعوت دیتا ہے تو بلنگ ڈیش بورڈ کو حیران کر سکتا ہے۔ زیادہ تر پروڈکٹ فلو میں علیحدہ کیپس رکھیں: خلاصوں کے لیے 800 سے 1,500 ٹوکن، تفصیلی تجزیہ کے لیے 2,000 سے 4,000، اور لمبے فارم جنریشن کے لیے بڑا کیپ صرف واضح ضرورت پر۔
کیچنگ کے لیے ڈیزائن کریں
Kimi کانٹیکسٹ کیچنگ تب بہترین کام کرتی ہے جب بار بار آنے والا ابتدائی کانٹیکسٹ مستحکم رہے۔ Kimi کی موجودہ کانٹیکسٹ کیچنگ ڈاکس اسے آٹومیٹک بیان کرتی ہیں: کوئی دستی کیچ تخلیق، کیچ آئی ڈی، یا TTL مینجمنٹ درکار نہیں۔ کوڈنگ ایجنٹس کے لیے، ریپوزٹری ہدایات، ٹول ڈیفینیشنز، اور پروجیکٹ پالیسیاں ایک مستقل پری فکس میں رکھیں۔ دستاویزاتی QA کے لیے، متعلقہ سوالات میں دستاویز پیک مستحکم رکھیں۔ ہر ٹرن پر سسٹم پرامپٹ دوبارہ نہ لکھیں، اور بڑے مستقل کانٹیکسٹ کو messages اررے کے آغاز میں رکھیں تاکہ کیچ بار بار آنے والے پری فکس کو پہچان سکے۔
وژن کو سوچ سمجھ کر استعمال کریں
وژن ان پٹ قیمتی ہے، مگر تصاویر اور ویڈیوز مواد اور ریزولیوشن کی بنیاد پر ٹوکنز استعمال کرتی ہیں۔ تصاویر تب استعمال کریں جب وہ ایسی معلومات دیں جو متن سے گرفت میں نہ آئے: UI لے آؤٹ، چارٹس، ہاتھ سے لکھے نوٹس، ڈیزائن موکس، CAD اسکرین شاٹس، اور ایرر اسکرینز۔ حد سے زیادہ بڑی تصاویر ڈاؤن اسکیل کریں، غیر متعلقہ خالی جگہ کراپ کریں، اور تصویر کے ساتھ ایک دقیق سوال شامل کریں۔
نتیجہ اور سفارشات
CometAPI پر Kimi K3 سرحدی صلاحیتیں — وسیع کانٹیکسٹ، وژن، اور ریزننگ — قابلِ رسائی قیمتوں اور کم سے کم انٹیگریشن رگڑ کے ساتھ فراہم کرتا ہے۔ چاہے آپ کوڈنگ ایجنٹس، ملٹی موڈل ایپس، یا اسکیل ایبل AI سروسز بنا رہے ہوں، متحدہ رسائی، بچت، اور قابلِ بھروسہ ہونے کے لیے CometAPI سے آغاز کریں۔ سائن اپ کریں، اوپر دیے گئے کوئک اسٹارٹس آزماییں، اور پراعتماد طریقے سے اسکیل کریں۔
