Kimi K3 is now live on CometAPI →

Kimi K3 API کی قیمتیں (2026): اس کی لاگت کیا ہے & K2.7 کوڈ کا موازنہ

CometAPI
Mia MarenJul 17, 2026
Kimi K3 API کی قیمتیں (2026): اس کی لاگت کیا ہے & K2.7 کوڈ کا موازنہ

TL;DR

Kimi K3 کی قیمتیں ہیں: کیچ ہٹ ان پٹ ٹوکنز کے ہر 1M پر $0.30، کیچ مس ان پٹ ٹوکنز کے ہر 1M پر $3.00، اور آؤٹ پٹ ٹوکنز کے ہر 1M پر $15.00، اور اس میں 1,048,576 ٹوکنز کی کانٹیکسٹ ونڈو شامل ہے۔

K2.7 Code کے مقابلے میں K3 فی ٹوکن کافی مہنگا ہے، لیکن یہ 4× بڑی کانٹیکسٹ ونڈو کے ساتھ نیٹو وژن اور طویل دورانیے والی ایجنٹک ورک لوڈز کے لیے مضبوط سپورٹ فراہم کرتا ہے۔

خلاصہ کلام: 256K کانٹیکسٹ کے اندر معمول کے کوڈنگ کاموں کے لیے K2.7 Code اب بھی زیادہ معاشی انتخاب ہے۔ جب بڑے کانٹیکسٹ، ملٹی موڈل صلاحیتیں، یا ایسے کام درکار ہوں جنہیں K2.7 قابلِ اعتماد طور پر مکمل نہیں کر پاتا، تو K3 استعمال کریں۔

Kimi K3 API Pricing at a Glance

ItemKimi K3
API model IDkimi-k3
Cache-hit input$0.30 / 1M tokens
Cache-miss input$3.00 / 1M tokens
Output$15.00 / 1M tokens
Context window1,048,576 tokens
Reasoningہمیشہ فعال
Supported reasoning effortصرف max
Default maximum completion131,072 tokens
Configurable maximum completionزیادہ سے زیادہ 1,048,576 tokens تک، کل کانٹیکسٹ حد کے تابع
Key capabilitiesنیٹو وژن، tool calls، structured output، Partial Mode، dynamic tool loading، automatic context caching
Batch APIK3 اس وقت سپورٹڈ Batch ماڈلز میں درج نہیں ہے

Moonshot کے Kimi K3 quickstart سے موجودہ API پیرا میٹرز اور انٹیگریشن کی تفصیلات دیکھیں۔

What Kimi K3 Adds Over K2.7 Code

سب سے واضح اپ گریڈ کانٹیکسٹ لمبائی ہے۔

K2.7 Code 262,144 ٹوکنز سپورٹ کرتا ہے، جبکہ K3 اس حد کو بڑھا کر 1,048,576 ٹوکنز کر دیتا ہے۔ یہ K3 کو بڑی ریپوزٹریز، طویل ایجنٹ ہسٹریز، وسیع دستاویزات، اور ایسے ورک فلو کے لیے زیادہ عملی بناتا ہے جن میں ورنہ کانٹیکسٹ کم کرنا پڑتا۔

K3 مزید یہ سپورٹ کرتا ہے:

  • نیٹو بصری فہم
  • سخت ساختہ آؤٹ پٹ
  • tool_choice
  • ڈائنامک ٹول لوڈنگ
  • خودکار کانٹیکسٹ کیشنگ
  • طویل دورانیے کے کوڈنگ اور نالج ورک کے ورک فلو

Moonshot کے Kimi K3 technical blog کے مطابق Terminal-Bench 2.1 پر 88.3، Program Bench پر 77.8، اور FrontierSWE پر 81.2 اسکور رپورٹ کیے گئے ہیں۔

یہ فراہم کنندہ کی جانب سے رپورٹ کردہ بینچ مارکس ہیں؛ انہیں K3 کا جائزہ لینے کی وجہ سمجھیں—یہ اس بات کی ضمانت نہیں کہ ہر پروڈکشن ورک لوڈ میں یہ K2.7 Code سے بہتر ہوگا۔

گزشتہ جنریشن کے پس منظر کے لیے CometAPI کا Kimi K2 API guide دیکھیں۔

Kimi K3 vs Kimi K2.7 Code Pricing

ModelCache-hit inputCache-miss inputOutputContext
kimi-k3$0.30 / 1M$3.00 / 1M$15.00 / 1M1,048,576
kimi-k2.7-code$0.19 / 1M$0.95 / 1M$4.00 / 1M262,144
kimi-k2.7-code-highspeed$0.38 / 1M$1.90 / 1M$8.00 / 1M262,144

K2.7 کی یہ قیمتیں Moonshot کی Kimi K2.7 Code pricing documentation سے لی گئی ہیں۔

معیاری K2.7 Code کے مقابلے میں، K3 کی قیمت:

  • کیچ ہٹ ان پٹ کے لیے 1.58×
  • کیچ مس ان پٹ کے لیے 3.16×
  • آؤٹ پٹ کے لیے 3.75×

زیادہ ہے۔

K2.7 Code HighSpeed کے مقابلے میں K3 کا پریمیم کم ہے، لیکن دونوں ماڈلز کی ترجیحات مختلف ہیں: HighSpeed تیز تر کوڈنگ آؤٹ پٹ پر فوکس کرتا ہے، جب کہ K3 زیادہ تقاضا رکھنے والے لانگ کانٹیکسٹ اور ایجنٹک ورک لوڈز کے لیے بنایا گیا ہے۔

Moonshot کی موجودہ Batch API pricing documentation میں K3 درج نہیں، اس لیے فرض نہ کریں کہ دیگر Kimi ماڈلز پر دستیاب Batch ڈسکاؤنٹس یہاں بھی لاگو ہوں گے۔

Kimi K3 Context Caching: How the 90% Input Discount Works

K3 خودکار کانٹیکسٹ کیشنگ سپورٹ کرتا ہے۔

ڈیولپرز کو دستی طور پر cache ID یا TTL بنانے کی ضرورت نہیں۔ بار بار کی درخواستوں میں بڑے پری فکسز کو مستحکم رکھنا بعد کی درخواستوں کو کیچ ہٹ ریٹ حاصل کرنے کا موقع دیتا ہے۔

قیمت کا فرق یہ ہے:

  • کیچ مس: $3.00 / 1M ان پٹ ٹوکنز
  • کیچ ہٹ: $0.30 / 1M ان پٹ ٹوکنز

یعنی کیچ ہٹ ان پٹ ٹوکنز کی قیمت کیچ مس کے مقابلے میں 90% کم ہے۔

تاہم آؤٹ پٹ بدستور ہر ملین ٹوکنز پر $15 ہے، اس لیے کل درخواست لاگت 90% نہیں گرتی۔

مثال کے طور پر فرض کریں:

  • 600,000 ان پٹ ٹوکنز
  • 20,000 آؤٹ پٹ ٹوکنز
Cache stateInput costOutput costTotal
All input cache miss$1.80$0.30$2.10
All input cache hit$0.18$0.30$0.48

اس سادہ مثال میں، کل لاگت تقریباً 77% کم ہو جاتی ہے۔

حقیقی بچت اس بات پر منحصر ہے کہ کتنے ان پٹ ٹوکنز کو کیچ ہٹ ریٹ ملتا ہے۔

Example: What a Coding Task Costs on K3 vs K2.7

فرض کریں ایک کوڈنگ ٹاسک استعمال کرتا ہے:

  • 200,000 ان پٹ ٹوکنز
  • 20,000 آؤٹ پٹ ٹوکنز
RouteCold totalFully cached total
kimi-k3$0.90$0.36
kimi-k2.7-code$0.27$0.12
kimi-k2.7-code-highspeed$0.54$0.24

اس ورک لوڈ کے لیے، سرد (کولڈ) درخواست پر K3 کی لاگت معیاری K2.7 Code کے مقابلے میں تقریباً 3.33× ہے۔

K3 کے اندر ہی، مکمل کیچ مس ان پٹ سے مکمل کیشڈ ان پٹ پر منتقل ہونے سے اندازاً لاگت $0.90 سے $0.36 تک گرتی ہے، یعنی اس مثال میں 60% کمی۔

لیکن فی درخواست لاگت صرف مساوات کا ایک حصہ ہے۔

Cost per Successful Task = Total Workflow Spend ÷ Tasks That Pass Acceptance Checks

پروڈکشن موازنہ میں ری ٹرائز، فال بیک کالز، ٹول ایگزیکیوشنز، اور انسانی ریویو کے وقت کو بھی شامل کرنا چاہیے۔

ایک ایسی K3 درخواست جو ایک ہی بار میں کامیاب ہو جائے، کئی ناکام سستی کوششوں کے مقابلے میں زیادہ معاشی ہو سکتی ہے۔

A Real-World Edge Case: Reasoning Token Cost

K3 ہمیشہ استدلال استعمال کرتا ہے، لہٰذا آؤٹ پٹ ٹوکنز کا استعمال بل کا معنی خیز حصہ بن سکتا ہے۔

Simon Willison کے لانچ ڈے ٹیسٹ میں، SVG بنانے کی ایک پرامپٹ نے جواب کے 3,417 ٹوکنز سے پہلے 13,241 ریزننگ ٹوکنز استعمال کیے، جس کی کل لاگت تقریباً $0.25 بنی۔

یہ بینچ مارک نہیں بلکہ ایک غیر رسمی واحد پرامپٹ ٹیسٹ تھا، مگر یہ ایک اہم لاگت پہلو واضح کرتا ہے: نظر آنے والا آخری جواب بل کیے گئے آؤٹ پٹ کا صرف ایک حصہ ہو سکتا ہے۔

کیونکہ فی الحال K3 صرف زیادہ سے زیادہ ریزننگ ایفرت سپورٹ کرتا ہے، ٹیموں کو چاہیے کہ اپنے ورک لوڈز پر اصل آؤٹ پٹ ٹوکن استعمال کی پیمائش کریں۔

A Better Default: K2.7 First, K3 on Escalation

مخلوط کوڈنگ ورک لوڈز کے لیے، ہر درخواست براہ راست K3 کو بھیجنے کے بجائے راؤٹنگ زیادہ معاشی ہو سکتی ہے۔

ایک سادہ حکمت عملی یہ ہے:

Start with K2.7 Code
        ↓
Task exceeds 256K context?
        → Yes: use K3
        ↓ No
Run task and validation
        ↓
Validation failed?
        → Yes: escalate to K3
        ↓ No
Return result

پچھلی مثال استعمال کرتے ہوئے:

  • K2.7 Code کی فی کولڈ کوشش لاگت $0.27 ہے
  • K3 کی $0.90 ہے
  • K2.7 70% ٹاسکس کامیابی سے مکمل کرتا ہے
  • 30% کو ایک بار K3 پر ری ٹرائی کیا جاتا ہے

اوسط لاگت بنتی ہے:

$0.27 + (30% × $0.90) = $0.54 per task

انہی ٹوکن مفروضات کے تحت ہر ٹاسک براہ راست K3 کو بھیجنے کی لاگت $0.90 فی ٹاسک ہوگی۔

اس طرح یہ راؤٹڈ حکمتِ عملی اس سادہ منظرنامے میں 40% سستی پڑتی ہے۔

حقیقی بچت مختلف ہو سکتی ہے، مگر اصول کارآمد ہے: معمول کے کام سستے ماڈل کو سونپیں اور اضافی قابلیت درکار ہو تو ایزکیلیٹ کریں۔

When Is Kimi K3 Worth the Upgrade?

K3 اس وقت زیادہ پرکشش ہوتا ہے جب:

  • مطلوبہ کانٹیکسٹ K2.7 Code کی 262,144 ٹوکن حد سے تجاوز کرتا ہو۔
  • ٹاسک میں کوڈ کے ساتھ بصری ان پٹ شامل ہو۔
  • کوئی لانگ رَننگ ایجنٹ بڑی ریپوزٹریز اور بیرونی ٹولز پر کام کرے۔
  • K2.7 میں بار بار ری ٹرائز یا فال بیک کالز درکار ہوں۔
  • ٹاسک اتنا قیمتی ہو کہ تکمیل کا معیار پہلی کال کی کم سے کم لاگت سے زیادہ اہم ہو۔

K2.7 Code 256K کانٹیکسٹ کے اندر دہرا ئی جانے والے، واضح طور پر متعین کوڈنگ کاموں کے لیے اب بھی مضبوط آپشن ہے۔

کم لیٹنسی والے کوڈنگ ایپلی کیشنز کے لیے K2.7 Code HighSpeed کو بھی الگ سے ٹیسٹ کریں۔

Migrating from K2.7 to K3: Five Engineering Checks

  1. K3 Reasoning Cannot Currently Be Reduced

K3 ہمیشہ ریزننگ کرتا ہے، اور موجودہ API صرف یہ سپورٹ کرتی ہے:

reasoning_effort="max"

چونکہ max ڈیفالٹ ہے، اس پیرا میٹر کو چھوڑا بھی جا سکتا ہے۔

  1. Remove K2-Specific thinking Parameters

K3 کے ساتھ K2.x کا thinking پیرا میٹر استعمال نہ کریں۔

اس کے بجائے اوپر کی سطح کا reasoning_effort فیلڈ استعمال کریں۔

  1. Omit Fixed Sampling Parameters

K3 فی الحال درج ذیل پیرا میٹرز کے لیے فکسڈ قدروں کا استعمال کرتا ہے:

temperature=1.0
top_p=0.95
n=1
presence_penalty=0
frequency_penalty=0

Moonshot ان فیلڈز کو اوور رائیڈ کرنے کے بجائے چھوڑ دینے کی سفارش کرتا ہے۔

  1. Preserve Complete Assistant Messages

ملٹی ٹرن گفتگو اور ٹول کالنگ لوپس کے لیے، اگلی درخواست میں مکمل assistant میسج پاس کریں، صرف نظر آنے والا content برقرار نہ رکھیں۔

  1. Validate Vision and Search Before Production

K3 کا موجودہ وژن API عوامی امیج URLs کو براہِ راست سپورٹ نہیں کرتا۔ base64 ڈیٹا یا Moonshot کے فائل ریفرنس میکنزم جیسا سپورٹڈ امیج فارمیٹ استعمال کریں۔

Moonshot اپنے موجودہ Web Search فیچر پر نزدیک مدتی پروڈکشن استعمال کے لیے انحصار کرنے کے خلاف بھی مشورہ دیتا ہے، جب تک فیچر اپ ڈیٹ ہو رہا ہے۔

Kimi K3 API Example in Python

K3 کو OpenAI-compatible API انٹرفیس کے ذریعے کال کیا جا سکتا ہے:

from openai import OpenAI

client = OpenAI(
    base_url="YOUR_OPENAI_COMPATIBLE_BASE_URL",
    api_key="YOUR_API_KEY",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "You are an expert software engineer.",
        },
        {
            "role": "user",
            "content": "Analyze this repository logic and identify potential issues.",
        },
    ],
    reasoning_effort="max",  # Optional while "max" is the default
)

assistant_message = response.choices[0].message
print(assistant_message)

K3 کے فکسڈ سیمپلنگ پیرا میٹرز کو اوور رائیڈ کرنے سے گریز کریں۔ ملٹی ٹرن اور ٹول کالنگ ورک فلو کے لیے، مکمل assistant میسج کو برقرار رکھیں۔

How to Evaluate Kimi K3 Before Upgrading

بینچ مارک پرامپٹس کے بجائے حقیقی ورک لوڈز پر K3 ٹیسٹ کریں۔

ایک عملی ایویلیو ایشن سیٹ میں شامل ہو سکتے ہیں:

  • معمول کے ریپوزٹری ایڈٹس
  • 256K کانٹیکسٹ حد کے قریب کے ٹاسکس
  • 256K سے زائد کے ٹاسکس
  • بصری انجینئرنگ ٹاسکس
  • طویل دورانیہ ایجنٹک یا نالج ورک ٹاسکس

جہاں مناسب ہو K3، K2.7 Code، اور K2.7 Code HighSpeed کا موازنہ کریں۔

ریکارڈ کریں:

  • ٹاسک کامیابی کی شرح
  • کیشڈ اور اَن کیشڈ ان پٹ ٹوکنز
  • آؤٹ پٹ اور ریزننگ ٹوکنز
  • ری ٹرائز اور فال بیک کالز
  • p50 اور p95 لیٹنسی
  • ٹول کال ایررز
  • انسانی ریویو کا وقت
  • فی کامیاب ٹاسک لاگت

پھر تین پالیسیوں کا موازنہ کریں:

  1. تمام K2.7 Code
  2. تمام K3
  3. K2.7 Code کے ساتھ K3 ایزکیلیشن

بہترین راستہ وہ ہے جو آپ کی کوالٹی اور لیٹنسی کی ضروریات کو فی کامیاب ٹاسک کم ترین لاگت پر پورا کرے۔

Kimi K3 Pricing on CometAPI

مندرجہ بالا کیلکولیشنز میں K3 اور K2.7 کے موازنے کی یکسانیت برقرار رکھنے کے لیے Moonshot AI کی آفیشل API قیمتیں استعمال کی گئی ہیں۔

اشاعت کے وقت، CometAPI پر Kimi K3 کی قیمتیں Moonshot AI کی معیاری API ریٹس سے 20% کم تھیں:

RouteInputOutput
Moonshot AI$3.00 / 1M$15.00 / 1M
CometAPI$2.40 / 1M$12.00 / 1M

چونکہ API قیمتیں بدل سکتی ہیں، پروڈکشن بجٹنگ کے لیے ان اعداد کے استعمال سے پہلے لائیو ماڈل پیج چیک کریں۔

CometAPI کی OpenAI-compatible API ایک ہی پرامپٹس اور ایویلیو ایشن ورک فلو کے ساتھ kimi-k3 کو دیگر ماڈل راؤٹس کے ساتھ ٹیسٹ کرنا آسان بناتی ہے۔

Kimi K3 ٹیسٹ کے لیے تیار؟ CometAPI پر Kimi K3 دیکھیں اور پروڈکشن میں منتقل کرنے سے پہلے قیمتوں کا موازنہ کریں۔

انٹیگریشن اور ایویلیو ایشن کی مثالوں کے لیے CometAPI Cookbook on GitHub دیکھیں۔

FAQ

Kimi K3 API کی قیمت کتنی ہے؟

Moonshot AI کے مطابق Kimi K3 کی قیمت ہر 1 ملین کیچ ہٹ ان پٹ ٹوکنز پر $0.30، ہر 1 ملین کیچ مس ان پٹ ٹوکنز پر $3.00، اور ہر 1 ملین آؤٹ پٹ ٹوکنز پر $15.00 ہے۔

API ماڈل ID kimi-k3 ہے۔

کیا Kimi K3، Kimi K2.7 Code سے سستا ہے؟

نہیں۔ Moonshot کے آفیشل ریٹس کی بنیاد پر، K3 کیچ مس ان پٹ کے لیے تقریباً 3.16× اور آؤٹ پٹ کے لیے 3.75× مہنگا ہے۔

اگر یہ ٹاسک کی کامیابی بہتر بنائے یا ری ٹرائز کم کرے تو پھر بھی ورک فلو لاگت کم ہو سکتی ہے۔

کیا Kimi K3 میں 1M-ٹوکن کانٹیکسٹ ونڈو ہے؟

جی ہاں۔ Kimi K3 1,048,576-ٹوکن کانٹیکسٹ ونڈو سپورٹ کرتا ہے، جب کہ Kimi K2.7 Code کے لیے یہ 262,144 ٹوکنز ہے۔

کیا Kimi K3 خودکار کانٹیکسٹ کیشنگ سپورٹ کرتا ہے؟

جی ہاں۔ کانٹیکسٹ کیشنگ خودکار ہے۔ کیچ ہٹ ان پٹ ٹوکنز کی قیمت $0.30 فی ملین ہے، جب کہ کیچ مس ان پٹ ٹوکنز کی $3.00 فی ملین۔

کیا میں لاگت کم کرنے کے لیے Kimi K3 کی ریزننگ بند کر سکتا/سکتی ہوں؟

فی الحال نہیں۔ K3 ہمیشہ ریزننگ کرتا ہے، اور reasoning_effort="max" واحد سپورٹڈ ریزننگ ایفرت لیول ہے۔

Final Thoughts

Kimi K3، K2.7 Code کے مقابلے میں کافی زیادہ کانٹیکسٹ اور وسیع صلاحیتیں فراہم کرتا ہے، لیکن فی ٹوکن قیمت زیادہ ہے۔

256K کانٹیکسٹ کے اندر معمول کی کوڈنگ کے لیے K2.7 Code عموماً زیادہ معاشی انتخاب ہے۔ لانگ کانٹیکسٹ، ملٹی موڈل، یا مشکل ایجنٹک کاموں کے لیے، جب K3 کامیاب تکمیل بہتر بنائے، تو اس کا پریمیم جائز ہو سکتا ہے۔

بہت سے پروڈکشن سسٹمز کے لیے مؤثر حکمتِ عملی یہ ہے کہ K2.7 کو ڈیفالٹ رکھیں اور K3 کو ایزکیلیشن روٹ کے طور پر استعمال کریں۔

بالآخر اہم میٹرک فی API کال لاگت نہیں بلکہ فی کامیاب ٹاسک لاگت ہے۔

AI ترقیاتی اخراجات 20% کم کرنے کے لیے تیار ہیں؟

منٹوں میں مفت شروع کریں۔ مفت ٹرائل کریڈٹس شامل ہیں۔ کریڈٹ کارڈ کی ضرورت نہیں۔

مزید پڑھیں