DeepSeek Vision and Grok Imagine models are now live on CometAPI →
شفاف کارکردگی کی تحقیق

AI API تاخیر بینچ مارک: TTFT، تھروپٹ اور قابلِ اعتمادیت

AI API تاخیر کی پیمائش کے لیے ایک شفاف طریقہ کار، جس میں time-to-first-token، generation speed اور total response time کو خلط ملط نہ کیا جائے۔

AI API بینچ مارک آلہ جو تاخیر اور تھروپٹ کے سگنلز ناپ رہا ہے
CA
CometAPI ریسرچ
AI ماڈل اور API انجینئرنگ
6 اگست، 2026 8 منٹ کا مطالعہ

اہم نکات

TTFT responsiveness ناپتا ہے؛ tokens per second generation speed ناپتا ہے۔
ہر route کے لیے ایک ہی model version، prompt، output target اور streaming mode استعمال کریں۔
ایک تیز ترین request کے بجائے median اور p95 values رپورٹ کریں۔
کارکردگی کے اعداد کے ساتھ errors، timeouts، region اور test window شائع کریں۔

چار مختلف latency signals ناپیں

ایک واحد latency number یہ چھپا دیتا ہے کہ users کہاں انتظار کر رہے ہیں۔ Streaming chat کم TTFT کے ساتھ تیز محسوس ہو سکتی ہے، چاہے مکمل completion میں زیادہ وقت لگے، جبکہ batch extraction کو صرف end-to-end duration درکار ہو سکتی ہے۔

  • Time to first token: request start سے پہلے streamed token تک کا وقت۔
  • Generation throughput: output tokens کو generation time سے تقسیم کیا جاتا ہے۔
  • End-to-end duration: request start سے completed response تک کا وقت۔
  • Reliability: successful responses کو total attempts سے تقسیم کیا جاتا ہے۔

Benchmark workload کو کنٹرول کریں

ایک fixed prompt set استعمال کریں جو مطلوبہ workload کی نمائندگی کرے۔ model ID، provider route، region، request parameters، input tokens اور requested output length ریکارڈ کریں۔

  • Measurements ریکارڈ کرنے سے پہلے warm-up requests چلائیں۔
  • وقتِ روزانہ کے bias کو کم کرنے کے لیے provider order کو randomize کریں۔
  • ایک سے زیادہ traffic window کے دوران tests دہرائیں۔
  • Streaming اور non-streaming نتائج کو الگ رکھیں۔

Leaderboard screenshot کے بجائے distributions استعمال کریں

Sample size کے ساتھ median، p90 اور p95 values رپورٹ کریں۔ جس route کا median سب سے تیز ہو لیکن جس میں شدید delays بار بار آئیں، وہ production میں ایک قدرے سست مگر زیادہ stable route سے بدتر تجربہ دے سکتا ہے۔

{
  "sample_size": 100,
  "ttft_ms": { "median": 640, "p95": 1840 },
  "output_tokens_per_second": { "median": 42.1 },
  "end_to_end_ms": { "median": 5120, "p95": 9080 },
  "success_rate": 0.98
}

اوپر دی گئی values reporting format کی ایک illustrative مثال ہیں، کوئی live CometAPI benchmark result نہیں۔

ہر report کے ساتھ methodology شائع کریں

Benchmark تبھی مفید ہے جب reader سمجھ سکے کہ کیا measure کیا گیا تھا اور approach دوبارہ reproduce کر سکے۔ limitations شامل کریں اور واضح کریں کہ provider route pinned تھا یا automatically selected تھا۔

اکثر پوچھے گئے سوالات

AI API میں TTFT کیا ہے؟

Time to first token اس مدت کو کہتے ہیں جو request بھیجنے اور streaming response سے پہلا generated token ملنے کے درمیان ہوتی ہے۔

کیا سب سے تیز AI API ہمیشہ بہترین route ہوتی ہے؟

نہیں۔ Production selection میں error rate، p95 latency، output quality، price اور یہ بھی شامل ہونا چاہیے کہ route مطلوبہ features کو support کرتی ہے یا نہیں۔

بینچ مارکس اور رپورٹس کے ساتھ جاری رکھیں
سیکشن کے جائزے اور آئندہ مضامین پر واپس جائیں۔
سیکشن دیکھیں