قِس أربعة مؤشرات مختلفة لزمن الاستجابة
يخفي رقم واحد لزمن الاستجابة الموضع الذي ينتظر فيه المستخدمون. قد تبدو محادثة البث سريعة بفضل انخفاض TTFT حتى عندما يستغرق الاكتمال الكامل وقتًا أطول، في حين قد يهتم الاستخراج الدفعي بالمدة من البداية إلى النهاية فقط.
- زمن الوصول إلى أول رمز: من بدء الطلب إلى أول رمز يتم بثه.
- معدل معالجة التوليد: رموز المخرجات مقسومة على زمن التوليد.
- المدة من البداية إلى النهاية: من بدء الطلب إلى اكتمال الاستجابة.
- الموثوقية: الاستجابات الناجحة مقسومة على إجمالي المحاولات.
اضبط عبء عمل المعيار
استخدم مجموعة مطالبات ثابتة تمثل عبء العمل المستهدف. وسجّل معرّف النموذج ومسار مزود الخدمة والمنطقة ومعلمات الطلب وعدد رموز الإدخال وطول المخرجات المطلوب.
- نفّذ طلبات إحماء قبل تسجيل القياسات.
- بدّل ترتيب مزودي الخدمة عشوائيًا لتقليل انحياز وقت اليوم.
- كرّر الاختبارات خلال أكثر من نافذة لحركة المرور.
- أبقِ نتائج البث والنتائج غير المعتمدة على البث منفصلة.
استخدم التوزيعات، لا لقطة شاشة للوحة المتصدرين
اعرض قيم الوسيط وp90 وp95 مع حجم العينة. قد يوفر مسار ذو وسيط الأسرع، لكنه يعاني من تأخيرات قصوى متكررة، تجربة إنتاج أسوأ من مسار أبطأ قليلًا لكنه أكثر استقرارًا.
{
"sample_size": 100,
"ttft_ms": { "median": 640, "p95": 1840 },
"output_tokens_per_second": { "median": 42.1 },
"end_to_end_ms": { "median": 5120, "p95": 9080 },
"success_rate": 0.98
}القيم الواردة أعلاه تمثل تنسيقًا توضيحيًا لإعداد التقارير، وليست نتيجة معيار مباشر من CometAPI.
انشر المنهجية مع كل تقرير
يكون المعيار مفيدًا فقط عندما يستطيع القارئ فهم ما تم قياسه وإعادة تنفيذ المنهج. أدرج القيود واشرح ما إذا كان مسار مزود الخدمة مثبتًا أم مختارًا تلقائيًا.
