Төрт түрлі кідіріс сигналын өлшеңіз
Бір ғана кідіріс саны пайдаланушылар қай жерде күтіп тұрғанын жасырады. Streaming chat төмен TTFT кезінде жылдам сезілуі мүмкін, тіпті толық completion ұзаққа созылса да, ал batch extraction үшін тек end-to-end ұзақтығы маңызды болуы мүмкін.
- Бірінші токенге дейінгі уақыт: request басталған сәттен бірінші streamed token алғанға дейін.
- Генерация өткізу қабілеті: output tokens-ті генерация уақытына бөлу.
- End-to-end ұзақтығы: request басталған сәттен толық response алынғанға дейін.
- Сенімділік: сәтті жауаптар санының жалпы әрекеттер санына қатынасы.
Benchmark жұмыс жүктемесін бақылаңыз
Ниет етілген жұмыс жүктемесін білдіретін бекітілген prompt жиынын қолданыңыз. Model ID, provider route, region, request параметрлері, input tokens және сұралған output ұзындығын жазып отырыңыз.
- Өлшеуді бастамас бұрын warm-up request-терін орындаңыз.
- Күн уақытына байланысты ауытқуды азайту үшін provider ретін кездейсоқтаңыз.
- Тесттерді бірден көп traffic window кезінде қайталаңыз.
- Streaming және non-streaming нәтижелерін бөлек сақтаңыз.
Leaderboards скриншоты емес, үлестірімдерді қолданыңыз
Үлгі көлемімен бірге median, p90 және p95 мәндерін көрсетіңіз. Ең жылдам median бар, бірақ жиі болатын шектен тыс кідірістері бар route аздап баяуырақ, бірақ тұрақтырақ route-қа қарағанда production-та нашар тәжірибе беруі мүмкін.
{
"sample_size": 100,
"ttft_ms": { "median": 640, "p95": 1840 },
"output_tokens_per_second": { "median": 42.1 },
"end_to_end_ms": { "median": 5120, "p95": 9080 },
"success_rate": 0.98
}Жоғарыдағы мәндер live CometAPI benchmark нәтижесі емес, тек есеп беру форматының иллюстрациясы.
Әр есеппен бірге әдістемені жариялаңыз
Benchmark тек оқырман не өлшенгенін түсініп, тәсілді қайта өндіре алған жағдайда ғана пайдалы болады. Шектеулерді қосыңыз және provider route бекітілген бе, әлде автоматты түрде таңдалған ба, соны түсіндіріңіз.
