DeepSeek Vision and Grok Imagine models are now live on CometAPI →
Ашық өнімділік зерттеуі

AI API кідіріс бенчмаркі: TTFT, өткізу қабілеті және сенімділік

Time-to-first-token, генерация жылдамдығы және жалпы жауап беру уақытын шатастырмай, AI API кідірісін өлшеуге арналған ашық әдістеме.

Кідіріс және өткізу қабілеті сигналдарын өлшейтін AI API бенчмарк құралы
CA
CometAPI зерттеуі
AI model және API инженериясы
6 тамыз, 2026 8 мин оқу

Негізгі тұжырымдар

TTFT жауап беру жылдамдығын өлшейді; секундына токендер генерация жылдамдығын өлшейді.
Әр route үшін бірдей model нұсқасын, prompt-ты, output мақсатты және streaming режимін қолданыңыз.
Бір ең жылдам request орнына медиана және p95 мәндерін жариялаңыз.
Өнімділік сандарымен бірге қателерді, timeouts, region және test window-ды да жариялаңыз.

Төрт түрлі кідіріс сигналын өлшеңіз

Бір ғана кідіріс саны пайдаланушылар қай жерде күтіп тұрғанын жасырады. Streaming chat төмен TTFT кезінде жылдам сезілуі мүмкін, тіпті толық completion ұзаққа созылса да, ал batch extraction үшін тек end-to-end ұзақтығы маңызды болуы мүмкін.

  • Бірінші токенге дейінгі уақыт: request басталған сәттен бірінші streamed token алғанға дейін.
  • Генерация өткізу қабілеті: output tokens-ті генерация уақытына бөлу.
  • End-to-end ұзақтығы: request басталған сәттен толық response алынғанға дейін.
  • Сенімділік: сәтті жауаптар санының жалпы әрекеттер санына қатынасы.

Benchmark жұмыс жүктемесін бақылаңыз

Ниет етілген жұмыс жүктемесін білдіретін бекітілген prompt жиынын қолданыңыз. Model ID, provider route, region, request параметрлері, input tokens және сұралған output ұзындығын жазып отырыңыз.

  • Өлшеуді бастамас бұрын warm-up request-терін орындаңыз.
  • Күн уақытына байланысты ауытқуды азайту үшін provider ретін кездейсоқтаңыз.
  • Тесттерді бірден көп traffic window кезінде қайталаңыз.
  • Streaming және non-streaming нәтижелерін бөлек сақтаңыз.

Leaderboards скриншоты емес, үлестірімдерді қолданыңыз

Үлгі көлемімен бірге median, p90 және p95 мәндерін көрсетіңіз. Ең жылдам median бар, бірақ жиі болатын шектен тыс кідірістері бар route аздап баяуырақ, бірақ тұрақтырақ route-қа қарағанда production-та нашар тәжірибе беруі мүмкін.

{
  "sample_size": 100,
  "ttft_ms": { "median": 640, "p95": 1840 },
  "output_tokens_per_second": { "median": 42.1 },
  "end_to_end_ms": { "median": 5120, "p95": 9080 },
  "success_rate": 0.98
}

Жоғарыдағы мәндер live CometAPI benchmark нәтижесі емес, тек есеп беру форматының иллюстрациясы.

Әр есеппен бірге әдістемені жариялаңыз

Benchmark тек оқырман не өлшенгенін түсініп, тәсілді қайта өндіре алған жағдайда ғана пайдалы болады. Шектеулерді қосыңыз және provider route бекітілген бе, әлде автоматты түрде таңдалған ба, соны түсіндіріңіз.

Жиі қойылатын сұрақтар

AI API ішіндегі TTFT деген не?

Time to first token дегеніміз request жіберілген сәттен streaming response ішіндегі алғашқы generated token алынғанға дейінгі уақыт аралығы.

Ең жылдам AI API әрқашан ең жақсы route пе?

Жоқ. Production таңдауы қате деңгейін, p95 latency-ді, output сапасын, бағасын және route қажетті features-ті қолдай ма, соны да ескеруі керек.

Бенчмарктер және есептер арқылы жалғастыру
Бөлім шолуына және алдағы мақалаларға оралыңыз.
Бөлімді көру