FLUX 3 and Gemini 3.7 Flash are now live on CometAPI โ†’
Riset performa yang transparan

Benchmark Latensi API AI: TTFT, Throughput, dan Keandalan

Metodologi transparan untuk mengukur latensi API AI tanpa mencampuradukkan time-to-first-token, kecepatan generasi, dan total waktu respons.

Instrumen benchmark API AI yang mengukur sinyal latensi dan throughput
CA
Riset CometAPI
Rekayasa model AI dan API
6 Agustus 2026 8 menit baca

Poin utama

TTFT mengukur responsivitas; token per detik mengukur kecepatan generasi.
Gunakan versi model, prompt, target output, dan mode streaming yang sama untuk setiap rute.
Laporkan nilai median dan p95, bukan hanya satu permintaan tercepat.
Publikasikan error, timeout, region, dan jendela pengujian bersama angka performa.

Ukur empat sinyal latensi yang berbeda

Satu angka latensi menyembunyikan bagian mana yang sedang ditunggu pengguna. Chat streaming dapat terasa cepat dengan TTFT yang rendah meskipun penyelesaian penuh memakan waktu lebih lama, sementara ekstraksi batch mungkin hanya peduli pada durasi end-to-end.

  • Waktu ke token pertama: dari awal permintaan hingga token streaming pertama.
  • Throughput generasi: token output dibagi dengan waktu generasi.
  • Durasi end-to-end: dari awal permintaan hingga respons selesai.
  • Keandalan: respons sukses dibagi dengan total percobaan.

Kendalikan workload benchmark

Gunakan set prompt tetap yang mewakili workload yang dituju. Catat model ID, rute provider, region, parameter permintaan, token input, dan panjang output yang diminta.

  • Jalankan permintaan warm-up sebelum merekam pengukuran.
  • Acak urutan provider untuk mengurangi bias waktu dalam sehari.
  • Ulangi pengujian pada lebih dari satu jendela trafik.
  • Pisahkan hasil streaming dan non-streaming.

Gunakan distribusi, bukan tangkapan layar leaderboard

Laporkan nilai median, p90, dan p95 beserta ukuran sampel. Rute dengan median tercepat tetapi sering mengalami penundaan ekstrem dapat memberikan pengalaman produksi yang lebih buruk dibandingkan rute yang sedikit lebih lambat tetapi lebih stabil.

{
  "sample_size": 100,
  "ttft_ms": { "median": 640, "p95": 1840 },
  "output_tokens_per_second": { "median": 42.1 },
  "end_to_end_ms": { "median": 5120, "p95": 9080 },
  "success_rate": 0.98
}

Nilai di atas merupakan format pelaporan ilustratif, bukan hasil benchmark CometAPI yang berjalan secara langsung.

Publikasikan metodologi bersama setiap laporan

Sebuah benchmark hanya berguna jika pembaca dapat memahami apa yang diukur dan mereproduksi pendekatannya. Cantumkan batasan dan jelaskan apakah rute provider dikunci atau dipilih secara otomatis.

Pertanyaan umum

Apa itu TTFT dalam API AI?

Time to first token adalah durasi antara pengiriman permintaan dan penerimaan token pertama yang dihasilkan dari respons streaming.

Apakah API AI tercepat selalu menjadi rute terbaik?

Tidak. Pemilihan untuk produksi juga harus mempertimbangkan tingkat error, latensi p95, kualitas output, harga, dan apakah rute mendukung fitur yang diperlukan.

Lanjutkan dengan Benchmark & Laporan
Kembali ke ringkasan bagian dan artikel mendatang.
Lihat bagian