Ukur empat sinyal latensi yang berbeda
Satu angka latensi menyembunyikan bagian mana yang sedang ditunggu pengguna. Chat streaming dapat terasa cepat dengan TTFT yang rendah meskipun penyelesaian penuh memakan waktu lebih lama, sementara ekstraksi batch mungkin hanya peduli pada durasi end-to-end.
- Waktu ke token pertama: dari awal permintaan hingga token streaming pertama.
- Throughput generasi: token output dibagi dengan waktu generasi.
- Durasi end-to-end: dari awal permintaan hingga respons selesai.
- Keandalan: respons sukses dibagi dengan total percobaan.
Kendalikan workload benchmark
Gunakan set prompt tetap yang mewakili workload yang dituju. Catat model ID, rute provider, region, parameter permintaan, token input, dan panjang output yang diminta.
- Jalankan permintaan warm-up sebelum merekam pengukuran.
- Acak urutan provider untuk mengurangi bias waktu dalam sehari.
- Ulangi pengujian pada lebih dari satu jendela trafik.
- Pisahkan hasil streaming dan non-streaming.
Gunakan distribusi, bukan tangkapan layar leaderboard
Laporkan nilai median, p90, dan p95 beserta ukuran sampel. Rute dengan median tercepat tetapi sering mengalami penundaan ekstrem dapat memberikan pengalaman produksi yang lebih buruk dibandingkan rute yang sedikit lebih lambat tetapi lebih stabil.
{
"sample_size": 100,
"ttft_ms": { "median": 640, "p95": 1840 },
"output_tokens_per_second": { "median": 42.1 },
"end_to_end_ms": { "median": 5120, "p95": 9080 },
"success_rate": 0.98
}Nilai di atas merupakan format pelaporan ilustratif, bukan hasil benchmark CometAPI yang berjalan secara langsung.
Publikasikan metodologi bersama setiap laporan
Sebuah benchmark hanya berguna jika pembaca dapat memahami apa yang diukur dan mereproduksi pendekatannya. Cantumkan batasan dan jelaskan apakah rute provider dikunci atau dipilih secara otomatis.
