Ukur empat isyarat latensi yang berbeza
Satu nombor latensi menyembunyikan di mana pengguna menunggu. Sembang penstriman boleh terasa pantas dengan TTFT yang rendah walaupun penyelesaian penuh mengambil masa lebih lama, manakala pengekstrakan kelompok mungkin hanya mengambil kira tempoh hujung ke hujung.
- Masa ke token pertama: permulaan permintaan hingga token penstriman pertama.
- Daya pemprosesan penjanaan: token output dibahagikan dengan masa penjanaan.
- Tempoh hujung ke hujung: permulaan permintaan hingga respons lengkap.
- Kebolehpercayaan: respons berjaya dibahagikan dengan jumlah percubaan.
Kawal beban kerja penanda aras
Gunakan set prompt tetap yang mewakili beban kerja yang dimaksudkan. Rekod ID model, laluan penyedia, rantau, parameter permintaan, token input dan panjang output yang diminta.
- Jalankan permintaan pemanasan sebelum merekod ukuran.
- Rawakkan susunan penyedia untuk mengurangkan bias masa dalam sehari.
- Ulang ujian semasa lebih daripada satu tetingkap trafik.
- Pastikan keputusan penstriman dan bukan penstriman dipisahkan.
Gunakan taburan, bukan tangkapan skrin papan pendahulu
Laporkan nilai median, p90 dan p95 bersama saiz sampel. Laluan dengan median terpantas tetapi kelewatan melampau yang kerap mungkin memberikan pengalaman pengeluaran yang lebih buruk berbanding laluan yang sedikit lebih perlahan tetapi lebih stabil.
{
"sample_size": 100,
"ttft_ms": { "median": 640, "p95": 1840 },
"output_tokens_per_second": { "median": 42.1 },
"end_to_end_ms": { "median": 5120, "p95": 9080 },
"success_rate": 0.98
}Nilai di atas ialah format pelaporan ilustratif, bukan hasil penanda aras CometAPI secara langsung.
Terbitkan metodologi dengan setiap laporan
Penanda aras hanya berguna apabila pembaca boleh memahami apa yang diukur dan menghasilkan semula pendekatannya. Sertakan had dan jelaskan sama ada laluan penyedia dipinkan atau dipilih secara automatik.
