DeepSeek Vision and Grok Imagine models are now live on CometAPI โ†’
Penyelidikan prestasi yang telus

Penanda Aras Latensi API AI: TTFT, Daya Pemprosesan dan Kebolehpercayaan

Metodologi telus untuk mengukur latensi API AI tanpa mengelirukan masa-ke-token-pertama, kelajuan penjanaan dan masa respons keseluruhan.

Instrumen penanda aras API AI yang mengukur isyarat latensi dan daya pemprosesan
CA
Penyelidikan CometAPI
Kejuruteraan model AI dan API
6 Ogos 2026 8 min baca

Inti pati

TTFT mengukur responsif; token per saat mengukur kelajuan penjanaan.
Gunakan versi model, prompt, sasaran output dan mod penstriman yang sama untuk setiap laluan.
Laporkan nilai median dan p95 dan bukannya satu permintaan terpantas.
Terbitkan ralat, tamat masa, rantau dan tetingkap ujian bersama nombor prestasi.

Ukur empat isyarat latensi yang berbeza

Satu nombor latensi menyembunyikan di mana pengguna menunggu. Sembang penstriman boleh terasa pantas dengan TTFT yang rendah walaupun penyelesaian penuh mengambil masa lebih lama, manakala pengekstrakan kelompok mungkin hanya mengambil kira tempoh hujung ke hujung.

  • Masa ke token pertama: permulaan permintaan hingga token penstriman pertama.
  • Daya pemprosesan penjanaan: token output dibahagikan dengan masa penjanaan.
  • Tempoh hujung ke hujung: permulaan permintaan hingga respons lengkap.
  • Kebolehpercayaan: respons berjaya dibahagikan dengan jumlah percubaan.

Kawal beban kerja penanda aras

Gunakan set prompt tetap yang mewakili beban kerja yang dimaksudkan. Rekod ID model, laluan penyedia, rantau, parameter permintaan, token input dan panjang output yang diminta.

  • Jalankan permintaan pemanasan sebelum merekod ukuran.
  • Rawakkan susunan penyedia untuk mengurangkan bias masa dalam sehari.
  • Ulang ujian semasa lebih daripada satu tetingkap trafik.
  • Pastikan keputusan penstriman dan bukan penstriman dipisahkan.

Gunakan taburan, bukan tangkapan skrin papan pendahulu

Laporkan nilai median, p90 dan p95 bersama saiz sampel. Laluan dengan median terpantas tetapi kelewatan melampau yang kerap mungkin memberikan pengalaman pengeluaran yang lebih buruk berbanding laluan yang sedikit lebih perlahan tetapi lebih stabil.

{
  "sample_size": 100,
  "ttft_ms": { "median": 640, "p95": 1840 },
  "output_tokens_per_second": { "median": 42.1 },
  "end_to_end_ms": { "median": 5120, "p95": 9080 },
  "success_rate": 0.98
}

Nilai di atas ialah format pelaporan ilustratif, bukan hasil penanda aras CometAPI secara langsung.

Terbitkan metodologi dengan setiap laporan

Penanda aras hanya berguna apabila pembaca boleh memahami apa yang diukur dan menghasilkan semula pendekatannya. Sertakan had dan jelaskan sama ada laluan penyedia dipinkan atau dipilih secara automatik.

Soalan lazim

Apakah TTFT dalam API AI?

Masa ke token pertama ialah tempoh antara menghantar permintaan dan menerima token pertama yang dijana daripada respons penstriman.

Adakah API AI terpantas sentiasa laluan terbaik?

Tidak. Pemilihan untuk pengeluaran juga perlu mempertimbangkan kadar ralat, latensi p95, kualiti output, harga dan sama ada laluan menyokong ciri yang diperlukan.

Teruskan dengan Penanda Aras & Laporan
Kembali ke gambaran keseluruhan bahagian dan artikel akan datang.
Lihat bahagian