
Benchmark e report / Esempio
Benchmark di latenza per API AI: TTFT, throughput e affidabilità
Una metodologia trasparente per misurare la latenza delle API AI senza confondere il time-to-first-token, la velocità di generazione e il tempo totale di risposta.
TTFT misura la reattività; i token al secondo misurano la velocità di generazione.
Usa la stessa versione del modello, lo stesso prompt, lo stesso obiettivo di output e la stessa modalità di streaming per ogni route.
Riporta i valori mediani e p95 invece di una sola richiesta più veloce.
Pubblica errori, timeout, regione e finestra di test insieme ai numeri di prestazione.