
Benchmarks y reportes / Ejemplo
Benchmark de latencia de API de IA: TTFT, rendimiento y fiabilidad
Una metodología transparente para medir la latencia de API de IA sin confundir el tiempo hasta el primer token, la velocidad de generación y el tiempo total de respuesta.
TTFT mide la capacidad de respuesta; los tokens por segundo miden la velocidad de generación.
Usa la misma versión del modelo, prompt, objetivo de salida y modo de streaming para cada ruta.
Informa los valores medianos y p95 en lugar de una sola solicitud más rápida.
Publica errores, timeouts, región y ventana de prueba junto con los números de rendimiento.