Mide cuatro señales de latencia distintas
Un único número de latencia oculta dónde esperan los usuarios. El chat en streaming puede sentirse rápido con un TTFT bajo incluso cuando la finalización completa tarda más, mientras que la extracción por lotes puede depender solo de la duración de extremo a extremo.
- Tiempo hasta el primer token: desde el inicio de la solicitud hasta el primer token transmitido.
- Rendimiento de generación: tokens de salida divididos por el tiempo de generación.
- Duración de extremo a extremo: desde el inicio de la solicitud hasta la respuesta completada.
- Fiabilidad: respuestas exitosas divididas por el total de intentos.
Controla la carga de trabajo del benchmark
Usa un conjunto fijo de prompts que represente la carga de trabajo prevista. Registra el ID del modelo, la ruta del proveedor, la región, los parámetros de la solicitud, los tokens de entrada y la longitud de salida solicitada.
- Ejecuta solicitudes de calentamiento antes de registrar las mediciones.
- Aleatoriza el orden de los proveedores para reducir el sesgo por hora del día.
- Repite las pruebas durante más de una ventana de tráfico.
- Mantén separados los resultados de streaming y no streaming.
Usa distribuciones, no una captura de pantalla del ranking
Informa los valores medianos, p90 y p95 junto con el tamaño de muestra. Una ruta con la mediana más rápida pero con retrasos extremos frecuentes puede ofrecer una peor experiencia de producción que una ruta ligeramente más lenta pero más estable.
{
"sample_size": 100,
"ttft_ms": { "median": 640, "p95": 1840 },
"output_tokens_per_second": { "median": 42.1 },
"end_to_end_ms": { "median": 5120, "p95": 9080 },
"success_rate": 0.98
}Los valores anteriores son un formato de informe ilustrativo, no un resultado en vivo de benchmark de CometAPI.
Publica la metodología con cada informe
Un benchmark solo es útil cuando el lector puede entender qué se midió y reproducir el enfoque. Incluye las limitaciones y explica si la ruta del proveedor estaba fijada o seleccionada automáticamente.
