
Benchmarks und Berichte / Beispiel
AI API-Latenzbenchmark: TTFT, Durchsatz und Zuverlässigkeit
Eine transparente Methodik zur Messung der AI API-Latenz, ohne Time-to-First-Token, Generierungsgeschwindigkeit und die gesamte Antwortzeit zu verwechseln.
TTFT misst die Reaktionsfähigkeit; Tokens pro Sekunde messen die Generierungsgeschwindigkeit.
Verwenden Sie für jede Route dieselbe Modellversion, denselben Prompt, dasselbe Ausgabeziel und denselben Streaming-Modus.
Geben Sie Median- und p95-Werte anstelle der jeweils schnellsten Anfrage aus.
Veröffentlichen Sie neben den Leistungswerten auch Fehler, Timeouts, Region und Testzeitraum.