FLUX 3 and Gemini 3.7 Flash are now live on CometAPI →
Transparente Leistungsforschung

AI API-Latenzbenchmark: TTFT, Durchsatz und Zuverlässigkeit

Eine transparente Methodik zur Messung der AI API-Latenz, ohne Time-to-First-Token, Generierungsgeschwindigkeit und die gesamte Antwortzeit zu verwechseln.

Messinstrument für AI API-Benchmarks zur Erfassung von Latenz- und Durchsatzsignalen
CA
CometAPI Research
Engineering für KI-Modelle und API
6. August 2026 8 Min. Lesezeit

Wichtigste Erkenntnisse

TTFT misst die Reaktionsfähigkeit; Tokens pro Sekunde messen die Generierungsgeschwindigkeit.
Verwenden Sie für jede Route dieselbe Modellversion, denselben Prompt, dasselbe Ausgabeziel und denselben Streaming-Modus.
Geben Sie Median- und p95-Werte anstelle der jeweils schnellsten Anfrage aus.
Veröffentlichen Sie neben den Leistungswerten auch Fehler, Timeouts, Region und Testzeitraum.

Messen Sie vier verschiedene Latenzsignale

Eine einzelne Latenzkennzahl verschleiert, wo Benutzer warten. Gestreamte Chats können sich bei einem niedrigen TTFT schnell anfühlen, selbst wenn die vollständige Vervollständigung länger dauert, während bei der Batch-Extraktion möglicherweise nur die End-to-End-Dauer relevant ist.

  • Time to First Token: vom Start der Anfrage bis zum ersten gestreamten Token.
  • Generierungsdurchsatz: Ausgabetokens geteilt durch die Generierungszeit.
  • End-to-End-Dauer: vom Start der Anfrage bis zur vollständig abgeschlossenen Antwort.
  • Zuverlässigkeit: erfolgreiche Antworten geteilt durch die Gesamtzahl der Versuche.

Kontrollieren Sie die Benchmark-Arbeitslast

Verwenden Sie eine feste Prompt-Sammlung, die die vorgesehene Arbeitslast abbildet. Erfassen Sie die Modell-ID, die Anbieterroute, die Region, die Anfrageparameter, die Eingabetokens und die angeforderte Ausgabelänge.

  • Führen Sie Aufwärmanfragen aus, bevor Sie Messwerte erfassen.
  • Variieren Sie die Reihenfolge der Anbieter, um Verzerrungen durch die Tageszeit zu reduzieren.
  • Wiederholen Sie die Tests während mehrerer Zeitfenster mit unterschiedlicher Auslastung.
  • Halten Sie Streaming- und Nicht-Streaming-Ergebnisse getrennt.

Verwenden Sie Verteilungen statt eines Leaderboard-Screenshots

Geben Sie Median-, p90- und p95-Werte zusammen mit der Stichprobengröße an. Eine Route mit dem schnellsten Median, aber häufigen extremen Verzögerungen kann zu einer schlechteren Produktionserfahrung führen als eine geringfügig langsamere, aber stabilere Route.

{
  "sample_size": 100,
  "ttft_ms": { "median": 640, "p95": 1840 },
  "output_tokens_per_second": { "median": 42.1 },
  "end_to_end_ms": { "median": 5120, "p95": 9080 },
  "success_rate": 0.98
}

Die oben genannten Werte dienen als beispielhaftes Berichtsformat und sind kein aktuelles CometAPI-Benchmark-Ergebnis.

Veröffentlichen Sie die Methodik mit jedem Bericht

Ein Benchmark ist nur dann nützlich, wenn Leser nachvollziehen können, was gemessen wurde, und den Ansatz reproduzieren können. Fügen Sie Einschränkungen hinzu und erläutern Sie, ob die Anbieterroute fest vorgegeben oder automatisch ausgewählt wurde.

Häufig gestellte Fragen

Was ist TTFT bei einem AI API?

Time to First Token bezeichnet die Zeitspanne zwischen dem Senden der Anfrage und dem Empfang des ersten generierten Tokens einer gestreamten Antwort.

Ist die schnellste AI API immer die beste Route?

Nein. Bei der Auswahl für den Produktionseinsatz sollten auch die Fehlerrate, die p95-Latenz, die Ausgabequalität, der Preis und die Unterstützung der erforderlichen Funktionen berücksichtigt werden.

Mit Benchmarks und Berichte fortfahren
Zur Übersicht des Bereichs und zu zukünftigen Artikeln zurückkehren.
Bereich anzeigen