Meet vier verschillende latentiesignalen
Een enkel latentiegetal verbergt waar gebruikers wachten. Streaming chat kan snel aanvoelen met een lage TTFT, ook wanneer de volledige voltooiing langer duurt, terwijl batch-extractie mogelijk alleen om de end-to-end duur geeft.
- Time to first token: start van de aanvraag tot het eerste gestreamde token.
- Generatiedoorvoer: output tokens gedeeld door de generatie tijd.
- End-to-end duur: start van de aanvraag tot de voltooide respons.
- Betrouwbaarheid: succesvolle responsen gedeeld door het totaal aantal pogingen.
Beperk de benchmark-workload
Gebruik een vaste promptset die de beoogde workload vertegenwoordigt. Leg model-ID, providerroute, regio, aanvraagparameters, input tokens en gevraagde outputlengte vast.
- Voer warming-upaanvragen uit voordat je metingen vastlegt.
- Randomiseer de volgorde van providers om tijd-van-de-dag-bias te verminderen.
- Herhaal tests tijdens meer dan รฉรฉn verkeersvenster.
- Houd streaming- en niet-streamingresultaten gescheiden.
Gebruik distributies, geen leaderboard-screenshot
Rapporteer mediane, p90- en p95-waarden met steekproefgrootte. Een route met de snelste mediaan maar frequente extreme vertragingen kan in productie slechter presteren dan een iets langzamere maar stabielere route.
{
"sample_size": 100,
"ttft_ms": { "median": 640, "p95": 1840 },
"output_tokens_per_second": { "median": 42.1 },
"end_to_end_ms": { "median": 5120, "p95": 9080 },
"success_rate": 0.98
}De bovenstaande waarden zijn een illustratief rapportageformaat, geen live CometAPI-benchmarkresultaat.
Publiceer de methodologie bij elk rapport
Een benchmark is alleen bruikbaar wanneer een lezer kan begrijpen wat er is gemeten en de aanpak kan reproduceren. Vermeld beperkingen en leg uit of de providerroute vastgezet was of automatisch geselecteerd.
