FLUX 3 and Gemini 3.7 Flash are now live on CometAPI →
Recherche de performance transparente

Benchmark de latence d'API d'IA : TTFT, débit et fiabilité

Une méthodologie transparente pour mesurer la latence d'une API d'IA sans confondre le temps jusqu'au premier token, la vitesse de génération et le temps de réponse total.

Instrument de benchmark d'API d'IA mesurant les signaux de latence et de débit
CA
Recherche CometAPI
Ingénierie des modèles IA et API
6 août 2026 8 min de lecture

Points clés à retenir

TTFT mesure la réactivité ; les tokens par seconde mesurent la vitesse de génération.
Utilisez la même version du modèle, la même invite, la même cible de sortie et le même mode de streaming pour chaque route.
Publiez les valeurs médiane et p95 au lieu d'une seule requête la plus rapide.
Publiez les erreurs, les timeouts, la région et la fenêtre de test avec les chiffres de performance.

Mesurez quatre signaux de latence différents

Un seul chiffre de latence masque l'endroit où les utilisateurs attendent. Le chat en streaming peut sembler rapide avec un TTFT faible même lorsque la complétion totale prend plus de temps, tandis que l'extraction par lot peut ne se soucier que de la durée de bout en bout.

  • Temps jusqu'au premier token : du démarrage de la requête au premier token diffusé.
  • Débit de génération : tokens de sortie divisés par le temps de génération.
  • Durée de bout en bout : du démarrage de la requête à la réponse terminée.
  • Fiabilité : réponses réussies divisées par le nombre total de tentatives.

Contrôlez la charge de travail du benchmark

Utilisez un ensemble d'invites fixe qui représente la charge de travail visée. Enregistrez l'ID du modèle, la route du fournisseur, la région, les paramètres de requête, les tokens d'entrée et la longueur de sortie demandée.

  • Exécutez des requêtes de préchauffage avant d'enregistrer les mesures.
  • Randomisez l'ordre des fournisseurs pour réduire le biais lié à l'heure de la journée.
  • Répétez les tests sur plus d'une fenêtre de trafic.
  • Conservez les résultats de streaming et de non-streaming séparés.

Utilisez des distributions, pas une capture d'écran de classement

Publiez la médiane, le p90 et le p95 avec la taille d'échantillon. Une route avec la médiane la plus rapide mais des retards extrêmes fréquents peut offrir une expérience de production pire qu'une route légèrement plus lente mais plus stable.

{
  "sample_size": 100,
  "ttft_ms": { "median": 640, "p95": 1840 },
  "output_tokens_per_second": { "median": 42.1 },
  "end_to_end_ms": { "median": 5120, "p95": 9080 },
  "success_rate": 0.98
}

Les valeurs ci-dessus constituent un format de rapport illustratif, et non un résultat de benchmark CometAPI en direct.

Publiez la méthodologie avec chaque rapport

Un benchmark n'est utile que si le lecteur peut comprendre ce qui a été mesuré et reproduire l'approche. Incluez les limites et expliquez si la route du fournisseur était épinglée ou sélectionnée automatiquement.

Foire aux questions

Qu'est-ce que le TTFT dans une API d'IA ?

Le temps jusqu'au premier token est la durée entre l'envoi de la requête et la réception du premier token généré par une réponse en streaming.

L'API d'IA la plus rapide est-elle toujours la meilleure route ?

Non. La sélection en production doit aussi tenir compte du taux d'erreur, de la latence p95, de la qualité de sortie, du prix et du fait que la route prenne en charge ou non les fonctionnalités requises.

Continuer avec Benchmarks et rapports
Retournez à la vue d'ensemble de la section et aux futurs articles.
Voir la section