GPT-Transcribe vs GPT-Live-Transcribe : tarification, différences d’API et migration
TL;DR
Utilisez gpt-transcribe pour des enregistrements terminés à $0.0045 par minute audio et gpt-live-transcribe pour les microphones, appels ou flux multimédias en direct à $0.017 par minute. OpenAI rapporte un taux d’erreur de transcription plus faible pour le modèle live que pour GPT-Realtime-Whisper sur ses benchmarks publiés, mais le bon choix dépend du moment où le texte doit apparaître, des champs de sortie dont vous avez besoin et de la performance des deux modèles sur votre audio de production.
GPT-Transcribe vs GPT-Live-Transcribe en un coup d’œil
Si vous n’avez besoin de la transcription qu’après l’enregistrement de l’audio, utilisez gpt-transcribe. Si votre application a besoin de texte pendant que l’audio arrive encore, utilisez gpt-live-transcribe. La plus grande différence n’est pas seulement le prix, mais le moment où la transcription commence et le type de workflow API que votre application doit supporter.
| Élément | gpt-transcribe | gpt-live-transcribe |
|---|---|---|
| Idéal pour | Enregistrements téléversés, requêtes audio bornées, tâches asynchrones et tours Realtime validés | Microphones, appels, réunions et flux multimédias en direct |
| Prix publié | $0.0045 par minute audio | $0.017 par minute audio |
| Prix par heure audio | $0.27 | $1.02 |
| API / points de terminaison | /v1/audio/transcriptions ; workflow Realtime à tours validés en option | Sessions de transcription Realtime (v1/realtime/transcription_sessions ou similaire) |
| Connexion | Téléversement de fichier ; réponse diffusée en option pendant le traitement du fichier | WebSocket pour les pipelines serveur ou WebRTC pour l’audio navigateur |
| Début de la transcription | Après soumission du fichier ou validation d’un tour audio | Pendant l’arrivée de l’audio |
| Sortie partielle de transcription | Oui, avec diffusion du fichier ou diffusion en mode tours validés | Oui, au fur et à mesure de la parole |
| Contrôles de contexte | prompt, keywords, languages | prompt, keywords, languages, delay |
| Sortie de langue détectée | Oui, lorsque le modèle peut faire une prédiction fiable | Non |
| Limitations importantes | Limite de téléversement de 25 MB ; d’autres routes sont nécessaires pour les horodatages, la diarisation ou la traduction | Pas d’horodatages au niveau des mots, d’étiquettes de locuteur ni de scores de confiance |
Bien que gpt-transcribe puisse renvoyer des mises à jour partielles de transcription pendant le traitement d’un fichier terminé ou d’un tour audio validé, ce n’est pas une route de diffusion continue en direct. Pour des sous-titres en direct, des appels ou une entrée microphone, gpt-live-transcribe est le meilleur choix.
Pour une comparaison plus large entre fournisseurs, voir l’article de CometAPI Les 6 meilleures API de reconnaissance vocale en 2026.
Qu’est-ce que GPT-Transcribe et GPT-Live-Transcribe ?
OpenAI a introduit gpt-transcribe et gpt-live-transcribe le 29 juillet 2026. gpt-transcribe traite les enregistrements terminés, les transcriptions de fichiers diffusés et les tours Realtime validés, tandis que gpt-live-transcribe renvoie des mises à jour de transcription à faible latence à mesure que l’audio arrive via des microphones, des appels ou des flux multimédias en direct.
Les deux modèles fournissent de nouvelles routes par défaut pour la transcription générale de fichiers et en direct, mais des workflows spécialisés Whisper et GPT-4o restent nécessaires pour les horodatages, la traduction, les sous-titres et la diarisation des locuteurs.
Quand GPT-Live-Transcribe vaut-il le surcoût ?
La page de tarification de l’API d’OpenAI liste gpt-transcribe à $0.0045 par minute et gpt-live-transcribe à $0.017 par minute. La route live coûte donc environ 3,8 fois plus par minute audio.
| Volume audio mensuel | gpt-transcribe | gpt-live-transcribe | Surcoût du live |
|---|---|---|---|
| 100 heures | $27 | $102 | $75 |
| 1,000 heures | $270 | $1,020 | $750 |
| 10,000 heures | $2,700 | $10,200 | $7,500 |
Ces estimations de coûts de transcription utilisent uniquement les tarifs de base publiés par OpenAI : heures audio × 60 × prix par minute. Elles excluent le stockage, le transport réseau, les réessais, l’hébergement d’applications, le post-traitement, la correction humaine et les coûts de fournisseur de secours.
Choisissez gpt-live-transcribe lorsque des sous-titres immédiats, l’assistance d’agent, la modération ou l’interaction en temps réel font partie des exigences produit. Choisissez gpt-transcribe lorsque la transcription n’est nécessaire qu’après la fin d’une réunion, d’un appel, d’un entretien ou d’un téléchargement média. Une architecture à deux routes peut utiliser la transcription live pour l’UX et la transcription de fichier pour le post-appel ou les backfills.
OpenAI affiche actuellement GPT-Realtime-Whisper et gpt-live-transcribe au même tarif de base de $0.017 par minute. Évaluez une migration entre ces routes live sur la qualité des transcriptions acceptées, la latence, la gestion des événements et la compatibilité opérationnelle, plutôt que sur le prix catalogue seul.
En quoi les API GPT-Transcribe et GPT-Live-Transcribe diffèrent-elles ?
La principale différence tient à la manière dont l’audio entre dans le système et au moment où les événements de transcription commencent. gpt-transcribe accepte des fichiers terminés ou des tours audio validés, tandis que gpt-live-transcribe maintient une connexion Realtime et émet des mises à jour de transcription pendant que l’audio arrive encore.
Utilisez GPT-Transcribe pour l’audio terminé
Pour un enregistrement terminé, envoyez le fichier à /v1/audio/transcriptions. Le guide de transcription de fichiers d’OpenAI accepte des fichiers jusqu’à 25 MB aux formats mp3, mp4, mpeg, mpga, m4a, wav ou webm.
from openai import OpenAI
client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="gpt-transcribe",
file=audio_file,
prompt="A support call about a premium plan and account AC-42.",
extra_body={
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
},
)
print(transcript.text)
Définissez stream=True pour recevoir des événements delta de transcription pendant qu’OpenAI traite l’enregistrement téléversé. Cela réduit l’attente avant l’apparition de texte, mais cela ne transforme pas le point de terminaison fichier en ingestion microphone live.
Utilisez GPT-Live-Transcribe pour l’audio entrant
Créez une session Realtime avec type: "transcription" et sélectionnez gpt-live-transcribe. Utilisez WebSocket pour un pipeline média côté serveur ou WebRTC pour l’audio navigateur.
{
"type": "session.update",
"session": {
"type": "transcription",
"audio": {
"input": {
"format": {
"type": "audio/pcm",
"rate": 24000
},
"transcription": {
"model": "gpt-live-transcribe",
"prompt": "A support call about a premium plan and account AC-42.",
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
"delay": "low"
},
"turn_detection": null
}
}
}
}
Ajoutez des segments audio avec input_audio_buffer.append. L’application peut valider des tours avec input_audio_buffer.commit ou configurer une détection d’activité vocale côté serveur.
Le guide de transcription Realtime renvoie du texte incrémental via conversation.item.input_audio_transcription.delta, suivi de conversation.item.input_audio_transcription.completed pour l’item validé. Les événements d’achèvement de différents tours ne sont pas garantis d’arriver dans l’ordre ; réconciliez-les avec item_id plutôt que l’ordre d’arrivée.
Utilisez la route à tours validés lorsque le texte immédiat n’est pas nécessaire
gpt-transcribe peut également fonctionner dans une session de transcription Realtime via WebSocket. La transcription commence après la validation d’un tour audio, le modèle peut utiliser les tours transcrits précédents comme contexte, et l’événement d’achèvement peut inclure les langues détectées.
Cette route à tours validés est utile lorsque la diffusion par tours ou la détection de langue compte plus que l’affichage de texte pendant que l’orateur parle encore. Elle ne doit pas être confondue avec le comportement continu et à plus faible latence de gpt-live-transcribe.
Comment les prompts, keywords, languages et delay influencent-ils la transcription ?
Les deux modèles acceptent un contexte qui peut améliorer la reconnaissance de noms, chiffres, acronymes, termes produits, parole accentuée, audio multilingue et code-switching.
| Contrôle | Objectif | Attention en production |
|---|---|---|
| prompt | Décrire l’enregistrement, l’orateur, le domaine ou le sujet attendu | Un contexte trop spécifique peut biaiser la transcription |
| keywords | Fournir des noms littéraux, acronymes, formats de compte ou termes techniques | Les indices ne sont pas une sortie requise ; tester l’insertion de termes non prononcés |
| languages | Lister une ou plusieurs langues d’entrée attendues | Codes non pris en charge ou mal formatés entraînent un rejet |
| delay | Échanger des deltas plus précoces contre davantage de contexte acoustique | Disponible pour gpt-live-transcribe ; mesurer plutôt que supposer des millisecondes fixes |
Pour les nouveaux modèles, languages remplace l’ancien champ singulier language. Ne pas envoyer les deux. Chaque mot-clé doit tenir sur une seule ligne et ne peut pas contenir <, >, retours chariot ou sauts de ligne ; des valeurs invalides entraînent le rejet de la requête ou de la mise à jour de session.
gpt-live-transcribe prend en charge les niveaux de delay minimal, low, medium, high et xhigh. Des réglages plus bas favorisent un texte partiel plus précoce, tandis que des réglages plus élevés fournissent plus de contexte audio et peuvent améliorer la qualité de transcription. OpenAI ne promet pas une latence fixe pour chaque niveau ; mesurez le temps jusqu’au premier delta et le temps jusqu’à la transcription finale sur des microphones, codecs, réseaux, langues et durées de session représentatifs.
Que montrent les benchmarks de précision d’OpenAI ?
L’annonce de lancement d’OpenAI indique que gpt-live-transcribe a surpassé GPT-Realtime-Whisper-1 sur deux tests de transcription multilingue. Elle indique également que le contexte libre a amélioré la précision sémantique sur une évaluation Context Aware ASR.
| Évaluation OpenAI | Résultat gpt-live-transcribe | Comparaison | Changement rapporté |
|---|---|---|---|
| Précision sémantique Context Aware ASR | 44.6% avec contexte libre | 38.5% sans contexte | +6.1 points de pourcentage |
| Common Voice, 22 langues, taux d’erreur de transcription | 19.70% | 20.33% pour GPT-Realtime-Whisper-1 | -0.63 point ; environ 3.1% relatif |
| Real-World Audio Recording, 9 langues, taux d’erreur | 9.60% | 11.65% pour GPT-Realtime-Whisper-1 | -2.05 points ; environ 17.6% relatif |
La conclusion défendable est étroite : le nouveau modèle live a mieux performé sur les tests rapportés par OpenAI, et le contexte a amélioré le score de précision sémantique rapporté. Ces résultats rapportés par le fournisseur ne garantissent pas la même amélioration pour chaque langue, codec téléphonique, microphone, réglage de delay, vocabulaire de domaine ou politique de correction.
Quand faut-il utiliser Whisper ou GPT-4o Transcribe à la place ?
Aucun des nouveaux modèles ne remplace tous les workflows de reconnaissance vocale.
| Exigence | Route recommandée |
|---|---|
| Transcription générale de fichiers terminés | gpt-transcribe |
| Sous-titres live à faible latence ou transcription d’appels | gpt-live-transcribe |
| Étiquettes de locuteurs pour enregistrements terminés | gpt-4o-transcribe-diarize avec diarized_json |
| Horodatages de mots ou de segments | whisper-1 avec timestamp_granularities[] |
| Traduction d’audio non anglais terminé vers l’anglais | /v1/audio/translations avec whisper-1 |
Pour la diarisation, OpenAI exige l’API de transcription de fichiers ; l’étiquetage des locuteurs n’est pas pris en charge dans les sessions de transcription Realtime. Pour les enregistrements de plus de 30 secondes, configurez chunking_strategy sur "auto" ou utilisez une configuration de détection d’activité vocale.
Pour les horodatages, sous-titres, traduction ou les workflows Whisper existants, voir le guide de l’API Whisper de CometAPI et la page du modèle Whisper-1. Les équipes évaluant une autre route de transcription de fichiers OpenAI peuvent également consulter la page du modèle GPT-4o Transcribe.
Comment migrer depuis Whisper ?
Changer l’ID du modèle n’est que la première étape. Validez le workflow complet avant de basculer le trafic de production.
| Vérification | Action requise | Risque si omise |
|---|---|---|
| Sélection de route | Séparer les enregistrements terminés des charges réellement live | Payer le tarif live pour des tâches asynchrones |
| Champs de langue | Remplacer language par languages pour les nouveaux modèles ; ne jamais envoyer les deux | Requêtes ou sessions rejetées |
| Indices de contexte | Tester prompts et keywords sur noms, chiffres, jargon et parole bruitée | Termes biaisés ou insérés |
| Réglage du delay | Évaluer au moins low, medium et high sur de l’audio représentatif | Choisir vitesse ou précision sans données |
| Gestion des événements | Réconcilier deltas et événements completed avec item_id | Transcriptions hors ordre ou écrasées |
| Parité fonctionnelle | Inventorier dépendances diarisation, horodatages, confiance, sous-titres et traduction | Champs aval manquants |
| Télémétrie de coût | Journaliser minutes audio, réessais, résultats échoués, temps de correction et sorties acceptées | Confusion entre prix catalogue et coût workflow |
| Déploiement | Test en shadow, canary sur une petite part de trafic et garder un fallback | Régression large sans retour arrière rapide |
Pour une migration depuis GPT-Realtime-Whisper, conservez constants le format audio, la politique de détection des tours, le jeu de test et la cible de latence. Comme le prix live publié est inchangé, priorisez le taux de transcription acceptée, la distribution de latence, la stabilité de sortie et la compatibilité avec le reste du pipeline.
Guide de migration (depuis Whisper / modèles antérieurs)
OpenAI propose un cookbook officiel : Migrer de Whisper vers GPT-Transcribe et GPT-Live-Transcribe.
Règles de haut niveau :
- Audio enregistré / batch → passer à gpt-transcribe sur le point de terminaison /v1/audio/transcriptions existant.
- Audio live continu → passer à gpt-live-transcribe dans une session de transcription Realtime.
- Meilleure précision après un tour validé → utiliser gpt-transcribe dans une session Realtime.
Exemple minimal de migration de fichier (Python) :
Python
# Before (Whisper)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="whisper-1", file=audio, language="en", prompt="Support call about AC-42" )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="gpt-transcribe", file=audio, prompt="A customer support call about billing", extra_body={ "keywords": ["AC-42", "Premium Plus"], "languages": ["en", "fr"] }, response_format="json" # or stream=True for deltas )
Notes pour la migration live :
- Conserver la même architecture de session Realtime / WebSocket.
- Changer l’ID du modèle et remplacer le champ singulier language par le tableau languages.
- Ajouter un prompt, des keywords et un delay optionnels (par ex. "low").
- Continuer à gérer les mêmes événements delta/completed.
- Ne pas envoyer à la fois language et languages.
Caveats importants lors de la migration :
- GPT-Transcribe/GPT-Live-Transcribe ne prennent pas en charge les horodatages au niveau des mots, SRT/VTT ou la traduction vers l’anglais de la même manière que whisper-1. Conservez Whisper pour ces besoins spécifiques.
- Les formats de réponse diffèrent — ne supposez pas que text, verbose_json, srt ou vtt fonctionnent à l’identique.
- Les keywords doivent être des littéraux sur une seule ligne (pas de <, >, CR ou LF) sinon la requête est rejetée.
- Tester sur de l’audio de production représentatif (accents, bruit, termes de domaine, énoncés courts) plutôt que de se fier aux seuls WER publiés.
Recommandation rapide
- Par défaut pour les nouveaux travaux : GPT-Transcribe pour les fichiers/batch, GPT-Live-Transcribe pour le streaming live.
- Les intégrations existantes Whisper ou GPT-4o-Transcribe continuent de fonctionner mais ne sont plus le point de départ recommandé.
- Les tâches batch sensibles aux coûts bénéficient le plus du passage à GPT-Transcribe ($0.0045 vs $0.006).
Pour les dernières informations, consultez les pages officielles des modèles et le guide d’aperçu de la transcription sur le site développeur d’OpenAI.
Comment évaluer les deux modèles sur de l’audio de production ?
Utilisez de l’audio sous licence qui représente le produit plutôt que de simples extraits de démonstration propres.
- Sélectionner au moins 50 enregistrements couvrant les principaux cas d’usage, langues, appareils et conditions audio.
- Inclure accents, interruptions, bruit de fond, code-switching, nombres, dates, monnaie, adresses e‑mail et vocabulaire de domaine.
- Traiter les enregistrements terminés via
gpt-transcribeavec et sans indices de contexte. - Rejouer les mêmes échantillons live via
gpt-live-transcribeà trois réglages de delay. - Garder constants les formats, bornes de tours, prompts et règles de scoring entre les runs.
- Mesurer l’erreur de transcription, le rappel des termes de domaine, les révisions de texte partiel, la latence p50 et p95, les échecs, les réessais et le temps de correction humaine.
- Calculer le coût par transcription acceptée, puis canary le routage sélectionné avant une migration complète.
La conception finale peut utiliser un modèle ou les deux. La métrique décisive doit être le coût et la fiabilité d’une transcription de production acceptée, et non le prix publié par minute pris isolément.
FAQ
Quel modèle dois-je utiliser : GPT-Transcribe ou GPT-Live-Transcribe ?
Utilisez gpt-transcribe pour les enregistrements terminés et les tâches asynchrones. Utilisez gpt-live-transcribe lorsque le texte doit arriver pendant que l’audio est encore en cours de diffusion.
Combien coûtent GPT-Transcribe et GPT-Live-Transcribe ?
OpenAI liste gpt-transcribe à $0.0045 par minute audio ($0.27 par heure) et gpt-live-transcribe à $0.017 par minute ($1.02 par heure).
GPT-Live-Transcribe est-il plus précis que GPT-Realtime-Whisper ?
Sur le benchmark Real-World Audio Recording à neuf langues d’OpenAI, le taux d’erreur de transcription rapporté est passé de 11.65% à 9.60%. Vérifiez ce résultat spécifique au benchmark sur votre propre audio.
GPT-Live-Transcribe prend-il en charge la diarisation ou les horodatages de mots ?
Non. Il ne renvoie pas d’étiquettes de locuteur, d’horodatages au niveau des mots ni de scores de confiance. Utilisez un modèle de fichier compatible ou une étape de secours lorsque ces champs sont requis.
La migration depuis GPT-Realtime-Whisper est-elle un simple remplacement de modèle ?
Non. Vérifiez la configuration de session, les champs de langue, les entrées de contexte, les réglages de delay, l’ordre des événements, les dépendances fonctionnelles, la latence et la qualité de sortie avant de passer le trafic de production.
Tester les routes de transcription avec CometAPI
Avant l’implémentation, vérifiez la disponibilité actuelle des modèles et la tarification des routes sur la page de tarification CometAPI et utilisez la documentation CometAPI pour des schémas de requêtes compatibles OpenAI. Fixez des IDs de modèle exacts dans les tests et journalisez la durée audio, le niveau de delay, la latence du premier delta, la latence de la transcription finale, les réessais et le taux de transcriptions acceptées afin que la décision de routage reflète le coût total du workflow.
