GPT-5.6 Luna price down 80%, Terra down 20% →

GPT-Transcribe vs GPT-Live-Transcribe : API & tarification

CometAPI
Mia MarenJul 31, 2026
GPT-Transcribe vs GPT-Live-Transcribe : API & tarification

GPT-Transcribe vs GPT-Live-Transcribe : tarification, différences d’API et migration

TL;DR

Utilisez gpt-transcribe pour des enregistrements terminés à $0.0045 par minute audio et gpt-live-transcribe pour les microphones, appels ou flux multimédias en direct à $0.017 par minute. OpenAI rapporte un taux d’erreur de transcription plus faible pour le modèle live que pour GPT-Realtime-Whisper sur ses benchmarks publiés, mais le bon choix dépend du moment où le texte doit apparaître, des champs de sortie dont vous avez besoin et de la performance des deux modèles sur votre audio de production.

GPT-Transcribe vs GPT-Live-Transcribe en un coup d’œil

Si vous n’avez besoin de la transcription qu’après l’enregistrement de l’audio, utilisez gpt-transcribe. Si votre application a besoin de texte pendant que l’audio arrive encore, utilisez gpt-live-transcribe. La plus grande différence n’est pas seulement le prix, mais le moment où la transcription commence et le type de workflow API que votre application doit supporter.

Élémentgpt-transcribegpt-live-transcribe
Idéal pourEnregistrements téléversés, requêtes audio bornées, tâches asynchrones et tours Realtime validésMicrophones, appels, réunions et flux multimédias en direct
Prix publié$0.0045 par minute audio$0.017 par minute audio
Prix par heure audio$0.27$1.02
API / points de terminaison/v1/audio/transcriptions ; workflow Realtime à tours validés en optionSessions de transcription Realtime (v1/realtime/transcription_sessions ou similaire)
ConnexionTéléversement de fichier ; réponse diffusée en option pendant le traitement du fichierWebSocket pour les pipelines serveur ou WebRTC pour l’audio navigateur
Début de la transcriptionAprès soumission du fichier ou validation d’un tour audioPendant l’arrivée de l’audio
Sortie partielle de transcriptionOui, avec diffusion du fichier ou diffusion en mode tours validésOui, au fur et à mesure de la parole
Contrôles de contexteprompt, keywords, languagesprompt, keywords, languages, delay
Sortie de langue détectéeOui, lorsque le modèle peut faire une prédiction fiableNon
Limitations importantesLimite de téléversement de 25 MB ; d’autres routes sont nécessaires pour les horodatages, la diarisation ou la traductionPas d’horodatages au niveau des mots, d’étiquettes de locuteur ni de scores de confiance

Bien que gpt-transcribe puisse renvoyer des mises à jour partielles de transcription pendant le traitement d’un fichier terminé ou d’un tour audio validé, ce n’est pas une route de diffusion continue en direct. Pour des sous-titres en direct, des appels ou une entrée microphone, gpt-live-transcribe est le meilleur choix.

Pour une comparaison plus large entre fournisseurs, voir l’article de CometAPI Les 6 meilleures API de reconnaissance vocale en 2026.

Qu’est-ce que GPT-Transcribe et GPT-Live-Transcribe ?

OpenAI a introduit gpt-transcribe et gpt-live-transcribe le 29 juillet 2026. gpt-transcribe traite les enregistrements terminés, les transcriptions de fichiers diffusés et les tours Realtime validés, tandis que gpt-live-transcribe renvoie des mises à jour de transcription à faible latence à mesure que l’audio arrive via des microphones, des appels ou des flux multimédias en direct.

Les deux modèles fournissent de nouvelles routes par défaut pour la transcription générale de fichiers et en direct, mais des workflows spécialisés Whisper et GPT-4o restent nécessaires pour les horodatages, la traduction, les sous-titres et la diarisation des locuteurs.

Quand GPT-Live-Transcribe vaut-il le surcoût ?

La page de tarification de l’API d’OpenAI liste gpt-transcribe à $0.0045 par minute et gpt-live-transcribe à $0.017 par minute. La route live coûte donc environ 3,8 fois plus par minute audio.

Volume audio mensuelgpt-transcribegpt-live-transcribeSurcoût du live
100 heures$27$102$75
1,000 heures$270$1,020$750
10,000 heures$2,700$10,200$7,500

Ces estimations de coûts de transcription utilisent uniquement les tarifs de base publiés par OpenAI : heures audio × 60 × prix par minute. Elles excluent le stockage, le transport réseau, les réessais, l’hébergement d’applications, le post-traitement, la correction humaine et les coûts de fournisseur de secours.

Choisissez gpt-live-transcribe lorsque des sous-titres immédiats, l’assistance d’agent, la modération ou l’interaction en temps réel font partie des exigences produit. Choisissez gpt-transcribe lorsque la transcription n’est nécessaire qu’après la fin d’une réunion, d’un appel, d’un entretien ou d’un téléchargement média. Une architecture à deux routes peut utiliser la transcription live pour l’UX et la transcription de fichier pour le post-appel ou les backfills.

OpenAI affiche actuellement GPT-Realtime-Whisper et gpt-live-transcribe au même tarif de base de $0.017 par minute. Évaluez une migration entre ces routes live sur la qualité des transcriptions acceptées, la latence, la gestion des événements et la compatibilité opérationnelle, plutôt que sur le prix catalogue seul.

En quoi les API GPT-Transcribe et GPT-Live-Transcribe diffèrent-elles ?

La principale différence tient à la manière dont l’audio entre dans le système et au moment où les événements de transcription commencent. gpt-transcribe accepte des fichiers terminés ou des tours audio validés, tandis que gpt-live-transcribe maintient une connexion Realtime et émet des mises à jour de transcription pendant que l’audio arrive encore.

Utilisez GPT-Transcribe pour l’audio terminé

Pour un enregistrement terminé, envoyez le fichier à /v1/audio/transcriptions. Le guide de transcription de fichiers d’OpenAI accepte des fichiers jusqu’à 25 MB aux formats mp3, mp4, mpeg, mpga, m4a, wav ou webm.

from openai import OpenAI

client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
    transcript = client.audio.transcriptions.create(
        model="gpt-transcribe",
        file=audio_file,
        prompt="A support call about a premium plan and account AC-42.",
        extra_body={
            "keywords": ["premium plan", "AC-42", "billing"],
            "languages": ["en"],
        },
    )
print(transcript.text)

Définissez stream=True pour recevoir des événements delta de transcription pendant qu’OpenAI traite l’enregistrement téléversé. Cela réduit l’attente avant l’apparition de texte, mais cela ne transforme pas le point de terminaison fichier en ingestion microphone live.

Utilisez GPT-Live-Transcribe pour l’audio entrant

Créez une session Realtime avec type: "transcription" et sélectionnez gpt-live-transcribe. Utilisez WebSocket pour un pipeline média côté serveur ou WebRTC pour l’audio navigateur.

{
  "type": "session.update",
  "session": {
    "type": "transcription",
    "audio": {
      "input": {
        "format": {
          "type": "audio/pcm",
          "rate": 24000
        },
        "transcription": {
          "model": "gpt-live-transcribe",
          "prompt": "A support call about a premium plan and account AC-42.",
          "keywords": ["premium plan", "AC-42", "billing"],
          "languages": ["en"],
          "delay": "low"
        },
        "turn_detection": null
      }
    }
  }
}

Ajoutez des segments audio avec input_audio_buffer.append. L’application peut valider des tours avec input_audio_buffer.commit ou configurer une détection d’activité vocale côté serveur.

Le guide de transcription Realtime renvoie du texte incrémental via conversation.item.input_audio_transcription.delta, suivi de conversation.item.input_audio_transcription.completed pour l’item validé. Les événements d’achèvement de différents tours ne sont pas garantis d’arriver dans l’ordre ; réconciliez-les avec item_id plutôt que l’ordre d’arrivée.

Utilisez la route à tours validés lorsque le texte immédiat n’est pas nécessaire

gpt-transcribe peut également fonctionner dans une session de transcription Realtime via WebSocket. La transcription commence après la validation d’un tour audio, le modèle peut utiliser les tours transcrits précédents comme contexte, et l’événement d’achèvement peut inclure les langues détectées.

Cette route à tours validés est utile lorsque la diffusion par tours ou la détection de langue compte plus que l’affichage de texte pendant que l’orateur parle encore. Elle ne doit pas être confondue avec le comportement continu et à plus faible latence de gpt-live-transcribe.

Comment les prompts, keywords, languages et delay influencent-ils la transcription ?

Les deux modèles acceptent un contexte qui peut améliorer la reconnaissance de noms, chiffres, acronymes, termes produits, parole accentuée, audio multilingue et code-switching.

ContrôleObjectifAttention en production
promptDécrire l’enregistrement, l’orateur, le domaine ou le sujet attenduUn contexte trop spécifique peut biaiser la transcription
keywordsFournir des noms littéraux, acronymes, formats de compte ou termes techniquesLes indices ne sont pas une sortie requise ; tester l’insertion de termes non prononcés
languagesLister une ou plusieurs langues d’entrée attenduesCodes non pris en charge ou mal formatés entraînent un rejet
delayÉchanger des deltas plus précoces contre davantage de contexte acoustiqueDisponible pour gpt-live-transcribe ; mesurer plutôt que supposer des millisecondes fixes

Pour les nouveaux modèles, languages remplace l’ancien champ singulier language. Ne pas envoyer les deux. Chaque mot-clé doit tenir sur une seule ligne et ne peut pas contenir <, >, retours chariot ou sauts de ligne ; des valeurs invalides entraînent le rejet de la requête ou de la mise à jour de session.

gpt-live-transcribe prend en charge les niveaux de delay minimal, low, medium, high et xhigh. Des réglages plus bas favorisent un texte partiel plus précoce, tandis que des réglages plus élevés fournissent plus de contexte audio et peuvent améliorer la qualité de transcription. OpenAI ne promet pas une latence fixe pour chaque niveau ; mesurez le temps jusqu’au premier delta et le temps jusqu’à la transcription finale sur des microphones, codecs, réseaux, langues et durées de session représentatifs.

Que montrent les benchmarks de précision d’OpenAI ?

L’annonce de lancement d’OpenAI indique que gpt-live-transcribe a surpassé GPT-Realtime-Whisper-1 sur deux tests de transcription multilingue. Elle indique également que le contexte libre a amélioré la précision sémantique sur une évaluation Context Aware ASR.

Évaluation OpenAIRésultat gpt-live-transcribeComparaisonChangement rapporté
Précision sémantique Context Aware ASR44.6% avec contexte libre38.5% sans contexte+6.1 points de pourcentage
Common Voice, 22 langues, taux d’erreur de transcription19.70%20.33% pour GPT-Realtime-Whisper-1-0.63 point ; environ 3.1% relatif
Real-World Audio Recording, 9 langues, taux d’erreur9.60%11.65% pour GPT-Realtime-Whisper-1-2.05 points ; environ 17.6% relatif

La conclusion défendable est étroite : le nouveau modèle live a mieux performé sur les tests rapportés par OpenAI, et le contexte a amélioré le score de précision sémantique rapporté. Ces résultats rapportés par le fournisseur ne garantissent pas la même amélioration pour chaque langue, codec téléphonique, microphone, réglage de delay, vocabulaire de domaine ou politique de correction.

Quand faut-il utiliser Whisper ou GPT-4o Transcribe à la place ?

Aucun des nouveaux modèles ne remplace tous les workflows de reconnaissance vocale.

ExigenceRoute recommandée
Transcription générale de fichiers terminésgpt-transcribe
Sous-titres live à faible latence ou transcription d’appelsgpt-live-transcribe
Étiquettes de locuteurs pour enregistrements terminésgpt-4o-transcribe-diarize avec diarized_json
Horodatages de mots ou de segmentswhisper-1 avec timestamp_granularities[]
Traduction d’audio non anglais terminé vers l’anglais/v1/audio/translations avec whisper-1

Pour la diarisation, OpenAI exige l’API de transcription de fichiers ; l’étiquetage des locuteurs n’est pas pris en charge dans les sessions de transcription Realtime. Pour les enregistrements de plus de 30 secondes, configurez chunking_strategy sur "auto" ou utilisez une configuration de détection d’activité vocale.

Pour les horodatages, sous-titres, traduction ou les workflows Whisper existants, voir le guide de l’API Whisper de CometAPI et la page du modèle Whisper-1. Les équipes évaluant une autre route de transcription de fichiers OpenAI peuvent également consulter la page du modèle GPT-4o Transcribe.

Comment migrer depuis Whisper ?

Changer l’ID du modèle n’est que la première étape. Validez le workflow complet avant de basculer le trafic de production.

VérificationAction requiseRisque si omise
Sélection de routeSéparer les enregistrements terminés des charges réellement livePayer le tarif live pour des tâches asynchrones
Champs de langueRemplacer language par languages pour les nouveaux modèles ; ne jamais envoyer les deuxRequêtes ou sessions rejetées
Indices de contexteTester prompts et keywords sur noms, chiffres, jargon et parole bruitéeTermes biaisés ou insérés
Réglage du delayÉvaluer au moins low, medium et high sur de l’audio représentatifChoisir vitesse ou précision sans données
Gestion des événementsRéconcilier deltas et événements completed avec item_idTranscriptions hors ordre ou écrasées
Parité fonctionnelleInventorier dépendances diarisation, horodatages, confiance, sous-titres et traductionChamps aval manquants
Télémétrie de coûtJournaliser minutes audio, réessais, résultats échoués, temps de correction et sorties acceptéesConfusion entre prix catalogue et coût workflow
DéploiementTest en shadow, canary sur une petite part de trafic et garder un fallbackRégression large sans retour arrière rapide

Pour une migration depuis GPT-Realtime-Whisper, conservez constants le format audio, la politique de détection des tours, le jeu de test et la cible de latence. Comme le prix live publié est inchangé, priorisez le taux de transcription acceptée, la distribution de latence, la stabilité de sortie et la compatibilité avec le reste du pipeline.

Guide de migration (depuis Whisper / modèles antérieurs)

OpenAI propose un cookbook officiel : Migrer de Whisper vers GPT-Transcribe et GPT-Live-Transcribe.

Règles de haut niveau :

  1. Audio enregistré / batch → passer à gpt-transcribe sur le point de terminaison /v1/audio/transcriptions existant.
  2. Audio live continu → passer à gpt-live-transcribe dans une session de transcription Realtime.
  3. Meilleure précision après un tour validé → utiliser gpt-transcribe dans une session Realtime.

Exemple minimal de migration de fichier (Python) :

Python

# Before (Whisper)with open("meeting.wav", "rb") as audio:    result = client.audio.transcriptions.create(        model="whisper-1",        file=audio,        language="en",        prompt="Support call about AC-42"    )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio:    result = client.audio.transcriptions.create(        model="gpt-transcribe",        file=audio,        prompt="A customer support call about billing",        extra_body={            "keywords": ["AC-42", "Premium Plus"],            "languages": ["en", "fr"]        },        response_format="json"  # or stream=True for deltas    )

Notes pour la migration live :

  • Conserver la même architecture de session Realtime / WebSocket.
  • Changer l’ID du modèle et remplacer le champ singulier language par le tableau languages.
  • Ajouter un prompt, des keywords et un delay optionnels (par ex. "low").
  • Continuer à gérer les mêmes événements delta/completed.
  • Ne pas envoyer à la fois language et languages.

Caveats importants lors de la migration :

  • GPT-Transcribe/GPT-Live-Transcribe ne prennent pas en charge les horodatages au niveau des mots, SRT/VTT ou la traduction vers l’anglais de la même manière que whisper-1. Conservez Whisper pour ces besoins spécifiques.
  • Les formats de réponse diffèrent — ne supposez pas que text, verbose_json, srt ou vtt fonctionnent à l’identique.
  • Les keywords doivent être des littéraux sur une seule ligne (pas de <, >, CR ou LF) sinon la requête est rejetée.
  • Tester sur de l’audio de production représentatif (accents, bruit, termes de domaine, énoncés courts) plutôt que de se fier aux seuls WER publiés.

Recommandation rapide

  • Par défaut pour les nouveaux travaux : GPT-Transcribe pour les fichiers/batch, GPT-Live-Transcribe pour le streaming live.
  • Les intégrations existantes Whisper ou GPT-4o-Transcribe continuent de fonctionner mais ne sont plus le point de départ recommandé.
  • Les tâches batch sensibles aux coûts bénéficient le plus du passage à GPT-Transcribe ($0.0045 vs $0.006).

Pour les dernières informations, consultez les pages officielles des modèles et le guide d’aperçu de la transcription sur le site développeur d’OpenAI.

Comment évaluer les deux modèles sur de l’audio de production ?

Utilisez de l’audio sous licence qui représente le produit plutôt que de simples extraits de démonstration propres.

  1. Sélectionner au moins 50 enregistrements couvrant les principaux cas d’usage, langues, appareils et conditions audio.
  2. Inclure accents, interruptions, bruit de fond, code-switching, nombres, dates, monnaie, adresses e‑mail et vocabulaire de domaine.
  3. Traiter les enregistrements terminés via gpt-transcribe avec et sans indices de contexte.
  4. Rejouer les mêmes échantillons live via gpt-live-transcribe à trois réglages de delay.
  5. Garder constants les formats, bornes de tours, prompts et règles de scoring entre les runs.
  6. Mesurer l’erreur de transcription, le rappel des termes de domaine, les révisions de texte partiel, la latence p50 et p95, les échecs, les réessais et le temps de correction humaine.
  7. Calculer le coût par transcription acceptée, puis canary le routage sélectionné avant une migration complète.

La conception finale peut utiliser un modèle ou les deux. La métrique décisive doit être le coût et la fiabilité d’une transcription de production acceptée, et non le prix publié par minute pris isolément.

FAQ

Quel modèle dois-je utiliser : GPT-Transcribe ou GPT-Live-Transcribe ?

Utilisez gpt-transcribe pour les enregistrements terminés et les tâches asynchrones. Utilisez gpt-live-transcribe lorsque le texte doit arriver pendant que l’audio est encore en cours de diffusion.

Combien coûtent GPT-Transcribe et GPT-Live-Transcribe ?

OpenAI liste gpt-transcribe à $0.0045 par minute audio ($0.27 par heure) et gpt-live-transcribe à $0.017 par minute ($1.02 par heure).

GPT-Live-Transcribe est-il plus précis que GPT-Realtime-Whisper ?

Sur le benchmark Real-World Audio Recording à neuf langues d’OpenAI, le taux d’erreur de transcription rapporté est passé de 11.65% à 9.60%. Vérifiez ce résultat spécifique au benchmark sur votre propre audio.

GPT-Live-Transcribe prend-il en charge la diarisation ou les horodatages de mots ?

Non. Il ne renvoie pas d’étiquettes de locuteur, d’horodatages au niveau des mots ni de scores de confiance. Utilisez un modèle de fichier compatible ou une étape de secours lorsque ces champs sont requis.

La migration depuis GPT-Realtime-Whisper est-elle un simple remplacement de modèle ?

Non. Vérifiez la configuration de session, les champs de langue, les entrées de contexte, les réglages de delay, l’ordre des événements, les dépendances fonctionnelles, la latence et la qualité de sortie avant de passer le trafic de production.

Tester les routes de transcription avec CometAPI

Avant l’implémentation, vérifiez la disponibilité actuelle des modèles et la tarification des routes sur la page de tarification CometAPI et utilisez la documentation CometAPI pour des schémas de requêtes compatibles OpenAI. Fixez des IDs de modèle exacts dans les tests et journalisez la durée audio, le niveau de delay, la latence du premier delta, la latence de la transcription finale, les réessais et le taux de transcriptions acceptées afin que la décision de routage reflète le coût total du workflow.

44 vues
Revu pour la clarté, l'attribution des sources et la terminologie API actuelle.

Prêt à réduire vos coûts de développement IA de 20 % ?

Démarrez gratuitement en quelques minutes. Crédits d'essai offerts. Aucune carte bancaire requise.

En savoir plus