TL;DR
Il n’existe pas d’API de transcription de la parole universellement « meilleure ». AssemblyAI Universal-2 et Google Dynamic Batch sont d’excellents points de départ économiques pour l’audio enregistré. Deepgram, AssemblyAI et ElevenLabs méritent des tests précoces pour les sous-titres en direct et les agents vocaux. OpenAI est pratique si le reste du produit utilise déjà le SDK OpenAI, tandis qu’AWS et Google peuvent réduire les frictions opérationnelles dans une pile cloud existante.
Ne choisissez pas uniquement sur le prix par minute. Le coût en production dépend aussi de la facturation par canal, des frais de diarisation et de masquage, de la latence de finalisation p95, des réessais, des conditions d’utilisation des données et des minutes qu’un humain passe à corriger chaque transcription acceptée.
How to Choose a Speech-to-Text API: Which Provider Should You Test First?
Commencez par votre charge de travail plutôt que par un classement universel des fournisseurs. La bonne API de transcription de la parole dépend de vos besoins: transcription par lot à faible coût, streaming à faible latence, prise en charge multilingue, séparation des locuteurs, ou intégration étroite avec une pile cloud existante.
Utilisez la liste restreinte ci-dessous pour décider quels fournisseurs doivent figurer dans votre premier benchmark.
| Workload | Start with | Why | Decision-breaking test |
|---|---|---|---|
| Large recorded archive | AssemblyAI Universal-2, Google Dynamic Batch, OpenAI gpt-4o-mini-transcribe | Faibles prix publiés pour l’audio enregistré | Temps de mise en file, gestion des longs fichiers, mise en forme et minutes de correction |
| Live captions or voice agents | Deepgram Nova-3 or Flux, AssemblyAI Realtime, ElevenLabs Scribe v2 Realtime | API de streaming avec résultats partiels et workflows de détection des tours de parole | Latence des partiels stables, délai de finalisation, interruptions et reconnexions |
| Contact-center calls | AWS Transcribe, Google Cloud STT, Deepgram, AssemblyAI | Gestion des canaux, diarisation, contrôles de vocabulaire et options de masquage | Facturation par canal, chevauchements de parole, politique PII et traitement régional |
| Multilingual meetings or media | AssemblyAI Universal-3.5 Pro, ElevenLabs Scribe v2, Deepgram Nova-3 Multilingual, OpenAI transcription models | Large couverture linguistique ou prise en charge du code-switching | Vos paires de langues réelles, accents, noms, horodatages et segments en langues mixtes |
Speech-to-Text API Pricing Comparison: 2026 Snapshot
Le tableau normalise les prix publics de liste à une heure d’audio pour un premier balayage. Il n’implique pas une qualité, une latence, une couverture fonctionnelle ou des conditions commerciales égales. Les tarifs promotionnels, à basse priorité et à gros volume sont étiquetés car ils ne sont pas directement équivalents aux tarifs d’entrée ordinaires.
| Provider | Best production fit | Recorded or asynchronous price | Live or standard price | Most important caveat |
|---|---|---|---|---|
| OpenAI | Applications OpenAI existantes et téléversement simple pour la transcription | gpt-4o-mini-transcribe: $0.18/hr; gpt-4o-transcribe: $0.36/hr | gpt-realtime-whisper: $1.02/hr | Les téléversements sont limités à 25 MB. Les timestamp_granularities[] au niveau du mot ne sont documentées que pour whisper-1; la diarisation utilise un modèle séparé et n’est pas prise en charge dans l’API Realtime. |
| Deepgram | Contrôle du streaming, sous-titres en direct et pipelines d’agents vocaux | Nova-3 Monolingual pre-recorded: $0.462/hr | Nova-3 Monolingual streaming: $0.288/hr promotional | La diarisation et le masquage ajoutent chacun $0.0020/min; l’amorçage par termes-clés ajoute $0.0013/min. Les tarifs indiqués inscrivent les utilisateurs au Model Improvement Program. |
| AssemblyAI | Transcription enregistrée à faible coût et fonctionnalités clairement tarifées | Universal-2: $0.15/hr; Universal-3.5 Pro: $0.21/hr | Universal-Streaming: $0.15/hr; Universal-3.5 Pro Realtime: $0.45/hr | Les fichiers multicanaux sont facturés par canal. Les routes de streaming à $0.15/hr prennent en charge l’anglais ou six langues, pas la couverture complète de 99 langues de Universal-2. |
| Google Cloud Speech-to-Text V2 | Charges GCP natives et archives à faible priorité | Dynamic Batch: $0.18/hr | Standard recognition: $0.96/hr for the first 500,000 monthly minutes | Dynamic Batch s’exécute avec une priorité plus faible. Chaque canal audio est facturé séparément. |
| Amazon Transcribe | Audio de centres de contact AWS natif et appels à deux canaux | Region- and volume-tiered; official 2M-minute US East example: $0.36/hr | Official 2M-minute US East example: $0.60/hr | Il s’agit d’exemples à gros volume, pas de tarifs d’entrée universels. Les requêtes ont un minimum de 15 secondes; jusqu’à deux canaux sont inclus dans la facturation de la durée. |
| ElevenLabs Scribe | Médias multilingues, minutage des mots et expérimentations temps réel rapides | Scribe v2: $0.22/hr | Scribe v2 Realtime: $0.39/hr | La détection d’entités ajoute $0.07/hr et l’amorçage par termes-clés ajoute $0.05/hr. La latence du fournisseur n’inclut pas votre réseau et le chemin applicatif. |
Developer shortcut: Si votre liste restreinte inclut Whisper, GPT-4o Transcribe, ou un autre modèle de parole actuellement pris en charge par CometAPI, consultez le live model catalog and pricing et utilisez le OpenAI-compatible quickstart pour faire passer le même audio par les routes prises en charge. Confirmez l’ID exact du modèle et l’endpoint avant de construire le benchmark.
Detailed Vendor Breakdown: The 6 APIs Compared
1. OpenAI: Best for Teams Already Using the OpenAI SDK
OpenAI’s pricing page estime la transcription à $0.003 par minute pour gpt-4o-mini-transcribe et $0.006 par minute pour gpt-4o-transcribe. La route dédiée gpt-realtime-whisper est indiquée à environ $0.017 par minute.
OpenAI est un premier choix pratique pour les équipes qui utilisent déjà le SDK OpenAI pour l’authentification, la journalisation, les réessais et la gouvernance des modèles. gpt-4o-transcribe et gpt-4o-mini-transcribe prennent en charge le prompting, ce qui peut améliorer la reconnaissance des noms de produits, acronymes, personnes et vocabulaires spécifiques à un domaine. Pour les enregistrements nécessitant l’identification des locuteurs, le modèle séparé gpt-4o-transcribe-diarize peut renvoyer des segments étiquetés par locuteur et les associer à des locuteurs connus via de courts extraits de référence.
Les principales limites sont architecturales plutôt que purement tarifaires. Les fichiers téléversés sont limités à 25 MB, les timestamp_granularities[] au niveau du mot sont documentées pour whisper-1, et le modèle de diarisation n’est pas disponible via l’API Realtime. Les équipes traitant de longs enregistrements, des conversations en direct ou de l’audio de centre de contact avec de nombreux locuteurs doivent tester la gestion des fichiers, les exigences d’horodatage et l’attribution des locuteurs avant de standardiser sur une route OpenAI. Voir la documentation officielle OpenAI speech-to-text pour le comportement actuel des endpoints et les formats de sortie pris en charge.
Les équipes souhaitant utiliser GPT-4o Transcribe tout en réduisant les coûts d’API directs peuvent également consulter le GPT-4o Transcribe API on CometAPI. Au moment de la rédaction, CometAPI liste un tarif inférieur au prix standard de l’API directe OpenAI, tout en conservant une intégration compatible OpenAI. Vérifiez la page du modèle en direct avant le benchmark, car les prix, la disponibilité et les paramètres pris en charge peuvent changer.
Testez OpenAI en premier lorsque : votre application utilise déjà des outils compatibles OpenAI, la majorité de l’audio est téléversée plutôt que diffusée en continu, et la réduction de la complexité d’intégration compte davantage que des contrôles spécialisés de streaming ou de centre de contact.
2. Deepgram: Best for Streaming Control and Voice-Agent Pipelines
La page de tarification de Deepgram affiche des tarifs streaming à durée limitée de $0.0048 par minute pour Nova-3 Monolingual et $0.0058 par minute pour Nova-3 Multilingual. Les tarifs pré-enregistrés pay-as-you-go correspondants sont $0.0077 et $0.0092 par minute. Flux est positionné pour les agents vocaux conversationnels avec détection des tours et gestion des interruptions.
Deepgram mérite une place sur les listes restreintes orientées produit live, car le comportement en streaming compte autant que l’exactitude finale de la transcription. Une interface vocale a besoin de résultats partiels utiles, d’un endpointing fiable, d’une gestion naturelle des interruptions et d’une finalisation prévisible — pas seulement d’une transcription propre une fois l’appel terminé.
Intégrez les modules complémentaires au budget. La diarisation et le masquage ajoutent chacun $0.0020 par minute; l’amorçage par termes-clés ajoute $0.0013 par minute. Deepgram précise aussi que ses tarifs indiqués inscrivent les utilisateurs au Model Improvement Program, donc les équipes ayant des exigences plus strictes en matière d’utilisation des données doivent vérifier des conditions commerciales alternatives.
Testez Deepgram en premier lorsque : la prise de tour, les partiels à faible latence, le contrôle du streaming ou le comportement d’agent vocal sont la priorité.
3. AssemblyAI: Best Low-Cost Recorded Route with Transparent Add-On Pricing
La tarification d’AssemblyAI indique Universal-2 à $0.15 par heure d’audio et Universal-3.5 Pro à $0.21 par heure. Universal-2 prend en charge 99 langues; Universal-3.5 Pro prend en charge 18 langues avec code switching et un niveau de modèle plus avancé.
La gamme temps réel est séparée. Universal-Streaming coûte $0.15 par heure pour l’anglais, et Universal-Streaming Multilingual couvre l’anglais, l’espagnol, l’allemand, le français, le portugais et l’italien au même prix. Universal-3.5 Pro Realtime coûte $0.45 par heure et prend en charge 18 langues.
La matrice d’options explicite d’AssemblyAI facilite la budgétisation : la diarisation enregistrée est à $0.02 par heure, la diarisation temps réel à $0.12 par heure, et l’amorçage par termes-clés pour Universal-Streaming à $0.04 par heure. Les fichiers multicanaux sont facturés par canal, ce qui peut modifier le résultat pour les appels stéréo.
Testez AssemblyAI en premier lorsque : le faible coût pour l’audio enregistré, la large couverture linguistique, une tarification claire des fonctionnalités ou un flux asynchrone simple sont prioritaires.
4. Google Cloud Speech-to-Text: Best for Dynamic Batch and GCP-Native Workloads
La tarification de Google Cloud Speech-to-Text V2 liste Dynamic Batch à $0.003 par minute et la reconnaissance standard à $0.016 par minute pour les premiers 500 000 minutes mensuelles. Les tarifs standard diminuent à des paliers d’usage supérieurs.
Dynamic Batch est attrayant pour des archives qui ne requièrent pas un délai de restitution urgent, mais le prix plus bas est lié à une urgence de traitement moindre. Google facture également chaque canal audio séparément : une requête de 30 secondes à quatre canaux est facturée comme 120 secondes d’audio traité.
Google est souvent attractif opérationnellement lorsque l’audio réside déjà dans Cloud Storage et que l’équipe utilise l’identité GCP, la journalisation, les endpoints régionaux et les contrôles de facturation. Ajoutez le stockage, le transfert et les services cloud adjacents au modèle de coût total plutôt que de traiter la transcription comme une ligne isolée.
Testez Google en premier lorsque : de grandes archives non urgentes, des opérations GCP natives, un déploiement régional ou des fonctionnalités d’adaptation priment sur la table de prix la plus simple.
5. Amazon Transcribe: Best for AWS-Native Contact-Center Audio
La tarification d’Amazon Transcribe varie selon la région et le palier d’utilisation mensuel. L’exemple public d’AWS pour US East à deux millions de minutes mensuelles utilise $0.006 par minute pour le batch et $0.01 par minute pour le streaming. Ces chiffres sont des exemples à gros volume, pas des tarifs d’entrée ordinaires.
La facturation se fait à la seconde avec un minimum de 15 secondes par requête. La tarification standard inclut les vocabulaires personnalisés, le filtrage de vocabulaire, la diarisation des locuteurs et l’identification de la langue; le masquage automatique de contenu et les modèles de langue personnalisés sont en supplément.
AWS inclut jusqu’à deux canaux dans la facturation de la durée audio. Pour les appels stéréo d’assistance, cette règle peut être plus favorable qu’un fournisseur qui facture chaque canal comme une heure séparée.
Testez AWS en premier lorsque : les appels transitent déjà par AWS, la facturation à deux canaux est précieuse, ou que l’intégration IAM, stockage, sécurité et achats l’emporte sur le tarif d’entrée le plus faible.
6. ElevenLabs Scribe: Best for Multilingual Media and Fast Real-Time Experiments
La tarification API d’ElevenLabs liste Scribe v2 à $0.22 par heure et Scribe v2 Realtime à $0.39 par heure. Le produit inclut la transcription multilingue, des horodatages au niveau du mot, la diarisation, le taggage audio et des options d’amorçage par termes-clés et de détection d’entités.
Scribe v2 Realtime annonce une faible latence de modèle, mais il faut mesurer l’ensemble du chemin, de la capture micro jusqu’au texte stable dans la région cible et la pile de transport. La latence du fournisseur n’inclut pas votre gestion WebSocket, le chemin réseau, le buffering, les mises à jour UI ou la logique d’agent en aval.
La détection d’entités ajoute $0.07 par heure et l’amorçage par termes-clés ajoute $0.05 par heure. Intégrez les deux au coût par transcription acceptée lorsqu’ils sont requis pour le produit.
Testez ElevenLabs en premier lorsque : médias multilingues, minutage des mots, tags audio, ou prototype temps réel rapide sont des exigences centrales.
Total Cost of Ownership: Hidden Costs That Can Reverse the Ranking
Multichannel Billing
Une heure d’appel stéréo n’est pas toujours une heure facturable.
| Route | Planning calculation for a 60-minute, two-channel call | Estimated base cost |
|---|---|---|
| AssemblyAI Universal-2 | 1 hour × 2 channels × $0.15/hr | $0.30 |
| AWS Transcribe batch | 1 hour total × $0.36/hr | $0.36 |
| Google standard recognition | 1 hour × 2 channels × $0.96/hr | $1.92 |
La valeur AWS utilise l’exemple officiel du fournisseur en US East à deux millions de minutes mensuelles. Utilisez le calculateur AWS pour la région et le volume mensuel réels.
Ce tableau est un exemple de facturation, pas un classement des centres de contact. Testez les chevauchements de parole, les relais de locuteurs, la terminologie, le masquage, le délai de finalisation et l’effort de correction avant de choisir une route.
Add-Ons, Retries, and Human Review
Le traitement pré-enregistré Deepgram Nova-3 Monolingual passe de $0.0077 à $0.0097 par minute quand la diarisation est ajoutée. L’ajout du masquage le porte à $0.0117 par minute avant l’amorçage par termes-clés. AssemblyAI facture $0.02 par heure pour la diarisation enregistrée et $0.12 par heure pour la diarisation temps réel. ElevenLabs facture $0.07 par heure pour la détection d’entités et $0.05 par heure pour l’amorçage par termes-clés.
Les réessais, les webhooks en double, le stockage et les transferts inter-cloud peuvent ajouter des coûts sans améliorer la transcription. Journalisez les secondes audio, le nombre de canaux, les options activées, le statut des requêtes, les réessais, la version du modèle, la latence et le temps de relecture pour chaque tâche.
The better procurement metric is not price per audio minute. Cost per accepted transcript = API processing + paid features + retries + storage/transfer + human correction time
Supposons qu’un réviseur coûte $30 par heure :
| Illustrative route | API cost for one audio hour | Human correction | Correction cost | Total accepted-transcript cost |
|---|---|---|---|---|
| Lower-price route | $0.15 | 8 minutes | $4.00 | $4.15 |
| Higher-price route | $0.60 | 3 minutes | $1.50 | $2.10 |
La deuxième route coûte quatre fois plus au niveau API mais environ deux fois moins après relecture. Les temps de correction sont des hypothèses de planification, pas des résultats de benchmark fournisseur; remplacez-les par des mesures provenant des personnes qui valident les transcriptions dans votre workflow.
How to Evaluate Speech-to-Text APIs on Real Audio
Les affirmations d’exactitude des fournisseurs ne sont pas directement comparables car ils utilisent des jeux de données, langues, politiques de normalisation, versions de modèles et conditions acoustiques différentes. L’étude GigaSpeechBench 2026 évalue 680 heures de parole réelle annotée par des humains, couvrant des langues peu dotées, des dialectes chinois, des accents anglais, la terminologie de 12 secteurs, et la parole d’enfants et de personnes âgées. Ses résultats montrent des dégradations substantielles pour des modèles de pointe et des API commerciales dans des situations difficiles.
La conclusion utile n’est pas qu’un benchmark public a trouvé un gagnant permanent. C’est que votre jeu de test doit ressembler à votre trafic.
Use a Production-Like Evaluation Set
- 20 réunions ou interviews « propres » contenant des noms propres et des termes métier.
- 20 appels d’assistance bruyants avec interruptions, musique d’attente, diaphonie et changements de canal.
- 20 extraits avec accents ou multilingues, incluant un véritable code switching.
- 10 podcasts ou fichiers vidéo longs.
- 10 courtes énonciations live avec silences, hésitations, faux départs et barge-in.
Score More Than Word Error Rate
| Metric | What to measure | Why it matters |
|---|---|---|
| Word error rate | Insertion, suppressions et substitutions sous une politique de normalisation partagée | Capture l’exactitude lexicale, mais pas l’utilisabilité globale |
| Named-term accuracy | Noms de produits, personnes, lieux, abréviations, nombres et vocabulaire sectoriel | Un faible taux d’erreurs sur les noms propres peut générer une forte charge de relecture |
| Speaker attribution | Mots mal attribués et changements de locuteur manqués | Critique pour les appels, interviews, conformité et analytics |
| Formatting quality | Ponctuation, casse, paragraphes, nombres, dates et disfluences | Détermine le temps de nettoyage avant publication ou analyse |
| Batch turnaround | Upload-to-final p50 et p95 pour fichiers courts et longs | Une route à basse priorité et bon marché peut rater l’échéance opérationnelle |
| Streaming latency | Premier partiel, partiel stable, et transcription finale aux p50 et p95 | La latence moyenne masque les pauses réellement perçues par les utilisateurs |
| Reliability | Timeouts, résultats vides, réessais, webhooks en double, et taux de repli | Les échecs ajoutent des coûts directs et des retards visibles |
| Review effort | Minutes d’édition par heure d’audio et taux d’acceptation | Convertit la qualité de sortie en coût métier |
A Seven-Day Evaluation Plan
- Définissez le contrat d’acceptation. Fixez les langues requises, la latence p95, la tolérance d’étiquetage des locuteurs, les besoins d’horodatage, les règles de rétention et le maximum de minutes de relecture par heure d’audio.
- Constituez et annotez le jeu audio. Utilisez de l’audio proche de la production, sous licence, et une politique de transcription de référence partagée.
- Normalisez les intégrations. Alignez les formats audio, régions, indices de vocabulaire, configurations de canaux, réessais, timeouts et versions de modèles.
- Exécutez les tests audio enregistrés. Mesurez coût, délai, WER, termes nommés, mise en forme, locuteurs, échecs et temps de correction.
- Exécutez les tests audio live. Mesurez partiels stables, délai de finalisation, endpointing, gestion des interruptions et comportement de reconnexion aux p50 et p95.
- Calculez le coût par transcription acceptée. Ajoutez canaux, fonctionnalités, réessais, stockage, transfert et temps de relecture.
- Choisissez une politique de routage. Le meilleur design de production peut utiliser une route pour les appels anglais en direct, une autre pour les réunions multilingues, et une route à priorité plus basse pour les archives.
Production Checklist Before Signing a Contract
- Testez séparément les modèles enregistrés et live; leurs prix, langues et comportements peuvent différer.
- Mesurez les partiels stables et la finalisation, pas seulement le temps jusqu’au premier texte.
- Comparez l’identification des canaux stéréo avec la diarisation monocanal en cas de chevauchements de parole.
- Forcez des timeouts, audio malformé, réponses vides, chutes de connexion, re-livraison de webhooks et erreurs de rate limit.
- Vérifiez la taille de fichier, la durée de session, la concurrence, les limites de débit et les workflows de longs fichiers.
- Confirmez la rétention, l’utilisation pour l’amélioration des modèles, le traitement régional, les contrôles de suppression, le chiffrement, la disponibilité d’un DPA ou BAA, et les sous-traitants du plan exact.
- Stockez la version du modèle, les secondes audio, les canaux, les options, le coût par requête, les réessais, la latence, les minutes de relecture et le statut d’acceptation.
- Re-testez après des changements de prix ou de modèle au lieu de supposer que le précédent gagnant reste le meilleur.
Établissez une liste restreinte de fournisseurs par charge de travail, puis évaluez-les avec le même audio, les mêmes paramètres et les mêmes critères d’acceptation. Pour la plupart des équipes, un premier tour pratique devrait inclure une route à faible coût pour l’audio enregistré, une route spécialisée pour le streaming, et un fournisseur déjà aligné avec la pile cloud ou SDK existante.
Test Supported Speech Models Through CometAPI
Les équipes évaluant des modèles de parole compatibles OpenAI pris en charge peuvent suivre le CometAPI Quickstart pour exécuter une première requête de transcription via un endpoint d’API unifié.
CometAPI peut simplifier l’authentification, la facturation et l’intégration client pour les modèles pris en charge. Avant de passer en production, vérifiez les formats pris en charge, les limites, les conditions de confidentialité, la latence et le comportement de facturation de chaque modèle.
Frequently Asked Questions
What is the best speech-to-text API in 2026?
Il n’y a pas de gagnant unique pour toutes les charges de travail. AssemblyAI et Google Dynamic Batch sont de solides candidats à faible coût pour l’audio enregistré. Deepgram, AssemblyAI et ElevenLabs méritent des tests précoces pour la transcription live. OpenAI est pratique dans une pile compatible OpenAI, tandis qu’AWS et Google peuvent être plus simples opérationnellement dans leurs clouds respectifs.
What is the cheapest speech-to-text API for recorded audio?
Parmi les routes publiques normalisées ici, AssemblyAI Universal-2 commence à $0.15 par heure d’audio. Google Dynamic Batch et OpenAI gpt-4o-mini-transcribe se normalisent à environ $0.18 par heure. Le coût final peut changer avec les canaux, les paliers de volume, les options, les réessais, le stockage, le transfert et la correction humaine.
Which API is best for real-time transcription or voice agents?
Commencez avec Deepgram, AssemblyAI et ElevenLabs, puis incluez OpenAI, AWS ou Google lorsque leur écosystème ou leur couverture linguistique correspond. Comparez les partiels stables, l’endpointing, le délai de finalisation, la gestion des interruptions, le comportement de reconnexion et la latence p95 sur votre propre trafic live.
How should I compare speech-to-text accuracy?
Utilisez le même audio sous licence, la même région, les mêmes paramètres de modèle et la même politique de normalisation pour chaque fournisseur. Indiquez le taux d’erreur de mots avec l’exactitude des termes nommés, l’attribution des locuteurs, la mise en forme, la latence p95, le taux d’échec et les minutes d’édition par heure d’audio. N’agrégez pas des affirmations de benchmarks fournisseurs non comparables en un classement universel.
