TL;DR
No existe una API de voz a texto universalmente mejor. AssemblyAI Universal-2 y Google Dynamic Batch son buenos puntos de partida de bajo costo para audio grabado. Deepgram, AssemblyAI y ElevenLabs merecen pruebas tempranas para subtítulos en vivo y agentes de voz. OpenAI es conveniente cuando el resto del producto ya usa el SDK de OpenAI, mientras que AWS y Google pueden reducir la fricción operativa dentro de una pila cloud existente.
No elija solo por el precio por minuto. El costo en producción también depende de la facturación por canal, tarifas de diarización y redacción, latencia de finalización p95, reintentos, términos de datos y los minutos que una persona dedica a corregir cada transcripción aceptada.
How to Choose a Speech-to-Text API: Which Provider Should You Test First?
Empiece por su carga de trabajo en lugar de una clasificación universal de proveedores. La API de voz a texto adecuada depende de si necesita transcripción por lotes de bajo costo, streaming de baja latencia, compatibilidad multilingüe, separación de hablantes o una integración más estrecha con una pila cloud existente.
Use la lista corta siguiente para decidir qué proveedores incluir en su primer benchmark.
| Workload | Start with | Why | Decision-breaking test |
|---|---|---|---|
| Large recorded archive | AssemblyAI Universal-2, Google Dynamic Batch, OpenAI gpt-4o-mini-transcribe | Low published recorded-audio prices | Queue time, long-file handling, formatting, and correction minutes |
| Live captions or voice agents | Deepgram Nova-3 or Flux, AssemblyAI Realtime, ElevenLabs Scribe v2 Realtime | Streaming APIs with partial-result and turn-detection workflows | Stable partial latency, finalization delay, interruptions, and reconnects |
| Contact-center calls | AWS Transcribe, Google Cloud STT, Deepgram, AssemblyAI | Channel handling, diarization, vocabulary controls, and redaction options | Per-channel billing, overlapping speech, PII policy, and regional processing |
| Multilingual meetings or media | AssemblyAI Universal-3.5 Pro, ElevenLabs Scribe v2, Deepgram Nova-3 Multilingual, OpenAI transcription models | Broad language coverage or code-switching support | Your actual language pairs, accents, names, timestamps, and mixed-language segments |
Speech-to-Text API Pricing Comparison: 2026 Snapshot
La tabla normaliza los precios públicos de lista a una hora de audio para escaneo. No implica igualdad de calidad, latencia, cobertura de funciones ni condiciones comerciales. Los precios promocionales, de menor prioridad y de alto volumen están etiquetados porque no son directamente equivalentes a las tarifas de entrada ordinarias.
| Provider | Best production fit | Recorded or asynchronous price | Live or standard price | Most important caveat |
|---|---|---|---|---|
| OpenAI | Existing OpenAI applications and straightforward uploaded transcription | gpt-4o-mini-transcribe: $0.18/hr; gpt-4o-transcribe: $0.36/hr | gpt-realtime-whisper: $1.02/hr | Uploads are limited to 25 MB. Word-level timestamp_granularities[] are documented only for whisper-1; diarization uses a separate model and is not supported in the Realtime API. |
| Deepgram | Streaming control, live captions, and voice-agent pipelines | Nova-3 Monolingual pre-recorded: $0.462/hr | Nova-3 Monolingual streaming: $0.288/hr promotional | Diarization and redaction each add $0.0020/min; keyterm prompting adds $0.0013/min. Listed rates opt users into the Model Improvement Program. |
| AssemblyAI | Low-cost recorded transcription and clearly priced features | Universal-2: $0.15/hr; Universal-3.5 Pro: $0.21/hr | Universal-Streaming: $0.15/hr; Universal-3.5 Pro Realtime: $0.45/hr | Multichannel files are billed per channel. The $0.15/hr streaming routes support English or six languages, not Universal-2's full 99-language coverage. |
| Google Cloud Speech-to-Text V2 | GCP-native workloads and low-priority archives | Dynamic Batch: $0.18/hr | Standard recognition: $0.96/hr for the first 500,000 monthly minutes | Dynamic Batch runs at lower urgency. Every audio channel is billed separately. |
| Amazon Transcribe | AWS-native contact-center and two-channel call audio | Region- and volume-tiered; official 2M-minute US East example: $0.36/hr | Official 2M-minute US East example: $0.60/hr | These are high-volume examples, not universal entry prices. Requests have a 15-second minimum; up to two channels are included in the duration charge. |
| ElevenLabs Scribe | Multilingual media, word timings, and rapid real-time experiments | Scribe v2: $0.22/hr | Scribe v2 Realtime: $0.39/hr | Entity detection adds $0.07/hr and keyterm prompting adds $0.05/hr. Vendor latency does not include your network and application path. |
Developer shortcut: If your shortlist includes Whisper, GPT-4o Transcribe, or another speech model currently supported by CometAPI, check the live model catalog and pricing and use the OpenAI-compatible quickstart to run the same audio through supported routes. Confirm the exact model ID and endpoint before building the benchmark.
Detailed Vendor Breakdown: The 6 APIs Compared
1. OpenAI: Best for Teams Already Using the OpenAI SDK
OpenAI’s pricing page estima la transcripción en $0.003 por minuto para gpt-4o-mini-transcribe y $0.006 por minuto para gpt-4o-transcribe. La ruta dedicada gpt-realtime-whisper figura aproximadamente en $0.017 por minuto.
OpenAI es una primera opción práctica para equipos que ya usan el SDK de OpenAI para autenticación, registro, reintentos y gobernanza de modelos. Tanto gpt-4o-transcribe como gpt-4o-mini-transcribe admiten prompting, lo que puede mejorar el reconocimiento de nombres de productos, siglas, personas y vocabulario específico del dominio. Para grabaciones que requieren identificación de hablantes, el modelo separado gpt-4o-transcribe-diarize puede devolver segmentos etiquetados por hablante y asociarlos con hablantes conocidos usando clips de referencia cortos.
Las principales limitaciones son arquitectónicas más que puramente de precio. Los archivos cargados están limitados a 25 MB, las timestamp_granularities[] a nivel de palabra están documentadas para whisper-1, y el modelo de diarización no está disponible a través de la API Realtime. Los equipos que procesan grabaciones largas, conversaciones en vivo o audio de centros de contacto con muchos hablantes deben probar el manejo de archivos, los requisitos de marcas de tiempo y la atribución de hablantes antes de estandarizar en una ruta de OpenAI. Consulte la documentación oficial de voz a texto de OpenAI para conocer el comportamiento actual de los endpoints y los formatos de salida compatibles.
Los equipos que quieran usar GPT-4o Transcribe reduciendo costos directos de API también pueden revisar la API de GPT-4o Transcribe en CometAPI. Al momento de escribir, CometAPI lista el acceso a una tarifa inferior a los precios directos estándar de OpenAI, manteniendo una vía de integración compatible con OpenAI. Revise la página del modelo en vivo antes del benchmark porque precios, disponibilidad y parámetros admitidos pueden cambiar.
Prueba OpenAI primero cuando: su aplicación ya usa herramientas compatibles con OpenAI, la mayor parte del audio se sube en lugar de transmitirse de forma continua, y reducir la complejidad de integración importa más que controles especializados de streaming o de centro de contacto.
2. Deepgram: Best for Streaming Control and Voice-Agent Pipelines
La página de precios de Deepgram muestra tarifas temporales de streaming de $0.0048 por minuto para Nova-3 Monolingual y $0.0058 por minuto para Nova-3 Multilingual. Las tarifas correspondientes de pregrabado bajo demanda son $0.0077 y $0.0092 por minuto. Flux está orientado a agentes de voz conversacionales con detección de turnos y manejo de interrupciones.
Deepgram pertenece a las listas cortas de productos en vivo porque el comportamiento en streaming importa tanto como la exactitud final de la transcripción. Una interfaz de voz necesita resultados parciales útiles, un cierre confiable de turnos, manejo natural de interrupciones y una finalización predecible, no solo una transcripción limpia cuando la llamada termina.
Presupueste los complementos junto con el modelo. La diarización y la redacción agregan cada una $0.0020 por minuto; el prompting de términos clave agrega $0.0013 por minuto. Deepgram también indica que sus tarifas listadas inscriben a los usuarios en el Model Improvement Program, por lo que los equipos con requisitos más estrictos de uso de datos deben verificar términos comerciales alternativos.
Prueba Deepgram primero cuando: la toma de turnos, los parciales de baja latencia, el control de streaming o el comportamiento de agentes de voz sea el requisito principal.
3. AssemblyAI: Best Low-Cost Recorded Route with Transparent Add-On Pricing
Los precios de AssemblyAI listan Universal-2 a $0.15 por hora de audio y Universal-3.5 Pro a $0.21 por hora. Universal-2 admite 99 idiomas; Universal-3.5 Pro admite 18 idiomas con cambio de código y un nivel de modelo más avanzado.
La línea de productos en tiempo real es separada. Universal-Streaming cuesta $0.15 por hora para inglés, y Universal-Streaming Multilingual cubre inglés, español, alemán, francés, portugués e italiano al mismo precio. Universal-3.5 Pro Realtime cuesta $0.45 por hora y admite 18 idiomas.
La matriz explícita de complementos de AssemblyAI facilita la presupuestación: la diarización en grabado cuesta $0.02 por hora, la diarización en tiempo real $0.12 por hora, y el prompting de términos clave en Universal-Streaming $0.04 por hora. Los archivos multicanal se facturan por canal, lo que puede cambiar el resultado para llamadas en estéreo.
Prueba AssemblyAI primero cuando: el bajo costo para audio grabado, la amplia cobertura de idiomas, la claridad de precios de funciones o un flujo asíncrono simple sean la prioridad.
4. Google Cloud Speech-to-Text: Best for Dynamic Batch and GCP-Native Workloads
Los precios de Google Cloud Speech-to-Text V2 listan Dynamic Batch a $0.003 por minuto y el reconocimiento estándar a $0.016 por minuto para los primeros 500,000 minutos mensuales. El precio estándar disminuye en niveles de mayor uso.
Dynamic Batch es atractivo para archivos que no requieren una entrega urgente, pero el menor precio está ligado a menor urgencia de procesamiento. Google también factura cada canal de audio por separado: una solicitud de 30 segundos y cuatro canales se factura como 120 segundos de audio procesado.
Google suele ser operativo y atractivo cuando el audio ya reside en Cloud Storage y el equipo usa identidad de GCP, registro, endpoints regionales y controles de facturación. Incluya almacenamiento, transferencia y servicios cloud adyacentes en el modelo de costo total en lugar de tratar la transcripción como una partida aislada.
Prueba Google primero cuando: archivos grandes no urgentes, operaciones nativas de GCP, despliegue regional o funciones de adaptación importan más que la tabla de precios más simple.
5. Amazon Transcribe: Best for AWS-Native Contact-Center Audio
El precio de Amazon Transcribe varía por región y nivel de uso mensual. El ejemplo público de AWS para US East con dos millones de minutos mensuales usa $0.006 por minuto para batch y $0.01 por minuto para streaming. Esas cifras son ejemplos de alto volumen, no cotizaciones de entrada ordinarias.
La facturación se realiza en incrementos de un segundo con un mínimo de 15 segundos por solicitud. El precio estándar incluye vocabularios personalizados, filtro de vocabulario, diarización de hablantes e identificación de idioma; la redacción automática de contenido y los modelos de idioma personalizados tienen costo adicional.
AWS incluye hasta dos canales en el cargo por duración de audio. Para llamadas en estéreo de soporte, esa regla puede ser más favorable que un proveedor que factura cada canal como una hora separada.
Prueba AWS primero cuando: las llamadas ya fluyen por AWS, la facturación de dos canales es valiosa, o la integración con IAM, almacenamiento, seguridad y compras pesa más que el precio de lista más bajo.
6. ElevenLabs Scribe: Best for Multilingual Media and Fast Real-Time Experiments
Los precios del API de ElevenLabs listan Scribe v2 a $0.22 por hora y Scribe v2 Realtime a $0.39 por hora. El producto incluye transcripción multilingüe, marcas de tiempo a nivel de palabra, diarización, etiquetado de audio y funciones opcionales de términos clave y entidades.
Scribe v2 Realtime anuncia baja latencia del modelo, pero el comprador debe medir la ruta completa desde la captura del micrófono hasta el texto estable en la región objetivo y la pila de transporte. La latencia del proveedor no incluye su manejo de WebSocket, ruta de red, buffering, actualizaciones de UI ni la lógica de agentes aguas abajo.
La detección de entidades agrega $0.07 por hora y el prompting de términos clave agrega $0.05 por hora. Incluya ambos en el costo de transcripción aceptada cuando sean necesarios para el producto.
Prueba ElevenLabs primero cuando: medios multilingües, marcas de tiempo por palabra, etiquetas de audio o un prototipo en tiempo real rápido sean requisitos centrales.
Total Cost of Ownership: Hidden Costs That Can Reverse the Ranking
Multichannel Billing
Una llamada estéreo de una hora no siempre equivale a una hora facturable.
| Route | Planning calculation for a 60-minute, two-channel call | Estimated base cost |
|---|---|---|
| AssemblyAI Universal-2 | 1 hour × 2 channels × $0.15/hr | $0.30 |
| AWS Transcribe batch | 1 hour total × $0.36/hr | $0.36 |
| Google standard recognition | 1 hour × 2 channels × $0.96/hr | $1.92 |
*El valor de AWS usa el ejemplo oficial del proveedor para US East con dos millones de minutos mensuales. Use la calculadora de AWS para la región y el volumen mensual reales.
La tabla es un ejemplo de facturación, no una clasificación para centros de contacto. Pruebe habla superpuesta, cambios de hablante, terminología, redacción, demora de finalización y esfuerzo de corrección antes de elegir una ruta.
Add-Ons, Retries, and Human Review
El procesamiento pregrabado de Nova-3 Monolingual de Deepgram sube de $0.0077 a $0.0097 por minuto cuando se agrega diarización. Agregar redacción lo eleva a $0.0117 por minuto antes del prompting de términos clave. AssemblyAI cobra $0.02 por hora por diarización en grabado y $0.12 por hora por diarización en tiempo real. ElevenLabs cobra $0.07 por hora por detección de entidades y $0.05 por hora por prompting de términos clave.
Los reintentos, webhooks duplicados, almacenamiento y transferencias entre nubes pueden agregar costo sin mejorar la transcripción. Registre segundos de audio, conteo de canales, flags de funciones, estado de la solicitud, reintentos, versión del modelo, latencia y tiempo de revisión para cada trabajo.
The better procurement metric is not price per audio minute. Cost per accepted transcript = API processing + paid features + retries + storage/transfer + human correction time
Suponga que un revisor cuesta $30 por hora:
| Illustrative route | API cost for one audio hour | Human correction | Correction cost | Total accepted-transcript cost |
|---|---|---|---|---|
| Lower-price route | $0.15 | 8 minutes | $4.00 | $4.15 |
| Higher-price route | $0.60 | 3 minutes | $1.50 | $2.10 |
La segunda ruta cuesta cuatro veces más en la capa de API pero aproximadamente la mitad después de la revisión. Los tiempos de corrección son supuestos de planificación, no resultados de benchmark de proveedores; reemplácelos con mediciones del equipo que aprueba transcripciones en su flujo de trabajo.
How to Evaluate Speech-to-Text APIs on Real Audio
Las afirmaciones de exactitud de proveedores no son directamente comparables porque usan distintos conjuntos de datos, idiomas, políticas de normalización, versiones de modelos y condiciones acústicas. El estudio GigaSpeechBench 2026 evalúa 680 horas de habla del mundo real con anotación humana en idiomas de bajos recursos, dialectos del chino, acentos en inglés, terminología de 12 verticales y habla infantil y de adultos mayores. Sus resultados muestran degradación sustancial para modelos líderes y APIs comerciales en escenarios difíciles.
La conclusión útil no es que un benchmark público haya encontrado un ganador permanente. Es que su conjunto de prueba debe parecerse a su tráfico.
Use a Production-Like Evaluation Set
- 20 reuniones o entrevistas limpias que contengan nombres y términos del dominio.
- 20 llamadas de soporte ruidosas con interrupciones, música en espera, solapamiento de habla y cambios de canal.
- 20 clips con acento o multilingües, incluido cambio de código genuino.
- 10 podcasts o archivos de video de formato largo.
- 10 enunciados cortos en vivo con silencio, vacilaciones, falsos comienzos y barge-in.
Score More Than Word Error Rate
| Metric | What to measure | Why it matters |
|---|---|---|
| Word error rate | Insertions, deletions, and substitutions under one shared normalization policy | Captures lexical accuracy, but not full transcript usability |
| Named-term accuracy | Product names, people, places, abbreviations, numbers, and industry vocabulary | A small proper-noun failure rate can create heavy review work |
| Speaker attribution | Misassigned words and missed speaker changes | Critical for calls, interviews, compliance, and analytics |
| Formatting quality | Punctuation, casing, paragraphs, numbers, dates, and disfluencies | Determines cleanup time before publication or analysis |
| Batch turnaround | Upload-to-final p50 and p95 for short and long files | A cheap lower-priority route may miss the operational deadline |
| Streaming latency | First partial, stable partial, and final transcript at p50 and p95 | Average latency hides the pauses users actually feel |
| Reliability | Timeouts, empty results, retries, duplicate webhooks, and fallback rate | Failures add direct cost and user-visible delay |
| Review effort | Editor minutes per audio hour and accepted-transcript rate | Converts output quality into a business cost |
A Seven-Day Evaluation Plan
- Defina el contrato de aceptación. Establezca idiomas requeridos, latencia p95, tolerancia de etiquetas de hablante, necesidades de marcas de tiempo, reglas de retención y minutos máximos de revisión por hora de audio.
- Construya y etiquete el conjunto de audio. Use audio similar a producción con licencia y una política de transcripción de referencia compartida.
- Normalice las integraciones. Haga coincidir formatos de audio, regiones, pistas de vocabulario, disposiciones de canales, reintentos, timeouts y versiones de modelos.
- Ejecute pruebas de audio grabado. Mida costo, tiempo de entrega, WER, términos con nombre, formato, hablantes, fallos y tiempo de corrección.
- Ejecute pruebas de audio en vivo. Mida parciales estables, demora de finalización, delimitación de final de turno, manejo de interrupciones y comportamiento de reconexión en p50 y p95.
- Calcule el costo por transcripción aceptada. Sume canales, funciones, reintentos, almacenamiento, transferencia y tiempo del revisor.
- Elija una política de ruteo. El mejor diseño en producción puede usar una ruta para llamadas en vivo en inglés, otra para reuniones multilingües y una ruta de menor prioridad para archivos de archivo.
Production Checklist Before Signing a Contract
- Pruebe los modelos de grabado y en vivo por separado; sus precios, idiomas y comportamiento pueden diferir.
- Mida parciales estables y finalización, no solo el tiempo hasta el primer texto.
- Compare identificación de canales en estéreo con diarización de canal único en habla superpuesta.
- Fuerce timeouts, audio malformado, respuestas vacías, caídas de conexión, reenvío de webhooks y errores de límite de tasa.
- Verifique tamaño de archivo, duración de sesión, concurrencia, límites de tasa y flujos para archivos largos.
- Confirme retención, uso para mejora de modelo, procesamiento regional, controles de eliminación, cifrado, disponibilidad de DPA o BAA y subprocesadores para el plan exacto.
- Almacene versión del modelo, segundos de audio, canales, complementos, costo de la solicitud, reintentos, latencia, minutos de revisión y estado de aceptación.
- Vuelva a probar después de cambios de precios o de modelo en lugar de asumir que el ganador anterior sigue siéndolo.
Haga una lista corta de proveedores por carga de trabajo y luego haga el benchmark con el mismo audio, configuración y criterios de aceptación. Para la mayoría de los equipos, una primera ronda práctica debería incluir una ruta de bajo costo para audio grabado, una ruta de streaming especializada y un proveedor ya alineado con la pila cloud o el SDK existente.
Test Supported Speech Models Through CometAPI
Los equipos que evalúen modelos de voz compatibles con OpenAI pueden seguir el Quickstart de CometAPI para ejecutar una solicitud inicial de transcripción a través de un endpoint unificado.
CometAPI puede simplificar la autenticación, facturación e integración del cliente para los modelos compatibles. Antes de pasar a producción, verifique los formatos admitidos, límites, términos de privacidad, latencia y comportamiento de facturación de cada modelo.
Frequently Asked Questions
What is the best speech-to-text API in 2026?
No hay un único ganador para todas las cargas de trabajo. AssemblyAI y Google Dynamic Batch son candidatos de bajo costo sólidos para audio grabado. Deepgram, AssemblyAI y ElevenLabs merecen pruebas tempranas para transcripción en vivo. OpenAI es conveniente en una pila compatible con OpenAI, mientras que AWS y Google pueden ser operativamente más simples dentro de sus respectivas nubes.
What is the cheapest speech-to-text API for recorded audio?
Entre las rutas públicas aquí normalizadas, AssemblyAI Universal-2 parte de $0.15 por hora de audio. Google Dynamic Batch y OpenAI gpt-4o-mini-transcribe se normalizan alrededor de $0.18 por hora. El costo final puede cambiar con canales, niveles de volumen, complementos, reintentos, almacenamiento, transferencia y corrección humana.
Which API is best for real-time transcription or voice agents?
Comience con Deepgram, AssemblyAI y ElevenLabs, luego incluya OpenAI, AWS o Google cuando su ecosistema o soporte de idiomas encaje. Compare parciales estables, delimitación de turnos, demora de finalización, manejo de interrupciones, comportamiento de reconexión y latencia p95 con su propio patrón de tráfico en vivo.
How should I compare speech-to-text accuracy?
Use el mismo audio con licencia, región, configuración de modelo y política de normalización para cada proveedor. Informe tasa de error de palabras junto con exactitud de términos con nombre, atribución de hablantes, formato, latencia p95, tasa de fallos y minutos de edición por hora de audio. No fusione afirmaciones de benchmarks de proveedores no relacionados en una clasificación universal.
