GPT-Transcribe vs GPT-Live-Transcribe: precios, diferencias de API y migración
TL;DR
Use gpt-transcribe para grabaciones completas a $0.0045 por minuto de audio y gpt-live-transcribe para micrófonos, llamadas o transmisiones de medios en vivo a $0.017 por minuto. OpenAI informa un menor error de transcripción para el modelo en vivo que para GPT-Realtime-Whisper en sus benchmarks publicados, pero la ruta adecuada depende de cuándo debe aparecer el texto, qué campos de salida necesita y cómo ambos modelos rinden con su audio en producción.
GPT-Transcribe vs GPT-Live-Transcribe de un vistazo
Si solo necesita transcripción después de que el audio esté grabado, use gpt-transcribe. Si su aplicación necesita texto mientras el audio aún está llegando, use gpt-live-transcribe. La mayor diferencia no es solo el precio, sino cuándo comienza la transcripción y qué tipo de flujo de trabajo de API debe soportar su app.
| Ítem | gpt-transcribe | gpt-live-transcribe |
|---|---|---|
| Ideal para | Grabaciones cargadas, solicitudes de audio delimitadas, trabajos asíncronos y turnos Realtime confirmados | Micrófonos, llamadas, reuniones y transmisiones de medios en vivo |
| Precio publicado | $0.0045 por minuto de audio | $0.017 por minuto de audio |
| Precio por hora de audio | $0.27 | $1.02 |
| API / Endpoints | /v1/audio/transcriptions; flujo de trabajo Realtime opcional con turnos confirmados | Sesiones de transcripción Realtime (v1/realtime/transcription_sessions o similar) |
| Conexión | Carga de archivo; respuesta transmitida opcional mientras se procesa el archivo | WebSocket para canalizaciones en servidor o WebRTC para audio en navegador |
| Cuándo comienza la transcripción | Después de enviar un archivo o de confirmar un turno de audio | Mientras el audio está llegando |
| Salida de transcripción parcial | Sí, con transmisión de archivo o transmisión de turnos confirmados | Sí, a medida que llega el habla en vivo |
| Controles de contexto | prompt, keywords, languages | prompt, keywords, languages, delay |
| Salida de idioma detectado | Sí, cuando el modelo puede hacer una predicción confiable | No |
| Limitaciones importantes | Límite de carga de 25 MB; se requieren otras rutas para marcas de tiempo, diarización o traducción | Sin marcas de tiempo a nivel de palabra, etiquetas de hablante ni puntajes de confianza |
Aunque gpt-transcribe puede devolver actualizaciones parciales de transcripción mientras procesa un archivo completo o un turno de audio confirmado, no es una ruta de transmisión continua en vivo. Para subtítulos en vivo, llamadas o entrada de micrófono, gpt-live-transcribe es la mejor opción.
Para una comparación más amplia entre proveedores, consulte las 6 mejores API de voz a texto en 2026 de CometAPI: 6 Best Speech-to-Text APIs in 2026.
¿Qué son GPT-Transcribe y GPT-Live-Transcribe?
OpenAI presentó gpt-transcribe y gpt-live-transcribe el 29 de julio de 2026. gpt-transcribe procesa grabaciones completas, transcripciones de archivos transmitidos y turnos Realtime confirmados, mientras que gpt-live-transcribe devuelve actualizaciones de transcripción de baja latencia a medida que llega audio desde micrófonos, llamadas o transmisiones de medios en vivo.
Los dos modelos proporcionan nuevas rutas predeterminadas para transcripción general de archivos y en vivo, pero siguen siendo necesarios flujos de trabajo especializados con Whisper y GPT-4o para marcas de tiempo, traducción, subtítulos y diarización de hablantes.
¿Cuándo vale la pena GPT-Live-Transcribe a su precio más alto?
La página de precios del API de OpenAI lista gpt-transcribe a $0.0045 por minuto y gpt-live-transcribe a $0.017 por minuto. La ruta en vivo cuesta por tanto aproximadamente 3.8 veces más por minuto de audio.
| Volumen mensual de audio | gpt-transcribe | gpt-live-transcribe | Costo adicional del en vivo |
|---|---|---|---|
| 100 horas | $27 | $102 | $75 |
| 1,000 horas | $270 | $1,020 | $750 |
| 10,000 horas | $2,700 | $10,200 | $7,500 |
Estas estimaciones de costo de transcripción usan únicamente las tarifas base publicadas por OpenAI: horas de audio × 60 × precio por minuto. Excluyen almacenamiento, transporte de red, reintentos, hosting de aplicaciones, posprocesamiento, corrección humana y costos de proveedor de respaldo.
Elija gpt-live-transcribe cuando sean requisito del producto los subtítulos inmediatos, asistencia de agentes, moderación o interacción en tiempo real. Elija gpt-transcribe cuando la transcripción solo se necesite después de que se complete una reunión, llamada, entrevista o carga de medios. Una arquitectura de dos rutas puede usar transcripción en vivo para la experiencia del usuario y transcripción de archivos para el posprocesamiento posterior a la llamada o backfills.
Actualmente OpenAI lista GPT-Realtime-Whisper y gpt-live-transcribe al mismo precio base de $0.017 por minuto. Evalúe una migración entre estas rutas en vivo según la calidad de la transcripción aceptada, la latencia, el manejo de eventos y la compatibilidad operativa, más que por el precio de lista.
¿En qué difieren las APIs de GPT-Transcribe y GPT-Live-Transcribe?
La principal diferencia es cómo entra el audio al sistema y cuándo comienzan los eventos de transcripción. gpt-transcribe acepta archivos completados o turnos de audio confirmados, mientras que gpt-live-transcribe mantiene una conexión Realtime y emite actualizaciones de transcripción mientras el audio aún está llegando.
Use GPT-Transcribe para audio completado
Para una grabación completada, envíe el archivo a /v1/audio/transcriptions. La guía de transcripción de archivos de OpenAI acepta archivos de hasta 25 MB en formato mp3, mp4, mpeg, mpga, m4a, wav o webm.
from openai import OpenAI
client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="gpt-transcribe",
file=audio_file,
prompt="A support call about a premium plan and account AC-42.",
extra_body={
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
},
)
print(transcript.text)
Configure stream=True para recibir eventos delta de transcripción mientras OpenAI procesa la grabación cargada. Esto reduce la espera para ver texto, pero no convierte el endpoint de archivos en una ingesta en vivo desde micrófono.
Use GPT-Live-Transcribe para audio entrante
Cree una sesión Realtime con type: "transcription" y seleccione gpt-live-transcribe. Use WebSocket para una canalización de medios del lado del servidor o WebRTC para audio en navegador.
{
"type": "session.update",
"session": {
"type": "transcription",
"audio": {
"input": {
"format": {
"type": "audio/pcm",
"rate": 24000
},
"transcription": {
"model": "gpt-live-transcribe",
"prompt": "A support call about a premium plan and account AC-42.",
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
"delay": "low"
},
"turn_detection": null
}
}
}
}
Anexe fragmentos de audio con input_audio_buffer.append. La aplicación puede confirmar turnos con input_audio_buffer.commit o configurar detección de actividad de voz en el servidor.
La guía de transcripción Realtime devuelve texto incremental mediante conversation.item.input_audio_transcription.delta, seguido de conversation.item.input_audio_transcription.completed para el ítem confirmado. No se garantiza que los eventos de finalización de distintos turnos lleguen en orden, así que concílielos usando item_id en lugar del orden de llegada.
Use la ruta de turnos confirmados cuando el texto inmediato no sea necesario
gpt-transcribe también puede ejecutarse en una sesión de transcripción Realtime sobre WebSocket. La transcripción comienza después de que se confirma un turno de audio, el modelo puede usar como contexto turnos transcritos anteriormente y el evento de finalización puede incluir idiomas detectados.
Esta ruta de turnos confirmados es útil cuando la transmisión basada en turnos o la detección de idiomas importan más que mostrar texto mientras el hablante aún está hablando. No debe confundirse con el comportamiento continuo y de menor latencia de gpt-live-transcribe.
¿Cómo afectan la transcripción los campos prompt, keywords, languages y delay?
Ambos modelos aceptan contexto que puede mejorar el reconocimiento de nombres, números, siglas, términos de producto, habla con acento, audio multilingüe y cambio de código.
| Control | Propósito | Precaución en producción |
|---|---|---|
| prompt | Describa la grabación, el hablante, el dominio o el tema esperado | Un contexto demasiado específico puede sesgar la transcripción |
| keywords | Proporcione nombres literales, siglas, formatos de cuentas o términos técnicos | Las sugerencias no son salida obligatoria; pruebe si se insertan términos no pronunciados |
| languages | Liste uno o más idiomas de entrada esperados | Códigos no soportados o con formato incorrecto causan rechazo |
| delay | Intercambie deltas en vivo más tempranos por más contexto acústico | Disponible para gpt-live-transcribe; haga benchmarks en lugar de asumir milisegundos fijos |
Para los modelos nuevos, languages reemplaza el antiguo campo singular language. No envíe ambos. Cada keyword debe permanecer en una sola línea y no puede contener <, >, retornos de carro ni saltos de línea; valores inválidos causan que se rechace la solicitud o la actualización de sesión.
gpt-live-transcribe admite configuraciones de minimal, low, medium, high y xhigh en delay. Configuraciones más bajas favorecen texto parcial más temprano, mientras que las más altas brindan más contexto de audio y pueden mejorar la calidad de transcripción. OpenAI no promete una latencia fija para cada nivel, así que mida el tiempo hasta el primer delta y el tiempo hasta la transcripción final en micrófonos, códecs, redes, idiomas y duraciones de sesión representativos.
¿Qué muestran los benchmarks de precisión de OpenAI?
El anuncio de lanzamiento de OpenAI informa que gpt-live-transcribe superó a GPT-Realtime-Whisper-1 en dos pruebas multilingües de transcripción. También informa que el contexto libre mejoró la precisión semántica en una evaluación de ASR consciente del contexto.
| Evaluación de OpenAI | Resultado de gpt-live-transcribe | Comparación | Cambio reportado |
|---|---|---|---|
| Precisión semántica en ASR consciente del contexto | 44.6% con contexto libre | 38.5% sin contexto | +6.1 puntos porcentuales |
| Common Voice, 22 idiomas, tasa de error de transcripción | 19.70% | 20.33% para GPT-Realtime-Whisper-1 | -0.63 puntos; alrededor de 3.1% relativo |
| Real-World Audio Recording, 9 idiomas, tasa de error de transcripción | 9.60% | 11.65% para GPT-Realtime-Whisper-1 | -2.05 puntos; alrededor de 17.6% relativo |
La conclusión defendible es estrecha: el nuevo modelo en vivo rindió mejor en las pruebas reportadas por OpenAI, y el contexto mejoró la puntuación de precisión semántica reportada. Estos resultados informados por el proveedor no garantizan la misma mejora para todos los idiomas, códecs de telefonía, micrófonos, configuración de delay, vocabulario de dominio o política de corrección.
¿Cuándo debería usar Whisper o GPT-4o Transcribe en su lugar?
Ninguno de los modelos nuevos reemplaza todos los flujos de trabajo de voz a texto.
| Requisito | Ruta recomendada |
|---|---|
| Transcripción general de archivos completados | gpt-transcribe |
| Subtítulos de baja latencia o transcripción de llamadas en vivo | gpt-live-transcribe |
| Etiquetas de hablante para grabaciones completadas | gpt-4o-transcribe-diarize con diarized_json |
| Marcas de tiempo por palabra o segmento | whisper-1 con timestamp_granularities[] |
| Traducción de audio no inglés a inglés (archivos) | /v1/audio/translations con whisper-1 |
Para diarización, OpenAI requiere el API de Transcriptions de archivos; el etiquetado de hablantes no se admite en sesiones de transcripción Realtime. Para grabaciones de más de 30 segundos, configure chunking_strategy como "auto" o use una configuración de detección de actividad de voz.
Para marcas de tiempo, subtítulos, traducción o flujos de trabajo existentes con Whisper, consulte la guía del API de Whisper de CometAPI y la página del modelo Whisper-1. Los equipos que evalúan otra ruta de transcripción de archivos de OpenAI también pueden revisar la página del modelo GPT-4o Transcribe.
¿Cómo debería migrar desde Whisper?
Cambiar el ID del modelo es solo el primer paso. Valide el flujo de trabajo completo antes de desviar tráfico de producción.
| Verificación | Acción requerida | Riesgo si se omite |
|---|---|---|
| Selección de ruta | Separe grabaciones completadas de cargas realmente en vivo | Pagar la tarifa en vivo para trabajos asíncronos |
| Campos de idioma | Reemplace language por languages en los modelos nuevos; nunca envíe ambos | Solicitudes o sesiones rechazadas |
| Pistas de contexto | Pruebe prompts y keywords en nombres, números, jerga y habla con ruido | Términos sesgados o insertados |
| Configuración de delay | Haga benchmarks al menos en low, medium y high con audio representativo | Elegir velocidad o precisión sin datos |
| Manejo de eventos | Conciliar deltas y eventos completados con item_id | Transcripciones fuera de orden o sobrescritas |
| Paridad de funciones | Inventariar dependencias de diarización, marcas de tiempo, confianza, subtítulos y traducción | Falta de campos posteriores necesarios |
| Telemetría de costos | Registrar minutos de audio, reintentos, resultados fallidos, tiempo de corrección y salidas aceptadas | Confundir el precio de lista con el costo del flujo de trabajo |
| Despliegue | Pruebas en sombra, canario con pequeña porción de tráfico y mantener un fallback | Regresión amplia sin reversión rápida |
Para una migración desde GPT-Realtime-Whisper, mantenga constantes el formato de audio, la política de detección de turnos, el conjunto de pruebas y el objetivo de latencia. Dado que el precio en vivo publicado no cambia, priorice la tasa de transcripciones aceptadas, la distribución de latencia, la estabilidad de la salida y la compatibilidad con el resto de la canalización.
Guía de migración (desde Whisper / modelos previos)
OpenAI proporciona un recetario oficial: Migrate from Whisper to GPT-Transcribe and GPT-Live-Transcribe.
Reglas de alto nivel:
- Audio grabado / por lotes → cambie a gpt-transcribe en el endpoint existente /v1/audio/transcriptions.
- Audio en vivo continuo → cambie a gpt-live-transcribe en una sesión de transcripción Realtime.
- Mayor precisión tras un turno confirmado → use gpt-transcribe dentro de una sesión Realtime.
Ejemplo mínimo de migración de archivos (Python):
Python
# Before (Whisper)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="whisper-1", file=audio, language="en", prompt="Support call about AC-42" )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="gpt-transcribe", file=audio, prompt="A customer support call about billing", extra_body={ "keywords": ["AC-42", "Premium Plus"], "languages": ["en", "fr"] }, response_format="json" # or stream=True for deltas )
Notas para la migración en vivo:
- Mantenga la misma arquitectura de sesión Realtime / WebSocket.
- Cambie el ID del modelo y reemplace el campo singular language por el arreglo languages.
- Agregue prompt, keywords y delay opcionales (p. ej., "low").
- Continúe manejando los mismos eventos de delta y de completado.
- No envíe language y languages a la vez.
Advertencias importantes al migrar:
- GPT-Transcribe/GPT-Live-Transcribe no admiten marcas de tiempo a nivel de palabra, SRT/VTT ni traducción al inglés de la misma manera que whisper-1. Mantenga Whisper para esas necesidades específicas.
- Los formatos de respuesta difieren: no asuma que text, verbose_json, srt o vtt funcionan de forma idéntica.
- Las keywords deben ser literales de una sola línea (sin <, >, CR ni LF) o la solicitud será rechazada.
- Pruebe con audio representativo de producción (acentos, ruido, términos de dominio, enunciados cortos) en lugar de confiar solo en números de WER publicados.
Recomendación rápida
- Predeterminado para trabajo nuevo: GPT-Transcribe para archivos/lotes, GPT-Live-Transcribe para transmisión en vivo.
- Las integraciones existentes con Whisper o GPT-4o-Transcribe seguirán funcionando, pero ya no son el punto de partida recomendado.
- Los trabajos por lotes sensibles a costos se benefician más del cambio a GPT-Transcribe ($0.0045 vs $0.006).
Para los últimos detalles, consulte las páginas oficiales de los modelos y la guía general de transcripción en el sitio de desarrolladores de OpenAI.
¿Cómo debería evaluar los dos modelos con audio de producción?
Use audio con licencia que represente el producto en lugar de solo clips de demostración limpios.
- Seleccione al menos 50 grabaciones que cubran los principales casos de uso, idiomas, dispositivos y condiciones de audio.
- Incluya acentos, interrupciones, ruido de fondo, cambio de código, números, fechas, moneda, direcciones de correo y vocabulario de dominio.
- Procese grabaciones completas con
gpt-transcribecon y sin pistas de contexto. - Reproduzca las mismas muestras en vivo con
gpt-live-transcribeen tres configuraciones de delay. - Mantenga formatos, límites de turno, prompts y reglas de puntuación consistentes entre ejecuciones.
- Mida error de transcripción, recuperación de términos de dominio, revisiones de texto parcial, latencia p50 y p95, fallas, reintentos y tiempo de corrección humana.
- Calcule el costo por transcripción aceptada y, luego, haga canario de la política de enrutamiento seleccionada antes de la migración completa.
El diseño final puede usar un modelo o ambos. La métrica decisiva debe ser el costo y la confiabilidad de una transcripción de producción aceptada, no el precio publicado por minuto de forma aislada.
Preguntas frecuentes
¿Qué modelo debería usar: GPT-Transcribe o GPT-Live-Transcribe?
Use gpt-transcribe para grabaciones completas y trabajos asíncronos. Use gpt-live-transcribe cuando el texto deba llegar mientras el audio aún se está transmitiendo.
¿Cuánto cuestan GPT-Transcribe y GPT-Live-Transcribe?
OpenAI lista gpt-transcribe a $0.0045 por minuto de audio ($0.27 por hora) y gpt-live-transcribe a $0.017 por minuto ($1.02 por hora).
¿Es GPT-Live-Transcribe más preciso que GPT-Realtime-Whisper?
En el benchmark de OpenAI de Real-World Audio Recording con nueve idiomas, la tasa de error de transcripción reportada disminuyó de 11.65% a 9.60%. Verifique este resultado específico del benchmark con su propio audio.
¿GPT-Live-Transcribe admite diarización o marcas de tiempo por palabra?
No. No devuelve etiquetas de hablante, marcas de tiempo a nivel de palabra ni puntajes de confianza. Use un modelo de archivos compatible o un paso de respaldo cuando esos campos sean necesarios.
¿La migración desde GPT-Realtime-Whisper es un reemplazo de modelo directo?
No. Verifique la configuración de la sesión, los campos de idioma, las entradas de contexto, los ajustes de delay, el orden de eventos, las dependencias de funciones, la latencia y la calidad de salida antes de mover tráfico de producción.
Pruebe rutas de transcripción con CometAPI
Antes de implementar, revise la disponibilidad actual de modelos y precios de rutas en la página de precios de CometAPI y use la documentación de CometAPI para patrones de solicitud compatibles con OpenAI. Fije IDs exactos de modelos en las pruebas y registre duración de audio, nivel de delay, latencia del primer delta, latencia de la transcripción final, reintentos y tasa de transcripciones aceptadas para que la decisión de enrutamiento refleje el costo total del flujo de trabajo.
