GPT-5.6 Luna price down 80%, Terra down 20% →

GPT-Transcribe vs GPT-Live-Transcribe: API & precios

CometAPI
Mia MarenJul 31, 2026
GPT-Transcribe vs GPT-Live-Transcribe: API & precios

GPT-Transcribe vs GPT-Live-Transcribe: precios, diferencias de API y migración

TL;DR

Use gpt-transcribe para grabaciones completas a $0.0045 por minuto de audio y gpt-live-transcribe para micrófonos, llamadas o transmisiones de medios en vivo a $0.017 por minuto. OpenAI informa un menor error de transcripción para el modelo en vivo que para GPT-Realtime-Whisper en sus benchmarks publicados, pero la ruta adecuada depende de cuándo debe aparecer el texto, qué campos de salida necesita y cómo ambos modelos rinden con su audio en producción.

GPT-Transcribe vs GPT-Live-Transcribe de un vistazo

Si solo necesita transcripción después de que el audio esté grabado, use gpt-transcribe. Si su aplicación necesita texto mientras el audio aún está llegando, use gpt-live-transcribe. La mayor diferencia no es solo el precio, sino cuándo comienza la transcripción y qué tipo de flujo de trabajo de API debe soportar su app.

Ítemgpt-transcribegpt-live-transcribe
Ideal paraGrabaciones cargadas, solicitudes de audio delimitadas, trabajos asíncronos y turnos Realtime confirmadosMicrófonos, llamadas, reuniones y transmisiones de medios en vivo
Precio publicado$0.0045 por minuto de audio$0.017 por minuto de audio
Precio por hora de audio$0.27$1.02
API / Endpoints/v1/audio/transcriptions; flujo de trabajo Realtime opcional con turnos confirmadosSesiones de transcripción Realtime (v1/realtime/transcription_sessions o similar)
ConexiónCarga de archivo; respuesta transmitida opcional mientras se procesa el archivoWebSocket para canalizaciones en servidor o WebRTC para audio en navegador
Cuándo comienza la transcripciónDespués de enviar un archivo o de confirmar un turno de audioMientras el audio está llegando
Salida de transcripción parcialSí, con transmisión de archivo o transmisión de turnos confirmadosSí, a medida que llega el habla en vivo
Controles de contextoprompt, keywords, languagesprompt, keywords, languages, delay
Salida de idioma detectadoSí, cuando el modelo puede hacer una predicción confiableNo
Limitaciones importantesLímite de carga de 25 MB; se requieren otras rutas para marcas de tiempo, diarización o traducciónSin marcas de tiempo a nivel de palabra, etiquetas de hablante ni puntajes de confianza

Aunque gpt-transcribe puede devolver actualizaciones parciales de transcripción mientras procesa un archivo completo o un turno de audio confirmado, no es una ruta de transmisión continua en vivo. Para subtítulos en vivo, llamadas o entrada de micrófono, gpt-live-transcribe es la mejor opción.

Para una comparación más amplia entre proveedores, consulte las 6 mejores API de voz a texto en 2026 de CometAPI: 6 Best Speech-to-Text APIs in 2026.

¿Qué son GPT-Transcribe y GPT-Live-Transcribe?

OpenAI presentó gpt-transcribe y gpt-live-transcribe el 29 de julio de 2026. gpt-transcribe procesa grabaciones completas, transcripciones de archivos transmitidos y turnos Realtime confirmados, mientras que gpt-live-transcribe devuelve actualizaciones de transcripción de baja latencia a medida que llega audio desde micrófonos, llamadas o transmisiones de medios en vivo.

Los dos modelos proporcionan nuevas rutas predeterminadas para transcripción general de archivos y en vivo, pero siguen siendo necesarios flujos de trabajo especializados con Whisper y GPT-4o para marcas de tiempo, traducción, subtítulos y diarización de hablantes.

¿Cuándo vale la pena GPT-Live-Transcribe a su precio más alto?

La página de precios del API de OpenAI lista gpt-transcribe a $0.0045 por minuto y gpt-live-transcribe a $0.017 por minuto. La ruta en vivo cuesta por tanto aproximadamente 3.8 veces más por minuto de audio.

Volumen mensual de audiogpt-transcribegpt-live-transcribeCosto adicional del en vivo
100 horas$27$102$75
1,000 horas$270$1,020$750
10,000 horas$2,700$10,200$7,500

Estas estimaciones de costo de transcripción usan únicamente las tarifas base publicadas por OpenAI: horas de audio × 60 × precio por minuto. Excluyen almacenamiento, transporte de red, reintentos, hosting de aplicaciones, posprocesamiento, corrección humana y costos de proveedor de respaldo.

Elija gpt-live-transcribe cuando sean requisito del producto los subtítulos inmediatos, asistencia de agentes, moderación o interacción en tiempo real. Elija gpt-transcribe cuando la transcripción solo se necesite después de que se complete una reunión, llamada, entrevista o carga de medios. Una arquitectura de dos rutas puede usar transcripción en vivo para la experiencia del usuario y transcripción de archivos para el posprocesamiento posterior a la llamada o backfills.

Actualmente OpenAI lista GPT-Realtime-Whisper y gpt-live-transcribe al mismo precio base de $0.017 por minuto. Evalúe una migración entre estas rutas en vivo según la calidad de la transcripción aceptada, la latencia, el manejo de eventos y la compatibilidad operativa, más que por el precio de lista.

¿En qué difieren las APIs de GPT-Transcribe y GPT-Live-Transcribe?

La principal diferencia es cómo entra el audio al sistema y cuándo comienzan los eventos de transcripción. gpt-transcribe acepta archivos completados o turnos de audio confirmados, mientras que gpt-live-transcribe mantiene una conexión Realtime y emite actualizaciones de transcripción mientras el audio aún está llegando.

Use GPT-Transcribe para audio completado

Para una grabación completada, envíe el archivo a /v1/audio/transcriptions. La guía de transcripción de archivos de OpenAI acepta archivos de hasta 25 MB en formato mp3, mp4, mpeg, mpga, m4a, wav o webm.

from openai import OpenAI

client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
    transcript = client.audio.transcriptions.create(
        model="gpt-transcribe",
        file=audio_file,
        prompt="A support call about a premium plan and account AC-42.",
        extra_body={
            "keywords": ["premium plan", "AC-42", "billing"],
            "languages": ["en"],
        },
    )
print(transcript.text)

Configure stream=True para recibir eventos delta de transcripción mientras OpenAI procesa la grabación cargada. Esto reduce la espera para ver texto, pero no convierte el endpoint de archivos en una ingesta en vivo desde micrófono.

Use GPT-Live-Transcribe para audio entrante

Cree una sesión Realtime con type: "transcription" y seleccione gpt-live-transcribe. Use WebSocket para una canalización de medios del lado del servidor o WebRTC para audio en navegador.

{
  "type": "session.update",
  "session": {
    "type": "transcription",
    "audio": {
      "input": {
        "format": {
          "type": "audio/pcm",
          "rate": 24000
        },
        "transcription": {
          "model": "gpt-live-transcribe",
          "prompt": "A support call about a premium plan and account AC-42.",
          "keywords": ["premium plan", "AC-42", "billing"],
          "languages": ["en"],
          "delay": "low"
        },
        "turn_detection": null
      }
    }
  }
}

Anexe fragmentos de audio con input_audio_buffer.append. La aplicación puede confirmar turnos con input_audio_buffer.commit o configurar detección de actividad de voz en el servidor.

La guía de transcripción Realtime devuelve texto incremental mediante conversation.item.input_audio_transcription.delta, seguido de conversation.item.input_audio_transcription.completed para el ítem confirmado. No se garantiza que los eventos de finalización de distintos turnos lleguen en orden, así que concílielos usando item_id en lugar del orden de llegada.

Use la ruta de turnos confirmados cuando el texto inmediato no sea necesario

gpt-transcribe también puede ejecutarse en una sesión de transcripción Realtime sobre WebSocket. La transcripción comienza después de que se confirma un turno de audio, el modelo puede usar como contexto turnos transcritos anteriormente y el evento de finalización puede incluir idiomas detectados.

Esta ruta de turnos confirmados es útil cuando la transmisión basada en turnos o la detección de idiomas importan más que mostrar texto mientras el hablante aún está hablando. No debe confundirse con el comportamiento continuo y de menor latencia de gpt-live-transcribe.

¿Cómo afectan la transcripción los campos prompt, keywords, languages y delay?

Ambos modelos aceptan contexto que puede mejorar el reconocimiento de nombres, números, siglas, términos de producto, habla con acento, audio multilingüe y cambio de código.

ControlPropósitoPrecaución en producción
promptDescriba la grabación, el hablante, el dominio o el tema esperadoUn contexto demasiado específico puede sesgar la transcripción
keywordsProporcione nombres literales, siglas, formatos de cuentas o términos técnicosLas sugerencias no son salida obligatoria; pruebe si se insertan términos no pronunciados
languagesListe uno o más idiomas de entrada esperadosCódigos no soportados o con formato incorrecto causan rechazo
delayIntercambie deltas en vivo más tempranos por más contexto acústicoDisponible para gpt-live-transcribe; haga benchmarks en lugar de asumir milisegundos fijos

Para los modelos nuevos, languages reemplaza el antiguo campo singular language. No envíe ambos. Cada keyword debe permanecer en una sola línea y no puede contener <, >, retornos de carro ni saltos de línea; valores inválidos causan que se rechace la solicitud o la actualización de sesión.

gpt-live-transcribe admite configuraciones de minimal, low, medium, high y xhigh en delay. Configuraciones más bajas favorecen texto parcial más temprano, mientras que las más altas brindan más contexto de audio y pueden mejorar la calidad de transcripción. OpenAI no promete una latencia fija para cada nivel, así que mida el tiempo hasta el primer delta y el tiempo hasta la transcripción final en micrófonos, códecs, redes, idiomas y duraciones de sesión representativos.

¿Qué muestran los benchmarks de precisión de OpenAI?

El anuncio de lanzamiento de OpenAI informa que gpt-live-transcribe superó a GPT-Realtime-Whisper-1 en dos pruebas multilingües de transcripción. También informa que el contexto libre mejoró la precisión semántica en una evaluación de ASR consciente del contexto.

Evaluación de OpenAIResultado de gpt-live-transcribeComparaciónCambio reportado
Precisión semántica en ASR consciente del contexto44.6% con contexto libre38.5% sin contexto+6.1 puntos porcentuales
Common Voice, 22 idiomas, tasa de error de transcripción19.70%20.33% para GPT-Realtime-Whisper-1-0.63 puntos; alrededor de 3.1% relativo
Real-World Audio Recording, 9 idiomas, tasa de error de transcripción9.60%11.65% para GPT-Realtime-Whisper-1-2.05 puntos; alrededor de 17.6% relativo

La conclusión defendible es estrecha: el nuevo modelo en vivo rindió mejor en las pruebas reportadas por OpenAI, y el contexto mejoró la puntuación de precisión semántica reportada. Estos resultados informados por el proveedor no garantizan la misma mejora para todos los idiomas, códecs de telefonía, micrófonos, configuración de delay, vocabulario de dominio o política de corrección.

¿Cuándo debería usar Whisper o GPT-4o Transcribe en su lugar?

Ninguno de los modelos nuevos reemplaza todos los flujos de trabajo de voz a texto.

RequisitoRuta recomendada
Transcripción general de archivos completadosgpt-transcribe
Subtítulos de baja latencia o transcripción de llamadas en vivogpt-live-transcribe
Etiquetas de hablante para grabaciones completadasgpt-4o-transcribe-diarize con diarized_json
Marcas de tiempo por palabra o segmentowhisper-1 con timestamp_granularities[]
Traducción de audio no inglés a inglés (archivos)/v1/audio/translations con whisper-1

Para diarización, OpenAI requiere el API de Transcriptions de archivos; el etiquetado de hablantes no se admite en sesiones de transcripción Realtime. Para grabaciones de más de 30 segundos, configure chunking_strategy como "auto" o use una configuración de detección de actividad de voz.

Para marcas de tiempo, subtítulos, traducción o flujos de trabajo existentes con Whisper, consulte la guía del API de Whisper de CometAPI y la página del modelo Whisper-1. Los equipos que evalúan otra ruta de transcripción de archivos de OpenAI también pueden revisar la página del modelo GPT-4o Transcribe.

¿Cómo debería migrar desde Whisper?

Cambiar el ID del modelo es solo el primer paso. Valide el flujo de trabajo completo antes de desviar tráfico de producción.

VerificaciónAcción requeridaRiesgo si se omite
Selección de rutaSepare grabaciones completadas de cargas realmente en vivoPagar la tarifa en vivo para trabajos asíncronos
Campos de idiomaReemplace language por languages en los modelos nuevos; nunca envíe ambosSolicitudes o sesiones rechazadas
Pistas de contextoPruebe prompts y keywords en nombres, números, jerga y habla con ruidoTérminos sesgados o insertados
Configuración de delayHaga benchmarks al menos en low, medium y high con audio representativoElegir velocidad o precisión sin datos
Manejo de eventosConciliar deltas y eventos completados con item_idTranscripciones fuera de orden o sobrescritas
Paridad de funcionesInventariar dependencias de diarización, marcas de tiempo, confianza, subtítulos y traducciónFalta de campos posteriores necesarios
Telemetría de costosRegistrar minutos de audio, reintentos, resultados fallidos, tiempo de corrección y salidas aceptadasConfundir el precio de lista con el costo del flujo de trabajo
DesplieguePruebas en sombra, canario con pequeña porción de tráfico y mantener un fallbackRegresión amplia sin reversión rápida

Para una migración desde GPT-Realtime-Whisper, mantenga constantes el formato de audio, la política de detección de turnos, el conjunto de pruebas y el objetivo de latencia. Dado que el precio en vivo publicado no cambia, priorice la tasa de transcripciones aceptadas, la distribución de latencia, la estabilidad de la salida y la compatibilidad con el resto de la canalización.

Guía de migración (desde Whisper / modelos previos)

OpenAI proporciona un recetario oficial: Migrate from Whisper to GPT-Transcribe and GPT-Live-Transcribe.

Reglas de alto nivel:

  1. Audio grabado / por lotes → cambie a gpt-transcribe en el endpoint existente /v1/audio/transcriptions.
  2. Audio en vivo continuo → cambie a gpt-live-transcribe en una sesión de transcripción Realtime.
  3. Mayor precisión tras un turno confirmado → use gpt-transcribe dentro de una sesión Realtime.

Ejemplo mínimo de migración de archivos (Python):

Python

# Before (Whisper)with open("meeting.wav", "rb") as audio:    result = client.audio.transcriptions.create(        model="whisper-1",        file=audio,        language="en",        prompt="Support call about AC-42"    )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio:    result = client.audio.transcriptions.create(        model="gpt-transcribe",        file=audio,        prompt="A customer support call about billing",        extra_body={            "keywords": ["AC-42", "Premium Plus"],            "languages": ["en", "fr"]        },        response_format="json"  # or stream=True for deltas    )

Notas para la migración en vivo:

  • Mantenga la misma arquitectura de sesión Realtime / WebSocket.
  • Cambie el ID del modelo y reemplace el campo singular language por el arreglo languages.
  • Agregue prompt, keywords y delay opcionales (p. ej., "low").
  • Continúe manejando los mismos eventos de delta y de completado.
  • No envíe language y languages a la vez.

Advertencias importantes al migrar:

  • GPT-Transcribe/GPT-Live-Transcribe no admiten marcas de tiempo a nivel de palabra, SRT/VTT ni traducción al inglés de la misma manera que whisper-1. Mantenga Whisper para esas necesidades específicas.
  • Los formatos de respuesta difieren: no asuma que text, verbose_json, srt o vtt funcionan de forma idéntica.
  • Las keywords deben ser literales de una sola línea (sin <, >, CR ni LF) o la solicitud será rechazada.
  • Pruebe con audio representativo de producción (acentos, ruido, términos de dominio, enunciados cortos) en lugar de confiar solo en números de WER publicados.

Recomendación rápida

  • Predeterminado para trabajo nuevo: GPT-Transcribe para archivos/lotes, GPT-Live-Transcribe para transmisión en vivo.
  • Las integraciones existentes con Whisper o GPT-4o-Transcribe seguirán funcionando, pero ya no son el punto de partida recomendado.
  • Los trabajos por lotes sensibles a costos se benefician más del cambio a GPT-Transcribe ($0.0045 vs $0.006).

Para los últimos detalles, consulte las páginas oficiales de los modelos y la guía general de transcripción en el sitio de desarrolladores de OpenAI.

¿Cómo debería evaluar los dos modelos con audio de producción?

Use audio con licencia que represente el producto en lugar de solo clips de demostración limpios.

  1. Seleccione al menos 50 grabaciones que cubran los principales casos de uso, idiomas, dispositivos y condiciones de audio.
  2. Incluya acentos, interrupciones, ruido de fondo, cambio de código, números, fechas, moneda, direcciones de correo y vocabulario de dominio.
  3. Procese grabaciones completas con gpt-transcribe con y sin pistas de contexto.
  4. Reproduzca las mismas muestras en vivo con gpt-live-transcribe en tres configuraciones de delay.
  5. Mantenga formatos, límites de turno, prompts y reglas de puntuación consistentes entre ejecuciones.
  6. Mida error de transcripción, recuperación de términos de dominio, revisiones de texto parcial, latencia p50 y p95, fallas, reintentos y tiempo de corrección humana.
  7. Calcule el costo por transcripción aceptada y, luego, haga canario de la política de enrutamiento seleccionada antes de la migración completa.

El diseño final puede usar un modelo o ambos. La métrica decisiva debe ser el costo y la confiabilidad de una transcripción de producción aceptada, no el precio publicado por minuto de forma aislada.

Preguntas frecuentes

¿Qué modelo debería usar: GPT-Transcribe o GPT-Live-Transcribe?

Use gpt-transcribe para grabaciones completas y trabajos asíncronos. Use gpt-live-transcribe cuando el texto deba llegar mientras el audio aún se está transmitiendo.

¿Cuánto cuestan GPT-Transcribe y GPT-Live-Transcribe?

OpenAI lista gpt-transcribe a $0.0045 por minuto de audio ($0.27 por hora) y gpt-live-transcribe a $0.017 por minuto ($1.02 por hora).

¿Es GPT-Live-Transcribe más preciso que GPT-Realtime-Whisper?

En el benchmark de OpenAI de Real-World Audio Recording con nueve idiomas, la tasa de error de transcripción reportada disminuyó de 11.65% a 9.60%. Verifique este resultado específico del benchmark con su propio audio.

¿GPT-Live-Transcribe admite diarización o marcas de tiempo por palabra?

No. No devuelve etiquetas de hablante, marcas de tiempo a nivel de palabra ni puntajes de confianza. Use un modelo de archivos compatible o un paso de respaldo cuando esos campos sean necesarios.

¿La migración desde GPT-Realtime-Whisper es un reemplazo de modelo directo?

No. Verifique la configuración de la sesión, los campos de idioma, las entradas de contexto, los ajustes de delay, el orden de eventos, las dependencias de funciones, la latencia y la calidad de salida antes de mover tráfico de producción.

Pruebe rutas de transcripción con CometAPI

Antes de implementar, revise la disponibilidad actual de modelos y precios de rutas en la página de precios de CometAPI y use la documentación de CometAPI para patrones de solicitud compatibles con OpenAI. Fije IDs exactos de modelos en las pruebas y registre duración de audio, nivel de delay, latencia del primer delta, latencia de la transcripción final, reintentos y tasa de transcripciones aceptadas para que la decisión de enrutamiento refleje el costo total del flujo de trabajo.

0 visitas
Revisado para mayor claridad, atribución de fuentes y terminología API actual.

¿Listo para reducir los costos de desarrollo de IA en un 20%?

Comienza gratis en minutos. Créditos de prueba gratuitos incluidos. No se requiere tarjeta de crédito.

Leer Más