GPT-Transcribe vs GPT-Live-Transcribe: Preços, Diferenças de API e Migração
TL;DR
Use gpt-transcribe para gravações concluídas a $0.0045 por minuto de áudio e gpt-live-transcribe para microfones, chamadas ou fluxos de mídia ao vivo a $0.017 por minuto. A OpenAI reporta menor erro de transcrição para o modelo ao vivo do que para GPT-Realtime-Whisper em seus benchmarks publicados, mas a rota correta depende de quando o texto deve aparecer, de quais campos de saída você precisa e de como ambos os modelos se comportam com seu áudio de produção.
GPT-Transcribe vs GPT-Live-Transcribe em resumo
Se você só precisa de transcrição após o áudio ser gravado, use gpt-transcribe. Se sua aplicação precisa de texto enquanto o áudio ainda está chegando, use gpt-live-transcribe. A maior diferença não é apenas o preço, mas quando a transcrição começa e que tipo de fluxo de trabalho de API seu app deve suportar.
| Item | gpt-transcribe | gpt-live-transcribe |
|---|---|---|
| Melhor para | Gravações enviadas, requisições de áudio delimitadas, jobs assíncronos e turnos de Realtime comprometidos | Microfones, chamadas, reuniões e fluxos de mídia ao vivo |
| Preço publicado | $0.0045 por minuto de áudio | $0.017 por minuto de áudio |
| Preço por hora de áudio | $0.27 | $1.02 |
| API / Endpoints | /v1/audio/transcriptions; workflow opcional de Realtime com turno comprometido | Sessões de transcrição em Realtime (v1/realtime/transcription_sessions ou similar) |
| Conexão | Upload de arquivo; resposta opcional em streaming enquanto o arquivo é processado | WebSocket para pipelines no servidor ou WebRTC para áudio no navegador |
| Quando a transcrição começa | Após um arquivo ser enviado ou um turno de áudio ser comprometido | Enquanto o áudio está chegando |
| Saída parcial de transcrição | Sim, com streaming de arquivo ou streaming de turno comprometido | Sim, à medida que a fala ao vivo chega |
| Controles de contexto | prompt, keywords, languages | prompt, keywords, languages, delay |
| Saída de idioma detectado | Sim, quando o modelo consegue uma previsão confiável | Não |
| Limitações importantes | Limite de upload de 25 MB; outras rotas são necessárias para timestamps, diarização ou tradução | Sem timestamps em nível de palavra, rótulos de locutor ou pontuações de confiança |
Embora gpt-transcribe possa retornar atualizações parciais enquanto processa um arquivo concluído ou um turno de áudio comprometido, ele não é uma rota de streaming contínua ao vivo. Para legendas ao vivo, chamadas ou entrada de microfone, gpt-live-transcribe é a melhor escolha.
Para uma comparação mais ampla entre provedores, veja os 6 melhores APIs de reconhecimento de fala em 2026, da CometAPI.
O que são GPT-Transcribe e GPT-Live-Transcribe?
A OpenAI introduziu gpt-transcribe e gpt-live-transcribe em 29 de julho de 2026. gpt-transcribe processa gravações concluídas, transcrições de arquivo em streaming e turnos de Realtime comprometidos, enquanto gpt-live-transcribe retorna atualizações de transcrição com baixa latência conforme o áudio chega de microfones, chamadas ou fluxos de mídia ao vivo.
Os dois modelos fornecem novas rotas padrão para transcrição geral de arquivos e ao vivo, mas fluxos de trabalho especializados do Whisper e do GPT-4o para transcrição seguem necessários para timestamps, tradução, legendas e diarização de falantes.
Quando o GPT-Live-Transcribe compensa o preço mais alto?
A página de preços da API da OpenAI lista gpt-transcribe a $0.0045 por minuto e gpt-live-transcribe a $0.017 por minuto. Portanto, a rota ao vivo custa cerca de 3.8 vezes mais por minuto de áudio.
| Volume mensal de áudio | gpt-transcribe | gpt-live-transcribe | Custo adicional do ao vivo |
|---|---|---|---|
| 100 horas | $27 | $102 | $75 |
| 1,000 horas | $270 | $1,020 | $750 |
| 10,000 horas | $2,700 | $10,200 | $7,500 |
Essas estimativas de custo de transcrição usam apenas as tarifas base publicadas pela OpenAI: horas de áudio × 60 × preço por minuto. Elas excluem armazenamento, transporte de rede, novas tentativas, hospedagem de aplicação, pós-processamento, correção humana e custos de provedores de fallback.
Escolha gpt-live-transcribe quando legendas imediatas, assistência de agente, moderação ou interação em tempo real fizerem parte do requisito do produto. Escolha gpt-transcribe quando a transcrição só for necessária após o término de uma reunião, chamada, entrevista ou upload de mídia. Uma arquitetura com duas rotas pode usar transcrição ao vivo para a experiência do usuário e transcrição de arquivo para processamento pós-chamada ou backfills.
Atualmente, a OpenAI lista GPT-Realtime-Whisper e gpt-live-transcribe com a mesma tarifa base de $0.017 por minuto. Avalie uma migração entre essas rotas ao vivo com base na qualidade da transcrição aceita, latência, tratamento de eventos e compatibilidade operacional, e não apenas no preço de tabela.
Como as APIs do GPT-Transcribe e do GPT-Live-Transcribe diferem?
A principal diferença é como o áudio entra no sistema e quando os eventos de transcrição começam. gpt-transcribe aceita arquivos concluídos ou turnos de áudio comprometidos, enquanto gpt-live-transcribe mantém uma conexão Realtime e emite atualizações de transcrição enquanto o áudio ainda está chegando.
Use GPT-Transcribe para áudio concluído
Para uma gravação concluída, envie o arquivo para /v1/audio/transcriptions. O guia de transcrição de arquivo da OpenAI aceita arquivos de até 25 MB nos formatos mp3, mp4, mpeg, mpga, m4a, wav ou webm.
from openai import OpenAI
client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="gpt-transcribe",
file=audio_file,
prompt="A support call about a premium plan and account AC-42.",
extra_body={
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
},
)
print(transcript.text)
Defina stream=True para receber eventos de delta de transcrição enquanto a OpenAI processa a gravação enviada. Isso reduz a espera por texto visível, mas não transforma o endpoint de arquivo em ingestão de microfone ao vivo.
Use GPT-Live-Transcribe para áudio em chegada
Crie uma sessão Realtime com type: "transcription" e selecione gpt-live-transcribe. Use WebSocket para um pipeline de mídia no servidor ou WebRTC para áudio no navegador.
{
"type": "session.update",
"session": {
"type": "transcription",
"audio": {
"input": {
"format": {
"type": "audio/pcm",
"rate": 24000
},
"transcription": {
"model": "gpt-live-transcribe",
"prompt": "A support call about a premium plan and account AC-42.",
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
"delay": "low"
},
"turn_detection": null
}
}
}
}
Anexe blocos de áudio com input_audio_buffer.append. O aplicativo pode comprometer turnos com input_audio_buffer.commit ou configurar detecção de atividade de voz no servidor.
O guia de transcrição Realtime retorna texto incremental por meio de conversation.item.input_audio_transcription.delta, seguido de conversation.item.input_audio_transcription.completed para o item comprometido. Eventos de conclusão de diferentes turnos não têm garantia de chegar em ordem, então reconcilie-os com item_id em vez da ordem de chegada.
Use a rota de turno comprometido quando texto imediato não for necessário
gpt-transcribe também pode ser executado em uma sessão de transcrição Realtime via WebSocket. A transcrição começa após um turno de áudio ser comprometido, o modelo pode usar turnos transcritos anteriores como contexto, e o evento concluído pode incluir idiomas detectados.
Essa rota de turno comprometido é útil quando o streaming por turnos ou a detecção de idioma importam mais do que exibir texto enquanto o locutor ainda está falando. Não deve ser confundida com o comportamento contínuo e de menor latência do gpt-live-transcribe.
Como prompts, keywords, languages e delay afetam a transcrição?
Ambos os modelos aceitam contexto que pode melhorar o reconhecimento de nomes, números, siglas, termos de produto, fala com sotaque, áudio multilíngue e code-switching.
| Controle | Finalidade | Cautela em produção |
|---|---|---|
| prompt | Descrever a gravação, o locutor, o domínio ou o tópico esperado | Contexto excessivamente específico pode enviesar a transcrição |
| keywords | Fornecer nomes literais, siglas, formatos de conta ou termos técnicos | Dicas não são saída obrigatória; teste se há termos inseridos não falados |
| languages | Listar um ou mais idiomas de entrada esperados | Códigos não suportados ou formatados incorretamente causam rejeição |
| delay | Trocar deltas ao vivo mais cedo por mais contexto acústico | Disponível para gpt-live-transcribe; faça benchmark em vez de assumir milissegundos fixos |
Para os novos modelos, languages substitui o antigo campo singular language. Não envie ambos. Cada keyword deve permanecer em uma linha e não pode conter <, >, retornos de carro ou quebras de linha; valores inválidos causam a rejeição da requisição ou da atualização de sessão.
gpt-live-transcribe suporta as configurações de delay minimal, low, medium, high e xhigh. Configurações mais baixas favorecem texto parcial mais cedo, enquanto as mais altas fornecem mais contexto de áudio e podem melhorar a qualidade da transcrição. A OpenAI não promete uma latência fixa para cada nível, então meça o tempo até o primeiro delta e o tempo até a transcrição final em microfones, codecs, redes, idiomas e durações de sessão representativos.
O que mostram os benchmarks de acurácia da OpenAI?
O anúncio de lançamento da OpenAI relata que gpt-live-transcribe superou o GPT-Realtime-Whisper-1 em dois testes multilíngues de transcrição. Também relata que contexto em linguagem livre melhorou a acurácia semântica em uma avaliação de ASR com consciência de contexto.
| Avaliação da OpenAI | Resultado de gpt-live-transcribe | Comparação | Variação reportada |
|---|---|---|---|
| Acurácia semântica em Context Aware ASR | 44.6% com contexto em linguagem livre | 38.5% sem contexto | +6.1 pontos percentuais |
| Common Voice, 22 idiomas, taxa de erro de transcrição | 19.70% | 20.33% para GPT-Realtime-Whisper-1 | -0.63 pontos; cerca de 3.1% relativa |
| Real-World Audio Recording, 9 idiomas, taxa de erro de transcrição | 9.60% | 11.65% para GPT-Realtime-Whisper-1 | -2.05 pontos; cerca de 17.6% relativa |
A conclusão defensável é estreita: o novo modelo ao vivo teve melhor desempenho nos testes reportados pela OpenAI, e o contexto melhorou a pontuação de acurácia semântica reportada. Esses resultados reportados pelo fornecedor não garantem a mesma melhora para todo idioma, codec de telefonia, microfone, configuração de delay, vocabulário de domínio ou política de correção.
Quando você deve usar Whisper ou GPT-4o Transcribe em vez disso?
Nenhum dos novos modelos substitui todos os fluxos de trabalho de speech-to-text.
| Requisito | Rota recomendada |
|---|---|
| Transcrição geral de arquivo concluído | gpt-transcribe |
| Legendas ao vivo ou transcrição de chamada com baixa latência | gpt-live-transcribe |
| Rótulos de locutor para gravações concluídas | gpt-4o-transcribe-diarize com diarized_json |
| Timestamps de palavra ou segmento | whisper-1 com timestamp_granularities[] |
| Tradução de áudio não inglês concluído para inglês | /v1/audio/translations com whisper-1 |
Para diarização, a OpenAI requer a Transcriptions API de arquivo; rotulagem de locutor não é suportada em sessões de transcrição Realtime. Para gravações com mais de 30 segundos, configure chunking_strategy como "auto" ou use uma configuração de detecção de atividade de voz.
Para fluxos de trabalho de timestamp, legenda, tradução ou Whisper existentes, veja o guia da API Whisper da CometAPI e a página do modelo Whisper-1. Equipes avaliando outra rota de transcrição de arquivo da OpenAI também podem revisar a página do modelo GPT-4o Transcribe.
Como você deve migrar do Whisper?
Trocar o ID do modelo é apenas o primeiro passo. Valide o fluxo de trabalho completo antes de mover o tráfego de produção.
| Verificação | Ação necessária | Risco se ignorado |
|---|---|---|
| Seleção de rota | Separar gravações concluídas de workloads genuinamente ao vivo | Pagar a tarifa ao vivo por jobs assíncronos |
| Campos de idioma | Substituir language por languages nos novos modelos; nunca enviar ambos | Requisições ou sessões rejeitadas |
| Dicas de contexto | Testar prompts e keywords em nomes, números, jargões e fala ruidosa | Termos enviesados ou inseridos |
| Configuração de delay | Fazer benchmark de pelo menos low, medium e high em áudio representativo | Escolher velocidade ou acurácia sem dados |
| Tratamento de eventos | Conciliar deltas e eventos concluídos com item_id | Transcrições fora de ordem ou sobrescritas |
| Paridade de recursos | Inventariar dependências de diarização, timestamps, confiança, legenda e tradução | Campos ausentes a jusante |
| Telemetria de custo | Registrar minutos de áudio, novas tentativas, resultados com falha, tempo de correção e saídas aceitas | Confundir preço de tabela com custo do fluxo |
| Rollout | Shadow test, canary com pequena parcela de tráfego e manter um fallback | Regressão ampla sem rollback rápido |
Para uma migração do GPT-Realtime-Whisper, mantenha constantes o formato de áudio, a política de detecção de turno, o conjunto de testes e a meta de latência. Como o preço publicado do ao vivo é inalterado, priorize a taxa de transcrição aceita, a distribuição de latência, a estabilidade da saída e a compatibilidade com o restante do pipeline.
Guia de migração (do Whisper / modelos anteriores)
A OpenAI fornece um cookbook oficial: Migrar do Whisper para GPT-Transcribe e GPT-Live-Transcribe.
Regras de alto nível:
- Áudio gravado / em lote → mudar para gpt-transcribe no endpoint existente /v1/audio/transcriptions.
- Áudio ao vivo contínuo → mudar para gpt-live-transcribe em uma sessão de transcrição Realtime.
- Maior acurácia após um turno comprometido → usar gpt-transcribe dentro de uma sessão Realtime.
Exemplo mínimo de migração de arquivo (Python):
Python
# Before (Whisper)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="whisper-1", file=audio, language="en", prompt="Support call about AC-42" )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="gpt-transcribe", file=audio, prompt="A customer support call about billing", extra_body={ "keywords": ["AC-42", "Premium Plus"], "languages": ["en", "fr"] }, response_format="json" # or stream=True for deltas )
Notas de migração ao vivo:
- Manter a mesma arquitetura de sessão Realtime / WebSocket.
- Alterar o ID do modelo e substituir o singular language pelo array languages.
- Adicionar prompt, keywords e delay opcionais (por exemplo, "low").
- Continuar tratando os mesmos eventos de delta/completed.
- Não enviar language e languages juntos.
Caveats importantes ao migrar:
- GPT-Transcribe/GPT-Live-Transcribe não suportam timestamps em nível de palavra, SRT/VTT ou tradução para inglês do mesmo modo que o whisper-1. Mantenha o Whisper para essas necessidades específicas.
- Formatos de resposta diferem — não assuma que text, verbose_json, srt ou vtt funcionam de forma idêntica.
- Keywords devem ser literais de uma linha (sem <, >, CR ou LF) ou a requisição será rejeitada.
- Teste em áudio de produção representativo (sotaques, ruído, termos de domínio, enunciados curtos) em vez de confiar apenas em números de WER publicados.
Recomendação rápida
- Padrão para novos trabalhos: GPT-Transcribe para arquivos/lote, GPT-Live-Transcribe para streaming ao vivo.
- Integrações existentes de Whisper ou GPT-4o-Transcribe continuam funcionando, mas não são mais o ponto de partida recomendado.
- Jobs em lote sensíveis a custo se beneficiam mais da troca para GPT-Transcribe ($0.0045 vs $0.006).
Para os detalhes mais recentes, consulte as páginas oficiais dos modelos e o guia de visão geral de transcrição no site de desenvolvedores da OpenAI.
Como avaliar os dois modelos em áudio de produção?
Use áudio licenciado que represente o produto, em vez de apenas clipes de demonstração limpos.
- Selecione pelo menos 50 gravações cobrindo os principais casos de uso, idiomas, dispositivos e condições de áudio.
- Inclua sotaques, interrupções, ruído de fundo, code-switching, números, datas, moeda, endereços de e-mail e vocabulário de domínio.
- Execute gravações concluídas com
gpt-transcribecom e sem dicas de contexto. - Reproduza as mesmas amostras ao vivo com
gpt-live-transcribeem três configurações de delay. - Mantenha formatos, limites de turno, prompts e regras de pontuação consistentes entre as execuções.
- Meça erro de transcrição, recall de termos de domínio, revisões de texto parcial, latência p50 e p95, falhas, novas tentativas e tempo de correção humana.
- Calcule o custo por transcrição aceita e, em seguida, faça canary da política de roteamento selecionada antes da migração completa.
O design final pode usar um modelo ou ambos. A métrica decisiva deve ser o custo e a confiabilidade de uma transcrição de produção aceita, não o preço publicado por minuto isoladamente.
FAQ
Qual modelo devo usar: GPT-Transcribe ou GPT-Live-Transcribe?
Use gpt-transcribe para gravações concluídas e jobs assíncronos. Use gpt-live-transcribe quando o texto precisar chegar enquanto o áudio ainda está em streaming.
Quanto custam o GPT-Transcribe e o GPT-Live-Transcribe?
A OpenAI lista gpt-transcribe a $0.0045 por minuto de áudio ($0.27 por hora) e gpt-live-transcribe a $0.017 por minuto ($1.02 por hora).
O GPT-Live-Transcribe é mais preciso que o GPT-Realtime-Whisper?
No benchmark de Real-World Audio Recording da OpenAI, com nove idiomas, a taxa de erro de transcrição reportada caiu de 11.65% para 9.60%. Verifique esse resultado específico de benchmark em seu próprio áudio.
O GPT-Live-Transcribe suporta diarização ou timestamps de palavra?
Não. Ele não retorna rótulos de locutor, timestamps em nível de palavra ou pontuações de confiança. Use um modelo de arquivo compatível ou uma etapa de fallback quando esses campos forem necessários.
A migração do GPT-Realtime-Whisper é uma troca de modelo plug-and-play?
Não. Verifique configuração de sessão, campos de idioma, entradas de contexto, configurações de delay, ordenação de eventos, dependências de recursos, latência e qualidade de saída antes de mover tráfego de produção.
Teste rotas de transcrição com a CometAPI
Antes da implementação, verifique a disponibilidade atual de modelos e preços de rotas na página de preços da CometAPI e use a documentação da CometAPI para padrões de requisição compatíveis com a OpenAI. Fixe os IDs de modelo exatos nos testes e registre duração de áudio, nível de delay, latência do primeiro delta, latência da transcrição final, novas tentativas e taxa de transcrição aceita para que a decisão de roteamento reflita o custo total do fluxo de trabalho.
