GPT-Transcribe vs GPT-Live-Transcribe: prezzi, differenze API e migrazione
In breve
Usa gpt-transcribe per registrazioni complete a $0.0045 per minuto di audio e gpt-live-transcribe per microfoni, chiamate o flussi multimediali live a $0.017 al minuto. OpenAI riporta un errore di trascrizione più basso per il modello live rispetto a GPT-Realtime-Whisper sui benchmark pubblicati, ma la scelta giusta dipende da quando deve apparire il testo, da quali campi di output ti servono e da come entrambi i modelli si comportano sul tuo audio di produzione.
GPT-Transcribe vs GPT-Live-Transcribe in sintesi
Se ti serve la trascrizione solo dopo che l’audio è stato registrato, usa gpt-transcribe. Se la tua applicazione ha bisogno di testo mentre l’audio sta ancora arrivando, usa gpt-live-transcribe. La differenza più grande non è solo il prezzo, ma quando inizia la trascrizione e quale tipo di workflow API deve supportare la tua app.
| Voce | gpt-transcribe | gpt-live-transcribe |
|---|---|---|
| Ideale per | Registrazioni caricate, richieste audio delimitate, job asincroni e turni Realtime confermati | Microfoni, chiamate, riunioni e flussi multimediali live |
| Prezzo pubblicato | $0.0045 per minuto di audio | $0.017 per minuto di audio |
| Prezzo per ora di audio | $0.27 | $1.02 |
| API / endpoint | /v1/audio/transcriptions; workflow Realtime a turni confermati opzionale | Sessioni di trascrizione Realtime (v1/realtime/transcription_sessions o simili) |
| Connessione | Upload di file; risposta in streaming opzionale mentre il file è elaborato | WebSocket per pipeline server o WebRTC per audio da browser |
| Quando inizia la trascrizione | Dopo l’invio del file o il commit di un turno audio | Mentre l’audio sta arrivando |
| Output parziale della trascrizione | Sì, con streaming del file o streaming a turni confermati | Sì, mentre arriva il parlato live |
| Controlli di contesto | prompt, keywords, languages | prompt, keywords, languages, delay |
| Output lingua rilevata | Sì, quando il modello può fornire una previsione affidabile | No |
| Limitazioni importanti | Limite di upload a 25 MB; altri percorsi richiesti per timestamp, diarizzazione o traduzione | Nessun timestamp a livello di parola, etichette dei parlanti o punteggi di confidenza |
Sebbene gpt-transcribe possa restituire aggiornamenti parziali della trascrizione mentre elabora un file completo o un turno audio confermato, non è un percorso di streaming live continuo. Per sottotitoli live, chiamate o input da microfono, gpt-live-transcribe è la scelta migliore.
Per un confronto più ampio tra provider, vedi le 6 migliori API di riconoscimento vocale del 2026 di CometAPI: 6 Best Speech-to-Text APIs in 2026.
Che cosa sono GPT-Transcribe e GPT-Live-Transcribe?
OpenAI ha introdotto gpt-transcribe e gpt-live-transcribe il 29 luglio 2026. gpt-transcribe elabora registrazioni complete, trascrizioni di file in streaming e turni Realtime confermati, mentre gpt-live-transcribe restituisce aggiornamenti della trascrizione a bassa latenza mentre l’audio arriva da microfoni, chiamate o flussi multimediali live.
I due modelli forniscono nuovi percorsi predefiniti per trascrizione di file e live generale, ma workflow specializzati di Whisper e GPT-4o per trascrizione restano necessari per timestamp, traduzione, sottotitoli e diarizzazione dei parlanti.
Quando conviene pagare di più per GPT-Live-Transcribe?
La pagina dei prezzi API di OpenAI elenca gpt-transcribe a $0.0045 al minuto e gpt-live-transcribe a $0.017 al minuto. Il percorso live costa quindi circa 3,8 volte in più per minuto di audio.
| Volume audio mensile | gpt-transcribe | gpt-live-transcribe | Costo live aggiuntivo |
|---|---|---|---|
| 100 ore | $27 | $102 | $75 |
| 1.000 ore | $270 | $1,020 | $750 |
| 10.000 ore | $2,700 | $10,200 | $7,500 |
Queste stime di costo per la trascrizione utilizzano solo le tariffe base pubblicate da OpenAI: ore di audio × 60 × prezzo al minuto. Escludono archiviazione, trasporto di rete, retry, hosting dell’applicazione, post-elaborazione, correzione umana e costi di fallback provider.
Scegli gpt-live-transcribe quando didascalie immediate, assistenza agenti, moderazione o interazione in tempo reale fanno parte del requisito di prodotto. Scegli gpt-transcribe quando la trascrizione serve solo dopo che una riunione, chiamata, intervista o upload di media è completata. Un’architettura a due percorsi può usare trascrizione live per l’esperienza utente e trascrizione da file per l’elaborazione post-chiamata o i backfill.
Attualmente OpenAI elenca GPT-Realtime-Whisper e gpt-live-transcribe allo stesso prezzo base di $0.017 al minuto. Valuta una migrazione tra questi percorsi live sulla qualità della trascrizione accettata, latenza, gestione degli eventi e compatibilità operativa, non solo sul prezzo di listino.
In che cosa differiscono le API di GPT-Transcribe e GPT-Live-Transcribe?
La differenza principale è come l’audio entra nel sistema e quando iniziano gli eventi di trascrizione. gpt-transcribe accetta file completi o turni audio confermati, mentre gpt-live-transcribe mantiene una connessione Realtime ed emette aggiornamenti della trascrizione mentre l’audio sta ancora arrivando.
Usa GPT-Transcribe per audio completato
Per una registrazione completa, invia il file a /v1/audio/transcriptions. La guida alla trascrizione di file di OpenAI accetta file fino a 25 MB nei formati mp3, mp4, mpeg, mpga, m4a, wav o webm.
from openai import OpenAI
client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="gpt-transcribe",
file=audio_file,
prompt="A support call about a premium plan and account AC-42.",
extra_body={
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
},
)
print(transcript.text)
Imposta stream=True per ricevere eventi delta della trascrizione mentre OpenAI elabora la registrazione caricata. Questo riduce l’attesa per il testo visibile, ma non trasforma l’endpoint di file in un’ingestione live da microfono.
Usa GPT-Live-Transcribe per audio in arrivo
Crea una sessione Realtime con type: "transcription" e seleziona gpt-live-transcribe. Usa WebSocket per una pipeline media lato server o WebRTC per l’audio da browser.
{
"type": "session.update",
"session": {
"type": "transcription",
"audio": {
"input": {
"format": {
"type": "audio/pcm",
"rate": 24000
},
"transcription": {
"model": "gpt-live-transcribe",
"prompt": "A support call about a premium plan and account AC-42.",
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
"delay": "low"
},
"turn_detection": null
}
}
}
}
Accoda i chunk audio con input_audio_buffer.append. L’applicazione può confermare i turni con input_audio_buffer.commit oppure configurare il voice activity detection lato server.
La guida alla trascrizione Realtime restituisce testo incrementale tramite conversation.item.input_audio_transcription.delta, seguito da conversation.item.input_audio_transcription.completed per l’elemento confermato. Gli eventi di completamento di turni diversi non sono garantiti in ordine di arrivo, quindi riconcíliali usando item_id invece dell’ordine di arrivo.
Usa il percorso a turni confermati quando il testo immediato non è necessario
gpt-transcribe può anche essere eseguito in una sessione di trascrizione Realtime via WebSocket. La trascrizione inizia dopo che un turno audio è stato confermato, il modello può usare come contesto i turni trascritti in precedenza e l’evento di completamento può includere le lingue rilevate.
Questo percorso a turni confermati è utile quando lo streaming basato su turni o il rilevamento della lingua contano più della visualizzazione del testo mentre l’oratore sta ancora parlando. Non va confuso con il comportamento continuo e a latenza inferiore di gpt-live-transcribe.
In che modo prompt, keywords, languages e delay influenzano la trascrizione?
Entrambi i modelli accettano contesto che può migliorare il riconoscimento di nomi, numeri, acronimi, termini di prodotto, parlato con accento, audio multilingue e code-switching.
| Controllo | Scopo | Attenzione in produzione |
|---|---|---|
| prompt | Descrivi registrazione, speaker, dominio o argomento atteso | Un contesto troppo specifico può introdurre bias nella trascrizione |
| keywords | Fornisci nomi letterali, acronimi, formati di account o termini tecnici | Gli hint non sono output obbligatorio; verifica termini inseriti non pronunciati |
| languages | Elenca una o più lingue di input attese | Codici non supportati o formattati male causano il rifiuto |
| delay | Scambia delte live più precoci con più contesto acustico | Disponibile per gpt-live-transcribe; valuta con benchmark invece di assumere millisecondi fissi |
Per i nuovi modelli, languages sostituisce il precedente campo singolare language. Non inviarli entrambi. Ogni keyword deve rimanere su una sola riga e non può contenere <, >, carriage return o line feed; valori non validi causano il rifiuto della richiesta o dell’aggiornamento di sessione.
gpt-live-transcribe supporta le impostazioni di minimal, low, medium, high e xhigh per il delay. Impostazioni più basse favoriscono testo parziale più precoce, mentre quelle più alte forniscono più contesto audio e possono migliorare la qualità della trascrizione. OpenAI non promette una latenza fissa per ciascun livello, quindi misura il tempo al primo delta e il tempo alla trascrizione finale su microfoni, codec, reti, lingue e durate di sessione rappresentativi.
Cosa mostrano i benchmark di accuratezza di OpenAI?
L’annuncio di lancio di OpenAI riporta che gpt-live-transcribe ha superato GPT-Realtime-Whisper-1 in due test multilingue di trascrizione. Riporta anche che il contesto libero ha migliorato l’accuratezza semantica in una valutazione di Context Aware ASR.
| Valutazione OpenAI | Risultato gpt-live-transcribe | Confronto | Variazione riportata |
|---|---|---|---|
| Context Aware ASR, accuratezza semantica | 44,6% con contesto libero | 38,5% senza contesto | +6,1 punti percentuali |
| Common Voice, 22 lingue, tasso di errore di trascrizione | 19,70% | 20,33% per GPT-Realtime-Whisper-1 | -0,63 punti; circa 3,1% relativo |
| Real-World Audio Recording, 9 lingue, tasso di errore | 9,60% | 11,65% per GPT-Realtime-Whisper-1 | -2,05 punti; circa 17,6% relativo |
La conclusione difendibile è circoscritta: il nuovo modello live ha performato meglio nei test riportati da OpenAI, e il contesto ha migliorato il punteggio di accuratezza semantica riportato. Questi risultati riportati dal vendor non garantiscono lo stesso miglioramento per ogni lingua, codec di telefonia, microfono, impostazione di delay, vocabolario di dominio o politica di correzione.
Quando dovresti usare invece Whisper o GPT-4o Transcribe?
Nessuno dei due nuovi modelli sostituisce ogni workflow di speech-to-text.
| Requisito | Percorso consigliato |
|---|---|
| Trascrizione generale di file completati | gpt-transcribe |
| Didascalie live a bassa latenza o trascrizione chiamate | gpt-live-transcribe |
| Etichette dei parlanti per registrazioni complete | gpt-4o-transcribe-diarize con diarized_json |
| Timestamp di parola o segmento | whisper-1 con timestamp_granularities[] |
| Traduzione in inglese di audio non inglese completato | /v1/audio/translations con whisper-1 |
Per la diarizzazione, OpenAI richiede l’API di Transcriptions per file; le etichette dei parlanti non sono supportate nelle sessioni di trascrizione Realtime. Per registrazioni più lunghe di 30 secondi, configura chunking_strategy su "auto" o usa una configurazione di voice activity detection.
Per timestamp, sottotitoli, traduzione o workflow Whisper esistenti, vedi la guida all’API Whisper di CometAPI e la pagina del modello Whisper-1. I team che valutano un altro percorso di trascrizione file OpenAI possono anche consultare la pagina del modello GPT-4o Transcribe.
Come migrare da Whisper?
Cambiare l’ID del modello è solo il primo passo. Convalida l’intero workflow prima di spostare traffico in produzione.
| Verifica | Azione richiesta | Rischio se saltata |
|---|---|---|
| Selezione percorso | Separa registrazioni complete da carichi veramente live | Pagare la tariffa live per job asincroni |
| Campi lingua | Sostituisci language con languages per i nuovi modelli; non inviarli mai entrambi | Richieste o sessioni rifiutate |
| Hint di contesto | Prova prompt e keywords su nomi, numeri, gergo e parlato rumoroso | Termini distorti o inseriti |
| Impostazione delay | Esegui benchmark almeno di low, medium e high su audio rappresentativo | Scegliere velocità o accuratezza senza dati |
| Gestione eventi | Riconcilia delta e completed con item_id | Trascrizioni fuori ordine o sovrascritte |
| Parità funzionale | Inventaria dipendenze da diarizzazione, timestamp, confidenza, sottotitoli e traduzione | Campi a valle mancanti |
| Telemetria costi | Logga minuti audio, retry, risultati falliti, tempo di correzione e output accettati | Confondere prezzo di listino e costo del workflow |
| Rollout | Test ombra, canary su piccola quota di traffico e fallback pronto | Regressione ampia senza rollback rapido |
Per una migrazione da GPT-Realtime-Whisper, mantieni costanti formato audio, policy di rilevamento dei turni, set di test e target di latenza. Poiché il prezzo live pubblicato è invariato, dai priorità a tasso di trascrizioni accettate, distribuzione della latenza, stabilità dell’output e compatibilità con il resto della pipeline.
Guida alla migrazione (da Whisper / modelli precedenti)
OpenAI fornisce un cookbook ufficiale: Migrate from Whisper to GPT-Transcribe and GPT-Live-Transcribe.
Regole di alto livello:
- Audio registrato / batch → passa a gpt-transcribe sull’endpoint esistente /v1/audio/transcriptions.
- Audio live continuo → passa a gpt-live-transcribe in una sessione di trascrizione Realtime.
- Maggiore accuratezza dopo un turno confermato → usa gpt-transcribe all’interno di una sessione Realtime.
Esempio minimo di migrazione file (Python):
Python
# Before (Whisper)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="whisper-1", file=audio, language="en", prompt="Support call about AC-42" )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="gpt-transcribe", file=audio, prompt="A customer support call about billing", extra_body={ "keywords": ["AC-42", "Premium Plus"], "languages": ["en", "fr"] }, response_format="json" # or stream=True for deltas )
Note per migrazione live:
- Mantieni la stessa architettura di sessione Realtime / WebSocket.
- Cambia l’ID del modello e sostituisci il campo singolare language con l’array languages.
- Aggiungi prompt, keywords e delay opzionali (ad es. "low").
- Continua a gestire gli stessi eventi di delta/completed.
- Non inviare sia language sia languages.
Avvertenze importanti nella migrazione:
- GPT-Transcribe/GPT-Live-Transcribe non supportano timestamp a livello di parola, SRT/VTT o traduzione in inglese nello stesso modo di whisper-1. Mantieni Whisper per queste esigenze specifiche.
- I formati di risposta differiscono — non assumere che text, verbose_json, srt o vtt funzionino in modo identico.
- Le keywords devono essere stringhe letterali su singola riga (niente <, >, CR o LF) oppure la richiesta viene rifiutata.
- Testa su audio rappresentativo di produzione (accenti, rumore, termini di dominio, enunciati brevi) invece di fare affidamento solo su WER pubblicati.
Raccomandazione rapida
- Default per nuovi lavori: GPT-Transcribe per file/batch, GPT-Live-Transcribe per streaming live.
- Integrazioni esistenti di Whisper o GPT-4o-Transcribe continuano a funzionare ma non sono più il punto di partenza consigliato.
- I job batch sensibili ai costi traggono il massimo vantaggio dal passaggio a GPT-Transcribe ($0.0045 vs $0.006).
Per i dettagli più recenti, consulta le pagine ufficiali dei modelli e la guida panoramica sulla trascrizione sul sito degli sviluppatori OpenAI.
Come valutare i due modelli sull’audio di produzione?
Usa audio con licenza che rappresenti il prodotto, non solo clip dimostrative pulite.
- Seleziona almeno 50 registrazioni per i principali casi d’uso, lingue, dispositivi e condizioni audio.
- Includi accenti, interruzioni, rumore di fondo, code-switching, numeri, date, valute, indirizzi email e vocabolario di dominio.
- Esegui le registrazioni complete con
gpt-transcribecon e senza hint di contesto. - Riproduci gli stessi campioni live con
gpt-live-transcribea tre impostazioni di delay. - Mantieni costanti formati, confini dei turni, prompt e regole di scoring tra le esecuzioni.
- Misura errore di trascrizione, recall dei termini di dominio, revisioni del testo parziale, latenza p50 e p95, failure, retry e tempo di correzione umana.
- Calcola il costo per trascrizione accettata, quindi esegui un canary della policy di instradamento selezionata prima della migrazione completa.
Il design finale può usare un modello o entrambi. La metrica decisiva dovrebbe essere il costo e l’affidabilità di una trascrizione di produzione accettata, non il prezzo pubblicato al minuto isolatamente.
FAQ
Quale modello dovrei usare: GPT-Transcribe o GPT-Live-Transcribe?
Usa gpt-transcribe per registrazioni complete e job asincroni. Usa gpt-live-transcribe quando il testo deve arrivare mentre l’audio sta ancora facendo streaming.
Quanto costano GPT-Transcribe e GPT-Live-Transcribe?
OpenAI elenca gpt-transcribe a $0.0045 per minuto di audio ($0.27 all’ora) e gpt-live-transcribe a $0.017 al minuto ($1.02 all’ora).
GPT-Live-Transcribe è più accurato di GPT-Realtime-Whisper?
Sulla valutazione Real-World Audio Recording di nove lingue di OpenAI, il tasso di errore di trascrizione riportato è diminuito da 11,65% a 9,60%. Verifica questo risultato specifico del benchmark sul tuo audio.
GPT-Live-Transcribe supporta diarizzazione o timestamp delle parole?
No. Non restituisce etichette dei parlanti, timestamp a livello di parola o punteggi di confidenza. Usa un modello file compatibile o uno step di fallback quando tali campi sono richiesti.
La migrazione da GPT-Realtime-Whisper è uno scambio di modello drop-in?
No. Verifica configurazione della sessione, campi di lingua, input di contesto, impostazioni di delay, ordinamento degli eventi, dipendenze funzionali, latenza e qualità dell’output prima di spostare traffico di produzione.
Testa i percorsi di trascrizione con CometAPI
Prima dell’implementazione, verifica disponibilità dei modelli attuali e prezzi dei percorsi sulla pagina prezzi di CometAPI e usa la documentazione CometAPI per pattern di richieste compatibili con OpenAI. Fissa ID modello esatti nei test e registra durata audio, livello di delay, latenza del primo delta, latenza della trascrizione finale, retry e tasso di trascrizioni accettate affinché la decisione di instradamento rifletta il costo complessivo del workflow.
