GPT-5.6 Luna price down 80%, Terra down 20% →

GPT-Transcribe vs GPT-Live-Transcribe: API e prezzi

CometAPI
Mia MarenJul 31, 2026
GPT-Transcribe vs GPT-Live-Transcribe: API e prezzi

GPT-Transcribe vs GPT-Live-Transcribe: prezzi, differenze API e migrazione

In breve

Usa gpt-transcribe per registrazioni complete a $0.0045 per minuto di audio e gpt-live-transcribe per microfoni, chiamate o flussi multimediali live a $0.017 al minuto. OpenAI riporta un errore di trascrizione più basso per il modello live rispetto a GPT-Realtime-Whisper sui benchmark pubblicati, ma la scelta giusta dipende da quando deve apparire il testo, da quali campi di output ti servono e da come entrambi i modelli si comportano sul tuo audio di produzione.

GPT-Transcribe vs GPT-Live-Transcribe in sintesi

Se ti serve la trascrizione solo dopo che l’audio è stato registrato, usa gpt-transcribe. Se la tua applicazione ha bisogno di testo mentre l’audio sta ancora arrivando, usa gpt-live-transcribe. La differenza più grande non è solo il prezzo, ma quando inizia la trascrizione e quale tipo di workflow API deve supportare la tua app.

Vocegpt-transcribegpt-live-transcribe
Ideale perRegistrazioni caricate, richieste audio delimitate, job asincroni e turni Realtime confermatiMicrofoni, chiamate, riunioni e flussi multimediali live
Prezzo pubblicato$0.0045 per minuto di audio$0.017 per minuto di audio
Prezzo per ora di audio$0.27$1.02
API / endpoint/v1/audio/transcriptions; workflow Realtime a turni confermati opzionaleSessioni di trascrizione Realtime (v1/realtime/transcription_sessions o simili)
ConnessioneUpload di file; risposta in streaming opzionale mentre il file è elaboratoWebSocket per pipeline server o WebRTC per audio da browser
Quando inizia la trascrizioneDopo l’invio del file o il commit di un turno audioMentre l’audio sta arrivando
Output parziale della trascrizioneSì, con streaming del file o streaming a turni confermatiSì, mentre arriva il parlato live
Controlli di contestoprompt, keywords, languagesprompt, keywords, languages, delay
Output lingua rilevataSì, quando il modello può fornire una previsione affidabileNo
Limitazioni importantiLimite di upload a 25 MB; altri percorsi richiesti per timestamp, diarizzazione o traduzioneNessun timestamp a livello di parola, etichette dei parlanti o punteggi di confidenza

Sebbene gpt-transcribe possa restituire aggiornamenti parziali della trascrizione mentre elabora un file completo o un turno audio confermato, non è un percorso di streaming live continuo. Per sottotitoli live, chiamate o input da microfono, gpt-live-transcribe è la scelta migliore.

Per un confronto più ampio tra provider, vedi le 6 migliori API di riconoscimento vocale del 2026 di CometAPI: 6 Best Speech-to-Text APIs in 2026.

Che cosa sono GPT-Transcribe e GPT-Live-Transcribe?

OpenAI ha introdotto gpt-transcribe e gpt-live-transcribe il 29 luglio 2026. gpt-transcribe elabora registrazioni complete, trascrizioni di file in streaming e turni Realtime confermati, mentre gpt-live-transcribe restituisce aggiornamenti della trascrizione a bassa latenza mentre l’audio arriva da microfoni, chiamate o flussi multimediali live.

I due modelli forniscono nuovi percorsi predefiniti per trascrizione di file e live generale, ma workflow specializzati di Whisper e GPT-4o per trascrizione restano necessari per timestamp, traduzione, sottotitoli e diarizzazione dei parlanti.

Quando conviene pagare di più per GPT-Live-Transcribe?

La pagina dei prezzi API di OpenAI elenca gpt-transcribe a $0.0045 al minuto e gpt-live-transcribe a $0.017 al minuto. Il percorso live costa quindi circa 3,8 volte in più per minuto di audio.

Volume audio mensilegpt-transcribegpt-live-transcribeCosto live aggiuntivo
100 ore$27$102$75
1.000 ore$270$1,020$750
10.000 ore$2,700$10,200$7,500

Queste stime di costo per la trascrizione utilizzano solo le tariffe base pubblicate da OpenAI: ore di audio × 60 × prezzo al minuto. Escludono archiviazione, trasporto di rete, retry, hosting dell’applicazione, post-elaborazione, correzione umana e costi di fallback provider.

Scegli gpt-live-transcribe quando didascalie immediate, assistenza agenti, moderazione o interazione in tempo reale fanno parte del requisito di prodotto. Scegli gpt-transcribe quando la trascrizione serve solo dopo che una riunione, chiamata, intervista o upload di media è completata. Un’architettura a due percorsi può usare trascrizione live per l’esperienza utente e trascrizione da file per l’elaborazione post-chiamata o i backfill.

Attualmente OpenAI elenca GPT-Realtime-Whisper e gpt-live-transcribe allo stesso prezzo base di $0.017 al minuto. Valuta una migrazione tra questi percorsi live sulla qualità della trascrizione accettata, latenza, gestione degli eventi e compatibilità operativa, non solo sul prezzo di listino.

In che cosa differiscono le API di GPT-Transcribe e GPT-Live-Transcribe?

La differenza principale è come l’audio entra nel sistema e quando iniziano gli eventi di trascrizione. gpt-transcribe accetta file completi o turni audio confermati, mentre gpt-live-transcribe mantiene una connessione Realtime ed emette aggiornamenti della trascrizione mentre l’audio sta ancora arrivando.

Usa GPT-Transcribe per audio completato

Per una registrazione completa, invia il file a /v1/audio/transcriptions. La guida alla trascrizione di file di OpenAI accetta file fino a 25 MB nei formati mp3, mp4, mpeg, mpga, m4a, wav o webm.

from openai import OpenAI

client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
    transcript = client.audio.transcriptions.create(
        model="gpt-transcribe",
        file=audio_file,
        prompt="A support call about a premium plan and account AC-42.",
        extra_body={
            "keywords": ["premium plan", "AC-42", "billing"],
            "languages": ["en"],
        },
    )
print(transcript.text)

Imposta stream=True per ricevere eventi delta della trascrizione mentre OpenAI elabora la registrazione caricata. Questo riduce l’attesa per il testo visibile, ma non trasforma l’endpoint di file in un’ingestione live da microfono.

Usa GPT-Live-Transcribe per audio in arrivo

Crea una sessione Realtime con type: "transcription" e seleziona gpt-live-transcribe. Usa WebSocket per una pipeline media lato server o WebRTC per l’audio da browser.

{
  "type": "session.update",
  "session": {
    "type": "transcription",
    "audio": {
      "input": {
        "format": {
          "type": "audio/pcm",
          "rate": 24000
        },
        "transcription": {
          "model": "gpt-live-transcribe",
          "prompt": "A support call about a premium plan and account AC-42.",
          "keywords": ["premium plan", "AC-42", "billing"],
          "languages": ["en"],
          "delay": "low"
        },
        "turn_detection": null
      }
    }
  }
}

Accoda i chunk audio con input_audio_buffer.append. L’applicazione può confermare i turni con input_audio_buffer.commit oppure configurare il voice activity detection lato server.

La guida alla trascrizione Realtime restituisce testo incrementale tramite conversation.item.input_audio_transcription.delta, seguito da conversation.item.input_audio_transcription.completed per l’elemento confermato. Gli eventi di completamento di turni diversi non sono garantiti in ordine di arrivo, quindi riconcíliali usando item_id invece dell’ordine di arrivo.

Usa il percorso a turni confermati quando il testo immediato non è necessario

gpt-transcribe può anche essere eseguito in una sessione di trascrizione Realtime via WebSocket. La trascrizione inizia dopo che un turno audio è stato confermato, il modello può usare come contesto i turni trascritti in precedenza e l’evento di completamento può includere le lingue rilevate.

Questo percorso a turni confermati è utile quando lo streaming basato su turni o il rilevamento della lingua contano più della visualizzazione del testo mentre l’oratore sta ancora parlando. Non va confuso con il comportamento continuo e a latenza inferiore di gpt-live-transcribe.

In che modo prompt, keywords, languages e delay influenzano la trascrizione?

Entrambi i modelli accettano contesto che può migliorare il riconoscimento di nomi, numeri, acronimi, termini di prodotto, parlato con accento, audio multilingue e code-switching.

ControlloScopoAttenzione in produzione
promptDescrivi registrazione, speaker, dominio o argomento attesoUn contesto troppo specifico può introdurre bias nella trascrizione
keywordsFornisci nomi letterali, acronimi, formati di account o termini tecniciGli hint non sono output obbligatorio; verifica termini inseriti non pronunciati
languagesElenca una o più lingue di input atteseCodici non supportati o formattati male causano il rifiuto
delayScambia delte live più precoci con più contesto acusticoDisponibile per gpt-live-transcribe; valuta con benchmark invece di assumere millisecondi fissi

Per i nuovi modelli, languages sostituisce il precedente campo singolare language. Non inviarli entrambi. Ogni keyword deve rimanere su una sola riga e non può contenere <, >, carriage return o line feed; valori non validi causano il rifiuto della richiesta o dell’aggiornamento di sessione.

gpt-live-transcribe supporta le impostazioni di minimal, low, medium, high e xhigh per il delay. Impostazioni più basse favoriscono testo parziale più precoce, mentre quelle più alte forniscono più contesto audio e possono migliorare la qualità della trascrizione. OpenAI non promette una latenza fissa per ciascun livello, quindi misura il tempo al primo delta e il tempo alla trascrizione finale su microfoni, codec, reti, lingue e durate di sessione rappresentativi.

Cosa mostrano i benchmark di accuratezza di OpenAI?

L’annuncio di lancio di OpenAI riporta che gpt-live-transcribe ha superato GPT-Realtime-Whisper-1 in due test multilingue di trascrizione. Riporta anche che il contesto libero ha migliorato l’accuratezza semantica in una valutazione di Context Aware ASR.

Valutazione OpenAIRisultato gpt-live-transcribeConfrontoVariazione riportata
Context Aware ASR, accuratezza semantica44,6% con contesto libero38,5% senza contesto+6,1 punti percentuali
Common Voice, 22 lingue, tasso di errore di trascrizione19,70%20,33% per GPT-Realtime-Whisper-1-0,63 punti; circa 3,1% relativo
Real-World Audio Recording, 9 lingue, tasso di errore9,60%11,65% per GPT-Realtime-Whisper-1-2,05 punti; circa 17,6% relativo

La conclusione difendibile è circoscritta: il nuovo modello live ha performato meglio nei test riportati da OpenAI, e il contesto ha migliorato il punteggio di accuratezza semantica riportato. Questi risultati riportati dal vendor non garantiscono lo stesso miglioramento per ogni lingua, codec di telefonia, microfono, impostazione di delay, vocabolario di dominio o politica di correzione.

Quando dovresti usare invece Whisper o GPT-4o Transcribe?

Nessuno dei due nuovi modelli sostituisce ogni workflow di speech-to-text.

RequisitoPercorso consigliato
Trascrizione generale di file completatigpt-transcribe
Didascalie live a bassa latenza o trascrizione chiamategpt-live-transcribe
Etichette dei parlanti per registrazioni completegpt-4o-transcribe-diarize con diarized_json
Timestamp di parola o segmentowhisper-1 con timestamp_granularities[]
Traduzione in inglese di audio non inglese completato/v1/audio/translations con whisper-1

Per la diarizzazione, OpenAI richiede l’API di Transcriptions per file; le etichette dei parlanti non sono supportate nelle sessioni di trascrizione Realtime. Per registrazioni più lunghe di 30 secondi, configura chunking_strategy su "auto" o usa una configurazione di voice activity detection.

Per timestamp, sottotitoli, traduzione o workflow Whisper esistenti, vedi la guida all’API Whisper di CometAPI e la pagina del modello Whisper-1. I team che valutano un altro percorso di trascrizione file OpenAI possono anche consultare la pagina del modello GPT-4o Transcribe.

Come migrare da Whisper?

Cambiare l’ID del modello è solo il primo passo. Convalida l’intero workflow prima di spostare traffico in produzione.

VerificaAzione richiestaRischio se saltata
Selezione percorsoSepara registrazioni complete da carichi veramente livePagare la tariffa live per job asincroni
Campi linguaSostituisci language con languages per i nuovi modelli; non inviarli mai entrambiRichieste o sessioni rifiutate
Hint di contestoProva prompt e keywords su nomi, numeri, gergo e parlato rumorosoTermini distorti o inseriti
Impostazione delayEsegui benchmark almeno di low, medium e high su audio rappresentativoScegliere velocità o accuratezza senza dati
Gestione eventiRiconcilia delta e completed con item_idTrascrizioni fuori ordine o sovrascritte
Parità funzionaleInventaria dipendenze da diarizzazione, timestamp, confidenza, sottotitoli e traduzioneCampi a valle mancanti
Telemetria costiLogga minuti audio, retry, risultati falliti, tempo di correzione e output accettatiConfondere prezzo di listino e costo del workflow
RolloutTest ombra, canary su piccola quota di traffico e fallback prontoRegressione ampia senza rollback rapido

Per una migrazione da GPT-Realtime-Whisper, mantieni costanti formato audio, policy di rilevamento dei turni, set di test e target di latenza. Poiché il prezzo live pubblicato è invariato, dai priorità a tasso di trascrizioni accettate, distribuzione della latenza, stabilità dell’output e compatibilità con il resto della pipeline.

Guida alla migrazione (da Whisper / modelli precedenti)

OpenAI fornisce un cookbook ufficiale: Migrate from Whisper to GPT-Transcribe and GPT-Live-Transcribe.

Regole di alto livello:

  1. Audio registrato / batch → passa a gpt-transcribe sull’endpoint esistente /v1/audio/transcriptions.
  2. Audio live continuo → passa a gpt-live-transcribe in una sessione di trascrizione Realtime.
  3. Maggiore accuratezza dopo un turno confermato → usa gpt-transcribe all’interno di una sessione Realtime.

Esempio minimo di migrazione file (Python):

Python

# Before (Whisper)with open("meeting.wav", "rb") as audio:    result = client.audio.transcriptions.create(        model="whisper-1",        file=audio,        language="en",        prompt="Support call about AC-42"    )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio:    result = client.audio.transcriptions.create(        model="gpt-transcribe",        file=audio,        prompt="A customer support call about billing",        extra_body={            "keywords": ["AC-42", "Premium Plus"],            "languages": ["en", "fr"]        },        response_format="json"  # or stream=True for deltas    )

Note per migrazione live:

  • Mantieni la stessa architettura di sessione Realtime / WebSocket.
  • Cambia l’ID del modello e sostituisci il campo singolare language con l’array languages.
  • Aggiungi prompt, keywords e delay opzionali (ad es. "low").
  • Continua a gestire gli stessi eventi di delta/completed.
  • Non inviare sia language sia languages.

Avvertenze importanti nella migrazione:

  • GPT-Transcribe/GPT-Live-Transcribe non supportano timestamp a livello di parola, SRT/VTT o traduzione in inglese nello stesso modo di whisper-1. Mantieni Whisper per queste esigenze specifiche.
  • I formati di risposta differiscono — non assumere che text, verbose_json, srt o vtt funzionino in modo identico.
  • Le keywords devono essere stringhe letterali su singola riga (niente <, >, CR o LF) oppure la richiesta viene rifiutata.
  • Testa su audio rappresentativo di produzione (accenti, rumore, termini di dominio, enunciati brevi) invece di fare affidamento solo su WER pubblicati.

Raccomandazione rapida

  • Default per nuovi lavori: GPT-Transcribe per file/batch, GPT-Live-Transcribe per streaming live.
  • Integrazioni esistenti di Whisper o GPT-4o-Transcribe continuano a funzionare ma non sono più il punto di partenza consigliato.
  • I job batch sensibili ai costi traggono il massimo vantaggio dal passaggio a GPT-Transcribe ($0.0045 vs $0.006).

Per i dettagli più recenti, consulta le pagine ufficiali dei modelli e la guida panoramica sulla trascrizione sul sito degli sviluppatori OpenAI.

Come valutare i due modelli sull’audio di produzione?

Usa audio con licenza che rappresenti il prodotto, non solo clip dimostrative pulite.

  1. Seleziona almeno 50 registrazioni per i principali casi d’uso, lingue, dispositivi e condizioni audio.
  2. Includi accenti, interruzioni, rumore di fondo, code-switching, numeri, date, valute, indirizzi email e vocabolario di dominio.
  3. Esegui le registrazioni complete con gpt-transcribe con e senza hint di contesto.
  4. Riproduci gli stessi campioni live con gpt-live-transcribe a tre impostazioni di delay.
  5. Mantieni costanti formati, confini dei turni, prompt e regole di scoring tra le esecuzioni.
  6. Misura errore di trascrizione, recall dei termini di dominio, revisioni del testo parziale, latenza p50 e p95, failure, retry e tempo di correzione umana.
  7. Calcola il costo per trascrizione accettata, quindi esegui un canary della policy di instradamento selezionata prima della migrazione completa.

Il design finale può usare un modello o entrambi. La metrica decisiva dovrebbe essere il costo e l’affidabilità di una trascrizione di produzione accettata, non il prezzo pubblicato al minuto isolatamente.

FAQ

Quale modello dovrei usare: GPT-Transcribe o GPT-Live-Transcribe?

Usa gpt-transcribe per registrazioni complete e job asincroni. Usa gpt-live-transcribe quando il testo deve arrivare mentre l’audio sta ancora facendo streaming.

Quanto costano GPT-Transcribe e GPT-Live-Transcribe?

OpenAI elenca gpt-transcribe a $0.0045 per minuto di audio ($0.27 all’ora) e gpt-live-transcribe a $0.017 al minuto ($1.02 all’ora).

GPT-Live-Transcribe è più accurato di GPT-Realtime-Whisper?

Sulla valutazione Real-World Audio Recording di nove lingue di OpenAI, il tasso di errore di trascrizione riportato è diminuito da 11,65% a 9,60%. Verifica questo risultato specifico del benchmark sul tuo audio.

GPT-Live-Transcribe supporta diarizzazione o timestamp delle parole?

No. Non restituisce etichette dei parlanti, timestamp a livello di parola o punteggi di confidenza. Usa un modello file compatibile o uno step di fallback quando tali campi sono richiesti.

La migrazione da GPT-Realtime-Whisper è uno scambio di modello drop-in?

No. Verifica configurazione della sessione, campi di lingua, input di contesto, impostazioni di delay, ordinamento degli eventi, dipendenze funzionali, latenza e qualità dell’output prima di spostare traffico di produzione.

Testa i percorsi di trascrizione con CometAPI

Prima dell’implementazione, verifica disponibilità dei modelli attuali e prezzi dei percorsi sulla pagina prezzi di CometAPI e usa la documentazione CometAPI per pattern di richieste compatibili con OpenAI. Fissa ID modello esatti nei test e registra durata audio, livello di delay, latenza del primo delta, latenza della trascrizione finale, retry e tasso di trascrizioni accettate affinché la decisione di instradamento rifletta il costo complessivo del workflow.

44 visualizzazioni
Revisionato per chiarezza, attribuzione delle fonti e terminologia API aggiornata.

Pronto a ridurre i costi di sviluppo AI del 20%?

Inizia gratuitamente in pochi minuti. Crediti di prova gratuiti inclusi. Nessuna carta di credito richiesta.

Leggi di più