Claude Opus 5 is now live on CometAPI →

Le 6 migliori API di conversione voce-testo nel 2026: prezzi, latenza e idoneità alla produzione

CometAPI
Mia MarenJul 27, 2026
Le 6 migliori API di conversione voce-testo nel 2026: prezzi, latenza e idoneità alla produzione

TL;DR

Non esiste una API speech-to-text universalmente migliore. AssemblyAI Universal-2 e Google Dynamic Batch sono ottimi punti di partenza a basso costo per audio registrato. Deepgram, AssemblyAI ed ElevenLabs meritano test preliminari per sottotitoli live e agenti vocali. OpenAI è comoda quando il resto del prodotto usa già l’SDK di OpenAI, mentre AWS e Google possono ridurre gli attriti operativi all’interno di uno stack cloud esistente.

Non scegliere solo in base al prezzo al minuto. Il costo in produzione dipende anche dalla fatturazione per canale, dalle tariffe per diarizzazione e oscuramento, dalla latenza di finalizzazione p95, dai retry, dalle condizioni sui dati e dai minuti che una persona impiega per correggere ogni trascrizione accettata.

Come scegliere una API speech-to-text: quale provider testare per primo?

Inizia dal tuo workload anziché da una classifica universale dei provider. La API giusta dipende se ti servono trascrizione batch a basso costo, streaming a bassa latenza, supporto multilingue, separazione dei parlanti, oppure un’integrazione più stretta con uno stack cloud esistente.

Usa la shortlist seguente per decidere quali provider includere nel primo benchmark.

WorkloadStart withWhyDecision-breaking test
Ampio archivio registratoAssemblyAI Universal-2, Google Dynamic Batch, OpenAI gpt-4o-mini-transcribePrezzi pubblicati bassi per audio registratoTempo in coda, gestione di file lunghi, formattazione e minuti di correzione
Sottotitoli live o agenti vocaliDeepgram Nova-3 o Flux, AssemblyAI Realtime, ElevenLabs Scribe v2 RealtimeAPI di streaming con workflow di risultati parziali e rilevamento dei turniLatenza dei parziali stabili, ritardo di finalizzazione, interruzioni e riconnessioni
Chiamate di contact centerAWS Transcribe, Google Cloud STT, Deepgram, AssemblyAIGestione dei canali, diarizzazione, controlli del vocabolario e opzioni di oscuramentoFatturazione per canale, parlato sovrapposto, policy PII ed elaborazione regionale
Riunioni o media multilingueAssemblyAI Universal-3.5 Pro, ElevenLabs Scribe v2, Deepgram Nova-3 Multilingual, OpenAI transcription modelsAmpia copertura linguistica o supporto al code switchingLe tue coppie di lingue reali, accenti, nomi, timestamp e segmenti a lingue miste

Confronto prezzi delle API speech-to-text: panoramica 2026

La tabella normalizza i prezzi di listino pubblici a un’ora di audio per una visione rapida. Non implica qualità, latenza, copertura funzionale o condizioni commerciali equivalenti. I prezzi promozionali, a priorità inferiore e per volumi elevati sono etichettati perché non sono direttamente equivalenti alle tariffe di ingresso ordinarie.

ProviderMiglior aderenza alla produzionePrezzo per audio registrato o asincronoPrezzo live o standardAvvertenza più importante
OpenAIApplicazioni OpenAI esistenti e trascrizione semplice di file caricatigpt-4o-mini-transcribe: $0.18/hr; gpt-4o-transcribe: $0.36/hrgpt-realtime-whisper: $1.02/hrI caricamenti sono limitati a 25 MB. A livello di parola, timestamp_granularities[] è documentato solo per whisper-1; la diarizzazione usa un modello separato e non è supportata nell’API Realtime.
DeepgramControllo dello streaming, sottotitoli live e pipeline per agenti vocaliNova-3 Monolingual pre-recorded: $0.462/hrStreaming monolinguale Nova-3: $0.288/hr promozionaleDiarizzazione e oscuramento aggiungono ciascuna $0.0020/min; il prompting dei termini chiave aggiunge $0.0013/min. Le tariffe elencate includono l’adesione al Model Improvement Program.
AssemblyAITrascrizione registrata a basso costo e funzionalità con prezzi chiariUniversal-2: $0.15/hr; Universal-3.5 Pro: $0.21/hrUniversal-Streaming: $0.15/hr; Universal-3.5 Pro Realtime: $0.45/hrI file multicanale sono fatturati per canale. Le rotte di streaming da $0.15/hr supportano l’inglese o sei lingue, non l’intera copertura di 99 lingue di Universal-2.
Google Cloud Speech-to-Text V2Workload nativi GCP e archivi a bassa prioritàDynamic Batch: $0.18/hrRiconoscimento standard: $0.96/hr per i primi 500.000 minuti mensiliDynamic Batch opera con urgenza inferiore. Ogni canale audio viene fatturato separatamente.
Amazon TranscribeContact center nativi AWS e audio di chiamate a due canaliSuddiviso per regione e volume; esempio ufficiale US East a 2M minuti: $0.36/hrEsempio ufficiale US East a 2M minuti: $0.60/hrQuesti sono esempi ad alto volume, non prezzi di ingresso universali. Le richieste hanno un minimo di 15 secondi; fino a due canali sono inclusi nel calcolo della durata.
ElevenLabs ScribeMedia multilingue, tempi parola e sperimentazioni real-time rapideScribe v2: $0.22/hrScribe v2 Realtime: $0.39/hrIl rilevamento entità aggiunge $0.07/hr e il prompting dei termini chiave aggiunge $0.05/hr. La latenza del vendor non include il tuo percorso di rete e applicativo.

Scorciatoia per sviluppatori: Se la tua shortlist include Whisper, GPT-4o Transcribe o un altro modello di speech attualmente supportato da CometAPI, consulta il catalogo dei modelli live e prezzi e usa il Quickstart compatibile con OpenAI per eseguire lo stesso audio sulle rotte supportate. Conferma l’ID modello esatto e l’endpoint prima di costruire il benchmark.

Analisi dettagliata dei vendor: confronto di 6 API

1. OpenAI: ideale per i team che già usano l’SDK di OpenAI

La pagina dei prezzi di OpenAI stima la trascrizione a $0.003 al minuto per gpt-4o-mini-transcribe e $0.006 al minuto per gpt-4o-transcribe. La route dedicata gpt-realtime-whisper è indicata a circa $0.017 al minuto.

OpenAI è una prima scelta pratica per i team che già usano l’SDK di OpenAI per autenticazione, logging, retry e governance dei modelli. Sia gpt-4o-transcribe sia gpt-4o-mini-transcribe supportano il prompting, che può migliorare il riconoscimento di nomi di prodotto, acronimi, persone e vocabolario specifico di dominio. Per registrazioni che richiedono identificazione dei parlanti, il modello separato gpt-4o-transcribe-diarize può restituire segmenti etichettati per parlante e associarli a parlanti noti usando brevi clip di riferimento.

Le principali limitazioni sono architetturali piuttosto che solo di prezzo. I file caricati sono limitati a 25 MB, il timestamp_granularities[] a livello di parola è documentato per whisper-1, e il modello di diarizzazione non è disponibile tramite la Realtime API. I team che elaborano registrazioni lunghe, conversazioni live o audio di contact center con molti parlanti dovrebbero testare gestione dei file, requisiti di timestamp e attribuzione dei parlanti prima di standardizzare su una route OpenAI. Consulta la documentazione speech-to-text di OpenAI per il comportamento attuale degli endpoint e i formati di output supportati.

I team che vogliono usare GPT-4o Transcribe riducendo i costi API diretti possono anche esaminare la GPT-4o Transcribe API su CometAPI. Al momento della stesura, CometAPI indica un accesso a un prezzo inferiore rispetto ai prezzi standard dell’API diretta di OpenAI, mantenendo un percorso di integrazione compatibile con OpenAI. Verifica la pagina del modello live prima del benchmark perché prezzi, disponibilità e parametri supportati possono cambiare.

Prova OpenAI per primo quando: la tua applicazione usa già strumenti compatibili con OpenAI, la maggior parte dell’audio viene caricata invece di essere trasmessa in continuo, e ridurre la complessità d’integrazione conta più di controlli specializzati per streaming o contact center.

2. Deepgram: ideale per controllo dello streaming e pipeline di agenti vocali

La pagina dei prezzi di Deepgram mostra tariffe di streaming a tempo limitato di $0.0048 al minuto per Nova-3 Monolingual e $0.0058 al minuto per Nova-3 Multilingual. Le corrispondenti tariffe pay-as-you-go per preregistrato sono $0.0077 e $0.0092 al minuto. Flux è pensato per agenti vocali conversazionali con rilevamento dei turni e gestione delle interruzioni.

Deepgram merita di essere nella shortlist dei prodotti live perché il comportamento in streaming conta quanto l’accuratezza finale della trascrizione. Un’interfaccia vocale ha bisogno di risultati parziali utili, endpointing affidabile, gestione naturale delle interruzioni e finalizzazione prevedibile—non solo di una trascrizione pulita dopo la fine della chiamata.

Considera gli add-on nel budget insieme al modello. La diarizzazione e l’oscuramento aggiungono ciascuna $0.0020 al minuto; il prompting dei termini chiave aggiunge $0.0013 al minuto. Deepgram inoltre afferma che le tariffe elencate includono l’adesione al Model Improvement Program, quindi i team con requisiti più rigidi sull’uso dei dati dovrebbero verificare termini commerciali alternativi.

Prova Deepgram per primo quando: la gestione dei turni, i parziali a bassa latenza, il controllo dello streaming o il comportamento dell’agente vocale sono i requisiti principali.

3. AssemblyAI: miglior route a basso costo per registrato con prezzi trasparenti degli add-on

I prezzi di AssemblyAI elencano Universal-2 a $0.15 per ora di audio e Universal-3.5 Pro a $0.21 per ora. Universal-2 supporta 99 lingue; Universal-3.5 Pro supporta 18 lingue con code switching e un tier di modello più avanzato.

La linea di prodotto real-time è separata. Universal-Streaming costa $0.15 all’ora per l’inglese, e Universal-Streaming Multilingual copre inglese, spagnolo, tedesco, francese, portoghese e italiano allo stesso prezzo. Universal-3.5 Pro Realtime costa $0.45 all’ora e supporta 18 lingue.

La matrice esplicita degli add-on di AssemblyAI semplifica la pianificazione: la diarizzazione per registrato costa $0.02 all’ora, la diarizzazione in tempo reale $0.12 all’ora, e il prompting dei termini chiave in Universal-Streaming $0.04 all’ora. I file multicanale sono fatturati per canale, il che può cambiare il risultato per chiamate stereo.

Prova AssemblyAI per primo quando: costo basso per audio registrato, ampia copertura linguistica, prezzi delle funzionalità chiari o un workflow asincrono semplice sono prioritari.

4. Google Cloud Speech-to-Text: ideale per Dynamic Batch e workload nativi GCP

I prezzi di Google Cloud Speech-to-Text V2 elencano Dynamic Batch a $0.003 al minuto e il riconoscimento standard a $0.016 al minuto per i primi 500.000 minuti mensili. I prezzi standard scendono a livelli di utilizzo superiori.

Dynamic Batch è interessante per archivi che non richiedono un turnaround urgente, ma il prezzo più basso è legato a un’urgenza di elaborazione inferiore. Google fattura anche ogni canale audio separatamente: una richiesta da 30 secondi e quattro canali viene fatturata come 120 secondi di audio elaborato.

Google è spesso attraente operativamente quando l’audio è già in Cloud Storage e il team usa identità GCP, logging, endpoint regionali e controlli di fatturazione. Aggiungi archiviazione, trasferimento e servizi cloud adiacenti al modello di costo totale invece di trattare la trascrizione come voce isolata.

Prova Google per primo quando: grandi archivi non urgenti, operazioni native GCP, distribuzione regionale o funzionalità di adattamento contano più della tabella prezzi più semplice.

5. Amazon Transcribe: ideale per audio di contact center nativi AWS

I prezzi di Amazon Transcribe variano per regione e tier di utilizzo mensile. L’esempio pubblico di AWS per due milioni di minuti mensili negli US East usa $0.006 al minuto per batch e $0.01 al minuto per streaming. Queste cifre sono esempi ad alto volume, non preventivi di ingresso ordinari.

L’uso è fatturato a incrementi di un secondo con un minimo di 15 secondi per richiesta. Il pricing standard include vocabolari personalizzati, filtraggio del vocabolario, diarizzazione e identificazione della lingua; l’oscuramento automatico dei contenuti e i modelli linguistici personalizzati hanno costi extra.

AWS include fino a due canali nel calcolo della durata dell’audio. Per chiamate stereo di supporto, questa regola può essere più favorevole rispetto a un provider che fattura ogni canale come ora separata.

Prova AWS per primo quando: le chiamate passano già attraverso AWS, la fatturazione a due canali è preziosa, oppure integrazione con IAM, storage, sicurezza e acquisti pesa più del prezzo di listino più basso.

6. ElevenLabs Scribe: ideale per media multilingue e rapide sperimentazioni real-time

I prezzi API di ElevenLabs elencano Scribe v2 a $0.22 all’ora e Scribe v2 Realtime a $0.39 all’ora. Il prodotto include trascrizione multilingue, timestamp a livello di parola, diarizzazione, tagging audio e funzionalità opzionali di keyterm ed entità.

Scribe v2 Realtime pubblicizza bassa latenza del modello, ma un acquirente dovrebbe misurare l’intero percorso dalla cattura del microfono al testo stabile nella regione e nello stack di trasporto target. La latenza del vendor non include la tua gestione WebSocket, il percorso di rete, il buffering, gli aggiornamenti UI o la logica dell’agente a valle.

Il rilevamento entità aggiunge $0.07 all’ora e il prompting dei termini chiave aggiunge $0.05 all’ora. Includi entrambi nel costo della trascrizione accettata quando sono richiesti dal prodotto.

Prova ElevenLabs per primo quando: media multilingue, tempi parola, tag audio o un prototipo real-time veloce sono requisiti centrali.

TCO: costi nascosti che possono invertire la classifica

Fatturazione multicanale

Una chiamata stereo di un’ora non è sempre un’ora fatturabile.

RouteCalcolo di pianificazione per una chiamata da 60 minuti a due canaliCosto base stimato
AssemblyAI Universal-21 ora × 2 canali × $0.15/hr$0.30
AWS Transcribe batch1 ora totale × $0.36/hr$0.36
Riconoscimento standard Google1 ora × 2 canali × $0.96/hr$1.92

*Il valore AWS usa l’esempio ufficiale del provider per US East a due milioni di minuti mensili. Usa il calcolatore AWS per la regione e il volume mensile effettivi.

La tabella è un esempio di fatturazione, non una classifica dei contact center. Testa parlato sovrapposto, passaggi di parlante, terminologia, oscuramento, ritardo di finalizzazione e sforzo di correzione prima di scegliere una route.

Add-on, retry e revisione umana

L’elaborazione preregistrata Nova-3 Monolingual di Deepgram sale da $0.0077 a $0.0097 al minuto quando si aggiunge la diarizzazione. Aggiungendo l’oscuramento sale a $0.0117 al minuto prima del prompting dei termini chiave. AssemblyAI addebita $0.02 all’ora per la diarizzazione su registrato e $0.12 all’ora per la diarizzazione in tempo reale. ElevenLabs addebita $0.07 all’ora per il rilevamento entità e $0.05 all’ora per il prompting dei termini chiave.

Retry, webhook duplicati, storage e trasferimenti cross-cloud possono aggiungere costi senza migliorare la trascrizione. Registra secondi di audio, numero di canali, flag di funzionalità, stato della richiesta, retry, versione del modello, latenza e tempo di revisione per ogni job.

La metrica migliore per gli acquisti non è il prezzo per minuto di audio. Costo per trascrizione accettata = elaborazione API + funzionalità a pagamento + retry + storage/transfer + tempo di correzione umana

Supponi che un revisore costi $30 all’ora:

Route illustrativaCosto API per un’ora di audioCorrezione umanaCosto di correzioneCosto totale per trascrizione accettata
Route a prezzo più basso$0.158 minuti$4.00$4.15
Route a prezzo più alto$0.603 minuti$1.50$2.10

La seconda route costa quattro volte di più a livello di API ma circa la metà dopo la revisione. I tempi di correzione sono assunzioni di pianificazione, non risultati di benchmark dei provider; sostituiscili con misurazioni delle persone che approvano le trascrizioni nel tuo workflow.

Come valutare le API speech-to-text su audio reale

Le dichiarazioni di accuratezza dei vendor non sono direttamente comparabili perché i provider usano dataset, lingue, politiche di normalizzazione, versioni di modello e condizioni acustiche diverse. Lo studio GigaSpeechBench 2026 valuta 680 ore di parlato annotato umano in contesti reali tra lingue a basse risorse, dialetti cinesi, accenti inglesi, terminologia di 12 domini verticali e parlato di bambini e anziani. I risultati mostrano degrado sostanziale per modelli leader e API commerciali in scenari difficili.

La conclusione utile non è che un benchmark pubblico abbia trovato un vincitore permanente. È che il tuo set di test deve somigliare al tuo traffico.

Usa un set di valutazione simile alla produzione

  • 20 riunioni o interviste pulite contenenti nomi e termini di dominio.
  • 20 chiamate di supporto rumorose con interruzioni, musiche d’attesa, crosstalk e cambi di canale.
  • 20 clip con accenti o multilingue, incluso vero code switching.
  • 10 podcast o file video long-form.
  • 10 brevi enunciati live con silenzi, esitazioni, false partenze e barge-in.

Valuta più del Word Error Rate

MetricWhat to measureWhy it matters
Word error rateInserzioni, cancellazioni e sostituzioni sotto un’unica politica di normalizzazione condivisaCattura l’accuratezza lessicale, ma non l’usabilità completa della trascrizione
Accuratezza dei termini propriNomi di prodotto, persone, luoghi, abbreviazioni, numeri e vocabolario di settoreUn piccolo tasso di errore sui nomi propri può generare molto lavoro di revisione
Attribuzione del parlanteParole assegnate erroneamente e cambi di parlante mancatiCritica per chiamate, interviste, conformità e analytics
Qualità della formattazionePunteggiatura, maiuscole/minuscole, paragrafi, numeri, date e disfluenzeDetermina il tempo di pulizia prima di pubblicazione o analisi
Turnaround batchp50 e p95 dal caricamento al finale per file brevi e lunghiUna route economica a priorità inferiore può mancare la scadenza operativa
Latenza in streamingPrimo parziale, parziale stabile e trascrizione finale a p50 e p95La latenza media nasconde le pause che gli utenti percepiscono davvero
AffidabilitàTimeout, risultati vuoti, retry, webhook duplicati e tasso di fallbackI fallimenti aggiungono costi diretti e ritardi percepiti dagli utenti
Sforzo di revisioneMinuti dell’editor per ora di audio e tasso di trascrizioni accettateConverte la qualità dell’output in costo di business

Piano di valutazione in sette giorni

  1. Definisci il contratto di accettazione. Imposta lingue richieste, latenza p95, tolleranza per etichette dei parlanti, esigenze di timestamp, regole di retention e minuti massimi di revisione per ora di audio.
  2. Costruisci e annota il set audio. Usa audio simile alla produzione con licenza e una politica di trascrizione di riferimento condivisa.
  3. Normalizza le integrazioni. Allinea formati audio, regioni, suggerimenti di vocabolario, layout dei canali, retry, timeout e versioni del modello.
  4. Esegui test su audio registrato. Misura costo, turnaround, WER, termini propri, formattazione, parlanti, failure e tempo di correzione.
  5. Esegui test su audio live. Misura parziali stabili, ritardo di finalizzazione, endpointing, gestione delle interruzioni e comportamento di riconnessione a p50 e p95.
  6. Calcola il costo per trascrizione accettata. Aggiungi canali, funzionalità, retry, storage, trasferimento e tempo del revisore.
  7. Scegli una policy di routing. Il miglior design di produzione può usare una route per chiamate live in inglese, un’altra per riunioni multilingue e una route batch a priorità inferiore per gli archivi.

Checklist di produzione prima di firmare un contratto

  1. Testa separatamente modelli per registrato e live; prezzi, lingue e comportamento possono differire.
  2. Misura parziali stabili e finalizzazione, non solo il tempo al primo testo.
  3. Confronta identificazione dei canali stereo con diarizzazione a canale singolo su parlato sovrapposto.
  4. Forza timeout, audio malformato, risposte vuote, cadute di connessione, ritrasmissione dei webhook ed errori di rate limit.
  5. Verifica dimensione dei file, durata delle sessioni, concorrenza, limiti di rate e workflow per file lunghi.
  6. Conferma retention, uso del miglioramento del modello, elaborazione regionale, controlli di cancellazione, cifratura, disponibilità di DPA o BAA e subprocessor per il piano esatto.
  7. Archivia versione del modello, secondi di audio, canali, add-on, costo della richiesta, retry, latenza, minuti di revisione e stato di accettazione.
  8. Riesegui i test dopo cambi di pricing o di modello invece di assumere che il precedente vincitore resti il migliore.

Seleziona i provider in shortlist per workload, poi esegui benchmark con lo stesso audio, le stesse impostazioni e criteri di accettazione. Per la maggior parte dei team, un primo giro pratico dovrebbe includere una route a basso costo per audio registrato, una route di streaming specializzata e un provider già allineato con lo stack cloud o SDK esistente.

Testa modelli di speech supportati tramite CometAPI

I team che valutano modelli di speech compatibili con OpenAI supportati possono seguire il CometAPI Quickstart per eseguire una richiesta di trascrizione iniziale tramite un endpoint API unificato.

CometAPI può semplificare autenticazione, fatturazione e integrazione client per i modelli supportati. Prima di passare alla produzione, verifica formati supportati, limiti, termini sulla privacy, latenza e comportamento di fatturazione di ogni modello.

Domande frequenti

Qual è la migliore API speech-to-text nel 2026?

Non esiste un unico vincitore per ogni workload. AssemblyAI e Google Dynamic Batch sono candidati forti a basso costo per audio registrato. Deepgram, AssemblyAI ed ElevenLabs meritano test iniziali per trascrizione live. OpenAI è conveniente in uno stack compatibile con OpenAI, mentre AWS e Google possono essere operativamente più semplici all’interno dei rispettivi cloud.

Qual è la API speech-to-text più economica per audio registrato?

Tra le route pubbliche normalizzate qui, AssemblyAI Universal-2 parte da $0.15 per ora di audio. Google Dynamic Batch e OpenAI gpt-4o-mini-transcribe normalizzano a circa $0.18 all’ora. Il costo finale può cambiare con canali, tier di volume, add-on, retry, storage, trasferimento e correzione umana.

Quale API è migliore per trascrizione in tempo reale o agenti vocali?

Inizia con Deepgram, AssemblyAI ed ElevenLabs, poi includi OpenAI, AWS o Google quando il loro ecosistema o supporto linguistico si adatta. Confronta parziali stabili, endpointing, ritardo di finalizzazione, gestione delle interruzioni, comportamento di riconnessione e latenza p95 sul tuo pattern di traffico live.

Come dovrei confrontare l’accuratezza dello speech-to-text?

Usa lo stesso audio con licenza, regione, impostazioni del modello e politica di normalizzazione per ogni provider. Riporta il word error rate insieme ad accuratezza dei termini propri, attribuzione dei parlanti, formattazione, latenza p95, tasso di failure e minuti dell’editor per ora di audio. Non fondere affermazioni di benchmark non correlate dei vendor in una classifica universale.

Pronto a ridurre i costi di sviluppo AI del 20%?

Inizia gratuitamente in pochi minuti. Crediti di prova gratuiti inclusi. Nessuna carta di credito richiesta.

Leggi di più