TL;DR
Non esiste una API speech-to-text universalmente migliore. AssemblyAI Universal-2 e Google Dynamic Batch sono ottimi punti di partenza a basso costo per audio registrato. Deepgram, AssemblyAI ed ElevenLabs meritano test preliminari per sottotitoli live e agenti vocali. OpenAI è comoda quando il resto del prodotto usa già l’SDK di OpenAI, mentre AWS e Google possono ridurre gli attriti operativi all’interno di uno stack cloud esistente.
Non scegliere solo in base al prezzo al minuto. Il costo in produzione dipende anche dalla fatturazione per canale, dalle tariffe per diarizzazione e oscuramento, dalla latenza di finalizzazione p95, dai retry, dalle condizioni sui dati e dai minuti che una persona impiega per correggere ogni trascrizione accettata.
Come scegliere una API speech-to-text: quale provider testare per primo?
Inizia dal tuo workload anziché da una classifica universale dei provider. La API giusta dipende se ti servono trascrizione batch a basso costo, streaming a bassa latenza, supporto multilingue, separazione dei parlanti, oppure un’integrazione più stretta con uno stack cloud esistente.
Usa la shortlist seguente per decidere quali provider includere nel primo benchmark.
| Workload | Start with | Why | Decision-breaking test |
|---|---|---|---|
| Ampio archivio registrato | AssemblyAI Universal-2, Google Dynamic Batch, OpenAI gpt-4o-mini-transcribe | Prezzi pubblicati bassi per audio registrato | Tempo in coda, gestione di file lunghi, formattazione e minuti di correzione |
| Sottotitoli live o agenti vocali | Deepgram Nova-3 o Flux, AssemblyAI Realtime, ElevenLabs Scribe v2 Realtime | API di streaming con workflow di risultati parziali e rilevamento dei turni | Latenza dei parziali stabili, ritardo di finalizzazione, interruzioni e riconnessioni |
| Chiamate di contact center | AWS Transcribe, Google Cloud STT, Deepgram, AssemblyAI | Gestione dei canali, diarizzazione, controlli del vocabolario e opzioni di oscuramento | Fatturazione per canale, parlato sovrapposto, policy PII ed elaborazione regionale |
| Riunioni o media multilingue | AssemblyAI Universal-3.5 Pro, ElevenLabs Scribe v2, Deepgram Nova-3 Multilingual, OpenAI transcription models | Ampia copertura linguistica o supporto al code switching | Le tue coppie di lingue reali, accenti, nomi, timestamp e segmenti a lingue miste |
Confronto prezzi delle API speech-to-text: panoramica 2026
La tabella normalizza i prezzi di listino pubblici a un’ora di audio per una visione rapida. Non implica qualità, latenza, copertura funzionale o condizioni commerciali equivalenti. I prezzi promozionali, a priorità inferiore e per volumi elevati sono etichettati perché non sono direttamente equivalenti alle tariffe di ingresso ordinarie.
| Provider | Miglior aderenza alla produzione | Prezzo per audio registrato o asincrono | Prezzo live o standard | Avvertenza più importante |
|---|---|---|---|---|
| OpenAI | Applicazioni OpenAI esistenti e trascrizione semplice di file caricati | gpt-4o-mini-transcribe: $0.18/hr; gpt-4o-transcribe: $0.36/hr | gpt-realtime-whisper: $1.02/hr | I caricamenti sono limitati a 25 MB. A livello di parola, timestamp_granularities[] è documentato solo per whisper-1; la diarizzazione usa un modello separato e non è supportata nell’API Realtime. |
| Deepgram | Controllo dello streaming, sottotitoli live e pipeline per agenti vocali | Nova-3 Monolingual pre-recorded: $0.462/hr | Streaming monolinguale Nova-3: $0.288/hr promozionale | Diarizzazione e oscuramento aggiungono ciascuna $0.0020/min; il prompting dei termini chiave aggiunge $0.0013/min. Le tariffe elencate includono l’adesione al Model Improvement Program. |
| AssemblyAI | Trascrizione registrata a basso costo e funzionalità con prezzi chiari | Universal-2: $0.15/hr; Universal-3.5 Pro: $0.21/hr | Universal-Streaming: $0.15/hr; Universal-3.5 Pro Realtime: $0.45/hr | I file multicanale sono fatturati per canale. Le rotte di streaming da $0.15/hr supportano l’inglese o sei lingue, non l’intera copertura di 99 lingue di Universal-2. |
| Google Cloud Speech-to-Text V2 | Workload nativi GCP e archivi a bassa priorità | Dynamic Batch: $0.18/hr | Riconoscimento standard: $0.96/hr per i primi 500.000 minuti mensili | Dynamic Batch opera con urgenza inferiore. Ogni canale audio viene fatturato separatamente. |
| Amazon Transcribe | Contact center nativi AWS e audio di chiamate a due canali | Suddiviso per regione e volume; esempio ufficiale US East a 2M minuti: $0.36/hr | Esempio ufficiale US East a 2M minuti: $0.60/hr | Questi sono esempi ad alto volume, non prezzi di ingresso universali. Le richieste hanno un minimo di 15 secondi; fino a due canali sono inclusi nel calcolo della durata. |
| ElevenLabs Scribe | Media multilingue, tempi parola e sperimentazioni real-time rapide | Scribe v2: $0.22/hr | Scribe v2 Realtime: $0.39/hr | Il rilevamento entità aggiunge $0.07/hr e il prompting dei termini chiave aggiunge $0.05/hr. La latenza del vendor non include il tuo percorso di rete e applicativo. |
Scorciatoia per sviluppatori: Se la tua shortlist include Whisper, GPT-4o Transcribe o un altro modello di speech attualmente supportato da CometAPI, consulta il catalogo dei modelli live e prezzi e usa il Quickstart compatibile con OpenAI per eseguire lo stesso audio sulle rotte supportate. Conferma l’ID modello esatto e l’endpoint prima di costruire il benchmark.
Analisi dettagliata dei vendor: confronto di 6 API
1. OpenAI: ideale per i team che già usano l’SDK di OpenAI
La pagina dei prezzi di OpenAI stima la trascrizione a $0.003 al minuto per gpt-4o-mini-transcribe e $0.006 al minuto per gpt-4o-transcribe. La route dedicata gpt-realtime-whisper è indicata a circa $0.017 al minuto.
OpenAI è una prima scelta pratica per i team che già usano l’SDK di OpenAI per autenticazione, logging, retry e governance dei modelli. Sia gpt-4o-transcribe sia gpt-4o-mini-transcribe supportano il prompting, che può migliorare il riconoscimento di nomi di prodotto, acronimi, persone e vocabolario specifico di dominio. Per registrazioni che richiedono identificazione dei parlanti, il modello separato gpt-4o-transcribe-diarize può restituire segmenti etichettati per parlante e associarli a parlanti noti usando brevi clip di riferimento.
Le principali limitazioni sono architetturali piuttosto che solo di prezzo. I file caricati sono limitati a 25 MB, il timestamp_granularities[] a livello di parola è documentato per whisper-1, e il modello di diarizzazione non è disponibile tramite la Realtime API. I team che elaborano registrazioni lunghe, conversazioni live o audio di contact center con molti parlanti dovrebbero testare gestione dei file, requisiti di timestamp e attribuzione dei parlanti prima di standardizzare su una route OpenAI. Consulta la documentazione speech-to-text di OpenAI per il comportamento attuale degli endpoint e i formati di output supportati.
I team che vogliono usare GPT-4o Transcribe riducendo i costi API diretti possono anche esaminare la GPT-4o Transcribe API su CometAPI. Al momento della stesura, CometAPI indica un accesso a un prezzo inferiore rispetto ai prezzi standard dell’API diretta di OpenAI, mantenendo un percorso di integrazione compatibile con OpenAI. Verifica la pagina del modello live prima del benchmark perché prezzi, disponibilità e parametri supportati possono cambiare.
Prova OpenAI per primo quando: la tua applicazione usa già strumenti compatibili con OpenAI, la maggior parte dell’audio viene caricata invece di essere trasmessa in continuo, e ridurre la complessità d’integrazione conta più di controlli specializzati per streaming o contact center.
2. Deepgram: ideale per controllo dello streaming e pipeline di agenti vocali
La pagina dei prezzi di Deepgram mostra tariffe di streaming a tempo limitato di $0.0048 al minuto per Nova-3 Monolingual e $0.0058 al minuto per Nova-3 Multilingual. Le corrispondenti tariffe pay-as-you-go per preregistrato sono $0.0077 e $0.0092 al minuto. Flux è pensato per agenti vocali conversazionali con rilevamento dei turni e gestione delle interruzioni.
Deepgram merita di essere nella shortlist dei prodotti live perché il comportamento in streaming conta quanto l’accuratezza finale della trascrizione. Un’interfaccia vocale ha bisogno di risultati parziali utili, endpointing affidabile, gestione naturale delle interruzioni e finalizzazione prevedibile—non solo di una trascrizione pulita dopo la fine della chiamata.
Considera gli add-on nel budget insieme al modello. La diarizzazione e l’oscuramento aggiungono ciascuna $0.0020 al minuto; il prompting dei termini chiave aggiunge $0.0013 al minuto. Deepgram inoltre afferma che le tariffe elencate includono l’adesione al Model Improvement Program, quindi i team con requisiti più rigidi sull’uso dei dati dovrebbero verificare termini commerciali alternativi.
Prova Deepgram per primo quando: la gestione dei turni, i parziali a bassa latenza, il controllo dello streaming o il comportamento dell’agente vocale sono i requisiti principali.
3. AssemblyAI: miglior route a basso costo per registrato con prezzi trasparenti degli add-on
I prezzi di AssemblyAI elencano Universal-2 a $0.15 per ora di audio e Universal-3.5 Pro a $0.21 per ora. Universal-2 supporta 99 lingue; Universal-3.5 Pro supporta 18 lingue con code switching e un tier di modello più avanzato.
La linea di prodotto real-time è separata. Universal-Streaming costa $0.15 all’ora per l’inglese, e Universal-Streaming Multilingual copre inglese, spagnolo, tedesco, francese, portoghese e italiano allo stesso prezzo. Universal-3.5 Pro Realtime costa $0.45 all’ora e supporta 18 lingue.
La matrice esplicita degli add-on di AssemblyAI semplifica la pianificazione: la diarizzazione per registrato costa $0.02 all’ora, la diarizzazione in tempo reale $0.12 all’ora, e il prompting dei termini chiave in Universal-Streaming $0.04 all’ora. I file multicanale sono fatturati per canale, il che può cambiare il risultato per chiamate stereo.
Prova AssemblyAI per primo quando: costo basso per audio registrato, ampia copertura linguistica, prezzi delle funzionalità chiari o un workflow asincrono semplice sono prioritari.
4. Google Cloud Speech-to-Text: ideale per Dynamic Batch e workload nativi GCP
I prezzi di Google Cloud Speech-to-Text V2 elencano Dynamic Batch a $0.003 al minuto e il riconoscimento standard a $0.016 al minuto per i primi 500.000 minuti mensili. I prezzi standard scendono a livelli di utilizzo superiori.
Dynamic Batch è interessante per archivi che non richiedono un turnaround urgente, ma il prezzo più basso è legato a un’urgenza di elaborazione inferiore. Google fattura anche ogni canale audio separatamente: una richiesta da 30 secondi e quattro canali viene fatturata come 120 secondi di audio elaborato.
Google è spesso attraente operativamente quando l’audio è già in Cloud Storage e il team usa identità GCP, logging, endpoint regionali e controlli di fatturazione. Aggiungi archiviazione, trasferimento e servizi cloud adiacenti al modello di costo totale invece di trattare la trascrizione come voce isolata.
Prova Google per primo quando: grandi archivi non urgenti, operazioni native GCP, distribuzione regionale o funzionalità di adattamento contano più della tabella prezzi più semplice.
5. Amazon Transcribe: ideale per audio di contact center nativi AWS
I prezzi di Amazon Transcribe variano per regione e tier di utilizzo mensile. L’esempio pubblico di AWS per due milioni di minuti mensili negli US East usa $0.006 al minuto per batch e $0.01 al minuto per streaming. Queste cifre sono esempi ad alto volume, non preventivi di ingresso ordinari.
L’uso è fatturato a incrementi di un secondo con un minimo di 15 secondi per richiesta. Il pricing standard include vocabolari personalizzati, filtraggio del vocabolario, diarizzazione e identificazione della lingua; l’oscuramento automatico dei contenuti e i modelli linguistici personalizzati hanno costi extra.
AWS include fino a due canali nel calcolo della durata dell’audio. Per chiamate stereo di supporto, questa regola può essere più favorevole rispetto a un provider che fattura ogni canale come ora separata.
Prova AWS per primo quando: le chiamate passano già attraverso AWS, la fatturazione a due canali è preziosa, oppure integrazione con IAM, storage, sicurezza e acquisti pesa più del prezzo di listino più basso.
6. ElevenLabs Scribe: ideale per media multilingue e rapide sperimentazioni real-time
I prezzi API di ElevenLabs elencano Scribe v2 a $0.22 all’ora e Scribe v2 Realtime a $0.39 all’ora. Il prodotto include trascrizione multilingue, timestamp a livello di parola, diarizzazione, tagging audio e funzionalità opzionali di keyterm ed entità.
Scribe v2 Realtime pubblicizza bassa latenza del modello, ma un acquirente dovrebbe misurare l’intero percorso dalla cattura del microfono al testo stabile nella regione e nello stack di trasporto target. La latenza del vendor non include la tua gestione WebSocket, il percorso di rete, il buffering, gli aggiornamenti UI o la logica dell’agente a valle.
Il rilevamento entità aggiunge $0.07 all’ora e il prompting dei termini chiave aggiunge $0.05 all’ora. Includi entrambi nel costo della trascrizione accettata quando sono richiesti dal prodotto.
Prova ElevenLabs per primo quando: media multilingue, tempi parola, tag audio o un prototipo real-time veloce sono requisiti centrali.
TCO: costi nascosti che possono invertire la classifica
Fatturazione multicanale
Una chiamata stereo di un’ora non è sempre un’ora fatturabile.
| Route | Calcolo di pianificazione per una chiamata da 60 minuti a due canali | Costo base stimato |
|---|---|---|
| AssemblyAI Universal-2 | 1 ora × 2 canali × $0.15/hr | $0.30 |
| AWS Transcribe batch | 1 ora totale × $0.36/hr | $0.36 |
| Riconoscimento standard Google | 1 ora × 2 canali × $0.96/hr | $1.92 |
*Il valore AWS usa l’esempio ufficiale del provider per US East a due milioni di minuti mensili. Usa il calcolatore AWS per la regione e il volume mensile effettivi.
La tabella è un esempio di fatturazione, non una classifica dei contact center. Testa parlato sovrapposto, passaggi di parlante, terminologia, oscuramento, ritardo di finalizzazione e sforzo di correzione prima di scegliere una route.
Add-on, retry e revisione umana
L’elaborazione preregistrata Nova-3 Monolingual di Deepgram sale da $0.0077 a $0.0097 al minuto quando si aggiunge la diarizzazione. Aggiungendo l’oscuramento sale a $0.0117 al minuto prima del prompting dei termini chiave. AssemblyAI addebita $0.02 all’ora per la diarizzazione su registrato e $0.12 all’ora per la diarizzazione in tempo reale. ElevenLabs addebita $0.07 all’ora per il rilevamento entità e $0.05 all’ora per il prompting dei termini chiave.
Retry, webhook duplicati, storage e trasferimenti cross-cloud possono aggiungere costi senza migliorare la trascrizione. Registra secondi di audio, numero di canali, flag di funzionalità, stato della richiesta, retry, versione del modello, latenza e tempo di revisione per ogni job.
La metrica migliore per gli acquisti non è il prezzo per minuto di audio. Costo per trascrizione accettata = elaborazione API + funzionalità a pagamento + retry + storage/transfer + tempo di correzione umana
Supponi che un revisore costi $30 all’ora:
| Route illustrativa | Costo API per un’ora di audio | Correzione umana | Costo di correzione | Costo totale per trascrizione accettata |
|---|---|---|---|---|
| Route a prezzo più basso | $0.15 | 8 minuti | $4.00 | $4.15 |
| Route a prezzo più alto | $0.60 | 3 minuti | $1.50 | $2.10 |
La seconda route costa quattro volte di più a livello di API ma circa la metà dopo la revisione. I tempi di correzione sono assunzioni di pianificazione, non risultati di benchmark dei provider; sostituiscili con misurazioni delle persone che approvano le trascrizioni nel tuo workflow.
Come valutare le API speech-to-text su audio reale
Le dichiarazioni di accuratezza dei vendor non sono direttamente comparabili perché i provider usano dataset, lingue, politiche di normalizzazione, versioni di modello e condizioni acustiche diverse. Lo studio GigaSpeechBench 2026 valuta 680 ore di parlato annotato umano in contesti reali tra lingue a basse risorse, dialetti cinesi, accenti inglesi, terminologia di 12 domini verticali e parlato di bambini e anziani. I risultati mostrano degrado sostanziale per modelli leader e API commerciali in scenari difficili.
La conclusione utile non è che un benchmark pubblico abbia trovato un vincitore permanente. È che il tuo set di test deve somigliare al tuo traffico.
Usa un set di valutazione simile alla produzione
- 20 riunioni o interviste pulite contenenti nomi e termini di dominio.
- 20 chiamate di supporto rumorose con interruzioni, musiche d’attesa, crosstalk e cambi di canale.
- 20 clip con accenti o multilingue, incluso vero code switching.
- 10 podcast o file video long-form.
- 10 brevi enunciati live con silenzi, esitazioni, false partenze e barge-in.
Valuta più del Word Error Rate
| Metric | What to measure | Why it matters |
|---|---|---|
| Word error rate | Inserzioni, cancellazioni e sostituzioni sotto un’unica politica di normalizzazione condivisa | Cattura l’accuratezza lessicale, ma non l’usabilità completa della trascrizione |
| Accuratezza dei termini propri | Nomi di prodotto, persone, luoghi, abbreviazioni, numeri e vocabolario di settore | Un piccolo tasso di errore sui nomi propri può generare molto lavoro di revisione |
| Attribuzione del parlante | Parole assegnate erroneamente e cambi di parlante mancati | Critica per chiamate, interviste, conformità e analytics |
| Qualità della formattazione | Punteggiatura, maiuscole/minuscole, paragrafi, numeri, date e disfluenze | Determina il tempo di pulizia prima di pubblicazione o analisi |
| Turnaround batch | p50 e p95 dal caricamento al finale per file brevi e lunghi | Una route economica a priorità inferiore può mancare la scadenza operativa |
| Latenza in streaming | Primo parziale, parziale stabile e trascrizione finale a p50 e p95 | La latenza media nasconde le pause che gli utenti percepiscono davvero |
| Affidabilità | Timeout, risultati vuoti, retry, webhook duplicati e tasso di fallback | I fallimenti aggiungono costi diretti e ritardi percepiti dagli utenti |
| Sforzo di revisione | Minuti dell’editor per ora di audio e tasso di trascrizioni accettate | Converte la qualità dell’output in costo di business |
Piano di valutazione in sette giorni
- Definisci il contratto di accettazione. Imposta lingue richieste, latenza p95, tolleranza per etichette dei parlanti, esigenze di timestamp, regole di retention e minuti massimi di revisione per ora di audio.
- Costruisci e annota il set audio. Usa audio simile alla produzione con licenza e una politica di trascrizione di riferimento condivisa.
- Normalizza le integrazioni. Allinea formati audio, regioni, suggerimenti di vocabolario, layout dei canali, retry, timeout e versioni del modello.
- Esegui test su audio registrato. Misura costo, turnaround, WER, termini propri, formattazione, parlanti, failure e tempo di correzione.
- Esegui test su audio live. Misura parziali stabili, ritardo di finalizzazione, endpointing, gestione delle interruzioni e comportamento di riconnessione a p50 e p95.
- Calcola il costo per trascrizione accettata. Aggiungi canali, funzionalità, retry, storage, trasferimento e tempo del revisore.
- Scegli una policy di routing. Il miglior design di produzione può usare una route per chiamate live in inglese, un’altra per riunioni multilingue e una route batch a priorità inferiore per gli archivi.
Checklist di produzione prima di firmare un contratto
- Testa separatamente modelli per registrato e live; prezzi, lingue e comportamento possono differire.
- Misura parziali stabili e finalizzazione, non solo il tempo al primo testo.
- Confronta identificazione dei canali stereo con diarizzazione a canale singolo su parlato sovrapposto.
- Forza timeout, audio malformato, risposte vuote, cadute di connessione, ritrasmissione dei webhook ed errori di rate limit.
- Verifica dimensione dei file, durata delle sessioni, concorrenza, limiti di rate e workflow per file lunghi.
- Conferma retention, uso del miglioramento del modello, elaborazione regionale, controlli di cancellazione, cifratura, disponibilità di DPA o BAA e subprocessor per il piano esatto.
- Archivia versione del modello, secondi di audio, canali, add-on, costo della richiesta, retry, latenza, minuti di revisione e stato di accettazione.
- Riesegui i test dopo cambi di pricing o di modello invece di assumere che il precedente vincitore resti il migliore.
Seleziona i provider in shortlist per workload, poi esegui benchmark con lo stesso audio, le stesse impostazioni e criteri di accettazione. Per la maggior parte dei team, un primo giro pratico dovrebbe includere una route a basso costo per audio registrato, una route di streaming specializzata e un provider già allineato con lo stack cloud o SDK esistente.
Testa modelli di speech supportati tramite CometAPI
I team che valutano modelli di speech compatibili con OpenAI supportati possono seguire il CometAPI Quickstart per eseguire una richiesta di trascrizione iniziale tramite un endpoint API unificato.
CometAPI può semplificare autenticazione, fatturazione e integrazione client per i modelli supportati. Prima di passare alla produzione, verifica formati supportati, limiti, termini sulla privacy, latenza e comportamento di fatturazione di ogni modello.
Domande frequenti
Qual è la migliore API speech-to-text nel 2026?
Non esiste un unico vincitore per ogni workload. AssemblyAI e Google Dynamic Batch sono candidati forti a basso costo per audio registrato. Deepgram, AssemblyAI ed ElevenLabs meritano test iniziali per trascrizione live. OpenAI è conveniente in uno stack compatibile con OpenAI, mentre AWS e Google possono essere operativamente più semplici all’interno dei rispettivi cloud.
Qual è la API speech-to-text più economica per audio registrato?
Tra le route pubbliche normalizzate qui, AssemblyAI Universal-2 parte da $0.15 per ora di audio. Google Dynamic Batch e OpenAI gpt-4o-mini-transcribe normalizzano a circa $0.18 all’ora. Il costo finale può cambiare con canali, tier di volume, add-on, retry, storage, trasferimento e correzione umana.
Quale API è migliore per trascrizione in tempo reale o agenti vocali?
Inizia con Deepgram, AssemblyAI ed ElevenLabs, poi includi OpenAI, AWS o Google quando il loro ecosistema o supporto linguistico si adatta. Confronta parziali stabili, endpointing, ritardo di finalizzazione, gestione delle interruzioni, comportamento di riconnessione e latenza p95 sul tuo pattern di traffico live.
Come dovrei confrontare l’accuratezza dello speech-to-text?
Usa lo stesso audio con licenza, regione, impostazioni del modello e politica di normalizzazione per ogni provider. Riporta il word error rate insieme ad accuratezza dei termini propri, attribuzione dei parlanti, formattazione, latenza p95, tasso di failure e minuti dell’editor per ora di audio. Non fondere affermazioni di benchmark non correlate dei vendor in una classifica universale.
