TL;DR
Der findes ikke én universelt bedste speech-to-text-API. AssemblyAI Universal-2 og Google Dynamic Batch er stærke, lavpris-startpunkter for optaget lyd. Deepgram, AssemblyAI og ElevenLabs fortjener tidlig afprøvning til live-undertekster og stemmeagenter. OpenAI er bekvemt, når resten af produktet allerede bruger OpenAI SDK, mens AWS og Google kan reducere den operationelle friktion i en eksisterende cloud-stack.
Vælg ikke kun ud fra pris pr. minut. Produktionsomkostningen afhænger også af kanalfakturering, gebyrer for diarisering og maskering, p95-finaliseringslatens, genforsøg, datavilkår og de minutter, en person bruger på at rette hver accepteret transskription.
How to Choose a Speech-to-Text API: Which Provider Should You Test First?
Start med din arbejdsbelastning frem for en universel udbyderrangering. Den rette speech-to-text-API afhænger af, om du har brug for billig batchtransskription, lav-latens streaming, flersproget support, talerseparation eller tættere integration med en eksisterende cloud-stack.
Brug shortlisten nedenfor til at afgøre, hvilke udbydere der hører til i din første benchmark.
| Brugsscenarie | Start med | Hvorfor | Afgørende test |
|---|---|---|---|
| Stort arkiv med optagelser | AssemblyAI Universal-2, Google Dynamic Batch, OpenAI gpt-4o-mini-transcribe | Lave listede priser for optaget lyd | Køtid, håndtering af lange filer, formatering og korrektionsminutter |
| Live-undertekster eller stemmeagenter | Deepgram Nova-3 eller Flux, AssemblyAI Realtime, ElevenLabs Scribe v2 Realtime | Streaming-API'er med delvise resultater og turdetektions-workflows | Latens for stabile delresultater, finaliseringsforsinkelse, afbrydelser og genopkoblinger |
| Kontaktcenter-opkald | AWS Transcribe, Google Cloud STT, Deepgram, AssemblyAI | Kanalhåndtering, diarisering, ordforrådskontrol og sløringsmuligheder | Fakturering pr. kanal, overlappende tale, PII-politik og regional behandling |
| Flersprogede møder eller medier | AssemblyAI Universal-3.5 Pro, ElevenLabs Scribe v2, Deepgram Nova-3 Multilingual, OpenAI transcription models | Bred sprogunderstøttelse eller understøttelse af code-switching | Dine faktiske sprogsæt, accenter, navne, tidsstempler og blandede sprogsegmenter |
Speech-to-Text API Pricing Comparison: 2026 Snapshot
Tabellen normaliserer offentlige listepriser til én lydtime for overblik. Den indebærer ikke ens kvalitet, latens, funktioner eller kommercielle vilkår. Kampagner, lavere prioritet og højvolumenpriser er markeret, fordi de ikke er direkte ækvivalente med almindelige startpriser.
| Udbyder | Bedste produktionsmatch | Pris for optaget/asynkron | Pris for live/standard | Vigtigste forbehold |
|---|---|---|---|---|
| OpenAI | Eksisterende OpenAI-applikationer og enkel uploadet transskription | gpt-4o-mini-transcribe: $0.18/hr; gpt-4o-transcribe: $0.36/hr | gpt-realtime-whisper: $1.02/hr | Uploads er begrænset til 25 MB. Word-level timestamp_granularities[] er dokumenteret kun for whisper-1; diarisering bruger en separat model og understøttes ikke i Realtime API. |
| Deepgram | Streamingkontrol, live-undertekster og stemmeagent-pipelines | Nova-3 Monolingual pre-recorded: $0.462/hr | Nova-3 Monolingual streaming: $0.288/hr (kampagne) | Diarisering og sløring tilføjer hver $0.0020/min; keyterm prompting tilføjer $0.0013/min. De oplyste satser tilmelder brugere Model Improvement Program. |
| AssemblyAI | Billig transskription af optaget lyd og tydeligt prissatte funktioner | Universal-2: $0.15/hr; Universal-3.5 Pro: $0.21/hr | Universal-Streaming: $0.15/hr; Universal-3.5 Pro Realtime: $0.45/hr | Multikanalsfiler faktureres pr. kanal. $0.15/hr-streamingruterne understøtter engelsk eller seks sprog, ikke Universal-2's fulde 99-sprog-dækning. |
| Google Cloud Speech-to-Text V2 | GCP-native arbejdsbelastninger og arkiver med lav prioritet | Dynamic Batch: $0.18/hr | Standard recognition: $0.96/hr for the first 500,000 monthly minutes | Dynamic Batch kører med lavere prioritet. Hver lydkanal faktureres separat. |
| Amazon Transcribe | AWS-native kontaktcenter og to-kanals opkaldslyd | Regions- og volumentrappet; officielt 2M-minute US East-eksempel: $0.36/hr | Officielt 2M-minute US East-eksempel: $0.60/hr | Dette er højvolumeneksempler, ikke generelle startpriser. Anmodninger har et minimum på 15 sekunder; op til to kanaler er inkluderet i varighedsafgiften. |
| ElevenLabs Scribe | Flersprogede medier, ordtimings og hurtige realtids-eksperimenter | Scribe v2: $0.22/hr | Scribe v2 Realtime: $0.39/hr | Enhedsgenkendelse tilføjer $0.07/hr og keyterm prompting tilføjer $0.05/hr. Leverandørens latens omfatter ikke dit netværk og din applikationssti. |
Developer-genvej: Hvis din shortlist omfatter Whisper, GPT-4o Transcribe eller en anden speech-model, der aktuelt understøttes af CometAPI, så tjek live-modelkatalog og prissætning og brug den OpenAI-kompatible hurtigstart for at køre den samme lyd gennem understøttede ruter. Bekræft den præcise model-ID og endpoint, før du bygger benchmarken.
Detailed Vendor Breakdown: The 6 APIs Compared
1. OpenAI: Best for Teams Already Using the OpenAI SDK
OpenAI’s prisside anslår transskription til $0.003 pr. minut for gpt-4o-mini-transcribe og $0.006 pr. minut for gpt-4o-transcribe. Den dedikerede gpt-realtime-whisper-rute er opført til cirka $0.017 pr. minut.
OpenAI er et praktisk førstevalg for teams, der allerede bruger OpenAI SDK til autentificering, logging, genforsøg og modelstyring. Både gpt-4o-transcribe og gpt-4o-mini-transcribe understøtter prompting, hvilket kan forbedre genkendelsen af produktnavne, akronymer, personer og domænespecifikt ordforråd. For optagelser, der kræver taleridentifikation, kan den separate gpt-4o-transcribe-diarize-model returnere segmenter med taleretikker og knytte dem til kendte talere ved hjælp af korte referenceklip.
De vigtigste begrænsninger er arkitektoniske snarere end rent prisrelaterede. Uploadede filer er begrænset til 25 MB, word-level timestamp_granularities[] er dokumenteret for whisper-1, og diarisering er ikke tilgængelig via Realtime API. Teams, der behandler lange optagelser, live-samtaler eller kontaktcenter-lyd med mange talere, bør teste filhåndtering, tidsstempelkrav og talerattribuering, før de standardiserer på en OpenAI-rute. Se den officielle OpenAI-speech-to-text-dokumentation for aktuel endpoint-adfærd og understøttede outputformater.
Teams, der vil bruge GPT-4o Transcribe og samtidig reducere direkte API-omkostninger, kan også gennemgå GPT-4o Transcribe API på CometAPI. På skrivende tidspunkt viser CometAPI adgang til en lavere sats end OpenAIs standardpriser for direkte API, samtidig med at integrationen forbliver OpenAI-kompatibel. Tjek live-modelsiden, før du benchmarker, da priser, tilgængelighed og understøttede parametre kan ændre sig.
Test OpenAI først når: din applikation allerede bruger OpenAI-kompatible værktøjer, det meste lyd uploades i stedet for at blive streamet kontinuerligt, og reduktion af integrationskompleksitet betyder mere end specialiseret streaming eller kontaktcenter-kontrol.
2. Deepgram: Best for Streaming Control and Voice-Agent Pipelines
Deepgrams prisside viser tidsbegrænsede streamingrater på $0.0048 pr. minut for Nova-3 Monolingual og $0.0058 pr. minut for Nova-3 Multilingual. De tilsvarende pay-as-you-go-satser for forudindspillet er $0.0077 og $0.0092 pr. minut. Flux er positioneret til samtalebaserede stemmeagenter med turdetektion og håndtering af afbrydelser.
Deepgram hører hjemme på shortlister til live-produkter, fordi streamingadfærd betyder lige så meget som endelig transkriptkvalitet. En stemmegrænseflade har brug for nyttige delvise resultater, pålidelig endpointing, naturlig afbrydelseshåndtering og forudsigelig finalisering—ikke blot et pænt transkript, når samtalen slutter.
Budgetter tillæggene sammen med modellen. Talerdiarisering og sløring tilføjer hver $0.0020 pr. minut; keyterm prompting tilføjer $0.0013 pr. minut. Deepgram oplyser også, at de anførte satser tilmelder brugere Model Improvement Program, så teams med strengere dataanvendelseskrav bør verificere alternative kommercielle vilkår.
Test Deepgram først når: turtagning, lav-latens delresultater, streamingkontrol eller stemmeagent-adfærd er det primære krav.
3. AssemblyAI: Best Low-Cost Recorded Route with Transparent Add-On Pricing
AssemblyAIs priser oplyser Universal-2 til $0.15 pr. lydtime og Universal-3.5 Pro til $0.21 pr. time. Universal-2 understøtter 99 sprog; Universal-3.5 Pro understøtter 18 sprog med code switching og et mere avanceret modelniveau.
Realtime-produktlinjen er separat. Universal-Streaming koster $0.15 pr. time for engelsk, og Universal-Streaming Multilingual dækker engelsk, spansk, tysk, fransk, portugisisk og italiensk til samme pris. Universal-3.5 Pro Realtime koster $0.45 pr. time og understøtter 18 sprog.
AssemblyAIs eksplicitte tillægs-matrix gør budgettering lettere: optaget talerdiarisering koster $0.02 pr. time, realtime-diarisering koster $0.12 pr. time, og Universal-Streaming keyterm prompting koster $0.04 pr. time. Multikanalsfiler faktureres pr. kanal, hvilket kan ændre resultatet for stereoopkald.
Test AssemblyAI først når: lav pris for optaget lyd, bred sprogunderstøttelse, klar funktionsprissætning eller en simpel asynkron workflow er prioriteten.
4. Google Cloud Speech-to-Text: Best for Dynamic Batch and GCP-Native Workloads
Google Cloud Speech-to-Text V2-priser oplyser Dynamic Batch til $0.003 pr. minut og standardgenkendelse til $0.016 pr. minut for de første 500.000 månedlige minutter. Standardprisen falder ved højere brugstrin.
Dynamic Batch er overbevisende for arkiver, der ikke kræver hurtig ekspedering, men den lavere pris er bundet til lavere behandlingshast. Google fakturerer også hver lydkanal separat: en 30-sekunders forespørgsel med fire kanaler faktureres som 120 sekunders behandlet lyd.
Google er ofte operationelt attraktivt, når lyd allerede ligger i Cloud Storage, og teamet bruger GCP-identitet, logning, regionale endpoints og faktureringskontroller. Læg lager, overførsel og tilstødende cloud-tjenester ind i totalomkostningsmodellen i stedet for at behandle transskription som en isoleret linjepost.
Test Google først når: store, ikke-hastende arkiver, GCP-native drift, regional udrulning eller adaptationsfunktioner betyder mere end den enkleste prisliste.
5. Amazon Transcribe: Best for AWS-Native Contact-Center Audio
Amazon Transcribe-priser varierer efter region og månedlig brugstrin. AWS’ offentlige US East-eksempel for to millioner månedlige minutter bruger $0.006 pr. minut for batch og $0.01 pr. minut for streaming. Disse tal er højvolumeneksempler, ikke almindelige startpriser.
Forbruget faktureres i ét-sekunds intervaller med et minimum på 15 sekunder pr. anmodning. Standardpriserne inkluderer brugerdefinerede ordlister, ordlistefiltrering, talerdiarisering og sprogidentifikation; automatisk indholdsredigering og brugerdefinerede sprogmodeller koster ekstra.
AWS inkluderer op til to kanaler i varighedsafgiften. For stereo-supportopkald kan den regel være mere fordelagtig end en udbyder, der fakturerer hver kanal som en separat time.
Test AWS først når: opkaldene allerede kører via AWS, to-kanals fakturering er værdifuld, eller IAM, lager, sikkerhed og indkøbsintegration vejer tungere end den laveste synlige listepris.
6. ElevenLabs Scribe: Best for Multilingual Media and Fast Real-Time Experiments
ElevenLabs API-priser oplyser Scribe v2 til $0.22 pr. time og Scribe v2 Realtime til $0.39 pr. time. Produktet inkluderer flersproget transskription, ordniveau-tidsstempler, diarisering, lydtagging og valgfrie nøgleterm- og enhedsfunktioner.
Scribe v2 Realtime annoncerer lav modellatens, men en køber bør måle den komplette vej fra mikrofonoptagelse til stabil tekst i den målregion og transportstack. Leverandørens latens omfatter ikke din WebSocket-håndtering, netværkssti, buffering, UI-opdateringer eller downstream-agentlogik.
Enhedsgenkendelse tilføjer $0.07 pr. time, og keyterm prompting tilføjer $0.05 pr. time. Medtag begge i omkostningen pr. accepteret transskription, når de er påkrævet for produktet.
Test ElevenLabs først når: flersprogede medier, ordtimings, lydtags eller en hurtig realtime-prototype er centrale krav.
Total Cost of Ownership: Hidden Costs That Can Reverse the Ranking
Multichannel Billing
Et en-times stereoopkald er ikke altid én fakturerbar time.
| Rute | Planlægningsberegning for et 60-minutters opkald med to kanaler | Anslået grundomkostning |
|---|---|---|
| AssemblyAI Universal-2 | 1 time × 2 kanaler × $0.15/hr | $0.30 |
| AWS Transcribe batch | 1 time i alt × $0.36/hr | $0.36 |
| Google standard recognition | 1 time × 2 kanaler × $0.96/hr | $1.92 |
AWS-værdien bruger udbyderens officielle US East-eksempel ved to millioner månedlige minutter. Brug AWS-beregneren for den faktiske region og månedlige volumen.
Tabellen er et faktureringseksempel, ikke en rangering af kontaktcentre. Test overlappende tale, talerovertagelser, terminologi, sløring, finaliseringsforsinkelse og korrektionsindsats, før du vælger en rute.
Add-Ons, Retries, and Human Review
Deepgrams Nova-3 Monolingual-forudindspillede behandling stiger fra $0.0077 til $0.0097 pr. minut, når diarisering tilføjes. Tilføjes sløring, stiger den til $0.0117 pr. minut før keyterm prompting. AssemblyAI opkræver $0.02 pr. time for diarisering af optaget lyd og $0.12 pr. time for realtime-diarisering. ElevenLabs opkræver $0.07 pr. time for enhedsgenkendelse og $0.05 pr. time for keyterm prompting.
Genforsøg, duplikerede webhooks, lager og cross-cloud-overførsel kan tilføje omkostninger uden at forbedre transskriptet. Log lydsekunder, kanaltal, funktionsflag, anmodningsstatus, genforsøg, modelversion, latens og gennemgangstid for hvert job.
Den bedre indkøbsmåling er ikke pris pr. lydminut. Omkostning pr. accepteret transskription = API-behandling + betalte funktioner + genforsøg + lager/overførsel + menneskelig korrekturtid
Antag, at en korrekturlæser koster $30 pr. time:
| Illustrativ rute | API-omkostning for én lydtime | Menneskelig korrektion | Korrektionsomkostning | Samlet omkostning pr. accepteret transskription |
|---|---|---|---|---|
| Lavprisrute | $0.15 | 8 minutter | $4.00 | $4.15 |
| Højprisrute | $0.60 | 3 minutter | $1.50 | $2.10 |
Den anden rute koster fire gange mere på API-laget, men omtrent halvt så meget efter gennemgang. Korrektions-tiderne er planlægningsantagelser, ikke udbyder-benchmarkresultater; erstat dem med målinger fra de personer, der godkender transskripter i din workflow.
How to Evaluate Speech-to-Text APIs on Real Audio
Udbydernes nøjagtighedspåstande er ikke direkte sammenlignelige, fordi de bruger forskellige datasæt, sprog, normaliseringspolitikker, modelversioner og akustiske forhold. 2026-studiet GigaSpeechBench evaluerer 680 timer menneskeannoteret virkelighedstale på tværs af lavressourcesprog, kinesiske dialekter, engelske accenter, terminologi fra 12 vertikaler samt børne- og ældres tale. Dets resultater viser væsentlige forringelser for førende modeller og kommercielle API'er i vanskelige forhold.
Den nyttige konklusion er ikke, at én offentlig benchmark har fundet en permanent vinder. Det er, at dit testsæt skal ligne din trafik.
Use a Production-Like Evaluation Set
- 20 rene møder eller interviews med navne og domænetermer.
- 20 støjende supportopkald med afbrydelser, ventemusik, krydstale og kanalskift.
- 20 accent- eller flersprogede klip, inklusive ægte code switching.
- 10 lange podcasts eller videofiler.
- 10 korte live-udsagn med stilhed, tøven, falske starter og barge-in.
Score More Than Word Error Rate
| Metrik | Hvad der måles | Hvorfor det betyder noget |
|---|---|---|
| Ordfejlsrate (WER) | Indsættelser, sletninger og substitutioner under én fælles normaliseringspolitik | Fanger leksikal nøjagtighed, men ikke fuld transkriptanvendelighed |
| Nøjagtighed for navngivne termer | Produktnavne, personer, steder, forkortelser, tal og brancheterminologi | En lille fejlrate for egennavne kan skabe stort korrekturarbejde |
| Talertilknytning | Fejlagtigt tildelte ord og oversete talerskift | Kritisk for opkald, interviews, compliance og analyse |
| Formateringskvalitet | Tegnsætning, store/små bogstaver, afsnit, tal, datoer og disfluens | Bestemmer oprydningstid før publicering eller analyse |
| Batch-gennemløbstid | Upload-til-final p50 og p95 for korte og lange filer | En billig rute med lavere prioritet kan misse den operationelle deadline |
| Streaminglatens | Første delresultat, stabilt delresultat og endelig transskription ved p50 og p95 | Gennemsnitslatens skjuler de pauser, brugerne faktisk mærker |
| Pålidelighed | Timeouts, tomme resultater, genforsøg, duplikerede webhooks og fallback-rate | Fejl øger direkte omkostninger og synlig forsinkelse for brugeren |
| Gennemgangsindsats | Redaktørminutter pr. lydtime og acceptgrad for transskription | Omsætter outputkvalitet til en forretningsomkostning |
A Seven-Day Evaluation Plan
- Definér acceptkontrakten. Fastlæg påkrævede sprog, p95-latens, tolerance for talerlabels, tidsstempelkrav, opbevaringsregler og maksimale gennemgangsminutter pr. lydtime.
- Byg og mærk lydsættet. Brug licenseret, produktionslignende lyd og én fælles reference-transkriptpolitik.
- Normalisér integrationer. Match lydformater, regioner, ordforrådshints, kanallayouts, genforsøg, timeouts og modelversioner.
- Kør test for optaget lyd. Mål omkostning, gennemløb, WER, navngivne termer, formatering, talere, fejl og korrektions-tid.
- Kør live-lydtests. Mål stabile delresultater, finaliseringsforsinkelse, endpointing, afbrydelseshåndtering og genopkoblingsadfærd ved p50 og p95.
- Beregn omkostning pr. accepteret transskription. Læg kanaler, funktioner, genforsøg, lager, overførsel og korrekturtid til.
- Vælg en routingspolitik. Den bedste produktion kan bruge én rute til live engelske opkald, en anden til flersprogede møder og en lavere-prioritets batchrute til arkiver.
Production Checklist Before Signing a Contract
- Test optagede og live-modeller separat; deres priser, sprog og adfærd kan variere.
- Mål stabile delresultater og finalisering, ikke kun tid til første tekst.
- Sammenlign stereo-kanalidentifikation med enkel-kanals diarisering på overlappende tale.
- Fremprovokér timeouts, misformet lyd, tomme svar, forbindelsesbrud, webhook-genlevering og rate-limit-fejl.
- Verificér filstørrelse, sessionsvarighed, samtidighed, rate limits og workflows for lange filer.
- Bekræft retention, anvendelse til modelforbedring, regional behandling, sletningskontroller, kryptering, DPA eller BAA-tilgængelighed og underdatabehandlere for den præcise plan.
- Gem modelversion, lydsekunder, kanaler, tillæg, anmodningsomkostning, genforsøg, latens, gennemgangsminutter og acceptstatus.
- Retest efter pris- eller modelændringer i stedet for at antage, at den tidligere vinder forbliver bedst.
Lav en shortlist af udbydere efter arbejdsbelastning, og benchmark dem derefter med samme lyd, indstillinger og acceptkriterier. For de fleste teams bør en praktisk første runde omfatte én billig rute for optaget lyd, én specialiseret streamingrute og én udbyder, der allerede passer til den eksisterende cloud- eller SDK-stack.
Test Supported Speech Models Through CometAPI
Teams, der evaluerer understøttede OpenAI-kompatible speech-modeller, kan følge CometAPI Quickstart for at køre en indledende transskriptionsforespørgsel gennem et samlet API-endpoint.
CometAPI kan forenkle autentificering, fakturering og klientintegration for understøttede modeller. Før produktion skal du verificere hver models understøttede formater, begrænsninger, privatlivsvilkår, latens og faktureringsadfærd.
Frequently Asked Questions
Hvad er den bedste speech-to-text-API i 2026?
Der findes ikke én vinder for alle arbejdsbelastninger. AssemblyAI og Google Dynamic Batch er stærke, lavpris-kandidater til optaget lyd. Deepgram, AssemblyAI og ElevenLabs fortjener tidlig test til live-transskription. OpenAI er bekvemt i en OpenAI-kompatibel stack, mens AWS og Google kan være operationelt enklere i deres respektive clouds.
Hvad er den billigste speech-to-text-API til optaget lyd?
Blandt de offentlige ruter, der er normaliseret her, starter AssemblyAI Universal-2 ved $0.15 pr. lydtime. Google Dynamic Batch og OpenAI gpt-4o-mini-transcribe normaliserer til ca. $0.18 pr. time. Den endelige omkostning kan ændre sig med kanaler, volumentrappetrin, tillæg, genforsøg, lager, overførsel og menneskelig korrektion.
Hvilken API er bedst til realtime-transskription eller stemmeagenter?
Start med Deepgram, AssemblyAI og ElevenLabs, og inkluder derefter OpenAI, AWS eller Google, når deres økosystem eller sprogunderstøttelse passer. Sammenlign stabile delresultater, endpointing, finaliseringsforsinkelse, afbrydelseshåndtering, genopkoblingsadfærd og p95-latens på dit eget livemønster.
Hvordan bør jeg sammenligne speech-to-text-nøjagtighed?
Brug den samme licenserede lyd, region, modelindstillinger og normaliseringspolitik for hver udbyder. Rapportér ordfejlsrate sammen med nøjagtighed for navngivne termer, talertilknytning, formatering, p95-latens, fejlrater og redaktørminutter pr. lydtime. Sammenflet ikke urelaterede leverandør-benchmarks til en universel rangering.
