GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
technology/CometAPI research

6 bedste tale-til-tekst-API'er i 2026: priser, latens og egnethed til produktion

Sammenlign OpenAI, Deepgram, AssemblyAI, Google, AWS og ElevenLabs efter pris, latenstid, sprog, talerdiarisering og samlede produktionsomkostninger.

CometAPI
Mia MarenForskningshold for AI-modeller og API
Opdateret Sep 3, 2026 14 min. læsning
6 bedste tale-til-tekst-API'er i 2026: priser, latens og egnethed til produktion
Brug dette mønster

Lav det første API-kald.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Der findes ikke én universelt bedste speech-to-text-API. AssemblyAI Universal-2 og Google Dynamic Batch er stærke, lavpris-startpunkter for optaget lyd. Deepgram, AssemblyAI og ElevenLabs fortjener tidlig afprøvning til live-undertekster og stemmeagenter. OpenAI er bekvemt, når resten af produktet allerede bruger OpenAI SDK, mens AWS og Google kan reducere den operationelle friktion i en eksisterende cloud-stack.

Vælg ikke kun ud fra pris pr. minut. Produktionsomkostningen afhænger også af kanalfakturering, gebyrer for diarisering og maskering, p95-finaliseringslatens, genforsøg, datavilkår og de minutter, en person bruger på at rette hver accepteret transskription.

How to Choose a Speech-to-Text API: Which Provider Should You Test First?

Start med din arbejdsbelastning frem for en universel udbyderrangering. Den rette speech-to-text-API afhænger af, om du har brug for billig batchtransskription, lav-latens streaming, flersproget support, talerseparation eller tættere integration med en eksisterende cloud-stack.

Brug shortlisten nedenfor til at afgøre, hvilke udbydere der hører til i din første benchmark.

BrugsscenarieStart medHvorforAfgørende test
Stort arkiv med optagelserAssemblyAI Universal-2, Google Dynamic Batch, OpenAI gpt-4o-mini-transcribeLave listede priser for optaget lydKøtid, håndtering af lange filer, formatering og korrektionsminutter
Live-undertekster eller stemmeagenterDeepgram Nova-3 eller Flux, AssemblyAI Realtime, ElevenLabs Scribe v2 RealtimeStreaming-API'er med delvise resultater og turdetektions-workflowsLatens for stabile delresultater, finaliseringsforsinkelse, afbrydelser og genopkoblinger
Kontaktcenter-opkaldAWS Transcribe, Google Cloud STT, Deepgram, AssemblyAIKanalhåndtering, diarisering, ordforrådskontrol og sløringsmulighederFakturering pr. kanal, overlappende tale, PII-politik og regional behandling
Flersprogede møder eller medierAssemblyAI Universal-3.5 Pro, ElevenLabs Scribe v2, Deepgram Nova-3 Multilingual, OpenAI transcription modelsBred sprogunderstøttelse eller understøttelse af code-switchingDine faktiske sprogsæt, accenter, navne, tidsstempler og blandede sprogsegmenter

Speech-to-Text API Pricing Comparison: 2026 Snapshot

Tabellen normaliserer offentlige listepriser til én lydtime for overblik. Den indebærer ikke ens kvalitet, latens, funktioner eller kommercielle vilkår. Kampagner, lavere prioritet og højvolumenpriser er markeret, fordi de ikke er direkte ækvivalente med almindelige startpriser.

UdbyderBedste produktionsmatchPris for optaget/asynkronPris for live/standardVigtigste forbehold
OpenAIEksisterende OpenAI-applikationer og enkel uploadet transskriptiongpt-4o-mini-transcribe: $0.18/hr; gpt-4o-transcribe: $0.36/hrgpt-realtime-whisper: $1.02/hrUploads er begrænset til 25 MB. Word-level timestamp_granularities[] er dokumenteret kun for whisper-1; diarisering bruger en separat model og understøttes ikke i Realtime API.
DeepgramStreamingkontrol, live-undertekster og stemmeagent-pipelinesNova-3 Monolingual pre-recorded: $0.462/hrNova-3 Monolingual streaming: $0.288/hr (kampagne)Diarisering og sløring tilføjer hver $0.0020/min; keyterm prompting tilføjer $0.0013/min. De oplyste satser tilmelder brugere Model Improvement Program.
AssemblyAIBillig transskription af optaget lyd og tydeligt prissatte funktionerUniversal-2: $0.15/hr; Universal-3.5 Pro: $0.21/hrUniversal-Streaming: $0.15/hr; Universal-3.5 Pro Realtime: $0.45/hrMultikanalsfiler faktureres pr. kanal. $0.15/hr-streamingruterne understøtter engelsk eller seks sprog, ikke Universal-2's fulde 99-sprog-dækning.
Google Cloud Speech-to-Text V2GCP-native arbejdsbelastninger og arkiver med lav prioritetDynamic Batch: $0.18/hrStandard recognition: $0.96/hr for the first 500,000 monthly minutesDynamic Batch kører med lavere prioritet. Hver lydkanal faktureres separat.
Amazon TranscribeAWS-native kontaktcenter og to-kanals opkaldslydRegions- og volumentrappet; officielt 2M-minute US East-eksempel: $0.36/hrOfficielt 2M-minute US East-eksempel: $0.60/hrDette er højvolumeneksempler, ikke generelle startpriser. Anmodninger har et minimum på 15 sekunder; op til to kanaler er inkluderet i varighedsafgiften.
ElevenLabs ScribeFlersprogede medier, ordtimings og hurtige realtids-eksperimenterScribe v2: $0.22/hrScribe v2 Realtime: $0.39/hrEnhedsgenkendelse tilføjer $0.07/hr og keyterm prompting tilføjer $0.05/hr. Leverandørens latens omfatter ikke dit netværk og din applikationssti.

Developer-genvej: Hvis din shortlist omfatter Whisper, GPT-4o Transcribe eller en anden speech-model, der aktuelt understøttes af CometAPI, så tjek live-modelkatalog og prissætning og brug den OpenAI-kompatible hurtigstart for at køre den samme lyd gennem understøttede ruter. Bekræft den præcise model-ID og endpoint, før du bygger benchmarken.

Detailed Vendor Breakdown: The 6 APIs Compared

1. OpenAI: Best for Teams Already Using the OpenAI SDK

OpenAI’s prisside anslår transskription til $0.003 pr. minut for gpt-4o-mini-transcribe og $0.006 pr. minut for gpt-4o-transcribe. Den dedikerede gpt-realtime-whisper-rute er opført til cirka $0.017 pr. minut.

OpenAI er et praktisk førstevalg for teams, der allerede bruger OpenAI SDK til autentificering, logging, genforsøg og modelstyring. Både gpt-4o-transcribe og gpt-4o-mini-transcribe understøtter prompting, hvilket kan forbedre genkendelsen af produktnavne, akronymer, personer og domænespecifikt ordforråd. For optagelser, der kræver taleridentifikation, kan den separate gpt-4o-transcribe-diarize-model returnere segmenter med taleretikker og knytte dem til kendte talere ved hjælp af korte referenceklip.

De vigtigste begrænsninger er arkitektoniske snarere end rent prisrelaterede. Uploadede filer er begrænset til 25 MB, word-level timestamp_granularities[] er dokumenteret for whisper-1, og diarisering er ikke tilgængelig via Realtime API. Teams, der behandler lange optagelser, live-samtaler eller kontaktcenter-lyd med mange talere, bør teste filhåndtering, tidsstempelkrav og talerattribuering, før de standardiserer på en OpenAI-rute. Se den officielle OpenAI-speech-to-text-dokumentation for aktuel endpoint-adfærd og understøttede outputformater.

Teams, der vil bruge GPT-4o Transcribe og samtidig reducere direkte API-omkostninger, kan også gennemgå GPT-4o Transcribe API på CometAPI. På skrivende tidspunkt viser CometAPI adgang til en lavere sats end OpenAIs standardpriser for direkte API, samtidig med at integrationen forbliver OpenAI-kompatibel. Tjek live-modelsiden, før du benchmarker, da priser, tilgængelighed og understøttede parametre kan ændre sig.

Test OpenAI først når: din applikation allerede bruger OpenAI-kompatible værktøjer, det meste lyd uploades i stedet for at blive streamet kontinuerligt, og reduktion af integrationskompleksitet betyder mere end specialiseret streaming eller kontaktcenter-kontrol.

2. Deepgram: Best for Streaming Control and Voice-Agent Pipelines

Deepgrams prisside viser tidsbegrænsede streamingrater på $0.0048 pr. minut for Nova-3 Monolingual og $0.0058 pr. minut for Nova-3 Multilingual. De tilsvarende pay-as-you-go-satser for forudindspillet er $0.0077 og $0.0092 pr. minut. Flux er positioneret til samtalebaserede stemmeagenter med turdetektion og håndtering af afbrydelser.

Deepgram hører hjemme på shortlister til live-produkter, fordi streamingadfærd betyder lige så meget som endelig transkriptkvalitet. En stemmegrænseflade har brug for nyttige delvise resultater, pålidelig endpointing, naturlig afbrydelseshåndtering og forudsigelig finalisering—ikke blot et pænt transkript, når samtalen slutter.

Budgetter tillæggene sammen med modellen. Talerdiarisering og sløring tilføjer hver $0.0020 pr. minut; keyterm prompting tilføjer $0.0013 pr. minut. Deepgram oplyser også, at de anførte satser tilmelder brugere Model Improvement Program, så teams med strengere dataanvendelseskrav bør verificere alternative kommercielle vilkår.

Test Deepgram først når: turtagning, lav-latens delresultater, streamingkontrol eller stemmeagent-adfærd er det primære krav.

3. AssemblyAI: Best Low-Cost Recorded Route with Transparent Add-On Pricing

AssemblyAIs priser oplyser Universal-2 til $0.15 pr. lydtime og Universal-3.5 Pro til $0.21 pr. time. Universal-2 understøtter 99 sprog; Universal-3.5 Pro understøtter 18 sprog med code switching og et mere avanceret modelniveau.

Realtime-produktlinjen er separat. Universal-Streaming koster $0.15 pr. time for engelsk, og Universal-Streaming Multilingual dækker engelsk, spansk, tysk, fransk, portugisisk og italiensk til samme pris. Universal-3.5 Pro Realtime koster $0.45 pr. time og understøtter 18 sprog.

AssemblyAIs eksplicitte tillægs-matrix gør budgettering lettere: optaget talerdiarisering koster $0.02 pr. time, realtime-diarisering koster $0.12 pr. time, og Universal-Streaming keyterm prompting koster $0.04 pr. time. Multikanalsfiler faktureres pr. kanal, hvilket kan ændre resultatet for stereoopkald.

Test AssemblyAI først når: lav pris for optaget lyd, bred sprogunderstøttelse, klar funktionsprissætning eller en simpel asynkron workflow er prioriteten.

4. Google Cloud Speech-to-Text: Best for Dynamic Batch and GCP-Native Workloads

Google Cloud Speech-to-Text V2-priser oplyser Dynamic Batch til $0.003 pr. minut og standardgenkendelse til $0.016 pr. minut for de første 500.000 månedlige minutter. Standardprisen falder ved højere brugstrin.

Dynamic Batch er overbevisende for arkiver, der ikke kræver hurtig ekspedering, men den lavere pris er bundet til lavere behandlingshast. Google fakturerer også hver lydkanal separat: en 30-sekunders forespørgsel med fire kanaler faktureres som 120 sekunders behandlet lyd.

Google er ofte operationelt attraktivt, når lyd allerede ligger i Cloud Storage, og teamet bruger GCP-identitet, logning, regionale endpoints og faktureringskontroller. Læg lager, overførsel og tilstødende cloud-tjenester ind i totalomkostningsmodellen i stedet for at behandle transskription som en isoleret linjepost.

Test Google først når: store, ikke-hastende arkiver, GCP-native drift, regional udrulning eller adaptationsfunktioner betyder mere end den enkleste prisliste.

5. Amazon Transcribe: Best for AWS-Native Contact-Center Audio

Amazon Transcribe-priser varierer efter region og månedlig brugstrin. AWS’ offentlige US East-eksempel for to millioner månedlige minutter bruger $0.006 pr. minut for batch og $0.01 pr. minut for streaming. Disse tal er højvolumeneksempler, ikke almindelige startpriser.

Forbruget faktureres i ét-sekunds intervaller med et minimum på 15 sekunder pr. anmodning. Standardpriserne inkluderer brugerdefinerede ordlister, ordlistefiltrering, talerdiarisering og sprogidentifikation; automatisk indholdsredigering og brugerdefinerede sprogmodeller koster ekstra.

AWS inkluderer op til to kanaler i varighedsafgiften. For stereo-supportopkald kan den regel være mere fordelagtig end en udbyder, der fakturerer hver kanal som en separat time.

Test AWS først når: opkaldene allerede kører via AWS, to-kanals fakturering er værdifuld, eller IAM, lager, sikkerhed og indkøbsintegration vejer tungere end den laveste synlige listepris.

6. ElevenLabs Scribe: Best for Multilingual Media and Fast Real-Time Experiments

ElevenLabs API-priser oplyser Scribe v2 til $0.22 pr. time og Scribe v2 Realtime til $0.39 pr. time. Produktet inkluderer flersproget transskription, ordniveau-tidsstempler, diarisering, lydtagging og valgfrie nøgleterm- og enhedsfunktioner.

Scribe v2 Realtime annoncerer lav modellatens, men en køber bør måle den komplette vej fra mikrofonoptagelse til stabil tekst i den målregion og transportstack. Leverandørens latens omfatter ikke din WebSocket-håndtering, netværkssti, buffering, UI-opdateringer eller downstream-agentlogik.

Enhedsgenkendelse tilføjer $0.07 pr. time, og keyterm prompting tilføjer $0.05 pr. time. Medtag begge i omkostningen pr. accepteret transskription, når de er påkrævet for produktet.

Test ElevenLabs først når: flersprogede medier, ordtimings, lydtags eller en hurtig realtime-prototype er centrale krav.

Total Cost of Ownership: Hidden Costs That Can Reverse the Ranking

Multichannel Billing

Et en-times stereoopkald er ikke altid én fakturerbar time.

RutePlanlægningsberegning for et 60-minutters opkald med to kanalerAnslået grundomkostning
AssemblyAI Universal-21 time × 2 kanaler × $0.15/hr$0.30
AWS Transcribe batch1 time i alt × $0.36/hr$0.36
Google standard recognition1 time × 2 kanaler × $0.96/hr$1.92

AWS-værdien bruger udbyderens officielle US East-eksempel ved to millioner månedlige minutter. Brug AWS-beregneren for den faktiske region og månedlige volumen.

Tabellen er et faktureringseksempel, ikke en rangering af kontaktcentre. Test overlappende tale, talerovertagelser, terminologi, sløring, finaliseringsforsinkelse og korrektionsindsats, før du vælger en rute.

Add-Ons, Retries, and Human Review

Deepgrams Nova-3 Monolingual-forudindspillede behandling stiger fra $0.0077 til $0.0097 pr. minut, når diarisering tilføjes. Tilføjes sløring, stiger den til $0.0117 pr. minut før keyterm prompting. AssemblyAI opkræver $0.02 pr. time for diarisering af optaget lyd og $0.12 pr. time for realtime-diarisering. ElevenLabs opkræver $0.07 pr. time for enhedsgenkendelse og $0.05 pr. time for keyterm prompting.

Genforsøg, duplikerede webhooks, lager og cross-cloud-overførsel kan tilføje omkostninger uden at forbedre transskriptet. Log lydsekunder, kanaltal, funktionsflag, anmodningsstatus, genforsøg, modelversion, latens og gennemgangstid for hvert job.

Den bedre indkøbsmåling er ikke pris pr. lydminut. Omkostning pr. accepteret transskription = API-behandling + betalte funktioner + genforsøg + lager/overførsel + menneskelig korrekturtid

Antag, at en korrekturlæser koster $30 pr. time:

Illustrativ ruteAPI-omkostning for én lydtimeMenneskelig korrektionKorrektionsomkostningSamlet omkostning pr. accepteret transskription
Lavprisrute$0.158 minutter$4.00$4.15
Højprisrute$0.603 minutter$1.50$2.10

Den anden rute koster fire gange mere på API-laget, men omtrent halvt så meget efter gennemgang. Korrektions-tiderne er planlægningsantagelser, ikke udbyder-benchmarkresultater; erstat dem med målinger fra de personer, der godkender transskripter i din workflow.

How to Evaluate Speech-to-Text APIs on Real Audio

Udbydernes nøjagtighedspåstande er ikke direkte sammenlignelige, fordi de bruger forskellige datasæt, sprog, normaliseringspolitikker, modelversioner og akustiske forhold. 2026-studiet GigaSpeechBench evaluerer 680 timer menneskeannoteret virkelighedstale på tværs af lavressourcesprog, kinesiske dialekter, engelske accenter, terminologi fra 12 vertikaler samt børne- og ældres tale. Dets resultater viser væsentlige forringelser for førende modeller og kommercielle API'er i vanskelige forhold.

Den nyttige konklusion er ikke, at én offentlig benchmark har fundet en permanent vinder. Det er, at dit testsæt skal ligne din trafik.

Use a Production-Like Evaluation Set

  • 20 rene møder eller interviews med navne og domænetermer.
  • 20 støjende supportopkald med afbrydelser, ventemusik, krydstale og kanalskift.
  • 20 accent- eller flersprogede klip, inklusive ægte code switching.
  • 10 lange podcasts eller videofiler.
  • 10 korte live-udsagn med stilhed, tøven, falske starter og barge-in.

Score More Than Word Error Rate

MetrikHvad der målesHvorfor det betyder noget
Ordfejlsrate (WER)Indsættelser, sletninger og substitutioner under én fælles normaliseringspolitikFanger leksikal nøjagtighed, men ikke fuld transkriptanvendelighed
Nøjagtighed for navngivne termerProduktnavne, personer, steder, forkortelser, tal og brancheterminologiEn lille fejlrate for egennavne kan skabe stort korrekturarbejde
TalertilknytningFejlagtigt tildelte ord og oversete talerskiftKritisk for opkald, interviews, compliance og analyse
FormateringskvalitetTegnsætning, store/små bogstaver, afsnit, tal, datoer og disfluensBestemmer oprydningstid før publicering eller analyse
Batch-gennemløbstidUpload-til-final p50 og p95 for korte og lange filerEn billig rute med lavere prioritet kan misse den operationelle deadline
StreaminglatensFørste delresultat, stabilt delresultat og endelig transskription ved p50 og p95Gennemsnitslatens skjuler de pauser, brugerne faktisk mærker
PålidelighedTimeouts, tomme resultater, genforsøg, duplikerede webhooks og fallback-rateFejl øger direkte omkostninger og synlig forsinkelse for brugeren
GennemgangsindsatsRedaktørminutter pr. lydtime og acceptgrad for transskriptionOmsætter outputkvalitet til en forretningsomkostning

A Seven-Day Evaluation Plan

  1. Definér acceptkontrakten. Fastlæg påkrævede sprog, p95-latens, tolerance for talerlabels, tidsstempelkrav, opbevaringsregler og maksimale gennemgangsminutter pr. lydtime.
  2. Byg og mærk lydsættet. Brug licenseret, produktionslignende lyd og én fælles reference-transkriptpolitik.
  3. Normalisér integrationer. Match lydformater, regioner, ordforrådshints, kanallayouts, genforsøg, timeouts og modelversioner.
  4. Kør test for optaget lyd. Mål omkostning, gennemløb, WER, navngivne termer, formatering, talere, fejl og korrektions-tid.
  5. Kør live-lydtests. Mål stabile delresultater, finaliseringsforsinkelse, endpointing, afbrydelseshåndtering og genopkoblingsadfærd ved p50 og p95.
  6. Beregn omkostning pr. accepteret transskription. Læg kanaler, funktioner, genforsøg, lager, overførsel og korrekturtid til.
  7. Vælg en routingspolitik. Den bedste produktion kan bruge én rute til live engelske opkald, en anden til flersprogede møder og en lavere-prioritets batchrute til arkiver.

Production Checklist Before Signing a Contract

  1. Test optagede og live-modeller separat; deres priser, sprog og adfærd kan variere.
  2. Mål stabile delresultater og finalisering, ikke kun tid til første tekst.
  3. Sammenlign stereo-kanalidentifikation med enkel-kanals diarisering på overlappende tale.
  4. Fremprovokér timeouts, misformet lyd, tomme svar, forbindelsesbrud, webhook-genlevering og rate-limit-fejl.
  5. Verificér filstørrelse, sessionsvarighed, samtidighed, rate limits og workflows for lange filer.
  6. Bekræft retention, anvendelse til modelforbedring, regional behandling, sletningskontroller, kryptering, DPA eller BAA-tilgængelighed og underdatabehandlere for den præcise plan.
  7. Gem modelversion, lydsekunder, kanaler, tillæg, anmodningsomkostning, genforsøg, latens, gennemgangsminutter og acceptstatus.
  8. Retest efter pris- eller modelændringer i stedet for at antage, at den tidligere vinder forbliver bedst.

Lav en shortlist af udbydere efter arbejdsbelastning, og benchmark dem derefter med samme lyd, indstillinger og acceptkriterier. For de fleste teams bør en praktisk første runde omfatte én billig rute for optaget lyd, én specialiseret streamingrute og én udbyder, der allerede passer til den eksisterende cloud- eller SDK-stack.

Test Supported Speech Models Through CometAPI

Teams, der evaluerer understøttede OpenAI-kompatible speech-modeller, kan følge CometAPI Quickstart for at køre en indledende transskriptionsforespørgsel gennem et samlet API-endpoint.

CometAPI kan forenkle autentificering, fakturering og klientintegration for understøttede modeller. Før produktion skal du verificere hver models understøttede formater, begrænsninger, privatlivsvilkår, latens og faktureringsadfærd.

Frequently Asked Questions

Hvad er den bedste speech-to-text-API i 2026?

Der findes ikke én vinder for alle arbejdsbelastninger. AssemblyAI og Google Dynamic Batch er stærke, lavpris-kandidater til optaget lyd. Deepgram, AssemblyAI og ElevenLabs fortjener tidlig test til live-transskription. OpenAI er bekvemt i en OpenAI-kompatibel stack, mens AWS og Google kan være operationelt enklere i deres respektive clouds.

Hvad er den billigste speech-to-text-API til optaget lyd?

Blandt de offentlige ruter, der er normaliseret her, starter AssemblyAI Universal-2 ved $0.15 pr. lydtime. Google Dynamic Batch og OpenAI gpt-4o-mini-transcribe normaliserer til ca. $0.18 pr. time. Den endelige omkostning kan ændre sig med kanaler, volumentrappetrin, tillæg, genforsøg, lager, overførsel og menneskelig korrektion.

Hvilken API er bedst til realtime-transskription eller stemmeagenter?

Start med Deepgram, AssemblyAI og ElevenLabs, og inkluder derefter OpenAI, AWS eller Google, når deres økosystem eller sprogunderstøttelse passer. Sammenlign stabile delresultater, endpointing, finaliseringsforsinkelse, afbrydelseshåndtering, genopkoblingsadfærd og p95-latens på dit eget livemønster.

Hvordan bør jeg sammenligne speech-to-text-nøjagtighed?

Brug den samme licenserede lyd, region, modelindstillinger og normaliseringspolitik for hver udbyder. Rapportér ordfejlsrate sammen med nøjagtighed for navngivne termer, talertilknytning, formatering, p95-latens, fejlrater og redaktørminutter pr. lydtime. Sammenflet ikke urelaterede leverandør-benchmarks til en universel rangering.

Fortsæt læring

Knyt denne artikel til den næste beslutning.

Se alle emner
Udgivet den Jul 27, 2026
Sidst opdateret Sep 3, 2026
80 visninger
Gennemgået for klarhed, kildeangivelse og aktuel API-terminologi.

Klar til at skære AI-udviklingsomkostninger med 20%?

Kom gratis i gang på få minutter. Gratis prøvekreditter inkluderet. Intet kreditkort påkrævet.

Læs mere