GPT-Transcribe vs GPT-Live-Transcribe: prijzen, API-verschillen en migratie
TL;DR
Gebruik gpt-transcribe voor voltooide opnames voor $0.0045 per audiominuut en gpt-live-transcribe voor microfoons, oproepen of live mediastreams voor $0.017 per minuut. OpenAI rapporteert een lagere transcriptiefout voor het live-model dan voor GPT-Realtime-Whisper op de gepubliceerde benchmarks, maar de juiste route hangt af van wanneer tekst moet verschijnen, welke uitvoervelden je nodig hebt en hoe beide modellen presteren op jouw productie-audio.
GPT-Transcribe vs GPT-Live-Transcribe in één oogopslag
Als je alleen transcriptie nodig hebt nadat audio is opgenomen, gebruik dan gpt-transcribe. Als je toepassing tekst nodig heeft terwijl audio nog binnenkomt, gebruik dan gpt-live-transcribe. Het grootste verschil is niet alleen de prijs, maar wanneer transcriptie begint en welk type API-werkstroom je app moet ondersteunen.
| Item | gpt-transcribe | gpt-live-transcribe |
|---|---|---|
| Best voor | Geuploade opnames, begrensde audiovragen, asynchrone jobs en vastgelegde Realtime-beurten | Microfoons, oproepen, vergaderingen en live mediastreams |
| Gepubliceerde prijs | $0.0045 per audiominuut | $0.017 per audiominuut |
| Prijs per audio-uur | $0.27 | $1.02 |
| API / Endpoints | /v1/audio/transcriptions; optionele vastgelegde-turn Realtime-werkstroom | Realtime transcriptiesessies (v1/realtime/transcription_sessions of vergelijkbaar) |
| Verbinding | Bestand uploaden; optionele gestreamde respons terwijl het bestand wordt verwerkt | WebSocket voor server-pijplijnen of WebRTC voor browseraudio |
| Wanneer transcriptie start | Nadat een bestand is ingediend of een audiobeurt is vastgelegd | Terwijl audio binnenkomt |
| Gedeeltelijke transcriptie-uitvoer | Ja, met bestandsstreaming of vastgelegde-turn-streaming | Ja, zodra live spraak binnenkomt |
| Contextinstellingen | prompt, keywords, languages | prompt, keywords, languages, delay |
| Gedetecteerde taal in output | Ja, wanneer het model een betrouwbare voorspelling kan doen | Nee |
| Belangrijke beperkingen | Uploadlimiet 25 MB; andere routes vereist voor tijdstempels, diarisatie of vertaling | Geen woordniveau-tijdstempels, sprekerlabels of betrouwbaarheidscores |
Hoewel gpt-transcribe gedeeltelijke transcriptupdates kan terugsturen tijdens het verwerken van een voltooid bestand of een vastgelegde audiobeurt, is het geen doorlopende live-streamingroute. Voor live-ondertiteling, oproepen of microfooningest is gpt-live-transcribe de betere keuze.
Voor een bredere vergelijking tussen aanbieders, zie CometAPI’s 6 beste Speech-to-Text-API’s in 2026.
Wat zijn GPT-Transcribe en GPT-Live-Transcribe?
OpenAI introduceerde gpt-transcribe en gpt-live-transcribe op 29 juli 2026. gpt-transcribe verwerkt voltooide opnames, gestreamde bestandstranscripts en vastgelegde Realtime-beurten, terwijl gpt-live-transcribe transcriptupdates met lage latentie terugstuurt terwijl audio binnenkomt van microfoons, oproepen of live mediastreams.
De twee modellen bieden nieuwe standaardroutes voor algemene bestands- en live-transcriptie, maar gespecialiseerde Whisper- en GPT-4o-transcriptiewerkstromen blijven nodig voor tijdstempels, vertaling, ondertitels en sprekersdiarisatie.
Wanneer is GPT-Live-Transcribe de hogere prijs waard?
De API-prijspagina van OpenAI vermeldt gpt-transcribe voor $0.0045 per minuut en gpt-live-transcribe voor $0.017 per minuut. De live-route kost dus ongeveer 3,8 keer meer per audiominuut.
| Maandelijks audiovolume | gpt-transcribe | gpt-live-transcribe | Extra kosten voor live |
|---|---|---|---|
| 100 uur | $27 | $102 | $75 |
| 1.000 uur | $270 | $1,020 | $750 |
| 10.000 uur | $2,700 | $10,200 | $7,500 |
Deze transcriptiekostenschattingen gebruiken alleen de gepubliceerde basistarieven van OpenAI: audio-uren × 60 × prijs per minuut. Ze sluiten opslag, netwerktransport, retries, applicatiehosting, post-processing, menselijke correctie en fallback-providerkosten uit.
Kies gpt-live-transcribe wanneer directe ondertiteling, agent-assistentie, moderatie of realtime-interactie onderdeel is van de productvereiste. Kies gpt-transcribe wanneer het transcript pas nodig is nadat een vergadering, gesprek, interview of media-upload is voltooid. Een tweeroute-architectuur kan live-transcriptie gebruiken voor de gebruikerservaring en bestandstranscriptie voor verwerking na de call of backfills.
OpenAI vermeldt momenteel GPT-Realtime-Whisper en gpt-live-transcribe tegen hetzelfde basistarief van $0.017 per minuut. Evalueer een migratie tussen deze live-routes op kwaliteit van geaccepteerde transcripties, latentie, event-afhandeling en operationele compatibiliteit in plaats van alleen op de lijstprijs.
Hoe verschillen de GPT-Transcribe- en GPT-Live-Transcribe-API’s?
Het belangrijkste verschil is hoe audio het systeem binnenkomt en wanneer transcriptie-events beginnen. gpt-transcribe accepteert voltooide bestanden of vastgelegde audiobeurten, terwijl gpt-live-transcribe een Realtime-verbinding onderhoudt en transcriptupdates uitstuurt terwijl audio nog binnenkomt.
Gebruik GPT-Transcribe voor voltooide audio
Voor een voltooide opname, stuur het bestand naar /v1/audio/transcriptions. De handleiding voor bestandstranscriptie van OpenAI accepteert bestanden tot 25 MB in de formaten mp3, mp4, mpeg, mpga, m4a, wav of webm.
from openai import OpenAI
client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="gpt-transcribe",
file=audio_file,
prompt="A support call about a premium plan and account AC-42.",
extra_body={
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
},
)
print(transcript.text)
Stel stream=True in om transcript-delta-evenementen te ontvangen terwijl OpenAI de geüploade opname verwerkt. Dit verkort de wachttijd op zichtbare tekst, maar verandert het bestandsendpoint beslist niet in live microfooningest.
Gebruik GPT-Live-Transcribe voor binnenkomende audio
Maak een Realtime-sessie met type: "transcription" en selecteer gpt-live-transcribe. Gebruik WebSocket voor een server-side mediapijplijn of WebRTC voor browseraudio.
{
"type": "session.update",
"session": {
"type": "transcription",
"audio": {
"input": {
"format": {
"type": "audio/pcm",
"rate": 24000
},
"transcription": {
"model": "gpt-live-transcribe",
"prompt": "A support call about a premium plan and account AC-42.",
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
"delay": "low"
},
"turn_detection": null
}
}
}
}
Voeg audiodelen toe met input_audio_buffer.append. De toepassing kan beurten vastleggen met input_audio_buffer.commit of server-side voice-activity-detection configureren.
De Realtime transcriptiehandleiding retourneert incrementele tekst via conversation.item.input_audio_transcription.delta, gevolgd door conversation.item.input_audio_transcription.completed voor het vastgelegde item. Voltooiingsevents van verschillende beurten zijn niet gegarandeerd in volgorde van aankomst; reconcilieer ze daarom met item_id in plaats van op aankomstvolgorde.
Gebruik de vastgelegde-turn-route wanneer onmiddellijke tekst niet nodig is
gpt-transcribe kan ook worden uitgevoerd in een Realtime-transcriptiesessie via WebSocket. Transcriptie begint nadat een audiobeurt is vastgelegd, het model kan eerder getranscribeerde beurten als context gebruiken, en het voltooide event kan gedetecteerde talen bevatten.
Deze vastgelegde-turn-route is nuttig wanneer turn-gebaseerde streaming of taalherkenning belangrijker is dan tekst tonen terwijl de spreker nog praat. Verwissel dit niet met het continue, lagere-latentiegedrag van gpt-live-transcribe.
Hoe beïnvloeden prompts, keywords, languages en delay de transcriptie?
Beide modellen accepteren context die de herkenning van namen, nummers, acroniemen, producttermen, geaccentueerde spraak, meertalige audio en code-switching kan verbeteren.
| Control | Doel | Let op in productie |
|---|---|---|
| prompt | Beschrijf de opname, spreker, domein of het verwachte onderwerp | Te specifieke context kan het transcript bevooroordelen |
| keywords | Geef letterlijke namen, acroniemen, accountformaten of technische termen | Hints zijn geen verplichte output; test op onuitgesproken ingevoegde termen |
| languages | Geef een of meer verwachte invoertalen op | Niet-ondersteunde of onjuist geformatteerde codes leiden tot afwijzing |
| delay | Ruil eerdere live-delta’s in voor meer akoestische context | Beschikbaar voor gpt-live-transcribe; benchmark in plaats van vaste milliseconden te veronderstellen |
Voor de nieuwe modellen vervangt languages het oudere enkelvoudige veld language. Stuur niet beide. Elk keyword moet op één regel blijven en mag geen <, >, carriage returns of line feeds bevatten; ongeldige waarden zorgen ervoor dat de aanvraag of sessie-update wordt afgewezen.
gpt-live-transcribe ondersteunt de delay-instellingen minimal, low, medium, high en xhigh. Lagere instellingen geven de voorkeur aan eerdere gedeeltelijke tekst, terwijl hogere instellingen meer audiocontext bieden en de transcriptiekwaliteit kunnen verbeteren. OpenAI belooft geen vaste latentie voor elk niveau, dus meet time to first delta en time to final transcript op representatieve microfoons, codecs, netwerken, talen en sessieduren.
Wat laten de nauwkeurigheidsbenchmarks van OpenAI zien?
De lancering van OpenAI rapporteert dat gpt-live-transcribe beter presteerde dan GPT-Realtime-Whisper-1 op twee meertalige transcriptietests. Er wordt ook gemeld dat vrije context de semantische nauwkeurigheid verbeterde op een Context Aware ASR-evaluatie.
| OpenAI-evaluatie | resultaat gpt-live-transcribe | Vergelijking | Gerapporteerde verandering |
|---|---|---|---|
| Context Aware ASR, semantische nauwkeurigheid | 44.6% met vrije context | 38.5% zonder context | +6.1 procentpunt |
| Common Voice, 22 talen, transcriptiefoutpercentage | 19.70% | 20.33% voor GPT-Realtime-Whisper-1 | -0.63 punt; circa 3.1% relatief |
| Real-World Audio Recording, 9 talen, transcriptiefoutpercentage | 9.60% | 11.65% voor GPT-Realtime-Whisper-1 | -2.05 punt; circa 17.6% relatief |
De verdedigbare conclusie is beperkt: het nieuwe livemodel presteerde beter op de door OpenAI gerapporteerde tests, en context verbeterde de gerapporteerde semantische-nauwkeurigheidsscore. Deze door de leverancier gerapporteerde resultaten garanderen niet dezelfde verbetering voor elke taal, telefoniecodec, microfoon, delay-instelling, domeinvocabulaire of correctiebeleid.
Wanneer moet je in plaats daarvan Whisper of GPT-4o Transcribe gebruiken?
Geen van beide nieuwe modellen vervangt elke spraak-naar-tekst-werkstroom.
| Vereiste | Aanbevolen route |
|---|---|
| Algemene transcriptie van voltooide bestanden | gpt-transcribe |
| Live-ondertiteling met lage latentie of call-transcriptie | gpt-live-transcribe |
| Sprekerlabels voor voltooide opnames | gpt-4o-transcribe-diarize met diarized_json |
| Woord- of segmenttijdstempels | whisper-1 met timestamp_granularities[] |
| Vertaling van voltooide niet-Engelse audio naar Engels | /v1/audio/translations met whisper-1 |
Voor diarisatie vereist OpenAI de Transcriptions API voor bestanden; sprekerlabeling wordt niet ondersteund in Realtime-transcriptiesessies. Voor opnames langer dan 30 seconden, configureer chunking_strategy als "auto" of gebruik een configuratie voor voice-activity-detection.
Voor tijdstempels, ondertitels, vertaling of bestaande Whisper-werkstromen, zie de Whisper API-handleiding van CometAPI en de Whisper-1-modelpagina. Teams die een andere OpenAI-route voor bestandstranscriptie evalueren, kunnen ook de GPT-4o Transcribe-modelpagina bekijken.
Hoe migreer je vanaf Whisper?
Het wijzigen van de model-ID is slechts de eerste stap. Valideer de volledige werkstroom voordat je productieverkeer verschuift.
| Check | Vereiste actie | Risico als overgeslagen |
|---|---|---|
| Routeselectie | Scheid voltooide opnames van echt live workloads | Het live-tarief betalen voor asynchrone jobs |
| Taalvelden | Vervang language door languages voor de nieuwe modellen; stuur nooit beide | Afgewezen requests of sessies |
| Contexthints | Test prompts en keywords op namen, nummers, jargon en rumoerige spraak | Bevooroordeelde of ingevoegde termen |
| Delay-instelling | Benchmark minimaal low, medium en high op representatieve audio | Snelheid of nauwkeurigheid kiezen zonder data |
| Eventafhandeling | Reconcileer delta’s en completed-events met item_id | Uit-volgorde of overschreven transcripts |
| Featurepariteit | Maak inventaris van afhankelijkheden voor diarisatie, tijdstempels, confidence, ondertitels en vertaling | Ontbrekende downstream-velden |
| Kostentelemetrie | Log audiominuten, retries, mislukte resultaten, correctietijd en geaccepteerde outputs | Lijstprijs verwarren met werkstroomkosten |
| Uitrol | Shadow-test, canary een klein deel van het verkeer, en behoud een fallback | Brede regressie zonder snelle rollback |
Voor een GPT-Realtime-Whisper-migratie, houd audioformaat, beurtdetectiebeleid, testset en latentiedoel constant. Omdat de gepubliceerde live-prijs ongewijzigd is, geef prioriteit aan accepted-transcript rate, latentieverdeling, outputstabiliteit en compatibiliteit met de rest van de pijplijn.
Migratiehandleiding (van Whisper / eerdere modellen)
OpenAI biedt een officiële kookboekgids: Migrate from Whisper to GPT-Transcribe and GPT-Live-Transcribe.
Hoofdregels:
- Opgenomen / batch-audio → schakel over naar gpt-transcribe op het bestaande /v1/audio/transcriptions-endpoint.
- Continue live audio → schakel over naar gpt-live-transcribe in een Realtime-transcriptiesessie.
- Hogere nauwkeurigheid na een vastgelegde beurt → gebruik gpt-transcribe binnen een Realtime-sessie.
Minimalistisch bestandsmigratievoorbeeld (Python):
Python
# Before (Whisper)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="whisper-1", file=audio, language="en", prompt="Support call about AC-42" )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="gpt-transcribe", file=audio, prompt="A customer support call about billing", extra_body={ "keywords": ["AC-42", "Premium Plus"], "languages": ["en", "fr"] }, response_format="json" # or stream=True for deltas )
Live-migratienotities:
- Behoud dezelfde Realtime-sessie-/WebSocket-architectuur.
- Wijzig de model-ID en vervang het enkelvoudige language door de languages-array.
- Voeg optioneel prompt, keywords en delay toe (bijv. "low").
- Blijf dezelfde delta-/completed-events afhandelen.
- Stuur niet zowel language als languages.
Belangrijke kanttekeningen bij migratie:
- GPT-Transcribe/GPT-Live-Transcribe ondersteunen geen woordniveau-tijdstempels, SRT/VTT of Engelse vertaling op dezelfde manier als whisper-1. Houd Whisper voor die specifieke behoeften.
- Responseformaten verschillen — ga er niet van uit dat text, verbose_json, srt of vtt identiek werken.
- Keywords moeten éénregelige literal strings zijn (geen <, >, CR of LF), anders wordt de aanvraag afgewezen.
- Test op representatieve productie-audio (accenten, ruis, domeintermen, korte uitingen) in plaats van uitsluitend op gepubliceerde WER-cijfers te vertrouwen.
Snelle aanbeveling
- Standaard voor nieuw werk: GPT-Transcribe voor bestanden/batch, GPT-Live-Transcribe voor live streaming.
- Bestaande Whisper- of GPT-4o-Transcribe-integraties blijven werken, maar zijn niet langer het aanbevolen startpunt.
- Kostengevoelige batchjobs profiteren het meest van de overstap naar GPT-Transcribe ($0.0045 vs $0.006).
Voor de meest recente details, bekijk de officiële modelpagina’s en de transcriptie-overzichtsgids op de OpenAI-ontwikkelaarsite.
Hoe evalueer je de twee modellen op productie-audio?
Gebruik gelicentieerde audio die het product representeert in plaats van alleen schone democlips.
- Selecteer ten minste 50 opnames over de belangrijkste use-cases, talen, apparaten en audiocondities.
- Neem accenten, onderbrekingen, achtergrondgeluid, code-switching, nummers, data, valuta, e-mailadressen en domeinvocabulaire op.
- Laat voltooide opnames door
gpt-transcribelopen mét en zonder contexthints. - Speel dezelfde live-samples af via
gpt-live-transcribeop drie delay-instellingen. - Houd formaten, beurtgrenzen, prompts en scoringsregels consistent over runs heen.
- Meet transcriptiefout, recall van domeintermen, herzieningen van partiële tekst, p50- en p95-latentie, falingen, retries en tijd voor menselijke correctie.
- Bereken kosten per geaccepteerde transcriptie, en voer daarna een canary uit met de geselecteerde routeringspolicy voordat je volledig migreert.
Het eindontwerp kan één model of beide gebruiken. De beslissende metriek moet de kosten en betrouwbaarheid van een geaccepteerde productietranscriptie zijn, niet de gepubliceerde prijs per minuut op zichzelf.
FAQ
Welk model moet ik gebruiken: GPT-Transcribe of GPT-Live-Transcribe?
Gebruik gpt-transcribe voor voltooide opnames en asynchrone jobs. Gebruik gpt-live-transcribe wanneer tekst moet binnenkomen terwijl audio nog streamt.
Wat kosten GPT-Transcribe en GPT-Live-Transcribe?
OpenAI vermeldt gpt-transcribe voor $0.0045 per audiominuut ($0.27 per uur) en gpt-live-transcribe voor $0.017 per minuut ($1.02 per uur).
Is GPT-Live-Transcribe nauwkeuriger dan GPT-Realtime-Whisper?
Op OpenAI’s negen-talen Real-World Audio Recording-benchmark daalde het gerapporteerde transcriptiefoutpercentage van 11.65% naar 9.60%. Verifieer dit benchmarkspecifieke resultaat op je eigen audio.
Ondersteunt GPT-Live-Transcribe diarisatie of woordtijdstempels?
Nee. Het retourneert geen sprekerlabels, woordniveau-tijdstempels of betrouwbaarheidscores. Gebruik een compatibel bestandsmodel of een fallback-stap wanneer die velden nodig zijn.
Is migratie vanaf GPT-Realtime-Whisper een drop-in modelwissel?
Nee. Verifieer sessieconfiguratie, taalvelden, contextinputs, delay-instellingen, event-volgorde, feature-afhankelijkheden, latentie en outputkwaliteit voordat je productieverkeer verplaatst.
Test transcriptieroutes met CometAPI
Controleer vooraf de huidige modelbeschikbaarheid en routeprijzen op de CometAPI-prijspagina en gebruik de CometAPI-documentatie voor OpenAI-compatibele requestpatronen. Pin exacte model-ID’s in tests en log audiotduur, delay-niveau, first-delta-latentie, final-transcript-latentie, retries en accepted-transcript rate zodat de routeringsbeslissing de totale werkstroomkosten weerspiegelt.
