DeepSeek Vision and Grok Imagine models are now live on CometAPI →
new/CometAPI research

GPT-Transcribe vs GPT-Live-Transcribe: API & prijzen

请提供需要翻译成荷兰语的原始文本(可为纯文本或包含 HTML/Markdown/JSON/XML/代码片段),我将严格保留结构与技术元素,仅翻译可读内容。

CometAPI
Mia MarenOnderzoeksteam voor AI-modellen en API
Bijgewerkt Aug 22, 2026 12 min leestijd
GPT-Transcribe vs GPT-Live-Transcribe: API & prijzen
Gebruik dit patroon

Doe de eerste API-aanroep.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

GPT-Transcribe vs GPT-Live-Transcribe: prijzen, API-verschillen en migratie

TL;DR

Gebruik gpt-transcribe voor voltooide opnames voor $0.0045 per audiominuut en gpt-live-transcribe voor microfoons, oproepen of live mediastreams voor $0.017 per minuut. OpenAI rapporteert een lagere transcriptiefout voor het live-model dan voor GPT-Realtime-Whisper op de gepubliceerde benchmarks, maar de juiste route hangt af van wanneer tekst moet verschijnen, welke uitvoervelden je nodig hebt en hoe beide modellen presteren op jouw productie-audio.

GPT-Transcribe vs GPT-Live-Transcribe in één oogopslag

Als je alleen transcriptie nodig hebt nadat audio is opgenomen, gebruik dan gpt-transcribe. Als je toepassing tekst nodig heeft terwijl audio nog binnenkomt, gebruik dan gpt-live-transcribe. Het grootste verschil is niet alleen de prijs, maar wanneer transcriptie begint en welk type API-werkstroom je app moet ondersteunen.

Itemgpt-transcribegpt-live-transcribe
Best voorGeuploade opnames, begrensde audiovragen, asynchrone jobs en vastgelegde Realtime-beurtenMicrofoons, oproepen, vergaderingen en live mediastreams
Gepubliceerde prijs$0.0045 per audiominuut$0.017 per audiominuut
Prijs per audio-uur$0.27$1.02
API / Endpoints/v1/audio/transcriptions; optionele vastgelegde-turn Realtime-werkstroomRealtime transcriptiesessies (v1/realtime/transcription_sessions of vergelijkbaar)
VerbindingBestand uploaden; optionele gestreamde respons terwijl het bestand wordt verwerktWebSocket voor server-pijplijnen of WebRTC voor browseraudio
Wanneer transcriptie startNadat een bestand is ingediend of een audiobeurt is vastgelegdTerwijl audio binnenkomt
Gedeeltelijke transcriptie-uitvoerJa, met bestandsstreaming of vastgelegde-turn-streamingJa, zodra live spraak binnenkomt
Contextinstellingenprompt, keywords, languagesprompt, keywords, languages, delay
Gedetecteerde taal in outputJa, wanneer het model een betrouwbare voorspelling kan doenNee
Belangrijke beperkingenUploadlimiet 25 MB; andere routes vereist voor tijdstempels, diarisatie of vertalingGeen woordniveau-tijdstempels, sprekerlabels of betrouwbaarheidscores

Hoewel gpt-transcribe gedeeltelijke transcriptupdates kan terugsturen tijdens het verwerken van een voltooid bestand of een vastgelegde audiobeurt, is het geen doorlopende live-streamingroute. Voor live-ondertiteling, oproepen of microfooningest is gpt-live-transcribe de betere keuze.

Voor een bredere vergelijking tussen aanbieders, zie CometAPI’s 6 beste Speech-to-Text-API’s in 2026.

Wat zijn GPT-Transcribe en GPT-Live-Transcribe?

OpenAI introduceerde gpt-transcribe en gpt-live-transcribe op 29 juli 2026. gpt-transcribe verwerkt voltooide opnames, gestreamde bestandstranscripts en vastgelegde Realtime-beurten, terwijl gpt-live-transcribe transcriptupdates met lage latentie terugstuurt terwijl audio binnenkomt van microfoons, oproepen of live mediastreams.

De twee modellen bieden nieuwe standaardroutes voor algemene bestands- en live-transcriptie, maar gespecialiseerde Whisper- en GPT-4o-transcriptiewerkstromen blijven nodig voor tijdstempels, vertaling, ondertitels en sprekersdiarisatie.

Wanneer is GPT-Live-Transcribe de hogere prijs waard?

De API-prijspagina van OpenAI vermeldt gpt-transcribe voor $0.0045 per minuut en gpt-live-transcribe voor $0.017 per minuut. De live-route kost dus ongeveer 3,8 keer meer per audiominuut.

Maandelijks audiovolumegpt-transcribegpt-live-transcribeExtra kosten voor live
100 uur$27$102$75
1.000 uur$270$1,020$750
10.000 uur$2,700$10,200$7,500

Deze transcriptiekostenschattingen gebruiken alleen de gepubliceerde basistarieven van OpenAI: audio-uren × 60 × prijs per minuut. Ze sluiten opslag, netwerktransport, retries, applicatiehosting, post-processing, menselijke correctie en fallback-providerkosten uit.

Kies gpt-live-transcribe wanneer directe ondertiteling, agent-assistentie, moderatie of realtime-interactie onderdeel is van de productvereiste. Kies gpt-transcribe wanneer het transcript pas nodig is nadat een vergadering, gesprek, interview of media-upload is voltooid. Een tweeroute-architectuur kan live-transcriptie gebruiken voor de gebruikerservaring en bestandstranscriptie voor verwerking na de call of backfills.

OpenAI vermeldt momenteel GPT-Realtime-Whisper en gpt-live-transcribe tegen hetzelfde basistarief van $0.017 per minuut. Evalueer een migratie tussen deze live-routes op kwaliteit van geaccepteerde transcripties, latentie, event-afhandeling en operationele compatibiliteit in plaats van alleen op de lijstprijs.

Hoe verschillen de GPT-Transcribe- en GPT-Live-Transcribe-API’s?

Het belangrijkste verschil is hoe audio het systeem binnenkomt en wanneer transcriptie-events beginnen. gpt-transcribe accepteert voltooide bestanden of vastgelegde audiobeurten, terwijl gpt-live-transcribe een Realtime-verbinding onderhoudt en transcriptupdates uitstuurt terwijl audio nog binnenkomt.

Gebruik GPT-Transcribe voor voltooide audio

Voor een voltooide opname, stuur het bestand naar /v1/audio/transcriptions. De handleiding voor bestandstranscriptie van OpenAI accepteert bestanden tot 25 MB in de formaten mp3, mp4, mpeg, mpga, m4a, wav of webm.

from openai import OpenAI

client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
    transcript = client.audio.transcriptions.create(
        model="gpt-transcribe",
        file=audio_file,
        prompt="A support call about a premium plan and account AC-42.",
        extra_body={
            "keywords": ["premium plan", "AC-42", "billing"],
            "languages": ["en"],
        },
    )
print(transcript.text)

Stel stream=True in om transcript-delta-evenementen te ontvangen terwijl OpenAI de geüploade opname verwerkt. Dit verkort de wachttijd op zichtbare tekst, maar verandert het bestandsendpoint beslist niet in live microfooningest.

Gebruik GPT-Live-Transcribe voor binnenkomende audio

Maak een Realtime-sessie met type: "transcription" en selecteer gpt-live-transcribe. Gebruik WebSocket voor een server-side mediapijplijn of WebRTC voor browseraudio.

{
  "type": "session.update",
  "session": {
    "type": "transcription",
    "audio": {
      "input": {
        "format": {
          "type": "audio/pcm",
          "rate": 24000
        },
        "transcription": {
          "model": "gpt-live-transcribe",
          "prompt": "A support call about a premium plan and account AC-42.",
          "keywords": ["premium plan", "AC-42", "billing"],
          "languages": ["en"],
          "delay": "low"
        },
        "turn_detection": null
      }
    }
  }
}

Voeg audiodelen toe met input_audio_buffer.append. De toepassing kan beurten vastleggen met input_audio_buffer.commit of server-side voice-activity-detection configureren.

De Realtime transcriptiehandleiding retourneert incrementele tekst via conversation.item.input_audio_transcription.delta, gevolgd door conversation.item.input_audio_transcription.completed voor het vastgelegde item. Voltooiingsevents van verschillende beurten zijn niet gegarandeerd in volgorde van aankomst; reconcilieer ze daarom met item_id in plaats van op aankomstvolgorde.

Gebruik de vastgelegde-turn-route wanneer onmiddellijke tekst niet nodig is

gpt-transcribe kan ook worden uitgevoerd in een Realtime-transcriptiesessie via WebSocket. Transcriptie begint nadat een audiobeurt is vastgelegd, het model kan eerder getranscribeerde beurten als context gebruiken, en het voltooide event kan gedetecteerde talen bevatten.

Deze vastgelegde-turn-route is nuttig wanneer turn-gebaseerde streaming of taalherkenning belangrijker is dan tekst tonen terwijl de spreker nog praat. Verwissel dit niet met het continue, lagere-latentiegedrag van gpt-live-transcribe.

Hoe beïnvloeden prompts, keywords, languages en delay de transcriptie?

Beide modellen accepteren context die de herkenning van namen, nummers, acroniemen, producttermen, geaccentueerde spraak, meertalige audio en code-switching kan verbeteren.

ControlDoelLet op in productie
promptBeschrijf de opname, spreker, domein of het verwachte onderwerpTe specifieke context kan het transcript bevooroordelen
keywordsGeef letterlijke namen, acroniemen, accountformaten of technische termenHints zijn geen verplichte output; test op onuitgesproken ingevoegde termen
languagesGeef een of meer verwachte invoertalen opNiet-ondersteunde of onjuist geformatteerde codes leiden tot afwijzing
delayRuil eerdere live-delta’s in voor meer akoestische contextBeschikbaar voor gpt-live-transcribe; benchmark in plaats van vaste milliseconden te veronderstellen

Voor de nieuwe modellen vervangt languages het oudere enkelvoudige veld language. Stuur niet beide. Elk keyword moet op één regel blijven en mag geen <, >, carriage returns of line feeds bevatten; ongeldige waarden zorgen ervoor dat de aanvraag of sessie-update wordt afgewezen.

gpt-live-transcribe ondersteunt de delay-instellingen minimal, low, medium, high en xhigh. Lagere instellingen geven de voorkeur aan eerdere gedeeltelijke tekst, terwijl hogere instellingen meer audiocontext bieden en de transcriptiekwaliteit kunnen verbeteren. OpenAI belooft geen vaste latentie voor elk niveau, dus meet time to first delta en time to final transcript op representatieve microfoons, codecs, netwerken, talen en sessieduren.

Wat laten de nauwkeurigheidsbenchmarks van OpenAI zien?

De lancering van OpenAI rapporteert dat gpt-live-transcribe beter presteerde dan GPT-Realtime-Whisper-1 op twee meertalige transcriptietests. Er wordt ook gemeld dat vrije context de semantische nauwkeurigheid verbeterde op een Context Aware ASR-evaluatie.

OpenAI-evaluatieresultaat gpt-live-transcribeVergelijkingGerapporteerde verandering
Context Aware ASR, semantische nauwkeurigheid44.6% met vrije context38.5% zonder context+6.1 procentpunt
Common Voice, 22 talen, transcriptiefoutpercentage19.70%20.33% voor GPT-Realtime-Whisper-1-0.63 punt; circa 3.1% relatief
Real-World Audio Recording, 9 talen, transcriptiefoutpercentage9.60%11.65% voor GPT-Realtime-Whisper-1-2.05 punt; circa 17.6% relatief

De verdedigbare conclusie is beperkt: het nieuwe livemodel presteerde beter op de door OpenAI gerapporteerde tests, en context verbeterde de gerapporteerde semantische-nauwkeurigheidsscore. Deze door de leverancier gerapporteerde resultaten garanderen niet dezelfde verbetering voor elke taal, telefoniecodec, microfoon, delay-instelling, domeinvocabulaire of correctiebeleid.

Wanneer moet je in plaats daarvan Whisper of GPT-4o Transcribe gebruiken?

Geen van beide nieuwe modellen vervangt elke spraak-naar-tekst-werkstroom.

VereisteAanbevolen route
Algemene transcriptie van voltooide bestandengpt-transcribe
Live-ondertiteling met lage latentie of call-transcriptiegpt-live-transcribe
Sprekerlabels voor voltooide opnamesgpt-4o-transcribe-diarize met diarized_json
Woord- of segmenttijdstempelswhisper-1 met timestamp_granularities[]
Vertaling van voltooide niet-Engelse audio naar Engels/v1/audio/translations met whisper-1

Voor diarisatie vereist OpenAI de Transcriptions API voor bestanden; sprekerlabeling wordt niet ondersteund in Realtime-transcriptiesessies. Voor opnames langer dan 30 seconden, configureer chunking_strategy als "auto" of gebruik een configuratie voor voice-activity-detection.

Voor tijdstempels, ondertitels, vertaling of bestaande Whisper-werkstromen, zie de Whisper API-handleiding van CometAPI en de Whisper-1-modelpagina. Teams die een andere OpenAI-route voor bestandstranscriptie evalueren, kunnen ook de GPT-4o Transcribe-modelpagina bekijken.

Hoe migreer je vanaf Whisper?

Het wijzigen van de model-ID is slechts de eerste stap. Valideer de volledige werkstroom voordat je productieverkeer verschuift.

CheckVereiste actieRisico als overgeslagen
RouteselectieScheid voltooide opnames van echt live workloadsHet live-tarief betalen voor asynchrone jobs
TaalveldenVervang language door languages voor de nieuwe modellen; stuur nooit beideAfgewezen requests of sessies
ContexthintsTest prompts en keywords op namen, nummers, jargon en rumoerige spraakBevooroordeelde of ingevoegde termen
Delay-instellingBenchmark minimaal low, medium en high op representatieve audioSnelheid of nauwkeurigheid kiezen zonder data
EventafhandelingReconcileer delta’s en completed-events met item_idUit-volgorde of overschreven transcripts
FeaturepariteitMaak inventaris van afhankelijkheden voor diarisatie, tijdstempels, confidence, ondertitels en vertalingOntbrekende downstream-velden
KostentelemetrieLog audiominuten, retries, mislukte resultaten, correctietijd en geaccepteerde outputsLijstprijs verwarren met werkstroomkosten
UitrolShadow-test, canary een klein deel van het verkeer, en behoud een fallbackBrede regressie zonder snelle rollback

Voor een GPT-Realtime-Whisper-migratie, houd audioformaat, beurtdetectiebeleid, testset en latentiedoel constant. Omdat de gepubliceerde live-prijs ongewijzigd is, geef prioriteit aan accepted-transcript rate, latentieverdeling, outputstabiliteit en compatibiliteit met de rest van de pijplijn.

Migratiehandleiding (van Whisper / eerdere modellen)

OpenAI biedt een officiële kookboekgids: Migrate from Whisper to GPT-Transcribe and GPT-Live-Transcribe.

Hoofdregels:

  1. Opgenomen / batch-audio → schakel over naar gpt-transcribe op het bestaande /v1/audio/transcriptions-endpoint.
  2. Continue live audio → schakel over naar gpt-live-transcribe in een Realtime-transcriptiesessie.
  3. Hogere nauwkeurigheid na een vastgelegde beurt → gebruik gpt-transcribe binnen een Realtime-sessie.

Minimalistisch bestandsmigratievoorbeeld (Python):

Python

# Before (Whisper)with open("meeting.wav", "rb") as audio:    result = client.audio.transcriptions.create(        model="whisper-1",        file=audio,        language="en",        prompt="Support call about AC-42"    )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio:    result = client.audio.transcriptions.create(        model="gpt-transcribe",        file=audio,        prompt="A customer support call about billing",        extra_body={            "keywords": ["AC-42", "Premium Plus"],            "languages": ["en", "fr"]        },        response_format="json"  # or stream=True for deltas    )

Live-migratienotities:

  • Behoud dezelfde Realtime-sessie-/WebSocket-architectuur.
  • Wijzig de model-ID en vervang het enkelvoudige language door de languages-array.
  • Voeg optioneel prompt, keywords en delay toe (bijv. "low").
  • Blijf dezelfde delta-/completed-events afhandelen.
  • Stuur niet zowel language als languages.

Belangrijke kanttekeningen bij migratie:

  • GPT-Transcribe/GPT-Live-Transcribe ondersteunen geen woordniveau-tijdstempels, SRT/VTT of Engelse vertaling op dezelfde manier als whisper-1. Houd Whisper voor die specifieke behoeften.
  • Responseformaten verschillen — ga er niet van uit dat text, verbose_json, srt of vtt identiek werken.
  • Keywords moeten éénregelige literal strings zijn (geen <, >, CR of LF), anders wordt de aanvraag afgewezen.
  • Test op representatieve productie-audio (accenten, ruis, domeintermen, korte uitingen) in plaats van uitsluitend op gepubliceerde WER-cijfers te vertrouwen.

Snelle aanbeveling

  • Standaard voor nieuw werk: GPT-Transcribe voor bestanden/batch, GPT-Live-Transcribe voor live streaming.
  • Bestaande Whisper- of GPT-4o-Transcribe-integraties blijven werken, maar zijn niet langer het aanbevolen startpunt.
  • Kostengevoelige batchjobs profiteren het meest van de overstap naar GPT-Transcribe ($0.0045 vs $0.006).

Voor de meest recente details, bekijk de officiële modelpagina’s en de transcriptie-overzichtsgids op de OpenAI-ontwikkelaarsite.

Hoe evalueer je de twee modellen op productie-audio?

Gebruik gelicentieerde audio die het product representeert in plaats van alleen schone democlips.

  1. Selecteer ten minste 50 opnames over de belangrijkste use-cases, talen, apparaten en audiocondities.
  2. Neem accenten, onderbrekingen, achtergrondgeluid, code-switching, nummers, data, valuta, e-mailadressen en domeinvocabulaire op.
  3. Laat voltooide opnames door gpt-transcribe lopen mét en zonder contexthints.
  4. Speel dezelfde live-samples af via gpt-live-transcribe op drie delay-instellingen.
  5. Houd formaten, beurtgrenzen, prompts en scoringsregels consistent over runs heen.
  6. Meet transcriptiefout, recall van domeintermen, herzieningen van partiële tekst, p50- en p95-latentie, falingen, retries en tijd voor menselijke correctie.
  7. Bereken kosten per geaccepteerde transcriptie, en voer daarna een canary uit met de geselecteerde routeringspolicy voordat je volledig migreert.

Het eindontwerp kan één model of beide gebruiken. De beslissende metriek moet de kosten en betrouwbaarheid van een geaccepteerde productietranscriptie zijn, niet de gepubliceerde prijs per minuut op zichzelf.

FAQ

Welk model moet ik gebruiken: GPT-Transcribe of GPT-Live-Transcribe?

Gebruik gpt-transcribe voor voltooide opnames en asynchrone jobs. Gebruik gpt-live-transcribe wanneer tekst moet binnenkomen terwijl audio nog streamt.

Wat kosten GPT-Transcribe en GPT-Live-Transcribe?

OpenAI vermeldt gpt-transcribe voor $0.0045 per audiominuut ($0.27 per uur) en gpt-live-transcribe voor $0.017 per minuut ($1.02 per uur).

Is GPT-Live-Transcribe nauwkeuriger dan GPT-Realtime-Whisper?

Op OpenAI’s negen-talen Real-World Audio Recording-benchmark daalde het gerapporteerde transcriptiefoutpercentage van 11.65% naar 9.60%. Verifieer dit benchmarkspecifieke resultaat op je eigen audio.

Ondersteunt GPT-Live-Transcribe diarisatie of woordtijdstempels?

Nee. Het retourneert geen sprekerlabels, woordniveau-tijdstempels of betrouwbaarheidscores. Gebruik een compatibel bestandsmodel of een fallback-stap wanneer die velden nodig zijn.

Is migratie vanaf GPT-Realtime-Whisper een drop-in modelwissel?

Nee. Verifieer sessieconfiguratie, taalvelden, contextinputs, delay-instellingen, event-volgorde, feature-afhankelijkheden, latentie en outputkwaliteit voordat je productieverkeer verplaatst.

Test transcriptieroutes met CometAPI

Controleer vooraf de huidige modelbeschikbaarheid en routeprijzen op de CometAPI-prijspagina en gebruik de CometAPI-documentatie voor OpenAI-compatibele requestpatronen. Pin exacte model-ID’s in tests en log audiotduur, delay-niveau, first-delta-latentie, final-transcript-latentie, retries en accepted-transcript rate zodat de routeringsbeslissing de totale werkstroomkosten weerspiegelt.

Verder leren

Koppel dit artikel aan de volgende beslissing.

Alle onderwerpen bekijken
Gepubliceerd op Jul 31, 2026
Laatst bijgewerkt Aug 22, 2026
63 weergaven
Gecontroleerd op duidelijkheid, bronvermelding en actuele API-terminologie.

Klaar om de AI-ontwikkelingskosten met 20% te verlagen?

Start gratis in enkele minuten. Gratis proeftegoeden inbegrepen. Geen creditcard vereist.

Lees Meer