GPT-5.6 Luna price down 80%, Terra down 20% →

GPT-Transcribe vs GPT-Live-Transcribe: API & Preise

CometAPI
Mia MarenJul 31, 2026
GPT-Transcribe vs GPT-Live-Transcribe: API & Preise

GPT-Transcribe vs GPT-Live-Transcribe: Preise, API-Unterschiede und Migration

TL;DR

Verwenden Sie gpt-transcribe für abgeschlossene Aufnahmen zu $0.0045 pro Audiominute und gpt-live-transcribe für Mikrofone, Anrufe oder Live-Medienstreams zu $0.017 pro Minute. OpenAI berichtet auf veröffentlichten Benchmarks über eine geringere Transkriptionsfehlerrate für das Live-Modell als für GPT-Realtime-Whisper, aber die richtige Route hängt davon ab, wann Text erscheinen muss, welche Ausgabefelder Sie benötigen und wie beide Modelle auf Ihrem Produktionsaudio performen.

GPT-Transcribe vs GPT-Live-Transcribe auf einen Blick

Wenn Sie Transkription erst nach der Aufzeichnung benötigen, verwenden Sie gpt-transcribe. Wenn Ihre Anwendung Text braucht, während Audio noch eintrifft, verwenden Sie gpt-live-transcribe. Der größte Unterschied ist nicht nur der Preis, sondern der Zeitpunkt, zu dem die Transkription beginnt, und welche Art von API-Workflow Ihre App unterstützen muss.

Itemgpt-transcribegpt-live-transcribe
Best forHochgeladene Aufnahmen, begrenzte Audiorequests, asynchrone Jobs und bestätigte Realtime-TurnsMikrofone, Anrufe, Meetings und Live-Medienstreams
Published price$0.0045 pro Audiominute$0.017 pro Audiominute
Price per audio hour$0.27$1.02
API / Endpoints/v1/audio/transcriptions; optionaler Workflow mit bestätigten Realtime-TurnsRealtime-Transkriptionssitzungen (v1/realtime/transcription_sessions oder ähnlich)
ConnectionDatei-Upload; optional gestreamte Antwort während der DateiverarbeitungWebSocket für Server-Pipelines oder WebRTC für Browser-Audio
When transcription beginsNachdem eine Datei eingereicht oder ein Audioturn bestätigt wurdeWährend Audio eintrifft
Partial transcript outputJa, mit Datei-Streaming oder Streaming bei bestätigtem TurnJa, während Live-Sprache eintrifft
Context controlsprompt, keywords, languagesprompt, keywords, languages, delay
Detected-language outputJa, wenn das Modell eine verlässliche Vorhersage treffen kannNein
Important limitations25 MB Upload-Limit; andere Routen sind erforderlich für Timestamps, Diarisierung oder ÜbersetzungKeine Wort-Timestamps, Sprecherlabels oder Konfidenzwerte

Obwohl gpt-transcribe während der Verarbeitung einer abgeschlossenen Datei oder eines bestätigten Audioturns partielle Transkript-Updates zurückgeben kann, ist es keine kontinuierliche Live-Streaming-Route. Für Live-Untertitel, Anrufe oder Mikrofoneingaben ist gpt-live-transcribe die bessere Wahl.

Für einen breiteren Vergleich über Anbieter hinweg siehe CometAPI’s 6 Best Speech-to-Text APIs in 2026.

Was sind GPT-Transcribe und GPT-Live-Transcribe?

OpenAI führte gpt-transcribe und gpt-live-transcribe am 29. Juli 2026 ein. gpt-transcribe verarbeitet abgeschlossene Aufnahmen, gestreamte Dateitranskripte und bestätigte Realtime-Turns, während gpt-live-transcribe Transkript-Updates mit niedriger Latenz zurückgibt, während Audio aus Mikrofonen, Anrufen oder Live-Medienstreams eintrifft.

Die beiden Modelle bieten neue Standardrouten für allgemeine Datei- und Live-Transkription, aber spezialisierte Whisper- und GPT-4o-Transkriptions-Workflows bleiben für Timestamps, Übersetzungen, Untertitel und Sprecherdiarisierung notwendig.

Wann lohnt sich der höhere Preis von GPT-Live-Transcribe?

Auf OpenAI's API Pricing-Seite wird gpt-transcribe mit $0.0045 pro Minute und gpt-live-transcribe mit $0.017 pro Minute gelistet. Die Live-Route kostet damit etwa 3.8-mal mehr pro Audiominute.

Monthly audio volumegpt-transcribegpt-live-transcribeAdditional live cost
100 hours$27$102$75
1,000 hours$270$1,020$750
10,000 hours$2,700$10,200$7,500

Diese Transkriptionskostenschätzungen verwenden nur die veröffentlichten Basisraten von OpenAI: Audio-Stunden × 60 × Preis pro Minute. Sie schließen Speicher, Netzwerktransport, Retries, Anwendungs-Hosting, Nachbearbeitung, menschliche Korrektur und Fallback-Provider-Kosten aus.

Wählen Sie gpt-live-transcribe, wenn unmittelbare Untertitel, Agentenunterstützung, Moderation oder Echtzeit-Interaktion Teil der Produktanforderung sind. Wählen Sie gpt-transcribe, wenn das Transkript erst nach Abschluss eines Meetings, Anrufs, Interviews oder Medien-Uploads benötigt wird. Eine Zwei-Routen-Architektur kann Live-Transkription für die Nutzererfahrung und Datei-Transkription für die Nachbearbeitung nach dem Anruf oder Backfills verwenden.

OpenAI listet derzeit GPT-Realtime-Whisper und gpt-live-transcribe zum gleichen Basispreis von $0.017 pro Minute. Evaluieren Sie eine Migration zwischen diesen Live-Routen anhand der Qualität der akzeptierten Transkripte, Latenz, Event-Handling und operativen Kompatibilität und nicht allein aufgrund des Listenpreises.

Wie unterscheiden sich die APIs von GPT-Transcribe und GPT-Live-Transcribe?

Der Hauptunterschied besteht darin, wie Audio ins System gelangt und wann Transkriptereignisse beginnen. gpt-transcribe akzeptiert abgeschlossene Dateien oder bestätigte Audioturns, während gpt-live-transcribe eine Realtime-Verbindung aufrechterhält und Transkript-Updates liefert, während Audio noch eintrifft.

Verwenden Sie GPT-Transcribe für abgeschlossenes Audio

Für eine abgeschlossene Aufnahme senden Sie die Datei an /v1/audio/transcriptions. OpenAI's Leitfaden zur Dateitranskription akzeptiert Dateien bis 25 MB im Format mp3, mp4, mpeg, mpga, m4a, wav oder webm.

from openai import OpenAI

client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
    transcript = client.audio.transcriptions.create(
        model="gpt-transcribe",
        file=audio_file,
        prompt="A support call about a premium plan and account AC-42.",
        extra_body={
            "keywords": ["premium plan", "AC-42", "billing"],
            "languages": ["en"],
        },
    )
print(transcript.text)

Setzen Sie stream=True, um Transkript-Delta-Events zu erhalten, während OpenAI die hochgeladene Aufnahme verarbeitet. Dies verkürzt die Wartezeit auf sichtbaren Text, macht den Datei-Endpunkt jedoch nicht zu einer Live-Mikrofon-Ingestion.

Verwenden Sie GPT-Live-Transcribe für eintreffendes Audio

Erstellen Sie eine Realtime-Session mit type: "transcription" und wählen Sie gpt-live-transcribe. Verwenden Sie WebSocket für eine serverseitige Medienpipeline oder WebRTC für Browser-Audio.

{
  "type": "session.update",
  "session": {
    "type": "transcription",
    "audio": {
      "input": {
        "format": {
          "type": "audio/pcm",
          "rate": 24000
        },
        "transcription": {
          "model": "gpt-live-transcribe",
          "prompt": "A support call about a premium plan and account AC-42.",
          "keywords": ["premium plan", "AC-42", "billing"],
          "languages": ["en"],
          "delay": "low"
        },
        "turn_detection": null
      }
    }
  }
}

Hängen Sie Audio-Chunks mit input_audio_buffer.append an. Die Anwendung kann Turns mit input_audio_buffer.commit bestätigen oder serverseitige Voice-Activity-Detection konfigurieren.

Der Leitfaden zur Realtime-Transkription gibt inkrementellen Text über conversation.item.input_audio_transcription.delta zurück, gefolgt von conversation.item.input_audio_transcription.completed für den bestätigten Eintrag. Abschluss-Events verschiedener Turns sind nicht garantiert in Reihenfolge des Eintreffens, daher sollten sie über item_id und nicht anhand der Ankunftsreihenfolge abgeglichen werden.

Verwenden Sie die bestätigte-Turn-Route, wenn sofortiger Text nicht notwendig ist

gpt-transcribe kann auch in einer Realtime-Transkriptionssitzung über WebSocket ausgeführt werden. Die Transkription beginnt, nachdem ein Audioturn bestätigt wurde, das Modell kann frühere transkribierte Turns als Kontext verwenden, und das Abschluss-Event kann erkannte Sprachen enthalten.

Diese bestätigte-Turn-Route ist nützlich, wenn Turn-basiertes Streaming oder Spracherkennung wichtiger ist als die Anzeige von Text, während der Sprecher noch spricht. Sie darf nicht mit dem kontinuierlichen, latenzärmeren Verhalten von gpt-live-transcribe verwechselt werden.

Wie wirken sich Prompts, Keywords, Languages und Delay auf die Transkription aus?

Beide Modelle akzeptieren Kontext, der die Erkennung von Namen, Zahlen, Akronymen, Produktbegriffen, akzentuierter Sprache, mehrsprachigem Audio und Code-Switching verbessern kann.

ControlPurposeProduction caution
promptBeschreibt die Aufnahme, den Sprecher, die Domäne oder das erwartete ThemaZu spezifischer Kontext kann das Transkript verzerren
keywordsLiefert wörtliche Namen, Akronyme, Account-Formate oder technische BegriffeHinweise sind keine verpflichtende Ausgabe; auf eingefügte, nicht gesprochene Begriffe testen
languagesListet eine oder mehrere erwartete Eingabesprachen aufNicht unterstützte oder falsch formatierte Codes führen zur Ablehnung
delayTauscht frühere Live-Deltas gegen mehr akustischen KontextVerfügbar für gpt-live-transcribe; messen statt feste Millisekunden anzunehmen

Für die neuen Modelle ersetzt languages das ältere singuläre Feld language. Senden Sie nicht beide. Jedes Keyword muss in einer Zeile stehen und darf kein <, >, Carriage Returns oder Line Feeds enthalten; ungültige Werte führen zur Ablehnung der Anfrage oder Session-Aktualisierung.

gpt-live-transcribe unterstützt die Delay-Einstellungen minimal, low, medium, high und xhigh. Niedrigere Einstellungen bevorzugen frühere Teiltexte, während höhere mehr Audiokontext bieten und die Transkriptionsqualität verbessern können. OpenAI garantiert keine fixe Latenz für jede Stufe, daher messen Sie die Zeit bis zum ersten Delta und die Zeit bis zum finalen Transkript auf repräsentativen Mikrofonen, Codecs, Netzwerken, Sprachen und Sitzungsdauern.

Was zeigen die Genauigkeits-Benchmarks von OpenAI?

OpenAI's Launch-Ankündigung berichtet, dass gpt-live-transcribe in zwei mehrsprachigen Transkriptionstests GPT-Realtime-Whisper-1 übertraf. Es wird auch berichtet, dass freier Kontext die semantische Genauigkeit in einer Context Aware ASR-Evaluation verbesserte.

OpenAI evaluationgpt-live-transcribe resultComparisonReported change
Context Aware ASR semantic accuracy44.6% with free-form context38.5% without context+6.1 Prozentpunkte
Common Voice, 22 languages, transcription error rate19.70%20.33% for GPT-Realtime-Whisper-1-0.63 Punkte; etwa 3.1% relativ
Real-World Audio Recording, 9 languages, transcription error rate9.60%11.65% for GPT-Realtime-Whisper-1-2.05 Punkte; etwa 17.6% relativ

Die belastbare Schlussfolgerung ist eng gefasst: Das neue Live-Modell erzielte auf den von OpenAI berichteten Tests bessere Ergebnisse, und Kontext verbesserte den gemeldeten semantischen Genauigkeitswert. Diese vom Anbieter gemeldeten Resultate garantieren nicht dieselbe Verbesserung für jede Sprache, jeden Telephonie-Codec, jedes Mikrofon, jede Delay-Einstellung, jede Domänenvokabel oder jede Korrekturrichtlinie.

Wann sollten Sie stattdessen Whisper oder GPT-4o Transcribe verwenden?

Keines der neuen Modelle ersetzt jeden Speech-to-Text-Workflow.

RequirementRecommended route
General completed-file transcriptiongpt-transcribe
Low-latency live captions or call transcriptiongpt-live-transcribe
Speaker labels for completed recordingsgpt-4o-transcribe-diarize mit diarized_json
Word or segment timestampswhisper-1 mit timestamp_granularities[]
Translation of completed non-English audio into English/v1/audio/translations mit whisper-1

Für Diarisierung verlangt OpenAI die File Transcriptions API; Sprecherkennzeichnung wird in Realtime-Transkriptionssitzungen nicht unterstützt. Für Aufnahmen länger als 30 Sekunden konfigurieren Sie chunking_strategy als "auto" oder verwenden eine Voice-Activity-Detection-Konfiguration.

Für Timestamp, Untertitel, Übersetzung oder bestehende Whisper-Workflows siehe CometAPI's Whisper API guide und Whisper-1 model page. Teams, die eine andere OpenAI-Dateitranskriptionsroute evaluieren, können außerdem die GPT-4o Transcribe model page prüfen.

How Should You Migrate From Whisper ?

Die Änderung der Modell-ID ist nur der erste Schritt. Validieren Sie den kompletten Workflow, bevor Sie Produktionsverkehr umschichten.

CheckRequired actionRisk if skipped
Route selectionAbgeschlossene Aufnahmen von wirklich Live-Workloads trennenLive-Tarif für asynchrone Jobs zahlen
Language fieldslanguage durch languages für die neuen Modelle ersetzen; niemals beide sendenAbgelehnte Requests oder Sessions
Context hintsPrompts und Keywords für Namen, Zahlen, Jargon und verrauschte Sprache testenVerzerrte oder eingefügte Begriffe
Delay settingMindestens low, medium und high auf repräsentativem Audio benchmarkenWahl von Geschwindigkeit oder Genauigkeit ohne Daten
Event handlingDeltas und Completed-Events mit item_id abgleichenUngeordnete oder überschriebene Transkripte
Feature parityAbhängigkeiten von Diarisierung, Timestamps, Konfidenz, Untertiteln und Übersetzung inventarisierenFehlende Downstream-Felder
Cost telemetryAudiominuten, Retries, fehlerhafte Ergebnisse, Korrekturzeit und akzeptierte Ausgaben loggenListenpreis mit Workflow-Kosten verwechseln
RolloutShadow-Tests, Canary mit kleinem Traffic-Anteil, Fallback vorhaltenBreite Regression ohne schnellen Rollback

Für eine GPT-Realtime-Whisper-Migration halten Sie Audioformat, Turn-Detection-Policy, Testset und Latenzziel konstant. Da der veröffentlichte Live-Preis unverändert ist, priorisieren Sie Akzeptanzrate der Transkripte, Latenzverteilung, Ausgabestabilität und Kompatibilität mit dem restlichen Pipeline-Aufbau.

Migrationsleitfaden (von Whisper / früheren Modellen)

OpenAI stellt ein offizielles Kochbuch bereit: Migrate from Whisper to GPT-Transcribe and GPT-Live-Transcribe.

High-level rules:

  1. Recorded / batch audio → Wechsel zu gpt-transcribe auf dem bestehenden /v1/audio/transcriptions-Endpoint.
  2. Continuous live audio → Wechsel zu gpt-live-transcribe in einer Realtime-Transkriptionssitzung.
  3. Higher-accuracy after a committed turn → gpt-transcribe innerhalb einer Realtime-Session verwenden.

Minimal file migration example (Python):

Python

# Before (Whisper)with open("meeting.wav", "rb") as audio:    result = client.audio.transcriptions.create(        model="whisper-1",        file=audio,        language="en",        prompt="Support call about AC-42"    )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio:    result = client.audio.transcriptions.create(        model="gpt-transcribe",        file=audio,        prompt="A customer support call about billing",        extra_body={            "keywords": ["AC-42", "Premium Plus"],            "languages": ["en", "fr"]        },        response_format="json"  # or stream=True for deltas    )

Live migration notes:

  • Behalten Sie dieselbe Realtime-Session-/WebSocket-Architektur bei.
  • Ändern Sie die Modell-ID und ersetzen Sie das singuläre language durch das Array languages.
  • Fügen Sie optional prompt, keywords und delay (z. B. "low") hinzu.
  • Handhaben Sie weiterhin dieselben Delta-/Completed-Events.
  • Senden Sie nicht sowohl language als auch languages.

Wichtige Hinweise bei der Migration:

  • GPT-Transcribe/GPT-Live-Transcribe unterstützen keine Wort-Timestamps, SRT/VTT oder Englisch-Übersetzung in derselben Weise wie whisper-1. Verwenden Sie Whisper für diese spezifischen Anforderungen weiter.
  • Die Response-Formate unterscheiden sich — gehen Sie nicht davon aus, dass text, verbose_json, srt oder vtt identisch funktionieren.
  • Keywords müssen einzeilige Literale sein (keine <, >, CR oder LF), sonst wird die Anfrage abgelehnt.
  • Testen Sie auf repräsentativem Produktionsaudio (Akzente, Rauschen, Domänenbegriffe, kurze Äußerungen) statt sich allein auf veröffentlichte WER-Zahlen zu verlassen.

Schnelle Empfehlung

  • Standard für neue Arbeiten: GPT-Transcribe für Dateien/Batch, GPT-Live-Transcribe für Live-Streaming.
  • Bestehende Whisper- oder GPT-4o-Transcribe-Integrationen funktionieren weiterhin, sind jedoch nicht mehr der empfohlene Ausgangspunkt.
  • Kostenempfindliche Batch-Jobs profitieren am meisten vom Wechsel zu GPT-Transcribe ($0.0045 vs $0.006).

Für die neuesten Details prüfen Sie die offiziellen Modellseiten und den Überblicksleitfaden zur Transkription auf der OpenAI-Developer-Seite.

Wie sollten Sie die beiden Modelle auf Produktionsaudio evaluieren?

Verwenden Sie lizenzierte Audios, die das Produkt repräsentieren, und nicht nur saubere Demo-Clips.

  1. Wählen Sie mindestens 50 Aufnahmen über die wichtigsten Anwendungsfälle, Sprachen, Geräte und Audiobedingungen hinweg.
  2. Schließen Sie Akzente, Unterbrechungen, Hintergrundgeräusche, Code-Switching, Zahlen, Daten, Währungen, E-Mail-Adressen und Domänenvokabular ein.
  3. Führen Sie abgeschlossene Aufnahmen durch gpt-transcribe mit und ohne Kontext-Hinweise.
  4. Spielen Sie dieselben Live-Beispiele durch gpt-live-transcribe bei drei Delay-Einstellungen.
  5. Halten Sie Formate, Turn-Grenzen, Prompts und Bewertungsregeln über die Läufe hinweg konsistent.
  6. Messen Sie Transkriptionsfehler, Recall bei Domänenbegriffen, Revisionen von Teiltexten, p50- und p95-Latenz, Fehler, Retries und Zeit für menschliche Korrektur.
  7. Berechnen Sie die Kosten pro akzeptiertem Transkript und führen Sie dann eine Canary-Phase für die gewählte Routing-Policy durch, bevor Sie vollständig migrieren.

Das endgültige Design kann ein Modell oder beide verwenden. Die entscheidende Metrik sollten Kosten und Zuverlässigkeit eines akzeptierten Produktionstranskripts sein — nicht isoliert der veröffentlichte Preis pro Minute.

FAQ

Welches Modell sollte ich verwenden: GPT-Transcribe oder GPT-Live-Transcribe?

Verwenden Sie gpt-transcribe für abgeschlossene Aufnahmen und asynchrone Jobs. Verwenden Sie gpt-live-transcribe, wenn Text eintreffen muss, während Audio noch streamt.

Wie viel kosten GPT-Transcribe und GPT-Live-Transcribe?

OpenAI listet gpt-transcribe mit $0.0045 pro Audiominute ($0.27 pro Stunde) und gpt-live-transcribe mit $0.017 pro Minute ($1.02 pro Stunde).

Ist GPT-Live-Transcribe genauer als GPT-Realtime-Whisper?

Auf OpenAI's neunsprachigem Real-World Audio Recording-Benchmark sank die gemeldete Transkriptionsfehlerrate von 11.65% auf 9.60%. Verifizieren Sie dieses, benchmark-spezifische Ergebnis auf Ihrem eigenen Audio.

Unterstützt GPT-Live-Transcribe Diarisierung oder Wort-Timestamps?

Nein. Es liefert keine Sprecherlabels, Wort-Timestamps oder Konfidenzwerte. Verwenden Sie ein kompatibles Datei-Modell oder einen Fallback-Schritt, wenn diese Felder erforderlich sind.

Ist die Migration von GPT-Realtime-Whisper ein Drop-in-Modelltausch?

Nein. Überprüfen Sie Session-Konfiguration, Sprachfelder, Kontextinputs, Delay-Einstellungen, Ereignisreihenfolge, Feature-Abhängigkeiten, Latenz und Ausgabequalität, bevor Sie Produktionsverkehr verschieben.

Testen Sie Transkriptionsrouten mit CometAPI

Prüfen Sie vor der Implementierung die aktuelle Modellverfügbarkeit und Routenpreise auf der CometAPI pricing page und verwenden Sie die CometAPI documentation für OpenAI-kompatible Request-Muster. Fixieren Sie in Tests exakte Modell-IDs und loggen Sie Audiodauer, Delay-Level, First-Delta-Latenz, Final-Transkript-Latenz, Retries und Akzeptanzrate, damit die Routing-Entscheidung die Gesamtkosten des Workflows widerspiegelt.

44 Aufrufe
Auf Klarheit, Quellenangabe und aktuelle API-Terminologie geprüft.

Bereit, die KI-Entwicklungskosten um 20 % zu senken?

In wenigen Minuten kostenlos starten. Inklusive kostenlosem Testguthaben. Keine Kreditkarte erforderlich.

Mehr lesen