GPT-Transcribe vs GPT-Live-Transcribe: Preise, API-Unterschiede und Migration
TL;DR
Verwenden Sie gpt-transcribe für abgeschlossene Aufnahmen zu $0.0045 pro Audiominute und gpt-live-transcribe für Mikrofone, Anrufe oder Live-Medienstreams zu $0.017 pro Minute. OpenAI berichtet auf veröffentlichten Benchmarks über eine geringere Transkriptionsfehlerrate für das Live-Modell als für GPT-Realtime-Whisper, aber die richtige Route hängt davon ab, wann Text erscheinen muss, welche Ausgabefelder Sie benötigen und wie beide Modelle auf Ihrem Produktionsaudio performen.
GPT-Transcribe vs GPT-Live-Transcribe auf einen Blick
Wenn Sie Transkription erst nach der Aufzeichnung benötigen, verwenden Sie gpt-transcribe. Wenn Ihre Anwendung Text braucht, während Audio noch eintrifft, verwenden Sie gpt-live-transcribe. Der größte Unterschied ist nicht nur der Preis, sondern der Zeitpunkt, zu dem die Transkription beginnt, und welche Art von API-Workflow Ihre App unterstützen muss.
| Item | gpt-transcribe | gpt-live-transcribe |
|---|---|---|
| Best for | Hochgeladene Aufnahmen, begrenzte Audiorequests, asynchrone Jobs und bestätigte Realtime-Turns | Mikrofone, Anrufe, Meetings und Live-Medienstreams |
| Published price | $0.0045 pro Audiominute | $0.017 pro Audiominute |
| Price per audio hour | $0.27 | $1.02 |
| API / Endpoints | /v1/audio/transcriptions; optionaler Workflow mit bestätigten Realtime-Turns | Realtime-Transkriptionssitzungen (v1/realtime/transcription_sessions oder ähnlich) |
| Connection | Datei-Upload; optional gestreamte Antwort während der Dateiverarbeitung | WebSocket für Server-Pipelines oder WebRTC für Browser-Audio |
| When transcription begins | Nachdem eine Datei eingereicht oder ein Audioturn bestätigt wurde | Während Audio eintrifft |
| Partial transcript output | Ja, mit Datei-Streaming oder Streaming bei bestätigtem Turn | Ja, während Live-Sprache eintrifft |
| Context controls | prompt, keywords, languages | prompt, keywords, languages, delay |
| Detected-language output | Ja, wenn das Modell eine verlässliche Vorhersage treffen kann | Nein |
| Important limitations | 25 MB Upload-Limit; andere Routen sind erforderlich für Timestamps, Diarisierung oder Übersetzung | Keine Wort-Timestamps, Sprecherlabels oder Konfidenzwerte |
Obwohl gpt-transcribe während der Verarbeitung einer abgeschlossenen Datei oder eines bestätigten Audioturns partielle Transkript-Updates zurückgeben kann, ist es keine kontinuierliche Live-Streaming-Route. Für Live-Untertitel, Anrufe oder Mikrofoneingaben ist gpt-live-transcribe die bessere Wahl.
Für einen breiteren Vergleich über Anbieter hinweg siehe CometAPI’s 6 Best Speech-to-Text APIs in 2026.
Was sind GPT-Transcribe und GPT-Live-Transcribe?
OpenAI führte gpt-transcribe und gpt-live-transcribe am 29. Juli 2026 ein. gpt-transcribe verarbeitet abgeschlossene Aufnahmen, gestreamte Dateitranskripte und bestätigte Realtime-Turns, während gpt-live-transcribe Transkript-Updates mit niedriger Latenz zurückgibt, während Audio aus Mikrofonen, Anrufen oder Live-Medienstreams eintrifft.
Die beiden Modelle bieten neue Standardrouten für allgemeine Datei- und Live-Transkription, aber spezialisierte Whisper- und GPT-4o-Transkriptions-Workflows bleiben für Timestamps, Übersetzungen, Untertitel und Sprecherdiarisierung notwendig.
Wann lohnt sich der höhere Preis von GPT-Live-Transcribe?
Auf OpenAI's API Pricing-Seite wird gpt-transcribe mit $0.0045 pro Minute und gpt-live-transcribe mit $0.017 pro Minute gelistet. Die Live-Route kostet damit etwa 3.8-mal mehr pro Audiominute.
| Monthly audio volume | gpt-transcribe | gpt-live-transcribe | Additional live cost |
|---|---|---|---|
| 100 hours | $27 | $102 | $75 |
| 1,000 hours | $270 | $1,020 | $750 |
| 10,000 hours | $2,700 | $10,200 | $7,500 |
Diese Transkriptionskostenschätzungen verwenden nur die veröffentlichten Basisraten von OpenAI: Audio-Stunden × 60 × Preis pro Minute. Sie schließen Speicher, Netzwerktransport, Retries, Anwendungs-Hosting, Nachbearbeitung, menschliche Korrektur und Fallback-Provider-Kosten aus.
Wählen Sie gpt-live-transcribe, wenn unmittelbare Untertitel, Agentenunterstützung, Moderation oder Echtzeit-Interaktion Teil der Produktanforderung sind. Wählen Sie gpt-transcribe, wenn das Transkript erst nach Abschluss eines Meetings, Anrufs, Interviews oder Medien-Uploads benötigt wird. Eine Zwei-Routen-Architektur kann Live-Transkription für die Nutzererfahrung und Datei-Transkription für die Nachbearbeitung nach dem Anruf oder Backfills verwenden.
OpenAI listet derzeit GPT-Realtime-Whisper und gpt-live-transcribe zum gleichen Basispreis von $0.017 pro Minute. Evaluieren Sie eine Migration zwischen diesen Live-Routen anhand der Qualität der akzeptierten Transkripte, Latenz, Event-Handling und operativen Kompatibilität und nicht allein aufgrund des Listenpreises.
Wie unterscheiden sich die APIs von GPT-Transcribe und GPT-Live-Transcribe?
Der Hauptunterschied besteht darin, wie Audio ins System gelangt und wann Transkriptereignisse beginnen. gpt-transcribe akzeptiert abgeschlossene Dateien oder bestätigte Audioturns, während gpt-live-transcribe eine Realtime-Verbindung aufrechterhält und Transkript-Updates liefert, während Audio noch eintrifft.
Verwenden Sie GPT-Transcribe für abgeschlossenes Audio
Für eine abgeschlossene Aufnahme senden Sie die Datei an /v1/audio/transcriptions. OpenAI's Leitfaden zur Dateitranskription akzeptiert Dateien bis 25 MB im Format mp3, mp4, mpeg, mpga, m4a, wav oder webm.
from openai import OpenAI
client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="gpt-transcribe",
file=audio_file,
prompt="A support call about a premium plan and account AC-42.",
extra_body={
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
},
)
print(transcript.text)
Setzen Sie stream=True, um Transkript-Delta-Events zu erhalten, während OpenAI die hochgeladene Aufnahme verarbeitet. Dies verkürzt die Wartezeit auf sichtbaren Text, macht den Datei-Endpunkt jedoch nicht zu einer Live-Mikrofon-Ingestion.
Verwenden Sie GPT-Live-Transcribe für eintreffendes Audio
Erstellen Sie eine Realtime-Session mit type: "transcription" und wählen Sie gpt-live-transcribe. Verwenden Sie WebSocket für eine serverseitige Medienpipeline oder WebRTC für Browser-Audio.
{
"type": "session.update",
"session": {
"type": "transcription",
"audio": {
"input": {
"format": {
"type": "audio/pcm",
"rate": 24000
},
"transcription": {
"model": "gpt-live-transcribe",
"prompt": "A support call about a premium plan and account AC-42.",
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
"delay": "low"
},
"turn_detection": null
}
}
}
}
Hängen Sie Audio-Chunks mit input_audio_buffer.append an. Die Anwendung kann Turns mit input_audio_buffer.commit bestätigen oder serverseitige Voice-Activity-Detection konfigurieren.
Der Leitfaden zur Realtime-Transkription gibt inkrementellen Text über conversation.item.input_audio_transcription.delta zurück, gefolgt von conversation.item.input_audio_transcription.completed für den bestätigten Eintrag. Abschluss-Events verschiedener Turns sind nicht garantiert in Reihenfolge des Eintreffens, daher sollten sie über item_id und nicht anhand der Ankunftsreihenfolge abgeglichen werden.
Verwenden Sie die bestätigte-Turn-Route, wenn sofortiger Text nicht notwendig ist
gpt-transcribe kann auch in einer Realtime-Transkriptionssitzung über WebSocket ausgeführt werden. Die Transkription beginnt, nachdem ein Audioturn bestätigt wurde, das Modell kann frühere transkribierte Turns als Kontext verwenden, und das Abschluss-Event kann erkannte Sprachen enthalten.
Diese bestätigte-Turn-Route ist nützlich, wenn Turn-basiertes Streaming oder Spracherkennung wichtiger ist als die Anzeige von Text, während der Sprecher noch spricht. Sie darf nicht mit dem kontinuierlichen, latenzärmeren Verhalten von gpt-live-transcribe verwechselt werden.
Wie wirken sich Prompts, Keywords, Languages und Delay auf die Transkription aus?
Beide Modelle akzeptieren Kontext, der die Erkennung von Namen, Zahlen, Akronymen, Produktbegriffen, akzentuierter Sprache, mehrsprachigem Audio und Code-Switching verbessern kann.
| Control | Purpose | Production caution |
|---|---|---|
| prompt | Beschreibt die Aufnahme, den Sprecher, die Domäne oder das erwartete Thema | Zu spezifischer Kontext kann das Transkript verzerren |
| keywords | Liefert wörtliche Namen, Akronyme, Account-Formate oder technische Begriffe | Hinweise sind keine verpflichtende Ausgabe; auf eingefügte, nicht gesprochene Begriffe testen |
| languages | Listet eine oder mehrere erwartete Eingabesprachen auf | Nicht unterstützte oder falsch formatierte Codes führen zur Ablehnung |
| delay | Tauscht frühere Live-Deltas gegen mehr akustischen Kontext | Verfügbar für gpt-live-transcribe; messen statt feste Millisekunden anzunehmen |
Für die neuen Modelle ersetzt languages das ältere singuläre Feld language. Senden Sie nicht beide. Jedes Keyword muss in einer Zeile stehen und darf kein <, >, Carriage Returns oder Line Feeds enthalten; ungültige Werte führen zur Ablehnung der Anfrage oder Session-Aktualisierung.
gpt-live-transcribe unterstützt die Delay-Einstellungen minimal, low, medium, high und xhigh. Niedrigere Einstellungen bevorzugen frühere Teiltexte, während höhere mehr Audiokontext bieten und die Transkriptionsqualität verbessern können. OpenAI garantiert keine fixe Latenz für jede Stufe, daher messen Sie die Zeit bis zum ersten Delta und die Zeit bis zum finalen Transkript auf repräsentativen Mikrofonen, Codecs, Netzwerken, Sprachen und Sitzungsdauern.
Was zeigen die Genauigkeits-Benchmarks von OpenAI?
OpenAI's Launch-Ankündigung berichtet, dass gpt-live-transcribe in zwei mehrsprachigen Transkriptionstests GPT-Realtime-Whisper-1 übertraf. Es wird auch berichtet, dass freier Kontext die semantische Genauigkeit in einer Context Aware ASR-Evaluation verbesserte.
| OpenAI evaluation | gpt-live-transcribe result | Comparison | Reported change |
|---|---|---|---|
| Context Aware ASR semantic accuracy | 44.6% with free-form context | 38.5% without context | +6.1 Prozentpunkte |
| Common Voice, 22 languages, transcription error rate | 19.70% | 20.33% for GPT-Realtime-Whisper-1 | -0.63 Punkte; etwa 3.1% relativ |
| Real-World Audio Recording, 9 languages, transcription error rate | 9.60% | 11.65% for GPT-Realtime-Whisper-1 | -2.05 Punkte; etwa 17.6% relativ |
Die belastbare Schlussfolgerung ist eng gefasst: Das neue Live-Modell erzielte auf den von OpenAI berichteten Tests bessere Ergebnisse, und Kontext verbesserte den gemeldeten semantischen Genauigkeitswert. Diese vom Anbieter gemeldeten Resultate garantieren nicht dieselbe Verbesserung für jede Sprache, jeden Telephonie-Codec, jedes Mikrofon, jede Delay-Einstellung, jede Domänenvokabel oder jede Korrekturrichtlinie.
Wann sollten Sie stattdessen Whisper oder GPT-4o Transcribe verwenden?
Keines der neuen Modelle ersetzt jeden Speech-to-Text-Workflow.
| Requirement | Recommended route |
|---|---|
| General completed-file transcription | gpt-transcribe |
| Low-latency live captions or call transcription | gpt-live-transcribe |
| Speaker labels for completed recordings | gpt-4o-transcribe-diarize mit diarized_json |
| Word or segment timestamps | whisper-1 mit timestamp_granularities[] |
| Translation of completed non-English audio into English | /v1/audio/translations mit whisper-1 |
Für Diarisierung verlangt OpenAI die File Transcriptions API; Sprecherkennzeichnung wird in Realtime-Transkriptionssitzungen nicht unterstützt. Für Aufnahmen länger als 30 Sekunden konfigurieren Sie chunking_strategy als "auto" oder verwenden eine Voice-Activity-Detection-Konfiguration.
Für Timestamp, Untertitel, Übersetzung oder bestehende Whisper-Workflows siehe CometAPI's Whisper API guide und Whisper-1 model page. Teams, die eine andere OpenAI-Dateitranskriptionsroute evaluieren, können außerdem die GPT-4o Transcribe model page prüfen.
How Should You Migrate From Whisper ?
Die Änderung der Modell-ID ist nur der erste Schritt. Validieren Sie den kompletten Workflow, bevor Sie Produktionsverkehr umschichten.
| Check | Required action | Risk if skipped |
|---|---|---|
| Route selection | Abgeschlossene Aufnahmen von wirklich Live-Workloads trennen | Live-Tarif für asynchrone Jobs zahlen |
| Language fields | language durch languages für die neuen Modelle ersetzen; niemals beide senden | Abgelehnte Requests oder Sessions |
| Context hints | Prompts und Keywords für Namen, Zahlen, Jargon und verrauschte Sprache testen | Verzerrte oder eingefügte Begriffe |
| Delay setting | Mindestens low, medium und high auf repräsentativem Audio benchmarken | Wahl von Geschwindigkeit oder Genauigkeit ohne Daten |
| Event handling | Deltas und Completed-Events mit item_id abgleichen | Ungeordnete oder überschriebene Transkripte |
| Feature parity | Abhängigkeiten von Diarisierung, Timestamps, Konfidenz, Untertiteln und Übersetzung inventarisieren | Fehlende Downstream-Felder |
| Cost telemetry | Audiominuten, Retries, fehlerhafte Ergebnisse, Korrekturzeit und akzeptierte Ausgaben loggen | Listenpreis mit Workflow-Kosten verwechseln |
| Rollout | Shadow-Tests, Canary mit kleinem Traffic-Anteil, Fallback vorhalten | Breite Regression ohne schnellen Rollback |
Für eine GPT-Realtime-Whisper-Migration halten Sie Audioformat, Turn-Detection-Policy, Testset und Latenzziel konstant. Da der veröffentlichte Live-Preis unverändert ist, priorisieren Sie Akzeptanzrate der Transkripte, Latenzverteilung, Ausgabestabilität und Kompatibilität mit dem restlichen Pipeline-Aufbau.
Migrationsleitfaden (von Whisper / früheren Modellen)
OpenAI stellt ein offizielles Kochbuch bereit: Migrate from Whisper to GPT-Transcribe and GPT-Live-Transcribe.
High-level rules:
- Recorded / batch audio → Wechsel zu gpt-transcribe auf dem bestehenden /v1/audio/transcriptions-Endpoint.
- Continuous live audio → Wechsel zu gpt-live-transcribe in einer Realtime-Transkriptionssitzung.
- Higher-accuracy after a committed turn → gpt-transcribe innerhalb einer Realtime-Session verwenden.
Minimal file migration example (Python):
Python
# Before (Whisper)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="whisper-1", file=audio, language="en", prompt="Support call about AC-42" )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="gpt-transcribe", file=audio, prompt="A customer support call about billing", extra_body={ "keywords": ["AC-42", "Premium Plus"], "languages": ["en", "fr"] }, response_format="json" # or stream=True for deltas )
Live migration notes:
- Behalten Sie dieselbe Realtime-Session-/WebSocket-Architektur bei.
- Ändern Sie die Modell-ID und ersetzen Sie das singuläre language durch das Array languages.
- Fügen Sie optional prompt, keywords und delay (z. B. "low") hinzu.
- Handhaben Sie weiterhin dieselben Delta-/Completed-Events.
- Senden Sie nicht sowohl language als auch languages.
Wichtige Hinweise bei der Migration:
- GPT-Transcribe/GPT-Live-Transcribe unterstützen keine Wort-Timestamps, SRT/VTT oder Englisch-Übersetzung in derselben Weise wie whisper-1. Verwenden Sie Whisper für diese spezifischen Anforderungen weiter.
- Die Response-Formate unterscheiden sich — gehen Sie nicht davon aus, dass text, verbose_json, srt oder vtt identisch funktionieren.
- Keywords müssen einzeilige Literale sein (keine <, >, CR oder LF), sonst wird die Anfrage abgelehnt.
- Testen Sie auf repräsentativem Produktionsaudio (Akzente, Rauschen, Domänenbegriffe, kurze Äußerungen) statt sich allein auf veröffentlichte WER-Zahlen zu verlassen.
Schnelle Empfehlung
- Standard für neue Arbeiten: GPT-Transcribe für Dateien/Batch, GPT-Live-Transcribe für Live-Streaming.
- Bestehende Whisper- oder GPT-4o-Transcribe-Integrationen funktionieren weiterhin, sind jedoch nicht mehr der empfohlene Ausgangspunkt.
- Kostenempfindliche Batch-Jobs profitieren am meisten vom Wechsel zu GPT-Transcribe ($0.0045 vs $0.006).
Für die neuesten Details prüfen Sie die offiziellen Modellseiten und den Überblicksleitfaden zur Transkription auf der OpenAI-Developer-Seite.
Wie sollten Sie die beiden Modelle auf Produktionsaudio evaluieren?
Verwenden Sie lizenzierte Audios, die das Produkt repräsentieren, und nicht nur saubere Demo-Clips.
- Wählen Sie mindestens 50 Aufnahmen über die wichtigsten Anwendungsfälle, Sprachen, Geräte und Audiobedingungen hinweg.
- Schließen Sie Akzente, Unterbrechungen, Hintergrundgeräusche, Code-Switching, Zahlen, Daten, Währungen, E-Mail-Adressen und Domänenvokabular ein.
- Führen Sie abgeschlossene Aufnahmen durch
gpt-transcribemit und ohne Kontext-Hinweise. - Spielen Sie dieselben Live-Beispiele durch
gpt-live-transcribebei drei Delay-Einstellungen. - Halten Sie Formate, Turn-Grenzen, Prompts und Bewertungsregeln über die Läufe hinweg konsistent.
- Messen Sie Transkriptionsfehler, Recall bei Domänenbegriffen, Revisionen von Teiltexten, p50- und p95-Latenz, Fehler, Retries und Zeit für menschliche Korrektur.
- Berechnen Sie die Kosten pro akzeptiertem Transkript und führen Sie dann eine Canary-Phase für die gewählte Routing-Policy durch, bevor Sie vollständig migrieren.
Das endgültige Design kann ein Modell oder beide verwenden. Die entscheidende Metrik sollten Kosten und Zuverlässigkeit eines akzeptierten Produktionstranskripts sein — nicht isoliert der veröffentlichte Preis pro Minute.
FAQ
Welches Modell sollte ich verwenden: GPT-Transcribe oder GPT-Live-Transcribe?
Verwenden Sie gpt-transcribe für abgeschlossene Aufnahmen und asynchrone Jobs. Verwenden Sie gpt-live-transcribe, wenn Text eintreffen muss, während Audio noch streamt.
Wie viel kosten GPT-Transcribe und GPT-Live-Transcribe?
OpenAI listet gpt-transcribe mit $0.0045 pro Audiominute ($0.27 pro Stunde) und gpt-live-transcribe mit $0.017 pro Minute ($1.02 pro Stunde).
Ist GPT-Live-Transcribe genauer als GPT-Realtime-Whisper?
Auf OpenAI's neunsprachigem Real-World Audio Recording-Benchmark sank die gemeldete Transkriptionsfehlerrate von 11.65% auf 9.60%. Verifizieren Sie dieses, benchmark-spezifische Ergebnis auf Ihrem eigenen Audio.
Unterstützt GPT-Live-Transcribe Diarisierung oder Wort-Timestamps?
Nein. Es liefert keine Sprecherlabels, Wort-Timestamps oder Konfidenzwerte. Verwenden Sie ein kompatibles Datei-Modell oder einen Fallback-Schritt, wenn diese Felder erforderlich sind.
Ist die Migration von GPT-Realtime-Whisper ein Drop-in-Modelltausch?
Nein. Überprüfen Sie Session-Konfiguration, Sprachfelder, Kontextinputs, Delay-Einstellungen, Ereignisreihenfolge, Feature-Abhängigkeiten, Latenz und Ausgabequalität, bevor Sie Produktionsverkehr verschieben.
Testen Sie Transkriptionsrouten mit CometAPI
Prüfen Sie vor der Implementierung die aktuelle Modellverfügbarkeit und Routenpreise auf der CometAPI pricing page und verwenden Sie die CometAPI documentation für OpenAI-kompatible Request-Muster. Fixieren Sie in Tests exakte Modell-IDs und loggen Sie Audiodauer, Delay-Level, First-Delta-Latenz, Final-Transkript-Latenz, Retries und Akzeptanzrate, damit die Routing-Entscheidung die Gesamtkosten des Workflows widerspiegelt.
