GPT-Transcribe vs GPT-Live-Transcribe: ceny, różnice w API i migracja
TL;DR
Używaj gpt-transcribe do ukończonych nagrań w cenie $0.0045 za minutę audio, a gpt-live-transcribe do mikrofonów, połączeń lub strumieni na żywo w cenie $0.017 za minutę. OpenAI raportuje niższy błąd transkrypcji dla modelu live niż dla GPT-Realtime-Whisper w opublikowanych benchmarkach, ale właściwy wybór zależy od momentu pojawienia się tekstu, potrzebnych pól wyjściowych oraz tego, jak oba modele działają na Twoim produkcyjnym audio.
GPT-Transcribe vs GPT-Live-Transcribe w skrócie
Jeśli potrzebujesz transkrypcji dopiero po nagraniu audio, użyj gpt-transcribe. Jeśli Twoja aplikacja musi otrzymywać tekst, gdy audio wciąż napływa, użyj gpt-live-transcribe. Największa różnica to nie tylko cena, ale również moment rozpoczęcia transkrypcji i typ przepływu API, który Twoja aplikacja musi obsłużyć.
| Element | gpt-transcribe | gpt-live-transcribe |
|---|---|---|
| Najlepsze zastosowanie | Przesyłane nagrania, ograniczone żądania audio, asynchroniczne zadania, oraz zatwierdzone tury Realtime | Mikrofony, połączenia, spotkania i strumienie mediów na żywo |
| Opublikowana cena | $0.0045 za minutę audio | $0.017 za minutę audio |
| Cena za godzinę audio | $0.27 | $1.02 |
| API / Endpointy | /v1/audio/transcriptions; opcjonalny, oparty na zatwierdzonych turach workflow Realtime | Sesje transkrypcji Realtime (v1/realtime/transcription_sessions lub podobne) |
| Połączenie | Przesyłanie plików; opcjonalna odpowiedź strumieniowa podczas przetwarzania pliku | WebSocket dla serwerowych potoków lub WebRTC dla audio w przeglądarce |
| Kiedy zaczyna się transkrypcja | Po przesłaniu pliku lub zatwierdzeniu tury audio | Gdy audio wciąż napływa |
| Częściowe wyjście transkryptu | Tak, przy strumieniowaniu pliku lub strumieniowaniu zatwierdzonej tury | Tak, gdy mowa napływa na żywo |
| Sterowanie kontekstem | prompt, keywords, languages | prompt, keywords, languages, delay |
| Wykryty język w wyjściu | Tak, gdy model może wiarygodnie przewidzieć | Nie |
| Ważne ograniczenia | Limit uploadu 25 MB; inne trasy wymagane dla znaczników czasu, diaryzacji lub tłumaczeń | Brak znaczników czasu na poziomie słów, etykiet mówców lub wyników ufności |
Chociaż gpt-transcribe może zwracać częściowe aktualizacje transkryptu podczas przetwarzania ukończonego pliku lub zatwierdzonej tury audio, nie jest to ciągła trasa strumieniowania na żywo. Do napisów na żywo, połączeń lub wejścia z mikrofonu lepszym wyborem jest gpt-live-transcribe.
Dla szerszego porównania między dostawcami, zobacz 6 najlepszych interfejsów Speech-to-Text w 2026 na CometAPI.
Czym są GPT-Transcribe i GPT-Live-Transcribe?
OpenAI wprowadziło gpt-transcribe i gpt-live-transcribe 29 lipca 2026 r. gpt-transcribe przetwarza ukończone nagrania, strumieniowane transkrypcje plików oraz zatwierdzone tury Realtime, podczas gdy gpt-live-transcribe zwraca niskolatencyjne aktualizacje transkryptu, gdy audio napływa z mikrofonów, połączeń lub strumieni mediów na żywo.
Te dwa modele stanowią nowe domyślne trasy dla ogólnych transkrypcji plików i na żywo, ale specjalistyczne workflow Whisper i GPT-4o wciąż są potrzebne dla znaczników czasu, tłumaczeń, napisów i diaryzacji mówców.
Kiedy GPT-Live-Transcribe jest wart wyższej ceny?
Strona cennika API OpenAI podaje gpt-transcribe za $0.0045 za minutę i gpt-live-transcribe za $0.017 za minutę. Trasa live kosztuje zatem około 3.8 razy więcej za minutę audio.
| Miesięczny wolumen audio | gpt-transcribe | gpt-live-transcribe | Dodatkowy koszt za live |
|---|---|---|---|
| 100 godzin | $27 | $102 | $75 |
| 1,000 godzin | $270 | $1,020 | $750 |
| 10,000 godzin | $2,700 | $10,200 | $7,500 |
Te szacunki kosztów transkrypcji używają wyłącznie opublikowanych stawek bazowych OpenAI: godziny audio × 60 × cena za minutę. Nie uwzględniają magazynowania, transmisji sieciowej, ponowień, hostingu aplikacji, przetwarzania końcowego, korekty przez człowieka i kosztów dostawcy awaryjnego.
Wybierz gpt-live-transcribe, gdy produkt wymaga natychmiastowych napisów, asysty agenta, moderacji lub interakcji w czasie rzeczywistym. Wybierz gpt-transcribe, gdy transkrypt jest potrzebny dopiero po zakończeniu spotkania, połączenia, wywiadu lub przesłania mediów. Architektura dwutorowa może używać transkrypcji live dla doświadczenia użytkownika oraz transkrypcji plików do przetwarzania po połączeniu lub uzupełnień.
OpenAI obecnie podaje tę samą bazową cenę $0.017 za minutę dla GPT-Realtime-Whisper i gpt-live-transcribe. Migrację między tymi trasami live oceniaj pod kątem jakości zaakceptowanych transkryptów, latencji, obsługi zdarzeń i zgodności operacyjnej, a nie wyłącznie według ceny katalogowej.
Czym różnią się API GPT-Transcribe i GPT-Live-Transcribe?
Główna różnica dotyczy sposobu wprowadzania audio do systemu i momentu pojawiania się zdarzeń transkryptu. gpt-transcribe akceptuje ukończone pliki lub zatwierdzone tury audio, podczas gdy gpt-live-transcribe utrzymuje połączenie Realtime i emituje aktualizacje transkryptu, gdy audio wciąż napływa.
Używaj GPT-Transcribe do ukończonego audio
Dla ukończonego nagrania wyślij plik na /v1/audio/transcriptions. Przewodnik OpenAI dotyczący transkrypcji plików akceptuje pliki do 25 MB w formatach mp3, mp4, mpeg, mpga, m4a, wav lub webm.
from openai import OpenAI
client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="gpt-transcribe",
file=audio_file,
prompt="A support call about a premium plan and account AC-42.",
extra_body={
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
},
)
print(transcript.text)
Ustaw stream=True, aby otrzymywać zdarzenia delta transkryptu podczas przetwarzania przesłanego nagrania. Skraca to czas oczekiwania na widoczny tekst, ale nie zamienia endpointu pliku w trasę odbierającą audio z mikrofonu na żywo.
Używaj GPT-Live-Transcribe dla napływającego audio
Utwórz sesję Realtime z type: "transcription" i wybierz gpt-live-transcribe. Użyj WebSocket dla serwerowego potoku mediów lub WebRTC dla audio w przeglądarce.
{
"type": "session.update",
"session": {
"type": "transcription",
"audio": {
"input": {
"format": {
"type": "audio/pcm",
"rate": 24000
},
"transcription": {
"model": "gpt-live-transcribe",
"prompt": "A support call about a premium plan and account AC-42.",
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
"delay": "low"
},
"turn_detection": null
}
}
}
}
Dołączaj fragmenty audio za pomocą input_audio_buffer.append. Aplikacja może zatwierdzać tury przez input_audio_buffer.commit lub skonfigurować serwerowe wykrywanie aktywności głosowej.
Przewodnik po transkrypcji Realtime zwraca przyrostowy tekst poprzez conversation.item.input_audio_transcription.delta, a następnie conversation.item.input_audio_transcription.completed dla zatwierdzonej pozycji. Zdarzenia ukończenia z różnych tur nie mają gwarancji przyjścia w kolejności, więc uzgadniaj je po item_id, a nie po kolejności nadejścia.
Użyj trasy zatwierdzonych tur, gdy natychmiastowy tekst nie jest konieczny
gpt-transcribe może również działać w sesji transkrypcji Realtime przez WebSocket. Transkrypcja rozpoczyna się po zatwierdzeniu tury audio, model może użyć wcześniejszych przetranskrybowanych tur jako kontekstu, a zdarzenie ukończenia może zawierać wykryte języki.
Ta trasa zatwierdzonych tur jest użyteczna, gdy strumieniowanie oparte na turach lub wykrywanie języków są ważniejsze niż wyświetlanie tekstu, gdy mówca wciąż mówi. Nie należy jej mylić z ciągłym, niższym opóźnieniem gpt-live-transcribe.
Jak prompt, keywords, languages i delay wpływają na transkrypcję?
Oba modele akceptują kontekst, który może poprawić rozpoznawanie nazw, liczb, akronimów, terminów produktowych, akcentowanej mowy, wielojęzycznego audio i przełączania kodów językowych.
| Kontrola | Cel | Uwaga produkcyjna |
|---|---|---|
| prompt | Opisz nagranie, mówcę, domenę lub oczekiwany temat | Zbyt specyficzny kontekst może zniekształcić transkrypt |
| keywords | Podaj literalnie nazwy, akronimy, formaty kont lub terminy techniczne | Podpowiedzi nie są wymaganym outputem; testuj wstawienia niewypowiedzianych terminów |
| languages | Wymień jeden lub więcej oczekiwanych języków wejściowych | Nieobsługiwane lub źle sformatowane kody powodują odrzucenie |
| delay | Wymień wcześniejsze delty na rzecz większego kontekstu akustycznego | Dostępne dla gpt-live-transcribe; mierz zamiast zakładać stałe milisekundy |
Dla nowych modeli languages zastępuje wcześniejsze pojedyncze pole language. Nie wysyłaj obu naraz. Każde słowo kluczowe musi mieścić się w jednym wierszu i nie może zawierać <, >, CR ani LF; nieprawidłowe wartości spowodują odrzucenie żądania lub aktualizacji sesji.
gpt-live-transcribe obsługuje ustawienia opóźnienia minimal, low, medium, high i xhigh. Niższe ustawienia preferują wcześniejszy tekst częściowy, podczas gdy wyższe zapewniają więcej kontekstu audio i mogą poprawić jakość transkrypcji. OpenAI nie gwarantuje stałej latencji dla każdego poziomu, więc mierz czas do pierwszej delty i czas do finalnego transkryptu na reprezentatywnych mikrofonach, kodekach, sieciach, językach i długościach sesji.
Co pokazują benchmarki dokładności OpenAI?
W ogłoszeniu OpenAI raportuje, że gpt-live-transcribe przewyższył GPT-Realtime-Whisper-1 w dwóch wielojęzycznych testach transkrypcji. Raportuje także, że kontekst swobodny poprawił dokładność semantyczną w ocenie Context Aware ASR.
| Ewaluacja OpenAI | wynik gpt-live-transcribe | Porównanie | Zgłaszana zmiana |
|---|---|---|---|
| Dokładność semantyczna Context Aware ASR | 44.6% z kontekstem | 38.5% bez kontekstu | +6.1 punktu procentowego |
| Common Voice, 22 języki, wskaźnik błędu transkrypcji | 19.70% | 20.33% dla GPT-Realtime-Whisper-1 | -0.63 punktu; ok. 3.1% względnie |
| Real-World Audio Recording, 9 języków, wskaźnik błędu | 9.60% | 11.65% dla GPT-Realtime-Whisper-1 | -2.05 punktu; ok. 17.6% względnie |
Uprawniony wniosek jest wąski: nowy model live wypadł lepiej w raportowanych testach OpenAI, a kontekst poprawił reportowany wynik dokładności semantycznej. Te wyniki od dostawcy nie gwarantują takiej samej poprawy dla każdego języka, kodeka telefonicznego, mikrofonu, ustawienia opóźnienia, słownictwa domenowego czy polityki korekcji.
Kiedy należy używać Whisper lub GPT-4o Transcribe?
Żaden z nowych modeli nie zastępuje wszystkich workflow mowy na tekst.
| Wymaganie | Zalecana trasa |
|---|---|
| Ogólna transkrypcja ukończonych plików | gpt-transcribe |
| Niskolatencyjne napisy na żywo lub transkrypcja połączeń | gpt-live-transcribe |
| Etykiety mówców dla ukończonych nagrań | gpt-4o-transcribe-diarize z diarized_json |
| Znaczniki czasu słów lub segmentów | whisper-1 z timestamp_granularities[] |
| Tłumaczenie ukończonego nieangielskiego audio na angielski | /v1/audio/translations z whisper-1 |
Dla diaryzacji OpenAI wymaga plikowego Transcriptions API; etykietowanie mówców nie jest obsługiwane w sesjach transkrypcji Realtime. Dla nagrań dłuższych niż 30 sekund skonfiguruj chunking_strategy jako "auto" lub użyj konfiguracji detekcji aktywności głosowej.
Dla znaczników czasu, napisów, tłumaczeń lub istniejących workflow Whisper zobacz przewodnik po Whisper API CometAPI oraz stronę modelu Whisper-1. Zespoły oceniające inną trasę transkrypcji plików OpenAI mogą też przejrzeć stronę modelu GPT-4o Transcribe.
Jak migrować z Whisper?
Zmiana identyfikatora modelu to dopiero pierwszy krok. Zweryfikuj cały workflow przed przekierowaniem ruchu produkcyjnego.
| Sprawdzenie | Wymagane działanie | Ryzyko pominięcia |
|---|---|---|
| Wybór trasy | Oddziel ukończone nagrania od rzeczywiście live | Płacenie stawki live za zadania asynch. |
| Pola językowe | Zastąp language przez languages dla nowych modeli; nigdy nie wysyłaj obu | Odrzucone żądania lub sesje |
| Podpowiedzi kontekstu | Przetestuj prompt i keywords na nazwach, liczbach, żargonie i szumie | Zniekształcone lub wstawione terminy |
| Ustawienie delay | Zbenchmarkuj co najmniej low, medium i high na reprezentatywnym audio | Wybór szybkości lub dokładności bez danych |
| Obsługa zdarzeń | Uzgadniaj delty i ukończenia po item_id | Transkrypty poza kolejnością lub nadpisane |
| Parzystość funkcji | Zewidencjonuj zależności: diaryzacja, znaczniki czasu, ufność, napisy, tłumaczenia | Brakujące pola dla dalszych etapów |
| Telemetria kosztu | Loguj minuty audio, ponowienia, niepowodzenia, czas korekty i zaakceptowane outputy | Mylenie ceny katalogowej z kosztem workflow |
| Wdrożenie | Test cieniowany, kanaryzacja małego odsetka ruchu i fallback | Szeroka regresja bez szybkiego rollbacku |
Dla migracji z GPT-Realtime-Whisper zachowaj format audio, politykę wykrywania tur, zestaw testowy i docelową latencję bez zmian. Ponieważ opublikowana cena live nie uległa zmianie, priorytetem są: odsetek zaakceptowanych transkryptów, rozkład latencji, stabilność wyjścia i zgodność z resztą potoku.
Przewodnik migracji (z Whisper / wcześniejszych modeli)
OpenAI zapewnia oficjalny cookbook: Migrate from Whisper to GPT-Transcribe and GPT-Live-Transcribe.
Zasady wysokiego poziomu:
- Nagrane / wsadowe audio → przełącz na gpt-transcribe na istniejącym endpointzie /v1/audio/transcriptions.
- Ciągłe audio na żywo → przełącz na gpt-live-transcribe w sesji transkrypcji Realtime.
- Wyższa dokładność po zatwierdzeniu tury → użyj gpt-transcribe wewnątrz sesji Realtime.
Minimalny przykład migracji pliku (Python):
Python
# Before (Whisper)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="whisper-1", file=audio, language="en", prompt="Support call about AC-42" )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="gpt-transcribe", file=audio, prompt="A customer support call about billing", extra_body={ "keywords": ["AC-42", "Premium Plus"], "languages": ["en", "fr"] }, response_format="json" # or stream=True for deltas )
Uwagi dot. migracji live:
- Zachowaj tę samą architekturę sesji Realtime / WebSocket.
- Zmień identyfikator modelu i zastąp pojedyncze language tablicą languages.
- Dodaj opcjonalnie prompt, keywords i delay (np. "low").
- Kontynuuj obsługę tych samych zdarzeń delta/completed.
- Nie wysyłaj jednocześnie language i languages.
Ważne zastrzeżenia przy migracji:
- GPT-Transcribe/GPT-Live-Transcribe nie obsługują znaczników czasu na poziomie słów, SRT/VTT ani tłumaczenia na angielski w taki sam sposób jak whisper-1. Dla tych potrzeb zachowaj Whisper.
- Format odpowiedzi różni się — nie zakładaj, że text, verbose_json, srt lub vtt działają identycznie.
- Słowa kluczowe muszą być literami jedno-wierszowymi (bez <, >, CR lub LF), inaczej żądanie zostanie odrzucone.
- Testuj na reprezentatywnym produkcyjnym audio (akcenty, szum, terminy domenowe, krótkie wypowiedzi), zamiast polegać wyłącznie na opublikowanych WER.
Szybka rekomendacja
- Domyślnie dla nowych prac: GPT-Transcribe dla plików/wsadów, GPT-Live-Transcribe dla strumieniowania live.
- Istniejące integracje Whisper lub GPT-4o-Transcribe nadal działają, ale nie są już rekomendowanym punktem startowym.
- Zadania wsadowe wrażliwe na koszty najbardziej skorzystają na przejściu na GPT-Transcribe ($0.0045 vs $0.006).
Najświeższe szczegóły sprawdź na oficjalnych stronach modeli i w przewodniku ogólnym dotyczącym transkrypcji na stronie deweloperskiej OpenAI.
Jak oceniać oba modele na produkcyjnym audio?
Używaj licencjonowanego audio reprezentującego produkt, a nie tylko czystych klipów demonstracyjnych.
- Wybierz co najmniej 50 nagrań obejmujących główne przypadki użycia, języki, urządzenia i warunki audio.
- Uwzględnij akcenty, przerwania, szum tła, przełączanie kodów, liczby, daty, waluty, adresy e-mail i słownictwo domenowe.
- Przepuść ukończone nagrania przez
gpt-transcribez kontekstem i bez. - Odtwórz te same próbki live przez
gpt-live-transcribena trzech poziomach delay. - Zachowaj spójne formaty, granice tur, prompty i zasady punktacji między uruchomieniami.
- Mierz błąd transkrypcji, recall terminów domenowych, rewizje tekstu częściowego, latencję p50 i p95, niepowodzenia, ponowienia oraz czas korekty przez człowieka.
- Oblicz koszt za zaakceptowany transkrypt, a następnie przeprowadź kanaryzację wybranej polityki routingu przed pełną migracją.
Końcowy projekt może używać jednego modelu lub obu. Decydującą metryką powinien być koszt i niezawodność zaakceptowanego transkryptu produkcyjnego, a nie wyłącznie opublikowana cena za minutę.
FAQ
Którego modelu powinienem użyć: GPT-Transcribe czy GPT-Live-Transcribe?
Użyj gpt-transcribe dla ukończonych nagrań i zadań asynchronicznych. Użyj gpt-live-transcribe, gdy tekst musi napływać, gdy audio jest wciąż strumieniowane.
Ile kosztują GPT-Transcribe i GPT-Live-Transcribe?
OpenAI podaje gpt-transcribe po $0.0045 za minutę audio ($0.27 za godzinę) i gpt-live-transcribe po $0.017 za minutę ($1.02 za godzinę).
Czy GPT-Live-Transcribe jest dokładniejszy niż GPT-Realtime-Whisper?
W benchmarku OpenAI na dziewięciu językach (Real-World Audio Recording) raportowany wskaźnik błędu transkrypcji spadł z 11.65% do 9.60%. Zweryfikuj ten wynik specyficzny dla benchmarku na własnym audio.
Czy GPT-Live-Transcribe wspiera diaryzację lub znaczniki czasu słów?
Nie. Nie zwraca etykiet mówców, znaczników czasu na poziomie słów ani wyników ufności. Użyj kompatybilnego modelu plikowego lub kroku awaryjnego, gdy te pola są wymagane.
Czy migracja z GPT-Realtime-Whisper to zamiana modelu „jeden do jednego”?
Nie. Zweryfikuj konfigurację sesji, pola językowe, wejścia kontekstu, ustawienia delay, kolejność zdarzeń, zależności funkcji, latencję i jakość wyjścia przed przeniesieniem ruchu produkcyjnego.
Testuj trasy transkrypcji z CometAPI
Przed implementacją sprawdź dostępność modeli i ceny tras na stronie cen CometAPI i używaj dokumentacji CometAPI dla wzorców żądań kompatybilnych z OpenAI. Przypnij dokładne identyfikatory modeli w testach i loguj długość audio, poziom delay, latencję pierwszej delty, latencję finalnego transkryptu, ponowienia i odsetek zaakceptowanych transkryptów, aby decyzja routingu odzwierciedlała całkowity koszt workflow.
