GPT-5.6 Luna price down 80%, Terra down 20% →

GPT-Transcribe vs GPT-Live-Transcribe: API & cennik

CometAPI
Mia MarenJul 31, 2026
GPT-Transcribe vs GPT-Live-Transcribe: API & cennik

GPT-Transcribe vs GPT-Live-Transcribe: ceny, różnice w API i migracja

TL;DR

Używaj gpt-transcribe do ukończonych nagrań w cenie $0.0045 za minutę audio, a gpt-live-transcribe do mikrofonów, połączeń lub strumieni na żywo w cenie $0.017 za minutę. OpenAI raportuje niższy błąd transkrypcji dla modelu live niż dla GPT-Realtime-Whisper w opublikowanych benchmarkach, ale właściwy wybór zależy od momentu pojawienia się tekstu, potrzebnych pól wyjściowych oraz tego, jak oba modele działają na Twoim produkcyjnym audio.

GPT-Transcribe vs GPT-Live-Transcribe w skrócie

Jeśli potrzebujesz transkrypcji dopiero po nagraniu audio, użyj gpt-transcribe. Jeśli Twoja aplikacja musi otrzymywać tekst, gdy audio wciąż napływa, użyj gpt-live-transcribe. Największa różnica to nie tylko cena, ale również moment rozpoczęcia transkrypcji i typ przepływu API, który Twoja aplikacja musi obsłużyć.

Elementgpt-transcribegpt-live-transcribe
Najlepsze zastosowaniePrzesyłane nagrania, ograniczone żądania audio, asynchroniczne zadania, oraz zatwierdzone tury RealtimeMikrofony, połączenia, spotkania i strumienie mediów na żywo
Opublikowana cena$0.0045 za minutę audio$0.017 za minutę audio
Cena za godzinę audio$0.27$1.02
API / Endpointy/v1/audio/transcriptions; opcjonalny, oparty na zatwierdzonych turach workflow RealtimeSesje transkrypcji Realtime (v1/realtime/transcription_sessions lub podobne)
PołączeniePrzesyłanie plików; opcjonalna odpowiedź strumieniowa podczas przetwarzania plikuWebSocket dla serwerowych potoków lub WebRTC dla audio w przeglądarce
Kiedy zaczyna się transkrypcjaPo przesłaniu pliku lub zatwierdzeniu tury audioGdy audio wciąż napływa
Częściowe wyjście transkryptuTak, przy strumieniowaniu pliku lub strumieniowaniu zatwierdzonej turyTak, gdy mowa napływa na żywo
Sterowanie kontekstemprompt, keywords, languagesprompt, keywords, languages, delay
Wykryty język w wyjściuTak, gdy model może wiarygodnie przewidziećNie
Ważne ograniczeniaLimit uploadu 25 MB; inne trasy wymagane dla znaczników czasu, diaryzacji lub tłumaczeńBrak znaczników czasu na poziomie słów, etykiet mówców lub wyników ufności

Chociaż gpt-transcribe może zwracać częściowe aktualizacje transkryptu podczas przetwarzania ukończonego pliku lub zatwierdzonej tury audio, nie jest to ciągła trasa strumieniowania na żywo. Do napisów na żywo, połączeń lub wejścia z mikrofonu lepszym wyborem jest gpt-live-transcribe.

Dla szerszego porównania między dostawcami, zobacz 6 najlepszych interfejsów Speech-to-Text w 2026 na CometAPI.

Czym są GPT-Transcribe i GPT-Live-Transcribe?

OpenAI wprowadziło gpt-transcribe i gpt-live-transcribe 29 lipca 2026 r. gpt-transcribe przetwarza ukończone nagrania, strumieniowane transkrypcje plików oraz zatwierdzone tury Realtime, podczas gdy gpt-live-transcribe zwraca niskolatencyjne aktualizacje transkryptu, gdy audio napływa z mikrofonów, połączeń lub strumieni mediów na żywo.

Te dwa modele stanowią nowe domyślne trasy dla ogólnych transkrypcji plików i na żywo, ale specjalistyczne workflow Whisper i GPT-4o wciąż są potrzebne dla znaczników czasu, tłumaczeń, napisów i diaryzacji mówców.

Kiedy GPT-Live-Transcribe jest wart wyższej ceny?

Strona cennika API OpenAI podaje gpt-transcribe za $0.0045 za minutę i gpt-live-transcribe za $0.017 za minutę. Trasa live kosztuje zatem około 3.8 razy więcej za minutę audio.

Miesięczny wolumen audiogpt-transcribegpt-live-transcribeDodatkowy koszt za live
100 godzin$27$102$75
1,000 godzin$270$1,020$750
10,000 godzin$2,700$10,200$7,500

Te szacunki kosztów transkrypcji używają wyłącznie opublikowanych stawek bazowych OpenAI: godziny audio × 60 × cena za minutę. Nie uwzględniają magazynowania, transmisji sieciowej, ponowień, hostingu aplikacji, przetwarzania końcowego, korekty przez człowieka i kosztów dostawcy awaryjnego.

Wybierz gpt-live-transcribe, gdy produkt wymaga natychmiastowych napisów, asysty agenta, moderacji lub interakcji w czasie rzeczywistym. Wybierz gpt-transcribe, gdy transkrypt jest potrzebny dopiero po zakończeniu spotkania, połączenia, wywiadu lub przesłania mediów. Architektura dwutorowa może używać transkrypcji live dla doświadczenia użytkownika oraz transkrypcji plików do przetwarzania po połączeniu lub uzupełnień.

OpenAI obecnie podaje tę samą bazową cenę $0.017 za minutę dla GPT-Realtime-Whisper i gpt-live-transcribe. Migrację między tymi trasami live oceniaj pod kątem jakości zaakceptowanych transkryptów, latencji, obsługi zdarzeń i zgodności operacyjnej, a nie wyłącznie według ceny katalogowej.

Czym różnią się API GPT-Transcribe i GPT-Live-Transcribe?

Główna różnica dotyczy sposobu wprowadzania audio do systemu i momentu pojawiania się zdarzeń transkryptu. gpt-transcribe akceptuje ukończone pliki lub zatwierdzone tury audio, podczas gdy gpt-live-transcribe utrzymuje połączenie Realtime i emituje aktualizacje transkryptu, gdy audio wciąż napływa.

Używaj GPT-Transcribe do ukończonego audio

Dla ukończonego nagrania wyślij plik na /v1/audio/transcriptions. Przewodnik OpenAI dotyczący transkrypcji plików akceptuje pliki do 25 MB w formatach mp3, mp4, mpeg, mpga, m4a, wav lub webm.

from openai import OpenAI

client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
    transcript = client.audio.transcriptions.create(
        model="gpt-transcribe",
        file=audio_file,
        prompt="A support call about a premium plan and account AC-42.",
        extra_body={
            "keywords": ["premium plan", "AC-42", "billing"],
            "languages": ["en"],
        },
    )
print(transcript.text)

Ustaw stream=True, aby otrzymywać zdarzenia delta transkryptu podczas przetwarzania przesłanego nagrania. Skraca to czas oczekiwania na widoczny tekst, ale nie zamienia endpointu pliku w trasę odbierającą audio z mikrofonu na żywo.

Używaj GPT-Live-Transcribe dla napływającego audio

Utwórz sesję Realtime z type: "transcription" i wybierz gpt-live-transcribe. Użyj WebSocket dla serwerowego potoku mediów lub WebRTC dla audio w przeglądarce.

{
  "type": "session.update",
  "session": {
    "type": "transcription",
    "audio": {
      "input": {
        "format": {
          "type": "audio/pcm",
          "rate": 24000
        },
        "transcription": {
          "model": "gpt-live-transcribe",
          "prompt": "A support call about a premium plan and account AC-42.",
          "keywords": ["premium plan", "AC-42", "billing"],
          "languages": ["en"],
          "delay": "low"
        },
        "turn_detection": null
      }
    }
  }
}

Dołączaj fragmenty audio za pomocą input_audio_buffer.append. Aplikacja może zatwierdzać tury przez input_audio_buffer.commit lub skonfigurować serwerowe wykrywanie aktywności głosowej.

Przewodnik po transkrypcji Realtime zwraca przyrostowy tekst poprzez conversation.item.input_audio_transcription.delta, a następnie conversation.item.input_audio_transcription.completed dla zatwierdzonej pozycji. Zdarzenia ukończenia z różnych tur nie mają gwarancji przyjścia w kolejności, więc uzgadniaj je po item_id, a nie po kolejności nadejścia.

Użyj trasy zatwierdzonych tur, gdy natychmiastowy tekst nie jest konieczny

gpt-transcribe może również działać w sesji transkrypcji Realtime przez WebSocket. Transkrypcja rozpoczyna się po zatwierdzeniu tury audio, model może użyć wcześniejszych przetranskrybowanych tur jako kontekstu, a zdarzenie ukończenia może zawierać wykryte języki.

Ta trasa zatwierdzonych tur jest użyteczna, gdy strumieniowanie oparte na turach lub wykrywanie języków są ważniejsze niż wyświetlanie tekstu, gdy mówca wciąż mówi. Nie należy jej mylić z ciągłym, niższym opóźnieniem gpt-live-transcribe.

Jak prompt, keywords, languages i delay wpływają na transkrypcję?

Oba modele akceptują kontekst, który może poprawić rozpoznawanie nazw, liczb, akronimów, terminów produktowych, akcentowanej mowy, wielojęzycznego audio i przełączania kodów językowych.

KontrolaCelUwaga produkcyjna
promptOpisz nagranie, mówcę, domenę lub oczekiwany tematZbyt specyficzny kontekst może zniekształcić transkrypt
keywordsPodaj literalnie nazwy, akronimy, formaty kont lub terminy technicznePodpowiedzi nie są wymaganym outputem; testuj wstawienia niewypowiedzianych terminów
languagesWymień jeden lub więcej oczekiwanych języków wejściowychNieobsługiwane lub źle sformatowane kody powodują odrzucenie
delayWymień wcześniejsze delty na rzecz większego kontekstu akustycznegoDostępne dla gpt-live-transcribe; mierz zamiast zakładać stałe milisekundy

Dla nowych modeli languages zastępuje wcześniejsze pojedyncze pole language. Nie wysyłaj obu naraz. Każde słowo kluczowe musi mieścić się w jednym wierszu i nie może zawierać <, >, CR ani LF; nieprawidłowe wartości spowodują odrzucenie żądania lub aktualizacji sesji.

gpt-live-transcribe obsługuje ustawienia opóźnienia minimal, low, medium, high i xhigh. Niższe ustawienia preferują wcześniejszy tekst częściowy, podczas gdy wyższe zapewniają więcej kontekstu audio i mogą poprawić jakość transkrypcji. OpenAI nie gwarantuje stałej latencji dla każdego poziomu, więc mierz czas do pierwszej delty i czas do finalnego transkryptu na reprezentatywnych mikrofonach, kodekach, sieciach, językach i długościach sesji.

Co pokazują benchmarki dokładności OpenAI?

W ogłoszeniu OpenAI raportuje, że gpt-live-transcribe przewyższył GPT-Realtime-Whisper-1 w dwóch wielojęzycznych testach transkrypcji. Raportuje także, że kontekst swobodny poprawił dokładność semantyczną w ocenie Context Aware ASR.

Ewaluacja OpenAIwynik gpt-live-transcribePorównanieZgłaszana zmiana
Dokładność semantyczna Context Aware ASR44.6% z kontekstem38.5% bez kontekstu+6.1 punktu procentowego
Common Voice, 22 języki, wskaźnik błędu transkrypcji19.70%20.33% dla GPT-Realtime-Whisper-1-0.63 punktu; ok. 3.1% względnie
Real-World Audio Recording, 9 języków, wskaźnik błędu9.60%11.65% dla GPT-Realtime-Whisper-1-2.05 punktu; ok. 17.6% względnie

Uprawniony wniosek jest wąski: nowy model live wypadł lepiej w raportowanych testach OpenAI, a kontekst poprawił reportowany wynik dokładności semantycznej. Te wyniki od dostawcy nie gwarantują takiej samej poprawy dla każdego języka, kodeka telefonicznego, mikrofonu, ustawienia opóźnienia, słownictwa domenowego czy polityki korekcji.

Kiedy należy używać Whisper lub GPT-4o Transcribe?

Żaden z nowych modeli nie zastępuje wszystkich workflow mowy na tekst.

WymaganieZalecana trasa
Ogólna transkrypcja ukończonych plikówgpt-transcribe
Niskolatencyjne napisy na żywo lub transkrypcja połączeńgpt-live-transcribe
Etykiety mówców dla ukończonych nagrańgpt-4o-transcribe-diarize z diarized_json
Znaczniki czasu słów lub segmentówwhisper-1 z timestamp_granularities[]
Tłumaczenie ukończonego nieangielskiego audio na angielski/v1/audio/translations z whisper-1

Dla diaryzacji OpenAI wymaga plikowego Transcriptions API; etykietowanie mówców nie jest obsługiwane w sesjach transkrypcji Realtime. Dla nagrań dłuższych niż 30 sekund skonfiguruj chunking_strategy jako "auto" lub użyj konfiguracji detekcji aktywności głosowej.

Dla znaczników czasu, napisów, tłumaczeń lub istniejących workflow Whisper zobacz przewodnik po Whisper API CometAPI oraz stronę modelu Whisper-1. Zespoły oceniające inną trasę transkrypcji plików OpenAI mogą też przejrzeć stronę modelu GPT-4o Transcribe.

Jak migrować z Whisper?

Zmiana identyfikatora modelu to dopiero pierwszy krok. Zweryfikuj cały workflow przed przekierowaniem ruchu produkcyjnego.

SprawdzenieWymagane działanieRyzyko pominięcia
Wybór trasyOddziel ukończone nagrania od rzeczywiście livePłacenie stawki live za zadania asynch.
Pola językoweZastąp language przez languages dla nowych modeli; nigdy nie wysyłaj obuOdrzucone żądania lub sesje
Podpowiedzi kontekstuPrzetestuj prompt i keywords na nazwach, liczbach, żargonie i szumieZniekształcone lub wstawione terminy
Ustawienie delayZbenchmarkuj co najmniej low, medium i high na reprezentatywnym audioWybór szybkości lub dokładności bez danych
Obsługa zdarzeńUzgadniaj delty i ukończenia po item_idTranskrypty poza kolejnością lub nadpisane
Parzystość funkcjiZewidencjonuj zależności: diaryzacja, znaczniki czasu, ufność, napisy, tłumaczeniaBrakujące pola dla dalszych etapów
Telemetria kosztuLoguj minuty audio, ponowienia, niepowodzenia, czas korekty i zaakceptowane outputyMylenie ceny katalogowej z kosztem workflow
WdrożenieTest cieniowany, kanaryzacja małego odsetka ruchu i fallbackSzeroka regresja bez szybkiego rollbacku

Dla migracji z GPT-Realtime-Whisper zachowaj format audio, politykę wykrywania tur, zestaw testowy i docelową latencję bez zmian. Ponieważ opublikowana cena live nie uległa zmianie, priorytetem są: odsetek zaakceptowanych transkryptów, rozkład latencji, stabilność wyjścia i zgodność z resztą potoku.

Przewodnik migracji (z Whisper / wcześniejszych modeli)

OpenAI zapewnia oficjalny cookbook: Migrate from Whisper to GPT-Transcribe and GPT-Live-Transcribe.

Zasady wysokiego poziomu:

  1. Nagrane / wsadowe audio → przełącz na gpt-transcribe na istniejącym endpointzie /v1/audio/transcriptions.
  2. Ciągłe audio na żywo → przełącz na gpt-live-transcribe w sesji transkrypcji Realtime.
  3. Wyższa dokładność po zatwierdzeniu tury → użyj gpt-transcribe wewnątrz sesji Realtime.

Minimalny przykład migracji pliku (Python):

Python

# Before (Whisper)with open("meeting.wav", "rb") as audio:    result = client.audio.transcriptions.create(        model="whisper-1",        file=audio,        language="en",        prompt="Support call about AC-42"    )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio:    result = client.audio.transcriptions.create(        model="gpt-transcribe",        file=audio,        prompt="A customer support call about billing",        extra_body={            "keywords": ["AC-42", "Premium Plus"],            "languages": ["en", "fr"]        },        response_format="json"  # or stream=True for deltas    )

Uwagi dot. migracji live:

  • Zachowaj tę samą architekturę sesji Realtime / WebSocket.
  • Zmień identyfikator modelu i zastąp pojedyncze language tablicą languages.
  • Dodaj opcjonalnie prompt, keywords i delay (np. "low").
  • Kontynuuj obsługę tych samych zdarzeń delta/completed.
  • Nie wysyłaj jednocześnie language i languages.

Ważne zastrzeżenia przy migracji:

  • GPT-Transcribe/GPT-Live-Transcribe nie obsługują znaczników czasu na poziomie słów, SRT/VTT ani tłumaczenia na angielski w taki sam sposób jak whisper-1. Dla tych potrzeb zachowaj Whisper.
  • Format odpowiedzi różni się — nie zakładaj, że text, verbose_json, srt lub vtt działają identycznie.
  • Słowa kluczowe muszą być literami jedno-wierszowymi (bez <, >, CR lub LF), inaczej żądanie zostanie odrzucone.
  • Testuj na reprezentatywnym produkcyjnym audio (akcenty, szum, terminy domenowe, krótkie wypowiedzi), zamiast polegać wyłącznie na opublikowanych WER.

Szybka rekomendacja

  • Domyślnie dla nowych prac: GPT-Transcribe dla plików/wsadów, GPT-Live-Transcribe dla strumieniowania live.
  • Istniejące integracje Whisper lub GPT-4o-Transcribe nadal działają, ale nie są już rekomendowanym punktem startowym.
  • Zadania wsadowe wrażliwe na koszty najbardziej skorzystają na przejściu na GPT-Transcribe ($0.0045 vs $0.006).

Najświeższe szczegóły sprawdź na oficjalnych stronach modeli i w przewodniku ogólnym dotyczącym transkrypcji na stronie deweloperskiej OpenAI.

Jak oceniać oba modele na produkcyjnym audio?

Używaj licencjonowanego audio reprezentującego produkt, a nie tylko czystych klipów demonstracyjnych.

  1. Wybierz co najmniej 50 nagrań obejmujących główne przypadki użycia, języki, urządzenia i warunki audio.
  2. Uwzględnij akcenty, przerwania, szum tła, przełączanie kodów, liczby, daty, waluty, adresy e-mail i słownictwo domenowe.
  3. Przepuść ukończone nagrania przez gpt-transcribe z kontekstem i bez.
  4. Odtwórz te same próbki live przez gpt-live-transcribe na trzech poziomach delay.
  5. Zachowaj spójne formaty, granice tur, prompty i zasady punktacji między uruchomieniami.
  6. Mierz błąd transkrypcji, recall terminów domenowych, rewizje tekstu częściowego, latencję p50 i p95, niepowodzenia, ponowienia oraz czas korekty przez człowieka.
  7. Oblicz koszt za zaakceptowany transkrypt, a następnie przeprowadź kanaryzację wybranej polityki routingu przed pełną migracją.

Końcowy projekt może używać jednego modelu lub obu. Decydującą metryką powinien być koszt i niezawodność zaakceptowanego transkryptu produkcyjnego, a nie wyłącznie opublikowana cena za minutę.

FAQ

Którego modelu powinienem użyć: GPT-Transcribe czy GPT-Live-Transcribe?

Użyj gpt-transcribe dla ukończonych nagrań i zadań asynchronicznych. Użyj gpt-live-transcribe, gdy tekst musi napływać, gdy audio jest wciąż strumieniowane.

Ile kosztują GPT-Transcribe i GPT-Live-Transcribe?

OpenAI podaje gpt-transcribe po $0.0045 za minutę audio ($0.27 za godzinę) i gpt-live-transcribe po $0.017 za minutę ($1.02 za godzinę).

Czy GPT-Live-Transcribe jest dokładniejszy niż GPT-Realtime-Whisper?

W benchmarku OpenAI na dziewięciu językach (Real-World Audio Recording) raportowany wskaźnik błędu transkrypcji spadł z 11.65% do 9.60%. Zweryfikuj ten wynik specyficzny dla benchmarku na własnym audio.

Czy GPT-Live-Transcribe wspiera diaryzację lub znaczniki czasu słów?

Nie. Nie zwraca etykiet mówców, znaczników czasu na poziomie słów ani wyników ufności. Użyj kompatybilnego modelu plikowego lub kroku awaryjnego, gdy te pola są wymagane.

Czy migracja z GPT-Realtime-Whisper to zamiana modelu „jeden do jednego”?

Nie. Zweryfikuj konfigurację sesji, pola językowe, wejścia kontekstu, ustawienia delay, kolejność zdarzeń, zależności funkcji, latencję i jakość wyjścia przed przeniesieniem ruchu produkcyjnego.

Testuj trasy transkrypcji z CometAPI

Przed implementacją sprawdź dostępność modeli i ceny tras na stronie cen CometAPI i używaj dokumentacji CometAPI dla wzorców żądań kompatybilnych z OpenAI. Przypnij dokładne identyfikatory modeli w testach i loguj długość audio, poziom delay, latencję pierwszej delty, latencję finalnego transkryptu, ponowienia i odsetek zaakceptowanych transkryptów, aby decyzja routingu odzwierciedlała całkowity koszt workflow.

0 wyświetleń
Sprawdzone pod kątem przejrzystości, atrybucji źródeł i aktualnej terminologii API.

Gotowy na obniżenie kosztów rozwoju AI o 20%?

Zacznij za darmo w kilka minut. Dołączone kredyty na bezpłatny okres próbny. Karta kredytowa nie jest wymagana.

Czytaj więcej