GPT-Transcribe ve GPT-Live-Transcribe: Fiyatlandırma, API Farkları ve Geçiş
Kısaca
Tamamlanmış kayıtlar için dakikada $0.0045 ile gpt-transcribe, mikrofonlar, aramalar veya canlı medya akışları için dakikada $0.017 ile gpt-live-transcribe kullanın. OpenAI, yayınladığı karşılaştırmalarda canlı modelin GPT-Realtime-Whisper’dan daha düşük transkripsiyon hatasına sahip olduğunu bildiriyor, ancak doğru rota metnin ne zaman görünmesi gerektiğine, hangi çıktı alanlarına ihtiyaç duyduğunuza ve her iki modelin üretim sesinizdeki performansına bağlıdır.
Bir Bakışta GPT-Transcribe ve GPT-Live-Transcribe
Yalnızca ses kaydı tamamlandıktan sonra transkripsiyona ihtiyacınız varsa gpt-transcribe kullanın. Uygulamanız ses hâlâ gelirken metne ihtiyaç duyuyorsa gpt-live-transcribe kullanın. En büyük fark yalnızca fiyat değil; transkripsiyonun ne zaman başladığı ve uygulamanızın hangi tür API iş akışını desteklemesi gerektiğidir.
| Öğe | gpt-transcribe | gpt-live-transcribe |
|---|---|---|
| En iyi kullanım | Yüklenen kayıtlar, sınırlandırılmış ses istekleri, asenkron işler ve commit edilen Realtime turları | Mikrofonlar, aramalar, toplantılar ve canlı medya akışları |
| Yayınlanan fiyat | Dakika başına $0.0045 ses | Dakika başına $0.017 ses |
| Ses saati başına fiyat | $0.27 | $1.02 |
| API / Uç noktalar | /v1/audio/transcriptions; isteğe bağlı commit’li Realtime iş akışı | Realtime transkripsiyon oturumları (v1/realtime/transcription_sessions veya benzeri) |
| Bağlantı | Dosya yükleme; dosya işlenirken isteğe bağlı akışlı yanıt | Sunucu hatları için WebSocket veya tarayıcı sesi için WebRTC |
| Transkripsiyon başlangıcı | Bir dosya gönderildikten veya bir ses turu commit edildikten sonra | Ses gelirken |
| Kısmi transkript çıktısı | Evet; dosya akışı veya commit’li tur akışıyla | Evet; canlı konuşma gelirken |
| Bağlam kontrolleri | prompt, keywords, languages | prompt, keywords, languages, delay |
| Tespit edilen dil çıktısı | Evet, model güvenilir bir tahmin yapabildiğinde | Hayır |
| Önemli sınırlamalar | 25 MB yükleme sınırı; zaman damgaları, diyarişasyon veya çeviri için başka rotalar gerekir | Kelime düzeyi zaman damgası, konuşmacı etiketleri veya güven puanları yok |
gpt-transcribe, tamamlanmış bir dosyayı veya commit edilmiş bir ses turunu işlerken kısmi transkript güncellemeleri döndürebilse de kesintisiz canlı yayın rotası değildir. Canlı altyazı, aramalar veya mikrofon girdisi için gpt-live-transcribe daha iyi bir seçimdir.
Sağlayıcılar arası daha geniş bir karşılaştırma için CometAPI’nin 2026’nın En İyi 6 Konuşmadan Metne API’si sayfasına bakın.
GPT-Transcribe ve GPT-Live-Transcribe Nedir?
OpenAI, 29 Temmuz 2026’da gpt-transcribe ve gpt-live-transcribe modellerini tanıttı. gpt-transcribe, tamamlanmış kayıtları, akışlı dosya transkriptlerini ve commit edilmiş Realtime turlarını işlerken, gpt-live-transcribe mikrofonlar, aramalar veya canlı medya akışlarından gelen sesi işlerken düşük gecikmeli transkript güncellemeleri döndürür.
Bu iki model, genel dosya ve canlı transkripsiyon için yeni varsayılan rotalar sunar; ancak zaman damgaları, çeviri, altyazı ve konuşmacı diyarişasyonu için uzmanlaşmış Whisper ve GPT-4o transkripsiyon iş akışları hâlâ gereklidir.
GPT-Live-Transcribe Daha Yüksek Fiyata Ne Zaman Değer?
OpenAI’nin API fiyatlandırma sayfası, gpt-transcribe için dakika başına $0.0045, gpt-live-transcribe için dakika başına $0.017 listeler. Canlı rota bu nedenle ses dakikası başına yaklaşık 3.8 kat daha pahalıdır.
| Aylık ses hacmi | gpt-transcribe | gpt-live-transcribe | Ek canlı maliyet |
|---|---|---|---|
| 100 saat | $27 | $102 | $75 |
| 1.000 saat | $270 | $1,020 | $750 |
| 10.000 saat | $2,700 | $10,200 | $7,500 |
Bu transkripsiyon maliyet tahminleri yalnızca OpenAI’nin yayınladığı temel oranları kullanır: ses saatleri × 60 × dakika başına fiyat. Depolama, ağ taşıma, yeniden denemeler, uygulama barındırma, son işlem, insan düzeltmesi ve geri dönüş sağlayıcı maliyetleri hariçtir.
Ürününüzde anında altyazı, temsilci yardımı, moderasyon veya gerçek zamanlı etkileşim gereksinimi varsa gpt-live-transcribe seçin. Transkript yalnızca toplantı, arama, röportaj veya medya yüklemesi tamamlandıktan sonra gerekiyorsa gpt-transcribe seçin. İki rotalı bir mimari, kullanıcı deneyimi için canlı transkripsiyonu, çağrı sonrası işlem veya geri doldurmalar için dosya transkripsiyonunu kullanabilir.
OpenAI şu anda GPT-Realtime-Whisper ve gpt-live-transcribe için aynı dakikada $0.017 temel fiyatı listeler. Bu canlı rotalar arasında geçişi, yalnızca liste fiyatına değil; kabul edilen transkript kalitesi, gecikme, olay işleme ve operasyonel uyumluluk üzerinden değerlendirin.
GPT-Transcribe ve GPT-Live-Transcribe API’leri Nasıl Farklı?
Temel fark, sesin sisteme nasıl girdiği ve transkript olaylarının ne zaman başladığıdır. gpt-transcribe, tamamlanmış dosyaları veya commit edilmiş ses turlarını kabul ederken, gpt-live-transcribe bir Realtime bağlantıyı sürdürür ve ses hâlâ gelirken transkript güncellemeleri yayar.
Tamamlanmış ses için GPT-Transcribe kullanın
Tamamlanmış bir kayıt için dosyayı /v1/audio/transcriptions adresine gönderin. OpenAI’nin dosya transkripsiyon kılavuzu, mp3, mp4, mpeg, mpga, m4a, wav veya webm formatında 25 MB’a kadar dosyaları kabul eder.
from openai import OpenAI
client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="gpt-transcribe",
file=audio_file,
prompt="A support call about a premium plan and account AC-42.",
extra_body={
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
},
)
print(transcript.text)
Yüklenen kayıt işlenirken transkript delta olaylarını almak için stream=True ayarlayın. Bu, görünür metin için beklemeyi azaltır, ancak dosya uç noktasını canlı mikrofon alımına dönüştürmez.
Gelen ses için GPT-Live-Transcribe kullanın
type: "transcription" ile bir Realtime oturumu oluşturun ve gpt-live-transcribe seçin. Sunucu tarafı medya hattı için WebSocket, tarayıcı sesi için WebRTC kullanın.
{
"type": "session.update",
"session": {
"type": "transcription",
"audio": {
"input": {
"format": {
"type": "audio/pcm",
"rate": 24000
},
"transcription": {
"model": "gpt-live-transcribe",
"prompt": "A support call about a premium plan and account AC-42.",
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
"delay": "low"
},
"turn_detection": null
}
}
}
}
Ses parçalarını input_audio_buffer.append ile ekleyin. Uygulama, input_audio_buffer.commit ile turları commit edebilir veya sunucu tarafı ses etkinliği algılamasını yapılandırabilir.
Realtime transkripsiyon kılavuzu, conversation.item.input_audio_transcription.delta üzerinden artımlı metin döndürür ve commit edilen öğe için conversation.item.input_audio_transcription.completed izler. Farklı turlardan gelen tamamlanma olaylarının sırayla geleceği garanti edilmez, bu nedenle geliş sırasına değil item_id ile uzlaştırın.
Anında metin gerekmiyorsa commit’li tur rotasını kullanın
gpt-transcribe aynı zamanda WebSocket üzerinden bir Realtime transkripsiyon oturumunda da çalışabilir. Transkripsiyon bir ses turu commit edildikten sonra başlar, model daha önce transkribe edilmiş turları bağlam olarak kullanabilir ve tamamlanmış olay tespit edilen dilleri içerebilir.
Bu commit’li tur rotası, metin konuşmacı hâlâ konuşurken gösterilmekten ziyade, tur bazlı akış veya dil tespitinin daha önemli olduğu durumlarda yararlıdır. Bunu gpt-live-transcribe’ın kesintisiz, daha düşük gecikmeli davranışıyla karıştırmayın.
Prompt, Keywords, Languages ve Delay Transkripsiyonu Nasıl Etkiler?
Her iki model de isimler, sayılar, kısaltmalar, ürün terimleri, aksanlı konuşma, çok dilli ses ve kod değiştirme için tanımayı iyileştirebilecek bağlam kabul eder.
| Kontrol | Amaç | Üretim uyarısı |
|---|---|---|
| prompt | Kaydı, konuşmacıyı, alanı veya beklenen konuyu anlatın | Aşırı spesifik bağlam transkripti taraflı hâle getirebilir |
| keywords | Özel isimleri, kısaltmaları, hesap formatlarını veya teknik terimleri verin | İpuçları zorunlu çıktı değildir; söylenmeyen terimler eklenebilir, test edin |
| languages | Bir veya daha fazla beklenen giriş dilini listeleyin | Desteklenmeyen veya hatalı biçimlendirilmiş kodlar reddedilir |
| delay | Daha erken canlı deltaları daha fazla akustik bağlamla değiş tokuş edin | gpt-live-transcribe için kullanılabilir; sabit ms varsaymayın, kıyaslayın |
Yeni modellerde languages, eski tekil language alanının yerini alır. Her ikisini birden göndermeyin. Her anahtar kelime tek satırda kalmalı ve <, >, carriage return veya line feed içeremez; geçersiz değerler isteğin veya oturum güncellemesinin reddedilmesine yol açar.
gpt-live-transcribe, minimal, low, medium, high ve xhigh delay ayarlarını destekler. Daha düşük ayarlar daha erken kısmi metni, daha yüksek ayarlar ise daha fazla ses bağlamını tercih eder ve transkripsiyon kalitesini iyileştirebilir. OpenAI her seviye için sabit gecikme vaat etmez; bu nedenle temsilî mikrofonlar, kodekler, ağlar, diller ve oturum uzunluklarında ilk delta süresi ve nihai transkript süresini ölçün.
OpenAI’nin Doğruluk Karşılaştırmaları Ne Gösteriyor?
OpenAI’nin yayın duyurusu, gpt-live-transcribe’ın iki çok dilli transkripsiyon testinde GPT-Realtime-Whisper-1’i geride bıraktığını bildiriyor. Ayrıca serbest biçimli bağlamın, Context Aware ASR değerlendirmesinde semantik doğruluğu artırdığını rapor ediyor.
| OpenAI değerlendirmesi | gpt-live-transcribe sonucu | Karşılaştırma | Bildirilen değişim |
|---|---|---|---|
| Context Aware ASR semantik doğruluk | Serbest bağlamla %44.6 | Bağlamsız %38.5 | +6.1 yüzde puanı |
| Common Voice, 22 dil, transkripsiyon hata oranı | %19.70 | GPT-Realtime-Whisper-1 için %20.33 | -0.63 puan; yaklaşık %3.1 göreli |
| Real-World Audio Recording, 9 dil, transkripsiyon hata oranı | %9.60 | GPT-Realtime-Whisper-1 için %11.65 | -2.05 puan; yaklaşık %17.6 göreli |
Savunulabilir sonuç sınırlıdır: yeni canlı model OpenAI’nin raporlanan testlerinde daha iyi performans gösterdi ve bağlam, raporlanan semantik doğruluk skorunu iyileştirdi. Bu satıcı raporları, her dil, telefon kodeği, mikrofon, delay ayarı, alan söz varlığı veya düzeltme politikası için aynı iyileşmeyi garanti etmez.
Whisper veya GPT-4o Transcribe’ı Ne Zaman Kullanmalısınız?
Yeni modellerin hiçbiri her konuşmadan metne iş akışının yerini almaz.
| Gereksinim | Önerilen rota |
|---|---|
| Genel tamamlanmış dosya transkripsiyonu | gpt-transcribe |
| Düşük gecikmeli canlı altyazı veya çağrı transkripsiyonu | gpt-live-transcribe |
| Tamamlanmış kayıtlarda konuşmacı etiketleri | gpt-4o-transcribe-diarize ve diarized_json |
| Kelime veya segment zaman damgaları | whisper-1 ve timestamp_granularities[] |
| İngilizce olmayan sesin İngilizceye çevirisi (tamamlanmış) | /v1/audio/translations ve whisper-1 |
Diyarişasyon için OpenAI, dosya Transcriptions API’sini gerektirir; konuşmacı etiketleme Realtime transkripsiyon oturumlarında desteklenmez. 30 saniyeden uzun kayıtlar için chunking_strategy değerini "auto" olarak yapılandırın veya bir ses etkinliği algılama yapılandırması kullanın.
Zaman damgası, altyazı, çeviri veya mevcut Whisper iş akışları için CometAPI’nin Whisper API kılavuzu ve Whisper-1 model sayfasına bakın. Başka bir OpenAI dosya transkripsiyon rotasını değerlendiren ekipler ayrıca GPT-4o Transcribe model sayfasını inceleyebilir.
Whisper’dan Nasıl Geçiş Yapmalısınız?
Model kimliğini değiştirmek yalnızca ilk adımdır. Üretim trafiğini taşımadan önce tüm iş akışını doğrulayın.
| Kontrol | Gerekli eylem | Atlarsanız risk |
|---|---|---|
| Rota seçimi | Tamamlanmış kayıtları gerçek anlamda canlı iş yüklerinden ayırın | Asenkron işler için canlı ücreti ödeme |
| Dil alanları | Yeni modeller için language yerine languages kullanın; ikisini birden asla göndermeyin | Reddedilen istekler veya oturumlar |
| Bağlam ipuçları | İsimler, sayılar, jargon ve gürültülü konuşmalar üzerinde prompt ve keywords’ü test edin | Taraflı veya eklenmiş terimler |
| Delay ayarı | Temsilî seste en az low, medium ve high’ı kıyaslayın | Verisiz hız veya doğruluk seçimi |
| Olay işleme | Delta ve tamamlandı olaylarını item_id ile uzlaştırın | Sıradışı veya üzerine yazılmış transkriptler |
| Özellik eşliği | Diyarişasyon, zaman damgası, güven, altyazı ve çeviri bağımlılıklarını envanterleyin | Aşağı akış alanlarının eksikliği |
| Maliyet telemetrisi | Ses dakikalarını, yeniden denemeleri, başarısız sonuçları, düzeltme süresini ve kabul oranını kaydedin | Liste fiyatını iş akışı maliyetiyle karıştırma |
| Yayın | Gölge test yapın, küçük bir trafik payını kanarya olarak deneyin ve bir geri dönüş saklayın | Hızlı geri dönüş olmadan geniş gerileme |
Bir GPT-Realtime-Whisper geçişi için ses formatını, tur algılama politikasını, test setini ve gecikme hedefini sabit tutun. Yayınlanan canlı fiyat değişmediğinden, kabul edilen transkript oranına, gecikme dağılımına, çıktı kararlılığına ve hattın geri kalanıyla uyumluluğa öncelik verin.
Geçiş Kılavuzu (Whisper / önceki modellerden)
OpenAI resmi bir cookbook sağlar: Whisper’dan GPT-Transcribe ve GPT-Live-Transcribe’a geçiş.
Yüksek seviyeli kurallar:
- Kayıtlı / yığın ses → mevcut /v1/audio/transcriptions uç noktasında gpt-transcribe’a geçin.
- Kesintisiz canlı ses → bir Realtime transkripsiyon oturumunda gpt-live-transcribe’a geçin.
- Commit edilmiş turdan sonra daha yüksek doğruluk → bir Realtime oturum içinde gpt-transcribe kullanın.
Minimal dosya geçiş örneği (Python):
Python
# Before (Whisper)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="whisper-1", file=audio, language="en", prompt="Support call about AC-42" )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="gpt-transcribe", file=audio, prompt="A customer support call about billing", extra_body={ "keywords": ["AC-42", "Premium Plus"], "languages": ["en", "fr"] }, response_format="json" # or stream=True for deltas )
Canlı geçiş notları:
- Aynı Realtime oturumu / WebSocket mimarisini koruyun.
- Model kimliğini değiştirin ve tekil language alanını languages dizisiyle değiştirin.
- İsteğe bağlı prompt, keywords ve delay ekleyin (örn. "low").
- Aynı delta/tamamlandı olaylarını işlemeye devam edin.
- Hem language hem de languages göndermeyin.
Geçişte önemli uyarılar:
- GPT-Transcribe/GPT-Live-Transcribe, kelime düzeyi zaman damgaları, SRT/VTT veya İngilizce çeviriyi whisper-1 ile aynı şekilde desteklemez. Bu özel ihtiyaçlar için Whisper’ı kullanmaya devam edin.
- Yanıt formatları farklıdır — text, verbose_json, srt veya vtt’nin aynı şekilde çalıştığını varsaymayın.
- Keywords tek satırlık sabitler olmalıdır (no <, >, CR veya LF) aksi hâlde istek reddedilir.
- Yalnızca yayınlanan WER sayılarına güvenmek yerine, temsilî üretim sesinde (aksanlar, gürültü, alan terimleri, kısa ifadeler) test edin.
Hızlı Öneri
- Yeni işler için varsayılan: Dosyalar/yığın için GPT-Transcribe, canlı akış için GPT-Live-Transcribe.
- Mevcut Whisper veya GPT-4o-Transcribe entegrasyonları çalışmaya devam eder, ancak artık önerilen başlangıç noktası değildir.
- Maliyet hassas yığın işler, GPT-Transcribe’a geçişten en çok fayda sağlar ($0.0045 vs $0.006).
En güncel ayrıntılar için resmi model sayfalarını ve OpenAI geliştirici sitesindeki transkripsiyon genel bakış kılavuzunu kontrol edin.
İki Modeli Üretim Sesinde Nasıl Değerlendirmelisiniz?
Yalnızca temiz demo klipleri yerine ürünü temsil eden lisanslı ses kullanın.
- Ana kullanım durumları, diller, cihazlar ve ses koşulları arasında en az 50 kayıt seçin.
- Aksanlar, kesintiler, arka plan gürültüsü, kod değiştirme, sayılar, tarihler, para birimi, e‑posta adresleri ve alan söz varlığını dahil edin.
- Tamamlanmış kayıtları bağlam ipuçlarıyla ve ipuçları olmadan
gpt-transcribeüzerinden çalıştırın. - Aynı canlı örnekleri üç farklı delay ayarında
gpt-live-transcribeile yeniden oynatın. - Formatları, tur sınırlarını, prompt’ları ve puanlama kurallarını koşular arasında tutarlı tutun.
- Transkripsiyon hatasını, alan terimi yakalama oranını, kısmi metin revizyonlarını, p50 ve p95 gecikmesini, hataları, yeniden denemeleri ve insan düzeltme süresini ölçün.
- Kabul edilen transkript başına maliyeti hesaplayın ve seçilen yönlendirme politikasını tam geçişten önce kanarya olarak deneyin.
Nihai tasarım bir modeli veya her ikisini de kullanabilir. Belirleyici metrik, tek başına yayınlanan dakika başı fiyat değil; kabul edilen üretim transkriptinin maliyeti ve güvenilirliği olmalıdır.
SSS
Hangi modeli kullanmalıyım: GPT-Transcribe mı GPT-Live-Transcribe mı?
Tamamlanmış kayıtlar ve asenkron işler için gpt-transcribe kullanın. Metin ses hâlâ akarken gelmek zorundaysa gpt-live-transcribe kullanın.
GPT-Transcribe ve GPT-Live-Transcribe ne kadara mal olur?
OpenAI, gpt-transcribe için ses dakikası başına $0.0045 ($0.27/saat) ve gpt-live-transcribe için dakikada $0.017 ($1.02/saat) listeler.
GPT-Live-Transcribe, GPT-Realtime-Whisper’dan daha mı doğru?
OpenAI’nin dokuz dilli Real-World Audio Recording kıyaslamasında raporlanan transkripsiyon hata oranı %11.65’ten %9.60’a düştü. Bu kıyaslamaya özgü sonucu kendi sesinizde doğrulayın.
GPT-Live-Transcribe diyarişasyon veya kelime zaman damgalarını destekliyor mu?
Hayır. Konuşmacı etiketleri, kelime düzeyi zaman damgaları veya güven puanları döndürmez. Bu alanlar gerektiğinde uyumlu bir dosya modeli veya yedek bir adım kullanın.
GPT-Realtime-Whisper’dan geçiş sadece model değişimiyle olur mu?
Hayır. Oturum yapılandırmasını, dil alanlarını, bağlam girdilerini, delay ayarlarını, olay sıralamasını, özellik bağımlılıklarını, gecikmeyi ve çıktı kalitesini üretim trafiğini taşımadan önce doğrulayın.
CometAPI ile Transkripsiyon Rotalarını Test Edin
Uygulamaya geçmeden önce, güncel model kullanılabilirliğini ve rota fiyatlandırmalarını CometAPI fiyatlandırma sayfasında kontrol edin ve OpenAI uyumlu istek kalıpları için CometAPI dokümantasyonunu kullanın. Testlerde kesin model kimliklerini sabitleyin ve yönlendirme kararının toplam iş akışı maliyetini yansıtması için ses süresini, delay seviyesini, ilk delta gecikmesini, nihai transkript gecikmesini, yeniden denemeleri ve kabul edilen transkript oranını kaydedin.
