GPT-6 Sol, GPT-6 Luna, and Claude Opus 5.5 are now live on CometAPI →
new/CometAPI araştırması

GPT-Transcribe vs GPT-Live-Transcribe: API & Fiyatlandırma

Below is a practical, side‑by‑side comparison to help you choose and plan migrations. Because pricing and limits can change, confirm the latest details in the official pricing and model docs before implementation. 1) Pricing - GPT‑Transcribe (batch/offline ASR) - Typical billing unit: per audio minute (often rounded to the nearest second or 15‑sec block). - Usually lower unit cost than live services. - Costs scale with duration and optional add‑ons (e.g., timestamps, diarization) if supported. - GPT‑Live‑Transcribe (real‑time/streaming) - Typical billing unit: per connection minute or per audio minute streamed; sometimes with session/connection fees. - Usually higher unit cost due to low‑latency compute and interactive infrastructure. - Watch for minimum charges per session, concurrency limits, and overage rates. 2) Latency - GPT‑Transcribe - Optimized for accuracy and throughput over latency. - End‑to‑end time depends on file length; you receive results after processing completes or chunk‑by‑chunk if you implement client‑side segmentation. - GPT‑Live‑Transcribe - Optimized for low latency and interactivity. - Partial (interim) transcripts within a few hundred milliseconds to ~1s; finalization depends on endpointing/VAD and model stabilization settings. 3) API workflows - GPT‑Transcribe - REST‑style: upload or reference an audio file/URL and request a transcription job. - Options may include language hints, punctuation, timestamps, diarization, formatting, and domain biasing prompts. - Response: a single JSON with full transcript and optional per‑segment timings, or polling for job status until complete. - GPT‑Live‑Transcribe - WebSocket/gRPC/Realtime API: open a session, stream audio frames (e.g., 16 kHz PCM), receive events for interim and final transcripts. - Controls for endpointing, partial stability, buffering, and backpressure. - Requires handling disconnections, heartbeats/pings, and session lifecycle. 4) Context controls and biasing - GPT‑Transcribe - Static or per‑job context: phrase hints/hotwords, domain dictionaries, language hints. - Some models support formatting rules (e.g., casing, numerals), profanity filtering, and timestamp granularity. - GPT‑Live‑Transcribe - Dynamic, in‑session biasing: push/update hotword lists or context sets during a call. - Tunables for stability vs. speed, endpointing thresholds, interim/final result cadence. - Useful for IVR/agent‑assist, where domain terms change mid‑conversation. 5) Limitations and constraints - GPT‑Transcribe - Throughput vs. quota: file size, max duration, and concurrent job limits. - Accuracy varies with accent, noise, domain jargon; diarization and word‑level timing quality can vary. - Latency not suitable for live captioning; retries/backoff needed for large batch workloads. - GPT‑Live‑Transcribe - Sensitive to network jitter/packet loss; requires careful buffering and reconnection strategies. - Possible “partial churn” (interim text revisions) before finalization; tune stability settings. - Session length and concurrency limits; CPU/energy trade‑offs on the client for encoding and VAD. - May have fewer advanced formatting/diarization features than batch models, depending on release. 6) Migration steps A) From Whisper/GPT‑Transcribe (batch) to GPT‑Live‑Transcribe (real‑time) - Assess requirements - Define target end‑to‑end latency, acceptable word error rate (WER), and stability thresholds. - Identify whether you need diarization, timestamps, or just live captions. - Session and transport - Implement Realtime API (WebSocket/gRPC). - Stream audio as small frames (e.g., 20–60 ms), standardize on 16 kHz mono PCM unless the API supports compressed codecs. - Add heartbeats, reconnection, and backpressure handling. - Context and tuning - Build hotword/context injection endpoints for dynamic updates (e.g., customer names, SKUs). - Tune endpointing/VAD and partial stabilization parameters for your UX. - UX and product behavior - Design for interim results with visual indicators; update text when finals arrive. - Handle mute/unmute, barge‑in, and silence detection. - Observability and cost - Add per‑session metrics: latency, partial churn rate, finalization delay, WER by domain term. - Monitor billed minutes per connection and enforce session timeouts. B) From Whisper/other ASR to GPT‑Transcribe (batch) - File pipeline - Normalize audio (sample rate, channels, loudness) and split long files into manageable chunks if needed. - Implement robust upload, storage, and a job queue with retry/backoff. - Context and formatting - Provide language hints, hotwords, and formatting preferences. - Enable timestamps/diarization only when needed to control cost and speed. - QA and evaluation - Benchmark on your domain audio (accents, noise profiles) and measure WER, punctuation, numerals, special terms. - Compare chunk sizes and parallelization strategies for throughput vs. cost. C) From GPT‑Transcribe (batch) to GPT‑Transcribe (newer batch model) - Compatibility - Map parameters (language hints, timestamps, diarization) to the new model’s flags. - Validate output JSON schema changes (segment fields, confidence scores). - Cost/perf validation - Run A/B tests on typical and worst‑case audio; check accuracy and runtime vs. cost. - Verify rate limits and concurrent job caps. D) Cross‑cutting recommendations - Error handling - Implement idempotent job creation, resumable uploads, and exponential backoff. - Distinguish transient vs. permanent errors; add DLQ for failed jobs. - Security and privacy - Use short‑lived credentials/tokens; encrypt audio at rest and in transit. - If using client‑side streaming, ensure token rotation and domain pinning/TLS. - Compliance and data handling - Confirm data retention defaults and opt‑out options if required. - Cost governance - Enforce per‑project quotas, alerting, and budget guards (e.g., max session length, max parallel jobs). 7) When to choose which - Choose GPT‑Transcribe if you need: - Lowest unit cost, high throughput, full‑file accuracy, detailed timestamps/diarization, or offline processing. - Choose GPT‑Live‑Transcribe if you need: - Real‑time captions, voice interactivity, agent assist, or rapid user feedback with partials/finals. To finalize your plan, check: - Official pricing page for exact per‑minute or per‑session rates, rounding rules, and minimums. - API docs for supported features (timestamps, diarization), request/response schemas, and limits (file size, session length, concurrency). - Release notes for recent model updates that may change accuracy or latency characteristics.

CometAPI
Mia MarenAI model ve API araştırma ekibi
Güncellendi Sep 3, 2026 12 dk okuma
GPT-Transcribe vs GPT-Live-Transcribe: API & Fiyatlandırma
Bu kalıbı kullanın

İlk API çağrısını yapın.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

GPT-Transcribe ve GPT-Live-Transcribe: Fiyatlandırma, API Farkları ve Geçiş

Kısaca

Tamamlanmış kayıtlar için dakikada $0.0045 ile gpt-transcribe, mikrofonlar, aramalar veya canlı medya akışları için dakikada $0.017 ile gpt-live-transcribe kullanın. OpenAI, yayınladığı karşılaştırmalarda canlı modelin GPT-Realtime-Whisper’dan daha düşük transkripsiyon hatasına sahip olduğunu bildiriyor, ancak doğru rota metnin ne zaman görünmesi gerektiğine, hangi çıktı alanlarına ihtiyaç duyduğunuza ve her iki modelin üretim sesinizdeki performansına bağlıdır.

Bir Bakışta GPT-Transcribe ve GPT-Live-Transcribe

Yalnızca ses kaydı tamamlandıktan sonra transkripsiyona ihtiyacınız varsa gpt-transcribe kullanın. Uygulamanız ses hâlâ gelirken metne ihtiyaç duyuyorsa gpt-live-transcribe kullanın. En büyük fark yalnızca fiyat değil; transkripsiyonun ne zaman başladığı ve uygulamanızın hangi tür API iş akışını desteklemesi gerektiğidir.

Öğegpt-transcribegpt-live-transcribe
En iyi kullanımYüklenen kayıtlar, sınırlandırılmış ses istekleri, asenkron işler ve commit edilen Realtime turlarıMikrofonlar, aramalar, toplantılar ve canlı medya akışları
Yayınlanan fiyatDakika başına $0.0045 sesDakika başına $0.017 ses
Ses saati başına fiyat$0.27$1.02
API / Uç noktalar/v1/audio/transcriptions; isteğe bağlı commit’li Realtime iş akışıRealtime transkripsiyon oturumları (v1/realtime/transcription_sessions veya benzeri)
BağlantıDosya yükleme; dosya işlenirken isteğe bağlı akışlı yanıtSunucu hatları için WebSocket veya tarayıcı sesi için WebRTC
Transkripsiyon başlangıcıBir dosya gönderildikten veya bir ses turu commit edildikten sonraSes gelirken
Kısmi transkript çıktısıEvet; dosya akışı veya commit’li tur akışıylaEvet; canlı konuşma gelirken
Bağlam kontrolleriprompt, keywords, languagesprompt, keywords, languages, delay
Tespit edilen dil çıktısıEvet, model güvenilir bir tahmin yapabildiğindeHayır
Önemli sınırlamalar25 MB yükleme sınırı; zaman damgaları, diyarişasyon veya çeviri için başka rotalar gerekirKelime düzeyi zaman damgası, konuşmacı etiketleri veya güven puanları yok

gpt-transcribe, tamamlanmış bir dosyayı veya commit edilmiş bir ses turunu işlerken kısmi transkript güncellemeleri döndürebilse de kesintisiz canlı yayın rotası değildir. Canlı altyazı, aramalar veya mikrofon girdisi için gpt-live-transcribe daha iyi bir seçimdir.

Sağlayıcılar arası daha geniş bir karşılaştırma için CometAPI’nin 2026’nın En İyi 6 Konuşmadan Metne API’si sayfasına bakın.

GPT-Transcribe ve GPT-Live-Transcribe Nedir?

OpenAI, 29 Temmuz 2026’da gpt-transcribe ve gpt-live-transcribe modellerini tanıttı. gpt-transcribe, tamamlanmış kayıtları, akışlı dosya transkriptlerini ve commit edilmiş Realtime turlarını işlerken, gpt-live-transcribe mikrofonlar, aramalar veya canlı medya akışlarından gelen sesi işlerken düşük gecikmeli transkript güncellemeleri döndürür.

Bu iki model, genel dosya ve canlı transkripsiyon için yeni varsayılan rotalar sunar; ancak zaman damgaları, çeviri, altyazı ve konuşmacı diyarişasyonu için uzmanlaşmış Whisper ve GPT-4o transkripsiyon iş akışları hâlâ gereklidir.

GPT-Live-Transcribe Daha Yüksek Fiyata Ne Zaman Değer?

OpenAI’nin API fiyatlandırma sayfası, gpt-transcribe için dakika başına $0.0045, gpt-live-transcribe için dakika başına $0.017 listeler. Canlı rota bu nedenle ses dakikası başına yaklaşık 3.8 kat daha pahalıdır.

Aylık ses hacmigpt-transcribegpt-live-transcribeEk canlı maliyet
100 saat$27$102$75
1.000 saat$270$1,020$750
10.000 saat$2,700$10,200$7,500

Bu transkripsiyon maliyet tahminleri yalnızca OpenAI’nin yayınladığı temel oranları kullanır: ses saatleri × 60 × dakika başına fiyat. Depolama, ağ taşıma, yeniden denemeler, uygulama barındırma, son işlem, insan düzeltmesi ve geri dönüş sağlayıcı maliyetleri hariçtir.

Ürününüzde anında altyazı, temsilci yardımı, moderasyon veya gerçek zamanlı etkileşim gereksinimi varsa gpt-live-transcribe seçin. Transkript yalnızca toplantı, arama, röportaj veya medya yüklemesi tamamlandıktan sonra gerekiyorsa gpt-transcribe seçin. İki rotalı bir mimari, kullanıcı deneyimi için canlı transkripsiyonu, çağrı sonrası işlem veya geri doldurmalar için dosya transkripsiyonunu kullanabilir.

OpenAI şu anda GPT-Realtime-Whisper ve gpt-live-transcribe için aynı dakikada $0.017 temel fiyatı listeler. Bu canlı rotalar arasında geçişi, yalnızca liste fiyatına değil; kabul edilen transkript kalitesi, gecikme, olay işleme ve operasyonel uyumluluk üzerinden değerlendirin.

GPT-Transcribe ve GPT-Live-Transcribe API’leri Nasıl Farklı?

Temel fark, sesin sisteme nasıl girdiği ve transkript olaylarının ne zaman başladığıdır. gpt-transcribe, tamamlanmış dosyaları veya commit edilmiş ses turlarını kabul ederken, gpt-live-transcribe bir Realtime bağlantıyı sürdürür ve ses hâlâ gelirken transkript güncellemeleri yayar.

Tamamlanmış ses için GPT-Transcribe kullanın

Tamamlanmış bir kayıt için dosyayı /v1/audio/transcriptions adresine gönderin. OpenAI’nin dosya transkripsiyon kılavuzu, mp3, mp4, mpeg, mpga, m4a, wav veya webm formatında 25 MB’a kadar dosyaları kabul eder.

from openai import OpenAI

client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
    transcript = client.audio.transcriptions.create(
        model="gpt-transcribe",
        file=audio_file,
        prompt="A support call about a premium plan and account AC-42.",
        extra_body={
            "keywords": ["premium plan", "AC-42", "billing"],
            "languages": ["en"],
        },
    )
print(transcript.text)

Yüklenen kayıt işlenirken transkript delta olaylarını almak için stream=True ayarlayın. Bu, görünür metin için beklemeyi azaltır, ancak dosya uç noktasını canlı mikrofon alımına dönüştürmez.

Gelen ses için GPT-Live-Transcribe kullanın

type: "transcription" ile bir Realtime oturumu oluşturun ve gpt-live-transcribe seçin. Sunucu tarafı medya hattı için WebSocket, tarayıcı sesi için WebRTC kullanın.

{
  "type": "session.update",
  "session": {
    "type": "transcription",
    "audio": {
      "input": {
        "format": {
          "type": "audio/pcm",
          "rate": 24000
        },
        "transcription": {
          "model": "gpt-live-transcribe",
          "prompt": "A support call about a premium plan and account AC-42.",
          "keywords": ["premium plan", "AC-42", "billing"],
          "languages": ["en"],
          "delay": "low"
        },
        "turn_detection": null
      }
    }
  }
}

Ses parçalarını input_audio_buffer.append ile ekleyin. Uygulama, input_audio_buffer.commit ile turları commit edebilir veya sunucu tarafı ses etkinliği algılamasını yapılandırabilir.

Realtime transkripsiyon kılavuzu, conversation.item.input_audio_transcription.delta üzerinden artımlı metin döndürür ve commit edilen öğe için conversation.item.input_audio_transcription.completed izler. Farklı turlardan gelen tamamlanma olaylarının sırayla geleceği garanti edilmez, bu nedenle geliş sırasına değil item_id ile uzlaştırın.

Anında metin gerekmiyorsa commit’li tur rotasını kullanın

gpt-transcribe aynı zamanda WebSocket üzerinden bir Realtime transkripsiyon oturumunda da çalışabilir. Transkripsiyon bir ses turu commit edildikten sonra başlar, model daha önce transkribe edilmiş turları bağlam olarak kullanabilir ve tamamlanmış olay tespit edilen dilleri içerebilir.

Bu commit’li tur rotası, metin konuşmacı hâlâ konuşurken gösterilmekten ziyade, tur bazlı akış veya dil tespitinin daha önemli olduğu durumlarda yararlıdır. Bunu gpt-live-transcribe’ın kesintisiz, daha düşük gecikmeli davranışıyla karıştırmayın.

Prompt, Keywords, Languages ve Delay Transkripsiyonu Nasıl Etkiler?

Her iki model de isimler, sayılar, kısaltmalar, ürün terimleri, aksanlı konuşma, çok dilli ses ve kod değiştirme için tanımayı iyileştirebilecek bağlam kabul eder.

KontrolAmaçÜretim uyarısı
promptKaydı, konuşmacıyı, alanı veya beklenen konuyu anlatınAşırı spesifik bağlam transkripti taraflı hâle getirebilir
keywordsÖzel isimleri, kısaltmaları, hesap formatlarını veya teknik terimleri verinİpuçları zorunlu çıktı değildir; söylenmeyen terimler eklenebilir, test edin
languagesBir veya daha fazla beklenen giriş dilini listeleyinDesteklenmeyen veya hatalı biçimlendirilmiş kodlar reddedilir
delayDaha erken canlı deltaları daha fazla akustik bağlamla değiş tokuş edingpt-live-transcribe için kullanılabilir; sabit ms varsaymayın, kıyaslayın

Yeni modellerde languages, eski tekil language alanının yerini alır. Her ikisini birden göndermeyin. Her anahtar kelime tek satırda kalmalı ve <, >, carriage return veya line feed içeremez; geçersiz değerler isteğin veya oturum güncellemesinin reddedilmesine yol açar.

gpt-live-transcribe, minimal, low, medium, high ve xhigh delay ayarlarını destekler. Daha düşük ayarlar daha erken kısmi metni, daha yüksek ayarlar ise daha fazla ses bağlamını tercih eder ve transkripsiyon kalitesini iyileştirebilir. OpenAI her seviye için sabit gecikme vaat etmez; bu nedenle temsilî mikrofonlar, kodekler, ağlar, diller ve oturum uzunluklarında ilk delta süresi ve nihai transkript süresini ölçün.

OpenAI’nin Doğruluk Karşılaştırmaları Ne Gösteriyor?

OpenAI’nin yayın duyurusu, gpt-live-transcribe’ın iki çok dilli transkripsiyon testinde GPT-Realtime-Whisper-1’i geride bıraktığını bildiriyor. Ayrıca serbest biçimli bağlamın, Context Aware ASR değerlendirmesinde semantik doğruluğu artırdığını rapor ediyor.

OpenAI değerlendirmesigpt-live-transcribe sonucuKarşılaştırmaBildirilen değişim
Context Aware ASR semantik doğrulukSerbest bağlamla %44.6Bağlamsız %38.5+6.1 yüzde puanı
Common Voice, 22 dil, transkripsiyon hata oranı%19.70GPT-Realtime-Whisper-1 için %20.33-0.63 puan; yaklaşık %3.1 göreli
Real-World Audio Recording, 9 dil, transkripsiyon hata oranı%9.60GPT-Realtime-Whisper-1 için %11.65-2.05 puan; yaklaşık %17.6 göreli

Savunulabilir sonuç sınırlıdır: yeni canlı model OpenAI’nin raporlanan testlerinde daha iyi performans gösterdi ve bağlam, raporlanan semantik doğruluk skorunu iyileştirdi. Bu satıcı raporları, her dil, telefon kodeği, mikrofon, delay ayarı, alan söz varlığı veya düzeltme politikası için aynı iyileşmeyi garanti etmez.

Whisper veya GPT-4o Transcribe’ı Ne Zaman Kullanmalısınız?

Yeni modellerin hiçbiri her konuşmadan metne iş akışının yerini almaz.

GereksinimÖnerilen rota
Genel tamamlanmış dosya transkripsiyonugpt-transcribe
Düşük gecikmeli canlı altyazı veya çağrı transkripsiyonugpt-live-transcribe
Tamamlanmış kayıtlarda konuşmacı etiketlerigpt-4o-transcribe-diarize ve diarized_json
Kelime veya segment zaman damgalarıwhisper-1 ve timestamp_granularities[]
İngilizce olmayan sesin İngilizceye çevirisi (tamamlanmış)/v1/audio/translations ve whisper-1

Diyarişasyon için OpenAI, dosya Transcriptions API’sini gerektirir; konuşmacı etiketleme Realtime transkripsiyon oturumlarında desteklenmez. 30 saniyeden uzun kayıtlar için chunking_strategy değerini "auto" olarak yapılandırın veya bir ses etkinliği algılama yapılandırması kullanın.

Zaman damgası, altyazı, çeviri veya mevcut Whisper iş akışları için CometAPI’nin Whisper API kılavuzu ve Whisper-1 model sayfasına bakın. Başka bir OpenAI dosya transkripsiyon rotasını değerlendiren ekipler ayrıca GPT-4o Transcribe model sayfasını inceleyebilir.

Whisper’dan Nasıl Geçiş Yapmalısınız?

Model kimliğini değiştirmek yalnızca ilk adımdır. Üretim trafiğini taşımadan önce tüm iş akışını doğrulayın.

KontrolGerekli eylemAtlarsanız risk
Rota seçimiTamamlanmış kayıtları gerçek anlamda canlı iş yüklerinden ayırınAsenkron işler için canlı ücreti ödeme
Dil alanlarıYeni modeller için language yerine languages kullanın; ikisini birden asla göndermeyinReddedilen istekler veya oturumlar
Bağlam ipuçlarıİsimler, sayılar, jargon ve gürültülü konuşmalar üzerinde prompt ve keywords’ü test edinTaraflı veya eklenmiş terimler
Delay ayarıTemsilî seste en az low, medium ve high’ı kıyaslayınVerisiz hız veya doğruluk seçimi
Olay işlemeDelta ve tamamlandı olaylarını item_id ile uzlaştırınSıradışı veya üzerine yazılmış transkriptler
Özellik eşliğiDiyarişasyon, zaman damgası, güven, altyazı ve çeviri bağımlılıklarını envanterleyinAşağı akış alanlarının eksikliği
Maliyet telemetrisiSes dakikalarını, yeniden denemeleri, başarısız sonuçları, düzeltme süresini ve kabul oranını kaydedinListe fiyatını iş akışı maliyetiyle karıştırma
YayınGölge test yapın, küçük bir trafik payını kanarya olarak deneyin ve bir geri dönüş saklayınHızlı geri dönüş olmadan geniş gerileme

Bir GPT-Realtime-Whisper geçişi için ses formatını, tur algılama politikasını, test setini ve gecikme hedefini sabit tutun. Yayınlanan canlı fiyat değişmediğinden, kabul edilen transkript oranına, gecikme dağılımına, çıktı kararlılığına ve hattın geri kalanıyla uyumluluğa öncelik verin.

Geçiş Kılavuzu (Whisper / önceki modellerden)

OpenAI resmi bir cookbook sağlar: Whisper’dan GPT-Transcribe ve GPT-Live-Transcribe’a geçiş.

Yüksek seviyeli kurallar:

  1. Kayıtlı / yığın ses → mevcut /v1/audio/transcriptions uç noktasında gpt-transcribe’a geçin.
  2. Kesintisiz canlı ses → bir Realtime transkripsiyon oturumunda gpt-live-transcribe’a geçin.
  3. Commit edilmiş turdan sonra daha yüksek doğruluk → bir Realtime oturum içinde gpt-transcribe kullanın.

Minimal dosya geçiş örneği (Python):

Python

# Before (Whisper)with open("meeting.wav", "rb") as audio:    result = client.audio.transcriptions.create(        model="whisper-1",        file=audio,        language="en",        prompt="Support call about AC-42"    )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio:    result = client.audio.transcriptions.create(        model="gpt-transcribe",        file=audio,        prompt="A customer support call about billing",        extra_body={            "keywords": ["AC-42", "Premium Plus"],            "languages": ["en", "fr"]        },        response_format="json"  # or stream=True for deltas    )

Canlı geçiş notları:

  • Aynı Realtime oturumu / WebSocket mimarisini koruyun.
  • Model kimliğini değiştirin ve tekil language alanını languages dizisiyle değiştirin.
  • İsteğe bağlı prompt, keywords ve delay ekleyin (örn. "low").
  • Aynı delta/tamamlandı olaylarını işlemeye devam edin.
  • Hem language hem de languages göndermeyin.

Geçişte önemli uyarılar:

  • GPT-Transcribe/GPT-Live-Transcribe, kelime düzeyi zaman damgaları, SRT/VTT veya İngilizce çeviriyi whisper-1 ile aynı şekilde desteklemez. Bu özel ihtiyaçlar için Whisper’ı kullanmaya devam edin.
  • Yanıt formatları farklıdır — text, verbose_json, srt veya vtt’nin aynı şekilde çalıştığını varsaymayın.
  • Keywords tek satırlık sabitler olmalıdır (no <, >, CR veya LF) aksi hâlde istek reddedilir.
  • Yalnızca yayınlanan WER sayılarına güvenmek yerine, temsilî üretim sesinde (aksanlar, gürültü, alan terimleri, kısa ifadeler) test edin.

Hızlı Öneri

  • Yeni işler için varsayılan: Dosyalar/yığın için GPT-Transcribe, canlı akış için GPT-Live-Transcribe.
  • Mevcut Whisper veya GPT-4o-Transcribe entegrasyonları çalışmaya devam eder, ancak artık önerilen başlangıç noktası değildir.
  • Maliyet hassas yığın işler, GPT-Transcribe’a geçişten en çok fayda sağlar ($0.0045 vs $0.006).

En güncel ayrıntılar için resmi model sayfalarını ve OpenAI geliştirici sitesindeki transkripsiyon genel bakış kılavuzunu kontrol edin.

İki Modeli Üretim Sesinde Nasıl Değerlendirmelisiniz?

Yalnızca temiz demo klipleri yerine ürünü temsil eden lisanslı ses kullanın.

  1. Ana kullanım durumları, diller, cihazlar ve ses koşulları arasında en az 50 kayıt seçin.
  2. Aksanlar, kesintiler, arka plan gürültüsü, kod değiştirme, sayılar, tarihler, para birimi, e‑posta adresleri ve alan söz varlığını dahil edin.
  3. Tamamlanmış kayıtları bağlam ipuçlarıyla ve ipuçları olmadan gpt-transcribe üzerinden çalıştırın.
  4. Aynı canlı örnekleri üç farklı delay ayarında gpt-live-transcribe ile yeniden oynatın.
  5. Formatları, tur sınırlarını, prompt’ları ve puanlama kurallarını koşular arasında tutarlı tutun.
  6. Transkripsiyon hatasını, alan terimi yakalama oranını, kısmi metin revizyonlarını, p50 ve p95 gecikmesini, hataları, yeniden denemeleri ve insan düzeltme süresini ölçün.
  7. Kabul edilen transkript başına maliyeti hesaplayın ve seçilen yönlendirme politikasını tam geçişten önce kanarya olarak deneyin.

Nihai tasarım bir modeli veya her ikisini de kullanabilir. Belirleyici metrik, tek başına yayınlanan dakika başı fiyat değil; kabul edilen üretim transkriptinin maliyeti ve güvenilirliği olmalıdır.

SSS

Hangi modeli kullanmalıyım: GPT-Transcribe mı GPT-Live-Transcribe mı?

Tamamlanmış kayıtlar ve asenkron işler için gpt-transcribe kullanın. Metin ses hâlâ akarken gelmek zorundaysa gpt-live-transcribe kullanın.

GPT-Transcribe ve GPT-Live-Transcribe ne kadara mal olur?

OpenAI, gpt-transcribe için ses dakikası başına $0.0045 ($0.27/saat) ve gpt-live-transcribe için dakikada $0.017 ($1.02/saat) listeler.

GPT-Live-Transcribe, GPT-Realtime-Whisper’dan daha mı doğru?

OpenAI’nin dokuz dilli Real-World Audio Recording kıyaslamasında raporlanan transkripsiyon hata oranı %11.65’ten %9.60’a düştü. Bu kıyaslamaya özgü sonucu kendi sesinizde doğrulayın.

GPT-Live-Transcribe diyarişasyon veya kelime zaman damgalarını destekliyor mu?

Hayır. Konuşmacı etiketleri, kelime düzeyi zaman damgaları veya güven puanları döndürmez. Bu alanlar gerektiğinde uyumlu bir dosya modeli veya yedek bir adım kullanın.

GPT-Realtime-Whisper’dan geçiş sadece model değişimiyle olur mu?

Hayır. Oturum yapılandırmasını, dil alanlarını, bağlam girdilerini, delay ayarlarını, olay sıralamasını, özellik bağımlılıklarını, gecikmeyi ve çıktı kalitesini üretim trafiğini taşımadan önce doğrulayın.

CometAPI ile Transkripsiyon Rotalarını Test Edin

Uygulamaya geçmeden önce, güncel model kullanılabilirliğini ve rota fiyatlandırmalarını CometAPI fiyatlandırma sayfasında kontrol edin ve OpenAI uyumlu istek kalıpları için CometAPI dokümantasyonunu kullanın. Testlerde kesin model kimliklerini sabitleyin ve yönlendirme kararının toplam iş akışı maliyetini yansıtması için ses süresini, delay seviyesini, ilk delta gecikmesini, nihai transkript gecikmesini, yeniden denemeleri ve kabul edilen transkript oranını kaydedin.

Öğrenmeye devam et

Bu makaleyi sonraki karara bağlayın.

Tüm konuları gör
Yayınlanma tarihi Jul 31, 2026
Son güncelleme Sep 3, 2026
100 görüntülenme
Netlik, kaynak ataması ve güncel API terminolojisi açısından gözden geçirildi.

Yapay zeka geliştirme maliyetlerinizi %20 azaltmaya hazır mısınız?

Dakikalar içinde ücretsiz başlayın. Ücretsiz deneme kredileri dahildir. Kredi kartı gerekmez.

Devamını Oku