GPT-5.6 Luna price down 80%, Terra down 20% →

GPT-Transcribe vs GPT-Live-Transcribe: API & Harga

CometAPI
Mia MarenJul 31, 2026
GPT-Transcribe vs GPT-Live-Transcribe: API & Harga

GPT-Transcribe vs GPT-Live-Transcribe: Harga, Perbedaan API, dan Migrasi

TL;DR

Gunakan gpt-transcribe untuk rekaman yang sudah selesai dengan harga $0.0045 per menit audio dan gpt-live-transcribe untuk mikrofon, panggilan, atau streaming media live dengan harga $0.017 per menit. OpenAI melaporkan kesalahan transkripsi yang lebih rendah untuk model live dibanding GPT-Realtime-Whisper pada tolok ukurnya, tetapi jalur yang tepat bergantung pada kapan teks harus muncul, field output yang Anda butuhkan, dan performa kedua model pada audio produksi Anda.

GPT-Transcribe vs GPT-Live-Transcribe Sekilas

Jika Anda hanya membutuhkan transkripsi setelah audio direkam, gunakan gpt-transcribe. Jika aplikasi Anda membutuhkan teks saat audio masih masuk, gunakan gpt-live-transcribe. Perbedaan terbesar bukan hanya harga, tetapi kapan transkripsi dimulai dan jenis alur kerja API yang harus didukung aplikasi Anda.

Itemgpt-transcribegpt-live-transcribe
Terbaik untukRekaman yang diunggah, permintaan audio berbatas, job asinkron, dan giliran Realtime yang dikomitMikrofon, panggilan, rapat, dan streaming media live
Harga yang dipublikasikan$0.0045 per menit audio$0.017 per menit audio
Harga per jam audio$0.27$1.02
API / Endpoint/v1/audio/transcriptions; alur kerja Realtime komit giliran opsionalSesi transkripsi Realtime (v1/realtime/transcription_sessions atau serupa)
KoneksiUnggah file; respons streaming opsional saat file diprosesWebSocket untuk pipeline server atau WebRTC untuk audio browser
Kapan transkripsi dimulaiSetelah file dikirim atau giliran audio dikomitSaat audio sedang masuk
Keluaran transkrip parsialYa, dengan streaming file atau streaming komit giliranYa, saat ucapan live masuk
Kontrol konteksprompt, keywords, languagesprompt, keywords, languages, delay
Keluaran bahasa terdeteksiYa, ketika model dapat membuat prediksi yang andalTidak
Keterbatasan pentingBatas unggahan 25 MB; rute lain diperlukan untuk timestamp, diarization, atau terjemahanTidak ada timestamp tingkat kata, label pembicara, atau skor kepercayaan

Meskipun gpt-transcribe dapat mengembalikan pembaruan transkrip parsial saat memproses file yang selesai atau giliran audio yang dikomit, ini bukan rute live streaming yang kontinu. Untuk caption live, panggilan, atau input mikrofon, gpt-live-transcribe adalah pilihan yang lebih baik.

Untuk perbandingan yang lebih luas di berbagai penyedia, lihat 6 API Ucapan-ke-Teks Terbaik pada 2026.

Apa itu GPT-Transcribe dan GPT-Live-Transcribe?

OpenAI memperkenalkan gpt-transcribe dan gpt-live-transcribe pada 29 Juli 2026. gpt-transcribe memproses rekaman yang sudah selesai, transkrip file yang di-stream, dan giliran Realtime yang dikomit, sementara gpt-live-transcribe mengembalikan pembaruan transkrip berlatensi rendah saat audio tiba dari mikrofon, panggilan, atau streaming media live.

Kedua model menyediakan rute default baru untuk transkripsi file umum dan live, tetapi alur kerja transkripsi Whisper dan GPT-4o yang terspesialisasi tetap diperlukan untuk timestamp, terjemahan, subtitle, dan diarisasi pembicara.

Kapan GPT-Live-Transcribe Layak dengan Harga Lebih Tinggi?

Halaman harga API OpenAI mencantumkan gpt-transcribe di $0.0045 per menit dan gpt-live-transcribe di $0.017 per menit. Oleh karena itu rute live berbiaya sekitar 3.8 kali lebih mahal per menit audio.

Volume audio bulanangpt-transcribegpt-live-transcribeBiaya tambahan untuk live
100 jam$27$102$75
1,000 jam$270$1,020$750
10,000 jam$2,700$10,200$7,500

Estimasi biaya transkripsi ini hanya menggunakan tarif dasar yang dipublikasikan OpenAI: jam audio × 60 × harga per menit. Tidak termasuk penyimpanan, transport jaringan, retry, hosting aplikasi, pascaproses, koreksi manusia, dan biaya penyedia cadangan.

Pilih gpt-live-transcribe ketika caption segera, bantuan agen, moderasi, atau interaksi real-time merupakan bagian dari kebutuhan produk. Pilih gpt-transcribe ketika transkrip hanya diperlukan setelah rapat, panggilan, wawancara, atau unggahan media selesai. Arsitektur dua rute dapat menggunakan transkripsi live untuk pengalaman pengguna dan transkripsi file untuk pemrosesan pascapanggilan atau backfill.

OpenAI saat ini mencantumkan GPT-Realtime-Whisper dan gpt-live-transcribe dengan tarif dasar yang sama $0.017 per menit. Evaluasi migrasi antara rute live ini berdasarkan kualitas transkrip yang diterima, latensi, penanganan event, dan kompatibilitas operasional, bukan hanya harga daftar.

Bagaimana Perbedaan API GPT-Transcribe dan GPT-Live-Transcribe?

Perbedaan utama adalah bagaimana audio masuk ke sistem dan kapan event transkrip dimulai. gpt-transcribe menerima file yang sudah selesai atau giliran audio yang dikomit, sementara gpt-live-transcribe mempertahankan koneksi Realtime dan memancarkan pembaruan transkrip saat audio masih masuk.

Gunakan GPT-Transcribe untuk audio yang sudah selesai

Untuk rekaman yang sudah selesai, kirim file ke /v1/audio/transcriptions. Panduan transkripsi file OpenAI menerima file hingga 25 MB dalam format mp3, mp4, mpeg, mpga, m4a, wav, atau webm.

from openai import OpenAI

client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
    transcript = client.audio.transcriptions.create(
        model="gpt-transcribe",
        file=audio_file,
        prompt="A support call about a premium plan and account AC-42.",
        extra_body={
            "keywords": ["premium plan", "AC-42", "billing"],
            "languages": ["en"],
        },
    )
print(transcript.text)

Setel stream=True untuk menerima event delta transkrip saat OpenAI memproses rekaman yang diunggah. Ini mengurangi waktu tunggu untuk teks yang terlihat, tetapi tidak mengubah endpoint file menjadi ingest mikrofon live.

Gunakan GPT-Live-Transcribe untuk audio yang masuk

Buat sesi Realtime dengan type: "transcription" dan pilih gpt-live-transcribe. Gunakan WebSocket untuk pipeline media sisi server atau WebRTC untuk audio browser.

{
  "type": "session.update",
  "session": {
    "type": "transcription",
    "audio": {
      "input": {
        "format": {
          "type": "audio/pcm",
          "rate": 24000
        },
        "transcription": {
          "model": "gpt-live-transcribe",
          "prompt": "A support call about a premium plan and account AC-42.",
          "keywords": ["premium plan", "AC-42", "billing"],
          "languages": ["en"],
          "delay": "low"
        },
        "turn_detection": null
      }
    }
  }
}

Tambahkan potongan audio dengan input_audio_buffer.append. Aplikasi dapat mengomit giliran dengan input_audio_buffer.commit atau mengonfigurasi deteksi aktivitas suara di server.

Panduan transkripsi Realtime mengembalikan teks inkremental melalui conversation.item.input_audio_transcription.delta, diikuti conversation.item.input_audio_transcription.completed untuk item yang dikomit. Event penyelesaian dari giliran yang berbeda tidak dijamin datang berurutan, jadi rekonsiliasi dengan item_id, bukan urutan kedatangan.

Gunakan rute komit giliran ketika teks segera tidak diperlukan

gpt-transcribe juga dapat berjalan dalam sesi transkripsi Realtime melalui WebSocket. Transkripsi dimulai setelah giliran audio dikomit, model dapat menggunakan giliran yang telah ditranskripsi sebelumnya sebagai konteks, dan event penyelesaian dapat menyertakan bahasa yang terdeteksi.

Rute komit giliran ini berguna ketika streaming berbasis giliran atau deteksi bahasa lebih penting daripada menampilkan teks saat penutur masih berbicara. Jangan disamakan dengan perilaku kontinu dan latensi lebih rendah dari gpt-live-transcribe.

Bagaimana Pengaruh Prompt, Keywords, Languages, dan Delay terhadap Transkripsi?

Kedua model menerima konteks yang dapat meningkatkan pengenalan nama, angka, akronim, istilah produk, aksen, audio multibahasa, dan alih kode.

KontrolTujuanPerhatian produksi
promptMendeskripsikan rekaman, penutur, domain, atau topik yang diharapkanKonteks yang terlalu spesifik dapat membiaskan transkrip
keywordsMenyediakan nama literal, akronim, format akun, atau istilah teknisPetunjuk bukan keluaran wajib; uji agar tidak menyisipkan istilah yang tidak diucapkan
languagesMendaftar satu atau lebih bahasa input yang diharapkanKode yang tidak didukung atau salah format menyebabkan penolakan
delayMenukar delta live yang lebih awal dengan konteks akustik yang lebih banyakTersedia untuk gpt-live-transcribe; benchmark alih-alih mengasumsikan milidetik tetap

Untuk model baru, languages menggantikan field tunggal lama language. Jangan kirim keduanya. Setiap keyword harus tetap satu baris dan tidak boleh berisi <, >, carriage return, atau line feed; nilai tidak valid menyebabkan permintaan atau pembaruan sesi ditolak.

gpt-live-transcribe mendukung pengaturan delay minimal, low, medium, high, dan xhigh. Pengaturan yang lebih rendah memprioritaskan teks parsial lebih awal, sementara pengaturan lebih tinggi memberikan lebih banyak konteks audio dan dapat meningkatkan kualitas transkripsi. OpenAI tidak menjanjikan latensi tetap untuk setiap level, jadi ukur waktu hingga delta pertama dan waktu hingga transkrip final pada mikrofon, codec, jaringan, bahasa, dan durasi sesi yang representatif.

Apa yang Ditunjukkan Tolok Ukur Akurasi OpenAI?

Pengumuman peluncuran OpenAI melaporkan bahwa gpt-live-transcribe mengungguli GPT-Realtime-Whisper-1 pada dua uji transkripsi multibahasa. Juga dilaporkan bahwa konteks bebas meningkatkan akurasi semantik pada evaluasi Context Aware ASR.

Evaluasi OpenAIHasil gpt-live-transcribePerbandinganPerubahan yang dilaporkan
Akurasi semantik Context Aware ASR44.6% dengan konteks bebas38.5% tanpa konteks+6.1 poin persentase
Common Voice, 22 bahasa, tingkat kesalahan transkripsi19.70%20.33% untuk GPT-Realtime-Whisper-1-0.63 poin; sekitar 3.1% relatif
Real-World Audio Recording, 9 bahasa, tingkat kesalahan transkripsi9.60%11.65% untuk GPT-Realtime-Whisper-1-2.05 poin; sekitar 17.6% relatif

Kesimpulan yang dapat dipertahankan bersifat sempit: model live baru tampil lebih baik pada uji yang dilaporkan OpenAI, dan konteks meningkatkan skor akurasi semantik yang dilaporkan. Hasil yang dilaporkan vendor ini tidak menjamin peningkatan yang sama untuk setiap bahasa, codec telepon, mikrofon, pengaturan delay, kosakata domain, atau kebijakan koreksi.

Kapan Anda Harus Menggunakan Whisper atau GPT-4o Transcribe?

Tidak ada model baru yang menggantikan setiap alur kerja ucapan-ke-teks.

KebutuhanRute yang direkomendasikan
Transkripsi file yang sudah selesai secara umumgpt-transcribe
Caption live berlatensi rendah atau transkripsi panggilangpt-live-transcribe
Label pembicara untuk rekaman yang sudah selesaigpt-4o-transcribe-diarize dengan diarized_json
Timestamp kata atau segmenwhisper-1 dengan timestamp_granularities[]
Terjemahan audio non-Inggris yang selesai ke bahasa Inggris/v1/audio/translations dengan whisper-1

Untuk diarisasi, OpenAI mengharuskan API Transcriptions file; pelabelan pembicara tidak didukung di sesi transkripsi Realtime. Untuk rekaman lebih dari 30 detik, konfigurasikan chunking_strategy sebagai "auto" atau gunakan konfigurasi deteksi aktivitas suara.

Untuk timestamp, subtitle, terjemahan, atau alur kerja Whisper yang ada, lihat panduan API Whisper dari CometAPI dan halaman model Whisper-1. Tim yang mengevaluasi rute transkripsi file OpenAI lainnya juga dapat meninjau halaman model GPT-4o Transcribe.

Bagaimana Cara Migrasi dari Whisper?

Mengganti ID model hanyalah langkah pertama. Validasi alur kerja lengkap sebelum mengalihkan trafik produksi.

PemeriksaanTindakan yang diperlukanRisiko jika dilewati
Pemilihan rutePisahkan rekaman yang sudah selesai dari beban kerja yang benar-benar liveMembayar tarif live untuk job asinkron
Field bahasaGanti language dengan languages untuk model baru; jangan pernah mengirim keduanyaPermintaan atau sesi ditolak
Petunjuk konteksUji prompt dan keywords pada nama, angka, jargon, dan ucapan berisikIstilah yang bias atau tersisip tanpa diucapkan
Pengaturan delayBenchmark setidaknya low, medium, dan high pada audio representatifMemilih kecepatan atau akurasi tanpa data
Penanganan eventRekonsiliasi delta dan event selesai dengan item_idTranskrip tidak berurutan atau tertimpa
Paritas fiturInventarisasi dependensi diarization, timestamp, kepercayaan, subtitle, dan terjemahanField hilang di hilir
Telemetri biayaLog menit audio, retry, hasil gagal, waktu koreksi, dan keluaran yang diterimaMengira harga daftar sama dengan biaya alur
RolloutShadow test, canary sebagian kecil trafik, dan pertahankan fallbackRegresi luas tanpa rollback cepat

Untuk migrasi GPT-Realtime-Whisper, pertahankan format audio, kebijakan deteksi giliran, set uji, dan target latensi tetap. Karena harga live yang dipublikasikan tidak berubah, prioritaskan tingkat transkrip yang diterima, distribusi latensi, stabilitas output, dan kompatibilitas dengan sisa pipeline.

Panduan Migrasi (dari Whisper / model sebelumnya)

OpenAI menyediakan cookbook resmi: Migrasi dari Whisper ke GPT-Transcribe dan GPT-Live-Transcribe.

Aturan tingkat tinggi:

  1. Audio rekaman / batch → beralih ke gpt-transcribe pada endpoint /v1/audio/transcriptions yang ada.
  2. Audio live kontinu → beralih ke gpt-live-transcribe dalam sesi transkripsi Realtime.
  3. Akurasi lebih tinggi setelah giliran dikomit → gunakan gpt-transcribe di dalam sesi Realtime.

Contoh migrasi file minimal (Python):

Python

# Before (Whisper)with open("meeting.wav", "rb") as audio:    result = client.audio.transcriptions.create(        model="whisper-1",        file=audio,        language="en",        prompt="Support call about AC-42"    )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio:    result = client.audio.transcriptions.create(        model="gpt-transcribe",        file=audio,        prompt="A customer support call about billing",        extra_body={            "keywords": ["AC-42", "Premium Plus"],            "languages": ["en", "fr"]        },        response_format="json"  # or stream=True for deltas    )

Catatan migrasi live:

  • Pertahankan arsitektur sesi Realtime / WebSocket yang sama.
  • Ganti ID model dan ganti field tunggal language dengan array languages.
  • Tambahkan prompt, keywords, dan delay opsional (mis. "low").
  • Lanjutkan menangani event delta/completed yang sama.
  • Jangan kirim keduanya, language dan languages.

Peringatan penting saat bermigrasi:

  • GPT-Transcribe/GPT-Live-Transcribe tidak mendukung timestamp tingkat kata, SRT/VTT, atau terjemahan ke Inggris dengan cara yang sama seperti whisper-1. Pertahankan Whisper untuk kebutuhan spesifik tersebut.
  • Format respons berbeda — jangan berasumsi text, verbose_json, srt, atau vtt bekerja identik.
  • Keywords harus literal satu baris (tanpa <, >, CR, atau LF) atau permintaan akan ditolak.
  • Uji pada audio produksi yang representatif (aksen, kebisingan, istilah domain, ujaran singkat) alih-alih hanya mengandalkan angka WER yang dipublikasikan.

Rekomendasi Singkat

  • Default untuk pekerjaan baru: GPT-Transcribe untuk file/batch, GPT-Live-Transcribe untuk live streaming.
  • Integrasi Whisper atau GPT-4o-Transcribe yang ada tetap berfungsi namun bukan titik awal yang direkomendasikan.
  • Job batch yang sensitif biaya paling diuntungkan dari beralih ke GPT-Transcribe ($0.0045 vs $0.006).

Untuk detail terbaru, periksa halaman model resmi dan panduan ringkasan transkripsi di situs pengembang OpenAI.

Bagaimana Mengevaluasi Kedua Model pada Audio Produksi?

Gunakan audio berlisensi yang mewakili produk, bukan hanya klip demo yang bersih.

  1. Pilih setidaknya 50 rekaman di seluruh use case utama, bahasa, perangkat, dan kondisi audio.
  2. Sertakan aksen, interupsi, kebisingan latar, alih kode, angka, tanggal, mata uang, alamat email, dan kosakata domain.
  3. Jalankan rekaman yang sudah selesai melalui gpt-transcribe dengan dan tanpa petunjuk konteks.
  4. Putar ulang sampel live yang sama melalui gpt-live-transcribe pada tiga pengaturan delay.
  5. Pertahankan format, batasan giliran, prompt, dan aturan penilaian konsisten di semua run.
  6. Ukur kesalahan transkripsi, recall istilah domain, revisi teks parsial, latensi p50 dan p95, kegagalan, retry, dan waktu koreksi manusia.
  7. Hitung biaya per transkrip yang diterima, lalu canary kebijakan perutean yang dipilih sebelum migrasi penuh.

Desain akhir dapat menggunakan satu model atau keduanya. Metrik penentu harus biaya dan keandalan transkrip produksi yang diterima, bukan harga per menit yang dipublikasikan secara terpisah.

FAQ

Model mana yang harus saya gunakan: GPT-Transcribe atau GPT-Live-Transcribe?

Gunakan gpt-transcribe untuk rekaman yang sudah selesai dan job asinkron. Gunakan gpt-live-transcribe ketika teks harus tiba saat audio masih streaming.

Berapa biaya GPT-Transcribe dan GPT-Live-Transcribe?

OpenAI mencantumkan gpt-transcribe di $0.0045 per menit audio ($0.27 per jam) dan gpt-live-transcribe di $0.017 per menit ($1.02 per jam).

Apakah GPT-Live-Transcribe lebih akurat daripada GPT-Realtime-Whisper?

Pada tolok ukur Real-World Audio Recording sembilan bahasa dari OpenAI, tingkat kesalahan transkripsi yang dilaporkan turun dari 11.65% menjadi 9.60%. Verifikasi hasil khusus tolok ukur ini pada audio Anda sendiri.

Apakah GPT-Live-Transcribe mendukung diarisasi atau timestamp kata?

Tidak. Model ini tidak mengembalikan label pembicara, timestamp tingkat kata, atau skor kepercayaan. Gunakan model file yang kompatibel atau langkah fallback ketika field tersebut diperlukan.

Apakah migrasi dari GPT-Realtime-Whisper cukup mengganti model saja?

Tidak. Verifikasi konfigurasi sesi, field bahasa, input konteks, pengaturan delay, pengurutan event, dependensi fitur, latensi, dan kualitas output sebelum memindahkan trafik produksi.

Uji Rute Transkripsi dengan CometAPI

Sebelum implementasi, periksa ketersediaan model saat ini dan harga rute pada halaman harga CometAPI dan gunakan dokumentasi CometAPI untuk pola permintaan yang kompatibel dengan OpenAI. Kunci ID model yang tepat dalam pengujian dan log durasi audio, level delay, latensi delta pertama, latensi transkrip final, retry, dan tingkat transkrip yang diterima agar keputusan perutean mencerminkan total biaya alur kerja.

44 tampilan
Ditinjau untuk kejelasan, atribusi sumber, dan terminologi API terkini.

Siap memangkas biaya pengembangan AI hingga 20%?

Mulai gratis dalam beberapa menit. Kredit uji coba gratis disertakan. Tidak perlu kartu kredit.

Baca Selengkapnya