GPT-Transcribe vs GPT-Live-Transcribe: Harga, Perbedaan API, dan Migrasi
TL;DR
Gunakan gpt-transcribe untuk rekaman yang sudah selesai dengan harga $0.0045 per menit audio dan gpt-live-transcribe untuk mikrofon, panggilan, atau streaming media live dengan harga $0.017 per menit. OpenAI melaporkan kesalahan transkripsi yang lebih rendah untuk model live dibanding GPT-Realtime-Whisper pada tolok ukurnya, tetapi jalur yang tepat bergantung pada kapan teks harus muncul, field output yang Anda butuhkan, dan performa kedua model pada audio produksi Anda.
GPT-Transcribe vs GPT-Live-Transcribe Sekilas
Jika Anda hanya membutuhkan transkripsi setelah audio direkam, gunakan gpt-transcribe. Jika aplikasi Anda membutuhkan teks saat audio masih masuk, gunakan gpt-live-transcribe. Perbedaan terbesar bukan hanya harga, tetapi kapan transkripsi dimulai dan jenis alur kerja API yang harus didukung aplikasi Anda.
| Item | gpt-transcribe | gpt-live-transcribe |
|---|---|---|
| Terbaik untuk | Rekaman yang diunggah, permintaan audio berbatas, job asinkron, dan giliran Realtime yang dikomit | Mikrofon, panggilan, rapat, dan streaming media live |
| Harga yang dipublikasikan | $0.0045 per menit audio | $0.017 per menit audio |
| Harga per jam audio | $0.27 | $1.02 |
| API / Endpoint | /v1/audio/transcriptions; alur kerja Realtime komit giliran opsional | Sesi transkripsi Realtime (v1/realtime/transcription_sessions atau serupa) |
| Koneksi | Unggah file; respons streaming opsional saat file diproses | WebSocket untuk pipeline server atau WebRTC untuk audio browser |
| Kapan transkripsi dimulai | Setelah file dikirim atau giliran audio dikomit | Saat audio sedang masuk |
| Keluaran transkrip parsial | Ya, dengan streaming file atau streaming komit giliran | Ya, saat ucapan live masuk |
| Kontrol konteks | prompt, keywords, languages | prompt, keywords, languages, delay |
| Keluaran bahasa terdeteksi | Ya, ketika model dapat membuat prediksi yang andal | Tidak |
| Keterbatasan penting | Batas unggahan 25 MB; rute lain diperlukan untuk timestamp, diarization, atau terjemahan | Tidak ada timestamp tingkat kata, label pembicara, atau skor kepercayaan |
Meskipun gpt-transcribe dapat mengembalikan pembaruan transkrip parsial saat memproses file yang selesai atau giliran audio yang dikomit, ini bukan rute live streaming yang kontinu. Untuk caption live, panggilan, atau input mikrofon, gpt-live-transcribe adalah pilihan yang lebih baik.
Untuk perbandingan yang lebih luas di berbagai penyedia, lihat 6 API Ucapan-ke-Teks Terbaik pada 2026.
Apa itu GPT-Transcribe dan GPT-Live-Transcribe?
OpenAI memperkenalkan gpt-transcribe dan gpt-live-transcribe pada 29 Juli 2026. gpt-transcribe memproses rekaman yang sudah selesai, transkrip file yang di-stream, dan giliran Realtime yang dikomit, sementara gpt-live-transcribe mengembalikan pembaruan transkrip berlatensi rendah saat audio tiba dari mikrofon, panggilan, atau streaming media live.
Kedua model menyediakan rute default baru untuk transkripsi file umum dan live, tetapi alur kerja transkripsi Whisper dan GPT-4o yang terspesialisasi tetap diperlukan untuk timestamp, terjemahan, subtitle, dan diarisasi pembicara.
Kapan GPT-Live-Transcribe Layak dengan Harga Lebih Tinggi?
Halaman harga API OpenAI mencantumkan gpt-transcribe di $0.0045 per menit dan gpt-live-transcribe di $0.017 per menit. Oleh karena itu rute live berbiaya sekitar 3.8 kali lebih mahal per menit audio.
| Volume audio bulanan | gpt-transcribe | gpt-live-transcribe | Biaya tambahan untuk live |
|---|---|---|---|
| 100 jam | $27 | $102 | $75 |
| 1,000 jam | $270 | $1,020 | $750 |
| 10,000 jam | $2,700 | $10,200 | $7,500 |
Estimasi biaya transkripsi ini hanya menggunakan tarif dasar yang dipublikasikan OpenAI: jam audio × 60 × harga per menit. Tidak termasuk penyimpanan, transport jaringan, retry, hosting aplikasi, pascaproses, koreksi manusia, dan biaya penyedia cadangan.
Pilih gpt-live-transcribe ketika caption segera, bantuan agen, moderasi, atau interaksi real-time merupakan bagian dari kebutuhan produk. Pilih gpt-transcribe ketika transkrip hanya diperlukan setelah rapat, panggilan, wawancara, atau unggahan media selesai. Arsitektur dua rute dapat menggunakan transkripsi live untuk pengalaman pengguna dan transkripsi file untuk pemrosesan pascapanggilan atau backfill.
OpenAI saat ini mencantumkan GPT-Realtime-Whisper dan gpt-live-transcribe dengan tarif dasar yang sama $0.017 per menit. Evaluasi migrasi antara rute live ini berdasarkan kualitas transkrip yang diterima, latensi, penanganan event, dan kompatibilitas operasional, bukan hanya harga daftar.
Bagaimana Perbedaan API GPT-Transcribe dan GPT-Live-Transcribe?
Perbedaan utama adalah bagaimana audio masuk ke sistem dan kapan event transkrip dimulai. gpt-transcribe menerima file yang sudah selesai atau giliran audio yang dikomit, sementara gpt-live-transcribe mempertahankan koneksi Realtime dan memancarkan pembaruan transkrip saat audio masih masuk.
Gunakan GPT-Transcribe untuk audio yang sudah selesai
Untuk rekaman yang sudah selesai, kirim file ke /v1/audio/transcriptions. Panduan transkripsi file OpenAI menerima file hingga 25 MB dalam format mp3, mp4, mpeg, mpga, m4a, wav, atau webm.
from openai import OpenAI
client = OpenAI()
with open("support-call.wav", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="gpt-transcribe",
file=audio_file,
prompt="A support call about a premium plan and account AC-42.",
extra_body={
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
},
)
print(transcript.text)
Setel stream=True untuk menerima event delta transkrip saat OpenAI memproses rekaman yang diunggah. Ini mengurangi waktu tunggu untuk teks yang terlihat, tetapi tidak mengubah endpoint file menjadi ingest mikrofon live.
Gunakan GPT-Live-Transcribe untuk audio yang masuk
Buat sesi Realtime dengan type: "transcription" dan pilih gpt-live-transcribe. Gunakan WebSocket untuk pipeline media sisi server atau WebRTC untuk audio browser.
{
"type": "session.update",
"session": {
"type": "transcription",
"audio": {
"input": {
"format": {
"type": "audio/pcm",
"rate": 24000
},
"transcription": {
"model": "gpt-live-transcribe",
"prompt": "A support call about a premium plan and account AC-42.",
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en"],
"delay": "low"
},
"turn_detection": null
}
}
}
}
Tambahkan potongan audio dengan input_audio_buffer.append. Aplikasi dapat mengomit giliran dengan input_audio_buffer.commit atau mengonfigurasi deteksi aktivitas suara di server.
Panduan transkripsi Realtime mengembalikan teks inkremental melalui conversation.item.input_audio_transcription.delta, diikuti conversation.item.input_audio_transcription.completed untuk item yang dikomit. Event penyelesaian dari giliran yang berbeda tidak dijamin datang berurutan, jadi rekonsiliasi dengan item_id, bukan urutan kedatangan.
Gunakan rute komit giliran ketika teks segera tidak diperlukan
gpt-transcribe juga dapat berjalan dalam sesi transkripsi Realtime melalui WebSocket. Transkripsi dimulai setelah giliran audio dikomit, model dapat menggunakan giliran yang telah ditranskripsi sebelumnya sebagai konteks, dan event penyelesaian dapat menyertakan bahasa yang terdeteksi.
Rute komit giliran ini berguna ketika streaming berbasis giliran atau deteksi bahasa lebih penting daripada menampilkan teks saat penutur masih berbicara. Jangan disamakan dengan perilaku kontinu dan latensi lebih rendah dari gpt-live-transcribe.
Bagaimana Pengaruh Prompt, Keywords, Languages, dan Delay terhadap Transkripsi?
Kedua model menerima konteks yang dapat meningkatkan pengenalan nama, angka, akronim, istilah produk, aksen, audio multibahasa, dan alih kode.
| Kontrol | Tujuan | Perhatian produksi |
|---|---|---|
| prompt | Mendeskripsikan rekaman, penutur, domain, atau topik yang diharapkan | Konteks yang terlalu spesifik dapat membiaskan transkrip |
| keywords | Menyediakan nama literal, akronim, format akun, atau istilah teknis | Petunjuk bukan keluaran wajib; uji agar tidak menyisipkan istilah yang tidak diucapkan |
| languages | Mendaftar satu atau lebih bahasa input yang diharapkan | Kode yang tidak didukung atau salah format menyebabkan penolakan |
| delay | Menukar delta live yang lebih awal dengan konteks akustik yang lebih banyak | Tersedia untuk gpt-live-transcribe; benchmark alih-alih mengasumsikan milidetik tetap |
Untuk model baru, languages menggantikan field tunggal lama language. Jangan kirim keduanya. Setiap keyword harus tetap satu baris dan tidak boleh berisi <, >, carriage return, atau line feed; nilai tidak valid menyebabkan permintaan atau pembaruan sesi ditolak.
gpt-live-transcribe mendukung pengaturan delay minimal, low, medium, high, dan xhigh. Pengaturan yang lebih rendah memprioritaskan teks parsial lebih awal, sementara pengaturan lebih tinggi memberikan lebih banyak konteks audio dan dapat meningkatkan kualitas transkripsi. OpenAI tidak menjanjikan latensi tetap untuk setiap level, jadi ukur waktu hingga delta pertama dan waktu hingga transkrip final pada mikrofon, codec, jaringan, bahasa, dan durasi sesi yang representatif.
Apa yang Ditunjukkan Tolok Ukur Akurasi OpenAI?
Pengumuman peluncuran OpenAI melaporkan bahwa gpt-live-transcribe mengungguli GPT-Realtime-Whisper-1 pada dua uji transkripsi multibahasa. Juga dilaporkan bahwa konteks bebas meningkatkan akurasi semantik pada evaluasi Context Aware ASR.
| Evaluasi OpenAI | Hasil gpt-live-transcribe | Perbandingan | Perubahan yang dilaporkan |
|---|---|---|---|
| Akurasi semantik Context Aware ASR | 44.6% dengan konteks bebas | 38.5% tanpa konteks | +6.1 poin persentase |
| Common Voice, 22 bahasa, tingkat kesalahan transkripsi | 19.70% | 20.33% untuk GPT-Realtime-Whisper-1 | -0.63 poin; sekitar 3.1% relatif |
| Real-World Audio Recording, 9 bahasa, tingkat kesalahan transkripsi | 9.60% | 11.65% untuk GPT-Realtime-Whisper-1 | -2.05 poin; sekitar 17.6% relatif |
Kesimpulan yang dapat dipertahankan bersifat sempit: model live baru tampil lebih baik pada uji yang dilaporkan OpenAI, dan konteks meningkatkan skor akurasi semantik yang dilaporkan. Hasil yang dilaporkan vendor ini tidak menjamin peningkatan yang sama untuk setiap bahasa, codec telepon, mikrofon, pengaturan delay, kosakata domain, atau kebijakan koreksi.
Kapan Anda Harus Menggunakan Whisper atau GPT-4o Transcribe?
Tidak ada model baru yang menggantikan setiap alur kerja ucapan-ke-teks.
| Kebutuhan | Rute yang direkomendasikan |
|---|---|
| Transkripsi file yang sudah selesai secara umum | gpt-transcribe |
| Caption live berlatensi rendah atau transkripsi panggilan | gpt-live-transcribe |
| Label pembicara untuk rekaman yang sudah selesai | gpt-4o-transcribe-diarize dengan diarized_json |
| Timestamp kata atau segmen | whisper-1 dengan timestamp_granularities[] |
| Terjemahan audio non-Inggris yang selesai ke bahasa Inggris | /v1/audio/translations dengan whisper-1 |
Untuk diarisasi, OpenAI mengharuskan API Transcriptions file; pelabelan pembicara tidak didukung di sesi transkripsi Realtime. Untuk rekaman lebih dari 30 detik, konfigurasikan chunking_strategy sebagai "auto" atau gunakan konfigurasi deteksi aktivitas suara.
Untuk timestamp, subtitle, terjemahan, atau alur kerja Whisper yang ada, lihat panduan API Whisper dari CometAPI dan halaman model Whisper-1. Tim yang mengevaluasi rute transkripsi file OpenAI lainnya juga dapat meninjau halaman model GPT-4o Transcribe.
Bagaimana Cara Migrasi dari Whisper?
Mengganti ID model hanyalah langkah pertama. Validasi alur kerja lengkap sebelum mengalihkan trafik produksi.
| Pemeriksaan | Tindakan yang diperlukan | Risiko jika dilewati |
|---|---|---|
| Pemilihan rute | Pisahkan rekaman yang sudah selesai dari beban kerja yang benar-benar live | Membayar tarif live untuk job asinkron |
| Field bahasa | Ganti language dengan languages untuk model baru; jangan pernah mengirim keduanya | Permintaan atau sesi ditolak |
| Petunjuk konteks | Uji prompt dan keywords pada nama, angka, jargon, dan ucapan berisik | Istilah yang bias atau tersisip tanpa diucapkan |
| Pengaturan delay | Benchmark setidaknya low, medium, dan high pada audio representatif | Memilih kecepatan atau akurasi tanpa data |
| Penanganan event | Rekonsiliasi delta dan event selesai dengan item_id | Transkrip tidak berurutan atau tertimpa |
| Paritas fitur | Inventarisasi dependensi diarization, timestamp, kepercayaan, subtitle, dan terjemahan | Field hilang di hilir |
| Telemetri biaya | Log menit audio, retry, hasil gagal, waktu koreksi, dan keluaran yang diterima | Mengira harga daftar sama dengan biaya alur |
| Rollout | Shadow test, canary sebagian kecil trafik, dan pertahankan fallback | Regresi luas tanpa rollback cepat |
Untuk migrasi GPT-Realtime-Whisper, pertahankan format audio, kebijakan deteksi giliran, set uji, dan target latensi tetap. Karena harga live yang dipublikasikan tidak berubah, prioritaskan tingkat transkrip yang diterima, distribusi latensi, stabilitas output, dan kompatibilitas dengan sisa pipeline.
Panduan Migrasi (dari Whisper / model sebelumnya)
OpenAI menyediakan cookbook resmi: Migrasi dari Whisper ke GPT-Transcribe dan GPT-Live-Transcribe.
Aturan tingkat tinggi:
- Audio rekaman / batch → beralih ke gpt-transcribe pada endpoint /v1/audio/transcriptions yang ada.
- Audio live kontinu → beralih ke gpt-live-transcribe dalam sesi transkripsi Realtime.
- Akurasi lebih tinggi setelah giliran dikomit → gunakan gpt-transcribe di dalam sesi Realtime.
Contoh migrasi file minimal (Python):
Python
# Before (Whisper)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="whisper-1", file=audio, language="en", prompt="Support call about AC-42" )# After (GPT-Transcribe)with open("meeting.wav", "rb") as audio: result = client.audio.transcriptions.create( model="gpt-transcribe", file=audio, prompt="A customer support call about billing", extra_body={ "keywords": ["AC-42", "Premium Plus"], "languages": ["en", "fr"] }, response_format="json" # or stream=True for deltas )
Catatan migrasi live:
- Pertahankan arsitektur sesi Realtime / WebSocket yang sama.
- Ganti ID model dan ganti field tunggal language dengan array languages.
- Tambahkan prompt, keywords, dan delay opsional (mis. "low").
- Lanjutkan menangani event delta/completed yang sama.
- Jangan kirim keduanya, language dan languages.
Peringatan penting saat bermigrasi:
- GPT-Transcribe/GPT-Live-Transcribe tidak mendukung timestamp tingkat kata, SRT/VTT, atau terjemahan ke Inggris dengan cara yang sama seperti whisper-1. Pertahankan Whisper untuk kebutuhan spesifik tersebut.
- Format respons berbeda — jangan berasumsi text, verbose_json, srt, atau vtt bekerja identik.
- Keywords harus literal satu baris (tanpa <, >, CR, atau LF) atau permintaan akan ditolak.
- Uji pada audio produksi yang representatif (aksen, kebisingan, istilah domain, ujaran singkat) alih-alih hanya mengandalkan angka WER yang dipublikasikan.
Rekomendasi Singkat
- Default untuk pekerjaan baru: GPT-Transcribe untuk file/batch, GPT-Live-Transcribe untuk live streaming.
- Integrasi Whisper atau GPT-4o-Transcribe yang ada tetap berfungsi namun bukan titik awal yang direkomendasikan.
- Job batch yang sensitif biaya paling diuntungkan dari beralih ke GPT-Transcribe ($0.0045 vs $0.006).
Untuk detail terbaru, periksa halaman model resmi dan panduan ringkasan transkripsi di situs pengembang OpenAI.
Bagaimana Mengevaluasi Kedua Model pada Audio Produksi?
Gunakan audio berlisensi yang mewakili produk, bukan hanya klip demo yang bersih.
- Pilih setidaknya 50 rekaman di seluruh use case utama, bahasa, perangkat, dan kondisi audio.
- Sertakan aksen, interupsi, kebisingan latar, alih kode, angka, tanggal, mata uang, alamat email, dan kosakata domain.
- Jalankan rekaman yang sudah selesai melalui
gpt-transcribedengan dan tanpa petunjuk konteks. - Putar ulang sampel live yang sama melalui
gpt-live-transcribepada tiga pengaturan delay. - Pertahankan format, batasan giliran, prompt, dan aturan penilaian konsisten di semua run.
- Ukur kesalahan transkripsi, recall istilah domain, revisi teks parsial, latensi p50 dan p95, kegagalan, retry, dan waktu koreksi manusia.
- Hitung biaya per transkrip yang diterima, lalu canary kebijakan perutean yang dipilih sebelum migrasi penuh.
Desain akhir dapat menggunakan satu model atau keduanya. Metrik penentu harus biaya dan keandalan transkrip produksi yang diterima, bukan harga per menit yang dipublikasikan secara terpisah.
FAQ
Model mana yang harus saya gunakan: GPT-Transcribe atau GPT-Live-Transcribe?
Gunakan gpt-transcribe untuk rekaman yang sudah selesai dan job asinkron. Gunakan gpt-live-transcribe ketika teks harus tiba saat audio masih streaming.
Berapa biaya GPT-Transcribe dan GPT-Live-Transcribe?
OpenAI mencantumkan gpt-transcribe di $0.0045 per menit audio ($0.27 per jam) dan gpt-live-transcribe di $0.017 per menit ($1.02 per jam).
Apakah GPT-Live-Transcribe lebih akurat daripada GPT-Realtime-Whisper?
Pada tolok ukur Real-World Audio Recording sembilan bahasa dari OpenAI, tingkat kesalahan transkripsi yang dilaporkan turun dari 11.65% menjadi 9.60%. Verifikasi hasil khusus tolok ukur ini pada audio Anda sendiri.
Apakah GPT-Live-Transcribe mendukung diarisasi atau timestamp kata?
Tidak. Model ini tidak mengembalikan label pembicara, timestamp tingkat kata, atau skor kepercayaan. Gunakan model file yang kompatibel atau langkah fallback ketika field tersebut diperlukan.
Apakah migrasi dari GPT-Realtime-Whisper cukup mengganti model saja?
Tidak. Verifikasi konfigurasi sesi, field bahasa, input konteks, pengaturan delay, pengurutan event, dependensi fitur, latensi, dan kualitas output sebelum memindahkan trafik produksi.
Uji Rute Transkripsi dengan CometAPI
Sebelum implementasi, periksa ketersediaan model saat ini dan harga rute pada halaman harga CometAPI dan gunakan dokumentasi CometAPI untuk pola permintaan yang kompatibel dengan OpenAI. Kunci ID model yang tepat dalam pengujian dan log durasi audio, level delay, latensi delta pertama, latensi transkrip final, retry, dan tingkat transkrip yang diterima agar keputusan perutean mencerminkan total biaya alur kerja.
