TL;DR
Tidak ada API ucapan-ke-teks yang terbaik untuk semua kasus. AssemblyAI Universal-2 dan Google Dynamic Batch adalah titik awal berbiaya rendah yang kuat untuk audio rekaman. Deepgram, AssemblyAI, dan ElevenLabs layak diuji lebih awal untuk caption langsung dan agen suara. OpenAI praktis ketika produk lainnya sudah memakai OpenAI SDK, sementara AWS dan Google dapat mengurangi friksi operasional di dalam tumpukan cloud yang sudah ada.
Jangan memilih hanya dari harga per menit. Biaya produksi juga bergantung pada penagihan kanal, biaya diarization dan redaction, latensi finalisasi p95, retry, ketentuan data, serta menit yang dihabiskan manusia untuk mengoreksi tiap transkrip yang diterima.
Cara Memilih API Ucapan-ke-Teks: Penyedia Mana yang Harus Anda Uji Terlebih Dahulu?
Mulailah dari beban kerja Anda alih-alih peringkat penyedia universal. API ucapan-ke-teks yang tepat bergantung pada apakah Anda membutuhkan transkripsi batch berbiaya rendah, streaming berlatensi rendah, dukungan multibahasa, pemisahan pembicara, atau integrasi yang lebih erat dengan tumpukan cloud yang ada.
Gunakan daftar pendek di bawah untuk memutuskan penyedia mana yang masuk ke tolok ukur pertama Anda.
| Beban kerja | Mulai dengan | Alasan | Uji pemutus keputusan |
|---|---|---|---|
| Arsip rekaman besar | AssemblyAI Universal-2, Google Dynamic Batch, OpenAI gpt-4o-mini-transcribe | Harga audio rekaman yang dipublikasikan rendah | Waktu antrean, penanganan berkas panjang, pemformatan, dan menit koreksi |
| Caption langsung atau agen suara | Deepgram Nova-3 atau Flux, AssemblyAI Realtime, ElevenLabs Scribe v2 Realtime | API streaming dengan hasil parsial dan alur deteksi giliran | Latensi parsial yang stabil, jeda finalisasi, interupsi, dan reconnect |
| Panggilan contact center | AWS Transcribe, Google Cloud STT, Deepgram, AssemblyAI | Penanganan kanal, diarization, kontrol kosakata, dan opsi redaction | Penagihan per kanal, tumpang tindih ucapan, kebijakan PII, dan pemrosesan regional |
| Rapat atau media multibahasa | AssemblyAI Universal-3.5 Pro, ElevenLabs Scribe v2, Deepgram Nova-3 Multilingual, OpenAI model transkripsi | Cakupan bahasa luas atau dukungan code-switching | Pasangan bahasa nyata Anda, aksen, nama, timestamp, dan segmen campuran bahasa |
Perbandingan Harga API Ucapan-ke-Teks: Potret 2026
Tabel ini menormalkan harga daftar publik ke satu jam audio untuk pemindaian. Ini tidak menyiratkan kualitas, latensi, cakupan fitur, atau ketentuan komersial yang setara. Harga promosi, prioritas lebih rendah, dan volume tinggi diberi label karena tidak langsung setara dengan tarif masuk biasa.
| Penyedia | Kecocokan produksi terbaik | Harga rekaman atau asinkron | Harga live atau standar | Peringatan terpenting |
|---|---|---|---|---|
| OpenAI | Aplikasi OpenAI yang sudah ada dan unggahan transkripsi yang lugas | gpt-4o-mini-transcribe: $0.18/hr; gpt-4o-transcribe: $0.36/hr | gpt-realtime-whisper: $1.02/hr | Unggahan dibatasi 25 MB. Word-level timestamp_granularities[] hanya didokumentasikan untuk whisper-1; diarization menggunakan model terpisah dan tidak didukung di Realtime API. |
| Deepgram | Kontrol streaming, caption langsung, dan pipeline agen suara | Nova-3 Monolingual pre-recorded: $0.462/hr | Nova-3 Monolingual streaming: $0.288/hr promosi | Diarization dan redaction masing-masing menambah $0.0020/menit; keyterm prompting menambah $0.0013/menit. Tarif tercantum mengikutsertakan pengguna ke Model Improvement Program. |
| AssemblyAI | Transkripsi rekaman berbiaya rendah dan fitur berharga jelas | Universal-2: $0.15/hr; Universal-3.5 Pro: $0.21/hr | Universal-Streaming: $0.15/hr; Universal-3.5 Pro Realtime: $0.45/hr | Berkas multikanal ditagih per kanal. Rute streaming $0.15/hr mendukung bahasa Inggris atau enam bahasa, bukan cakupan 99 bahasa milik Universal-2. |
| Google Cloud Speech-to-Text V2 | Beban kerja GCP-native dan arsip prioritas rendah | Dynamic Batch: $0.18/hr | Standard recognition: $0.96/hr untuk 500.000 menit bulanan pertama | Dynamic Batch berjalan dengan urgensi lebih rendah. Setiap kanal audio ditagih terpisah. |
| Amazon Transcribe | Audio contact center native AWS dan panggilan dua kanal | Bertingkat wilayah dan volume; contoh resmi US East 2M menit: $0.36/hr | Contoh resmi US East 2M menit: $0.60/hr | Ini contoh volume tinggi, bukan harga masuk universal. Permintaan memiliki minimum 15 detik; hingga dua kanal termasuk dalam durasi yang ditagih. |
| ElevenLabs Scribe | Media multibahasa, timing kata, dan eksperimen real-time cepat | Scribe v2: $0.22/hr | Scribe v2 Realtime: $0.39/hr | Entity detection menambah $0.07/hr dan keyterm prompting menambah $0.05/hr. Latensi vendor tidak termasuk jaringan dan jalur aplikasi Anda. |
Developer shortcut: Jika daftar pendek Anda mencakup Whisper, GPT-4o Transcribe, atau model ucapan lain yang saat ini didukung CometAPI, periksa live model catalog and pricing dan gunakan OpenAI-compatible quickstart untuk menjalankan audio yang sama melalui rute yang didukung. Konfirmasikan ID model dan endpoint yang tepat sebelum membangun tolok ukur.
Ulasan Penyedia Terperinci: 6 API yang Dibandingkan
1. OpenAI: Terbaik untuk Tim yang Sudah Menggunakan OpenAI SDK
OpenAI’s pricing page memperkirakan transkripsi sebesar $0.003 per minute untuk gpt-4o-mini-transcribe dan $0.006 per minute untuk gpt-4o-transcribe. Rute khusus gpt-realtime-whisper tercantum sekitar $0.017 per minute.
OpenAI adalah pilihan awal yang praktis untuk tim yang sudah memakai OpenAI SDK untuk autentikasi, logging, retry, dan tata kelola model. Baik gpt-4o-transcribe maupun gpt-4o-mini-transcribe mendukung prompting, yang dapat meningkatkan pengenalan nama produk, akronim, orang, dan kosakata spesifik domain. Untuk rekaman yang memerlukan identifikasi pembicara, model gpt-4o-transcribe-diarize terpisah dapat mengembalikan segmen berlabel pembicara dan mengaitkannya dengan pembicara yang dikenal menggunakan klip referensi singkat.
Keterbatasan utama bersifat arsitektural, bukan semata harga. Berkas unggahan dibatasi 25 MB, word-level timestamp_granularities[] didokumentasikan untuk whisper-1, dan model diarization tidak tersedia melalui Realtime API. Tim yang memproses rekaman panjang, percakapan live, atau audio contact center dengan banyak pembicara harus menguji penanganan berkas, kebutuhan timestamp, dan atribusi pembicara sebelum menstandarkan satu rute OpenAI. Lihat OpenAI speech-to-text documentation resmi untuk perilaku endpoint saat ini dan format output yang didukung.
Tim yang ingin memakai GPT-4o Transcribe sambil menurunkan biaya API langsung juga dapat meninjau GPT-4o Transcribe API di CometAPI. Pada saat penulisan, CometAPI mencantumkan akses dengan tarif lebih rendah daripada harga API langsung standar OpenAI, sambil mempertahankan jalur integrasi yang kompatibel dengan OpenAI. Periksa halaman model live sebelum benchmarking karena harga, ketersediaan, dan parameter yang didukung dapat berubah.
Test OpenAI terlebih dahulu ketika: aplikasi Anda sudah menggunakan tooling yang kompatibel dengan OpenAI, sebagian besar audio diunggah alih-alih di-stream terus-menerus, dan pengurangan kompleksitas integrasi lebih penting daripada kontrol streaming atau contact center yang khusus.
2. Deepgram: Terbaik untuk Kontrol Streaming dan Pipeline Agen Suara
Deepgram's pricing page menampilkan tarif streaming waktu terbatas $0.0048 per minute untuk Nova-3 Monolingual dan $0.0058 per minute untuk Nova-3 Multilingual. Tarif pay-as-you-go prarekam yang sesuai adalah $0.0077 dan $0.0092 per minute. Flux diposisikan untuk agen suara percakapan dengan deteksi giliran dan penanganan interupsi.
Deepgram layak masuk daftar pendek produk live karena perilaku streaming sama pentingnya dengan akurasi transkrip akhir. Antarmuka suara membutuhkan hasil parsial yang berguna, endpointing yang andal, penanganan interupsi yang natural, dan finalisasi yang dapat diprediksi—bukan sekadar transkrip bersih setelah panggilan berakhir.
Anggarkan add-on bersama modelnya. Diarization dan redaction masing-masing menambah $0.0020 per minute; keyterm prompting menambah $0.0013 per minute. Deepgram juga menyatakan bahwa tarif tercantum mengikutsertakan pengguna ke Model Improvement Program, jadi tim dengan persyaratan penggunaan data yang lebih ketat harus memverifikasi ketentuan komersial alternatif.
Test Deepgram terlebih dahulu ketika: pengambilan giliran, parsial berlatensi rendah, kontrol streaming, atau perilaku agen suara adalah kebutuhan utama.
3. AssemblyAI: Rute Rekaman Berbiaya Rendah Terbaik dengan Harga Add-on yang Transparan
AssemblyAI's pricing mencantumkan Universal-2 sebesar $0.15 per audio hour dan Universal-3.5 Pro sebesar $0.21 per hour. Universal-2 mendukung 99 bahasa; Universal-3.5 Pro mendukung 18 bahasa dengan code switching dan tier model yang lebih canggih.
Lini produk real-time terpisah. Universal-Streaming berharga $0.15 per hour untuk bahasa Inggris, dan Universal-Streaming Multilingual mencakup bahasa Inggris, Spanyol, Jerman, Prancis, Portugis, dan Italia dengan harga yang sama. Universal-3.5 Pro Realtime berharga $0.45 per hour dan mendukung 18 bahasa.
Matriks add-on yang eksplisit dari AssemblyAI memudahkan penganggaran: diarization rekaman $0.02 per hour, diarization real-time $0.12 per hour, dan Universal-Streaming keyterm prompting $0.04 per hour. Berkas multikanal ditagih per kanal, yang dapat mengubah hasil untuk panggilan stereo.
Test AssemblyAI terlebih dahulu ketika: biaya audio rekaman rendah, cakupan bahasa luas, harga fitur jelas, atau alur kerja async yang sederhana menjadi prioritas.
4. Google Cloud Speech-to-Text: Terbaik untuk Dynamic Batch dan Beban Kerja GCP-Native
Google Cloud Speech-to-Text V2 pricing mencantumkan Dynamic Batch $0.003 per minute dan standard recognition $0.016 per minute untuk 500.000 menit bulanan pertama. Harga standar turun pada tier penggunaan yang lebih tinggi.
Dynamic Batch menarik untuk arsip yang tidak memerlukan penyelesaian segera, tetapi harga lebih rendah terkait dengan urgensi pemrosesan yang lebih rendah. Google juga menagih tiap kanal audio secara terpisah: permintaan 30 detik dengan empat kanal ditagih sebagai 120 detik audio yang diproses.
Google sering menarik secara operasional ketika audio sudah berada di Cloud Storage dan tim menggunakan identitas GCP, logging, endpoint regional, dan kontrol penagihan. Tambahkan penyimpanan, transfer, dan layanan cloud terkait ke model biaya total alih-alih memperlakukan transkripsi sebagai item terisolasi.
Test Google terlebih dahulu ketika: arsip besar yang tidak mendesak, operasi GCP-native, penerapan regional, atau fitur adaptasi lebih penting daripada tabel harga paling sederhana.
5. Amazon Transcribe: Terbaik untuk Audio Contact Center Native AWS
Amazon Transcribe pricing bervariasi menurut wilayah dan tier penggunaan bulanan. Contoh publik AWS US East untuk dua juta menit bulanan menggunakan $0.006 per minute untuk batch dan $0.01 per minute untuk streaming. Angka-angka tersebut merupakan contoh volume tinggi, bukan kutipan masuk biasa.
Penggunaan ditagih per satu detik dengan minimum 15 detik per permintaan. Harga standar mencakup kosakata kustom, pemfilteran kosakata, diarization pembicara, dan identifikasi bahasa; redaction konten otomatis dan model bahasa kustom berbiaya tambahan.
AWS menyertakan hingga dua kanal dalam biaya durasi audio. Untuk panggilan stereo dukungan, aturan ini bisa lebih menguntungkan daripada penyedia yang menagih tiap kanal sebagai satu jam terpisah.
Test AWS terlebih dahulu ketika: panggilan sudah mengalir melalui AWS, penagihan dua kanal bernilai, atau integrasi IAM, penyimpanan, keamanan, dan pengadaan lebih penting daripada tarif daftar terendah yang terlihat.
6. ElevenLabs Scribe: Terbaik untuk Media Multibahasa dan Eksperimen Real-Time Cepat
ElevenLabs API pricing mencantumkan Scribe v2 $0.22 per hour dan Scribe v2 Realtime $0.39 per hour. Produk ini mencakup transkripsi multibahasa, timestamp tingkat kata, diarization, penandaan audio, dan opsi fitur keyterm serta entitas.
Scribe v2 Realtime mengiklankan latensi model rendah, tetapi pembeli harus mengukur jalur lengkap dari penangkapan mikrofon hingga teks stabil di wilayah target dan tumpukan transport. Latensi vendor tidak mencakup penanganan WebSocket Anda, jalur jaringan, buffering, pembaruan UI, atau logika agen hilir.
Entity detection menambah $0.07 per hour dan keyterm prompting menambah $0.05 per hour. Sertakan keduanya dalam biaya transkrip yang diterima ketika diwajibkan oleh produk.
Test ElevenLabs terlebih dahulu ketika: media multibahasa, timing kata, tag audio, atau prototipe real-time yang cepat adalah kebutuhan sentral.
Total Cost of Ownership: Biaya Tersembunyi yang Dapat Membalik Peringkat
Penagihan Multikanal
Panggilan stereo satu jam tidak selalu sama dengan satu jam yang ditagih.
| Rute | Perhitungan perencanaan untuk panggilan dua kanal 60 menit | Estimasi biaya dasar |
|---|---|---|
| AssemblyAI Universal-2 | 1 jam × 2 kanal × $0.15/hr | $0.30 |
| AWS Transcribe batch | 1 jam total × $0.36/hr | $0.36 |
| Google standard recognition | 1 jam × 2 kanal × $0.96/hr | $1.92 |
*Nilai AWS menggunakan contoh resmi penyedia untuk US East pada dua juta menit bulanan. Gunakan kalkulator AWS untuk wilayah dan volume bulanan aktual.
Tabel ini adalah contoh penagihan, bukan peringkat contact center. Ujilah tumpang tindih ucapan, pergantian pembicara, terminologi, redaction, jeda finalisasi, dan upaya koreksi sebelum memilih rute.
Add-On, Retry, dan Tinjauan Manual
Pemrosesan prarekam Deepgram Nova-3 Monolingual naik dari $0.0077 menjadi $0.0097 per minute saat diarization ditambahkan. Menambahkan redaction menaikkannya menjadi $0.0117 per minute sebelum keyterm prompting. AssemblyAI mengenakan $0.02 per hour untuk diarization rekaman dan $0.12 per hour untuk diarization real-time. ElevenLabs mengenakan $0.07 per hour untuk entity detection dan $0.05 per hour untuk keyterm prompting.
Retry, webhook duplikat, penyimpanan, dan transfer lintas cloud dapat menambah biaya tanpa meningkatkan transkrip. Catat detik audio, jumlah kanal, bendera fitur, status permintaan, retry, versi model, latensi, dan waktu tinjauan untuk setiap job.
The better procurement metric is not price per audio minute. Cost per accepted transcript = API processing + paid features + retries + storage/transfer + human correction time
Asumsikan peninjau berbiaya $30 per hour:
| Rute ilustratif | Biaya API untuk satu jam audio | Koreksi manual | Biaya koreksi | Total biaya transkrip diterima |
|---|---|---|---|---|
| Rute harga lebih rendah | $0.15 | 8 menit | $4.00 | $4.15 |
| Rute harga lebih tinggi | $0.60 | 3 menit | $1.50 | $2.10 |
Rute kedua empat kali lebih mahal di lapisan API tetapi kira-kira separuhnya setelah peninjauan. Waktu koreksi adalah asumsi perencanaan, bukan hasil tolok ukur penyedia; gantikan dengan pengukuran dari orang yang menyetujui transkrip dalam alur kerja Anda.
Cara Mengevaluasi API Ucapan-ke-Teks pada Audio Nyata
Klaim akurasi vendor tidak dapat dibandingkan langsung karena penyedia menggunakan dataset, bahasa, kebijakan normalisasi, versi model, dan kondisi akustik yang berbeda. Studi 2026 GigaSpeechBench mengevaluasi 680 jam ucapan dunia nyata beranotasi manusia di berbagai bahasa berdaya rendah, dialek Tionghoa, aksen bahasa Inggris, terminologi dari 12 domain vertikal, serta ucapan anak-anak dan lansia. Hasilnya menunjukkan degradasi substansial untuk model terkemuka dan API komersial dalam kondisi sulit.
Kesimpulan yang berguna bukan bahwa satu tolok ukur publik telah menemukan pemenang permanen. Melainkan set uji Anda harus menyerupai trafik Anda.
Gunakan Set Evaluasi Mirip Produksi
- 20 rapat atau wawancara bersih yang mengandung nama dan istilah domain.
- 20 panggilan dukungan yang bising dengan interupsi, musik tunggu, crosstalk, dan perubahan kanal.
- 20 klip beraksen atau multibahasa, termasuk code switching yang nyata.
- 10 podcast atau berkas video bentuk panjang.
- 10 ucapan live pendek dengan jeda diam, keraguan, awal salah, dan menyela.
Nilai Lebih dari Word Error Rate
| Metrik | Apa yang diukur | Mengapa penting |
|---|---|---|
| Word error rate | Insertion, deletion, dan substitution di bawah satu kebijakan normalisasi bersama | Menangkap akurasi leksikal, namun tidak kegunaan transkrip penuh |
| Akurasi istilah bernama | Nama produk, orang, tempat, singkatan, angka, dan kosakata industri | Kegagalan nama diri kecil dapat menciptakan kerja tinjauan berat |
| Atribusi pembicara | Kata yang salah-atribusi dan perpindahan pembicara yang terlewat | Kritis untuk panggilan, wawancara, kepatuhan, dan analitik |
| Kualitas pemformatan | Tanda baca, kapitalisasi, paragraf, angka, tanggal, dan disfluensi | Menentukan waktu perapihan sebelum publikasi atau analisis |
| Waktu penyelesaian batch | Upload-to-final p50 dan p95 untuk berkas pendek dan panjang | Rute prioritas lebih rendah yang murah dapat meleset dari tenggat operasional |
| Latensi streaming | Parsial pertama, parsial stabil, dan transkrip final pada p50 dan p95 | Rata-rata latensi menyembunyikan jeda yang benar-benar dirasakan pengguna |
| Keandalan | Timeout, hasil kosong, retry, webhook duplikat, dan tingkat fallback | Kegagalan menambah biaya langsung dan jeda yang terlihat pengguna |
| Upaya peninjauan | Menit editor per jam audio dan tingkat transkrip diterima | Mengonversi kualitas output menjadi biaya bisnis |
Rencana Evaluasi Tujuh Hari
- Tetapkan kontrak penerimaan. Tetapkan bahasa wajib, latensi p95, toleransi label pembicara, kebutuhan timestamp, aturan retensi, dan menit tinjauan maksimum per jam audio.
- Bangun dan labeli set audio. Gunakan audio mirip produksi yang berlisensi dan satu kebijakan transkrip referensi bersama.
- Normalisasi integrasi. Samakan format audio, wilayah, petunjuk kosakata, tata letak kanal, retry, timeout, dan versi model.
- Jalankan uji audio rekaman. Ukur biaya, waktu penyelesaian, WER, istilah bernama, pemformatan, pembicara, kegagalan, dan waktu koreksi.
- Jalankan uji audio live. Ukur parsial stabil, jeda finalisasi, endpointing, penanganan interupsi, dan perilaku reconnect pada p50 dan p95.
- Hitung biaya transkrip diterima. Tambahkan kanal, fitur, retry, penyimpanan, transfer, dan waktu peninjau.
- Pilih kebijakan perutean. Desain produksi terbaik mungkin menggunakan satu rute untuk panggilan live bahasa Inggris, rute lain untuk rapat multibahasa, dan rute batch prioritas rendah untuk arsip.
Daftar Periksa Produksi Sebelum Menandatangani Kontrak
- Uji model rekaman dan live secara terpisah; harga, bahasa, dan perilakunya dapat berbeda.
- Ukur parsial stabil dan finalisasi, bukan hanya waktu ke teks pertama.
- Bandingkan identifikasi kanal stereo dengan diarization satu kanal pada ucapan yang tumpang tindih.
- Paksa timeout, audio salah format, respons kosong, putus koneksi, pengiriman ulang webhook, dan error rate limit.
- Verifikasi ukuran berkas, durasi sesi, konkurensi, rate limit, dan alur kerja berkas panjang.
- Konfirmasikan retensi, penggunaan peningkatan model, pemrosesan regional, kontrol penghapusan, enkripsi, ketersediaan DPA atau BAA, dan subprosesor untuk paket yang tepat.
- Simpan versi model, detik audio, kanal, add-on, biaya permintaan, retry, latensi, menit tinjauan, dan status penerimaan.
- Uji ulang setelah perubahan harga atau model alih-alih mengasumsikan pemenang sebelumnya tetap terbaik.
Pilih penyedia berdasarkan beban kerja, lalu lakukan benchmarking menggunakan audio, pengaturan, dan kriteria penerimaan yang sama. Bagi kebanyakan tim, putaran pertama yang praktis harus mencakup satu rute audio rekaman berbiaya rendah, satu rute streaming spesialis, dan satu penyedia yang sudah selaras dengan cloud atau SDK yang ada.
Uji Model Ucapan yang Didukung Melalui CometAPI
Tim yang mengevaluasi model ucapan yang kompatibel dengan OpenAI yang didukung dapat mengikuti CometAPI Quickstart untuk menjalankan permintaan transkripsi awal melalui endpoint API terpadu.
CometAPI dapat menyederhanakan autentikasi, penagihan, dan integrasi klien untuk model yang didukung. Sebelum masuk produksi, verifikasi format yang didukung, batas, ketentuan privasi, latensi, dan perilaku penagihan setiap model.
Pertanyaan yang Sering Diajukan
Apa API ucapan-ke-teks terbaik di 2026?
Tidak ada satu pemenang untuk setiap beban kerja. AssemblyAI dan Google Dynamic Batch adalah kandidat berbiaya rendah yang kuat untuk audio rekaman. Deepgram, AssemblyAI, dan ElevenLabs layak diuji lebih awal untuk transkripsi live. OpenAI nyaman dalam tumpukan yang kompatibel dengan OpenAI, sementara AWS dan Google mungkin lebih sederhana secara operasional di cloud masing-masing.
Apa API ucapan-ke-teks termurah untuk audio rekaman?
Di antara rute publik yang dinormalisasi di sini, AssemblyAI Universal-2 mulai dari $0.15 per audio hour. Google Dynamic Batch dan OpenAI gpt-4o-mini-transcribe ternormalisasi sekitar $0.18 per hour. Biaya akhir dapat berubah dengan kanal, tier volume, add-on, retry, penyimpanan, transfer, dan koreksi manual.
API mana yang terbaik untuk transkripsi real-time atau agen suara?
Mulailah dengan Deepgram, AssemblyAI, dan ElevenLabs, lalu sertakan OpenAI, AWS, atau Google ketika ekosistem mereka atau dukungan bahasa sesuai. Bandingkan parsial stabil, endpointing, jeda finalisasi, penanganan interupsi, perilaku reconnect, dan latensi p95 pada pola trafik live Anda sendiri.
Bagaimana sebaiknya saya membandingkan akurasi ucapan-ke-teks?
Gunakan audio berlisensi, wilayah, pengaturan model, dan kebijakan normalisasi yang sama untuk setiap penyedia. Laporkan word error rate bersama akurasi istilah bernama, atribusi pembicara, pemformatan, latensi p95, tingkat kegagalan, dan menit editor per jam audio. Jangan menggabungkan klaim tolok ukur vendor yang tidak terkait ke dalam peringkat universal.
