TL;DR
ไม่มี API แปลงเสียงเป็นข้อความที่ดีที่สุดสำหรับทุกงาน AssemblyAI Universal-2 และ Google Dynamic Batch เป็นจุดเริ่มต้นต้นทุนต่ำที่แข็งแรงสำหรับเสียงบันทึก Deepgram, AssemblyAI และ ElevenLabs ควรถูกทดสอบตั้งแต่ต้นสำหรับคำบรรยายสดและตัวแทนเสียง OpenAI สะดวกเมื่อส่วนอื่นของผลิตภัณฑ์ใช้ OpenAI SDK อยู่แล้ว ขณะที่ AWS และ Google อาจลดแรงเสียดทานเชิงปฏิบัติการภายในสแตกคลาวด์ที่ใช้อยู่
อย่าเลือกจากราคาต่อนาทีเพียงอย่างเดียว ต้นทุนจริงในการผลิตยังขึ้นกับการคิดเงินแยกช่อง การคิดค่าสำหรับการแยกผู้พูดและการปกปิดข้อมูล p95 เวลาปิดผลลัพธ์ การรีทราย นโยบายข้อมูล และนาทีที่มนุษย์ใช้แก้ไขในแต่ละทรานสคริปต์ที่ยอมรับ
How to Choose a Speech-to-Text API: Which Provider Should You Test First?
เริ่มจากลักษณะงานของคุณ ไม่ใช่อันดับผู้ให้บริการแบบสากล API แปลงเสียงเป็นข้อความที่เหมาะขึ้นอยู่กับว่าคุณต้องการการถอดความแบบแบตช์ต้นทุนต่ำ สตรีมมิงหน่วงต่ำ รองรับหลายภาษา แยกผู้พูด หรือผนึกกับสแตกคลาวด์ที่ใช้อยู่
ใช้ชอร์ตลิสต์ด้านล่างเพื่อตัดสินใจว่าผู้ให้บริการใดควรอยู่ในชุดทดสอบรอบแรกของคุณ
| Workload | Start with | Why | Decision-breaking test |
|---|---|---|---|
| Large recorded archive | AssemblyAI Universal-2, Google Dynamic Batch, OpenAI gpt-4o-mini-transcribe | ราคาที่ประกาศสำหรับเสียงบันทึกต่ำ | เวลาเข้าคิว การจัดการไฟล์ยาว การจัดรูปแบบ และนาทีแก้ไข |
| Live captions or voice agents | Deepgram Nova-3 or Flux, AssemblyAI Realtime, ElevenLabs Scribe v2 Realtime | สตรีมมิง API ที่รองรับผลลัพธ์บางส่วนและเวิร์กโฟลว์ตรวจจับเทิร์น | ความนิ่งของผลลัพธ์บางส่วน หน่วงปิดผลลัพธ์ การขัดจังหวะ และการเชื่อมต่อใหม่ |
| Contact-center calls | AWS Transcribe, Google Cloud STT, Deepgram, AssemblyAI | การจัดการช่อง การแยกผู้พูด การควบคุมคำศัพท์ และตัวเลือกการปกปิดข้อมูล | การคิดเงินรายช่อง การพูดซ้อน การจัดการ PII และการประมวลผลตามภูมิภาค |
| Multilingual meetings or media | AssemblyAI Universal-3.5 Pro, ElevenLabs Scribe v2, Deepgram Nova-3 Multilingual, OpenAI transcription models | ความครอบคลุมภาษากว้างหรือรองรับสลับภาษา | คู่ภาษาจริงของคุณ สำเนียง ชื่อ เวลา และช่วงผสมภาษา |
Speech-to-Text API Pricing Comparison: 2026 Snapshot
ตารางนี้ปรับราคาแบบรายการสาธารณะให้เทียบกับหนึ่งชั่วโมงเสียงเพื่อการสแกน ไม่ได้บ่งบอกคุณภาพ หน่วงเวลา ความครอบคลุมฟีเจอร์ หรือเงื่อนไขเชิงพาณิชย์ที่เท่ากัน ราคาส่งเสริมการขาย ความสำคัญต่ำ และปริมาณสูงถูกติดป้ายเพราะไม่เทียบตรงกับอัตราเริ่มต้นปกติ
| Provider | Best production fit | Recorded or asynchronous price | Live or standard price | Most important caveat |
|---|---|---|---|---|
| OpenAI | แอปที่ใช้ OpenAI อยู่แล้วและการอัปโหลดถอดเสียงแบบตรงไปตรงมา | gpt-4o-mini-transcribe: $0.18/hr; gpt-4o-transcribe: $0.36/hr | gpt-realtime-whisper: $1.02/hr | การอัปโหลดจำกัดที่ 25 MB word-level timestamp_granularities[] มีเอกสารเฉพาะสำหรับ whisper-1; การแยกผู้พูดใช้โมเดลแยกต่างหากและไม่รองรับใน Realtime API |
| Deepgram | การควบคุมสตรีมมิง คำบรรยายสด และสายโซ่ตัวแทนเสียง | Nova-3 Monolingual pre-recorded: $0.462/hr | Nova-3 Monolingual streaming: $0.288/hr promotional | การแยกผู้พูดและการปกปิดข้อมูลเพิ่ม $0.0020/min; การชี้เป้าคำสำคัญเพิ่ม $0.0013/min อัตราที่แสดงพาผู้ใช้เข้าร่วม Model Improvement Program |
| AssemblyAI | ถอดเสียงบันทึกต้นทุนต่ำและราคาฟีเจอร์ที่ชัดเจน | Universal-2: $0.15/hr; Universal-3.5 Pro: $0.21/hr | Universal-Streaming: $0.15/hr; Universal-3.5 Pro Realtime: $0.45/hr | ไฟล์หลายช่องคิดเงินตามจำนวนช่อง เส้นทางสตรีมมิง $0.15/hr รองรับภาษาอังกฤษหรือหกภาษา ไม่ครอบคลุม 99 ภาษาของ Universal-2 |
| Google Cloud Speech-to-Text V2 | งาน GCP-native และคลังบันทึกความสำคัญต่ำ | Dynamic Batch: $0.18/hr | Standard recognition: $0.96/hr สำหรับ 500,000 นาทีแรกต่อเดือน | Dynamic Batch ทำงานด้วยความเร่งด่วนต่ำกว่า ทุกช่องเสียงคิดเงินแยก |
| Amazon Transcribe | งานคอนแท็กต์เซ็นเตอร์บน AWS และเสียงสายสองช่อง | แยกตามภูมิภาคและปริมาณ; ตัวอย่างทางการ US East 2M นาที: $0.36/hr | ตัวอย่างทางการ US East 2M นาที: $0.60/hr | เหล่านี้คือตัวอย่างปริมาณสูง ไม่ใช่อัตราเริ่มต้นสากล คำขอมีขั้นต่ำ 15 วินาที รวมสูงสุดสองช่องในเวลาคิดเงิน |
| ElevenLabs Scribe | สื่อหลายภาษา เวลาคำ และการทดลองเรียลไทม์รวดเร็ว | Scribe v2: $0.22/hr | Scribe v2 Realtime: $0.39/hr | การตรวจจับเอนทิตีเพิ่ม $0.07/hr และการชี้เป้าคำสำคัญเพิ่ม $0.05/hr หน่วงผู้ขายไม่รวมเครือข่ายและเส้นทางแอปของคุณ |
Developer shortcut: หากชอร์ตลิสต์ของคุณรวม Whisper, GPT-4o Transcribe หรือโมเดลเสียงอื่นที่ CometAPI รองรับอยู่ ให้ตรวจสอบ live model catalog and pricing และใช้ OpenAI-compatible quickstart เพื่อส่งเสียงเดียวกันผ่านเส้นทางที่รองรับ ยืนยัน model ID และ endpoint ที่แน่ชัดก่อนสร้างเบนช์มาร์ก
Detailed Vendor Breakdown: The 6 APIs Compared
1. OpenAI: Best for Teams Already Using the OpenAI SDK
หน้าราคา OpenAI ประเมินค่าถอดความที่ $0.003 ต่อนาทีสำหรับ gpt-4o-mini-transcribe และ $0.006 ต่อนาทีสำหรับ gpt-4o-transcribe เส้นทาง gpt-realtime-whisper เฉพาะอยู่ราว $0.017 ต่อนาที
OpenAI เป็นตัวเลือกแรกที่ใช้งานได้จริงสำหรับทีมที่ใช้งาน OpenAI SDK อยู่แล้วสำหรับการยืนยันตัวตน การบันทึก ลองใหม่ และกำกับดูแลโมเดล ทั้ง gpt-4o-transcribe และ gpt-4o-mini-transcribe รองรับการให้พรอมป์ต์ ซึ่งช่วยให้รู้จำชื่อผลิตภัณฑ์ ตัวย่อ บุคคล และคำศัพท์เฉพาะโดเมนดีขึ้น สำหรับบันทึกที่ต้องระบุผู้พูด โมเดล gpt-4o-transcribe-diarize แยกต่างหากสามารถส่งช่วงพร้อมป้ายผู้พูดและจับคู่กับผู้พูดที่รู้จักจากคลิปอ้างอิงสั้นๆ
ข้อจำกัดหลักเป็นเชิงสถาปัตยกรรมมากกว่าราคาอย่างเดียว ไฟล์อัปโหลดจำกัด 25 MB timestamp_granularities[] ระดับคำมีเอกสารสำหรับ whisper-1 และโมเดลแยกผู้พูดไม่พร้อมใช้ผ่าน Realtime API ทีมที่ประมวลผลบันทึกยาว การสนทนาสด หรือเสียงคอนแท็กต์เซ็นเตอร์ที่มีผู้พูดมากควรทดสอบการจัดการไฟล์ ข้อกำหนดเวลา และการระบุผู้พูดก่อนมาตรฐานบนเส้นทางเดียว ดู คู่มือ speech-to-text ของ OpenAI สำหรับพฤติกรรม endpoint ปัจจุบันและรูปแบบผลลัพธ์ที่รองรับ
ทีมที่ต้องการใช้ GPT-4o Transcribe พร้อมลดค่าใช้จ่าย API โดยตรงสามารถพิจารณา GPT-4o Transcribe API บน CometAPI ณ เวลาที่เขียน CometAPI แสดงราคาเข้าถึงต่ำกว่าราคา API ตรงมาตรฐานของ OpenAI พร้อมคงเส้นทางผสานแบบเข้ากันได้กับ OpenAI ตรวจสอบหน้ารุ่นสดก่อนเบนช์มาร์ก เพราะราคา ความพร้อมใช้ และพารามิเตอร์ที่รองรับอาจเปลี่ยนแปลง
ทดสอบ OpenAI ก่อนเมื่อ: แอปของคุณใช้เครื่องมือเข้ากันได้กับ OpenAI อยู่แล้ว เสียงส่วนใหญ่ถูกอัปโหลดแทนที่จะสตรีมต่อเนื่อง และการลดความซับซ้อนการผสานงานสำคัญกว่าการควบคุมสตรีมมิงหรือคอนแท็กต์เซ็นเตอร์แบบเฉพาะทาง
2. Deepgram: Best for Streaming Control and Voice-Agent Pipelines
หน้าราคา Deepgram แสดงอัตราสตรีมมิงช่วงจำกัดที่ $0.0048 ต่อนาทีสำหรับ Nova-3 Monolingual และ $0.0058 ต่อนาทีสำหรับ Nova-3 Multilingual อัตราแบบบันทึกจ่ายตามใช้สอดคล้องกันคือ $0.0077 และ $0.0092 ต่อนาที Flux ถูกวางตำแหน่งสำหรับตัวแทนเสียงแบบสนทนาพร้อมตรวจจับเทิร์นและรองรับการขัดจังหวะ
Deepgram ควรอยู่ในชอร์ตลิสต์ผลิตภัณฑ์สดเพราะพฤติกรรมสตรีมมิงสำคัญพอๆ กับความแม่นยำของทรานสคริปต์สุดท้าย อินเทอร์เฟซเสียงต้องการผลลัพธ์บางส่วนที่มีประโยชน์ การปิดประโยคที่เชื่อถือได้ การรองรับการขัดจังหวะตามธรรมชาติ และการปิดผลสุดท้ายที่คาดเดาได้ ไม่ใช่เพียงทรานสคริปต์สะอาดหลังจบสาย
วางงบฟีเจอร์เพิ่มกับโมเดลด้วย การแยกผู้พูดและการปกปิดข้อมูลเพิ่มอย่างละ $0.0020 ต่อนาที; การชี้เป้าคำสำคัญเพิ่ม $0.0013 ต่อนาที Deepgram ยังระบุว่าอัตราที่แสดงพาผู้ใช้เข้าร่วม Model Improvement Program ดังนั้นทีมที่ต้องการข้อกำหนดการใช้ข้อมูลที่เข้มงวดควรตรวจสอบเงื่อนไขเชิงพาณิชย์ทางเลือก
ทดสอบ Deepgram ก่อนเมื่อ: การรับส่งเทิร์น ผลลัพธ์บางส่วนหน่วงต่ำ การควบคุมสตรีมมิง หรือพฤติกรรมตัวแทนเสียงคือข้อกำหนดหลัก
3. AssemblyAI: Best Low-Cost Recorded Route with Transparent Add-On Pricing
ราคาของ AssemblyAI แสดง Universal-2 ที่ $0.15 ต่อชั่วโมงเสียง และ Universal-3.5 Pro ที่ $0.21 ต่อชั่วโมง Universal-2 รองรับ 99 ภาษา; Universal-3.5 Pro รองรับ 18 ภาษา พร้อมสลับภาษาและชั้นโมเดลที่สูงกว่า
สายผลิตภัณฑ์เรียลไทม์แยกกัน Universal-Streaming ราคา $0.15 ต่อชั่วโมงสำหรับภาษาอังกฤษ และ Universal-Streaming Multilingual ครอบคลุม อังกฤษ สเปน เยอรมัน ฝรั่งเศส โปรตุเกส และอิตาลีในราคาเดียวกัน Universal-3.5 Pro Realtime ราคา $0.45 ต่อชั่วโมงและรองรับ 18 ภาษา
ตารางฟีเจอร์เพิ่มที่ชัดเจนของ AssemblyAI ทำให้ตั้งงบง่ายขึ้น: การแยกผู้พูดแบบบันทึก $0.02 ต่อชั่วโมง การแยกผู้พูดแบบเรียลไทม์ $0.12 ต่อชั่วโมง และการชี้เป้าคำสำคัญของ Universal-Streaming $0.04 ต่อชั่วโมง ไฟล์หลายช่องคิดเงินตามจำนวนช่อง ซึ่งอาจเปลี่ยนผลสำหรับสายสเตอริโอ
ทดสอบ AssemblyAI ก่อนเมื่อ: ต้นทุนเสียงบันทึกต่ำ ครอบคลุมภาษากว้าง ราคาฟีเจอร์ชัดเจน หรือเวิร์กโฟลว์อะซิงก์แบบง่ายคือสิ่งสำคัญ
4. Google Cloud Speech-to-Text: Best for Dynamic Batch and GCP-Native Workloads
ราคาของ Google Cloud Speech-to-Text V2 แสดง Dynamic Batch ที่ $0.003 ต่อนาที และ standard recognition ที่ $0.016 ต่อนาทีสำหรับ 500,000 นาทีแรกต่อเดือน ราคา standard ลดลงในชั้นการใช้งานสูงขึ้น
Dynamic Batch น่าสนใจสำหรับคลังที่ไม่ต้องการความเร่งด่วน แต่ราคาที่ต่ำผูกกับความเร่งด่วนการประมวลผลที่ต่ำกว่า Google คิดเงินทุกช่องเสียงแยก: คำขอ 30 วินาที 4 ช่อง คิดเป็น 120 วินาทีเสียงที่ประมวลผล
Google มักน่าดึงดูดเชิงปฏิบัติการเมื่อเสียงอยู่ใน Cloud Storage และทีมใช้ตัวตน GCP การบันทึก จุดปลายภูมิภาค และการควบคุมบิลลิง เพิ่มที่เก็บ โอนย้าย และบริการคลาวด์ข้างเคียงในโมเดลต้นทุนรวม แทนที่จะมองการถอดความเป็นรายการโดดเดี่ยว
ทดสอบ Google ก่อนเมื่อ: คลังใหญ่ที่ไม่เร่งด่วน การปฏิบัติการ GCP-native การปรับใช้ตามภูมิภาค หรือฟีเจอร์การปรับตัวสำคัญกว่าตารางราคาที่ง่ายที่สุด
5. Amazon Transcribe: Best for AWS-Native Contact-Center Audio
ราคาของ Amazon Transcribe แตกต่างตามภูมิภาคและชั้นการใช้รายเดือน ตัวอย่างสาธารณะของ AWS ใน US East สำหรับสองล้านนาทีต่อเดือนใช้ $0.006 ต่อนาทีสำหรับแบตช์ และ $0.01 ต่อนาทีสำหรับสตรีมมิง ตัวเลขเหล่านี้คือตัวอย่างปริมาณสูง ไม่ใช่ใบเสนอราคาเริ่มต้นทั่วไป
การใช้งานคิดเป็นหน่วยหนึ่งวินาทีโดยมีขั้นต่ำ 15 วินาทีต่อคำขอ ราคามาตรฐานรวมคำศัพท์กำหนดเอง การกรองคำศัพท์ การแยกผู้พูด และการระบุภาษา; การปกปิดเนื้อหาอัตโนมัติและโมเดลภาษากำหนดเองมีค่าใช้จ่ายเพิ่ม
AWS รวมได้สูงสุดสองช่องในเวลาคิดเงิน สำหรับสายสนับสนุนสเตอริโอ กฎนี้อาจเป็นบวกมากกว่าผู้ให้บริการที่คิดทุกช่องเป็นชั่วโมงแยก
ทดสอบ AWS ก่อนเมื่อ: สายไหลผ่าน AWS อยู่แล้ว การคิดเงินสองช่องมีคุณค่า หรือบูรณาการ IAM ที่เก็บ ความปลอดภัย และการจัดซื้อสำคัญกว่ารายการราคาเริ่มต้นที่ต่ำที่สุด
6. ElevenLabs Scribe: Best for Multilingual Media and Fast Real-Time Experiments
ราคาของ ElevenLabs API แสดง Scribe v2 ที่ $0.22 ต่อชั่วโมง และ Scribe v2 Realtime ที่ $0.39 ต่อชั่วโมง ผลิตภัณฑ์รวมการถอดความหลายภาษา เวลาระดับคำ การแยกผู้พูด การแท็กเสียง และฟีเจอร์คำสำคัญกับเอนทิตีแบบเลือกได้
Scribe v2 Realtime โฆษณาหน่วงโมเดลต่ำ แต่ผู้ซื้อควรวัดเส้นทางเต็มจากไมค์ถึงข้อความนิ่งในภูมิภาคและสแตกการขนส่งเป้าหมาย หน่วงของผู้ขายไม่รวมการจัดการ WebSocket ของคุณ เส้นทางเครือข่าย บัฟเฟอร์ การอัปเดต UI หรือโลจิกเอเจนต์ถัดไป
การตรวจจับเอนทิตีเพิ่ม $0.07 ต่อชั่วโมง และการชี้เป้าคำสำคัญเพิ่ม $0.05 ต่อชั่วโมง รวมทั้งสองอย่างในต้นทุนทรานสคริปต์ที่ยอมรับเมื่อจำเป็นสำหรับผลิตภัณฑ์
ทดสอบ ElevenLabs ก่อนเมื่อ: สื่อหลายภาษา เวลาคำ แท็กเสียง หรือโปรโตไทป์เรียลไทม์ที่รวดเร็วคือข้อกำหนดหลัก
Total Cost of Ownership: Hidden Costs That Can Reverse the Ranking
Multichannel Billing
สายสเตอริโอหนึ่งชั่วโมง ไม่ใช่เสมอไปหนึ่งชั่วโมงที่คิดเงิน
| Route | Planning calculation for a 60-minute, two-channel call | Estimated base cost |
|---|---|---|
| AssemblyAI Universal-2 | 1 hour × 2 channels × $0.15/hr | $0.30 |
| AWS Transcribe batch | 1 hour total × $0.36/hr | $0.36 |
| Google standard recognition | 1 hour × 2 channels × $0.96/hr | $1.92 |
*ค่า AWS ใช้ตัวอย่างอย่างเป็นทางการของผู้ให้บริการใน US East ที่สองล้านนาทีต่อเดือน ใช้เครื่องคิดเลข AWS สำหรับภูมิภาคและปริมาณรายเดือนจริงของคุณ
ตารางนี้เป็นตัวอย่างการคิดเงิน ไม่ใช่อันดับคอนแท็กต์เซ็นเตอร์ ทดสอบการพูดซ้อน การส่งไม้ต่อผู้พูด ศัพท์เฉพาะ การปกปิด หน่วงปิดผลลัพธ์ และความพยายามแก้ไขก่อนเลือกเส้นทาง
Add-Ons, Retries, and Human Review
การประมวลผลแบบบันทึก Nova-3 Monolingual ของ Deepgram จาก $0.0077 เพิ่มเป็น $0.0097 ต่อนาทีเมื่อเพิ่มการแยกผู้พูด การเพิ่มการปกปิดทำให้เป็น $0.0117 ต่อนาทีก่อนการชี้เป้าคำสำคัญ AssemblyAI คิด $0.02 ต่อชั่วโมงสำหรับการแยกผู้พูดแบบบันทึก และ $0.12 ต่อชั่วโมงสำหรับแบบเรียลไทม์ ElevenLabs คิด $0.07 ต่อชั่วโมงสำหรับการตรวจจับเอนทิตี และ $0.05 ต่อชั่วโมงสำหรับการชี้เป้าคำสำคัญ
การรีทราย เว็บฮุกซ้ำ ที่เก็บ และการโอนข้ามคลาวด์สามารถเพิ่มต้นทุนโดยไม่ทำให้ทรานสคริปต์ดีขึ้น บันทึกวินาทีเสียง จำนวนช่อง ธงฟีเจอร์ สถานะคำขอ การรีทราย รุ่นโมเดล หน่วงเวลา และเวลาตรวจทานสำหรับทุกงาน
ตัวชี้วัดการจัดซื้อที่ดีกว่าไม่ใช่ราคาต่อนาทีเสียง ต้นทุนต่อทรานสคริปต์ที่ยอมรับ = การประมวลผล API + ฟีเจอร์ที่ชำระเงิน + การรีทราย + ที่เก็บ/โอน + เวลาที่มนุษย์แก้ไข
สมมติผู้ตรวจทานมีค่าแรง $30 ต่อชั่วโมง:
| Illustrative route | API cost for one audio hour | Human correction | Correction cost | Total accepted-transcript cost |
|---|---|---|---|---|
| Lower-price route | $0.15 | 8 minutes | $4.00 | $4.15 |
| Higher-price route | $0.60 | 3 minutes | $1.50 | $2.10 |
เส้นทางที่สองมีค่า API สูงกว่าสี่เท่าแต่ถูกลงราวครึ่งหนึ่งหลังการตรวจทาน เวลาที่ใช้แก้ไขเป็นสมมติฐานการวางแผน ไม่ใช่ผลเบนช์มาร์กจากผู้ให้บริการ แทนที่ด้วยการวัดจริงจากผู้ที่อนุมัติทรานสคริปต์ในเวิร์กโฟลว์ของคุณ
How to Evaluate Speech-to-Text APIs on Real Audio
คำกล่าวอ้างความแม่นยำของผู้ขายเปรียบเทียบกันโดยตรงไม่ได้ เพราะใช้ชุดข้อมูล ภาษา นโยบายการทำให้เป็นมาตรฐาน รุ่นโมเดล และสภาพเสียงต่างกัน การศึกษา GigaSpeechBench ปี 2026 ประเมิน 680 ชั่วโมงของคำอธิบายมนุษย์ในโลกจริง ครอบคลุมภาษาทรัพยากรต่ำ สำเนียงจีน สำเนียงอังกฤษ ศัพท์จาก 12 โดเมน และเสียงเด็กกับผู้สูงอายุ ผลลัพธ์แสดงการเสื่อมลงอย่างมีนัยสำคัญสำหรับโมเดลชั้นนำและ API เชิงพาณิชย์ในสภาพยาก
ข้อสรุปที่เป็นประโยชน์ไม่ใช่ว่ามีผู้ชนะถาวรจากเบนช์มาร์กเดียว แต่คือชุดทดสอบของคุณต้องเหมือนทราฟฟิกของคุณ
Use a Production-Like Evaluation Set
- การประชุมหรือสัมภาษณ์ที่คมชัด 20 รายการมีชื่อและคำเฉพาะโดเมน
- สายสนับสนุนมีเสียงรบกวน 20 รายการพร้อมการขัดจังหวะ เพลงรอสาย พูดซ้อน และเปลี่ยนช่อง
- คลิปสำเนียงหรือหลายภาษา 20 รายการ รวมการสลับภาษาจริง
- พ็อดคาสต์หรือไฟล์วิดีโอยาว 10 รายการ
- คำพูดสั้นสด 10 รายการพร้อมความเงียบ ลังเล เริ่มพูดผิด และการแทรกซ้อน
Score More Than Word Error Rate
| Metric | What to measure | Why it matters |
|---|---|---|
| Word error rate | การเพิ่ม ลบ และแทนคำ ภายใต้นโยบายทำให้เป็นมาตรฐานชุดเดียว | จับความถูกต้องเชิงคำศัพท์ แต่ไม่ใช่ความใช้การได้ของทรานสคริปต์ทั้งหมด |
| Named-term accuracy | ชื่อผลิตภัณฑ์ บุคคล สถานที่ ตัวย่อ ตัวเลข และคำศัพท์อุตสาหกรรม | ความผิดพลาดเล็กน้อยกับชื่อ固有ทำให้ภาระตรวจแก้หนักได้ |
| Speaker attribution | คำที่ติดผู้พูดผิดและการพลาดเปลี่ยนผู้พูด | สำคัญสำหรับสายสนทนา สัมภาษณ์ การปฏิบัติตามข้อกำกับ และอนาไลติกส์ |
| Formatting quality | วรรคตอน ตัวพิมพ์ หัวข้อ ตัวเลข วันที่ และคำฟุ้งซ่าน | กำหนดเวลาเกลี้ยงก่อนเผยแพร่หรือวิเคราะห์ |
| Batch turnaround | p50 และ p95 ตั้งแต่อัปโหลดถึงผลสุดท้ายสำหรับไฟล์สั้นและยาว | เส้นทางความสำคัญต่ำราคาถูกอาจพลาดกำหนดปฏิบัติการ |
| Streaming latency | ข้อความบางส่วนแรก บางส่วนนิ่ง และทรานสคริปต์สุดท้ายที่ p50 และ p95 | ค่าเฉลี่ยซ่อนช่วงหยุดที่ผู้ใช้รู้สึกจริง |
| Reliability | การหมดเวลา ผลลัพธ์ว่าง การรีทราย เว็บฮุกซ้ำ และอัตราสำรอง | ความล้มเหลวเพิ่มต้นทุนตรงและหน่วงที่ผู้ใช้มองเห็น |
| Review effort | นาทีบรรณาธิการต่อชั่วโมงเสียงและอัตราทรานสคริปต์ที่ยอมรับ | แปลงคุณภาพผลลัพธ์เป็นต้นทุนธุรกิจ |
A Seven-Day Evaluation Plan
- กำหนดสัญญาการยอมรับ ระบุภาษา หน่วง p95 ความคลาดเคลื่อนป้ายผู้พูด ความต้องการเวลา กฎการเก็บรักษา และนาทีตรวจทานสูงสุดต่อชั่วโมงเสียง
- สร้างและติดป้ายชุดเสียง ใช้เสียงคล้ายผลิตจริงที่มีสิทธิ์และนโยบายทรานสคริปต์อ้างอิงชุดเดียว
- ทำให้การผสานงานเป็นมาตรฐาน ตรงรูปแบบเสียง ภูมิภาค คำใบ้คำศัพท์ เลย์เอาต์ช่อง การรีทราย ไทม์เอาต์ และรุ่นโมเดล
- รันทดสอบเสียงบันทึก วัดต้นทุน เวลาเสร็จ WER ชื่อเฉพาะ การจัดรูปแบบ ผู้พูด ความล้มเหลว และเวลาแก้ไข
- รันทดสอบเสียงสด วัดผลบางส่วนนิ่ง หน่วงปิดผล การปิดประโยค การจัดการขัดจังหวะ และพฤติกรรมเชื่อมต่อใหม่ที่ p50 และ p95
- คำนวณต้นทุนทรานสคริปต์ที่ยอมรับ รวมช่อง ฟีเจอร์ การรีทราย ที่เก็บ โอน และเวลาผู้ตรวจทาน
- เลือกนโยบายการจัดเส้นทาง แบบผลิตจริงที่ดีที่สุดอาจใช้เส้นทางหนึ่งสำหรับสายอังกฤษสด อีกเส้นทางสำหรับประชุมหลายภาษา และเส้นทางแบตช์ความสำคัญต่ำสำหรับคลัง
Production Checklist Before Signing a Contract
- ทดสอบโมเดลแบบบันทึกและแบบสดแยกกัน; ราคา ภาษา และพฤติกรรมอาจต่างกัน
- วัดผลบางส่วนนิ่งและการปิดผล ไม่ใช่แค่เวลาถึงข้อความแรก
- เปรียบเทียบการระบุช่องสเตอริโอกับการแยกผู้พูดช่องเดียวในกรณีพูดซ้อน
- บังคับไทม์เอาต์ เสียงผิดรูป ผลลัพธ์ว่าง การดรอปการเชื่อมต่อ การส่งเว็บฮุกซ้ำ และข้อผิดพลาดจำกัดอัตรา
- ยืนยันขนาดไฟล์ ระยะเวลาซেশন ความพร้อมพร้อมกัน ขีดจำกัดอัตรา และเวิร์กโฟลว์ไฟล์ยาว
- ยืนยันการเก็บรักษา การใช้เพื่อพัฒนาโมเดล การประมวลผลตามภูมิภาค การลบ การเข้ารหัส DPA หรือ BAA ที่มี และตัวประมวลผลย่อยสำหรับแผนที่เลือก
- เก็บรุ่นโมเดล วินาทีเสียง จำนวนช่อง ฟีเจอร์เพิ่ม ค่าคำขอ การรีทราย หน่วงเวลา นาทีตรวจทาน และสถานะการยอมรับ
- ทดสอบใหม่หลังการเปลี่ยนราคา/โมเดล แทนที่จะสมมติว่าผู้ชนะเดิมยังดีที่สุด
คัดเลือกผู้ให้บริการตามงาน แล้วเบนช์มาร์กโดยใช้เสียง การตั้งค่า และเกณฑ์การยอมรับเดียวกัน สำหรับทีมส่วนใหญ่ รอบแรกที่ใช้งานได้จริงควรรวมเส้นทางเสียงบันทึกต้นทุนต่ำหนึ่งเส้นทาง เส้นทางสตรีมมิงเฉพาะทางหนึ่งเส้นทาง และผู้ให้บริการหนึ่งรายที่สอดคล้องกับคลาวด์หรือ SDK ที่มีอยู่
Test Supported Speech Models Through CometAPI
ทีมที่ประเมินโมเดลเสียงที่รองรับแบบเข้ากันได้กับ OpenAI สามารถทำตาม CometAPI Quickstart เพื่อรันคำขอถอดความเบื้องต้นผ่าน endpoint แบบรวม
CometAPI สามารถทำให้ง่ายขึ้นในด้านการยืนยันตัวตน การคิดเงิน และการผสานไคลเอนต์สำหรับโมเดลที่รองรับ ก่อนขึ้นผลิตจริง ให้ยืนยันรูปแบบที่รองรับ ขีดจำกัด เงื่อนไขความเป็นส่วนตัว หน่วง และพฤติกรรมการคิดเงินของแต่ละโมเดล
Frequently Asked Questions
What is the best speech-to-text API in 2026?
ไม่มีผู้ชนะหนึ่งเดียวสำหรับทุกงาน AssemblyAI และ Google Dynamic Batch เป็นตัวเลือกเสียงบันทึกต้นทุนต่ำที่แข็งแรง Deepgram, AssemblyAI และ ElevenLabs ควรทดสอบตั้งแต่ต้นสำหรับถ่ายทอดสด OpenAI สะดวกในสแตกที่เข้ากันได้กับ OpenAI ขณะที่ AWS และ Google อาจง่ายเชิงปฏิบัติการภายในคลาวด์ของตน
What is the cheapest speech-to-text API for recorded audio?
ในเส้นทางสาธารณะที่ทำให้เทียบกันที่นี่ AssemblyAI Universal-2 เริ่มที่ $0.15 ต่อชั่วโมงเสียง Google Dynamic Batch และ OpenAI gpt-4o-mini-transcribe เทียบได้ราว $0.18 ต่อชั่วโมง ต้นทุนสุดท้ายอาจเปลี่ยนตามจำนวนช่อง ชั้นปริมาณ ฟีเจอร์เพิ่ม การรีทราย ที่เก็บ โอน และการแก้ไขโดยมนุษย์
Which API is best for real-time transcription or voice agents?
เริ่มจาก Deepgram, AssemblyAI และ ElevenLabs จากนั้นเพิ่ม OpenAI, AWS หรือ Google เมื่อสอดคล้องกับระบบนิเวศหรือการรองรับภาษา เปรียบเทียบผลบางส่วนนิ่ง การปิดผล การปิดประโยค การจัดการขัดจังหวะ พฤติกรรมเชื่อมต่อใหม่ และหน่วง p95 บนทราฟฟิกสดของคุณเอง
How should I compare speech-to-text accuracy?
ใช้เสียงที่มีสิทธิ์ ภูมิภาค การตั้งค่าโมเดล และนโยบายทำให้เป็นมาตรฐานเดียวกันสำหรับทุกผู้ให้บริการ รายงาน word error rate พร้อมความถูกต้องของชื่อเฉพาะ การระบุผู้พูด การจัดรูปแบบ หน่วง p95 อัตราความล้มเหลว และนาทีบรรณาธิการต่อชั่วโมงเสียง อย่ารวมคำกล่าวอ้างเบนช์มาร์กของผู้ขายที่ไม่เกี่ยวข้องเป็นอันดับสากลเดียว
