ข้อกำหนดทางเทคนิคของ Eleven v4
| รายการ | ข้อกำหนด |
|---|---|
| ชื่อโมเดล | Eleven v4 |
| รหัสโมเดล CometAPI | eleven_v4 |
| ผู้ให้บริการดั้งเดิม | ElevenLabs |
| หมวดหมู่โมเดล | การแปลงข้อความเป็นเสียง (TTS) |
| รูปแบบ API หลัก | API แปลงข้อความเป็นเสียงที่เข้ากันได้กับ Runway |
| ปลายทาง CometAPI | POST /runwayml/v1/text_to_speech |
| อินพุต | ข้อความพรอมต์และการตั้งค่าเสียงสำเร็จรูป |
| เอาต์พุต | เสียงพูดที่สร้างขึ้น; CometAPI ระบุการส่งออกเป็น MP3 |
| ขีดจำกัดข้อความของ CometAPI | สูงสุด 2,500 อักขระต่อคำขอ ตามประกาศเมื่อวันที่ 10 ตุลาคม 2026 |
| ขีดจำกัดข้อความแบบเนทีฟของ ElevenLabs | 10,000 อักขระต่อคำขอ |
| การรองรับภาษา | มากกว่า 90 ภาษาในโมเดล Eleven v4 แบบเนทีฟ |
| ตัวควบคุมเสียง | ความเสถียร การเพิ่มความคล้ายคลึง สไตล์ ความเร็ว และการเพิ่มผู้พูด โดยขึ้นอยู่กับการรองรับของเกตเวย์ |
| ตัวควบคุมเชิงแสดงออก | แท็กเช่น [laughs], [whispers] และ [pause] |
| บทสนทนาหลายผู้พูด | รองรับโดยโมเดล Eleven v4 แบบเนทีฟผ่าน Text to Dialogue API |
| การประมวลผล | การส่งงานแบบอะซิงโครนัสและการสำรวจสถานะผ่าน CometAPI |
| รูปแบบเสียง | เอาต์พุต MP3 ตามที่ CometAPI ระบุ; โปรดยืนยันตัวเลือกฟอร์แมตที่มีในสคีมาของปลายทางปัจจุบัน |
แหล่งข้อมูล: ประกาศโมเดลของ CometAPI และเอกสาร CometAPI Runway Text-to-Speech API ความสามารถของโมเดลเนทีฟมีการบันทึกโดย ElevenLabs
Eleven v4 คืออะไร?
Eleven v4 เป็นโมเดลสังเคราะห์เสียงเชิงแสดงออกของ ElevenLabs ออกแบบมาเพื่อสร้างเสียงพูดที่เป็นธรรมชาติ พร้อมการถ่ายทอดอารมณ์ที่หลากหลาย การรับรู้บริบท และความคงเส้นคงวาของเสียงสูง เหมาะอย่างยิ่งสำหรับการบรรยาย การพากย์ตัวละคร หนังสือเสียง และบทสนทนา ที่วิธีการแสดงผลของแต่ละบรรทัดสำคัญพอๆ กับตัวบทเอง
ผ่าน CometAPI โมเดลนี้พร้อมใช้งานโดยใช้ตัวระบุ eleven_v4 ผ่านอินเทอร์เฟซแปลงข้อความเป็นเสียงที่เข้ากันได้กับ Runway เกตเวย์จะกำหนดรูปแบบคำขอและข้อจำกัดของตนเอง ดังนั้นควรใช้ขีดจำกัดจำนวนอักขระตามที่ CometAPI ระบุเมื่อผสานโมเดล แทนการสมมติว่าขีดจำกัดของ ElevenLabs API แบบเนทีฟใช้ได้
คุณสมบัติหลักของ Eleven v4
- การสังเคราะห์เสียงเชิงแสดงออก: สร้างเสียงพูดที่มีอารมณ์ละเอียด น้ำหนัก การเว้นจังหวะ และการถ่ายทอดที่เหมาะสม เหมาะกับสคริปต์เชิงอารมณ์มากกว่าการบรรยายแบบเรียบสม่ำเสมอ
- การแสดงเสียงธรรมชาติ: สร้างเสียงพูดคล้ายมนุษย์สำหรับตัวละคร การเล่าเรื่อง การบรรยายแบบมืออาชีพ และบทสนทนา
- การสร้างหลายภาษา: โมเดลเนทีฟรองรับมากกว่า 90 ภาษา รวมถึง อังกฤษ ญี่ปุ่น จีนกลาง เกาหลี ฝรั่งเศส และสเปน
- การควบคุมเสียงแบบละเอียด: รองรับพารามิเตอร์ เช่น ความเสถียร การเพิ่มความคล้ายคลึง สไตล์ ความเร็ว และการเพิ่มผู้พูด ช่วยให้ผู้พัฒนาปรับการถ่ายทอดและความคงเส้นคงวาของเสียงได้
- แท็กอารมณ์และการถ่ายทอด: แท็กอย่าง
[laughs],[whispers]และ[pause]สามารถกำกับการถ่ายทอดเชิงอารมณ์ในคำขอที่รองรับได้ - การผสาน API แบบอะซิงโครนัส: CometAPI รับงานสร้างเสียงและส่งคืนรหัสงาน (task ID) ซึ่งใช้ดึงสถานะและไฟล์เสียงที่ได้
ความพร้อมของฟีเจอร์และขีดจำกัดอินพุตอาจแตกต่างกันระหว่างปลายทางของ ElevenLabs แบบเนทีฟและเกตเวย์ของ CometAPI
Eleven v4 เทียบกับ Eleven v4 Turbo เทียบกับ Eleven v3
| โมเดล | จุดเด่นหลัก | กรณีใช้งานที่เหมาะสมที่สุด |
|---|---|---|
| Eleven v4 (eleven_v4) | การแสดงออกทางอารมณ์ที่เข้มข้นและเสียงความเที่ยงตรงสูง | หนังสือเสียง การบรรยาย แอนิเมชัน และบทสนทนาตัวละคร |
| Eleven v4 Turbo (eleven_v4_turbo) | เสียงเชิงแสดงออกที่ปรับให้หน่วงต่ำ; เวลาแฝงการอนุมานค่ามัธยฐานแบบเนทีฟประมาณ 100 ms | แอปเสียงเชิงโต้ตอบและเอเจนต์แบบเรียลไทม์ |
| Eleven v3 (eleven_v3) | เสียงเชิงแสดงออกพร้อมการถ่ายทอดเชิงดรามาและการควบคุมแท็กเสียง | การแสดงเสียงที่เน้นอารมณ์และฉากตัวละคร |
| Eleven Multilingual v2 (eleven_multilingual_v2) | คุณภาพเสียงหลายภาษาที่เสถียร โดยเฉพาะสำหรับคอนเทนต์รูปแบบยาว | การบรรยายที่สม่ำเสมอและการผลิตหลายภาษา |
การเปรียบเทียบเหล่านี้อธิบายโมเดล ElevenLabs แบบเนทีฟ ความพร้อมใช้งานและประสิทธิภาพผ่าน CometAPI ขึ้นอยู่กับปลายทางที่เปิดเผยและการใช้งานของมัน
กรณีใช้งานตัวอย่าง
- การผลิตหนังสือเสียง: สร้างการบรรยายเชิงอารมณ์ด้วยจังหวะธรรมชาติและการแยกแยะบุคลิกตัวละคร
- แอนิเมชันและเกม: สร้างบทสนทนาตัวละครพร้อมสัญญาณอารมณ์ การหยุด และการถ่ายทอดที่หลากหลาย
- พากย์วิดีโอ: ผลิตการบรรยายสำหรับวิดีโอโฆษณา บทเรียน สารคดี และวิดีโออธิบาย
- คอนเทนต์หลายภาษา: สร้างเสียงสำหรับเวิร์กโฟลว์คอนเทนต์ระดับสากลในภาษาที่รองรับ
- การเล่าเรื่องเชิงสร้างสรรค์: ผลิตการอ่านเชิงดรามา ฉากบทสนทนา และเสียงที่ขับเคลื่อนด้วยตัวละคร
- การผลิตคอนเทนต์อัตโนมัติ: ผสานการสร้างเสียงเข้ากับสายงานเผยแพร่โดยใช้เวิร์กโฟลว์งานแบบอะซิงโครนัสของ CometAPI
ข้อจำกัดและหมายเหตุการใช้งาน
- ขีดจำกัดอักขระเฉพาะเกตเวย์: CometAPI ประกาศขีดจำกัด 2,500 อักขระต่อคำขอสำหรับ Eleven v4 เมื่อวันที่ 10 ตุลาคม 2026 ซึ่งต่ำกว่าขีดจำกัดแบบเนทีฟของ ElevenLabs ที่ 10,000 อักขระ แบ่งสคริปต์ที่ยาวกว่าออกเป็นส่วนที่สอดคล้องกัน และตรวจสอบกฎการตรวจสอบของเกตเวย์ในปัจจุบัน
- ความเชิงแสดงออกต้องการการปรับแต่ง: การถ่ายทอดอารมณ์สูงอาจไม่เหมาะกับทุกสคริปต์ ทดสอบการตั้งค่าความเสถียรและสไตล์ในจุดที่รองรับ
- การออกเสียงต้องทบทวน: ชื่อ ตัวย่อ ตัวเลข และข้อความหลายภาษาอาจต้องการการทำให้เป็นรูปแบบมาตรฐานหรือการปรับการสะกด
- ความต่อเนื่องของส่วน: เมื่อแบ่งสคริปต์ยาว ให้ใช้ฟิลด์
previousTextและnextTextที่รองรับในจุดที่มี เพื่อช่วยคงการทรานซิชันให้ราบรื่น - ความพร้อมของเสียงขึ้นกับเกตเวย์: ใช้รหัสเสียงสำเร็จรูปที่ CometAPI เปิดเผย อย่าสมมติว่าเสียงทุกเสียงในไลบรารีของ ElevenLabs แบบเนทีฟจะพร้อมใช้งานผ่านอินเทอร์เฟซนี้
- การประมวลผลแบบอะซิงโครนัส: การส่งงานสำเร็จไม่ได้หมายความว่าเสียงพร้อมทันที จัดเก็บรหัสงาน สำรวจสถานะจนเสร็จสิ้น และจัดการความล้มเหลว
- ไม่ใช่โมเดลรู้จำเสียงพูด: Eleven v4 สร้างเสียงจากข้อความ ไม่ได้ออกแบบมาเพื่อถอดความเสียงที่เข้ามา
วิธีเข้าถึง API ของ Eleven v4 ผ่าน CometAPI
ปลายทางที่มีเอกสารถูกระบุคือ POST /runwayml/v1/text_to_speech โดยใช้การตรวจสอบสิทธิ์แบบ Bearer และอินพุต JSON CometAPI ส่งคืนรหัสงานซึ่งใช้ตรวจสอบสถานะและดึงไฟล์เสียงที่ได้