Spesifikasi teknis Eleven v4
| Item | Spesifikasi |
|---|---|
| Model name | Eleven v4 |
| CometAPI Model ID | eleven_v4 |
| Original provider | ElevenLabs |
| Model category | Text-to-Speech (TTS) |
| Primary API format | API Teks-ke-Ucapan yang kompatibel dengan Runway |
| CometAPI endpoint | POST /runwayml/v1/text_to_speech |
| Input | Prompt teks dan konfigurasi suara preset |
| Output | Audio ucapan yang dihasilkan; CometAPI mengumumkan output MP3 |
| CometAPI text limit | Hingga 2.500 karakter per permintaan, menurut pengumuman 10 Oktober 2026 |
| Native ElevenLabs text limit | 10.000 karakter per permintaan |
| Language support | 90+ bahasa pada model native Eleven v4 |
| Voice controls | stability, similarity boost, style, speed dan speaker boost, tergantung dukungan gateway |
| Expressive controls | Tag seperti [laughs], [whispers] dan [pause] |
| Multi-speaker dialogue | Didukung oleh model native Eleven v4 melalui Text to Dialogue API |
| Processing | Pengajuan tugas asinkron dan polling status melalui CometAPI |
| Audio format | Output MP3 diumumkan oleh CometAPI; konfirmasikan opsi format yang tersedia di skema endpoint saat ini |
Sumber: Pengumuman model CometAPI dan dokumentasi CometAPI Runway Text-to-Speech API. Kapabilitas model native didokumentasikan oleh ElevenLabs.
Apa itu Eleven v4?
Eleven v4 adalah model sintesis ucapan ekspresif dari ElevenLabs, dirancang untuk menghasilkan ucapan yang terdengar alami dengan penyampaian emosional yang kaya, kesadaran kontekstual, dan konsistensi suara yang kuat. Model ini sangat cocok untuk narasi, pengisian suara karakter, buku audio, dan dialog di mana cara sebuah kalimat disampaikan sama pentingnya dengan kata-katanya.
Melalui CometAPI, model ini tersedia menggunakan pengidentifikasi eleven_v4 melalui antarmuka teks-ke-ucapan yang kompatibel dengan Runway. Gateway menambahkan format permintaan dan batasannya sendiri, sehingga batas karakter yang didokumentasikan oleh CometAPI harus digunakan saat mengintegrasikan model, alih-alih berasumsi bahwa batas API native ElevenLabs berlaku.
Fitur utama Eleven v4
- Sintesis ucapan ekspresif: Menghasilkan ucapan dengan emosi, penekanan, tempo, dan penyampaian yang bernuansa, sehingga cocok untuk naskah ekspresif alih-alih narasi datar dan seragam.
- Performa suara yang natural: Menghasilkan ucapan mirip manusia untuk karakter, penceritaan, narasi profesional, dan dialog percakapan.
- Generasi multibahasa: Model native mendukung lebih dari 90 bahasa, termasuk Bahasa Inggris, Jepang, Mandarin, Korea, Prancis, dan Spanyol.
- Kontrol suara yang terperinci: Parameter yang didukung mencakup stability, similarity boost, style, speed, dan speaker boost, memungkinkan pengembang menyetel penyampaian dan konsistensi suara.
- Tag emosi dan penyampaian: Tag seperti
[laughs],[whispers]dan[pause]dapat membimbing penyampaian ekspresif dalam permintaan yang didukung. - Integrasi API asinkron: CometAPI menerima tugas generasi ucapan dan mengembalikan ID tugas yang dapat digunakan untuk mengambil status dan audio hasilnya.
Ketersediaan fitur dan batas input dapat berbeda antara endpoint native ElevenLabs dan gateway CometAPI.
Perbandingan Eleven v4 vs. Eleven v4 Turbo vs. Eleven v3
| Model | Kekuatan utama | Kasus penggunaan terbaik |
|---|---|---|
| Eleven v4 (eleven_v4) | Ekspresi emosional yang kaya dan ucapan berkualitas tinggi | Buku audio, narasi, animasi, dan dialog karakter |
| Eleven v4 Turbo (eleven_v4_turbo) | Ucapan ekspresif yang dioptimalkan untuk latensi rendah; latensi inferensi median native sekitar 100 ms | Aplikasi suara interaktif dan agen waktu nyata |
| Eleven v3 (eleven_v3) | Ucapan ekspresif dengan penyampaian dramatis dan kontrol audio-tag | Performa suara dengan emosi kuat dan adegan karakter |
| Eleven Multilingual v2 (eleven_multilingual_v2) | Kualitas ucapan multibahasa yang stabil, khususnya untuk konten berdurasi panjang | Narasi yang konsisten dan produksi multibahasa |
Perbandingan ini menggambarkan model native ElevenLabs. Ketersediaan dan performa melalui CometAPI bergantung pada endpoint yang diekspos dan implementasinya.
Kasus penggunaan representatif
- Produksi buku audio: Menghasilkan narasi ekspresif dengan tempo natural dan diferensiasi karakter.
- Animasi dan gim: Membuat dialog karakter dengan isyarat emosi, jeda, dan penyampaian yang bervariasi.
- Pengisian suara video: Menghasilkan narasi untuk video promosi, tutorial, dokumenter, dan penjelasan.
- Konten multibahasa: Menghasilkan ucapan untuk alur kerja konten internasional di berbagai bahasa yang didukung.
- Penceritaan kreatif: Menghasilkan pembacaan dramatis, adegan dialog, dan audio berbasis karakter.
- Produksi konten terotomatisasi: Mengintegrasikan generasi ucapan ke pipeline publikasi menggunakan alur tugas asinkron CometAPI.
Batasan dan catatan implementasi
- Batas karakter khusus gateway: CometAPI mengumumkan batas 2.500 karakter per permintaan untuk Eleven v4 pada 10 Oktober 2026. Ini lebih rendah daripada batas native ElevenLabs sebesar 10.000 karakter. Bagi naskah yang lebih panjang menjadi segmen yang koheren dan verifikasi aturan validasi gateway saat ini.
- Ekspresivitas memerlukan penyetelan: Penyampaian yang sangat emosional mungkin tidak cocok untuk setiap naskah. Uji pengaturan stability dan style jika didukung.
- Pelafalan perlu ditinjau: Nama, singkatan, angka, dan teks multibahasa mungkin perlu dinormalisasi atau ejaan yang direvisi.
- Kontinuitas segmen: Saat membagi naskah panjang, gunakan field
previousTextdannextTextyang didukung jika tersedia untuk membantu menjaga transisi yang koheren. - Ketersediaan suara bersifat spesifik gateway: Gunakan ID suara preset yang diekspos oleh CometAPI. Jangan berasumsi setiap suara di pustaka native ElevenLabs tersedia melalui antarmuka ini.
- Pemrosesan asinkron: Pengajuan tugas yang berhasil tidak berarti audio langsung siap. Simpan ID tugas, lakukan polling hingga selesai, dan tangani kegagalan.
- Bukan model pengenalan suara: Eleven v4 menghasilkan ucapan dari teks; model ini tidak dimaksudkan untuk mentranskripsikan audio masukan.
Cara mengakses API Eleven v4 melalui CometAPI
Endpoint yang didokumentasikan adalah POST /runwayml/v1/text_to_speech, menggunakan autentikasi Bearer dan input JSON. CometAPI mengembalikan ID tugas yang dapat digunakan untuk memeriksa status dan mengambil audio hasilnya.