Specyfikacje techniczne Eleven v4
| Pozycja | Specyfikacja |
|---|---|
| Nazwa modelu | Eleven v4 |
| CometAPI Model ID | eleven_v4 |
| Oryginalny dostawca | ElevenLabs |
| Kategoria modelu | Synteza mowy (TTS) |
| Główny format API | API Text-to-Speech zgodne z Runway |
| Endpoint CometAPI | POST /runwayml/v1/text_to_speech |
| Wejście | Tekstowy prompt i predefiniowana konfiguracja głosu |
| Wyjście | Wygenerowany dźwięk mowy; CometAPI deklaruje wyjście w formacie MP3 |
| Limit tekstu w CometAPI | Do 2 500 znaków na żądanie, zgodnie z ogłoszeniem z 10 października 2026 r. |
| Natywny limit w ElevenLabs | 10 000 znaków na żądanie |
| Obsługa języków | Ponad 90 języków w natywnym modelu Eleven v4 |
| Kontrola głosu | stability, similarity boost, style, speed i speaker boost, zależnie od wsparcia po stronie gateway |
| Kontrola ekspresji | Tagi takie jak [laughs], [whispers] i [pause] |
| Dialog wielomówcowy | Obsługiwane przez natywny model Eleven v4 poprzez Text to Dialogue API |
| Przetwarzanie | Asynchroniczne przesyłanie zadań i odpytywanie statusu przez CometAPI |
| Format audio | Wyjście MP3 ogłoszone przez CometAPI; potwierdź dostępne opcje formatów w bieżącym schemacie endpointu |
Źródła: ogłoszenie modelu CometAPI i dokumentacja CometAPI Runway Text-to-Speech API. Zdolności natywnego modelu są udokumentowane przez ElevenLabs.
Czym jest Eleven v4?
Eleven v4 to ekspresyjny model syntezy mowy ElevenLabs, zaprojektowany do generowania naturalnie brzmiącej mowy z bogatą ekspresją emocjonalną, świadomością kontekstu i wysoką spójnością głosu. Szczególnie nadaje się do narracji, głosów postaci, audiobooków i dialogów, w których sposób wykonania kwestii jest równie istotny jak same słowa.
Przez CometAPI model jest dostępny z identyfikatorem eleven_v4 poprzez interfejs Text-to-Speech zgodny z Runway. Gateway dodaje własny format żądań i ograniczenia, dlatego przy integracji należy stosować udokumentowany przez CometAPI limit znaków, zamiast zakładać, że obowiązuje natywny limit API ElevenLabs.
Główne funkcje Eleven v4
- Ekspresyjna synteza mowy: Generuje mowę z niuansami emocji, akcentów, tempa i ekspresji, dzięki czemu nadaje się do ekspresyjnych scenariuszy zamiast płaskiej, jednolitej narracji.
- Naturalna realizacja głosu: Tworzy ludzkopodobną mowę dla postaci, opowieści, profesjonalnej narracji i konwersacyjnych dialogów.
- Wielojęzyczne generowanie: Natywny model obsługuje ponad 90 języków, w tym angielski, japoński, mandaryński, koreański, francuski i hiszpański.
- Precyzyjna kontrola głosu: Obsługiwane parametry obejmują stability, similarity boost, style, speed i speaker boost, co pozwala dostrajać ekspresję i spójność głosu.
- Tagi emocji i wykonania: Tagi takie jak
[laughs],[whispers]i[pause]mogą kierować ekspresją w obsługiwanych żądaniach. - Asynchroniczna integracja API: CometAPI przyjmuje zadanie generowania mowy i zwraca identyfikator zadania, którego można użyć do sprawdzenia statusu i pobrania wynikowego audio.
Dostępność funkcji i limity wejścia mogą różnić się pomiędzy natywnymi endpointami ElevenLabs a gatewayem CometAPI.
Eleven v4 vs. Eleven v4 Turbo vs. Eleven v3
| Model | Główna mocna strona | Najlepsze zastosowanie |
|---|---|---|
| Eleven v4 (eleven_v4) | Bogata ekspresja emocjonalna i wysokiej jakości mowa | Audiobooki, narracja, animacja i dialogi postaci |
| Eleven v4 Turbo (eleven_v4_turbo) | Ekspresyjna mowa zoptymalizowana pod kątem niskich opóźnień; natywna mediana opóźnienia inferencji około 100 ms | Interaktywne aplikacje głosowe i agenci czasu rzeczywistego |
| Eleven v3 (eleven_v3) | Ekspresyjna mowa z dramatyczną realizacją i kontrolą tagów audio | Występy głosowe o silnym ładunku emocjonalnym i sceny z postaciami |
| Eleven Multilingual v2 (eleven_multilingual_v2) | Stabilna jakość wielojęzycznej mowy, szczególnie dla treści długich | Spójna narracja i produkcja wielojęzyczna |
Te porównania opisują natywne modele ElevenLabs. Dostępność i wydajność przez CometAPI zależą od udostępnionego endpointu i implementacji.
Przykładowe przypadki użycia
- Produkcja audiobooków: Generowanie ekspresyjnej narracji z naturalnym tempem i zróżnicowaniem postaci.
- Animacja i gry: Tworzenie dialogów postaci z sygnałami emocjonalnymi, pauzami i zróżnicowaną ekspresją.
- Lektory do wideo: Generowanie narracji do materiałów promocyjnych, tutoriali, dokumentów i explainerów.
- Treści wielojęzyczne: Generowanie mowy na potrzeby międzynarodowych procesów treści w obsługiwanych językach.
- Kreatywne opowiadanie historii: Tworzenie dramatycznych czytań, scen dialogowych i audio z udziałem postaci.
- Zautomatyzowana produkcja treści: Integracja generowania mowy w pipeline’ach wydawniczych z wykorzystaniem asynchronicznego przepływu zadań CometAPI.
Ograniczenia i uwagi implementacyjne
- Limit znaków specyficzny dla gatewaya: CometAPI ogłosiło 2 500 znaków na żądanie dla Eleven v4 w dniu 10 października 2026 r. To mniej niż natywny limit ElevenLabs wynoszący 10 000 znaków. Dłuższe skrypty dziel na spójne segmenty i zweryfikuj aktualne reguły walidacji gatewaya.
- Ekspresja wymaga strojenia: Bardzo emocjonalna realizacja może nie pasować do każdego skryptu. Testuj ustawienia stability i style tam, gdzie są obsługiwane.
- Wymowa wymaga przeglądu: Nazwy, skróty, liczby i tekst wielojęzyczny mogą wymagać normalizacji lub zmienionej pisowni.
- Ciągłość segmentów: Przy dzieleniu długich skryptów używaj obsługiwanych pól
previousTextinextText, gdy są dostępne, aby utrzymać spójne przejścia. - Dostępność głosów zależy od gatewaya: Używaj predefiniowanych identyfikatorów głosów udostępnionych przez CometAPI. Nie zakładaj, że każdy głos z natywnej biblioteki ElevenLabs jest dostępny przez ten interfejs.
- Przetwarzanie asynchroniczne: Pomyślne przesłanie zadania nie oznacza natychmiastowej gotowości audio. Zachowaj identyfikator zadania, odpytywaj o zakończenie i obsługuj błędy.
- To nie jest model rozpoznawania mowy: Eleven v4 generuje mowę z tekstu; nie służy do transkrypcji nagrań audio.
Jak uzyskać dostęp do API Eleven v4 przez CometAPI
Udokumentowany endpoint to POST /runwayml/v1/text_to_speech, z uwierzytelnianiem Bearer i wejściem JSON. CometAPI zwraca identyfikator zadania, którego można użyć do sprawdzenia statusu i pobrania wynikowego audio.