Eleven v4의 기술 사양
| 항목 | 사양 |
|---|---|
| 모델 이름 | Eleven v4 |
| CometAPI 모델 ID | eleven_v4 |
| 원 제공사 | ElevenLabs |
| 모델 카테고리 | 텍스트-투-스피치 (TTS) |
| 주요 API 형식 | Runway 호환 텍스트-투-스피치 API |
| CometAPI 엔드포인트 | POST /runwayml/v1/text_to_speech |
| 입력 | 텍스트 프롬프트와 사전 설정된 음성 구성 |
| 출력 | 생성된 음성 오디오; CometAPI는 MP3 출력을 공지 |
| CometAPI 텍스트 제한 | 2026년 10월 10일 공지에 따르면 요청당 최대 2,500자 |
| 네이티브 ElevenLabs 텍스트 제한 | 요청당 10,000자 |
| 언어 지원 | 네이티브 Eleven v4 모델에서 90개 이상의 언어 |
| 음성 제어 | Stability, similarity boost, style, speed 및 speaker boost(게이트웨이 지원 여부에 따름) |
| 표현 제어 | [laughs], [whispers], [pause]와 같은 태그 |
| 다중 화자 대화 | Text to Dialogue API를 통해 네이티브 Eleven v4 모델에서 지원 |
| 처리 | CometAPI를 통한 비동기 작업 제출 및 상태 폴링 |
| 오디오 형식 | CometAPI에서 MP3 출력이 공지됨; 현재 엔드포인트 스키마에서 사용 가능한 형식 옵션을 확인 |
출처: CometAPI 모델 공지 및 CometAPI Runway Text-to-Speech API 문서. 네이티브 모델 기능은 ElevenLabs에서 문서화되어 있습니다.
Eleven v4란?
Eleven v4는 ElevenLabs의 표현적 음성 합성 모델로, 풍부한 감정 표현, 문맥 인지, 높은 음색 일관성을 바탕으로 자연스러운 음성을 생성하도록 설계되었습니다. 대사 자체만큼이나 연기 방식이 중요한 내레이션, 캐릭터 보이스오버, 오디오북, 대화에 특히 적합합니다.
CometAPI를 통해 이 모델은 Runway 호환 텍스트-투-스피치 인터페이스에서 식별자 eleven_v4로 제공됩니다. 게이트웨이가 자체 요청 형식과 제약을 추가하므로, 통합 시에는 네이티브 ElevenLabs API 제한이 적용된다고 가정하지 말고 CometAPI에 문서화된 문자 제한을 기준으로 사용해야 합니다.
Eleven v4의 주요 기능
- 표현적 음성 합성: 섬세한 감정, 강조, 템포와 딜리버리를 갖춘 음성을 생성하여, 단조롭고 획일적인 내레이션보다 표현적인 스크립트에 적합합니다.
- 자연스러운 음성 퍼포먼스: 캐릭터, 스토리텔링, 전문 내레이션, 대화에 인간에 가까운 음성을 생성합니다.
- 다국어 생성: 네이티브 모델이 영어, 일본어, 중국어(만다린), 한국어, 프랑스어, 스페인어 등 90개 이상의 언어를 지원합니다.
- 정밀한 음성 제어: stability, similarity boost, style, speed, speaker boost 등의 파라미터를 통해 딜리버리와 음색 일관성을 조정할 수 있습니다.
- 감정 및 딜리버리 태그:
[laughs],[whispers],[pause]와 같은 태그를 지원 요청에서 사용해 표현적 딜리버리를 유도할 수 있습니다. - 비동기 API 통합: CometAPI가 음성 생성 작업을 접수하고 작업 ID를 반환하며, 이를 통해 상태와 결과 오디오를 조회할 수 있습니다.
기능 제공 여부와 입력 제한은 네이티브 ElevenLabs 엔드포인트와 CometAPI 게이트웨이 간에 다를 수 있습니다.
Eleven v4 vs. Eleven v4 Turbo vs. Eleven v3
| 모델 | 핵심 강점 | 추천 사용 사례 |
|---|---|---|
| Eleven v4 (eleven_v4) | 풍부한 감정 표현과 고충실도 음성 | 오디오북, 내레이션, 애니메이션 및 캐릭터 대화 |
| Eleven v4 Turbo (eleven_v4_turbo) | 낮은 지연시간에 최적화된 표현적 음성; 네이티브 중앙 추론 지연시간 약 100 ms | 대화형 음성 애플리케이션 및 실시간 에이전트 |
| Eleven v3 (eleven_v3) | 극적인 딜리버리와 오디오 태그 제어를 갖춘 표현적 음성 | 감정이 강조된 음성 퍼포먼스와 캐릭터 장면 |
| Eleven Multilingual v2 (eleven_multilingual_v2) | 특히 장편 콘텐츠에서 안정적인 다국어 음성 품질 | 일관된 내레이션과 다국어 제작 |
이 비교는 네이티브 ElevenLabs 모델을 설명합니다. CometAPI를 통한 가용성과 성능은 노출된 엔드포인트와 구현에 따라 달라집니다.
대표적인 사용 사례
- 오디오북 제작: 자연스러운 템포와 캐릭터 차별화를 갖춘 표현력 있는 내레이션 생성.
- 애니메이션 및 게임: 감정 신호, 일시 정지, 다양한 딜리버리를 갖춘 캐릭터 대화 생성.
- 비디오 보이스오버: 홍보 영상, 튜토리얼, 다큐멘터리, 설명 영상의 내레이션 제작.
- 다국어 콘텐츠: 지원 언어 전반의 국제 콘텐츠 워크플로를 위한 음성 생성.
- 크리에이티브 스토리텔링: 드라마틱한 낭독, 대화 장면, 캐릭터 중심 오디오 제작.
- 자동화된 콘텐츠 제작: CometAPI의 비동기 작업 워크플로를 사용해 퍼블리싱 파이프라인에 음성 생성을 통합.
제한 사항 및 구현 노트
- 게이트웨이별 문자 제한: CometAPI는 2026년 10월 10일 Eleven v4에 대해 요청당 2,500자 제한을 공지했습니다. 이는 네이티브 ElevenLabs의 10,000자 제한보다 낮습니다. 더 긴 스크립트는 의미 단위로 분할하고 현재 게이트웨이 검증 규칙을 확인하십시오.
- 표현력 튜닝 필요: 감정 표현이 강한 딜리버리는 모든 스크립트에 적합하지 않을 수 있습니다. 지원되는 경우 stability와 style 설정을 테스트하십시오.
- 발음 검토 필요: 이름, 약어, 숫자 및 다국어 텍스트는 정규화 또는 표기 수정이 필요할 수 있습니다.
- 세그먼트 연속성: 긴 스크립트를 분할할 때는 가능한 곳에서 지원되는
previousText및nextText필드를 사용해 자연스러운 전환을 돕습니다. - 음성 가용성은 게이트웨이별: CometAPI에서 노출하는 사전 설정 음성 ID를 사용하십시오. 네이티브 ElevenLabs 라이브러리의 모든 음성이 이 인터페이스에서 사용 가능하다고 가정하지 마십시오.
- 비동기 처리: 작업 제출 성공이 곧바로 오디오 준비 완료를 의미하지는 않습니다. 작업 ID를 저장하고 완료 상태를 폴링하며 실패를 처리하십시오.
- 음성 인식 모델이 아님: Eleven v4는 텍스트로부터 음성을 생성하며, 입력 오디오를 전사하는 용도는 아닙니다.
CometAPI를 통해 Eleven v4 API에 접근하는 방법
문서화된 엔드포인트는 POST /runwayml/v1/text_to_speech이며, Bearer 인증과 JSON 입력을 사용합니다. CometAPI는 작업 ID를 반환하며, 이를 통해 상태를 확인하고 결과 오디오를 가져올 수 있습니다.