Thông số kỹ thuật của Eleven v4
| Hạng mục | Thông số |
|---|---|
| Tên mô hình | Eleven v4 |
| CometAPI Model ID | eleven_v4 |
| Nhà cung cấp gốc | ElevenLabs |
| Hạng mục mô hình | Chuyển văn bản thành giọng nói (TTS) |
| Định dạng API chính | API Chuyển văn bản thành giọng nói tương thích Runway |
| CometAPI endpoint | POST /runwayml/v1/text_to_speech |
| Đầu vào | Prompt văn bản và cấu hình giọng nói dựng sẵn |
| Đầu ra | Âm thanh giọng nói được tạo; CometAPI thông báo đầu ra MP3 |
| Giới hạn văn bản CometAPI | Tối đa 2,500 ký tự cho mỗi yêu cầu, theo thông báo ngày October 10, 2026 |
| Giới hạn văn bản gốc | 10,000 ký tự cho mỗi yêu cầu |
| Hỗ trợ ngôn ngữ | Hơn 90 ngôn ngữ trong mô hình gốc Eleven v4 |
| Điều khiển giọng | Stability, similarity boost, style, speed và speaker boost, tùy thuộc vào hỗ trợ của cổng |
| Điều khiển biểu cảm | Thẻ như [laughs], [whispers] và [pause] |
| Hội thoại đa người nói | Được mô hình gốc Eleven v4 hỗ trợ thông qua Text to Dialogue API |
| Xử lý | Gửi tác vụ bất đồng bộ và thăm dò trạng thái thông qua CometAPI |
| Định dạng âm thanh | Đầu ra MP3 được CometAPI thông báo; xác nhận các tùy chọn định dạng khả dụng trong lược đồ endpoint hiện tại |
Nguồn: Thông báo mô hình CometAPI và tài liệu CometAPI Runway Text-to-Speech API. Khả năng của mô hình gốc do ElevenLabs tài liệu hóa.
Eleven v4 là gì?
Eleven v4 là mô hình tổng hợp giọng nói giàu biểu cảm của ElevenLabs, được thiết kế để tạo ra giọng nói tự nhiên với khả năng truyền tải cảm xúc phong phú, nhận biết ngữ cảnh và tính nhất quán giọng nói cao. Mô hình đặc biệt phù hợp cho thuyết minh, lồng tiếng nhân vật, sách nói và hội thoại, nơi cách thể hiện câu thoại quan trọng không kém nội dung lời nói.
Thông qua CometAPI, mô hình khả dụng với định danh eleven_v4 qua một giao diện TTS tương thích Runway. Cổng bổ sung định dạng yêu cầu và các ràng buộc riêng, vì vậy khi tích hợp mô hình nên sử dụng giới hạn ký tự do CometAPI tài liệu hóa thay vì giả định giới hạn của API gốc ElevenLabs.
Tính năng chính của Eleven v4
- Tổng hợp giọng nói giàu biểu cảm: Tạo giọng nói với cảm xúc, nhấn nhá, nhịp độ và cách thể hiện tinh tế, phù hợp với kịch bản biểu cảm hơn là thuyết minh phẳng, đồng đều.
- Hiệu suất giọng nói tự nhiên: Tạo giọng nói giống con người cho nhân vật, kể chuyện, thuyết minh chuyên nghiệp và hội thoại.
- Tạo đa ngôn ngữ: Mô hình gốc hỗ trợ hơn 90 ngôn ngữ, bao gồm tiếng Anh, tiếng Nhật, tiếng Trung Quan thoại, tiếng Hàn, tiếng Pháp và tiếng Tây Ban Nha.
- Điều khiển giọng nói chi tiết: Các tham số hỗ trợ gồm stability, similarity boost, style, speed và speaker boost, cho phép nhà phát triển tinh chỉnh cách thể hiện và tính nhất quán của giọng.
- Thẻ cảm xúc và cách thể hiện: Các thẻ như
[laughs],[whispers]và[pause]có thể định hướng cách thể hiện biểu cảm trong những yêu cầu được hỗ trợ. - Tích hợp API bất đồng bộ: CometAPI nhận tác vụ tạo giọng nói và trả về ID tác vụ, có thể dùng để truy xuất trạng thái và âm thanh kết quả.
Tính khả dụng tính năng và giới hạn đầu vào có thể khác nhau giữa các endpoint gốc của ElevenLabs và cổng CometAPI.
Eleven v4 so với Eleven v4 Turbo và Eleven v3
| Mô hình | Thế mạnh chính | Trường hợp sử dụng phù hợp nhất |
|---|---|---|
| Eleven v4 (eleven_v4) | Biểu đạt cảm xúc phong phú và giọng nói chất lượng cao | Sách nói, thuyết minh, hoạt hình và hội thoại nhân vật |
| Eleven v4 Turbo (eleven_v4_turbo) | Giọng nói biểu cảm tối ưu cho độ trễ thấp; độ trễ suy luận trung vị gốc khoảng 100 ms | Ứng dụng thoại tương tác và tác nhân thời gian thực |
| Eleven v3 (eleven_v3) | Giọng nói biểu cảm với cách thể hiện kịch tính và điều khiển bằng thẻ âm thanh | Các màn trình diễn giàu cảm xúc và cảnh nhân vật |
| Eleven Multilingual v2 (eleven_multilingual_v2) | Chất lượng giọng nói đa ngôn ngữ ổn định, đặc biệt cho nội dung dài | Thuyết minh nhất quán và sản xuất đa ngôn ngữ |
Các so sánh này mô tả các mô hình gốc của ElevenLabs. Tính khả dụng và hiệu năng qua CometAPI phụ thuộc vào endpoint được công bố và cách triển khai.
Trường hợp sử dụng tiêu biểu
- Sản xuất sách nói: Tạo thuyết minh biểu cảm với nhịp độ tự nhiên và phân biệt nhân vật.
- Hoạt hình và trò chơi: Tạo hội thoại nhân vật với gợi ý cảm xúc, ngắt nghỉ và cách thể hiện đa dạng.
- Lồng tiếng video: Tạo thuyết minh cho video quảng bá, hướng dẫn, tài liệu và video giải thích.
- Nội dung đa ngôn ngữ: Tạo giọng nói cho quy trình nội dung quốc tế trên các ngôn ngữ được hỗ trợ.
- Kể chuyện sáng tạo: Tạo đọc diễn cảm, cảnh hội thoại và âm thanh hướng nhân vật.
- Sản xuất nội dung tự động: Tích hợp tạo giọng nói vào pipeline xuất bản bằng quy trình tác vụ bất đồng bộ của CometAPI.
Hạn chế và lưu ý triển khai
- Giới hạn ký tự đặc thù cổng: CometAPI đã công bố giới hạn 2,500 ký tự cho mỗi yêu cầu đối với Eleven v4 vào ngày October 10, 2026. Con số này thấp hơn giới hạn 10,000 ký tự của ElevenLabs gốc. Hãy chia các kịch bản dài thành các đoạn mạch lạc và xác minh quy tắc kiểm tra hợp lệ hiện tại của cổng.
- Biểu cảm cần tinh chỉnh: Cách thể hiện giàu cảm xúc có thể không phù hợp mọi kịch bản. Hãy thử điều chỉnh stability và style ở nơi được hỗ trợ.
- Cần rà soát phát âm: Tên riêng, chữ viết tắt, số và văn bản đa ngôn ngữ có thể cần chuẩn hóa hoặc điều chỉnh cách viết.
- Tính liên tục giữa các đoạn: Khi chia nhỏ kịch bản dài, sử dụng các trường
previousTextvànextTextnếu khả dụng để giúp duy trì chuyển đoạn mạch lạc. - Khả dụng giọng nói phụ thuộc vào cổng: Sử dụng các ID giọng nói dựng sẵn do CometAPI cung cấp. Không giả định mọi giọng trong thư viện gốc của ElevenLabs đều khả dụng qua giao diện này.
- Xử lý bất đồng bộ: Gửi tác vụ thành công không đồng nghĩa âm thanh sẵn sàng ngay. Lưu ID tác vụ, thăm dò hoàn tất và xử lý lỗi.
- Không phải mô hình nhận dạng giọng nói: Eleven v4 tạo giọng nói từ văn bản; không nhằm mục đích phiên âm âm thanh đầu vào.
Cách truy cập API Eleven v4 qua CometAPI
Endpoint được tài liệu hóa là POST /runwayml/v1/text_to_speech, sử dụng xác thực Bearer và đầu vào JSON. CometAPI trả về một ID tác vụ có thể dùng để kiểm tra trạng thái và truy xuất âm thanh kết quả.