Eleven v4 的技術規格
| 項目 | 規格 |
|---|---|
| 模型名稱 | Eleven v4 |
| CometAPI 模型 ID | eleven_v4 |
| 原始提供方 | ElevenLabs |
| 模型類別 | 文字轉語音 (TTS) |
| 主要 API 格式 | 與 Runway 相容的文字轉語音 API |
| CometAPI 端點 | POST /runwayml/v1/text_to_speech |
| 輸入 | 文字提示與預設語音組態 |
| 輸出 | 生成的語音音訊;CometAPI 宣布為 MP3 輸出 |
| CometAPI 文字上限 | 每個請求最高 2,500 個字元,依其 2026 年 10 月 10 日公告 |
| 原生 ElevenLabs 文字上限 | 每個請求 10,000 個字元 |
| 語言支援 | 原生 Eleven v4 模型支援 90+ 種語言 |
| 語音控制 | 穩定性、相似度增益、風格、速度與說話者增益,具體取決於網關是否支援 |
| 表達控制 | 支援如 [laughs]、[whispers] 與 [pause] 的標籤 |
| 多說話者對話 | 原生 Eleven v4 模型透過 Text to Dialogue API 支援 |
| 處理方式 | 透過 CometAPI 進行非同步任務提交與狀態輪詢 |
| 音訊格式 | CometAPI 宣布提供 MP3 輸出;請在當前端點模式中確認可用的格式選項 |
來源:CometAPI 模型公告與 CometAPI Runway 文字轉語音 API 文件。原生模型能力由 ElevenLabs 提供說明。
什麼是 Eleven v4?
Eleven v4 是 ElevenLabs 的表現型語音合成模型,旨在生成具有豐富情感表達、情境理解與高度語音一致性的自然語音。特別適合敘事、角色配音、有聲書與需要注重台詞演繹方式的對話場景。
透過 CometAPI,可使用識別碼 eleven_v4,以與 Runway 相容的文字轉語音介面存取該模型。由於網關會加入自身的請求格式與限制,整合時應以 CometAPI 文件的字元上限為準,不應假設原生 ElevenLabs API 的上限適用。
Eleven v4 的主要特性
- 表現型語音合成:產生具備細膩情感、重音、節奏與演繹的語音,適合需要表達性的腳本,而非單調敘述。
- 自然語音表現:為角色、故事敘述、專業配音與對話生成逼真的人聲。
- 多語生成:原生模型支援 90+ 種語言,包括英語、日語、中文普通話、韓語、法語與西班牙語。
- 細緻的語音控制:支援的參數包含穩定性、相似度增益、風格、速度與說話者增益,便於調整演繹與語音一致性。
- 情緒與演繹標籤:如「[laughs]」、「[whispers]」與「[pause]」等標籤可在支援的請求中引導表現型演繹。
- 非同步 API 整合:CometAPI 接受語音生成任務並返回任務 ID,以供查詢狀態與取得生成音訊。
功能可用性與輸入上限可能在原生 ElevenLabs 端點與 CometAPI 網關之間有所差異。
Eleven v4 對比 Eleven v4 Turbo 與 Eleven v3
| 模型 | 主要優勢 | 最佳使用情境 |
|---|---|---|
| Eleven v4 (eleven_v4) | 豐富的情感表達與高保真語音 | 有聲書、敘事、動畫與角色對話 |
| Eleven v4 Turbo (eleven_v4_turbo) | 為低延遲優化的表現型語音;原生中位推理延遲約 100 毫秒 | 互動式語音應用與即時代理 |
| Eleven v3 (eleven_v3) | 具戲劇性演繹與音訊標籤控制的表現型語音 | 情緒濃烈的語音表演與角色場景 |
| Eleven Multilingual v2 (eleven_multilingual_v2) | 在長篇內容中特別穩定的多語種語音品質 | 穩定敘事與多語製作 |
上述比較描述的是原生 ElevenLabs 模型。透過 CometAPI 的可用性與效能取決於其公開的端點與實作。
代表性使用情境
- 有聲書製作:生成具自然節奏與角色區分的表現型敘事。
- 動畫與遊戲:創作帶有情感提示、停頓與多變演繹的角色對話。
- 影音配音:為宣傳影片、教學、紀錄片與說明影片生成旁白。
- 多語內容:為國際化工作流程生成支援語言的語音。
- 創意敘事:製作戲劇化朗讀、對話場景與角色驅動的音訊。
- 自動化內容製作:透過 CometAPI 的非同步任務流程整合語音生成至出版管線。
限制與實作注意事項
- 網關特定字元上限:CometAPI 於 2026 年 10 月 10 日宣布,Eleven v4 每個請求上限為 2,500 個字元,低於原生 ElevenLabs 的 10,000 個字元。請將較長腳本切分為條理清晰的段落,並驗證當前網關的檢核規則。
- 表達性需要調校:高度情緒化的演繹未必適合所有腳本。在支援的情況下測試穩定性與風格設定。
- 發音需審核:人名、縮寫、數字與多語文本可能需要正規化或調整拼寫。
- 片段連貫性:拆分長篇腳本時,如可用,請使用支援的
previousText與nextText欄位以維持過場連貫。 - 語音可用性依網關而定:請使用 CometAPI 提供的預設語音 ID;不要假設原生 ElevenLabs 資料庫中的所有語音皆可用於此介面。
- 非同步處理:提交任務成功並不表示音訊立即可用。請保存任務 ID,輪詢完成狀態,並處理失敗情況。
- 非語音辨識模型:Eleven v4 由文字生成語音;不適用於轉錄輸入音訊。
如何透過 CometAPI 存取 Eleven v4 API
文件化的端點為 POST /runwayml/v1/text_to_speech,使用 Bearer 認證與 JSON 輸入。CometAPI 會返回任務 ID,用於查詢狀態並取得生成的音訊。