Eleven v4 の技術仕様
| 項目 | 仕様 |
|---|---|
| モデル名 | Eleven v4 |
| CometAPI モデル ID | eleven_v4 |
| オリジナル提供元 | ElevenLabs |
| モデルカテゴリ | テキスト読み上げ(TTS) |
| 主要 API 形式 | Runway 互換のテキスト読み上げ API |
| CometAPI エンドポイント | POST /runwayml/v1/text_to_speech |
| 入力 | テキストプロンプトとプリセット音声設定 |
| 出力 | 生成された音声オーディオ;CometAPI は MP3 出力を告知 |
| CometAPI のテキスト上限 | 2026年10月10日の発表によれば、1 リクエストあたり最大 2,500 文字 |
| ネイティブ ElevenLabs の上限 | 1 リクエストあたり 10,000 文字 |
| 言語サポート | ネイティブの Eleven v4 モデルで 90 以上の言語 |
| ボイス制御 | stability、similarity boost、style、speed、speaker boost(ゲートウェイの対応状況に依存) |
| 表現制御 | [laughs]、[whispers]、[pause] などのタグ |
| マルチスピーカー対話 | Text to Dialogue API を通じてネイティブの Eleven v4 モデルで対応 |
| 処理 | CometAPI を介した非同期タスク送信とステータスのポーリング |
| 音声フォーマット | CometAPI により MP3 出力が告知;現在のエンドポイントスキーマで利用可能なフォーマットを確認 |
出典: CometAPI のモデル発表および CometAPI Runway Text-to-Speech API ドキュメント。ネイティブモデルの機能は ElevenLabs により文書化されています。
Eleven v4 とは?
Eleven v4 は ElevenLabs の表現力豊かな音声合成モデルで、自然な音質に加え、豊かな感情表現、文脈理解、強い声の一貫性を備えています。ナレーション、キャラクターボイスオーバー、オーディオブック、セリフの演技など、言葉だけでなく「どう届けるか」が重要な用途に特に適しています。
CometAPI では、Runway 互換のテキスト読み上げインターフェース経由で識別子 eleven_v4 を用いて利用できます。ゲートウェイは独自のリクエスト形式と制約を追加するため、ネイティブの ElevenLabs API の上限を前提にせず、統合時は CometAPI に文書化された文字数上限を使用してください。
Eleven v4 の主な機能
- 表現的な音声合成: 感情のニュアンス、強調、ペース、デリバリーに富む音声を生成し、均一な読み上げではなく表現重視の台本に適します。
- 自然な音声パフォーマンス: キャラクター、物語、プロフェッショナルなナレーション、会話型ダイアログに人間らしい音声を生成します。
- 多言語生成: ネイティブモデルは英語、日本語、北京語、韓国語、フランス語、スペイン語など 90 以上の言語をサポートします。
- 高精度なボイス制御: stability、similarity boost、style、speed、speaker boost などのパラメータにより、デリバリーや声の一貫性を調整できます。
- 感情・デリバリータグ:
[laughs]、[whispers]、[pause]といったタグで表現的なデリバリーをガイドできます(対応リクエストにて)。 - 非同期 API 連携: CometAPI は音声生成タスクを受け付けてタスク ID を返し、その ID でステータス確認と生成音声の取得が可能です。
機能の提供状況や入力上限は、ネイティブの ElevenLabs エンドポイントと CometAPI のゲートウェイで異なる場合があります。
Eleven v4 と Eleven v4 Turbo、Eleven v3 の比較
| モデル | 主な強み | 最適なユースケース |
|---|---|---|
| Eleven v4 (eleven_v4) | 豊かな感情表現と高忠実度の音声 | オーディオブック、ナレーション、アニメーション、キャラクターダイアログ |
| Eleven v4 Turbo (eleven_v4_turbo) | 低レイテンシに最適化された表現的な音声;ネイティブの推論中央値レイテンシは約 100 ms | インタラクティブ音声アプリケーション、リアルタイムエージェント |
| Eleven v3 (eleven_v3) | 劇的なデリバリーとオーディオタグ制御を伴う表現的音声 | 感情表現が強いボイスパフォーマンスやキャラクターシーン |
| Eleven Multilingual v2 (eleven_multilingual_v2) | 長尺コンテンツで特に安定した多言語音声品質 | 一貫したナレーションと多言語制作 |
これらの比較はネイティブの ElevenLabs モデルに関するものです。CometAPI 経由での提供状況や性能は、公開されているエンドポイントと実装に依存します。
代表的なユースケース
- オーディオブック制作: 自然なペースとキャラクター差別化を伴う表現的なナレーションを生成。
- アニメーションとゲーム: 感情キュー、ポーズ、変化に富んだデリバリーでキャラクターダイアログを作成。
- 動画ボイスオーバー: プロモーション動画、チュートリアル、ドキュメンタリー、解説動画のナレーションを生成。
- 多言語コンテンツ: 対応言語にまたがる国際的なコンテンツ制作ワークフロー向けに音声を生成。
- クリエイティブなストーリーテリング: 朗読、会話シーン、キャラクター中心の音声を生成。
- 自動化されたコンテンツ制作: CometAPI の非同期タスクワークフローを用いて出版パイプラインに音声生成を統合。
制約と実装上の注意点
- ゲートウェイ固有の文字数上限: CometAPI は 2026年10月10日に Eleven v4 の 1 リクエストあたり 2,500 文字上限を発表。これはネイティブの ElevenLabs の 10,000 文字上限より低いため、長い台本は意味の通るセグメントに分割し、最新のゲートウェイ検証ルールを確認してください。
- 表現の調整が必要: 高い感情表現はすべての台本に適するとは限りません。対応範囲で stability や style の設定をテストしてください。
- 発音の確認: 固有名詞、略語、数字、多言語テキストは正規化や表記の見直しが必要な場合があります。
- セグメントの連続性: 長文を分割する際は、対応している場合
previousTextとnextTextフィールドを使用して、つながりの整合性を高めてください。 - ボイスの提供状況はゲートウェイ依存: CometAPI が公開するプリセットのボイス ID を使用し、ネイティブの ElevenLabs ライブラリにある全ボイスが利用可能と仮定しないでください。
- 非同期処理: タスクの送信が成功しても、音声が即時に準備完了とは限りません。タスク ID を保存し、完了までポーリングし、失敗時のハンドリングを実装してください。
- 音声認識モデルではない: Eleven v4 はテキストから音声を生成するモデルであり、入力音声の文字起こしには意図されていません。
CometAPI 経由で Eleven v4 API にアクセスする方法
文書化されたエンドポイントは POST /runwayml/v1/text_to_speech で、Bearer 認証と JSON 入力を使用します。CometAPI はタスク ID を返し、その ID を用いてステータスを確認し、生成された音声を取得できます。