TL;DR
プロジェクトが、再利用可能な人物・製品・設定・ボイス・元動画を一つの制御されたワークフローで組み合わせることに依存する場合に Omni を使用する。価値は参照のオーケストレーションと視聴覚の連続性にあり、標準モデルに対する自動的な品質向上ではない。まず短い検証ショットを一本作り、参照を承認し、音声を追加し、コア資産が安定してからストーリーボードへ拡張する。
Key Takeaways
- Omni はテキスト、画像、要素、動画、ボイス参照をサポートし、対応ワークフローにおいてモデルレベルで最大 15 秒の出力が可能。
- Kling VIDEO 3.0 は嗜好ベンチマークで依然競争力がある。より広い参照ワークフローが特定の制作ニーズを解決する場合は Kling VIDEO 3.0 Omni を選ぶ。
- 識別(アイデンティティ)、製品形状、構図、音声を、結合してマルチショット化する前に個別に検証する。
- API では、全てのインターフェース機能が露出していると仮定せず、選択したプロバイダルートのドキュメント化されたパラメータに従う。
- 一回の試行の公称コストだけでなく、承認されたクリップに対して予算を立てる。
-公式 Omni ワークスペースと参照コントロール-
What Does the Omni Model Support?
Kling は Omni をマルチモーダル参照と視聴覚の一貫性の観点で位置づけている。実務上の意味はシンプルで、認識可能なままであるべき資産を定義し、その上で何が起きるべきかを記述することだ。
| 仕様 — 公式生成ガイド | Omni の機能 |
|---|---|
| 入力オプション | テキスト、画像、動画参照、再利用可能な要素、ボイス参照 |
| モデルレベルの出力時間 | 3–15 秒 |
| 動画解像度 | 720p と 1080p。対応ワークフローでネイティブ 4K |
| 音声 | 対応するキャラクター–声のバインディングによるネイティブ視聴覚生成 |
| ショット制御 | 単一ショット生成とカスタムマルチショットのシーケンス化 |
| 複数画像要素の作成 | 2–4 枚の画像 |
| 動画ベースのキャラクター作成 | 3–8 秒のキャラクタークリップ |
| 推奨ボイスサンプル | 5–30 秒の明瞭な単一話者の音声 |
| 画像と要素の合算上限 | 動画入力なしで最大 7、動画入力ありで最大 4 |
要素の作成は、一つの生成リクエストに参照を添付することとは異なる。複数のビューが一つの再利用可能要素に属する場合があり、それらは自動的に複数の独立した要素スロットとしてカウントされない。
モデルレベルの機能は、プロバイダ間で同一のコントロールを保証するものではない。Kling のインターフェースでの 15 秒ワークフローと、サードパーティ API リクエストでは、露出されるパラメータや時間が異なる場合がある。
Kling VIDEO 3.0 Omni vs Kling VIDEO 3.0: When to Choose Each
選択は単純に「基本動画」対「音付き動画」ではない。標準モデルもネイティブ音声、マルチショット生成、要素のバインディングをサポートする。より有用な区別は、プロジェクトが参照をどのように整理・再利用するかだ。
| 次元 | Kling VIDEO 3.0 | Kling VIDEO 3.0 Omni |
|---|---|---|
| 参照の構成 | 承認済みの開始フレーム、または開始/終了フレームを中心とした要素バインディング | 画像・要素・動画参照によるより広いコンポジション |
| 要素間の関係 | 重要な被写体が既に定義フレーム内に存在している場合に最適 | 別個の資産を結合・再利用する必要がある場合に最適 |
| キャラクターボイス | ボイスバインドされた要素を使用可能 | 一つの Omni ワークフローでビジュアルとボイス参照をサポート |
| マルチショット生成 | サポート | カスタムストーリーボードコントロールとともにサポート |
| 推奨される開始点 | 既にシーンを定義している承認済みのキーフレーム一枚 | 複数ショットにわたり認識可能であるべき資産のコレクション |
結果: 本質情報が一枚の承認フレームに含まれている場合は標準ワークフローから始める。参照のコンポジション、資産の再利用、ショット間の視聴覚的連続性が中核である場合は Omni を選ぶ。
Kling VIDEO 3.0 Omni vs Kling VIDEO 3.0: Benchmarks
以下の点推定値は、2026 年 9 月 9 日時点での Artificial Analysis における 1080p Pro・音声有効のエントリを比較したもの。± の後の値は公開 95% 信頼区間。
| 評価 — テキスト→動画 / 画像→動画 | Standard | Omni |
|---|---|---|
| テキスト→動画 Elo | 1108 ± 5 | 1090 ± 6 |
| 画像→動画 Elo | 1072 ± 6 | 1060 ± 7 |
これらは生成成功率ではなく、嗜好に基づく評価である。両比較において標準モデルの点推定が高く、画像→動画では信頼区間が重なっている。新しい評価の到来に伴いスコアは変動しうる。
結果: Omni の利点は名称から推し量るのではなく、参照処理と制作上の連続性で評価すべきであり、万能の品質ランキングとして扱うべきではない。
How to Build Your First Reference-Led Video
縦型広告を想定する。登壇者 Maya、再利用可能な青いボトル、一つの承認済みスタジオ設定。これは生成テストの報告ではなく、説明用の制作資産である。
Prepare a Small, Consistent Asset Set
| 資産 | 準備内容 | 受け入れ基準 |
|---|---|---|
| Presenter | 髪型・服装・照明を揃えた明瞭なビュー | 認識可能な顔、変わらない衣装 |
| Bottle | 正面・側面・斜め 3/4 のビュー | 安定した胴体形状、キャップ、色、ラベル |
| Setting | 承認済みスタジオ参照一つ | 一貫した背景と光の向き |
| Voice | 認可された話者のクリアな音声 | 認識可能な声で、競合する音声がないこと |
使用する顔、録音、ブランド資産は、使用許諾があるものに限る。矛盾する参照は、長いプロンプトで補おうとする前に修正すべき。
Create and Name Your Elements
Kling の Element ライブラリで、各ショットで同じ被写体を再記述するのではなく再利用可能な資産を作成する。公式ワークフローは、複数画像および動画ベースのキャラクター作成をサポートする。
Maya、BlueBottle、Studio のような記述的な名前を使う。名前は整理の助けであり、保存済み要素を選択することが参照の添付になる。アップロードしたボイスには、音楽や重なり音声のない明瞭な単一話者オーディオを使用する。

-公式キャラクター要素とボイスバインディングのコントロール-
以下のプロンプトにおいて、@Maya、@BlueBottle、@Studio は Kling のインターフェースで選択された要素を表す。対応する資産を添付せずにこれらの名前をタイプしても参照は作成されない。
Generate One Simple Shot First
Omni 生成ワークスペースを開き、モデルを選び、必要資産を添付する。まずは 5 秒、カメラムーブは一つ、台詞なしで始める。
Create a single continuous product shot using @BlueBottle in @Studio.
The bottle stands upright on a clean tabletop. Keep its body shape,
cap, surface color, and label placement consistent with the references.
Camera: a slow, straight push-in from a medium close-up.
Lighting: soft studio light from camera left.
Action: the bottle remains stationary.
Composition: leave clear space above the bottle for text added later.
No cuts, no extra products, and no generated captions.
冒頭・中間・終盤を確認する。キャップ、シルエット、ラベル位置、テーブルトップとの接地をチェックする。資産が変化する場合は、ショットを単純化するか、参照を改善してから新たな要求を加える。
Add the Presenter and Native Audio
ボトルショットが許容できる段階になったら、登壇者と短い台詞を導入する。Kling は複数言語での音声生成をドキュメント化しているが、出力品質は参照品質、タイミング、プロンプトの明確さに依存し続ける。
Create a five-second continuous shot using @Maya, @BlueBottle,
and @Studio.
Maya stands beside the bottle, looks toward the camera, and says:
“Ready when you are.”
Use Maya’s bound voice. Keep the bottle unchanged. Use one static
camera angle. Do not add music, captions, cuts, or additional speech.
音声は映像と分けて確認する。意図した人物が話しているか、台詞が完全か、タイミングが可視のパフォーマンスと合っているかを確認する。
単一ショットを検証したら、その承認済み参照を再利用してマルチショットのシーケンスを計画する。各ショットに時間と明確なビジュアルの目的を割り当てる。カスタムストーリーボードコントロールは、ショット単位での時間、フレーミング、カメラ挙動、物語進行の指示をサポートする。
| 時間 | 目的 | ビジュアル指示 | 音声指示 |
|---|---|---|---|
| 0–5 秒 | 製品を確立 | ボトルのクローズアップ。緩やかなプッシュイン | 静かな室内の環境音 |
| 5–10 秒 | プレゼンターの導入 | ボトルの横に立つ Maya のミディアムショット。静止カメラ | “Ready when you are.” |
| 10–15 秒 | 製品で締める | クリアなヒーローショット。最終構図でホールド | 室内の環境音 |

-公式カスタムマルチショットストーリーボードパネル-
Create a three-shot product advertisement using @Maya, @BlueBottle,
and @Studio.
Continuity rules:
Use the same presenter, outfit, bottle, and studio throughout.
Keep the bottle’s shape, cap, color, and label unchanged.
Maintain the same lighting direction.
Use Maya’s bound voice only.
Do not add people, products, captions, or extra dialogue.
Follow the separate shot descriptions and durations.
End on a stable product composition.
個々のショットと同じくらい丁寧にトランジションを確認する。各カットの直前の最後の明瞭な製品ビューと、カット後の最初の明瞭なビューを比較する。法務表記、正確な価格、字幕、ブランドタイポグラフィは、文言を直接管理できるようエディタで追加する。
How to Use Video References for Character Creation and Video Editing
再利用可能なキャラクター作成に使うクリップと、編集タスクのために供給するソース映像は異なる。前者は同一性を確立し、後者は既存の動きと構図を保持または変換するために提供する。キャラクター作成には一人のキャラクターの 3–8 秒クリップを使用する。動画編集では、Kling の公式 Omni ガイドが、3–10 秒、最大 200 MB、2K 解像度のソース動画 1 本を許可している。選択した API ルートの現行制限を確認し、拡大前に短いクリップでテストする。
Use the uploaded video as the source.
Change only the background to a softly lit studio.
Preserve the presenter’s identity, clothing, actions, and timing.
Preserve the bottle and the original camera movement.
Do not add cuts, gestures, objects, or dialogue.
制御された編集リクエストは、フレーム単位の完全保持を保証するものではない。ソース音声を維持するか新規生成するかを別途判断し、出力を元クリップと突き合わせて確認する。
How to Use the Omni API in CometAPI
プログラムアクセスには専用の Omni 動画エンドポイントを使用する。以下で使用するドキュメント上の識別子は kling-v3-omni である。
例は公開 API スキーマに従うもので、ライブ生成テストの報告ではない。選択ルートでは該当モードの duration 値として “5” と “10” が記載されているため、インターフェースの 15 秒ワークフローが同じリクエストにマップされると仮定しないこと。
Submit a Generation Task
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
curl --fail --silent --show-error \
--request POST \
"https://api.cometapi.com/kling/v1/videos/omni-video" \
--header "Authorization: Bearer ${COMETAPI_KEY}" \
--header "Content-Type: application/json" \
--data-raw '{
"model_name": "kling-v3-omni",
"prompt": "A blue reusable bottle stands on a clean studio tabletop. One continuous shot with a slow straight push-in. Soft light from camera left. No people, no cuts, no captions.",
"mode": "std",
"aspect_ratio": "9:16",
"duration": "5",
"sound": "off"
}'
ファーストフレーム参照を使う場合は、次の断片をリクエストにマージし、サンプル URL をアクセス可能な画像に置き換える。
{
"image_list": [
{
"image_url": "https://your-public-host.example/bottle.jpg",
"type": "first_frame"
}
],
"prompt": "Starting from <<<image_1>>>, create one continuous slow push-in. Preserve the bottle and studio composition. No cuts or captions."
}
API の <<<image_1>>> 構文は、インターフェースで選択する @Element 参照とは異なる。ドキュメント上の sound 値は on と off である。
Retrieve the Finished Video
返却された data.task_id を保存し、Omni タスクステータスルートをクエリする。
TASK_ID="REPLACE_WITH_RETURNED_TASK_ID"
curl --fail --silent --show-error \
"https://api.cometapi.com/kling/v1/videos/omni-video/${TASK_ID}" \
--header "Authorization: Bearer ${COMETAPI_KEY}"
記載されている状態は submitted、processing、succeed、failed。code: 0 の作成レスポンスはリクエスト受理を意味し、動画が準備完了であることは意味しない。タスクが成功したら、data.task_result.videos[0].url から結果を取得する。
バックオフ付きの境界ポーリングを用い、プロンプトと設定とともにタスク ID を保持し、再試行前に失敗メッセージを確認する。クライアントのタイムアウトしたリクエストでも、既に課金対象のタスクが作成されている可能性がある。
What Does Kling VIDEO 3.0 Omni Cost?
「動画一本あたりの価格」という一般化ではなく、構成固有の価格を使用する。以下の数字は 2026 年 9 月 9 日に確認したもので、変更されうる。
Kling の公式 VIDEO 3.0 Omni ガイドは、以下のプラットフォームクレジットレートを掲載している。次の表の CometAPI のドル価格は異なる課金単位を用いる。Kling のクレジットは、適用されるクレジット購入レートなしにはドルに換算できない。
| Omni 構成 | 公式クレジット/秒 | 公式クレジット/5 秒 | 公式クレジット/10 秒 |
|---|---|---|---|
| 720p、動画入力なし、ネイティブ音声オフ | 6 | 30 | 60 |
| 1080p、動画入力なし、ネイティブ音声オフ | 8 | 40 | 80 |
| 1080p、動画入力なし、ネイティブ音声オン | 12 | 60 | 120 |
| 1080p、動画入力あり、ネイティブ音声オフ | 16 | 80 | 160 |
公式ガイドは 4K Omni のクレジットレートを掲載しておらず、動画入力ありでのネイティブ音声をこの価格表では非対応と記している。注文前にプロダクト内の現行レートを確認する。
| CometAPI の Omni API | 5 秒出力 | 10 秒出力 |
|---|---|---|
| 720p、動画入力なし | $0.336 | $0.672 |
| 1080p、動画入力なし | $0.448 | $0.896 |
| 1080p、ネイティブ音声 | $0.560 | $1.120 |
| 1080p、動画入力あり | $0.672 | $1.344 |
| 4K、動画入力なし | $1.680 | $3.360 |
これらは別個の API 構成である。行を加算したり、解像度・音声・動画入力の全ての組み合わせが利用可能だと推論したりしないこと。4K の価格は、どのパラメータやルートで 4K が有効になるかを確定するものでもない。
Kling は初期リリース後にネイティブ 4K 動画を導入した。高解像度反復に費用をかける前に、コンテンツとモーションを承認する。
Budget for Accepted Clips
より有用な制作指標は次の通り。
受け入れられたクリップあたりのコスト = 総生成支出 ÷ 受け入れられたクリップ数
1080p ネイティブ音声音率での 5 秒の試行を 3 回行うと、コストは 3 × $0.560 = $1.680。もし一回のみが受け入れ基準を満たした場合、その生成の実効コストは $1.680 となる。この計算は予算立案の例示であり、再試行率の測定ではない。
Kling アプリケーションクレジットと CometAPI のドル課金は分けて管理する。Kling のクレジットコストガイドは、時間・解像度・音声・ワークフローを独立した計画要素として扱う。
Troubleshooting: What Should You Change First?
| 問題 | 最初の確認ポイント | 推奨調整 |
|---|---|---|
| ショット間でキャラクターが変わる | 矛盾する参照や衣装の記述 | 承認済み要素一つを再利用し、ショットを単純化する |
| 製品形状やラベルが変わる | 参照品質と要求の厳しい動き | より明瞭な製品ビューを追加。静止ショットを試す |
| 誤った声や余分な発話がある | ボイスバインディングと矛盾する指示 | 話者を一人・短い台詞一つにする |
| 不要なカットが入る | ストーリーボード設定とシーン変更 | 物語ジャンプのない連続ショットをテストする |
| API に拒否されるリクエスト | ルート固有のスキーマ、型、時間 | ドキュメント化された最小リクエストに戻る |
| タスクがあるが動画 URL がない | 生成がまだ進行中の可能性 | 新規作成ではなく既存タスクを照会する |
| 高解像度でも出来が悪い | 動きや同一性の問題が残っている | 出力品質を上げる前にシーンを見直す |
変数は一度に一つずつ変更する。資産、プロンプト、設定、出力、却下理由を記録し、改善がどの判断に紐づくかを追跡できるようにする。
Final Recommendation
Omni を使うのは、名称が普遍的なアップグレードを示唆するからではなく、制作が認識可能な資産の結合・再利用に依存する場合である。一本の短い参照主導ショットから始め、キャラクターや製品を承認し、バインドされたボイスを導入し、その後にストーリーボードを構築する。CometAPI に移行する際は、選択したエンドポイントに合わせてモデル識別子、duration、参照構文、非同期タスクフローを整合させる。
最も有用な問いは「一つのプロンプトにどれだけ詰め込めるか?」ではない。「次の生成前にどの不確実性を取り除くべきか?」である。
FAQ
Omni は常に標準モデルより優れている?
いいえ。嗜好ベンチマークでは標準モデルが優勢な評価もある。Omni は、より広い参照ワークフローが資産の再利用、連続性、編集コントロールを改善する場合に最も有用。
全ての Omni ワークフローで 15 秒動画を生成できる?
いいえ。15 秒は対応ワークフローでのモデルレベル能力。個別のインターフェースや API ルートでは、より短い時間オプションが露出される場合がある。
最初からネイティブ音声と複数ショットで始めるべき?
通常は推奨しない。まず短い視覚ショットを検証する。人物同一性と製品の一貫性が許容できてから声を追加し、その後ストーリーボードへ拡張する。
@Element 名は API リクエストで機能する?
自動的には機能しない。Kling のインターフェースで選択した要素と、API の画像参照構文は異なるメカニズム。呼び出すルートのスキーマに従うこと。
制作予算はどう見積もるべき?
総生成支出をトラッキングし、それを受け入れられたクリップ数で割る。却下された試行、高解像度での再実行、ストレージ、ポストプロダクションも見積もりに含める。
