GPT-6.1 Sol are now live on CometAPI →
guide/CometAPI 研究

Kling VIDEO 3.0 Omni Model 使用手冊

瞭解如何使用 Kling 3.0 Omni,搭配可重複使用的元素、原生音訊、多鏡位故事板、CometAPI 範例、基準情境,以及實用的成本控制。

CometAPI
Deon GoodwinAI 模型與 API 研究團隊
更新於 Oct 5, 2026 6 分鐘閱讀
Kling VIDEO 3.0 Omni Model 使用手冊
套用此模式

發出第一個 API 請求。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

在專案需要在一個可控工作流程中組合可重用的人物、產品、場景、聲音或來源影片時使用 Omni。其價值在於參考資產的協調與影音連貫性,而非相對標準模型的自動品質躍升。先從一個短的驗證鏡頭開始,核准參考資產、加入音訊,僅在核心素材保持穩定後再擴展到分鏡。

Key Takeaways

  • Omni 支援文字、圖片、元素、影片與聲音參考,在支援的工作流程中模型層級輸出可達 15 秒。
  • Kling VIDEO 3.0 在偏好基準中仍具競爭力;當更廣的參考工作流程能解決特定製作需求時,選擇 Kling VIDEO 3.0 Omni。
  • 在合併成多鏡頭序列前,分別驗證身份、產品外形、構圖與音訊。
  • 對於 API 作業,遵循所選供應商路由的參數文件,而非假設所有介面功能都已暴露。
  • 以被接受的片段為預算基礎,而不僅是一次嘗試的標示成本。

Kling VIDEO 3.0 Omni Model 使用手冊

Omni 官方工作區與參考控制。

What Does the Omni Model Support?

Kling 將 Omni 定位於多模態參考與影音一致性。實務含義很簡單:定義必須保持可辨識的資產,然後描述它們應該發生什麼事。

規格 — 官方生成指南Omni 能力
輸入選項文字、圖片、影片參考、可重用元素與聲音參考
模型層級輸出時長3–15 秒
影片解析度720p 與 1080p;支援的工作流程中具備原生 4K
音訊原生影音生成,支援角色—聲音綁定
鏡頭控制單鏡頭生成與自訂多鏡頭序列
多圖片元素建立2–4 張圖片
以影片建立角色一段 3–8 秒的角色片段
建議的聲音樣本5–30 秒清晰、單一說話者的語音
合併圖片與元素預算無影片輸入時最多 7 個;有影片輸入時最多 4 個

建立一個元素與在一次生成請求中附加參考是不同的。多個視角可屬於同一個可重用元素;它們不會自動被計為多個獨立元素插槽。

模型層級能力不保證各供應商的控制相同。Kling 介面中的 15 秒工作流程與第三方 API 請求可能會暴露不同的參數與時長值。

Kling VIDEO 3.0 Omni vs Kling VIDEO 3.0: When to Choose Each

選擇並非只是「基本影片」與「帶聲音的影片」。標準模型同樣支援原生音訊、多鏡頭生成與元素綁定。更有用的區別是專案如何組織與重用參考資產。

面向Kling VIDEO 3.0Kling VIDEO 3.0 Omni
參考組織圍繞已核准的起始影格或起始/結束影格進行元素綁定以圖片、元素與影片參考進行更廣的構圖
元素關係當重要主體已存在於定義影格時表現最佳當需要合併或重用分離資產時表現最佳
角色聲音可使用聲音綁定元素在一個 Omni 工作流程中同時支援視覺與聲音參考
多鏡頭生成支援支援,並提供自訂分鏡控制
建議起點一個已核准且已定義場景的關鍵影格一組需在多鏡頭間保持可辨識的資產

比較結論: 當一個已核准的影格已包含核心資訊時,先使用標準工作流程。當參考構圖、資產重用或跨鏡頭影音連貫性是工作的核心時,選擇 Omni。

Kling VIDEO 3.0 Omni vs Kling VIDEO 3.0: Benchmarks

以下點估計比較了截至 2026 年 9 月 9 日在 Artificial Analysis 上可用的 1080p Pro、啟用音訊的項目。出現於 “±” 後的數值為公布的 95% 信賴區間。

評估 — 文生影 / 圖生影StandardOmni
文生影 Elo1108 ± 51090 ± 6
圖生影 Elo1072 ± 61060 ± 7

這些是基於偏好的評分,而非生成成功百分比。標準模型在兩項比較中具有更高的點估計,而圖生影的信賴區間有重疊。分數可能會隨著新評估而變化。

基準結論: Omni 的優勢應透過參考處理與製作連續性來評估,不應僅由其名稱推論或視為普遍的品質排名。

How to Build Your First Reference-Led Video

假設一個直式廣告,包含名為 Maya 的主持人、一個可重用的藍色瓶子,以及一個已核准的攝影棚場景。這些是示例性的製作資產,而非報告的生成測試。

Prepare a Small, Consistent Asset Set

資產準備事項接受標準
主持人清晰視角,髮型、服裝與燈光一致臉部可辨識且服裝不變
瓶子正面、側面與四分之三視角機身外形、瓶蓋、表面顏色與標籤穩定
場景一個已核准的攝影棚參考背景與光線方向一致
聲音來自授權說話者的乾淨語音聲音可辨識且無競爭性語音

僅使用你有權使用的臉部、錄音與品牌資產。出現衝突的參考應在嘗試以更長提示補救之前先行修正。

Create and Name Your Elements

在 Kling 的 Element Library 中建立可重用資產,而不是在每個鏡頭中反覆描述相同主體。官方工作流程支援多圖片與以影片建立角色。

使用具描述性的名稱,例如 Maya、BlueBottle 與 Studio。名稱是組織輔助;選取已儲存的元素才會附加參考。對於上傳的聲音,使用清晰、單一說話者的音訊,不含音樂或重疊語音。

Kling VIDEO 3.0 Omni Model 使用手冊

官方角色元素與聲音綁定控制。

在以下提示中,@Maya、@BlueBottle 與 @Studio 代表在 Kling 介面中選取的元素。僅輸入這些名稱而未附加對應資產並不會建立參考。

Generate One Simple Shot First

開啟Omni 生成工作區,選擇模型並附加所需資產。從五秒、一個鏡頭運動、無對白開始。

Create a single continuous product shot using @BlueBottle in @Studio.

The bottle stands upright on a clean tabletop. Keep its body shape,
cap, surface color, and label placement consistent with the references.

Camera: a slow, straight push-in from a medium close-up.
Lighting: soft studio light from camera left.
Action: the bottle remains stationary.
Composition: leave clear space above the bottle for text added later.

No cuts, no extra products, and no generated captions.

檢視開頭、中段與結尾。檢查瓶蓋、輪廓、標籤位置與與桌面的接觸。如資產有變化,先簡化鏡頭或改善參考,再新增需求。

Add the Presenter and Native Audio

在瓶子鏡頭可接受後,引入主持人與一句簡短口白。Kling 文件記載了多語言的語音生成,但輸出品質仍取決於參考品質、時間安排與提示清晰度。

Create a five-second continuous shot using @Maya, @BlueBottle,
and @Studio.

Maya stands beside the bottle, looks toward the camera, and says:
“Ready when you are.”

Use Maya’s bound voice. Keep the bottle unchanged. Use one static
camera angle. Do not add music, captions, cuts, or additional speech.

分開於畫面之外檢視音訊:確認為預期的人說話、台詞完整,且時間與可見表演匹配。

在驗證單一鏡頭後,重用其已核准的參考來規劃多鏡頭序列;為每個鏡頭分配時長與明確的視覺目的。自訂分鏡控制支援針對時長、構圖、鏡頭表現與敘事推進的鏡頭級指令。

時間目的視覺指令音訊指令
0–5 秒建立產品存在感瓶子特寫;慢速推近安靜室內環境音
5–10 秒引入主持人Maya 與瓶子同框的中景;固定鏡頭“Ready when you are.”
10–15 秒以產品作結乾淨的英雄鏡;穩定停留在最終構圖室內環境音

Kling VIDEO 3.0 Omni Model 使用手冊

官方自訂多鏡頭分鏡面板。

Create a three-shot product advertisement using @Maya, @BlueBottle,
and @Studio.

Continuity rules:
Use the same presenter, outfit, bottle, and studio throughout.
Keep the bottle’s shape, cap, color, and label unchanged.
Maintain the same lighting direction.
Use Maya’s bound voice only.
Do not add people, products, captions, or extra dialogue.

Follow the separate shot descriptions and durations.
End on a stable product composition.

像檢視單一鏡頭一樣仔細檢視轉場。比較每次剪接前的最後清晰產品視角與剪接後的第一個清晰視角。在編輯器中加入法規文案、確切價格、字幕與品牌字體,以便措辭保持在直接控制之下。

How to Use Video References for Character Creation and Video Editing

用於建立可重用角色的片段與供編輯任務使用的來源素材不同。前者建立身份;後者提供既有的動作與構圖以供變換或保留。對於角色建立,使用一段 3–8 秒的單一角色片段。對於影片編輯,Kling 的Omni 官方指南允許一段 3–10 秒來源影片、最多 200 MB 與 2K 解析度;檢查所選 API 路由的當前限制,並先測試短片段再擴大製作。

Use the uploaded video as the source.

Change only the background to a softly lit studio.
Preserve the presenter’s identity, clothing, actions, and timing.
Preserve the bottle and the original camera movement.
Do not add cuts, gestures, objects, or dialogue.

受控的編輯請求不保證逐影格的完美保留。請分別決定是否保留來源音訊或生成新聲音,然後將輸出與原始片段逐一對照檢視。

How to Use the Omni API in CometAPI

對於程式化存取,使用專用的Omni 影片端點。下方使用的文件化識別碼為 kling-v3-omni。

範例遵循已公布的 API 結構;它們不代表實際的生成測試。所選路由為相關模式文件化的時長值為 “5” 與 “10”,因此不要假設 15 秒的介面工作流程能對應到相同的請求。

Submit a Generation Task

export COMETAPI_KEY="YOUR_COMETAPI_KEY"

curl --fail --silent --show-error \
  --request POST \
  "https://api.cometapi.com/kling/v1/videos/omni-video" \
  --header "Authorization: Bearer ${COMETAPI_KEY}" \
  --header "Content-Type: application/json" \
  --data-raw '{
    "model_name": "kling-v3-omni",
    "prompt": "A blue reusable bottle stands on a clean studio tabletop. One continuous shot with a slow straight push-in. Soft light from camera left. No people, no cuts, no captions.",
    "mode": "std",
    "aspect_ratio": "9:16",
    "duration": "5",
    "sound": "off"
  }'

對於第一影格參考,將以下片段合併到請求中,並以可存取的圖片取代範例 URL:

{
  "image_list": [
    {
      "image_url": "https://your-public-host.example/bottle.jpg",
      "type": "first_frame"
    }
  ],
  "prompt": "Starting from <<<image_1>>>, create one continuous slow push-in. Preserve the bottle and studio composition. No cuts or captions."
}

API 的 <<<image_1>>> 語法與介面中的 @Element 參考不同。文件化的 sound 值為 on 與 off。

Retrieve the Finished Video

儲存回傳的 data.task_id,然後查詢 Omni 任務狀態路由:

TASK_ID="REPLACE_WITH_RETURNED_TASK_ID"

curl --fail --silent --show-error \
  "https://api.cometapi.com/kling/v1/videos/omni-video/${TASK_ID}" \
  --header "Authorization: Bearer ${COMETAPI_KEY}"

文件化狀態為 submitted、processing、succeed 與 failed。具有 code: 0 的建立回應代表請求已被接受;並不表示影片已準備好。當任務成功時,從 data.task_result.videos[0].url 取得結果。

使用有界次數的輪詢與退避,保留任務 ID 及其提示與設定,並在重試前檢視失敗訊息。逾時的用戶端請求可能已建立可計費的任務。

What Does Kling VIDEO 3.0 Omni Cost?

請以特定組態的價格為準,而非通用的「單支影片價格」。下方數字於 2026 年 9 月 9 日檢查,且可能變更。

Kling 的官方 VIDEO 3.0 Omni 指南列出了以下平台點數費率。下一張表中的 CometAPI 美元價格使用不同的計費單位;在未套用相應的 Kling 點數購買匯率前,點數無法換算為美元。

Omni 組態官方點數 / 秒官方點數 / 5 秒官方點數 / 10 秒
720p,無影片輸入,原生音訊關閉63060
1080p,無影片輸入,原生音訊關閉84080
1080p,無影片輸入,原生音訊開啟1260120
1080p,影片輸入,原生音訊關閉1680160

官方指南未列出 4K Omni 的點數費率,並在此價格表中註記「影片輸入時的原生音訊不支援」。在訂購前確認產品內的當前費率。

CometAPI 的 Omni API5 秒輸出10 秒輸出
720p,無影片輸入$0.336$0.672
1080p,無影片輸入$0.448$0.896
1080p,原生音訊$0.560$1.120
1080p,影片輸入$0.672$1.344
4K,無影片輸入$1.680$3.360

這些是獨立的 API 組態。不要將各列相加或推斷每種解析度、音訊與影片輸入的組合都可用。4K 價格也不代表哪個參數或路由能啟用 4K。

Kling 在最初發佈後引入了原生 4K 影片。在支付更高解析度的迭代前先核准內容與動作。

Budget for Accepted Clips

更有用的製作量測是:

Cost per accepted clip = total generation spend ÷ accepted clips

以 1080p 原生音訊費率進行三次五秒嘗試的成本為 3 × $0.560 = $1.680。若只有一次嘗試符合接受標準,其有效生成成本為 $1.680。此計算用於說明預算編列;它並非測得的重試比率。

請將 Kling 應用點數與 CometAPI 美元計費分開。Kling 的點數成本指南將時長、解析度、音訊與工作流程視為獨立的規劃因子。

Troubleshooting: What Should You Change First?

問題首要檢查建議調整
角色在鏡頭間發生變化參考衝突或服裝描述重用一個已核准的元素並簡化鏡頭
產品外形或標籤發生變化參考品質與過於要求的運鏡增加更清晰的產品視角;測試靜止鏡頭
錯誤的聲音或多餘的語音聲音綁定與相互衝突的指令保持單一說話者與一句短台詞
不期望的剪接分鏡設定與場景變化測試沒有敘事跳躍的單一連續鏡頭
API 拒絕請求路由特定的結構、型別與時長回到文件化的最小請求
任務存在但沒有影片 URL生成可能仍在進行中查詢現有任務而不是再建立新的
更高解析度仍然看起來不對動作或身份問題仍然存在在提升輸出品質前先修正場景

一次只變更一個變數。記錄資產、提示、設定、輸出與拒絕原因,以便改進能追溯至特定決策。

Final Recommendation

在製作仰賴組合與重用可辨識資產時使用 Omni,而非僅因其名稱暗示普遍升級。先從一個短的參考主導鏡頭開始,核准角色或產品,引入綁定的聲音,然後建立分鏡。轉移到 CometAPI 時,使模型識別碼、時長、參考語法與非同步任務流程與所選端點保持一致。

最有用的問題不是「我能在一個提示中塞入多少?」而是「下一次生成之前,我應該先消除哪個不確定性?」

FAQ

Omni 一定比標準模型更好嗎?

不一定。偏好基準在某些評估上可能偏向標準模型。當其更廣的參考工作流程改善資產重用、連續性或編輯控制時,Omni 最有用。

每個 Omni 工作流程都能生成 15 秒影片嗎?

不一定。15 秒是支援工作流程下的模型層級能力。各個介面與 API 路由可能僅提供較短的時長選項。

我應該一開始就使用原生音訊與多鏡頭嗎?

通常不應該。先驗證一個短的視覺鏡頭。在身份與產品一致性可接受後再加入聲音,然後擴展為分鏡。

@Element 名稱在 API 請求中可用嗎?

不會自動可用。在 Kling 介面中選取的元素與 API 的圖片參考語法是不同機制。請遵循你所呼叫路由的結構文件。

我應該如何估算製作預算?

追蹤總生成支出並除以被接受的片段。將拒絕嘗試、更高解析度重跑、儲存與後製納入工作估算。

繼續學習

把這篇文章連到下一個決策。

查看所有主題
發布於 Oct 5, 2026
最後更新 Oct 5, 2026
1 次瀏覽
已審核內容清晰度、來源標註與最新 API 術語。

閱讀更多