TL;DR
프로젝트가 재사용 가능한 사람, 제품, 설정, 보이스 또는 소스 영상을 하나의 통제된 워크플로로 결합해야 할 때 Omni를 사용하세요. 그 가치 포인트는 레퍼런스 오케스트레이션과 시청각적 연속성이며, 표준 모델 대비 자동 품질 향상을 보장하는 것이 아닙니다. 짧은 검증 샷 하나로 시작하고, 레퍼런스를 승인한 뒤 오디오를 추가하고, 핵심 에셋이 안정적으로 유지될 때에만 스토리보드로 확장하세요.
Key Takeaways
- Omni는 텍스트, 이미지, 요소, 비디오, 보이스 레퍼런스를 지원하며, 지원되는 워크플로에서 모델 레벨 출력은 최대 15초입니다.
- Kling VIDEO 3.0은 선호도 벤치마크에서 여전히 경쟁력이 있습니다. 더 넓은 레퍼런스 워크플로가 특정 제작 니즈를 해결할 때 Kling VIDEO 3.0 Omni를 선택하세요.
- 멀티샷 시퀀스로 결합하기 전에 정체성, 제품 형태, 구도, 오디오를 각각 따로 검증하세요.
- API 작업에서는 모든 인터페이스 기능이 노출된다고 가정하지 말고 선택한 프로바이더 라우트에 문서화된 파라미터를 따르세요.
- 한 번의 시도 비용만이 아니라 승인된 클립을 기준으로 예산을 책정하세요.
공식 Omni 워크스페이스 및 레퍼런스 컨트롤.
What Does the Omni Model Support?
Kling는 Omni를 멀티모달 레퍼런스와 시청각적 일관성에 초점을 맞춘 모델로 포지셔닝합니다. 실무적 함의는 간단합니다: 인지 가능해야 하는 에셋을 정의하고, 그 위에 일어나야 할 일을 기술하세요.
| Specification — official generation guide | Omni capability |
|---|---|
| Input options | 텍스트, 이미지, 비디오 레퍼런스, 재사용 가능한 요소, 보이스 레퍼런스 |
| Model-level output duration | 3–15초 |
| Video resolution | 720p 및 1080p; 지원되는 워크플로에서 네이티브 4K |
| Audio | 지원되는 캐릭터–보이스 바인딩과 함께 네이티브 시청각 생성 |
| Shot control | 단일 샷 생성 및 커스텀 멀티샷 시퀀싱 |
| Multi-image element creation | 2–4장의 이미지 |
| Video-based character creation | 3–8초 캐릭터 클립 |
| Recommended voice sample | 5–30초 길이의 명료한 단일 화자 음성 |
| Combined image and element budget | 비디오 입력 없이 최대 7개; 비디오 입력 시 최대 4개 |
Element를 생성하는 것은 하나의 생성 요청에 레퍼런스를 첨부하는 것과 다릅니다. 여러 뷰가 하나의 재사용 가능한 Element에 속할 수 있으며, 이것이 자동으로 여러 개의 독립적인 Element 슬롯로 계산되지는 않습니다.
모델 레벨의 기능이 모든 프로바이더에서 동일한 컨트롤을 보장하지는 않습니다. Kling의 인터페이스에서 15초 워크플로가 서드파티 API 요청과 동일한 파라미터와 길이를 노출한다고 가정하지 마세요.
Kling VIDEO 3.0 Omni vs Kling VIDEO 3.0: When to Choose Each
선택은 단순히 “기본 영상”과 “사운드 포함 영상”의 구분이 아닙니다. 표준 모델도 네이티브 오디오, 멀티샷 생성, Element 바인딩을 지원합니다. 더 유용한 구분은 프로젝트가 레퍼런스를 어떻게 조직하고 재사용하는가입니다.
| Dimension | Kling VIDEO 3.0 | Kling VIDEO 3.0 Omni |
|---|---|---|
| Reference organization | 승인된 시작 프레임 또는 시작/종료 프레임을 중심으로 한 Element 바인딩 | 이미지, Elements, 비디오 레퍼런스를 결합하는 더 넓은 컴포지션 |
| Element relationship | 중요한 주제가 이미 정의 프레임에 존재할 때 최적 | 분리된 에셋을 결합하거나 재사용해야 할 때 최적 |
| Character voice | 보이스 바운드 Elements 사용 가능 | 하나의 Omni 워크플로에서 비주얼 및 보이스 레퍼런스 지원 |
| Multi-shot generation | 지원됨 | 커스텀 스토리보드 컨트롤과 함께 지원 |
| Recommended starting point | 이미 장면을 정의하는 승인된 키프레임 하나 | 여러 샷에 걸쳐 인지 가능해야 하는 에셋 컬렉션 |
결론: 필수 정보가 이미 하나의 승인된 프레임에 담겨 있다면 표준 워크플로로 시작하세요. 레퍼런스 컴포지션, 에셋 재사용, 또는 샷 간 시청각 연속성이 작업의 핵심이라면 Omni를 선택하세요.
Kling VIDEO 3.0 Omni vs Kling VIDEO 3.0: Benchmarks
다음 점추정치는 2026년 9월 9일 본 가이드를 검토할 당시 Artificial Analysis에서 제공하는 1080p Pro, 오디오 활성화 항목을 비교한 것입니다. “±” 뒤 값은 공개된 95% 신뢰구간입니다.
| Evaluation — text-to-video / image-to-video | Standard | Omni |
|---|---|---|
| Text-to-video Elo | 1108 ± 5 | 1090 ± 6 |
| Image-to-video Elo | 1072 ± 6 | 1060 ± 7 |
이는 선호 기반 평점이며, 생성 성공률이 아닙니다. 표준 모델이 두 비교에서 더 높은 점추정치를 보였고, image-to-video 신뢰구간은 겹칩니다. 평점은 새로운 평가가 추가되면 변할 수 있습니다.
벤치마크 결론: Omni의 장점은 이름에서 추론하거나 보편적 품질 순위로 취급할 것이 아니라, 레퍼런스 처리와 제작 연속성 관점에서 평가해야 합니다.
How to Build Your First Reference-Led Video
발표자 Maya, 재사용 가능한 파란색 병, 승인된 스튜디오 설정 하나를 포함한 세로형 광고를 상상해 보세요. 이는 예시적 제작 에셋이며 보고된 생성 테스트가 아닙니다.
Prepare a Small, Consistent Asset Set
| Asset | Preparation | Acceptance criterion |
|---|---|---|
| Presenter | 머리, 의상, 조명이 일관된 명확한 뷰 | 알아볼 수 있는 얼굴과 변하지 않은 의상 |
| Bottle | 정면, 측면, 3/4 뷰 | 안정적인 몸체 형태, 캡, 색상, 라벨 |
| Setting | 승인된 스튜디오 레퍼런스 하나 | 일관된 배경과 조명 방향 |
| Voice | 권한 있는 화자의 깨끗한 음성 | 겹치지 않는 단일 화자의 식별 가능한 음성 |
얼굴, 녹음, 브랜드 에셋은 사용할 권한이 있는 것만 사용하세요. 충돌하는 레퍼런스는 더 긴 프롬프트로 보정하려 하기 전에 먼저 수정해야 합니다.
Create and Name Your Elements
Kling의 Element Library에서, 매 샷마다 동일한 대상을 재서술하는 대신 재사용 가능한 에셋을 만드세요. 공식 워크플로는 멀티이미지 및 비디오 기반 캐릭터 생성을 지원합니다.
Maya, BlueBottle, Studio처럼 설명적인 이름을 사용하세요. 이름은 조직을 돕는 도구이며, 저장된 Element를 선택하는 것이 레퍼런스를 첨부하는 행위입니다. 업로드한 보이스의 경우 명확한 단일 화자 오디오를 사용하고 음악이나 겹치는 음성을 포함하지 마세요.

공식 캐릭터 Element 및 보이스 바인딩 컨트롤.
아래 프롬프트에서 @Maya, @BlueBottle, @Studio는 Kling 인터페이스에서 선택된 Elements를 의미합니다. 해당 에셋을 첨부하지 않고 이름만 입력해도 레퍼런스가 생성되지는 않습니다.
Generate One Simple Shot First
Omni 생성 워크스페이스를 열고, 모델을 선택한 뒤 필요한 에셋을 첨부하세요. 5초, 카메라 움직임 1개, 대사 없음으로 시작합니다.
Create a single continuous product shot using @BlueBottle in @Studio.
The bottle stands upright on a clean tabletop. Keep its body shape,
cap, surface color, and label placement consistent with the references.
Camera: a slow, straight push-in from a medium close-up.
Lighting: soft studio light from camera left.
Action: the bottle remains stationary.
Composition: leave clear space above the bottle for text added later.
No cuts, no extra products, and no generated captions.
초반, 중반, 후반을 확인하세요. 캡, 실루엣, 라벨 위치, 테이블 접촉을 점검합니다. 에셋이 바뀐다면, 새로운 요구를 추가하기 전에 샷을 단순화하거나 레퍼런스를 개선하세요.
Add the Presenter and Native Audio
병 샷이 허용 수준이면, 발표자와 짧은 대사 한 줄을 추가하세요. Kling는 여러 언어의 음성 생성을 문서화하지만, 출력 품질은 레퍼런스 품질, 타이밍, 프롬프트 명확성에 여전히 좌우됩니다.
Create a five-second continuous shot using @Maya, @BlueBottle,
and @Studio.
Maya stands beside the bottle, looks toward the camera, and says:
“Ready when you are.”
Use Maya’s bound voice. Keep the bottle unchanged. Use one static
camera angle. Do not add music, captions, cuts, or additional speech.
오디오는 화면과 별도로 검토하세요: 의도한 사람이 말하는지, 대사가 완전한지, 타이밍이 보이는 연기와 맞는지 확인합니다.
단일 샷을 검증한 후, 승인된 레퍼런스를 재사용하여 멀티샷 시퀀스를 계획하세요. 각 샷에 길이와 고유한 비주얼 목적을 부여합니다. 커스텀 스토리보드 컨트롤은 길이, 구도, 카메라 동작, 내러티브 진행에 대한 샷 수준 지시를 지원합니다.
| Time | Purpose | Visual instruction | Audio instruction |
|---|---|---|---|
| 0–5 seconds | 제품 제시 | 병 클로즈업; 느린 푸시 인 | 조용한 룸 톤 |
| 5–10 seconds | 발표자 소개 | 병 옆의 Maya 중간 샷; 정지 카메라 | “Ready when you are.” |
| 10–15 seconds | 제품으로 마무리 | 깨끗한 히어로 샷; 최종 구도 유지 | 룸 톤 |

공식 커스텀 멀티샷 스토리보드 패널.
Create a three-shot product advertisement using @Maya, @BlueBottle,
and @Studio.
Continuity rules:
Use the same presenter, outfit, bottle, and studio throughout.
Keep the bottle’s shape, cap, color, and label unchanged.
Maintain the same lighting direction.
Use Maya’s bound voice only.
Do not add people, products, captions, or extra dialogue.
Follow the separate shot descriptions and durations.
End on a stable product composition.
전환을 단일 샷만큼 면밀히 검토하세요. 각 컷 전의 마지막 명확한 제품 뷰와 컷 후의 첫 명확한 뷰를 비교합니다. 법적 고지, 정확한 가격, 자막, 브랜드 타이포그래피는 편집기에서 추가하여 문구를 직접 통제하세요.
How to Use Video References for Character Creation and Video Editing
재사용 가능한 캐릭터를 만들기 위해 사용하는 클립은 편집 작업을 위해 제공하는 소스 영상과 다릅니다. 전자는 정체성을 확립하고, 후자는 기존의 움직임과 구도를 제공해 변환하거나 보존합니다. 캐릭터 생성에는 한 캐릭터의 3–8초 클립을 사용하세요. 비디오 편집의 경우, Kling의 공식 Omni 가이드는 3–10초 소스 비디오 하나, 최대 200 MB 및 2K 해상도를 허용합니다. 선택한 API 라우트의 현재 제한을 확인하고 확장 전에 짧은 클립으로 테스트하세요.
Use the uploaded video as the source.
Change only the background to a softly lit studio.
Preserve the presenter’s identity, clothing, actions, and timing.
Preserve the bottle and the original camera movement.
Do not add cuts, gestures, objects, or dialogue.
통제된 편집 요청이 프레임 단위 보존을 보장하지는 않습니다. 소스 오디오를 유지할지 새로운 사운드를 생성할지 별도로 결정하고, 출력물을 원본 클립과 대조하세요.
How to Use the Omni API in CometAPI
프로그래매틱 접근을 위해 전용 Omni 비디오 엔드포인트를 사용하세요. 아래에 사용된 문서화된 식별자는 kling-v3-omni입니다.
예시는 게시된 API 스키마를 따릅니다. 라이브 생성 테스트를 보고하는 것이 아닙니다. 선택한 라우트는 관련 모드의 길이 값으로 “5”와 “10”을 문서화하므로, 15초 인터페이스 워크플로가 동일 요청으로 매핑된다고 가정하지 마세요.
Submit a Generation Task
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
curl --fail --silent --show-error \
--request POST \
"https://api.cometapi.com/kling/v1/videos/omni-video" \
--header "Authorization: Bearer ${COMETAPI_KEY}" \
--header "Content-Type: application/json" \
--data-raw '{
"model_name": "kling-v3-omni",
"prompt": "A blue reusable bottle stands on a clean studio tabletop. One continuous shot with a slow straight push-in. Soft light from camera left. No people, no cuts, no captions.",
"mode": "std",
"aspect_ratio": "9:16",
"duration": "5",
"sound": "off"
}'
첫 프레임 레퍼런스를 위해, 다음 조각을 요청에 병합하고 샘플 URL을 접근 가능한 이미지로 바꾸세요:
{
"image_list": [
{
"image_url": "https://your-public-host.example/bottle.jpg",
"type": "first_frame"
}
],
"prompt": "Starting from <<<image_1>>>, create one continuous slow push-in. Preserve the bottle and studio composition. No cuts or captions."
}
API의 <<<image_1>>> 문법은 인터페이스에서 선택하는 @Element 레퍼런스와 다른 메커니즘입니다. 문서화된 sound 값은 on과 off입니다.
Retrieve the Finished Video
반환된 data.task_id를 저장한 뒤, Omni 태스크 상태 라우트를 조회하세요:
TASK_ID="REPLACE_WITH_RETURNED_TASK_ID"
curl --fail --silent --show-error \
"https://api.cometapi.com/kling/v1/videos/omni-video/${TASK_ID}" \
--header "Authorization: Bearer ${COMETAPI_KEY}"
문서화된 상태는 submitted, processing, succeed, failed입니다. code: 0인 생성 응답은 요청이 접수되었음을 의미하며, 비디오가 준비되었음을 의미하지는 않습니다. 태스크가 성공하면 data.task_result.videos[0].url에서 결과를 얻습니다.
제한된 폴링과 백오프를 사용하고, 태스크 ID를 프롬프트 및 설정과 함께 보관하며, 재시도 전에 실패 메시지를 확인하세요. 시간 초과된 클라이언트 요청이 이미 과금 대상 태스크를 생성했을 수 있습니다.
What Does Kling VIDEO 3.0 Omni Cost?
일반적인 “영상당 가격”이 아니라 구성별 가격을 사용하세요. 아래 수치는 2026년 9월 9일 확인되었으며 변경될 수 있습니다.
Kling의 공식 VIDEO 3.0 Omni 가이드는 다음과 같은 플랫폼 크레딧 요율을 나열합니다. 다음 표의 CometAPI 달러 가격은 다른 과금 단위를 사용합니다. 적용되는 Kling 크레딧 구매율 없이는 크레딧을 달러로 환산할 수 없습니다.
| Omni configuration | Official credits / second | Official credits / 5 seconds | Official credits / 10 seconds |
|---|---|---|---|
| 720p, no video input, native audio off | 6 | 30 | 60 |
| 1080p, no video input, native audio off | 8 | 40 | 80 |
| 1080p, no video input, native audio on | 12 | 60 | 120 |
| 1080p, video input, native audio off | 16 | 80 | 160 |
공식 가이드는 4K Omni 크레딧 요율을 나열하지 않으며, 이 가격표에서 비디오 입력 시 네이티브 오디오를 미지원으로 표시합니다. 주문 전에 제품 내 최신 요율을 확인하세요.
| Omni API in CometAPI | 5-second output | 10-second output |
|---|---|---|
| 720p, no video input | $0.336 | $0.672 |
| 1080p, no video input | $0.448 | $0.896 |
| 1080p, native audio | $0.560 | $1.120 |
| 1080p, video input | $0.672 | $1.344 |
| 4K, no video input | $1.680 | $3.360 |
이는 별개의 API 구성입니다. 행을 더하거나, 해상도·오디오·비디오 입력의 모든 조합이 가능하다고 추론하지 마세요. 4K 가격이 어떤 파라미터나 라우트로 4K를 활성화하는지까지 보장하지도 않습니다.
Kling는 초기 출시 이후 네이티브 4K 비디오를 도입했습니다. 더 높은 해상도로 반복 실행하기 전에 콘텐츠와 모션을 승인하세요.
Budget for Accepted Clips
더 유용한 제작 지표는 다음과 같습니다:
Cost per accepted clip = total generation spend ÷ accepted clips
1080p 네이티브 오디오 요율로 5초짜리 시도 3번은 3 × $0.560 = $1.680입니다. 세 시도 중 하나만 승인 기준을 충족했다면, 해당 클립의 실질 생성 비용은 $1.680입니다. 이 계산은 예산 책정을 설명하기 위한 것이며, 재시도율을 측정한 값이 아닙니다.
Kling 애플리케이션 크레딧과 CometAPI 달러 과금은 분리해 관리하세요. Kling의 크레딧 비용 가이드는 길이, 해상도, 오디오, 워크플로를 독립적인 계획 요소로 다룹니다.
Troubleshooting: What Should You Change First?
| Problem | First check | Suggested adjustment |
|---|---|---|
| 샷 간 캐릭터 변화 | 충돌하는 레퍼런스 또는 의상 설명 | 승인된 Element 하나를 재사용하고 샷을 단순화 |
| 제품 형태 또는 라벨 변화 | 레퍼런스 품질 및 과도한 모션 | 더 명확한 제품 뷰 추가; 정지 샷 테스트 |
| 잘못된 보이스 또는 추가 발화 | 보이스 바인딩 및 충돌하는 지시 | 화자 1명과 짧은 한 줄로 제한 |
| 원치 않는 컷 | 스토리보드 설정 및 장면 전환 | 내러티브 점프 없이 연속 샷 하나를 테스트 |
| API가 요청을 거부함 | 라우트별 스키마, 타입, 길이 | 문서화된 최소 요청으로 복귀 |
| 태스크가 있으나 비디오 URL 없음 | 생성이 아직 진행 중일 수 있음 | 새로 만들지 말고 기존 태스크를 조회 |
| 고해상도인데도 문제 지속 | 모션 또는 정체성 문제가 여전히 존재 | 출력 품질을 올리기 전에 장면을 수정 |
한 번에 하나의 변수만 변경하세요. 에셋, 프롬프트, 설정, 출력, 거절 사유를 기록하여 개선이 특정 결정에 기인함을 추적하세요.
Final Recommendation
Omni를 사용하는 이유는 이름이 보편적 업그레이드를 암시하기 때문이 아니라, 인지 가능한 에셋의 결합과 재사용이 제작의 핵심일 때입니다. 짧은 레퍼런스 주도 샷 하나로 시작하고, 캐릭터나 제품을 승인한 뒤, 바인딩된 보이스를 도입하고, 그 다음에 스토리보드를 구축하세요. CometAPI로 전환할 때는 선택한 엔드포인트에 맞춰 모델 식별자, 길이, 레퍼런스 문법, 비동기 태스크 플로우를 정렬하세요.
가장 유용한 질문은 “한 프롬프트에 얼마나 많이 넣을 수 있는가?”가 아니라 “다음 생성 전에 어떤 불확실성을 제거해야 하는가?”입니다.
FAQ
Omni가 항상 표준 모델보다 낫나요?
아니요. 일부 평가에서 표준 모델이 선호될 수 있습니다. Omni는 더 넓은 레퍼런스 워크플로가 에셋 재사용, 연속성, 편집 제어를 개선할 때 가장 유용합니다.
모든 Omni 워크플로에서 15초 영상을 생성할 수 있나요?
아니요. 15초는 지원되는 워크플로에서의 모델 레벨 기능입니다. 개별 인터페이스와 API 라우트는 더 짧은 길이 옵션을 노출할 수 있습니다.
네이티브 오디오와 멀티샷으로 시작해야 하나요?
보통 그렇지 않습니다. 먼저 짧은 비주얼 샷 하나를 검증하세요. 정체성과 제품 일관성이 허용 수준이면 보이스를 추가하고, 그 다음 스토리보드로 확장하세요.
@Element 이름이 API 요청에서 작동하나요?
자동으로 작동하지 않습니다. Kling 인터페이스에서 선택된 Elements와 API의 이미지 레퍼런스 문법은 서로 다른 메커니즘입니다. 호출 중인 라우트의 스키마를 따르세요.
제작 예산은 어떻게 추정해야 하나요?
총 생성 지출을 추적하고 승인된 클립 수로 나누세요. 거절된 시도, 고해상도 재실행, 스토리지, 후반 작업까지 포함해 운영 추정에 반영하세요.
