먼저 답변 Vidu Q3는 텍스트 프롬프트 또는 참조 이미지를 기반으로, 하나의 워크플로에서 대사, 효과음, 앰비언스, 비주얼을 동기화해 단편적인 내러티브 영상을 생성할 수 있습니다. 최대 16초의 540p, 720p, 1080p를 지원합니다. 크리에이터는 Vidu 웹 제품에서 작업할 수 있고, 개발자는 CometAPI에서 모델 ID **viduq3**로 모델을 호출할 수 있습니다.
이 가이드는 창작 과정에 초점을 맞춥니다: 숏 기획, 텍스트-투-비디오 또는 이미지-투-비디오 선택, 카메라 무브와 오디오 연출, 변형 생성, 실패 리뷰, 그리고 반복 가능한 웹 또는 API 워크플로 구축.
What Is Vidu Q3?
Vidu Q3는 ShengShu Technology와 Vidu가 선보이는 3세대 비디오 모델입니다. 단순한 모션 루프가 아니라 이야기 중심의 영상 제작을 목표로 설계되었습니다. 이 모델은 이미지 시퀀스와 네이티브 오디오를 함께 생성할 수 있어, 대사, 환경음, 효과음, 음악 큐가 씬의 타이밍을 따라가도록 합니다.
이 모델은 단편 드라마, 만화/만화책 각색, 내러티브 광고, 영화 프리비주얼라이제이션, 제품 스토리텔링, 소셜 비디오에 특히 적합합니다. Vidu는 오디오-비디오 동기화, 다국어 출력, 다중 화자 씬, 정교한 카메라/페이싱 제어를 Q3의 핵심 역량으로 강조합니다.
Vidu Q3는 이제 단일 세대 구성이 아닌 모델 패밀리입니다. 본 가이드는 주로 CometAPI에서 viduq3로 노출되는 Q3 Pro 경로에 집중합니다.
Vidu Q3 Quick Specifications
출처 참고: 사양은 Vidu API 문서 와 CometAPI 모델 페이지를 종합했습니다.
| 사양 | Vidu Q3 세부 | 실무 의미 |
|---|---|---|
| 개발사 | ShengShu Technology / Vidu | 상용 폐쇄형 비디오 모델 |
| 공식 API 모델 ID | viduq3-pro | Vidu 직접 텍스트/이미지/프레임 워크플로에서 사용 |
| CometAPI 모델 ID | viduq3 | CometAPI의 통합 Videos API에서 사용 |
| 입력 모드 | 텍스트, 이미지, 시작/끝 프레임, 레퍼런스 | 구체적 모드는 API 서피스에 따라 다름 |
| 현재 CometAPI 입력 | 텍스트 또는 단일 참조 이미지 | 이미지-투-비디오용 멀티파트 폼 업로드 |
| 출력 | 네이티브 동기화 오디오가 포함된 MP4 비디오 | 대사와 효과음을 함께 생성 가능 |
| 길이 | 텍스트, 이미지, 시작/끝: 1–16초; 레퍼런스-투-비디오: 3–16초 | 기본값은 일반적으로 5초 |
| 해상도 | 540p, 720p, 1080p | CometAPI는 정확한 가로x세로 값을 사용 |
| 프레임 속도 | 24 FPS | CometAPI 모델 페이지에 표기 |
| 출력 언어 | 영어, 일본어, 중국어 | 현지화된 대사에 유용 |
| 주된 초점 | 내러티브 및 캐릭터 중심 비디오 | 단편 드라마, 광고, 영화풍 시퀀스 |
간단한 성능 맥락
공개 벤치마크는 출발점일 뿐입니다. 비디오 품질은 프롬프트, 참조 이미지, 숏 설계, 리뷰 기준에 크게 좌우됩니다. SuperCLUE-R2V에서 Vidu Q3는 70.89, Vidu Q2는 64.01을 기록했습니다. 이 결과는 Q3의 레퍼런스 보존과 피사체 연속성 개선을 뒷받침하지만, 크리에이터는 자신의 캐릭터, 제품, 카메라 언어, 오디오 요구로 모델을 평가해야 합니다.
리더보드보다 창작이 더 중요합니다 실무에서는 신원 보존, 의도한 액션 준수, 허용 가능한 카메라 무브, 대사 동기화, 리뷰 통과 비율을 추적하세요. 최고의 워크플로는 고립된 점수보다, 가장 많은 사용 가능한 숏을 만들어내는 워크플로입니다.
Key Features of Vidu Q3
네이티브 오디오-비디오 동시 생성
Vidu Q3는 한 번의 생성 패스로 영상과 사운드를 동시에 만듭니다. 프롬프트에 대사, 보이스오버, 환경 앰비언스, 발소리, 타격음 또는 기타 효과음을 비주얼 액션과 함께 요청할 수 있습니다. 이는 매 드래프트마다 별도의 사운드트랙을 제작해야 하는 부담을 줄이고, 창작 리뷰 중 타이밍 평가를 쉽게 해줍니다.
중요한 API 뉘앙스가 있습니다. Vidu의 직접 문서는 Q3용 audio 제어를 제공하지만, 별도 bgm 스위치는 Q3에서 효과가 없습니다. 음악이 중요하다면 프롬프트에 음악 큐와 타이밍을 묘사하세요. CometAPI의 현재 통합 Vidu 요청도 프롬프트, 길이, 사이즈, 선택적 참조 이미지를 노출하므로, 오디오 연출은 동일하게 프롬프트에 작성해야 합니다.
한 번의 생성으로 최대 16초
16초 상한은 하나의 완결된 내러티브 비트를 담기에 충분합니다: 도입 앵글, 하나의 주요 액션, 한 줄의 대사, 카메라 무브, 마무리 리액션. 장편 생성은 아닙니다. 광고, 에피소드, 뮤직비디오는 숏 플랜, 다중 태스크, 편집 조합이 필요합니다.
다중 화자 및 다국어 대사
이 제품은 다수 캐릭터의 대화를 위해 설계되었고 영어, 일본어, 중국어 출력을 지원합니다. 현지화된 단편 드라마와 소셜 캠페인에 유용합니다. 언어 지원을 능력으로만 보되, 모든 생성에서 발음, 감정, 립싱크가 완벽하다고 가정하지 마세요. 게시 전마다 출력을 검수해야 합니다.
카메라와 페이싱 제어
Q3는 사물을 나열하는 것보다, 영화적 의도를 묘사한 프롬프트에 더 잘 반응합니다. 숏 크기, 렌즈 감, 카메라 경로, 조명, 액션 순서, 페이싱, 대사, 사운드 큐를 지정하세요. 하나의 일관된 카메라 지시가, 하나의 숏에 여러 상충되는 움직임을 넣는 것보다 높은 성공률을 보입니다.
레퍼런스 기반 일관성
Vidu의 직접 레퍼런스-투-비디오 워크플로는 최대 7개의 이미지 또는 텍스트 피사체를 받습니다. 레퍼런스는 다양한 카메라 포지션에서 캐릭터, 제품, 소품, 비주얼 스타일을 고정하는 기준점이 됩니다.
- Text-to-video: 작성된 프롬프트로 씬, 움직임, 구도, 사운드를 생성합니다.
- Image-to-video: 단일 입력 이미지를 애니메이션화합니다. 프롬프트는 모션, 카메라 동작, 오디오에 초점을 둡니다.
- Start/end-frame generation: 직접 Vidu API에서 두 시각적 앵커 사이의 전환을 생성합니다.
- Reference-to-video: 생성된 시퀀스 전반에 걸쳐 피사체 또는 스타일의 일관성을 유지합니다.
웹에서 Vidu Q3로 비디오를 만드는 방법
웹 워크플로는 아이디어에서 리뷰된 클립까지 가장 빠른 경로입니다. 인터페이스 레이블은 바뀔 수 있지만, 창작 로직은 같습니다: 올바른 입력 모드 선택, 시각적 앵커 준비, 지시 가능한 하나의 숏 작성, 변형 생성, 실패한 차원만 정교화.
Step 1: 산출물을 정의하세요
영상의 사용처, 화면비, 목표 길이, 비주얼 스타일, 대사 언어, 다른 숏과 연결되어야 하는지 여부를 정하세요. 소셜 훅, 제품 디테일 숏, 단편 드라마 비트, 영화 프리비즈 숏은 서로 다른 페이싱을 요구합니다.
Step 2: 제작 모드를 선택하세요
구도를 프롬프트에서 발명할 수 있을 때 Text to Video를 선택하세요. 원하는 캐릭터/제품/아트워크/프레이밍이 이미 있을 때 Image to Video를 선택하세요. 정체성 또는 스타일을 여러 피사체로 고정해야 할 때는 Vidu의 직접 Reference to Video를 사용하세요.
모드 결정 탐색에는 text-to-video를 사용하세요. 첫 프레임에 보호해야 할 디자인이 이미 들어있다면 image-to-video를 사용하세요. 일관성이 시각적 놀라움보다 중요하다면 레퍼런스 기반 워크플로를 사용하세요.
Step 3: 참조 이미지를 준비하세요
image-to-video에서는 피사체 비율, 프레이밍, 조명 방향, 배경이 이미 적절한 선명한 이미지로 시작하세요. 피사체나 카메라가 움직일 방향에 시각적 여유를 남기세요. 작은 얼굴, 가려진 손, 읽기 어려운 제품 라벨, 상충되는 반사, 움직임 공간이 없는 과도한 크롭을 피하세요.
Step 4: Vidu Q3를 선택하세요
내러티브 품질, 캐릭터 연속성, 대사, 동기화된 사운드가 중요한 후보 숏에 Q3를 선택하세요. 비용을 낮춘 탐색에는 Q3 Turbo를 사용하고, 가장 강력한 프롬프트와 참조 이미지만 Q3로 옮겨 최종 렌더하세요.
Step 5: 구조화된 숏 프롬프트를 작성하세요
관객이 숏을 경험하는 순서로 프롬프트를 작성하세요: 피사체와 배경, 액션, 카메라, 룩, 대사, 사운드, 비트 타이밍, 제약. 하나의 지배적인 카메라 무브와 하나의 주요 액션을 지시하세요.
재사용 가능한 프롬프트 구조
Subject + environment + primary action + shot type + camera movement +lighting + visual style + dialogue + sound effects + timing + constraints
Step 6: 대사와 사운드를 연출하세요
따옴표로 대사를 표기하고 화자를 지정하며, 전달 톤을 묘사하고, 클립 길이에 맞게 대사를 짧게 유지하세요. 앰비언스와 타이밍이 맞는 효과음을 분리하세요. 예: Audio: 전반에 잔잔한 룸톤; 4초에 컵이 책상에 닿는 도자기 소리; 음악 없음.
Step 7: 길이와 해상도를 설정하세요
우선 720p 5초로 시작하세요. 더 길거나 더 높은 해상도로 비용을 쓰기 전에 구도, 정체성, 움직임, 오디오를 확인하세요. 숏의 비트를 마치려면 길이를 늘리되, 초를 추가한다고 움직임이 자동으로 좋아지는 것은 아닙니다.
Step 8: 변형을 생성하세요
모든 것을 다시 쓰기 전에 동일한 코어 프롬프트로 여러 후보를 생성하세요. 변형은 문제가 우연인지 구조적 문제인지 보여줍니다. 모든 출력이 동일한 방식으로 실패하면 프롬프트나 레퍼런스를 바꾸세요. 하나만 실패했다면 프롬프트는 유지하고 다른 후보를 선택하세요.
Step 9: 한 번에 하나의 차원만 수정하세요
클립을 여러 패스로 리뷰하세요. 먼저 신원과 오브젝트 무결성, 다음으로 액션과 카메라 무브, 그 다음 대사와 오디오 타이밍, 마지막으로 엔드 프레임을 확인합니다. 실패한 차원만 변경하여, 사운드 큐를 고치다가 좋은 구도가 사라지지 않도록 하세요.
- 신원 실패: 보존 문구를 강화하거나 더 깔끔한 참조 이미지를 사용하세요.
- 약한 액션: 추상적 동사를 하나의 가시적인 움직임과 명확한 방향으로 바꾸세요.
- 혼란스러운 카메라: 경쟁하는 움직임을 제거하고 속도와 함께 하나의 경로만 지정하세요.
- 좋지 않은 립싱크: 대사를 줄이고, 동시 액션을 줄이며, 화자와 전달 톤을 명시하세요.
- 불안정한 배경: 씬을 단순화하고 레이아웃과 조명을 명시적으로 보존하세요.
Step 10: 최종 클립을 다운로드하고 아카이브하세요
출력이 게시 또는 클라이언트 리뷰 기준을 통과한 뒤에만 다운로드하세요. 최종 클립을 프롬프트, 입력 이미지, 모델 변형, 길이, 해상도, 생성 메모와 함께 저장하여 창작 레시피를 재사용할 수 있게 하세요.
왜 CometAPI로 Vidu Q3를 사용할까요?
CometAPI는 여러 AI 제공업체에 접근해야 하지만, 각사별 인증과 태스크 관리 레이어를 따로 유지하고 싶지 않을 때 유용합니다. 현재 Vidu 경로는 통합 비동기 워크플로를 따릅니다: 태스크 생성, ID 수신, 잡 폴링, 완료된 MP4 다운로드.
- Vidu와 기타 모델 패밀리를 위한 하나의 API 키
- 제출/상태 조회/다운로드를 위한 단일 비디오 태스크 패턴
- 동일한 애플리케이션에서 Vidu, Kling, Veo, Seedance, Wan 경로를 비교하는 간단한 A/B 테스트
- 과금, 모니터링, 운영 리뷰를 위한 중앙화된 사용량 관리
- 모델 가용성 또는 가격이 변해도 제공업체별 코드 감소
요금 참고 CometAPI가 모든 Q3 구성에서 Vidu의 직접 API보다 자동으로 저렴한 것은 아닙니다. 가치 제안은 운영 일관성과 모델 선택지입니다. 배포 전 정확한 경로, 해상도, 길이, 큐 모드, 과금 정책을 비교하세요.
CometAPI로 Vidu Q3를 사용하는 방법
CometAPI의 Vidu 구현은 **multipart/form-data**와 함께 **POST /v1/videos**를 사용합니다. 아래 예시는 서버 사이드입니다. 프로덕션 키를 브라우저 JavaScript, 모바일 앱, 공개 레포지토리, 스크린샷, 클라이언트 사이드 로그에 노출하지 마세요.
Step 1: CometAPI 키를 생성하고 저장하세요
CometAPI 계정을 생성하거나 로그인한 뒤, API 키를 생성하세요. 환경 변수로 저장합니다.
macOS or Linux
export COMETAPI_KEY="your_cometapi_key"
Windows PowerShell
$env:COMETAPI_KEY="your_cometapi_key"
Step 2: 텍스트-투-비디오 태스크 생성
최소 실용 요청에는 모델 ID와 프롬프트가 필요합니다. 요청을 재현 가능하게 하려면 길이와 크기를 명시하세요.
cURL text-to-video 요청
curl https://api.cometapi.com/v1/videos \ -H "Authorization: Bearer $COMETAPI_KEY" \ -F model=viduq3 \ -F 'prompt=A cinematic medium shot of a young astronaut walking through pale blue fog. Slow dolly-in camera. Soft footsteps and distant mechanical ambience.' \ -F seconds=5 \ -F size=1280x720
엔드포인트는 렌더링 완료를 기다리지 않고 태스크 오브젝트를 즉시 반환합니다. 반환된 id 또는 **task_id**를 저장하세요.
Step 3: 이미지-투-비디오 태스크 생성
image-to-video에서는 input_reference 멀티파트 필드로 로컬 이미지를 업로드합니다. 보이는 세부를 반복하기보다 이미지가 어떻게 움직여야 하는지 묘사하세요.
cURL image-to-video 요청
curl https://api.cometapi.com/v1/videos \ -H "Authorization: Bearer $COMETAPI_KEY" \ -F model=viduq3 \ -F 'prompt=The character turns slowly toward the window as rain moves across the glass. Gentle handheld camera, quiet room tone, distant thunder.' \ -F seconds=6 \ -F size=1280x720 \ -F input_reference=@reference.png
Step 4: 태스크 응답 읽기
수락된 태스크 응답 예시
{ "id": "task_example", "object": "video", "model": "viduq3", "status": "queued", "progress": 0 }
태스크 식별자는 불투명 문자열로 취급하세요. id와 호환 별칭 task_id를 한 번 정규화한 뒤, 모델, 프롬프트, 길이, 크기, 요청 타임스탬프, 렌더를 시작한 사용자 또는 잡 레코드와 함께 저장하세요.
Step 5: 태스크 상태 폴링
상태가 completed, failed, error가 될 때까지 **GET /v1/videos/{task_id}**를 호출하세요. CometAPI의 retrieve 문서도 동일한 종료 상태 패턴을 포함합니다.
타임아웃이 있는 Python 폴링 루프
import os import time import requests task_id = "<TASK_ID>" headers = {"Authorization": f"Bearer {os.environ['COMETAPI_KEY']}"} terminal = {"completed", "failed", "error"} deadline = time.time() + 20 * 60 while time.time() < deadline: response = requests.get( f"https://api.cometapi.com/v1/videos/{task_id}", headers=headers, timeout=60, ) response.raise_for_status() task = response.json() print(task["status"], task.get("progress")) if task["status"] in terminal: if task["status"] != "completed": raise RuntimeError(task.get("error", task["status"])) break time.sleep(10) else: raise TimeoutError("Video generation did not finish in time")
Step 6: 완료된 비디오 다운로드
태스크가 완료되면 콘텐츠 엔드포인트로 MP4를 다운로드하세요. 애플리케이션이 장기 보관을 원한다면 내구성 있는 스토리지에 저장하세요.
MP4 다운로드
curl "https://api.cometapi.com/v1/videos/$TASK_ID/content" \ -H "Authorization: Bearer $COMETAPI_KEY" \ -o vidu-q3-output.mp4
Step 7: JavaScript로 전체 워크플로 실행
Node.js end-to-end 예시
import fs from "node:fs"; const form = new FormData(); form.append("model", "viduq3"); form.append("prompt", "A quiet product reveal with a slow orbit camera and soft mechanical sound design."); form.append("seconds", "5"); form.append("size", "1280x720"); const auth = { Authorization: `Bearer ${process.env.COMETAPI_KEY}` }; const created = await fetch("https://api.cometapi.com/v1/videos", { method: "POST", headers: auth, body: form, }).then((r) => r.json()); let task; do { await new Promise((resolve) => setTimeout(resolve, 10_000)); task = await fetch(`https://api.cometapi.com/v1/videos/${created.id}`, { headers: auth, }).then((r) => r.json()); } while (!["completed", "failed", "error"].includes(task.status)); if (task.status !== "completed") throw new Error(JSON.stringify(task.error)); const video = await fetch( `https://api.cometapi.com/v1/videos/${created.id}/content`, { headers: auth }, ); fs.writeFileSync("vidu-q3-output.mp4", Buffer.from(await video.arrayBuffer()));
Vidu Q3 API Parameters
출처 참고: 현재 필드명과 한계는 CometAPI Vidu 엔드포인트를 따릅니다.
| 파라미터 | 유형 | 필수 | 권장 | 용도 |
|---|---|---|---|---|
| model | 문자열 | 예 | viduq3 | Vidu Q3 선택 |
| prompt | 문자열 | 예 | 구조화된 씬 프롬프트 | 비주얼, 움직임, 대사, 사운드를 설명 |
| seconds | 정수 | 아니오 | 5로 시작 | 1–16 허용 |
| size | 문자열 | 아니오 | 1280x720 | 지원되는 가로x세로 값 사용 |
| input_reference | 파일 | 이미지 모드 | PNG/JPEG/WebP | image-to-video 생성을 안내 |
문서화된 Vidu 경로에서 지원되는 size 값:
-
960x528— 540p 티어, 16:9. -
1280x720— 720p 티어, 16:9. -
1920x1080— 1080p 티어, 16:9.
호환성 규칙 호출하는 경로에 문서화된 파라미터만 사용하세요. audio, callback_url, 다중 피사체, 비혼잡 시간 모드 같은 제공사 고유 필드는, CometAPI 문서에 명시되지 않는 한 CometAPI의 통합 엔드포인트에서 동작한다고 가정하지 마세요.
How to Write Better Vidu Q3 Prompts ?
각 프롬프트를 간결한 숏 브리프로 작성하세요. 아래 순서를 유지하여 Vidu Q3가 모션, 카메라 지시, 조명, 대사, 사운드, 보존 규칙보다 앞서 시각적 기반을 먼저 받도록 하세요.
Subject → Environment → Action → Camera → Lighting → Dialogue → Audio → Constraints
하나의 명확한 피사체, 하나의 주요 액션, 하나의 카메라 경로를 사용하세요. 대사는 짧게, 앰비언스와 이벤트 사운드는 분리하고, 제약에는 반드시 변하지 말아야 할 것을 명시하세요. image-to-video에서는 입력 이미지를 시각적 기준으로 삼고, 프롬프트는 모션, 카메라 동작, 오디오, 보존에 집중하세요.
Cinematic Prompt Example
Subject: A tired detective in a dark trench coat.Environment: A rain-soaked alley beneath a flickering streetlight at night.Action: She stops, hears approaching footsteps, and slowly looks over her shoulder.Camera: Medium close-up with a gentle three-second dolly in and a 35mm lens feel.Lighting: Blue-magenta reflections, soft backlighting, shallow depth of field, and subtle film grain.Dialogue: In a restrained whisper, "You should not have come back."Audio: Steady rain ambience, one distant siren, and footsteps that stop after the line.Constraints: Preserve her face, coat, and alley layout; no subtitles, logos, extra people, or camera shake.
Product Prompt Example
Subject: A premium stainless-steel smartwatch with a clean blue display.Environment: The watch rests on black stone while a thin ribbon of water circles the base.Action: At second three, the display turns on and reveals a single blue pulse.Camera: Slow left-to-right orbit ending on a centered macro view of the watch face.Lighting: Crisp edge reflections, controlled highlights, and a dark luxury color grade.Dialogue: None.Audio: Soft water movement, one precise electronic chime, and a restrained low bass swell.Constraints: Preserve the watch geometry, materials, display layout, and logo placement; no hands, extra text, or deformation.
Anime Prompt Example
Subject: A teenage girl holding a red umbrella in a hand-drawn anime style.Environment: A quiet rural train platform at sunset, with tall grass moving in a warm wind.Action: She looks down the empty track as a distant train light appears, then smiles slightly.Camera: Track slowly beside her and stop in a medium shot when the train light appears.Lighting: Warm sunset light, soft shadows, stable linework, and consistent character colors.Dialogue: She whispers in Japanese, "Yatto kaette kita."Audio: Summer insects, soft wind, and a distant railway bell after the dialogue.Constraints: Preserve the character design, facial features, umbrella color, and anime style; no on-screen text or extra characters.
Image-to-Video Prompt Example
Subject: Preserve the character's face, hairstyle, clothing, pose, and framing from the reference image.Environment: Keep the same room, furniture arrangement, background layout, and window position.Action: The character looks up from the book, smiles slightly, and turns toward the window while the curtain moves in a light breeze.Camera: Use a slow, stabilized push in with subtle natural movement.Lighting: Preserve the original light direction, exposure, skin tone, and room colors.Dialogue: None.Audio: Quiet room tone, soft page movement, light curtain rustle, and distant birds.Constraints: No identity changes, added accessories, hand distortion, sudden camera movement, background replacement, or new objects.
Vidu Q3로 멀티숏 비디오 만들기
완성된 광고, 단편 드라마, 트레일러, 음악 시퀀스는 보통 여러 생성 클립을 필요로 합니다. Vidu Q3를 숏 생성기로 취급하고, 간단한 숏 리스트로 시퀀스의 연속성을 유지하세요.
| 숏 | 목적 | 연속성 앵커 |
|---|---|---|
| 1. Establish | 와이드 숏으로 장소와 피사체 소개 | 환경, 의상, 시간대 |
| 2. Approach | 미디엄 숏으로 메인 액션 시작 | 화면 방향, 소품 위치, 조명 |
| 3. Emphasis | 클로즈업으로 대사 또는 제품 디테일 전달 | 얼굴 또는 제품 형상, 오디오 아이덴티티 |
| 4. Resolve | 반응 또는 깔끔한 엔드 프레임으로 비트 완결 | 최종 포즈, 컬러 그레이드, 전환 방향 |
연속성 헤더를 재사용하세요
모든 숏 프롬프트를 동일한 간결한 아이덴티티 블록으로 시작하세요: 캐릭터 외형, 의상, 제품 디자인, 장소, 시간대, 비주얼 스타일. 그런 다음 숏별 액션, 프레이밍, 카메라, 오디오만 변경합니다.
재사용 가능한 멀티숏 프롬프트 패턴
Continuity: the same woman in her early thirties, short black hair, dark green coat, silver pendant; rainy neon alley at night; blue-magenta reflections; restrained cinematic realism. Shot 3: medium close-up. She stops beneath the streetlight and looks over her shoulder. Slow dolly in. She whispers, "I heard you." Rain ambience continues; distant footsteps stop at second four.
앞 숏의 끝과 다음 숏의 시작을 맞추세요
- 의도적으로 뒤집지 않는 한 화면 방향을 일관되게 유지합니다.
- 같은 손/위치에 같은 소품을 유지합니다.
- 의상, 날씨, 광원 방향, 지배 색을 맞춥니다.
- 안정적인 포즈나 구도로 끝내어 다음 참조 이미지가 되게 합니다.
- 인접 숏 간 앰비언스를 일관되게 유지하고, 이벤트 사운드는 액션이 있을 때만 추가합니다.
생성기 밖에서 조립과 마무리를 하세요
약한 오프닝/클로징 프레임을 트리밍하고 숏을 배치한 뒤, 오디오 레벨을 정규화하고, 에디터에서 타이틀/캡션을 추가하며, 최종 색 보정과 사운드 마감을 적용하세요. AI가 생성한 온스크린 텍스트는 정확한 타이포그래피를 후반에 추가하는 것보다 신뢰도가 낮습니다.
언제 Vidu Q3를 선택해야 할까요?
모델 비교는 창작 결정을 보조해야 하며, 주도해선 안 됩니다. 실무 질문은 “필요한 숏과 가장 잘 맞는 워크플로는 무엇인가”입니다.
| 차원 | Vidu Q3 | Vidu Q3 Turbo | Seedance 2.5 | Kling 3.0 | Veo 3.1 |
|---|---|---|---|---|---|
| 길이 | 1–16초; 공식 레퍼런스-투-비디오 3–16초 | 1–16초; 공식 레퍼런스-투-비디오 3–16초 | 4–30초 | 최대 15초, 모드별 상이 | API당 4초, 6초, 8초 |
| 오디오 | 네이티브 동기화 오디오 | 네이티브 동기화 오디오 | 네이티브 오디오-비디오 생성 | 네이티브 오디오 모드 제공 | 네이티브 오디오 |
| 레퍼런스 | CometAPI에서 이미지 1장; 공식 서피스는 더 풍부 | CometAPI에서 이미지 1장; 공식 서피스는 더 풍부 | 최대 50개의 멀티모달 레퍼런스 | 이미지, 시작/끝, 모션-컨트롤 모드 | 이미지 및 시작/끝 프레임 가이던스 |
| API | CometAPI POST /v1/videos | CometAPI POST /v1/videos | CometAPI POST /v1/videos | Kling 호환 text2video/image2video 경로 | CometAPI POST /v1/videos |
| 표기 가격 | $0.056/s부터 | $0.028/s부터 | 경로 견적 기준 $0.0824/s부터 | V3 720p: 오디오 없이 5초당 $0.336 | 720p 또는 1080p에서 $0.32/s |
| 최적 용도 | 대사와 연속성이 필요한 최종 단편 내러티브 숏 | 드래프트, 프롬프트 반복, 고볼륨 생성 | 더 긴 멀티모달 및 레퍼런스 중심 스토리텔링 | 제어된 카메라, 모션, 멀티숏 프로덕션 | 포토리얼리스틱 시네마틱 숏과 현실적인 물리 |
출처 참고: 모델 서피스와 사용 가능한 모드는 변할 수 있습니다. Kling의 공식 가이드는 720p/1080p 및 네이티브 오디오 모드를 문서화하고, Google은 Veo 3.1의 네이티브 오디오, 레퍼런스 제어, 고해상도 워크플로를 설명합니다. 가격 항목은 정규화된 품질 비교가 아니라 경로 스냅샷입니다. 해상도, 오디오 모드, 품질 티어가 다르므로 게시 전 모델 페이지를 확인하세요.
실무적 선택 결과
캐릭터/제품 연속성, 지시 가능한 카메라 리듬, 대사, 앰비언스, 효과음을 한 번에 생성해야 하는 짧은 내러티브 숏에는 Vidu Q3를 선택하세요. 프롬프트 탐색에는 Q3 Turbo를 사용하고, 가장 강력한 크리에이티브 방향만 프리미엄 경로로 옮기세요. 클립 길이, 더 큰 레퍼런스 스택, 특수한 멀티숏 제어, 포토리얼리스틱 물리가 Q3의 내러티브 워크플로보다 중요하다면 다른 모델을 고려하세요.
Vidu Q3의 비용은 얼마인가요?
요금은 경로별 정직한 비교가 필요합니다. CometAPI는 Vidu Q3 경로를 생성된 초 단위로 청구합니다. Vidu의 직접 API도 길이와 해상도별로 가격을 책정하며, 완료 대기 시간이 훨씬 긴 저비용 비혼잡 시간 큐를 제공합니다.
| 해상도 | CometAPI Vidu Q3 | Vidu 공식 API | 공식 비혼잡 시간 |
|---|---|---|---|
| 540p | $0.056/s | $0.045/s | $0.025/s |
| 720p | $0.1232/s | $0.10/s | $0.05/s |
| 1080p | $0.1232/s | $0.12/s | $0.06/s |
출처 참고: 초당 가격은 CometAPI 모델 페이지 와 Vidu 가격 문서의 표기값입니다. 고객-facing 게시나 배포 전 실시간 과금을 검증하세요.
이 표기 요금 기준으로 CometAPI가 모든 Q3 구성에서 더 저렴한 것은 아닙니다. 장점은 운영입니다: 하나의 키, 일관된 비디오 엔드포인트, 중앙화된 태스크 처리, 제공업체 간 전환 용이. 오직 Vidu만 사용하고 비혼잡 시간 처리를 기다릴 수 있는 팀은 Vidu 직접 API가 더 저렴할 수 있습니다.
CometAPI 실행 비용 예시
| 길이 | 540p | 720p | 1080p |
|---|---|---|---|
| 5초 | $0.28 | $0.616 | $0.616 |
| 10초 | $0.56 | $1.232 | $1.232 |
| 16초 | $0.896 | $1.9712 | $1.9712 |
사용 가능한 클립당 비용 초당 낮은 요금이라도 대부분의 생성이 반려되면 비쌀 수 있습니다. 광고된 한 번의 렌더 가격이 아니라, 창작 리뷰를 통과한 결과물 대비 총 지출을 추적하세요.
프로덕션 모범 사례
더 나은 크리에이티브 반복 전략
- 작게 시작. 5초 720p 요청으로 구도, 액션, 카메라 무브를 검증하세요.
- 통제된 변형 생성. 코어 프롬프트를 안정적으로 유지하고, 한 번에 한 가지 크리에이티브 선택만 바꾸세요.
- 실패한 차원 진단. 프롬프트 수정 전, 신원/모션/카메라/오디오/연속성 문제를 분리하세요.
- 드래프트와 최종 경로 분리. 탐색에는 빠른 변형을, 선정된 프롬프트에는 프리미엄 변형을 사용하세요.
- 승인 레시피 저장. 최종 프롬프트, 레퍼런스, 설정, 출력, 리뷰 노트를 보관해 재사용하세요.
Vidu Q3 비디오 리뷰 체크리스트
모두를 한 번에 리뷰하면 프롬프트 수정을 어렵게 만듭니다. 각 반려가 구체적 수정으로 이어지도록 별도 패스로 진행하세요.
| 리뷰 패스 | 수용 기준 | 실패 시 수정할 것 |
|---|---|---|
| 피사체 | 얼굴, 몸, 의상, 제품 형상, 라벨, 소품이 일관되게 유지됨 | 레퍼런스 또는 보존 프롬프트 |
| 액션 | 주요 움직임이 완결되고, 읽기 쉽고, 타이밍이 정확함 | 액션 동사, 방향, 비트 순서 |
| 카메라 | 움직임이 점프, 드리프트, 원치 않는 리프레이밍 없이 하나의 경로를 따름 | 숏 크기, 경로, 속도, 엔드포인트 |
| 환경 | 배경 레이아웃, 조명, 날씨, 2차 움직임이 안정적으로 유지됨 | 씬 복잡도와 연속성 제약 |
| 오디오 | 대사, 발음, 립싱크, 앰비언스, 사운드 큐가 액션에 부합 | 더 짧은 대사와 명확한 오디오 타임라인 |
| 엔드 프레임 | 최종 구도가 홀드/컷/다음 숏의 시드로 쓰기 충분히 깔끔함 | 최종 포즈와 카메라 엔드포인트 |
승인 규칙 한 프레임이 인상적이라는 이유만으로 클립을 승인하지 마세요. 정상 속도로 시청한 뒤, 시작, 액션 피크, 대사 순간, 최종 프레임을 점검하세요. 사용 가능한 비디오는 시간에 걸쳐 일관되어야 합니다.
FAQs About Vidu Q3
Vidu Q3는 비디오와 오디오를 함께 생성할 수 있나요?
예. Q3는 대사와 효과음을 포함한 직접 오디오-비디오 생성을 위해 설계되었습니다. CometAPI의 통합 경로를 사용할 때 원하는 오디오와 타이밍을 프롬프트에 묘사하세요.
Vidu Q3의 CometAPI 모델 ID는 무엇인가요?
현재 CometAPI Videos API에서는 viduq3를 사용하세요. 경로 문서가 명시하지 않는 한 제공사 네이티브 이름 viduq3-pro로 대체하지 마세요.
Vidu Q3 비디오는 얼마나 길게 만들 수 있나요?
단일 Q3 생성은 1–16초를 지원합니다. 더 긴 제작은 다수의 숏과 편집이 필요합니다.
Vidu Q3는 이미지-투-비디오 생성을 지원하나요?
예. CometAPI에서는 input_reference로 이미지를 한 장 업로드하고, 프롬프트로 움직임, 카메라 동작, 사운드, 보존해야 할 것을 설명하세요.
Vidu Q3는 여러 언어로 대사를 생성할 수 있나요?
Vidu는 영어, 일본어, 중국어 출력을 표기합니다. 현지화 콘텐츠 출하 전 발음, 보이스 아이덴티티, 감정, 립싱크를 검수하세요.
Vidu Q3와 Vidu Q3 Turbo 중 무엇을 써야 하나요?
최종 시각 품질, 내러티브 일관성, 캐릭터 연속성이 생성 속도보다 중요하면 Q3를 사용하세요. 드래프트, 프롬프트 반복, 더 높은 볼륨 워크플로에는 Q3 Turbo를 사용하세요.
CometAPI가 Vidu 공식 API보다 저렴한가요?
모든 구성에서 그렇지 않습니다. 현재 공개 요금은 Vidu의 일반/비혼잡 모드가 더 저렴할 수 있음을 보여줍니다. 통합 접근, 단일 통합, 중앙화된 태스크 처리, 제공업체 간 전환 용이성 등 운영 가치를 위해 CometAPI를 선택하세요—모든 경로에서 더 싸다는 근거 없는 주장에 의존하지 마세요.
최종 권고
Vidu Q3는 그림, 대사, 앰비언스, 효과음이 함께 도착해야 하는 짧고 이야기 중심의 비디오에 강력한 옵션입니다. 가장 유용한 프로덕션 강점은 16초 생성, 레퍼런스 기반 일관성, 다중 화자 스토리텔링, 다국어 출력, 프롬프트 수준의 카메라/리듬 제어입니다.
첫 테스트로, 한 피사체/한 주요 액션/한 카메라 무브/명확한 오디오 지시를 담은 5초 720p 요청을 사용하세요. 저비용으로 프롬프트를 반복한 뒤, 구도가 작동하면 해상도나 길이를 높이세요. 드래프트 탐색에는 Q3 Turbo, 최종 렌더 후보에는 표준 Q3를 사용하세요.
반복 가능한 프로덕션을 위해, 승인된 결과를 재사용 가능한 창작 레시피로 전환하세요: 최종 프롬프트, 참조 이미지, 모델 ID, 길이, 해상도, 태스크 메타데이터, 리뷰 노트를 보존합니다. 안정적인 개별 클립으로 멀티숏 비디오를 구성한 뒤, 후반에서 정확한 타이틀/캡션/편집/컬러/최종 사운드를 추가하세요. 이 워크플로가 여러 비디오 모델 간 손쉬운 라우팅과 단일 태스크 패턴을 필요로 한다면 CometAPI가 가장 큰 가치를 제공합니다.
시작하기 Vidu Q3 모델 페이지를 열고, CometAPI 키를 생성하고, 소규모 테스트 태스크를 제출한 뒤, 생성 → 폴링 → 다운로드 전체 워크플로를 검증하세요.
