先回答 Vidu Q3 能從文字提示或參考影像生成短篇敘事影片,並在單一工作流程中同時生成同步的對白、音效、環境音與畫面。它支援長度最長 16 秒的片段,解析度可為 540p、720p 或 1080p。創作者可在 Vidu 網頁端產品中操作,開發者則可透過 CometAPI 以模型 ID viduq3 呼叫該模型。
本指南專注於創意流程:規劃鏡頭、選擇文字轉影片或圖像轉影片、指導鏡頭運動與音訊、生成變體、檢視失敗案例,以及建立可重複的網頁或 API 工作流程。
何謂 Vidu Q3?
Vidu Q3 是 ShengShu Technology 與 Vidu 發布的第三代影片模型,專為故事驅動的影片創作設計,而非單純的動態迴圈。該模型能同時生成圖像序列與原生音訊,使對白、環境音、音效與音樂提示可依場景時間線同步。
此模型特別適用於短劇、漫畫與動畫改編、敘事型廣告、電影預視化、產品故事化呈現與社群影片。Vidu 強調音畫同步、多語輸出、多說話者場景,以及對鏡頭與節奏的細緻控制,作為 Q3 的核心能力。
Vidu Q3 現已成為一個模型家族,而非單一代際配置。本指南主要聚焦於透過 CometAPI 暴露為 viduq3 的 Q3 Pro 路線。
Vidu Q3 快速規格
來源註記: 規格綜合 Vidu API 文件 與 CometAPI 模型頁**。
| 規格 | Vidu Q3 詳情 | 實務意義 |
|---|---|---|
| 開發者 | ShengShu Technology / Vidu | 商業封閉式視訊模型 |
| 官方 API 模型 ID | viduq3-pro | 用於 Vidu 原生的文字、影像與影格工作流程 |
| CometAPI 模型 ID | viduq3 | 與 CometAPI 統一的 Videos API 搭配使用 |
| 輸入模式 | 文字、影像、起始/結束影格、參考 | 實際模式取決於 API 介面 |
| 目前 CometAPI 輸入 | 文字或單一參考影像 | 影像轉影片採用 multipart 表單上傳 |
| 輸出 | 具原生同步音訊的 MP4 影片 | 可同時生成對白與音效 |
| 時長 | 文字、影像與起始/結束為 1–16 秒;參考到影片為 3–16 秒 | 預設通常為 5 秒 |
| 解析度 | 540p、720p、1080p | CometAPI 使用精確的寬x高值 |
| 影格率 | 24 FPS | 列於 CometAPI 模型頁 |
| 輸出語言 | 英文、日文、中文 | 有助於在地化對白 |
| 主要聚焦 | 以敘事與角色驅動為核心的影片 | 短劇、廣告、電影風格段落 |
簡要效能背景
公開基準僅能作為起點,因為影片品質高度依賴於提示、參考影像、鏡頭設計與審核標準。在 SuperCLUE-R2V 上,Vidu Q3 記錄了70.89,相較於 Vidu Q2 的 64.01。此結果支持 Q3 在參考保留與主體連貫上的改進,但創作者仍應以自身角色、產品、鏡頭語言與音訊需求來評估模型。
創作比榜單更重要 實務中,追蹤能保留身份、遵循預期動作、採用可接受鏡頭運動、同步對白並通過審核的片段比例。最佳的工作流程是能產出最多可用鏡頭者,而非單項分數最高者。
Vidu Q3 的關鍵特性
原生音畫生成
Vidu Q3 在一次生成中同時產出畫面與聲音。提示可同時要求口語對白、旁白、環境音、腳步、碰撞等音效,與視覺動作並行。這可減少為每個草稿單獨製作聲帶的需求,並在創意審查時更容易評估節奏。
有一個重要的 API 細節:Vidu 的直接文件中為 Q3 提供 [audio] 控制,但獨立的 bgm 開關在 Q3 上不生效。若音樂重要,請在提示中描述音樂提示與時間點。CometAPI 目前的統一 Vidu 請求暴露提示、時長、尺寸與可選的參考影像,因此音訊指示同樣應寫入提示中。
單次生成最長 16 秒
16 秒的上限足以完成一段完整的短敘事節拍:一個建立性鏡頭、一個主要動作、一句對白、一個鏡頭移動與一個收尾反應。它仍非長篇生成。廣告、劇集或音樂影片需要鏡頭計畫、多次任務與後期剪輯組裝。
多角色與多語言對白
此產品為多角色對話設計,支援英文、日文與中文輸出。適合在地化短劇與社群活動。將語言支援視為能力,而非每次生成皆保證完美的發音、情緒或唇形同步;發佈前請逐條檢視輸出。
鏡頭與節奏控制
當提示描述影像敘事意圖而非只列物件時,Q3 反應最佳。指定鏡頭尺寸、鏡頭感、攝影機路徑、光線、動作順序、節奏、對白與音訊提示。單一一致的鏡頭指令通常比在同一鏡頭中加入多個相互衝突的運動有更高命中率。
以參考為基礎的一致性
Vidu 的直接參考到影片工作流可接受最多七個影像或文字主體。參考能在不同鏡頭位置上錨定角色、產品、道具或視覺風格。
- 文字轉影片:由書面提示生成場景、運動、構圖與聲音。
- 影像轉影片:將單一輸入影像動畫化;提示應聚焦在動作、鏡頭行為與音訊。
- 起始/結束影格生成:在直接 Vidu API 上,於兩個視覺錨點間生成轉場。
- 參考到影片:在生成序列中保持主題或風格一致。
如何在網頁端使用 Vidu Q3 建立影片
網頁工作流程是從想法到可審核片段最快的方式。介面標籤可能變動,但創作邏輯保持一致:選擇正確的輸入模式、準備視覺錨點、撰寫可導演的單一鏡頭、生成變體,並只針對失敗的維度調整。
第 1 步:定義交付物
決定影片用途、長寬比、目標時長、視覺風格、口語語言,以及輸出是否需銜接其他鏡頭。社群開場、產品細節鏡頭、短劇節拍與電影預視化鏡頭需要不同節奏。
第 2 步:選擇創作模式
當可由提示發明構圖時選擇文字轉影片。當你已具備期望角色、產品、藝術作品或取景時選擇影像轉影片。當身份或風格需由多個主體錨定時,在 Vidu 直接介面使用參考到影片。
模式決策 探索時用文字轉影片。當第一幀已包含需保護的設計時用影像轉影片。當一致性比視覺驚喜更重要時,使用參考驅動的工作流。
第 3 步:準備參考影像
對於影像轉影片,使用清晰銳利且已具備正確主體比例、取景、光線方向與背景的影像。為主體或攝影機的移動方向保留視覺空間。避免極小的臉部、被遮擋的手、難以辨識的產品標籤、相互衝突的反射,以及沒有運動空間的裁切。
第 4 步:選擇 Vidu Q3
當敘事品質、角色連續性、對白與同步聲音重要時,為入圍鏡頭選擇 Q3。先以 Q3 Turbo 進行較低成本的探索,再將最強的提示與參考影像移至 Q3 做最終渲染。
第 5 步:撰寫結構化鏡頭提示
依觀眾體驗的順序撰寫提示:主體與場景、動作、鏡頭、風格、對白、音效、節拍時間與限制條件。給模型一個主導鏡頭移動與一個主要動作。
可重用的提示結構
Subject + environment + primary action + shot type + camera movement +lighting + visual style + dialogue + sound effects + timing + constraints
第 6 步:指導對白與聲音
將口語台詞放在引號中,標明說話者,描述表演方式,並將對白控制在片段長度內。將環境音與定時音效區分。例如:音訊:全程為安靜房間環境音;第四秒杯子碰桌面的陶瓷清脆聲;無音樂。
第 7 步:設定時長與解析度
從 5 秒、720p 開始。在投入更長或更高解析度之前,先確認構圖、身份、運動與音訊。僅當鏡頭需要更多時間完成節拍時才延長時長;多出的秒數不會自動改善運動。
第 8 步:生成變體
在重寫所有內容前,先以相同的核心提示生成多個候選。變體能揭示問題是隨機還是結構性。如果每個輸出都以相同方式失敗,則更換提示或參考影像。如果只有一個輸出失敗,則保留提示並選擇另一個候選。
第 9 步:審核並只修一個維度
分次審核片段。先檢查身份與物件完整性,再檢查動作與鏡頭運動,接著是對白與音訊時間,最後是結尾影格。只更改失敗的維度,以免在修正音效提示時丟失良好的構圖。
- 身份失敗:強化保留語句或使用更乾淨的參考影像。
- 動作薄弱:以一個可見且方向明確的動作取代抽象動詞。
- 鏡頭混亂:移除互相衝突的移動,指定一條具有速度的路徑。
- 唇形不同步:縮短對白、減少同時動作,並明確說話者與表演方式。
- 背景不穩:簡化場景,並明確保留佈局與光線。
第 10 步:下載並封存最終片段
僅在輸出符合發佈或客戶審核標準後下載。將最終片段與其提示、輸入影像、模型變體、時長、解析度與生成筆記一併保存,以便重用創作配方。
為何透過 CometAPI 使用 Vidu Q3?
當產品需要存取多個 AI 供應商而不想為每個供應商維護獨立的驗證與任務管理層時,CometAPI 最有用。 目前的 Vidu 路由遵循統一的非同步工作流:建立任務、取得 ID、輪詢作業,並下載完成的 MP4。
- 單一 API 金鑰 同時可用於 Vidu 與其他模型家族。
- 統一的影片任務模式 用於提交、狀態擷取與下載。
- 更簡單的 A/B 測試 當同一應用需比較 Vidu、Kling、Veo、Seedance 或 Wan 路由時。
- 集中化使用管理 便於計費、監控與營運審查。
- 更少供應商特定程式碼 當模型可用性或價格改變時。
定價註記 CometAPI 並非在每個 Q3 配置上都一定比 Vidu 直接 API 更便宜。其價值主張在於營運一致性與模型選擇。部署前請比較確切的路由、解析度、時長、佇列模式與計費政策。
如何透過 CometAPI 使用 Vidu Q3
CometAPI 的 Vidu 實作使用 POST /v1/videos 與 multipart/form-data。以下範例皆為伺服端。勿在瀏覽器 JavaScript、行動應用、公開儲存庫、截圖或客戶端日誌中暴露正式金鑰。
第 1 步:建立並儲存 CometAPI 金鑰
建立或登入 CometAPI 帳戶,然後產生 API 金鑰。將其儲存為環境變數。
macOS 或 Linux
export COMETAPI_KEY="your_cometapi_key"
Windows PowerShell
$env:COMETAPI_KEY="your_cometapi_key"
第 2 步:建立文字轉影片任務
最小可行請求需要模型 ID 與提示。加入時長與尺寸以便請求可重現。
cURL 文字轉影片請求
curl https://api.cometapi.com/v1/videos \ -H "Authorization: Bearer $COMETAPI_KEY" \ -F model=viduq3 \ -F 'prompt=A cinematic medium shot of a young astronaut walking through pale blue fog. Slow dolly-in camera. Soft footsteps and distant mechanical ambience.' \ -F seconds=5 \ -F size=1280x720
端點會立即回傳任務物件,不會等待渲染完成。請保存回傳的 id 或 task_id。
第 3 步:建立影像轉影片任務
對於影像轉影片,透過 input_reference multipart 欄位上傳一張本機影像。描述影像應如何動,而非重複每個可見細節。
cURL 影像轉影片請求
curl https://api.cometapi.com/v1/videos \ -H "Authorization: Bearer $COMETAPI_KEY" \ -F model=viduq3 \ -F 'prompt=The character turns slowly toward the window as rain moves across the glass. Gentle handheld camera, quiet room tone, distant thunder.' \ -F seconds=6 \ -F size=1280x720 \ -F input_reference=@reference.png
第 4 步:讀取任務回應
接受任務的回應範例
{ "id": "task_example", "object": "video", "model": "viduq3", "status": "queued", "progress": 0 }
將任務識別碼視為不透明字串。將 id 與相容別名 task_id 正規化一次,然後與模型、提示、時長、尺寸、請求時間戳、發起渲染的使用者或作業紀錄一同儲存。
第 5 步:輪詢任務狀態
呼叫 GET /v1/videos/{task_id},直到狀態變為 completed、failed 或 error。CometAPI 的擷取文件包含相同的終止狀態模式。
具逾時的 Python 輪詢迴圈
import os import time import requests task_id = "<TASK_ID>" headers = {"Authorization": f"Bearer {os.environ['COMETAPI_KEY']}"} terminal = {"completed", "failed", "error"} deadline = time.time() + 20 * 60 while time.time() < deadline: response = requests.get( f"https://api.cometapi.com/v1/videos/{task_id}", headers=headers, timeout=60, ) response.raise_for_status() task = response.json() print(task["status"], task.get("progress")) if task["status"] in terminal: if task["status"] != "completed": raise RuntimeError(task.get("error", task["status"])) break time.sleep(10) else: raise TimeoutError("Video generation did not finish in time")
第 6 步:下載完成影片
當任務完成時,透過內容端點下載 MP4。若應用需要長期保存,請將資產保存至耐久儲存。
下載 MP4
curl "https://api.cometapi.com/v1/videos/$TASK_ID/content" \ -H "Authorization: Bearer $COMETAPI_KEY" \ -o vidu-q3-output.mp4
第 7 步:以 JavaScript 執行完整流程
Node.js 端到端範例
import fs from "node:fs"; const form = new FormData(); form.append("model", "viduq3"); form.append("prompt", "A quiet product reveal with a slow orbit camera and soft mechanical sound design."); form.append("seconds", "5"); form.append("size", "1280x720"); const auth = { Authorization: `Bearer ${process.env.COMETAPI_KEY}` }; const created = await fetch("https://api.cometapi.com/v1/videos", { method: "POST", headers: auth, body: form, }).then((r) => r.json()); let task; do { await new Promise((resolve) => setTimeout(resolve, 10_000)); task = await fetch(`https://api.cometapi.com/v1/videos/${created.id}`, { headers: auth, }).then((r) => r.json()); } while (!["completed", "failed", "error"].includes(task.status)); if (task.status !== "completed") throw new Error(JSON.stringify(task.error)); const video = await fetch( `https://api.cometapi.com/v1/videos/${created.id}/content`, { headers: auth }, ); fs.writeFileSync("vidu-q3-output.mp4", Buffer.from(await video.arrayBuffer()));
Vidu Q3 API 參數
來源註記: 目前欄位名稱與限制遵循 CometAPI 的 Vidu 端點**。
| 參數 | 型別 | 是否必填 | 建議 | 用途 |
|---|---|---|---|---|
| model | String | 是 | viduq3 | 選擇 Vidu Q3 |
| prompt | String | 是 | 結構化場景提示 | 描述視覺、運動、對白與聲音 |
| seconds | Integer | 否 | 從 5 開始 | 接受 1 至 16 |
| size | String | 否 | 1280x720 | 使用支援的寬x高值 |
| input_reference | File | 影像模式 | PNG/JPEG/WebP | 引導影像轉影片生成 |
文件記載的 Vidu 路由支援以下尺寸值:
-
960x528— 540p 等級,16:9。 -
1280x720— 720p 等級,16:9。 -
1920x1080— 1080p 等級,16:9。
相容性規則 僅使用你呼叫之路由文件中列出的參數。供應商原生欄位如 audio、callback_url、多主體或離峰模式等,不應假設可在 CometAPI 的統一端點上使用,除非 CometAPI 文件明確列出。
如何撰寫更佳的 Vidu Q3 提示?
將每個提示寫成精簡的鏡頭說明。依下列順序安排欄位,使 Vidu Q3 在接收視覺基礎後,再接收運動、攝影機指示、光線、語音、音效與保留規則。
Subject → Environment → Action → Camera → Lighting → Dialogue → Audio → Constraints
使用一個清晰主體、一個主要動作與一條鏡頭路徑。保持對白簡短,將環境音與事件音分離,並用限制條件聲明必須保持不變的元素。對於影像轉影片,將輸入影像視為視覺真相來源,提示應聚焦在運動、鏡頭行為、音訊與保留。
電影風格提示範例
Subject: A tired detective in a dark trench coat.Environment: A rain-soaked alley beneath a flickering streetlight at night.Action: She stops, hears approaching footsteps, and slowly looks over her shoulder.Camera: Medium close-up with a gentle three-second dolly in and a 35mm lens feel.Lighting: Blue-magenta reflections, soft backlighting, shallow depth of field, and subtle film grain.Dialogue: In a restrained whisper, "You should not have come back."Audio: Steady rain ambience, one distant siren, and footsteps that stop after the line.Constraints: Preserve her face, coat, and alley layout; no subtitles, logos, extra people, or camera shake.
產品提示範例
Subject: A premium stainless-steel smartwatch with a clean blue display.Environment: The watch rests on black stone while a thin ribbon of water circles the base.Action: At second three, the display turns on and reveals a single blue pulse.Camera: Slow left-to-right orbit ending on a centered macro view of the watch face.Lighting: Crisp edge reflections, controlled highlights, and a dark luxury color grade.Dialogue: None.Audio: Soft water movement, one precise electronic chime, and a restrained low bass swell.Constraints: Preserve the watch geometry, materials, display layout, and logo placement; no hands, extra text, or deformation.
動畫風格提示範例
Subject: A teenage girl holding a red umbrella in a hand-drawn anime style.Environment: A quiet rural train platform at sunset, with tall grass moving in a warm wind.Action: She looks down the empty track as a distant train light appears, then smiles slightly.Camera: Track slowly beside her and stop in a medium shot when the train light appears.Lighting: Warm sunset light, soft shadows, stable linework, and consistent character colors.Dialogue: She whispers in Japanese, "Yatto kaette kita."Audio: Summer insects, soft wind, and a distant railway bell after the dialogue.Constraints: Preserve the character design, facial features, umbrella color, and anime style; no on-screen text or extra characters.
影像轉影片提示範例
Subject: Preserve the character's face, hairstyle, clothing, pose, and framing from the reference image.Environment: Keep the same room, furniture arrangement, background layout, and window position.Action: The character looks up from the book, smiles slightly, and turns toward the window while the curtain moves in a light breeze.Camera: Use a slow, stabilized push in with subtle natural movement.Lighting: Preserve the original light direction, exposure, skin tone, and room colors.Dialogue: None.Audio: Quiet room tone, soft page movement, light curtain rustle, and distant birds.Constraints: No identity changes, added accessories, hand distortion, sudden camera movement, background replacement, or new objects.
使用 Vidu Q3 建立多鏡頭影片
完整的廣告、短劇、預告或音樂段落通常需要多個生成片段。將 Vidu Q3 視為鏡頭生成器,使用簡單的鏡頭列表來在整段序列中保持連貫性。
| 鏡頭 | 目的 | 連貫性錨點 |
|---|---|---|
| 1. 建立 | 廣角鏡頭介紹場景與主體 | 環境、服裝、時段 |
| 2. 接近 | 中景開始主要動作 | 銀幕方向、道具位置、光線 |
| 3. 強調 | 特寫呈現對白或產品細節 | 臉部或產品幾何、音訊識別 |
| 4. 收束 | 反應或乾淨結尾影格完成節拍 | 最終姿勢、調色、轉場方向 |
重用連貫性標頭
為每個鏡頭提示都以相同的精簡身份區塊開頭:角色外觀、服裝、產品設計、地點、時段與視覺風格。然後只更改鏡頭特定的動作、取景、鏡頭與音訊。
可重用的多鏡頭提示樣式
Continuity: the same woman in her early thirties, short black hair, dark green coat, silver pendant; rainy neon alley at night; blue-magenta reflections; restrained cinematic realism. Shot 3: medium close-up. She stops beneath the streetlight and looks over her shoulder. Slow dolly in. She whispers, "I heard you." Rain ambience continues; distant footsteps stop at second four.
將一鏡結尾與下一鏡開頭對齊
- 保持銀幕方向一致,除非剪接刻意反轉。
- 同一道具保持在同一隻手或相同位置。
- 匹配服裝、天氣、光線方向與主色調。
- 以穩定姿勢或構圖收尾,讓其可作為下一鏡的參考影像。
- 在相鄰鏡頭間保持一致的環境音,僅在動作處加入事件音。
在生成器之外進行組裝與完成
修剪薄弱的開頭或結尾影格,排列鏡頭,標準化音量,在編輯器中加入標題或字幕,並在生成後進行最終調色與音訊處理。AI 生成的螢幕文字不如後期加入精確排版可靠。
何時應選擇 Vidu Q3?
模型比較應支持創意決策,而非喧賓奪主。實務問題是:哪個工作流程最符合你需要產出的鏡頭。
| 維度 | Vidu Q3 | Vidu Q3 Turbo | Seedance 2.5 | Kling 3.0 | Veo 3.1 |
|---|---|---|---|---|---|
| 時長 | 1–16s;官方 參考到影片 3–16s | 1–16s;官方 參考到影片 3–16s | 4–30s | 最長 15s,依模式而定 | 每次 API 生成 4s、6s 或 8s |
| 音訊 | 原生同步音訊 | 原生同步音訊 | 原生音畫生成 | 原生音訊模式可用 | 原生音訊 |
| 參考 | CometAPI 上為單一影像;官方介面更豐富 | CometAPI 上為單一影像;官方介面更豐富 | 最多 50 個多模態參考 | 影像、起始/結束與動作控制模式 | 影像與首/末幀引導 |
| API | CometAPI POST /v1/videos | CometAPI POST /v1/videos | CometAPI POST /v1/videos | 與 Kling 相容的 text2video/image2video 路由 | CometAPI POST /v1/videos |
| 標示價格 | 自 $0.056/s 起 | 自 $0.028/s 起 | 路由估算自 $0.0824/s 起 | V3 720p:$0.336/5s(無音訊) | 720p 或 1080p 為 $0.32/s |
| 最佳用途 | 帶對白與連貫性的最終短敘事鏡頭 | 打樣、提示迭代與更大量生成 | 較長且參考豐富的多模態敘事 | 受控鏡頭、運動與多鏡頭製作 | 寫實電影風格鏡頭與逼真物理 |
來源註記: 模型介面與可用模式可能變動。Kling 官方指南記載 720p/1080p 與原生音訊模式**;Google 描述 Veo 3.1 的 原生音訊、參考控制與高解析工作流**。價格為路由快照而非品質標準化比較;解析度、音訊模式與品質層級不同,故在發佈前請核實所連結的模型頁。
實務選擇結論
當你需要短篇敘事鏡頭,且要求角色或產品連貫性、可導演的鏡頭節奏、對白、環境音與音效一次生成時,選擇 Vidu Q3。使用 Q3 Turbo 探索提示,僅將最強的創意方向移至高階路線完成最終渲染。若片段長度、更大的參考堆疊、專門的多鏡頭控制或寫實物理比 Q3 的敘事工作流更重要,則考慮其他模型。
Vidu Q3 多少錢?
定價需要逐路由誠實比較。CometAPI 將其 Vidu Q3 路由按生成秒數計費。Vidu 的直接 API 也依時長與解析度計價,並提供成本更低但完成時間更長的離峰佇列。
| 解析度 | CometAPI Vidu Q3 | Vidu 官方 API | 官方 離峰 |
|---|---|---|---|
| 540p | $0.056/s | $0.045/s | $0.025/s |
| 720p | $0.1232/s | $0.10/s | $0.05/s |
| 1080p | $0.1232/s | $0.12/s | $0.06/s |
來源註記: 標示之每秒價格來自 CometAPI 模型頁 與 Vidu 價格文件**。在面向客戶發佈或部署前,請核實即時計費。
在上述標示價格下,CometAPI 並非在每個 Q3 配置上都較便宜。其優勢在於營運面:單一金鑰、一致的影片端點、集中化任務處理,以及更容易在多供應商間切換。僅使用 Vidu 且可等待離峰處理的團隊,透過 Vidu 直接 API 可能支付更少。
CometAPI 範例運行成本
| 時長 | 540p | 720p | 1080p |
|---|---|---|---|
| 5 秒 | $0.28 | $0.616 | $0.616 |
| 10 秒 | $0.56 | $1.232 | $1.232 |
| 16 秒 | $0.896 | $1.9712 | $1.9712 |
每支可用片段的成本 若大多數生成被淘汰,即便每秒費率低仍然昂貴。追蹤總支出除以通過創意審核的輸出數,而非僅看單次渲染的標價。
量產最佳實務
更好的創意迭代策略
- 從小開始。 使用 5 秒 720p 的請求驗證構圖、動作與鏡頭運動。
- 生成受控變體。 保持核心提示穩定,每次只變動一個創意選項。
- 診斷失敗維度。 在編輯提示前,區分身份、運動、鏡頭、音訊與連貫性的問題。
- 分離草稿與最終路線。 探索用較快變體,僅對入圍提示使用高階變體。
- 保存獲勝配方。 封存最終提示、參考、設定、輸出與審核筆記以便重用。
Vidu Q3 影片審核清單
一次審所有項會使提示修訂困難。使用分次審核,讓每次退件導向明確修正。
| 審核階段 | 受理檢查 | 失敗時要修什麼 |
|---|---|---|
| 主體 | 臉部、身體、服裝、產品幾何、標籤與道具保持一致 | 參考或保留提示 |
| 動作 | 主要運動完整、可讀且時序正確 | 動作動詞、方向與節拍順序 |
| 鏡頭 | 運動沿單一路徑,無跳動、漂移或非預期重新構圖 | 鏡頭尺寸、路徑、速度與終點 |
| 環境 | 背景佈局、光線、天氣與次要運動保持穩定 | 場景複雜度與連貫性限制 |
| 音訊 | 對白、發音、唇形同步、環境音與音效提示符合動作 | 更短台詞與更清晰的音訊時間線 |
| 結尾影格 | 最終構圖足夠乾淨,可停留、剪接或作為下一鏡的種子 | 最終姿勢與鏡頭終點 |
核准規則 不要僅因某一幀畫面令人印象深刻就核准片段。以正常速度觀看,再檢視開頭、動作高峰、對白時刻與最後一幀。可用影片必須在時間上保持連貫。
關於 Vidu Q3 的常見問題
Vidu Q3 能同時生成影片與音訊嗎?
可以。Q3 專為直接音畫生成設計,包括對白與音效。在使用 CometAPI 統一路由時,請在提示中描述所需音訊及其時間點。
Vidu Q3 的 CometAPI 模型 ID 是什麼?
在目前的 CometAPI Videos API 中使用 viduq3。除非路由文件明確要求,否則不要以供應商原生 viduq3-pro 名稱代替。
Vidu Q3 一支影片最長可多長?
單次 Q3 生成支援 1–16 秒。更長的作品需多鏡頭與剪輯。
Vidu Q3 是否支援影像轉影片?
是。於 CometAPI 上,透過 input_reference 上傳一張影像,並用提示描述運動、鏡頭行為、聲音與必須保持不變的內容。
Vidu Q3 能生成不同語言的對白嗎?
Vidu 列示支援英文、日文與中文。發佈在地化內容前,請檢視發音、聲音識別、情緒與唇形同步。
我應該用 Vidu Q3 還是 Vidu Q3 Turbo?
當最終視覺品質、敘事一致性與角色連貫性比生成速度更重要時,使用 Q3。Q3 Turbo 用於草稿、提示迭代與更大量的工作流程。
CometAPI 是否比官方 Vidu API 更便宜?
並非所有配置皆然。當前公開費率顯示 Vidu 的常規與離峰模式可能更便宜。選擇 CometAPI 是為了統一存取、單一整合、集中任務處理與更易跨供應商切換,而非基於不支持的「一律更便宜」主張。
最終建議
Vidu Q3 是製作短篇、故事驅動影片的強力選項,能讓畫面、對白、環境音與音效同步生成。其最有用的製作強項包括 16 秒生成、基於參考的一致性、多說話者敘事、多語輸出,以及在提示層面控制鏡頭與節奏。
首次測試時,使用一位主體、一個主要動作、一個鏡頭移動與清晰音訊指示的五秒 720p 請求。在低成本下迭代提示,僅在構圖有效後再提高解析度或時長。以 Q3 Turbo 進行草稿探索,對入圍的最終渲染再使用標準 Q3。
為建立可重複的生產流程,將每次通過審核的結果轉化為可重用的創作配方:保留最終提示、參考影像、模型 ID、時長、解析度、任務後設資料與審核筆記。以穩定的單支片段組裝成多鏡頭影片,並在後期加入精確的標題、字幕、剪輯、調色與最終混音。當此工作流程同時需要單一任務模式與跨多個影片模型的便捷路由時,CometAPI 的價值最大。
開始打造 打開 Vidu Q3 模型頁,建立 CometAPI 金鑰,提交一個小型測試任務,並驗證完整的 建立 → 輪詢 → 下載 工作流程。
