TLDR Wan 3.0(也寫作 Wan3.0)是 Alibaba Tongyi Lab 最新的全能影片模型,能以單次生成產出最長 30 秒、最高 1080p、音畫同步的連續片段。其支援文字轉影片、圖片轉影片、首末幀條件約束,以及強大的 Omni-Reference 工作流程,能接收圖片、影片、音訊、文件(PDF、PPT、XLS、DOC、MD 等)與網頁。
公開測試於 2026 年 8 月 6 日開放;約在 2026 年 8 月 24 日擴大開放。定價大致為 480p $0.05/s、720p $0.10/s、1080p $0.20/s。若開發者與團隊尋求一個統一且相容 OpenAI 的 API 以簡易整合地存取 Wan 系列與 500+ 其他模型,CometAPI 提供高效路徑——目前已上線 Wan 2.7,並透過 /v1/videos 持續擴充影片型號。
重點摘要
- 原生 30 秒單次一鏡到底生成(為先前 Wan 2.7/2.5 約 15 秒上限的兩倍),並具智慧時長匹配。
- Omni-Reference:可混合最多約 10–20 個素材(圖片、影片總長 ≤15 秒、音訊、1 份文件/網頁),以強化主體、產品與風格一致性。
- 文件與網頁轉影片表現突出:輸入 PDF、簡報、試算表或公開 URL,即可得到結構化影片。
- 同步生成原生音訊;支援 480p/720p/1080p 多解析度與多種長寬比。
- 較前代更強的臉部/微表情保真度、參考穩定性,以及更乾淨的螢幕文字。
- 可透過 Alibaba Cloud Model Studio / Qwen Cloud(模型
wan3.0-video)、wan.video 與第三方平台使用。若需精簡多模型開發流程,建議使用 CometAPI 的統一影片端點。 - 以「分鏡簡述」方式撰寫提示(主體 + 動作 + 鏡頭 + 時間 + 約束),並明確標註參考資產(@Image1 等)。
什麼是 Wan 3.0?
Wan 3.0 是 Alibaba 的 Tongyi Wanxiang(Wan)影片生成家族的最新旗艦,由 Tongyi Lab 開發。它延續了先前 Wan 開源與閉源版本的擴散-Transformer 譜系(包括 2025 年廣受研究的開源 Wan 系列)。
相較於 Wan 2.7 / 2.5 的重點升級包括:
- 最長原生時長翻倍至 30 秒,且為單次生成的連續片段(非拼接)。
- 多模態輸入擴及辦公文件與公開網頁,超越僅有文字/圖片/影片/音訊。
- 更佳的「真實級」呈現:臉部與微表情、產品細節、數位/UI 內容一致性更強。
- 單一全能模型覆蓋文字轉影片(T2V)、圖片轉影片(I2V)、首末幀、參考轉影片及相關編輯/延展能力。
Alibaba 將其定位於行銷影片、短劇、社群內容、產品展示、訓練/模擬畫面(如機器人或 AV)、以及企業型解說。該模型仍為封閉權重/僅提供 API(開放權重停留在較早的 Wan 2.x 版本)。
支持數據與來源:價格範例清單(國際):480p $0.05/s、720p $0.10/s、1080p $0.20/s(30 秒 1080p 約 $6 標準費用)。部分平台提供 Standard 與更快的 Prime 等級或臨時折扣。
如何使用 Wan 3.0 API
Alibaba Cloud 透過 Model Studio 的影片生成 API 對外提供 Wan 3.0。目前的模型識別碼為:
wan3.0-video
該 API 為非同步影片生成。代表性請求如下:
curl --location 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
-H 'X-DashScope-Async: enable' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "wan3.0-video",
"input": {
"prompt": "A cinematic product commercial showing a premium coffee machine in a modern kitchen."
},
"parameters": {
"resolution": "720P",
"ratio": "16:9",
"duration": 10,
"enable_thinking": false
}
}'
依據官方參考,模型、端點與 API 金鑰需屬於同一區域。由於為非同步流程,應用需先提交任務,待處理完成後再取回生成結果。
對於圖片轉影片與參考驅動的工作流程,可在 input 物件中一併提供參考媒體。Alibaba 目前示例展示了同時在單一請求中使用參考影片與參考圖片的組合。
透過 CometAPI 使用 Wan 3.0(推薦給開發者)
CometAPI 提供統一、相容 OpenAI 的介面以存取 500+ 模型,包含 Alibaba Wan 系列影片模型(目前已列出 Wan 2.7,且隨著供應擴大,請隨時查看最新是否上線 Wan 3.0)。影片生成使用 /v1/videos 端點與 multipart 表單,上線導入、n8n/Make 自動化,或在 Wan、Seedance、Kling、Veo、MiniMax 等模型間切換時特別合適,且只需一組金鑰。
CometAPI 步驟:
- 於 cometapi.com 註冊/登入並建立 API 金鑰(sk-…)。
- 查閱影片 API 文件(apidoc.cometapi.com)與模型清單以取得 Wan 的確切 ID(例如遵循
wan2.7的命名樣式;請確認最新)。 - 透過 POST 提交至
https://api.cometapi.com/v1/videos,使用表單欄位。 - 收到任務 ID;輪詢狀態端點或使用 webhooks 直至完成。
- 下載生成的影片內容。
- 在 CometAPI 控制台監控用量與成本(按量計費,無月費門檻)。
如何有效撰寫 Wan 3.0 提示語
將提示視為分鏡簡述,而非隨意的文字說明。一個實證有效的結構(來自社群與平台指南的調整版):
SPACE 風格或分鏡清單公式:
- 主體(Subject):具體描述是誰/什麼。
- 表演/動作(Performance/Action):可見的動作與狀態變化,依時間順序。
- 氛圍/場景(Ambience/Setting):地點、時間、光線、天氣。
- 鏡頭(Camera):鏡位 + 一個清晰的運鏡(慢速推進、環繞、跟拍、固定)。
- 額外(Extra):風格、音訊線索、節奏、約束(例如「保持標籤可讀」、「維持臉部辨識一致」)。
針對多段落的 30 秒片段,建議以時間範圍編號分鏡:
Overall: A premium product reveal of a ceramic perfume bottle on wet black stone at dusk.
Shot 1 [0-8s]: Wide establishing, slow three-quarter orbit, warm rim light, gentle rain.
Shot 2 [8-18s]: Closer product focus, bottle rotates slowly, label and gold cap remain sharp.
Shot 3 [18-30s]: Final push-in to detail, soft ambient score, hold on the logo.
Keep bottle shape, label position, and gold cap consistent. Cinematic, calm pacing, no text overlays.
Reference binding(對 Omni-Reference 極為關鍵):
@Image1 is the female character (face and yellow jacket).
@Image2 is the rainy alley background.
@Audio1 provides the voice timbre.
The character from @Image1 walks through the alley from @Image2 and says “…” using the voice of @Audio1.
其他提示:
- 具體描述可觀察的動作與空間關係。
- 使用負面提示語來抑制常見失敗模式(如手部變形、不想要的文字、風格漂移)。
- 用於文件:例如「製作一支解說影片,遵循所附 PDF 的結構,強調第 2 頁的三個關鍵指標與結論建議」。
- 迭代流程:先產生短版,成功後再延展到多段落。
- 善用鏡頭語言與燈光描述詞彙,以提升電影感。
為何使用 Wan 3.0?
當你的應用需要把多種來源素材轉化為一支連貫的影片,而非僅將文字提示變為短片時,Wan 3.0 具有明顯優勢。
其最突出的優勢包括:
- 30 秒原生影片生成
- 文字轉影片與圖片轉影片
- 多參考生成
- 同時接收文字、圖片、影片、音訊與文件
- 文件/網頁轉影片流程
- 原生視聽同步生成
- 1080P 輸出
- 指令驅動的影片編輯
- 強參考一致性
- 按秒計費
- 單一模型覆蓋多種創作流程
對於打造 AI 影像工具、廣告系統、產品影片生成器、教育內容平台或多模態創作代理的開發者,這些能力可顯著減少對多個模型與前處理步驟的依賴。
結論與建議
Wan 3.0 朝向實用、能上線的 AI 影片又邁進一步:更長的連續鏡頭、真正的文件轉影片、以及更強的多模態控制。結合嚴謹的提示撰寫與參考管理,對許多行銷、解說與短影音用例,能把傳統製作的數天工期壓縮到數分鐘。
對於正在打造應用或內部工具的團隊,建議先從 Alibaba 官方管道獲得最純粹的 Wan 3.0 體驗,並考慮以 CometAPI(cometapi.com)作為高效率的入口。它的統一影片 API、廣泛的模型覆蓋(包含現有 Wan 2.7 與持續擴張的型錄)、相容 OpenAI 的介面,以及透明的按量計費,能讓你在單一整合下輕鬆試驗、擴展,並把 Wan 類生成與互補的 LLM、影像與音訊模型組合起來。
請於 CometAPI 與 Alibaba Cloud Model Studio 查閱最新模型清單與文件,先以短片實驗、打磨分鏡式提示,並逐步擴展到完整 30 秒製作。更長的原生時長配合 Omni-Reference,將開啟以往繁瑣或昂貴的新型創意與商業工作流程。
