Wan 3.0 的技術規格
| 規格 | Wan 3.0 |
|---|---|
| 模型類型 | 多模態一體化影片生成模型 |
| 模型狀態 | 公開 API 預覽 |
| 輸入類型 | 文字、圖片、影片、音訊、文件、網頁 |
| 影片生成 | 文字轉影片、圖片轉影片、參考轉影片 |
| 影片編輯 | 基於指令與基於參考的編輯 |
| 最大時長 | 單次生成 30 秒 |
| 輸出解析度 | 480P, 720P, 1080P |
| 原生視聽生成 | 是 |
| 參考資產 | 最多 20 個多模態參考資產 |
| 文件輸入 | DOC, XLS, PPT, PDF, TXT, KEY, PAGES, NUMBERS, MD |
| 最大文件大小 | 100 MB |
| 最大文件頁數 | 50 頁 |
| API 存取 | Alibaba Cloud Model Studio API 預覽 |
| API 生成模式 | 非同步 |
| 480P 價格 | $0.05/sec |
| 720P 價格 | $0.10/sec |
| 1080P 價格 | $0.20/sec |
Wan 3.0 是 Alibaba Cloud 最新的一體化多模態影片生成模型,已於 2026 年 8 月正式發佈。 相較於先前的 Wan 系列,其最突出的升級不僅是更高的視覺品質,而是將文字、圖片、影片、音訊、文件與網頁整合進單一創作流程。Alibaba Cloud 表示該模型支援原生 30 秒影片生成、多模態參考輸入、同步視聽生成與精準影片編輯。
什麼是 Wan 3.0?
Wan 3.0 是 Alibaba 的新一代多模態影片生成模型,旨在將文字、圖片、影片、音訊、文件與網路內容轉化為連貫的影片。
早期的 AI 影片工作流程通常需要多個專用模型:一個負責文字轉影片、另一個負責圖片轉影片、再有一個保證參考一致性,並且需要獨立的剪輯或音訊工具。Wan 3.0 邁向一體化製作模型,讓這些輸入可以圍繞單一創作指令進行組合。
其核心能力是原生 30 秒生成。不再是生成 5 或 10 秒的短片再反覆延長與拼接,Wan 3.0 可一次性生成連續 30 秒的序列。Alibaba 的展示顯示,該模型能在較長場景中維持角色、環境、動作、鏡頭運動、對白與聲音的一致。
另一項重大變化是Omni-Reference。開發者可使用多個參考資產來確立角色、產品、環境、動作或其他視覺特徵。官方的 Wan 3.0 儲存庫描述支援最多 20 個參考資產;而 Alibaba Cloud 的產品頁則強調可將圖片、文字、影片、音訊、文件與網頁結合為創作參考。
這使得 Wan 3.0 更像是一個多模態創意製作引擎,而非簡單的提示詞到影片生成器。
Wan 3.0 的主要功能
- 原生 30 秒影片生成: Wan 3.0 可在單次生成中產出最長 30 秒的影片,並具備智慧時長選擇與影片延展能力。
- Omni-Reference: 可將文字、圖片、影片與音訊作為參考結合使用;Wan 3.0 亦將基於參考的生成拓展至文件與網頁。
- 文件轉影片: 可將 PPT、PDF、DOC、XLS、TXT、KEY、PAGES、NUMBERS 與 MD 作為創作輸入,讓簡報、報告與結構化資訊成為影片內容。
- 原生視聽生成: 可同時生成影片與聲音,支援對白、環境音與以音樂為導向的視聽場景。
- 參考一致性: 該模型旨在於參考驅動的生成中,保留角色、道具、環境、空間關係與風格。
- 影片編輯: 支援對已生成內容進行修改,包括視覺元素、劇情與對白,無需每次從頭開始。
Wan 3.0 與其他影片模型的比較
| 模型 | 原生時長 | 圖片轉影片 | 參考控制 | 音訊 | 文件/網頁輸入 | 主要優勢 |
|---|---|---|---|---|---|---|
| Wan 3.0 | 30s | ✓ | 強 | ✓ | ✓ | 一體化多模態製作 |
| Wan 2.7 | 15s | ✓ | ✓ | ✓ | 受限 | 成熟的 Wan 影片工作流程 |
| Grok Imagine Video 1.5 | 最長 15s | ✓ | ✓ | ✓ | — | 快速短影片創作 |
| Veo | 依模型而定 | ✓ | ✓ | ✓ | 多模態 | 電影級生成 |
| Kling | 依模型而定 | ✓ | ✓ | ✓ | — | 角色與動作生成 |
| Seedance | 依模型而定 | ✓ | ✓ | ✓ | — | 創意與多鏡頭影片 |
關鍵差異在於輸入的廣度。
相較於 Grok Imagine Video 1.5,Wan 3.0 在一體化製作工作流程上邁得更遠。Grok 專注於以文字、圖片與參考為核心的短影片生成,而 Wan 3.0 進一步將文件、網頁、音訊與影片納入直接的創作參考。
相較於 Wan 2.7,最大的架構與產品層變化在於邁向統一的多模態工作流程,以及原生 30 秒生成上限,不同於上一代較短的片段。Alibaba Cloud 目前對 Wan 3.0 的介紹明確將其定位於長篇敘事與 Omni-Reference 生成。
相較於 Kling 與 Veo,Wan 3.0 的最強差異不必然在於每一幀都更好,而在於能結合大量來源素材,並於較長的生成過程中維持這些資訊的一致。
若應用僅是「寫一段提示詞並生成電影感短片」,其他模型可能依然具有競爭力。若工作流程是「這裡有產品圖片、角色參考、PDF、試算表、音訊樣本與創作簡述——將它們變成一支連貫的影片」,Wan 3.0 則更具吸引力。
Wan 3.0 的代表性使用場景
1. AI 電影與故事製作
單次 30 秒生成能力適用於需要連續鏡頭運動、對白與多個動作的場景,無需拼接大量短片。
2. 產品廣告
可將產品圖片或一組參考與導演式提示結合,生成產品展示、UGC 廣告與電影感品牌影片。
3. 簡報轉影片生成
Wan 3.0 可處理 PPT、PDF、DOC、XLS 與其他受支援的文件格式,適合將報告、簡報與結構化資訊轉化為視覺敘事。
4. 角色一致的影片
可利用參考圖片、影片與其他媒體建立角色、物件與環境,再生成場景。
5. 社群媒體內容
30 秒時長與縱向 9:16 長寬比,使 Wan 3.0 適用於短影音、廣告與敘事片段。
6. 影片編輯與迭代
Wan 3.0 可修改既有生成內容,包括視覺元素、故事內容與對白,支援迭代的創作流程。
Wan 3.0 API 參數
官方 API 採用非同步影片生成端點。精簡的請求包含 model、input 與 parameters 物件。
重要參數包括:
| 參數 | 說明 |
|---|---|
| model | wan3.0-video |
| input.prompt | 導演風格的生成指令 |
| input.media | 參考圖片、影片、音訊、文件或網路資源 |
| parameters.resolution | 480P, 720P, 1080P |
| parameters.ratio | adaptive, 16:9, 4:3, 1:1, 3:4, 9:16 |
| parameters.duration | 2–30 秒;-1 啟用智慧時長 |
| parameters.audio | 是否包含音訊軌 |
| parameters.seed | 可重現性的隨機種子 |
| parameters.watermark | 是否加入浮水印 |
官方文件指出,當未提供影片輸入時,duration 可為 2 至 30 秒的整數;當提供影片輸入時,輸入與輸出時長合計需保持在支援的總時長範圍內。
如何在 CometAPI 上使用 Wan 3.0 API
對於同時使用多個 AI 影片模型的開發者,CometAPI 可作為統一的存取層,用於與其他影片生成模型一同實驗 Wan 3.0。
典型工作流程如下:
- 建立或登入 CometAPI 帳號。
- 取得 CometAPI API 金鑰。
- 選擇 Wan 3.0 模型端點。
- 提交文字轉影片、圖片轉影片或基於參考的生成請求。
- 指定解析度、時長、長寬比與其他受支援的參數。
- 監控非同步生成任務。
- 當處理完成時取回生成的影片。
在實作前,應根據當前的 CometAPI Wan 3.0 整合情況核對具體端點與受支援參數,特別是因為上游的 Alibaba API 仍處於預覽階段。