Wan 2.6 的技術規格
| 項目 | Wan 2.6 Video Suite |
|---|---|
| 提供方 | Alibaba / Tongyi Lab |
| 模型系列 | Wan 2.6 |
| 發佈時間範圍 | 2025 年 12 月世代 |
| 輸入類型 | 文字、圖像、參考影片、音訊輸入 |
| 輸出類型 | 影片(可選同步音訊) |
| 核心模式 | 文字轉影片(T2V)、圖像轉影片(I2V)、參考至影片(R2V) |
| Flash 變體 | I2V Flash、R2V Flash |
| 解析度支援 | 720P 與 1080P |
| 時長支援 | 2–15 秒(依工作流程而定) |
| 音訊能力 | 原生音訊生成、語音參考、對嘴同步 |
| 多鏡頭支援 | 在單一工作流程中 2–8 個場景片段 |
| 參考素材支援 | 最多 5 個參考(視工作流程可混合圖像/影片) |
| API 工作流程 | 非同步任務建立 + 輪詢 |
什麼是 Wan 2.6?
Wan 2.6 是 Alibaba 的多模態影片生成系統,專注於可控的短片製作。該模型並非僅由提示驅動,而是結合文字提示、圖像參考、參考影片、音訊條件化,以及場景串接,以支援創作者工作流程。相較於先前的 Wan 發佈版本,主要升級為更強的參考驅動一致性與更長的敘事生成。
Wan 2.6 的主要功能
- 參考至影片工作流程: 使用者可提供圖像或影片參考,以在多次生成中維持角色身份、風格與聲音的連續性。
- 多鏡頭敘事生成: 在單次生成流程中支援將多個提示串接,用於場景轉場與故事推進。
- 原生音訊同步: 內建支援生成音訊、自訂音訊上傳與對嘴同步的工作流程。
- 彈性的輸入模式: 支援僅提示生成、首幀動畫與參考驅動的工作流程。
- 用於迭代的 Flash 變體: 更快的版本可在最終高品質渲染前進行快速測試。
- 更長的片段: 相較於較早的世代,片段時長有所延長,支援敘事內容創作。
Wan 2.6 的基準測試表現
針對 Wan 2.6 的正式基準測試透明度仍然有限;與文字 LLM 供應商相比,Alibaba 公布的標準化基準指標更少。大多數評估來自工作流程測試與生態系比較,而非公開排行榜。社群測試一致指出:
- 相較舊版 Wan,角色一致性有所提升。
- 更佳的影音同步。
- 更強的多鏡頭連貫性。
- 更可靠的參考條件化。
由於基準發布較為稀少,部署前進行生產環境測試仍然十分重要。
Wan 2.6 與其他影片模型比較
| 功能 | Wan 2.6 | Wan 2.7 | Veo 系列模型 |
|---|---|---|---|
| 原生音訊生成 | 強 | 更強 | 強 |
| 多鏡頭工作流程 | 是 | 改進 | 中等 |
| 參考至影片 | 高度強調 | 更強的控制 | 中等 |
| 片段時長 | 最長 15 秒 | 相近/依工作流程而定 | 不定 |
| 多重參考支援 | 最多 5 個參考 | 擴充的工作流程 | 中等 |
| 編輯工作流程 | 中等 | 更好的編輯支援 | 強 |
Wan 2.6 的限制
- 較短的片段時長仍然限制長篇製作。
- 高動態場景可能仍會出現時序不穩定。
- 高度依賴參考的工作流程會提高設定複雜度。
- 公開的基準報告仍然有限。
- 非同步生成管線會增加整合複雜度。
典型使用案例
- 角色一致性的行銷影片。
- 多場景的社群媒體短片。
- 創作者虛擬形象動畫。
- 參考驅動的產品影片。
- 具備音訊同步的 AI 敘事。
- 需要維持品牌識別的內容。