Alibaba 和 ByteDance 現在都提供兩套異常完整的 30 秒 AI 影片系統。一者優先一體化管線,可將文件與網頁轉為影片;另一者優先長篇敘事、高密度參考控制與精準的影音剪輯。本指南將經驗證的規格與獨立基準證據分開,便於開發者基於實際生產適配而非發佈宣稱做選擇。
TL;DR
重點結論:Wan 3.0 更適合作為預設選擇,當你需要最清晰的獨立品質信號、1080p 輸出、文件/網頁輸入,以及更低的當前 API 起始成本。Seedance 2.5 更適合專業創作製作,當你需要最多 50 個參考、多輪續接、時間戳級編輯、綠幕工作流程,或白模預視。
目前尚無乾淨的公開正面對比基準。Artificial Analysis 目前在其含音訊的文字轉影片競技場中將 Alibaba 模型列為第一,而 ByteDance 的此版本尚未在相同評估下列出。由於 Seedance 2.5 尚未在同一競技場被評估,該排行榜無法支援兩者之間的直接品質比較。
Wan 3.0 vs Seedance 2.5: 快速比較
| 類別 | Wan 3.0 | Seedance 2.5 |
|---|---|---|
| 開發者 | Alibaba Tongyi / Wan | ByteDance Seed |
| 發佈/可用性 | 公開 API 發佈:Aug 24, 2026 | 官方發佈:Jul 31;CometAPI 路由:Aug 6, 2026 |
| 核心設計 | 一體化多模態影片製作 | 為受控敘事而設計的音畫聯合生成 |
| 原生最長時長 | 2-30 秒 | 4–30 秒 |
| 輸出解析度 | 480p、720p、1080p | CometAPI 目前文件列出 480p 與 720p 路由 |
| 參考容量 | 最多 10 張圖片 + 5 段影片 + 5 段音訊;另可選 1 份文件或 1 個公開網頁 | 30 張圖片 + 10 段影片 + 10 段音訊 |
| 輸入型別 | 文字、圖片、影片、音訊、文件、網頁 | 文字、圖片、影片、音訊 |
| 原生音訊 | 對話、BGM、音效 | 聲畫同步的聯合生成 |
| 編輯 | 指令式編輯、延伸、首/末幀控制 | 時間戳編輯、綠幕、相機與參考編輯 |
| 獨立基準 | 含音訊 T2V 排名第 1;1,241 Elo | 尚未在相同基準下列出 |
| CometAPI 起始價格 | 每生成秒 $0.04 | 每生成秒 $0.0824 |
| 最佳起步用例 | 產品示範、解說、文件轉影片、以品質為導向的預設 | 參考密集的敘事、影片/廣告級控制、定點編輯 |
什麼是 Wan 3.0?
Alibaba 最新的託管影片模型將文字轉影片、圖像轉影片、參考生成、編輯、延長與原生音訊整合於一套系統。其關鍵特徵不僅是 30 秒上限:它可從圖片、影片、音訊、辦公文件與公開網頁吸收創作脈絡,讓產品簡報或投影片直接成為生成指令的一部分。
官方 Wan 3.0 API 指南 指定最長 30 秒、30 fps、480p/720p/1080p 輸出,且具備原生對話/BGM/音效。其每次請求上限為最多 10 張參考圖片、5 段參考影片、5 段參考音訊;請求還可包含一份受支援文件或一個公開網頁。亦文件化了首幀、首末幀控制、影片續接與自然語言編輯。
來源: Alibaba Tongyi Wan official showcase
Alibaba 模型規格
| 規格 | 經驗證的值 |
|---|---|
| 模型狀態 | 託管商用模型;提供 API |
| 生成模式 | 文字轉影片、圖像轉影片、參考轉影片、編輯、續接 |
| 最長時長 | 每次生成 30 秒;文件化為 2-30 秒 |
| 影格率 | 30 fps |
| 解析度 | 480p、720p、1080p |
| 長寬比 | 自適應、16:9、4:3、1:1、3:4、9:16 |
| 參考 | 最多 10 張參考圖片、5 段參考影片、5 段參考音訊;一次請求還可使用 1 份文件或 1 個公開網頁 |
| 文件 | DOC、XLS、PPT、PDF、TXT、KEY、PAGES、NUMBERS、MD |
| 文件限制 | 最多 100 MB 與 50 頁 |
| 音訊 | 原生語音/對話、BGM 與音效 |
| CometAPI 模型 ID | wan3.0 |
| CometAPI 端點 | POST /v1/videos;非同步建立與輪詢的流程 |
Alibaba 模型的亮點
- 文件轉影片與網頁轉影片為簡報、報告、產品頁、培訓素材與企業解說去除了前處理步驟。
- 提供 1080p 路由與 30 fps 輸出,形成明確的最終交付路徑。
- 同一模型涵蓋生成、參考條件控制、編輯與延長,減少模型間的調度。
- 當前獨立的 T2V 與影片編輯結果比僅有供應商展示更有說服力。
什麼是 Seedance 2.5?
ByteDance 的新一代聲畫模型圍繞完整的 30 秒故事、大型多模態參考集合與製作級編輯而建。該模型可在一次生成中組織多個關聯鏡頭,於後續回合延續既有輸出,並在較長敘事中維持一致的視聽語言。
在官方發佈文章中,ByteDance 文件化了一次最多 30 張圖片、10 段影片、10 段音訊的參考上限。亦描述了時間戳級影音編輯、綠幕替換、相機視角編輯、動作參考、創意參考,以及用於構圖、場面調度、燈光與鏡頭規劃的白模(clay-render)控制。

來源: ByteDance Seedance 2.5 official showcase
ByteDance 模型規格
| 規格 | 經驗證的值 |
|---|---|
| 模型狀態 | 官方發佈;提供商業平台與 API 存取 |
| 生成模式 | 文字轉影片、圖像轉影片、參考轉影片、延長、編輯 |
| 最長時長 | ByteDance 官方確認每次最多 30 秒;目前文件化的 CometAPI 路由接受 4–30 秒 |
| 續接 | 多輪延長;產品頁描述最多兩次延長 |
| 解析度 | CometAPI 目前文件列出 480p 與 720p 的計價路由 |
| 參考 | 最多 30 張圖片、10 段影片、10 段音訊 |
| 輸入型別 | 文字、圖片、影片、音訊 |
| 文件 | 官方 Seedance 2.5 資料未將文件列為原生參考輸入 |
| 文件限制 | 不適用/目前路由未文件化 |
| 音訊 | 聲畫聯合生成與參考音訊 |
| 編輯 | 時間戳控制、綠幕、相機視角、參考式編輯 |
| 預視 | 白模/黏土渲染控制 |
| CometAPI 模型 ID | seedance-2-5 |
| CometAPI 端點 | POST /v1/videos;非同步建立與輪詢的流程 |
ByteDance 模型的亮點
- 總計 50 個參考,讓創作者在多角色、多場景、品牌、道具、聲線與動作約束上有更大空間。
- 時間戳級變更可針對特定節點、動作、聲音或鏡頭片段進行修訂,而非把整支影片視為一次性草稿。
- 綠幕與白模工作流程將生成式影片與傳統預視與合成實務接軌。
- 多輪續接旨在將一致的視覺與音訊語言擴展至初始 30 秒片段之外。
Wan 3.0 vs Seedance 2.5: 基準結果
基準規則:僅有在相同排行榜、任務、音訊模式與投票方法下產生的結果才可直接比較。供應商展示與舊版本分數可作參考,但不能替代缺失的正面對比結果。
目前的 Artificial Analysis Text to Video Leaderboard 在含音訊競技場中將 Alibaba 模型以 1,241 Elo 列為第一,95% 信賴區間為 +/-9,樣本數 6,195。相同評估者亦在含音訊影片編輯中將其列為第一,1,189 Elo,區間 +/-7,樣本數 5,231。
ByteDance 新版本尚未列入這兩張表。Artificial Analysis 確有列出舊版 Seedance 生成結果,但將其視為新模型代表是方法論錯誤。因此,最公允的結論是 Alibaba 目前擁有較強的獨立證據,而非 ByteDance 已被獨立證明較弱。

來源: Artificial Analysis Text to Video Leaderboard
| 證據型別 | Alibaba 模型 | ByteDance 模型 | 解讀 |
|---|---|---|---|
| 含音訊的文字轉影片 | 1,241 Elo;第 1 名;+/-9;6,195 個樣本 | 未列出 | 無法進行獨立直接比較 |
| 含音訊的影片編輯 | 1,189 Elo;第 1 名;+/-7;5,231 個樣本 | 未列出 | 無法進行獨立直接比較 |
| 官方質化證據 | 逼真級渲染、長時一致性、全域參考 | 長篇敘事、高密度參考控制、時間戳編輯 | 不同展示與宣稱;未被直接量化評分 |
Wan 3.0 vs Seedance 2.5: 主要差異比較
1. 長篇敘事與時間一致性
兩款模型都可在一次生成中產出最多 30 秒。Wan 3.0 的官方 API 範圍為 2–30 秒;而 BytePlus 官方 API 與目前 CometAPI 的 Seedance 路由皆文件化為 4–30 秒。因此在這些路由上,Wan 是原生支援 2–3 秒鏡頭的選項。當片段需吸收多樣來源素材並整合為單一產出時,Alibaba 的方法更強;當 30 秒需要包含規劃好的敘事弧、多個連貫鏡頭,並在後續回合延續角色、場景、節奏與聲音的一致性時,ByteDance 的方法更強。
結論:自洽的多模態製作請求選 Alibaba;分集式或多輪敘事構建選 ByteDance。
2. 視覺品質、運動與物理可可信度
Alibaba 擁有更明確的公開品質信號,因其目前在盲選偏好的含音訊 T2V 賽道領先。其產品資料亦強調人臉、微表情、產品細節、文字、空間布局與物理互動。ByteDance 則強調更順暢的轉場、跨剪穩定的主體、更擬真的材質與光影,以及可依白模參考的空間結構來驅動運動。
結論:就一般視覺偏好,Alibaba 是有證據支撐的首測對象;就導演式的場面調度、鏡頭走位與以預視資產規劃的場景,ByteDance 仍非常具吸引力。
3. 參考控制與角色一致性
Wan 3.0 支援最多 10 張圖片、5 段影片與 5 段音訊參考,且可另外使用一份文件或一個公開網頁。Seedance 2.5 接受更大的常規參考集:最多 30 張圖片、10 段影片與 10 段音訊,但官方資料未將文件或網頁列為原生參考輸入。當簡報包含演員陣容、多個環境、產品型號、服裝、道具、聲線樣本、鏡頭參考與動作示例時,較高的常規參考上限尤為重要。
結論:ByteDance 勝在參考密度;Alibaba 勝在參考廣度。
4. 原生音訊、對話與聲音設計
兩者皆與畫面同時生成聲音,而非需另行配音。Alibaba 明確文件化對話、背景音樂與音效。ByteDance 建立在統一的音畫架構上,支援音訊參考、聲線一致性與定點的影音修訂。
結論:從規格層面兩者接近。請用相同台詞測試對話清晰度、唇形同步、說話者識別、BGM 穩定度與音效時序,再決定製作路線。
5. 編輯與反覆迭代
Alibaba 在一體化模型內涵蓋自然語言編輯、延長與幀條件工作流。ByteDance 則更深入「編輯器式」工作流:提示可瞄準特定時間戳,透過綠幕替換背景,調整相機視角,並在保留周邊連貫性的同時,修訂角色、動作、劇情或音訊。
結論:ByteDance 在精準創作修訂的控制面更強;Alibaba 提供更簡潔的統一管線。
6. 文件、網頁與商務內容
這是 Alibaba 最明確且無爭議的優勢。PDF、簡報、試算表、文字文件、Apple 生產力文件、Markdown 文件或網頁皆可成為生成解說、產品影片、培訓短片或主管摘要的來源素材。ByteDance 已發佈的模型總覽更聚焦於文字、圖片、影片與音訊,而非文件解析。
結論:文件轉影片、網頁轉影片、企業知識與自動化內容再製管線請選 Alibaba。
7. 解析度與交付工作流程
Alibaba 文件化了 480p、720p 與 1080p 路由,支援清晰的階梯:480p 快速迭代、720p 審閱、1080p 產生定稿鏡頭。CometAPI 目前對 ByteDance 路由文件化了 480p 與 720p 定價;ByteDance 官方發文未提供等價的逐路由解析度表。
結論:Alibaba 擁有更清晰的高解析度交付路徑。在將解析度作為硬性產品承諾前,請確認活躍的 ByteDance 路由。
價格比較
CometAPI 模型卡當前顯示 Alibaba 的起始價每生成秒 $0.04、ByteDance 為每生成秒 $0.0824。其詳細定價亦顯示上游路由價格:Alibaba 分別為 480p/$0.05、720p/$0.10、1080p/$0.20 每秒;ByteDance 為 480p/$0.103 與 720p/$0.231 每秒。由於模型頁與路由折扣可能獨立變動,生產預估應依提交時選用的實際路由計算。
| 成本項目 | Wan 3.0 | Seedance 2.5 | 備註 |
|---|---|---|---|
| CometAPI 標示起始價格 | $0.04/s | $0.0824/s | 在顯示的地板價上 Alibaba 約低 51% |
| 10 秒片段(按起始價) | $0.40 | $0.824 | 未計重試 |
| 30 秒片段(按起始價) | $1.20 | $2.472 | 未計重試 |
| 公布的 480p 路由單價 | $0.05/s | $0.103/s | 上游/列表價 |
| 公布的 720p 路由單價 | $0.10/s | $0.231/s | 上游/列表價 |
| 公布的 1080p 路由單價 | $0.20/s | CometAPI 目前表中未顯示 | 請核實路由可用性 |
生產成本原則:比較「每條被採納片段成本」而非「每秒單價」。納入被拒結果、重試、升級、儲存、剪輯時間與使片段可發佈所需的人力審核。
Wan 3.0 vs Seedance 2.5: 優勢與取捨
| 模型 | 優勢 | 取捨 |
|---|---|---|
| Alibaba 模型 | 含音訊 T2V 獨立第 1 信號;編輯第 1 信號;文件/網頁輸入;1080p;較低起始價;統一工作流 | 參考上限 20;託管閉源權重;較長片段仍可能漂移;音訊/文字或需後期 |
| ByteDance 模型 | 50 個參考;多輪延長;時間戳編輯;綠幕;相機編輯;白模預視 | 尚無相同世代獨立 Elo;CometAPI 目前解析度表停於 720p;官方資料亦承認在複雜運動物理與多主體互動穩定性上仍有改進空間 |
你該選哪一個模型?
| 用例 | 起始選擇 | 原因 |
|---|---|---|
| 新影片功能的最佳預設 | Alibaba 模型 | 更強的獨立證據與更低的當前起始價格 |
| 30 秒產品商業廣告 | Alibaba 模型 | 文件/產品輸入、1080p 路由、更低的迭代成本 |
| PDF 或網頁轉解說影片 | Alibaba 模型 | 原生文件與網頁解析 |
| 參考密集的品牌宣傳 | ByteDance 模型 | 最多 50 個創意參考 |
| 多角色短劇 | ByteDance 模型 | 敘事連貫、參考密度、可延長 |
| 精確修訂某個時間範圍 | ByteDance 模型 | 時間戳級影音編輯 |
| 綠幕或白模預視工作流程 | ByteDance 模型 | 明確的專業製作控制 |
| 以證據為主導的品質基準 | Alibaba 模型 | 當前盲選偏好與編輯領先 |
| 最終部署決策 | 同時測試 | 以相同資產、時長、評分規則與驗收標準測試 |
如何進行公允的 A/B 測試
- 建立 20–40 個提示套件,涵蓋產品鏡頭、人類對話、多角色場景、鏡頭運動、物理、文字/UI 與參考密集生成。
- 在兩條路由皆支援等價設定的前提下,匹配時長、解析度、長寬比、音訊需求與來源資產。
- 對評審者進行模型盲測,分別評分視覺品質、提示符合度、主體一致性、動作、音訊時序、對話品質與剪輯工作量。
- 除成功輸出外,記錄失敗、重試、安全過濾拒絕、生成延遲與後期製作分鐘數。
- 針對每一類工作負載,選擇「每條被採納片段成本」最低的路線,而非強求單一通吃。
如何透過 CometAPI 存取兩款模型
兩條路由皆可透過 CometAPI 使用,便於團隊在評估不同供應商時,保留同一帳號、API 金鑰、計費層與非同步影片生命週期。目前對客的模型 ID 為 wan3.0 與 seedance-2-5。
- 建立帳號並產生 API 金鑰。將其存於伺服器端環境變數。
- 開啟影片 API 文件,確認所選模型路由支援的確切欄位。
- 提交 POST /v1/videos,保存返回的影片任務 ID,並輪詢 GET /v1/videos/{id} 直至任務達終止狀態。
- 下載完成的素材,並與結果一同保存模型 ID、路由、時長、解析度、延遲、價格與審核結果。
語言:Bash
export COMETAPI_KEY="your_api_key"
curl -X POST "https://api.cometapi.com/v1/videos" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-F 'model=wan3.0' \
-F 'prompt=A cinematic product reveal with synchronized ambient audio.' \
-F 'seconds=10' \
-F 'size=1280x720'
# For an A/B test, submit a validated Seedance payload with:
# -F 'model=seedance-2-5'
不要假設所有媒體參數僅因共用端點就可彼此通用。參考欄位、支援解析度、編輯控制與回調行為可能依路由而異。切換生產流量前,請先驗證每個請求負載。
Wan 3.0 vs Seedance 2.5: 侷限與注意事項
- 獨立基準會隨新投票變動;Elo 是相對偏好信號,非對事實性提示符合度或商用可用性的絕對量尺。
- 當前獨立框架缺少 ByteDance 分數,無法給出具統計意義的直接品質排序。
- 官方展示使用經策展的提示與資產。實際結果會隨主題複雜度、安全過濾、語言、長寬比與參考品質而變化。
- ByteDance 自身發佈亦承認在複雜運動的物理可可信度與多主體互動穩定性上仍有改進空間。
- Alibaba 的較長輸出仍可能出現身份漂移、物件變形、文字錯誤或音訊瑕疵;30 秒是容量上限,非品質保證。
- 價格與路由可用性可能變更。在發佈固定價格宣稱或承諾單位經濟前,請重查 CometAPI 即時模型頁。
結論
最可辯護的答案取決於工作負載。Alibaba 目前提供更強的預設組合:盲選偏好領先、編輯第一、文件與網頁輸入、文件化的 1080p 路由,以及較低的顯示起始價格。它是產品影片、解說、商務內容自動轉換與通用 API 部署的合乎邏輯的首測對象。
ByteDance 提供更專精的創作控制系統。其 50 參考上限、多輪續接、時間戳級修訂、綠幕工作流程、相機編輯與白模預視,當專業故事建構與精準迭代才是驗收標準時,足以彌補缺失的基準分數。
用於生產時,請勿只看標題。以相同簡報資產同時跑兩個模型,度量「被採納輸出」而非首次嘗試,並將每個任務導向能以更少重試與更少後製達成所需品質的系統。
FAQs
Wan 3.0 比 Seedance 2.5 更好嗎?
Alibaba 目前擁有更強的獨立基準證據與更廣的商務輸入支援。ByteDance 在高密度參考、延展敘事與精準創作編輯方面可能更佳。目前尚無在同一框架下的直接 Elo 比較。
哪個更便宜?
當前 CometAPI 頁面顯示 Alibaba 每秒 $0.04、ByteDance 每秒 $0.0824。最終成本取決於路由、解析度、重試次數與通過率。
誰支援更多參考?
Seedance 2.5 支援更大的常規參考集:最多 30 張圖片、10 段影片、10 段音訊。Wan 3.0 支援最多 10 張圖片、5 段影片、5 段音訊,並可額外使用一份文件或一個公開網頁。
哪個更適合影片編輯?
Alibaba 目前領先含音訊的影片編輯競技場。ByteDance 文件化了更細粒度的創作工作流,包括時間戳編輯、綠幕替換、相機視角變更與參考式編輯。最佳選擇取決於你更重視偏好品質還是控制深度。
兩者都能生成原生音訊嗎?
可以。兩者皆設計為聲畫同步生成。請用你的提示評估對話清晰度、對嘴同步、音效、音樂穩定與聲線一致性。
我可以用同一把 API 金鑰存取兩者嗎?
可以。兩者目前皆列於 CometAPI,並使用其非同步影片生成流程,但仍須逐路由檢查有效的請求欄位。
