Wan 2.7 和 Vidu Q3 針對同一類廣義問題——將提示與參考轉化為可投產的短影片——但分別圍繞不同的創作工作流程優化。Wan 2.7 更像是全面的影片製作套件,結合生成、參考控制、延續與剪輯能力。Vidu Q3 則更緊密定位於敘事片段,具備原生音訊、多鏡頭節奏與鏡頭語言感知的敘事能力。
因此實務上的選擇不是「哪個模型普遍更好?」而是「哪個模型能以可接受的成本、在符合你製作管線所需控制的前提下,為你的特定簡報產出最可用的片段?」
TL;DR
就公開盲選偏好品質而言,Wan2.7-260612 在 Artificial Analysis 的 Text-to-Video With Audio 排行榜達到 1,161 Elo,而 Vidu Q3 Pro 為 1,078。在 Image-to-Video With Audio 中,Wan 2.7 也以 1,094 對 1,065 取得領先。這使得當基準化的視覺品質、參考一致性、延續或剪輯最重要時,Wan 2.7 成為更強的起始點。
Vidu Q3 對於以故事為先的生成仍具吸引力。其官方產品材料強調每次生成可達 16 秒、原生對話/旁白、音效與音樂、詳細鏡頭語言控制,以及英文/日文/中文的輸出。透過 CometAPI,其目前顯示的起始價格低於 Wan 2.7,這讓 Q3 對重對話的短內容與成本敏感的迭代更具吸引力。
Key Takeaways
- 公開基準信號:Wan 2.7 目前在啟用音訊的 T2V 與 I2V 盲選 Elo 上領先 Vidu Q3 Pro。
- 工作流廣度:Wan 2.7 涵蓋 T2V、I2V、R2V 與專用影片剪輯。
- 以故事為核心的設計:Vidu Q3 將原生音訊、多鏡頭節奏與鏡頭控制置於產品中心。
- 時長:Wan 2.7 支援 2–15 秒,而 Vidu Q3 視路線可達 16 秒。
- 解析度:兩者皆達 1080p;Vidu 另提供 540p 以降低生成成本。
- 目前 CometAPI 起始價格:Wan 2.7 顯示為 $0.08/s;Vidu Q3 顯示為 $0.056/s。
- 最佳總體規則:當控制與工作流覆蓋度為主時選 Wan 2.7;當原生影音敘事與成本為主時先測 Vidu Q3。
What Is Wan 2.7?
Wan 2.7 是 Alibaba 的多模態短影片套件,面向可控創作,而非單一的文本轉影片端點。Alibaba 的發佈材料描述四條主要路線——Wan2.7-t2v、Wan2.7-i2v、Wan2.7-r2v 與 Wan2.7-videoedit——涵蓋以文本、圖片、影片與音訊輸入的生成、延續、參考與剪輯。
該套件支援 2–15 秒生成,解析度 720p 或 1080p。目前的 Model Studio T2V API 也記載自訂音訊輸入與自動配音,I2V 路線支援首幀、首尾幀與影片延續等任務。
| Specification | Wan 2.7 |
|---|---|
| Provider | Alibaba / Tongyi Lab |
| Core routes | 文本轉影片、圖片轉影片、參考轉影片、影片剪輯 |
| Input modalities | 文本、圖片、影片、音訊參考 |
| Output duration | 2–15 秒 |
| Resolution | 720p / 1080p |
| Native / generated audio | 是;自動音訊生成與自訂音訊工作流 |
| First + last frame | I2V 工作流支援 |
| Video continuation | 支援 |
| Dedicated editing | 是 — 指令式影片剪輯 |
| CometAPI model ID | wan2.7 |
What Makes Wan 2.7 Different?
參考與連續性控制。Alibaba 將 Wan 2.7 定位為可在多鏡頭中保留主體、使用多模態參考並延續既有片段的製作系統。其 I2V API 接受文本、圖片、音訊與影片輸入,並支援首幀、首尾幀與延續任務。
剪輯是一級工作流。專用的 Wan2.7 影片剪輯 API 接受文本、圖片與影片輸入,用於指令式剪輯與風格轉換。對已擁有素材且希望替換、重塑或複製視覺元素而非從頭重新生成的團隊而言,這是有意義的差異。
音訊可供給或生成。T2V 路線接受 WAV/MP3 音訊,亦可在未提供自訂音訊時自動生成音訊。目前 API 支援15 秒多鏡頭提示與 1080p 輸出,對短廣告、分鏡與電影感概念片段很有用。
What Is Vidu Q3?
Vidu Q3 是 Vidu 的第三代影片模型家族,圍繞影音敘事而設計。其官方產品頁面強調影片、對話/旁白、音效與音樂同步生成,可在單次生成工作流中同時構作時間與敘事節奏。
Vidu 的公開 API 文件支援 Q3 的文本轉影片、圖片轉影片、首尾與參考轉影片路線。視 Q3 變體與路線不同,輸出可達16 秒與 1080p。官方產品頁面亦突顯鏡頭語言控制與英文、日文、中文的多語輸出。
| Specification | Vidu Q3 |
|---|---|
| Provider | Vidu / ShengShu Technology |
| Core routes | 文本轉影片、圖片轉影片、首尾轉影片、參考轉影片 |
| Input modalities | 文本、圖片、首/尾幀、參考圖片 |
| Output duration | 最長 16 秒(依路線 / 變體而定) |
| Resolution | 540p / 720p / 1080p |
| Native audio | 是 — 語音、音效與其他生成音訊 |
| Multi-speaker storytelling | 官方強調用於敘事 |
| Camera / pacing control | 詳細的鏡頭語言與節奏控制 |
| Languages highlighted | English / Japanese / Chinese |
| CometAPI model ID | viduq3 |
Wan 2.7 vs Vidu Q3: Decision Snapshot
| Decision factor | Wan 2.7 | Vidu Q3 |
|---|---|---|
| Maximum clip duration | 15 s | 16 s |
| Maximum resolution | 1080p | 1080p |
| Lower-resolution tier | 720p | 540p / 720p |
| Text-to-video | Yes | Yes |
| Image-to-video | Yes | Yes |
| Reference-to-video | Yes | Yes |
| First/last-frame workflow | Yes | Yes |
| Video continuation | 原生工作流強 | 非 Q3 的核心差異化 |
| Dedicated instruction editing | Yes | 非 Q3 的核心生成路線 |
| Native audiovisual storytelling | 強 | 核心定位 |
| Public T2V with-audio Elo | 1,161(六月快照) | 1,078(Q3 Pro) |
| Public I2V with-audio Elo | 1,094 | 1,065(Q3 Pro) |
| CometAPI displayed starting price | $0.08/s | $0.056/s |
| Best starting point | 受控製作與剪輯 | 以對話為先的敘事與低成本迭代 |
規格表顯示核心權衡:Wan 2.7 擁有更廣的製作覆蓋面,而 Vidu Q3 更集中於成品級的影音敘事。這種差異遠比一秒的時長差更重要。
Wan 2.7 vs Vidu Q3: Benchmark Performance
影片模型的基準測試不如 LLM 評估那般標準化,因此本比較使用 Artificial Analysis Video Arena 作為中立的公開信號。其排名源自基於同一輸入的輸出之間的盲選用戶偏好。因此 Elo 有助於比較感知的輸出品質,但並不保證某一模型能在每個提示或製作風格上獲勝。
Text-to-Video With Audio
| Model / route | Elo | Rank | Samples |
|---|---|---|---|
| Wan2.7-260612 | 1,157 | #4 | 14,694 |
| Wan 2.7 | 1,109 | #7 | 5,276 |
| Vidu Q3 Pro | 1,076 | #16 | 16,578 |
圖 1:Text-to-Video With Audio Elo 比較 — 8 月
在 8 月的 Artificial Analysis 排行榜中,Wan 2.7 的 6 月檢查點以 1,157 Elo 排名第 4,相比之下 Vidu Q3 Pro 為 1,076(第 16 名),領先 81 分。最初的 4 月 Wan 2.7 檢查點得分 1,109 Elo,仍比 Vidu Q3 Pro 高出 33 分。務實解讀並非 Vidu Q3 在敘事上失敗;而是 8 月的盲選偏好數據仍更常偏向 Wan 2.7 的整體啟用音訊 T2V 輸出。
Image-to-Video With Audio
| Model / route | Elo | Rank | Samples |
|---|---|---|---|
| Wan 2.7 | 1,090 | #7 | 4,712 |
| Vidu Q3 Pro | 1,062 | #17 | 13,421 |
I2V 的差距較小——28 Elo 點——但方向仍一致。對於要為產品靜態圖、分鏡或角色參考圖片製作動畫的團隊而言,當輸出品質是主要驗收門檻時,Wan 2.7 值得先測。
Detailed Feature Comparison
Prompt Adherence and Storytelling
Wan 2.7 擅長處理混合鏡頭描述、主體約束與參考素材的提示。Alibaba 的發佈材料強調多鏡頭導演與從創作到剪輯的廣泛工作流,當提示是較大製作計畫的一部分、而非單一自洽場景時,是很強的選擇。
Vidu Q3 更明確圍繞緊湊敘事弧建構。其官方定位聚焦創作者打造漫畫/動畫風劇情、電影化場景、短劇系列與敘事廣告,並將鏡頭語言與節奏視為可控的敘事元素。
結論:沒有通用贏家。Wan 2.7 更適合以製作為導向;Vidu Q3 更符合原生敘事。
Motion and Camera Control
Alibaba 表示 Wan 2.7 能透過自然語言剪輯修改拍攝方式並重現複雜的鏡頭運動。Vidu Q3 的官方材料則強調在生成期間直接提供詳細鏡頭語言與節奏控制。這使得比較焦點從「是否有鏡頭控制」轉向「鏡頭控制在工作流程中的位置」。
結論:Vidu Q3 在明確的故事時間鏡頭節奏上略占優勢;當鏡頭控制需結合延續、參考條件或後續剪輯時,Wan 2.7 較強。
角色與參考一致性
Wan 2.7 擁有專用的 R2V 路線,Alibaba 描述可在多主體間實現跨影片一致性,包括聲音與視覺識別。該套件亦支援延續與首/尾幀工作流,為製作團隊在連續片段中維持識別提供多種方法。
Vidu Q3 也支援參考轉影片。官方 API 允許以 1–7 張參考圖生成 Q3 影片,輸出最長 16 秒,不應被視為僅文本或僅首幀模型。
結論:Wan 2.7 在以參考驅動的製作彈性上獲勝。Vidu Q3 在基於參考的敘事生成上仍具競爭力。
Audio, Dialogue and Lip Sync
兩者皆可生成含音訊的影片。Wan 2.7 支援自訂音訊檔與自動音訊生成;其 I2V 工作流可使用音訊作為驅動源以對齊口型與動作節奏。然而,Vidu Q3 將原生影音生成作為定義性的產品特徵:對話/旁白、音效與音樂與視覺一同生成。
結論:Vidu Q3 在以對話為先的敘事上獲勝。當製作始於供給的音訊參考或需將音訊與其他參考控制結合時,Wan 2.7 更具彈性。
Editing and Continuation
這是 Wan 最明確的優勢。Wan 2.7 包含專用的影片剪輯路線,Alibaba 文件化了指令式剪輯、風格轉換、元素替換與動作/效果複製。其 I2V 路線也支援從輸入片段延續。
Vidu Q3 支援首尾與參考生成,但在此比較的 Q3 模型中,專用剪輯並非核心能力。若你的工作流從既有素材開始,並要求模型修改而非重生成場景,Wan 2.7 更自然契合。
結論:Wan 2.7 勝出。
Duration and Resolution
| Capability | Wan 2.7 | Vidu Q3 |
|---|---|---|
| Maximum generation duration | 15 s | 16 s |
| Minimum typical generation duration | 2 s | 視 Q3 路線而定;最低 1–3 s(依變體) |
| 720p | Yes | Yes |
| 1080p | Yes | Yes |
| 540p | Wan 2.7 無主要等級 | Yes |
結論:Vidu Q3 在單次最長時長上略勝,並提供更便宜的 540p 等級。15 與 16 秒的差距本身很少決定性;工作流控制與成功率通常更重要。
Pricing and Cost Efficiency
影片生成定價依路線、解析度與平台而異,因此本節將直接供應商定價與當前 CometAPI 顯示的路線價格分開。
Direct Provider Pricing
| Model / route | 540p | 720p | 1080p |
|---|---|---|---|
| Wan 2.7 | — | $0.10/s | $0.15/s |
| Vidu Q3 Pro | $0.045/s | $0.10/s | $0.12/s |
| Vidu Q3 Turbo | $0.035/s | $0.055/s | $0.065/s |
Alibaba Model Studio 在國際新加坡部署中的 Wan 2.7 影音生成列價為 720p $0.10/s、1080p $0.15/s。Vidu 官方 API 列價 Q3 Pro 為540p $0.045/s、720p $0.10/s、1080p $0.12/s,Q3 Turbo 更低。
CometAPI Pricing vs Direct Provider Pricing
| Model / resolution | Official direct API | CometAPI | Pricing takeaway |
|---|---|---|---|
| Wan 2.7 / 720p | $0.10/s | $0.08/s | CometAPI 低 20% |
| Wan 2.7 / 1080p | $0.15/s | $0.12/s | CometAPI 低 20% |
| Vidu Q3 Pro / 540p | $0.045/s | $0.056/s | CometAPI 約高 24% |
| Vidu Q3 Pro / 720p | $0.10/s | $0.1232/s | CometAPI 約高 23% |
| Vidu Q3 Pro / 1080p | $0.12/s | $0.1232/s | CometAPI 約高 2.7% |

圖 3:同規格直接供應商 vs CometAPI 依模型與解析度的單位定價。
來源:Alibaba Model Studio、Vidu API pricing 與 CometAPI 模型頁。
同規格比較顯示為何不應概化閘道定價。對 Wan 2.7 而言,CometAPI 目前在 720p 與 1080p 相較 Alibaba Cloud 的國際費率提供明確的 20% 折扣。對 Vidu Q3 Pro 而言,直接使用 Vidu API 在 540p、720p、1080p 的價格目前均低於 CometAPI。因此,CometAPI 推薦 Vidu Q3 的理由應基於統一整合、模型切換與帳務整合——而非更低的每秒價格。
Strengths and Weaknesses
Wan 2.7 Strengths
- 在啟用音訊的 T2V 與 I2V 上具更強的公開盲選基準信號。
- 更廣的製作套件:T2V、I2V、R2V、延續與專用影片剪輯。
- 在多鏡頭製作中具強參考與身份控制工作流。
- 同時支援自動音訊生成與供給音訊參考。
- 適合需要在既有素材上反覆迭代而非重生成每個鏡頭的團隊。
Wan 2.7 Weaknesses
- 最長生成 15 秒略短於 Vidu Q3。
- 在本比較中的 CometAPI 起始價格較高。
- 其廣泛的工作流面向可能需要更多路線選擇與製作編排,而非「以故事為先」的單次生成。
Vidu Q3 Strengths
- 最長 16 秒輸出與 540p 低成本試驗等級。
- 原生影音生成是模型敘事工作流的核心。
- 很適合對話、短劇、敘事廣告與多鏡頭場景。
- 官方定位強調鏡頭語言、節奏與多語輸出。
- 當前 CometAPI 顯示的起始價格較低。
Vidu Q3 Weaknesses
- 目前在啟用音訊的 T2V 與 I2V Elo 落後於 Wan 2.7。
- Q3 的生成路線不像 Wan 2.7 的專用 videoedit 工作流那般以剪輯為核心。
- 長影片仍需超過 16 秒上限的多次生成與剪輯拼接。
Wan 2.7 vs Vidu Q3: Which Should You Choose?
| Workload | Recommended starting point | Why |
|---|---|---|
| Cinematic text-to-video quality | Wan 2.7 | 當前公開 T2V(含音訊)Elo 較高 |
| Image-to-video quality | Wan 2.7 | 當前公開 I2V(含音訊)Elo 較高 |
| Reference-driven character consistency | Wan 2.7 | 專用 R2V,加上延續與多模態控制 |
| Editing existing footage | Wan 2.7 | 專用指令式影片剪輯路線 |
| Video continuation | Wan 2.7 | 原生 I2V 延續工作流 |
| Dialogue-heavy short drama | Vidu Q3 | 以原生影音敘事為核心 |
| Multi-speaker narrative clips | Vidu Q3 | 對話與音訊是 Q3 的核心定位 |
| English/Japanese/Chinese narrative output | Vidu Q3 | 明確強調的多語輸出 |
| Lowest current CometAPI starting cost | Vidu Q3 | 顯示為 $0.056/s 對比 $0.08/s |
| Longest single generation | Vidu Q3 | 16 秒對比 15 秒 |
| Broadest production flexibility | Wan 2.7 | 生成 + 參考 + 延續 + 剪輯 |
對大多數專業評估管線而言,最佳策略是建立小型的提示與參考測試集,並將每項工作負載導向能以最低成本、最穩定通過驗收的模型。單價較低的模型若需要更多重試或手動修正,總成本仍可能更高。
Access Wan 2.7 and Vidu Q3 Through CometAPI
CometAPI 提供Wan 2.7 與 Vidu Q3 的統一、相容 OpenAI 的影片生成工作流程。開發者無需同時維護 Alibaba Model Studio 的 Wan 特定 API 流程與 Vidu 的供應商特定端點;可透過 POST /v1/videos 提交兩者,接收非同步影片 ID,輪詢 GET /v1/videos/{id},再擷取完成的 MP4。應用端的工作佇列、輪詢邏輯、驗證、重試處理與儲存工作流在切換供應商時可保持一致。
兩條路線皆支援文本轉影片與圖片轉影片生成。文本轉影片請求使用模型 ID、提示、時長與輸出尺寸;圖片轉影片請求沿用相同的影片端點並新增圖片參考。CometAPI 暴露簡化 ID wan2.7 與 viduq3,因此團隊可在不重建兩種供應商結構的前提下切換模型。
| Access / capability | Wan 2.7 through CometAPI | Vidu Q3 through CometAPI |
|---|---|---|
| CometAPI model ID | wan2.7 | viduq3 |
| Provider equivalent | Alibaba Wan 2.7 | Vidu Q3 Pro (viduq3-pro) |
| Unified endpoint | POST /v1/videos | POST /v1/videos |
| Text-to-video | Supported | Supported |
| Image-to-video | Supported | Supported |
| Task pattern | Asynchronous create → poll → retrieve | Asynchronous create → poll → retrieve |
| Pricing context | $0.08/s(720p)、$0.12/s(1080p):低於 Alibaba 直接定價 | $0.056/s(540p)、$0.1232/s(720p/1080p):高於 Vidu 直接 Q3 Pro 定價 |
命名差異並不代表較低的模型等級。CometAPI 的 viduq3 路線對應Vidu 官方的 viduq3-pro 模型,即用於文本轉影片、圖片轉影片與首尾幀生成的高階通用 Q3 路線。同樣地,wan2.7 暴露 Alibaba 的 Wan 2.7 模型家族;Alibaba 的文件將任務特定名稱區分為 wan2.7-t2v、wan2.7-i2v 等。換言之,CometAPI 正規化模型名稱與存取模式,而非替換為降級衍生版本。影片生成具隨機性,因此重複請求不會像素一致,但底層模型等級、能力範圍與預期品質與供應商模型保持一致。
對於 Wan 2.7 而言,當前公開的價格優勢很明確:CometAPI 列出720p $0.08/s 與 1080p $0.12/s,而 Alibaba Cloud 的國際 Model Studio 定價為720p $0.10/s 與 1080p $0.15/s,兩種解析度均下降 20%,且維持同一 Wan 2.7 生成等級。
對於 Vidu Q3,價格不應作為賣點。CometAPI 的 viduq3 路線映射至官方 Q3 Pro 等級,但目前公開的 CometAPI 費率在 540p、720p 與 1080p 均高於 Vidu 直接的 Q3 Pro 正常費率。使用 CometAPI 的理由在於操作簡化:相同的 OpenAI 風格影片端點、驗證模式、非同步工作生命週期與帳戶可與 Wan 2.7 及其他支援的影片模型一同使用。
實務重點在於 CometAPI 改變的是開發者「如何」抵達這些模型,而非「使用哪個」品質等級。對 Vidu Q3 而言,價值在於降低整合開銷:團隊可以在同一影片 API 背後對 Wan 2.7 與 Vidu Q3 Pro 做 A/B 測試,重用相同的佇列/輪詢/重試基礎設施,集中憑證與帳單,並在不維護供應商特定客戶端程式碼的情況下切換模型。即使直接供應商有較低單價,這種操作彈性仍是 CometAPI 的優勢。
What About Wan 3.0?
本比較需要一則當前情境註記。Alibaba 於 2026 年 8 月 7 日開始公開測試 Wan 3.0。Alibaba 表示該測試版支援最長 30 秒影片與更廣的多模態輸入,意味著 Wan 2.7 已非最新的 Wan 世代。
這並不使本比較失效。Wan 2.7 仍是成熟、定價明確、文件完善且具意義的公開基準覆蓋的生產路線,而 Wan 3.0 仍在測試中。今天選擇 API 的團隊可將本文視為穩定的 Wan 2.7 與 Q3 基線,比較之後再隨著 Wan 3.0 的 API 行為、定價與獨立基準證據成熟而另行評估。
How to Evaluate Both Models Yourself
- 建立 15–30 條提示的測試集,覆蓋你實際製作的內容:產品鏡頭、對話場景、動作、風格化動畫與基於參考的片段。
- 在兩個 API 允許的等效參數範圍內,使用相同的提示意圖、時長、寬高比與來源素材。
- 將視覺品質與提示遵循度、角色一致性、音訊節奏與鏡頭構圖分別打分。
- 追蹤失敗生成、重試與手動剪輯時間,而不僅計數成功的示例片段。
- 計算每支「被接受」片段的成本——不只每秒成本——然後將每項工作負載導向具最佳品質/成本權衡的模型。
Conclusion
Wan 2.7 在本比較中是更強的全方位製作候選。它在目前公開的盲選基準信號上領先,並提供更廣的創作工作流,尤其在參考一致性、延續與影片剪輯方面。
Vidu Q3 是更專注於敘事與成本效率的候選。其 16 秒上限、原生影音生成、鏡頭節奏感知與較低的 CometAPI 當前起始價格,使其對短劇、敘事廣告與以對話為中心的內容尤其有吸引力。
若需要一個受控的專業製作默認起點,請先測 Wan 2.7。若你的產品建立在快速敘事生成與同步對話/聲音之上,請先測 Vidu Q3。真正的部署中,正確的贏家是能以最少重試、最低「每支被接受片段」成本達到你的品質門檻的那一個。
FAQs
Is Wan 2.7 better than Vidu Q3?
Wan 2.7 目前擁有更強的公開盲選基準信號與更廣的製作工作流,但對於重對話的敘事、16 秒片段與低成本迭代,Vidu Q3 可能是更好的選擇。
Which model is cheaper?
撰寫時,CometAPI 顯示 Wan 2.7 起始 $0.08/s、Vidu Q3 起始 $0.056/s。直接供應商定價隨解析度與 Q3 變體而異。
Which model is better for image-to-video?
目前 Artificial Analysis 的 Image-to-Video With Audio 排行榜以 1,094 Elo 偏向 Wan 2.7、相對 Vidu Q3 Pro 的 1,065。因此若 I2V 輸出品質是主要驗收指標,Wan 是更強的首選。
Which model is better for AI short films with dialogue?
Vidu Q3 尤其契合此工作負載,因為原生對話、旁白、音效、音樂、鏡頭節奏與短篇敘事是其產品設計的核心。當短片需要更強的參考控制或後續剪輯時,Wan 2.7 仍具競爭力。
Does Wan 2.7 still make sense after Wan 3.0?
是的。Wan 3.0 於 2026 年 8 月 7 日進入公開測試,而 Wan 2.7 已具成熟的 API 文件、既定定價與更廣的獨立基準覆蓋。請另行評估 Wan 3.0,而非假設測試版立即取代已驗證的生產路線。
