Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →
guide/CometAPI 研究

如何使用 Wan 3:API 指南+ 提示詞

了解 Wan 3.0,支援從文字、圖片、文件(PDF/PPT)與網頁產生音訊。規格、定價、提示詞,以及如何透過 API 使用。

CometAPI
AnnaAI 模型與 API 研究團隊
更新於 Aug 29, 2026 3 分鐘閱讀
如何使用 Wan 3:API 指南+ 提示詞
套用此模式

發出第一個 API 請求。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR Wan 3.0(也寫作 Wan3.0)是 Alibaba Tongyi Lab 最新的全能影片模型,能以單次生成產出最長 30 秒、最高 1080p、音畫同步的連續片段。其支援文字轉影片、圖片轉影片、首末幀條件約束,以及強大的 Omni-Reference 工作流程,能接收圖片、影片、音訊、文件(PDF、PPT、XLS、DOC、MD 等)與網頁。

公開測試於 2026 年 8 月 6 日開放;約在 2026 年 8 月 24 日擴大開放。定價大致為 480p $0.05/s、720p $0.10/s、1080p $0.20/s。若開發者與團隊尋求一個統一且相容 OpenAI 的 API 以簡易整合地存取 Wan 系列與 500+ 其他模型,CometAPI 提供高效路徑——目前已上線 Wan 2.7,並透過 /v1/videos 持續擴充影片型號。

重點摘要

  • 原生 30 秒單次一鏡到底生成(為先前 Wan 2.7/2.5 約 15 秒上限的兩倍),並具智慧時長匹配。
  • Omni-Reference:可混合最多約 10–20 個素材(圖片、影片總長 ≤15 秒、音訊、1 份文件/網頁),以強化主體、產品與風格一致性。
  • 文件與網頁轉影片表現突出:輸入 PDF、簡報、試算表或公開 URL,即可得到結構化影片。
  • 同步生成原生音訊;支援 480p/720p/1080p 多解析度與多種長寬比。
  • 較前代更強的臉部/微表情保真度、參考穩定性,以及更乾淨的螢幕文字。
  • 可透過 Alibaba Cloud Model Studio / Qwen Cloud(模型 wan3.0-video)、wan.video 與第三方平台使用。若需精簡多模型開發流程,建議使用 CometAPI 的統一影片端點。
  • 以「分鏡簡述」方式撰寫提示(主體 + 動作 + 鏡頭 + 時間 + 約束),並明確標註參考資產(@Image1 等)。

什麼是 Wan 3.0?

Wan 3.0 是 Alibaba 的 Tongyi Wanxiang(Wan)影片生成家族的最新旗艦,由 Tongyi Lab 開發。它延續了先前 Wan 開源與閉源版本的擴散-Transformer 譜系(包括 2025 年廣受研究的開源 Wan 系列)。

相較於 Wan 2.7 / 2.5 的重點升級包括:

  • 最長原生時長翻倍至 30 秒,且為單次生成的連續片段(非拼接)。
  • 多模態輸入擴及辦公文件與公開網頁,超越僅有文字/圖片/影片/音訊。
  • 更佳的「真實級」呈現:臉部與微表情、產品細節、數位/UI 內容一致性更強。
  • 單一全能模型覆蓋文字轉影片(T2V)、圖片轉影片(I2V)、首末幀、參考轉影片及相關編輯/延展能力。

Alibaba 將其定位於行銷影片、短劇、社群內容、產品展示、訓練/模擬畫面(如機器人或 AV)、以及企業型解說。該模型仍為封閉權重/僅提供 API(開放權重停留在較早的 Wan 2.x 版本)。

支持數據與來源價格範例清單(國際):480p $0.05/s、720p $0.10/s、1080p $0.20/s(30 秒 1080p 約 $6 標準費用)。部分平台提供 Standard 與更快的 Prime 等級或臨時折扣。

如何使用 Wan 3.0 API

Alibaba Cloud 透過 Model Studio 的影片生成 API 對外提供 Wan 3.0。目前的模型識別碼為:

wan3.0-video

該 API 為非同步影片生成。代表性請求如下:

curl --location 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
  -H 'X-DashScope-Async: enable' \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "wan3.0-video",
    "input": {
      "prompt": "A cinematic product commercial showing a premium coffee machine in a modern kitchen."
    },
    "parameters": {
      "resolution": "720P",
      "ratio": "16:9",
      "duration": 10,
      "enable_thinking": false
    }
  }'

依據官方參考,模型、端點與 API 金鑰需屬於同一區域。由於為非同步流程,應用需先提交任務,待處理完成後再取回生成結果。

對於圖片轉影片與參考驅動的工作流程,可在 input 物件中一併提供參考媒體。Alibaba 目前示例展示了同時在單一請求中使用參考影片與參考圖片的組合。

透過 CometAPI 使用 Wan 3.0(推薦給開發者)

CometAPI 提供統一、相容 OpenAI 的介面以存取 500+ 模型,包含 Alibaba Wan 系列影片模型(目前已列出 Wan 2.7,且隨著供應擴大,請隨時查看最新是否上線 Wan 3.0)。影片生成使用 /v1/videos 端點與 multipart 表單,上線導入、n8n/Make 自動化,或在 Wan、Seedance、Kling、Veo、MiniMax 等模型間切換時特別合適,且只需一組金鑰。

CometAPI 步驟

  1. 於 cometapi.com 註冊/登入並建立 API 金鑰(sk-…)。
  2. 查閱影片 API 文件(apidoc.cometapi.com)與模型清單以取得 Wan 的確切 ID(例如遵循 wan2.7 的命名樣式;請確認最新)。
  3. 透過 POST 提交至 https://api.cometapi.com/v1/videos,使用表單欄位。
  4. 收到任務 ID;輪詢狀態端點或使用 webhooks 直至完成。
  5. 下載生成的影片內容。
  6. 在 CometAPI 控制台監控用量與成本(按量計費,無月費門檻)。

如何有效撰寫 Wan 3.0 提示語

將提示視為分鏡簡述,而非隨意的文字說明。一個實證有效的結構(來自社群與平台指南的調整版):

SPACE 風格或分鏡清單公式:

  • 主體(Subject):具體描述是誰/什麼。
  • 表演/動作(Performance/Action):可見的動作與狀態變化,依時間順序。
  • 氛圍/場景(Ambience/Setting):地點、時間、光線、天氣。
  • 鏡頭(Camera):鏡位 + 一個清晰的運鏡(慢速推進、環繞、跟拍、固定)。
  • 額外(Extra):風格、音訊線索、節奏、約束(例如「保持標籤可讀」、「維持臉部辨識一致」)。

針對多段落的 30 秒片段,建議以時間範圍編號分鏡:

Overall: A premium product reveal of a ceramic perfume bottle on wet black stone at dusk.
Shot 1 [0-8s]: Wide establishing, slow three-quarter orbit, warm rim light, gentle rain.
Shot 2 [8-18s]: Closer product focus, bottle rotates slowly, label and gold cap remain sharp.
Shot 3 [18-30s]: Final push-in to detail, soft ambient score, hold on the logo.
Keep bottle shape, label position, and gold cap consistent. Cinematic, calm pacing, no text overlays.

Reference binding(對 Omni-Reference 極為關鍵):

@Image1 is the female character (face and yellow jacket).
@Image2 is the rainy alley background.
@Audio1 provides the voice timbre.
The character from @Image1 walks through the alley from @Image2 and says “…” using the voice of @Audio1.

其他提示:

  • 具體描述可觀察的動作與空間關係。
  • 使用負面提示語來抑制常見失敗模式(如手部變形、不想要的文字、風格漂移)。
  • 用於文件:例如「製作一支解說影片,遵循所附 PDF 的結構,強調第 2 頁的三個關鍵指標與結論建議」。
  • 迭代流程:先產生短版,成功後再延展到多段落。
  • 善用鏡頭語言與燈光描述詞彙,以提升電影感。

為何使用 Wan 3.0?

當你的應用需要把多種來源素材轉化為一支連貫的影片,而非僅將文字提示變為短片時,Wan 3.0 具有明顯優勢。

其最突出的優勢包括:

  • 30 秒原生影片生成
  • 文字轉影片與圖片轉影片
  • 多參考生成
  • 同時接收文字、圖片、影片、音訊與文件
  • 文件/網頁轉影片流程
  • 原生視聽同步生成
  • 1080P 輸出
  • 指令驅動的影片編輯
  • 強參考一致性
  • 按秒計費
  • 單一模型覆蓋多種創作流程

對於打造 AI 影像工具、廣告系統、產品影片生成器、教育內容平台或多模態創作代理的開發者,這些能力可顯著減少對多個模型與前處理步驟的依賴。

結論與建議

Wan 3.0 朝向實用、能上線的 AI 影片又邁進一步:更長的連續鏡頭、真正的文件轉影片、以及更強的多模態控制。結合嚴謹的提示撰寫與參考管理,對許多行銷、解說與短影音用例,能把傳統製作的數天工期壓縮到數分鐘。

對於正在打造應用或內部工具的團隊,建議先從 Alibaba 官方管道獲得最純粹的 Wan 3.0 體驗,並考慮以 CometAPI(cometapi.com)作為高效率的入口。它的統一影片 API、廣泛的模型覆蓋(包含現有 Wan 2.7 與持續擴張的型錄)、相容 OpenAI 的介面,以及透明的按量計費,能讓你在單一整合下輕鬆試驗、擴展,並把 Wan 類生成與互補的 LLM、影像與音訊模型組合起來。

請於 CometAPI 與 Alibaba Cloud Model Studio 查閱最新模型清單與文件,先以短片實驗、打磨分鏡式提示,並逐步擴展到完整 30 秒製作。更長的原生時長配合 Omni-Reference,將開啟以往繁瑣或昂貴的新型創意與商業工作流程。

繼續學習

把這篇文章連到下一個決策。

查看所有主題
發布於 Aug 27, 2026
最後更新 Aug 29, 2026
4 次瀏覽
已審核內容清晰度、來源標註與最新 API 術語。

準備好將 AI 開發成本降低 20% 了嗎?

幾分鐘內免費開始。包含免費試用點數。無需信用卡。

閱讀更多