TLDR Wan 3.0(別表記: Wan3.0)は、Alibaba Tongyi Lab による最新のオールインワン動画モデル。最大 1080p の音声同期付きネイティブ 30 秒連続クリップを単一パスで生成します。text-to-video、image-to-video、先頭・末尾フレーム条件付け、そして画像・動画・音声・ドキュメント(PDF、PPT、XLS、DOC、MD など)・ウェブページを受け付ける強力な Omni-Reference ワークフローをサポート。
パブリックベータは 2026 年 8 月 6 日に開始、8 月 24 日頃により広範囲へ開放。価格は概ね 480p が $0.05/s、720p が $0.10/s、1080p が $0.20/s。Wan 系および 500 以上のモデルへ OpenAI 互換 API で統一的にアクセスしたい開発者・チーム向けには、簡易統合の効率的ルートとして CometAPI が有用—現在は Wan 2.7 を掲載し、/v1/videos 経由で動画カタログを拡充中。
重要ポイント
- ネイティブな 30 秒ワンテイク生成(従来の Wan 2.7/2.5 の約 15 秒上限の倍)と賢い尺合わせ。
- Omni-Reference: 最大約 10〜20 の混在アセット(画像、動画 ≤15 秒合計、音声、ドキュメント/ウェブページ)で強力な被写体・プロダクト・スタイル一貫性。
- 文書・ウェブページから動画への変換が目玉:PDF、スライド、表計算、公開 URL を投入して構造化動画を生成。
- 同一パスでのネイティブ音声生成;解像度は 480p/720p/1080p、複数アスペクト比に対応。
- 顔/微表情の忠実度向上、参照の安定性、オンスクリーンテキストのクリーンさが前世代より改善。
- Alibaba Cloud Model Studio/Qwen Cloud(モデル
wan3.0-video)、wan.video、サードパーティ経由で利用可能。マルチモデル開発を効率化するなら CometAPI の統一ビデオエンドポイントがおすすめ。 - プロンプトはショット指示書のように(被写体+動き+カメラ+タイミング+制約)書き、参照は明示的に(@Image1 など)ラベル付け。
What Is Wan 3.0?
Wan 3.0 は、Tongyi Lab が開発する Alibaba の Tongyi Wanxiang(Wan)動画生成ファミリーの最新フラッグシップです。オープン/クローズド両系の従来 Wan(2025 年のオープン版 Wan シリーズを含む)の拡散×トランスフォーマ系譜を継承。
Wan 2.7/2.5 からの主なアップグレードは以下のとおり:
- 連続生成のネイティブ最長尺が 30 秒に倍増(クリップの継ぎはぎではない)。
- テキスト/画像/動画/音声に加え、オフィス文書や公開ウェブページまでマルチモーダル入力を拡張。
- 顔・微表情、プロダクト細部、デジタル/UI コンテンツの一貫性における“Reality-grade”レンダリングの改善。
- text-to-video(T2V)、image-to-video(I2V)、先頭・末尾フレーム、参照ベース生成、関連編集/拡張までを一体化したオールインワンモデル。
Alibaba は、本モデルをマーケティング動画、短編ドラマ、ソーシャルコンテンツ、製品デモ、トレーニング/シミュレーション映像(例:ロボティクスや自動運転)、企業向け解説動画に位置づけています。ウェイトはクローズド/API 提供のみ(オープンウェイトは以前の Wan 2.x まで)。
補足データとソース: 料金例一覧 (国際):480p $0.05/s、720p $0.10/s、1080p $0.20/s(30 秒 1080p クリップ ≈ $6(Standard))。 一部プラットフォームでは Standard と高速な Prime ティアの提供や一時的な割引があります。
Wan 3.0 API の使い方
Alibaba Cloud は Model Studio の動画生成 API を通じて Wan 3.0 を提供しています。現在のモデル識別子は次のとおりです:
wan3.0-video
API は非同期で動画を生成します。代表的なリクエストは次のとおり:
curl --location 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
-H 'X-DashScope-Async: enable' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "wan3.0-video",
"input": {
"prompt": "モダンなキッチンで高級コーヒーマシンを魅せる、シネマティックなプロダクトCM。"
},
"parameters": {
"resolution": "720P",
"ratio": "16:9",
"duration": 10,
"enable_thinking": false
}
}'
Alibaba の API リファレンスによれば、モデル、エンドポイント、API キーは同一リージョンに属している必要があります。API は非同期のため、アプリケーションはタスクを送信し、処理完了後に生成結果を取得します。
image-to-video や参照ベースのワークフローでは、input オブジェクトに参照メディアを含められます。Alibaba の最新例では、同一リクエスト内で参照動画と参照画像の組み合わせを示しています。
CometAPI 経由での Wan 3.0 利用方法(開発者に推奨)
CometAPI は 500 以上のモデルに対する OpenAI 互換の統一インターフェースを提供し、Alibaba Wan 系の動画モデル(現在は Wan 2.7 を競争力のある秒単価で掲載。Wan 3.0 は拡大に応じてカタログを確認)にも対応します。動画生成は multipart フォームデータの /v1/videos エンドポイントを使用—本番パイプライン、n8n/Make の自動化、Wan・Seedance・Kling・Veo・MiniMax などの切り替えに適します。
CometAPI の手順:
- cometapi.com でサインアップ/ログインし、API キー(sk-…)を作成。
- 動画 API ドキュメント(apidoc.cometapi.com)とモデル一覧を確認し、正確な Wan の ID(例:
wan2.7のパターン。最新を確認)を把握。 - フォームフィールドを付与して POST
https://api.cometapi.com/v1/videosに送信。 - タスク/IDを受け取り、完了までステータスをポーリングするか Webhook を利用。
- 生成された動画コンテンツをダウンロード。
- CometAPI ダッシュボードで利用状況とコストを監視(従量課金、月額最低料金なし)。
Wan 3.0 の効果的なプロンプト作成法
プロンプトはカジュアルなキャプションではなく、ショット指示書として扱います。実績ある構成(コミュニティやプラットフォームガイドを参考):
SPACE 方式/ショットリストの書式:
- Subject(被写体):誰/何かを具体的に。
- Performance/Action(動き):時間順の見える動きと状態変化。
- Ambience/Setting(環境):場所、時間、照明、天候。
- Camera(カメラ):ショットサイズ+明確な 1 つの動き(スローのドリーイン、オービット、トラッキング、静止など)。
- Extra(追加):スタイル、音声のキュー、テンポ、制約(「ラベルを判読可能に」「顔の同一性を保持」など)。
30 秒のマルチビートクリップでは、時間範囲付きでショットを番号付けします:
Overall: 濡れた黒い石の上に置かれたセラミック製香水ボトルの高級感あるプロダクトリビール(夕暮れ)。
Shot 1 [0-8s]: ワイドの導入。ゆっくり 3/4 オービット。暖かいリムライト。やさしい雨。
Shot 2 [8-18s]: さらに寄って製品にフォーカス。ボトルがゆっくり回転。ラベルと金色のキャップはシャープなまま。
Shot 3 [18-30s]: 最後はディテールへドリーイン。柔らかなアンビエント音楽。ロゴで静止。
ボトル形状、ラベル位置、金色キャップの一貫性を維持。シネマティックで落ち着いたテンポ。テキストオーバーレイはなし。
Reference binding(Omni-Reference で重要):
@Image1 は女性キャラクター(顔と黄色のジャケット)。
@Image2 は雨の路地の背景。
@Audio1 は声のトーンを提供。
@Image1 のキャラクターが @Image2 の路地を歩き、「…」と @Audio1 の声で話す。
追加のコツ:
- 観察可能なアクションと空間関係を具体的に書く。
- よくある失敗(手の歪み、不要なテキスト、スタイルの漂流)にはネガティブプロンプトを使う。
- 文書入力の場合:「添付 PDF の構成に従う解説動画を作成。2 ページ目の 3 つの主要指標と結論の提言を強調」。
- 反復する:短尺で当たりを見てから、うまくいったパートを拡張。
- カメラ言語やライティング記述はシネマティック品質を高める。
Wan 3.0 を使う理由
Wan 3.0 は、単にテキストプロンプトから短いクリップを作るのではなく、複数種類のソース素材を一貫した動画へと変換する必要がある用途で最も力を発揮します。
主な強みは次のとおり:
- 30 秒のネイティブ動画生成
- Text-to-video と Image-to-video
- マルチリファレンス動画生成
- テキスト・画像・動画・音声・ドキュメント入力
- 文書・ウェブページから動画へのワークフロー
- ネイティブな音声・映像同時生成
- 1080P 出力
- 指示ベースの動画編集
- 強力な参照一貫性
- 秒課金の料金体系
- 複数のクリエイティブワークフローを単一モデルで網羅
AI 映像ツール、広告システム、製品動画ジェネレーター、教育コンテンツ基盤、マルチモーダルなクリエイティブエージェントを構築する開発者にとって、これらの機能は個別モデルや前処理ステップの数を大幅に削減します。
結論と推奨
Wan 3.0 は、より長い連続テイク、本格的な文書から動画への変換、強化されたマルチモーダル制御により、実務的・プロダクション志向の AI 動画へと前進しました。適切なプロンプト設計と参照の取り扱いを組み合わせれば、多くのマーケティング、解説、短尺用途で従来数日かかった制作を数分に圧縮できます。
アプリケーションや内製ツールを構築する開発者・チームは、まずは公式の Alibaba チャネルで Wan 3.0 を体験し、併せて高い生産性を求めるなら CometAPI(cometapi.com)も検討を。統一ビデオ API、幅広いモデル対応(現行 Wan 2.7 と拡大中のカタログ)、OpenAI 互換のインターフェース、透明な従量課金により、単一統合で実験からスケール、Wan 系生成と補完的な LLM/画像/音声モデルの組み合わせまでを容易にします。
CometAPI と Alibaba Cloud Model Studio の最新モデル一覧とドキュメントを確認し、短尺で試作、ショットリストのプロンプトを磨き、フル 30 秒制作へ拡張しましょう。ネイティブ尺の長さと Omni-Reference の組み合わせが、これまで煩雑または高コストだった新たな創作・ビジネスワークフローを切り開きます。
