Wan 3.0 の技術仕様
| 仕様 | Wan 3.0 |
|---|---|
| モデルタイプ | マルチモーダル・オールインワン動画生成モデル |
| モデルのステータス | 公開 API プレビュー |
| 入力タイプ | テキスト、画像、動画、音声、ドキュメント、ウェブページ |
| 動画生成 | テキストから動画、画像から動画、リファレンスから動画 |
| 動画編集 | 指示ベースおよびリファレンスベースの編集 |
| 最長時間 | 単回の生成で最大 30 秒 |
| 出力解像度 | 480P, 720P, 1080P |
| ネイティブ音声・映像生成 | 対応 |
| リファレンスアセット | 最大 20 個のマルチモーダル・リファレンスアセット |
| ドキュメント入力 | DOC, XLS, PPT, PDF, TXT, KEY, PAGES, NUMBERS, MD |
| 最大ドキュメントサイズ | 100 MB |
| 最大ページ数 | 50 ページ |
| API アクセス | Alibaba Cloud Model Studio API プレビュー |
| API 生成モード | 非同期 |
| 480P 料金 | $0.05/sec |
| 720P 料金 | $0.10/sec |
| 1080P 料金 | $0.20/sec |
Wan 3.0 は Alibaba Cloud による最新のオールインワン・マルチモーダル動画生成モデルで、2026 年 8 月に正式リリースされました。 先代の Wan と比べた最大の進化は単なる画質向上ではなく、テキスト、画像、動画、音声、ドキュメント、ウェブページを単一のクリエイティブなワークフローに統合した点です。Alibaba Cloud は、ネイティブな 30 秒動画生成、マルチモーダル・リファレンス入力、音声と映像の同期生成、精密な動画編集をサポートすると説明しています。
Wan 3.0 とは?
Wan 3.0 は、テキスト、画像、動画、音声、ドキュメント、ウェブコンテンツを首尾一貫した動画に変換するために設計された Alibaba の次世代マルチモーダル動画生成モデルです。
従来の AI 動画ワークフローでは、テキストから動画、画像から動画、リファレンスの一貫性確保、編集や音声用と、複数の専門モデルが必要でした。Wan 3.0 は、これらの入力を単一のクリエイティブ指示のもとで組み合わせられるオールインワンの制作モデルへと前進しています。
目玉機能はネイティブな 30 秒生成です。5~10 秒程度の短いクリップを繰り返し延長・結合するのではなく、Wan 3.0 は一度の処理で連続した 30 秒のシーケンスを生成できます。Alibaba のデモでは、より長いシーンでもキャラクター、環境、アクション、カメラワーク、セリフ、サウンドの一貫性が維持される様子が示されています。
もう一つの大きな変更は Omni-Reference です。開発者は複数のリファレンスアセットを使って、キャラクター、プロダクト、環境、モーション、その他の視覚的特徴を確立できます。公式の Wan 3.0 リポジトリでは最大 20 個のリファレンスアセットに対応と記載されており、Alibaba Cloud の製品ページでは、画像、テキスト、動画、音声、ドキュメント、ウェブページをクリエイティブなリファレンスとして組み合わせ可能である点が強調されています。
これにより、Wan 3.0 は単なるプロンプトから動画を生成するツールではなく、マルチモーダルのクリエイティブ制作エンジンに近い存在になります。
Wan 3.0 の主な機能
- ネイティブな 30 秒動画生成: Wan 3.0 は一度の処理で最大 30 秒の動画を生成でき、スマートな尺の選択と動画の延長機能を備えています。
- Omni-Reference: テキスト、画像、動画、音声をリファレンスとして組み合わせ可能。さらにドキュメントやウェブページへのリファレンスベース生成も拡張されています。
- ドキュメントから動画: PPT、PDF、DOC、XLS、TXT、KEY、PAGES、NUMBERS、MD をクリエイティブ入力として利用でき、プレゼン、レポート、構造化情報を動画化できます。
- ネイティブな映像・音声の同時生成: 対話、環境音、音楽指向のオーディオビジュアル・シーンを含む映像と音声の同時生成に対応。
- リファレンスの一貫性: リファレンス駆動の生成において、キャラクター、小道具、環境、空間関係、スタイルの維持を意図した設計。
- 動画編集: 生成済みの映像コンテンツ、プロット、セリフを修正でき、毎回ゼロからやり直す必要なく反復的な制作が可能。
Wan 3.0 は他の動画モデルとどう違う?
| モデル | ネイティブ生成時間 | 画像から動画 | リファレンス制御 | 音声 | ドキュメント/ウェブ入力 | 主な強み |
|---|---|---|---|---|---|---|
| Wan 3.0 | 30s | ✓ | 強力 | ✓ | ✓ | オールインワンのマルチモーダル制作 |
| Wan 2.7 | 15s | ✓ | ✓ | ✓ | 限定的 | 確立された Wan の動画ワークフロー |
| Grok Imagine Video 1.5 | 最大 15 秒 | ✓ | ✓ | ✓ | — | 短尺クリエイティブ動画の高速生成 |
| Veo | モデル依存 | ✓ | ✓ | ✓ | マルチモーダル | シネマティック生成 |
| Kling | モデル依存 | ✓ | ✓ | ✓ | — | キャラクターとモーション生成 |
| Seedance | モデル依存 | ✓ | ✓ | ✓ | — | クリエイティブでマルチショットな動画 |
最大の差別化要因は入力の幅広さです。
Grok Imagine Video 1.5 と比べると、Wan 3.0 はオールインワンの制作ワークフローに大きく踏み込んでいます。Grok はテキスト、画像、リファレンスのワークフローによる短尺生成に重点を置く一方で、Wan 3.0 はこれに加えてドキュメント、ウェブページ、音声、動画を直接のクリエイティブリファレンスとして取り込めます。
Wan 2.7 と比べた最大のアーキテクチャ/プロダクト面の変化は、統合されたマルチモーダル・ワークフローと、前世代の短いクリップに対して30 秒のネイティブ生成上限に移行した点です。Alibaba Cloud の現行の Wan 3.0 資料では、長尺のナラティブと Omni-Reference 生成を中心に据えたモデルとして位置づけられています。
Kling や Veo と比較して、Wan 3.0 の最大の差別化要因は、必ずしも生成されるすべてのフレームがより優れているということではありません。むしろ、膨大なソース素材を組み合わせ、それをより長い生成過程を通じて保持できる点にあります。
入力が単に「このプロンプトでシネマティックなクリップを生成して」という用途では、他のモデルも引き続き競争力があります。入力が「ここに製品画像、キャラクターのリファレンス、PDF、スプレッドシート、音声サンプル、クリエイティブブリーフがある—これらを首尾一貫した動画にして」というワークフローであれば、Wan 3.0 は非常に有力な選択肢になります。
Wan 3.0 の代表的なユースケース
1. AI 映画制作・ストーリー制作
単回 30 秒生成により、複数の短編をつなぎ合わせることなく、連続したカメラワーク、対話、複数アクションが必要なシーンに有用です。
2. プロダクト広告
製品画像や複数のリファレンスをディレクター風のプロンプトと組み合わせ、製品デモ、UGC 広告、シネマティックなブランド動画を作成できます。
3. プレゼンからの動画生成
PPT、PDF、DOC、XLS などの対応フォーマットを処理でき、レポート、プレゼン、構造化情報を視覚的なナラティブへ変換します。
4. キャラクター一貫性のある動画
リファレンス画像、動画、その他のメディアでキャラクター、オブジェクト、環境を確立してからシーンを生成できます。
5. ソーシャルメディア向けコンテンツ
30 秒の尺と縦型 9:16 のアスペクト比により、短尺のソーシャルコンテンツ、広告、ナラティブクリップに適しています。
6. 動画編集と反復
生成済みコンテンツのビジュアル要素、ストーリー、セリフを修正でき、反復的なクリエイティブワークフローを可能にします。
Wan 3.0 API パラメータ
公式 API は非同期の動画生成エンドポイントを使用します。簡略化したリクエストは、model、input、parameters オブジェクトを含みます。
主なパラメータは以下のとおりです:
| パラメータ | 説明 |
|---|---|
| model | wan3.0-video |
| input.prompt | ディレクター指向の生成指示 |
| input.media | リファレンス画像、動画、音声、ファイル、またはウェブリソース |
| parameters.resolution | 480P, 720P, 1080P |
| parameters.ratio | adaptive, 16:9, 4:3, 1:1, 3:4, 9:16 |
| parameters.duration | 2~30 秒。-1 でスマートな尺を有効化 |
| parameters.audio | 音声トラックを含めるかどうか |
| parameters.seed | 再現性のための乱数シード |
| parameters.watermark | ウォーターマークを追加するかどうか |
公式ドキュメントによると、動画入力がない場合、duration は 2~30 秒の整数を指定できます。動画入力がある場合、入力と出力の合計尺がサポートされる総尺の範囲内に収まる必要があります。
CometAPI で Wan 3.0 API を使う方法
複数の AI 動画モデルを利用する開発者にとって、CometAPI は Wan 3.0 と他の動画生成モデルを横並びで試すための統一アクセスポイントとして機能します。
一般的なワークフロー:
- CometAPI アカウントを作成またはログインする。
- CometAPI の API キーを取得する。
- Wan 3.0 のモデルエンドポイントを選択する。
- テキストから動画、画像から動画、またはリファレンスベースの生成リクエストを送信する。
- 解像度、尺、アスペクト比など、サポートされるパラメータを指定する。
- 非同期生成タスクをモニタリングする。
- 処理完了後に生成された動画を取得する。
実装前に、最新の CometAPI における Wan 3.0 連携内容と照らし合わせて、正確な CometAPI エンドポイントとサポートされるパラメータを確認してください。特に上流の Alibaba API がまだプレビュー段階であるため、最新情報に基づく検証が重要です。