Alibaba と ByteDance は、30 秒の AI 動画生成としては例外的に完成度の高い 2 つのシステムを提供している。1 つはドキュメントやウェブページを動画に変換できるオールインワンのパイプラインを重視し、もう 1 つは長編ストーリーテリング、密度の高いリファレンス制御、精密な視聴覚編集を重視している。本ガイドは、検証済み仕様と独立ベンチマークのエビデンスを切り分け、開発者がローンチ時の主張ではなく本番適合性で選べるようにする。
TL;DR
結論: Wan 3.0 は、独立した品質シグナルの明確さ、1080p 出力、ドキュメント/ウェブページ入力、そして現状の API スタート価格が低い点から、デフォルトの第一候補として強い。Seedance 2.5 は、最大 50 個のリファレンス、複数ラウンド継続、タイムスタンプ単位の編集、グリーンバック(グリーンスクリーン)ワークフロー、ホワイトモデルのプリビズ(previsualization)が必要な場合の、より専門的なクリエイティブ制作向けの選択肢。
まだクリーンな公開の正面比較ベンチマークはない。Artificial Analysis は現時点で Alibaba モデルを、音声有りの text-to-video アリーナで首位にランク付けしているが、ByteDance のリリースは同じ評価枠に未掲載。Seedance 2.5 が同じアリーナで未評価のため、このリーダーボードは両者を直接比較する根拠にはならない。
Wan 3.0 vs Seedance 2.5: クイック比較
| カテゴリー | Wan 3.0 | Seedance 2.5 |
|---|---|---|
| 開発元 | Alibaba Tongyi / Wan | ByteDance Seed |
| リリース/提供状況 | Public API リリース: 2026年8月24日 | 公式ローンチ: 7月31日;CometAPI ルート: 2026年8月6日 |
| 設計方針 | オールインワンのマルチモーダル動画制作 | 制御されたストーリーテリングのための音声・映像の共同生成 |
| ネイティブ最大尺 | 2~30 秒 | 4~30 秒 |
| 出力解像度 | 480p, 720p, 1080p | CometAPI は現在 480p と 720p のルートを記載 |
| 参照上限 | 画像最大 10 枚 + 動画 5 本 + 音声 5 本;加えてドキュメント 1 つまたは公開ウェブページ 1 つ | 画像 30 枚 + 動画 10 本 + 音声 10 本 |
| 入力タイプ | テキスト、画像、動画、音声、ドキュメント、ウェブページ | テキスト、画像、動画、音声 |
| ネイティブ音声 | セリフ、BGM、効果音 | 同期音声付きの音声・映像共同生成 |
| 編集 | 命令に基づく編集、延長、先頭/最終フレーム制御 | タイムスタンプ編集、グリーンスクリーン、カメラ/リファレンス編集 |
| 独立ベンチマーク | 音声付き T2V で #1;1,241 Elo | 同一ベンチマークに未掲載 |
| CometAPI 開始価格 | 生成 1 秒あたり $0.04 | 生成 1 秒あたり $0.0824 |
| 推奨スタート用途 | プロダクトデモ、解説動画、ドキュメント→動画、品質重視のデフォルト | リファレンス多用のナラティブ、映画/広告の制御、狙い撃ちの編集 |
Wan 3.0 とは?
Alibaba の最新ホスト型動画モデルは、text-to-video、image-to-video、リファレンス生成、編集、延長、ネイティブ音声を 1 つのシステムに統合している。特徴は 30 秒上限だけではなく、画像・動画・音声・オフィスドキュメント・公開ウェブページから創作コンテキストを受け取り、プロダクトブリーフやスライドを生成指示の一部にできる点にある。
公式の Wan 3.0 API ガイドでは、最大 30 秒・30 fps、480p/720p/1080p 出力、ネイティブのセリフ/BGM/効果音を明記。リクエスト制限は参照画像最大 10、参照動画 5、参照音声 5、加えて対応ドキュメント 1 件または公開ウェブページ 1 件。同ガイドには、先頭フレームおよび先頭+最終フレーム制御、動画継続、自然言語編集も記載されている。
出典: Alibaba Tongyi Wan 公式ショーケース
Alibaba モデル仕様
| 仕様 | 検証済み値 |
|---|---|
| モデルステータス | ホスト型商用モデル;API 提供 |
| 生成モード | Text-to-video、Image-to-video、Reference-to-video、編集、継続 |
| 最大尺 | 1 回の生成で最大 30 秒;2~30 秒をドキュメントに明記 |
| フレームレート | 30 fps |
| 解像度 | 480p, 720p, 1080p |
| アスペクト比 | アダプティブ、16:9、4:3、1:1、3:4、9:16 |
| 参照 | 参照画像最大 10、参照動画 5、参照音声 5;加えてリクエストごとに対応ドキュメント 1 件または公開ウェブページ 1 件を使用可能 |
| ドキュメント | DOC, XLS, PPT, PDF, TXT, KEY, PAGES, NUMBERS, MD |
| ドキュメント上限 | 最大 100 MB、50 ページ |
| 音声 | ネイティブな音声/セリフ、BGM、効果音 |
| CometAPI モデル ID | wan3.0 |
| CometAPI エンドポイント | POST /v1/videos;非同期の作成&ポーリング型ワークフロー |
Alibaba モデルの強み
- ドキュメント→動画/ウェブページ→動画により、プレゼン、レポート、商品ページ、トレーニング素材、コーポレート解説の前処理ステップを省略。
- 1080p ルートと 30 fps 出力が、最終納品までの明確なルートを提供。
- 同一モデルで生成、リファレンス条件付け、編集、延長をカバーし、モデル個別のオーケストレーションを削減。
- 独立 T2V と動画編集の現行結果が、ベンダーデモのみより強い公開エビデンスを提供。
Seedance 2.5 とは?
ByteDance の新世代の音声・映像モデルは、完結した 30 秒の物語、大規模なマルチモーダル参照セット、プロダクション編集を中心に設計されている。単一の生成内で複数の関連ショットを構成し、追加ラウンドで既存出力を継続し、長いナラティブにわたって一貫した視聴覚言語を維持できる。
公式ローンチ発表では、1 回の生成で最大 30 枚の画像、10 本の動画、10 本の音声を参照可能と記載。さらに、タイムスタンプ単位の視聴覚編集、グリーンスクリーン置換、カメラ視点編集、動きの参照、クリエイティブ参照、構図・ブロッキング・ライティング・カメラ計画のためのクレイレンダー(clay-render)制御を説明している。

出典: ByteDance Seedance 2.5 公式ショーケース
ByteDance モデル仕様
| 仕様 | 検証済み値 |
|---|---|
| モデルステータス | 正式ローンチ済み;商用プラットフォームと API アクセス |
| 生成モード | Text-to-video、Image-to-video、Reference-to-video、延長、編集 |
| 最大尺 | ByteDance が 1 生成あたり最大 30 秒を公式確認;現在の CometAPI ルートは 4~30 秒を受け付けると記載 |
| 継続 | 複数ラウンドの延長;製品ページは最大 2 回の延長を記載 |
| 解像度 | CometAPI は現在、価格表に 480p と 720p のルートを記載 |
| 参照 | 画像最大 30、動画 10、音声 10 |
| 入力タイプ | テキスト、画像、動画、音声 |
| ドキュメント | 公式の Seedance 2.5 資料にネイティブ参照入力としての記載なし |
| ドキュメント上限 | 該当なし/現行の Seedance 2.5 ルートでは未記載 |
| 音声 | 音声・映像の共同生成および参照音声 |
| 編集 | タイムスタンプ制御、グリーンスクリーン、カメラ視点、リファレンス編集 |
| プリビズ | クレイレンダー/ホワイトモデル制御 |
| CometAPI モデル ID | seedance-2-5 |
| CometAPI エンドポイント | POST /v1/videos;非同期の作成&ポーリング型ワークフロー |
ByteDance モデルの強み
- 合計 50 のリファレンスにより、多数のキャラクター、複数ロケーション、ブランド、プロップ、ボイス、動きの制約に対応しやすい。
- タイムスタンプ単位の変更で、特定のビート・アクション・効果音・カメラ区間のみを改稿でき、動画全体を使い捨てのドラフトとして扱わずに済む。
- グリーンスクリーンとクレイレンダーのワークフローが、生成動画を従来のプリビズや合成作業に接続。
- 複数ラウンドの継続で、初回の 30 秒を超えて一貫した映像・音声言語を拡張する設計。
Wan 3.0 vs Seedance 2.5: ベンチマーク結果
ベンチマークのルール: 同一のリーダーボード、タスク、音声モード、投票方法で生成された結果のみが直接比較可能。ベンダーデモや旧モデルのスコアは参考にはなるが、欠落した正面対決の代替にはならない。
現在の Artificial Analysis Text to Video Leaderboard では、Alibaba モデルが音声有りアリーナで Elo 1,241/95% 信頼区間 ±9/ブラインド比較 6,195 サンプルで首位。同評価者は、音声有りの動画編集でも Elo 1,189/±7/5,231 サンプルで首位としている。
ByteDance のリリースはこれら 2 つの表に未掲載。Artificial Analysis には旧 Seedance 世代の記載はあるが、それを新モデルの代表と見なすのは方法論的に不適切。したがって最も公平な結論は、Alibaba が現時点でより強い独立エビデンスを持つということであり、ByteDance が独立に劣っていると証明されたわけではない。

出典: Artificial Analysis Text to Video Leaderboard
| エビデンスタイプ | Alibaba モデル | ByteDance モデル | 解釈 |
|---|---|---|---|
| 音声付き text-to-video | 1,241 Elo;順位 #1;±9;6,195 サンプル | 未掲載 | 独立の直接比較は不可能 |
| 音声付き動画編集 | 1,189 Elo;順位 #1;±7;5,231 サンプル | 未掲載 | 独立の直接比較は不可能 |
| 公式の定性エビデンス | 現実級のレンダリング、長尺の一貫性、オムニ参照 | 長編ストーリーテリング、密度の高い参照制御、タイムスタンプ編集 | 異なるデモと主張であり、直接スコア化はされていない |
Wan 3.0 vs Seedance 2.5: 主要な違いの比較
1. 長編ストーリーテリングと時間的一貫性
両モデルとも 1 回で最大 30 秒を生成可能。公式の Wan 3.0 API 範囲は 2~30 秒、BytePlus 公式 API ドキュメントは Seedance 2.5 について 4~30 秒を明記。現行の CometAPI Seedance ルートも 4~30 秒を記載。したがって、このルート群では Wan が 2~3 秒のショットに対応するオプションとして文書化されている。Alibaba は、多様なソース素材を 1 本のクリップに取り込んで一貫出力にまとめるリクエストに強い。ByteDance は、30 秒内に計画的なナラティブアークや複数の連結ショットを含め、その後の継続でキャラクター・背景・テンポ・音を一貫させたい場合に強い。
結論: 自己完結のマルチモーダル制作なら Alibaba、連作や複数ラウンドのナラティブ構築なら ByteDance。
2. 画質・動き・物理的な尤度
Alibaba は、ブラインド好み投票の音声付き T2V アリーナで先行しているため、公開品質シグナルがより明確。製品資料でも、顔や微細表情、プロダクト細部、テキスト、空間レイアウト、物理的相互作用を強調。ByteDance は、滑らかな遷移、カットを跨ぐ被写体の安定、より写実的な質感とライティング、クレイレンダー参照に従う動きを強調する。
結論: 一般的な視覚的好みでは Alibaba がエビデンス主導の初期検証対象。ブロッキングやカメラ演出、プリビズ資産から計画したシーンでは ByteDance が有力。
3. 参照制御とキャラクター一貫性
Wan 3.0 は参照画像 10、参照動画 5、参照音声 5、加えて対応ドキュメント 1 件または公開ウェブページ 1 件を受け付ける。Seedance 2.5 はより大きい通常の参照上限(画像 30、動画 10、音声 10)に対応する一方、公式資料にはドキュメントやウェブページのネイティブ参照入力は記載されていない。キャスト、複数環境、製品バリアント、衣装、小道具、音声サンプル、カメラ参照、動きの例などを含むブリーフでは、この高い通常参照上限が効く。
結論: リファレンス密度では ByteDance、リファレンスの幅では Alibaba。
4. ネイティブ音声・セリフ・サウンドデザイン
いずれも画像と共に音を生成し、別の吹き替え工程を不要とする。Alibaba はセリフ、BGM、効果音を明記。ByteDance は統合された音声・映像アーキテクチャを基盤に、音声参照、ボイス一貫性、狙い撃ちの視聴覚編集をサポート。
結論: 仕様レベルでは拮抗。同一スクリプトで、セリフの明瞭度、リップシンク、話者同一性、BGM の安定性、効果音タイミングを比較検証すべき。
5. 編集と反復
Alibaba は自然言語編集、延長、フレーム条件付けワークフローをオールインワンモデル内でカバー。ByteDance は編集器寄りのワークフローを深化させ、プロンプトで特定タイムスタンプを狙い、グリーンスクリーン置換、カメラ視点調整、キャラクター/アクション/プロット/音声の改稿を周辺の連続性を保ちつつ実行できる。
結論: 緻密なクリエイティブ改稿の制御面では ByteDance が優勢、シンプルな統合パイプラインでは Alibaba が優位。
6. ドキュメント、ウェブページ、ビジネスコンテンツ
ここは Alibaba の明確な優位点。PDF、プレゼン、スプレッドシート、テキスト、Apple 仕事系ファイル、Markdown、ウェブページが、解説、製品動画、トレーニング、エグゼクティブサマリーのソースになり得る。ByteDance の公開モデル概要は、テキスト・画像・動画・音声に重点で、ドキュメント解析は中心ではない。
結論: ドキュメント→動画、ウェブ→動画、企業ナレッジ、自動コンテンツ再利用のパイプラインなら Alibaba。
7. 解像度と納品ワークフロー
Alibaba は 480p/720p/1080p ルートを文書化。これにより、480p で反復、720p でレビュー、承認ショットは 1080p といった明確な梯子を組める。CometAPI は現時点で ByteDance ルートの価格に 480p と 720p を記載。ByteDance 公式ローンチ記事には、ルート別の解像度表は同等には示されていない。
結論: 高解像度納品のルートは Alibaba の方が明確。解像度を堅い製品約束にする前に、ByteDance のアクティブルートを確認すべき。
価格比較
公開中の CometAPI モデルカードでは、Alibaba は生成 1 秒あたり $0.04、ByteDance は $0.0824 の開始価格を表示。詳細価格セクションでは上流ルート価格も示され、Alibaba は 480p/720p/1080p で $0.05/$0.10/$0.20、ByteDance は 480p/720p で $0.103/$0.231 を掲示。モデルページとルート割引は独立して変わり得るため、見積は送信時に選択する正確なルートで行うべき。
| コスト項目 | Wan 3.0 | Seedance 2.5 | 注記 |
|---|---|---|---|
| CometAPI 表示の開始価格 | $0.04/s | $0.0824/s | 表示フロアで Alibaba は約 51% 低い |
| 開始価格での 10 秒クリップ | $0.40 | $0.824 | リトライ前 |
| 開始価格での 30 秒クリップ | $1.20 | $2.472 | リトライ前 |
| 公開 480p ルート価格 | $0.05/s | $0.103/s | 上流/掲載ルート |
| 公開 720p ルート価格 | $0.10/s | $0.231/s | 上流/掲載ルート |
| 公開 1080p ルート価格 | $0.20/s | 現行 CometAPI 表に未掲載 | ルートの提供状況を確認 |
本番コストの原則: 秒単価ではなく、受理クリップあたりのコストで比較。却下出力、リトライ、アップスケーリング、保管、編集時間、公開可能にするための人的レビューも含める。
Wan 3.0 vs Seedance 2.5: 強みとトレードオフ
| モデル | 強み | トレードオフ |
|---|---|---|
| Alibaba モデル | 独立 T2V(音声付き)首位のシグナル;編集でも首位;ドキュメント/ウェブ入力;1080p;開始価格が低い;統合ワークフロー | 参照合計 20 の上限;ホスト型で重みは非公開;長尺では依然漂流の可能性;音声/テキストはポスプロが必要な場合あり |
| ByteDance モデル | 50 参照;複数ラウンド延長;タイムスタンプ編集;グリーンスクリーン;カメラ編集;クレイレンダーによるプリビズ | 同一世代の独立 Elo は未掲載;現行 CometAPI の解像度表は 720p まで;公式資料は複雑運動と複数被写体の限界を認めている |
どちらを選ぶべきか?
| ユースケース | 初手の選択 | 理由 |
|---|---|---|
| 新しい動画機能のデフォルト | Alibaba モデル | 独立エビデンスが強く、開始価格が低い |
| 30 秒のプロダクト CM | Alibaba モデル | ドキュメント/製品入力、1080p ルート、低い反復コスト |
| PDF/ウェブ→解説動画 | Alibaba モデル | ネイティブなドキュメント/ウェブ解析 |
| 参照多用のブランドキャンペーン | ByteDance モデル | 最大 50 のクリエイティブ参照 |
| 複数キャラの短編ドラマ | ByteDance モデル | ナラティブ継続、密度の高い参照、延長 |
| 特定時間帯の精密改稿 | ByteDance モデル | タイムスタンプ単位の視聴覚編集 |
| グリーンスクリーン/クレイレンダー系 | ByteDance モデル | プロ用途の制作制御が明示 |
| エビデンス主導の品質ベンチマーク | Alibaba モデル | 現行のブラインド好み/編集でのリーダーシップ |
| 最終的な配備判断 | 両方テスト | 同一の資産・尺・評価軸・合格基準で比較 |
公平な A/B テストの方法
- プロダクトショット、会話、複数キャラ、カメラモーション、物理、テキスト/UI、参照多用生成をカバーする 20~40 プロンプトを用意。
- 両ルートが同等設定をサポートする範囲で、尺・解像度・アスペクト比・音声要否・ソース資産を揃える。
- レビュワーにはモデル名を秘匿し、画質、プロンプト順守、被写体一貫性、動き、音声タイミング、セリフ品質、編集工数を個別採点。
- 成功出力だけでなく、失敗、リトライ、安全性リジェクト、生成レイテンシ、ポスプロ時間も記録。
- 普遍的な勝者を決めるのではなく、ワークロードごとに「受理クリップあたりのコスト」が最も低いルートを選択。
CometAPI で両モデルへアクセスする方法
両ルートは CometAPI から利用可能。単一のアカウント・API キー・課金レイヤー・非同期の動画ライフサイクルで、異なるプロバイダを評価できる。現行の顧客向けモデル ID は wan3.0 と seedance-2-5。
- アカウントを作成し、API キーを生成。サーバー側の環境変数に保管。
- 動画 API ドキュメントを開き、選択ルートでサポートされる正確なフィールドを確認。
- POST /v1/videos を送信し、返却された動画タスク ID を保存。タスクが終端状態になるまで GET /v1/videos/{id} をポーリング。
- 完了アセットをダウンロードし、モデル ID、ルート、尺、解像度、レイテンシ、価格、レビュー結果を併せて保存。
言語: Bash
export COMETAPI_KEY="your_api_key"
curl -X POST "https://api.cometapi.com/v1/videos" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-F 'model=wan3.0' \
-F 'prompt=同期した環境音とともにシネマティックな製品リビール。' \
-F 'seconds=10' \
-F 'size=1280x720'
# A/Bテスト用に、以下のSeedance向けペイロードを検証して送信:
# -F 'model=seedance-2-5'
すべてのメディアパラメータが、同じエンドポイントという理由だけで相互運用できると仮定しないこと。参照フィールド、対応解像度、編集コントロール、コールバック挙動はルート固有のままの場合がある。運用切替の前に各ペイロードを検証すること。
Wan 3.0 vs Seedance 2.5: 制約と注意点
- 独立ベンチマークは投票が増えるにつれ変動。Elo は相対的な嗜好シグナルであり、プロンプト厳密遵守や商用適性の絶対指標ではない。
- 現行の独立フレームワークに ByteDance スコアがないため、統計的に防御可能な直接品質ランキングはできない。
- 公式デモは吟味されたプロンプトと資産を使用。実地結果は被写体の複雑さ、安全フィルタ、言語、アスペクト比、参照品質で変わり得る。
- ByteDance のローンチ投稿自身が、複雑運動の物理的尤度や複数被写体の相互作用安定性に改善余地を認めている。
- Alibaba も長尺ではアイデンティティ漂流、物体変形、テキスト誤り、音声欠陥が出る可能性はある。30 秒は容量上限であって品質保証ではない。
- 価格とルート提供は変動し得る。固定価格の発表や単価設計の確定前に、CometAPI のライブモデルページを再確認すべき。
結論
最も防御可能な答えはワークロード別。Alibaba は現在、ブラインド好み投票の首位、編集の首位、ドキュメントとウェブ入力、文書化された 1080p ルート、低い表示開始価格という、デフォルトとして強いパッケージを提供。プロダクト動画、解説、ビジネスコンテンツの自動変換、汎用 API 導入の第一候補。
ByteDance は、より専門的なクリエイティブ制御のシステム。50 参照上限、複数ラウンド継続、タイムスタンプ単位の変更、グリーンスクリーン、カメラ編集、クレイレンダーのプリビズは、プロのストーリー構築と精密な反復が合格基準である場合、未整備のベンチマークを上回る価値を持ち得る。
本番では見出しだけで決めない。同一ブリーフを両モデルに通し、初回出力ではなく受理出力で比較し、必要な品質をより少ないリトライと編集で満たす方へジョブを振り分けること。
よくある質問(FAQs)
Wan 3.0 は Seedance 2.5 より良いのか?
Alibaba は現時点で、独立ベンチマークのエビデンスが強く、ビジネス入力の幅も広い。ByteDance は密度の高い参照、長編の継続、精密なクリエイティブ編集では優位になり得る。同一フレームワークでの直接 Elo 比較はまだない。
どちらが安い?
現行の CometAPI ページでは、Alibaba が 1 秒あたり $0.04、ByteDance が $0.0824 の開始価格を表示。最終コストはルート、解像度、リトライ、合格率に依存。
参照はどちらが多く扱える?
Seedance 2.5 は通常参照の上限が大きく、画像最大 30、動画 10、音声 10。Wan 3.0 は画像 10、動画 5、音声 5 に加え、対応ドキュメント 1 件または公開ウェブページ 1 件を利用可能。
動画編集に向いているのは?
Alibaba は独立の音声付き動画編集アリーナで現状首位。ByteDance はタイムスタンプ編集、グリーンスクリーン、カメラ視点変更、参照ベース編集など、より粒度の細かい制作ワークフローを文書化。好み品質を重視するか、制御の深さを重視するかで最適は変わる。
両モデルはネイティブ音声を生成できる?
はい。どちらも同期した音声と動画の生成を設計している。自分のプロンプトで、セリフ明瞭度、リップシンク、効果音、音楽安定性、声の一貫性を評価すべき。
1 つの API キーで両方にアクセスできる?
はい。どちらも現時点で CometAPI に掲載され、非同期の動画生成ワークフローを共有。ただし有効なリクエストフィールドはルートごとに要確認。
