Veo 3.1 の技術仕様
| 項目 | Veo 3.1(公開仕様) |
|---|---|
| 公式モデル ID | veo-3.1-generate-001 |
| 提供元 | Google DeepMind / Google Cloud |
| モデルタイプ | テキストから動画、画像から動画の生成 |
| 入力タイプ | テキストプロンプト、画像入力、ファーストフレーム+ラストフレームのガイダンス |
| 出力タイプ | AI 生成動画 |
| 対応解像度 | 720p および 1080p、4K |
| 対応アスペクト比 | 16:9 および 9:16 |
| 対応フレームレート | 24 FPS |
| 動画の長さ | 4s、6s、または 8s のクリップ(モード依存) |
| プロンプト言語 | 英語 |
| 1 リクエストあたりの動画数 | 最大 4 |
| API レート制限 | プロジェクトあたり毎分最大 50 リクエスト |
| 対応デプロイ先 | Vertex AI、Gemini エコシステム統合、Flow |
| 非対応機能(公式ドキュメント) | ダイナミック共有クォータ、一部の参照画像ワークフロー、標準 API フローにおけるネイティブな動画延長 |
Veo 3.1 とは?
Veo 3.1 は、映画品質の動画合成、より強固なプロンプト遵守、シーンの一貫性の向上、マルチモーダルな動画制作ワークフローに焦点を当てた Google のフラッグシップ生成動画モデルファミリーです。テキストから動画の生成を超えて、画像ガイド生成やフレーム制御ストーリーテリングのワークフローをサポートします。公式には、テキストから動画、画像から動画、プロンプトのリライト、ファースト/ラストフレーム生成ワークフローがサポートされています。
主要機能
Veo 3.1 は実用的なコンテンツ制作機能に注力しています:
- ネイティブ音声生成(セリフ、環境音、SFX)を出力に統合。Veo 3.1 は視覚的タイムラインに同期したネイティブ音声(セリフ+アンビエンス+SFX)を生成し、セリフのリップシンクやシーンのキューに対する音声–映像の整合を目指します。
- より長い出力(最大約 60 秒 / 1080p に対応。Veo 3 の非常に短いクリップ[8s]と比較)と、物語の連続性のためのマルチプロンプトによるマルチショットシーケンス。
- Scene Extension と First/Last Frame モードにより、キーフレーム間のフッテージを延長または補間。
- Flow 内でのオブジェクト挿入と(今後対応予定の)オブジェクト削除、および編集プリミティブ。
上記の各ポイントは手動の VFX 作業を減らすために設計されています。音声とシーンの連続性が後付けでなく、第一級の出力になりました。
技術的詳細(モデルの挙動と入力)
モデルファミリーとバリアント: Veo は Google の Veo-3 ファミリーに属します。プレビューのモデル ID は一般に veo3.1-pro、veo3.1(CometAPI ドキュメント)です。入力としてテキストプロンプト、画像参照(単一フレームまたはシーケンス)、およびマルチショット生成のための構造化マルチプロンプトレイアウトを受け付けます。
解像度と長さ: プレビューのドキュメントでは、出力は720p/1080p、一部のプレビュー設定では(より高い忠実度で)約 60 秒までの長尺に対応すると記載されています。
アスペクト比: 16:9(対応)および 9:16(一部の参照画像フローを除き対応)。
プロンプト言語: 英語(プレビュー)。
API 制限: 代表的なプレビュー制限には、プロジェクトあたり毎分最大 10 API リクエスト、1 リクエストあたり最大 4 本の動画、および動画長(4、6、8 秒から選択。参照画像フローは 8s をサポート)が含まれます。
ベンチマーク性能
Google の社内評価および公開要約では、テキスト整合性、視覚品質、音声–映像の一貫性(テキスト→動画および画像→動画のタスク)といった指標で、Veo 3.1 の出力が人手評価の比較において強く好まれることが報告されています。
Veo 3.1 は、MovieGenBench や VBench といったベンチマークデータセット上で、全体的な嗜好、プロンプト整合性(テキスト→動画および画像→動画)、視覚品質、音声–映像の整合、そして「視覚的にもっともらしい物理挙動」といった複数の客観軸における社内の人手評価比較で、最先端の結果を達成しました。
制限事項と安全性に関する考慮
制限事項:
- アーティファクトと不一致: 改善はあるものの、特定のライティング、細粒度の物理挙動、複雑な遮蔽では依然としてアーティファクトが生じる可能性があります。画像→動画の一貫性(特に長尺)は改善されていますが完璧ではありません。
- 誤情報/ディープフェイクのリスク: よりリッチな音声とオブジェクト挿入/削除により、不正使用のリスク(リアルな偽音声や長尺クリップ)が高まります。Google は緩和策(ポリシー、セーフガード)に言及し、過去の Veo リリースでは来歴証跡のためのウォーターマーキング/SynthID を参照していましたが、技術的なセーフガードだけで不正使用リスクを完全には排除できません。
- コストとスループットの制約: 高解像度・長尺動画は計算コストが高く、現在は有償プレビューでゲートされています—画像モデルと比べてレイテンシとコストが高くなることが想定されます。コミュニティの投稿や Google フォーラムのスレッドでは、提供時間枠やフォールバック戦略が議論されています。
安全対策: Veo 3.1 は統合されたコンテンツポリシー、(過去の Veo リリースでの)ウォーターマーキング/SynthID シグナリング、そしてプレビューアクセス制御を備えています。ユーザーにはプラットフォームポリシーの遵守と、高リスク出力に対する人手レビューの実施が推奨されます。
実用的なユースケース
- クリエイターの迅速なプロトタイピング: 絵コンテ → マルチショットのクリップやアニマティクスを、初期レビュー用のネイティブなセリフ付きで。
- マーケティング & ショートフォーム: 15–60 秒のプロダクトスポット、ソーシャルクリップ、コンセプトティーザーなど、完璧なフォトリアリズムよりもスピードが重要な場面。
- 画像→動画の適用: イラストやキャラクター、2 枚のフレームを用いて、First/Last Frame や Scene Extension によりスムーズなトランジションやアニメーションシーンへ。
- ツール支援: Flow に統合された反復編集(オブジェクト挿入/削除、ライティングプリセット)により、手動の VFX パスを削減。
他の主要モデルとの比較
Veo 3.1 vs Veo 3(前モデル): Veo 3.1 はプロンプト遵守の改善、音声品質、マルチショットの一貫性に焦点を当てています—アーティファクトの削減と編集容易性の向上を狙った、段階的ながら実用的なアップデートです。
Veo 3.1 vs OpenAI Sora 2: プレスで報じられるトレードオフとして、Veo 3.1 は長尺のナラティブ制御、統合音声、Flow 編集統合を重視。Sora 2(プレスでの比較時)は異なる強み(スピードや別の編集パイプライン)にフォーカスしています。独立した並走テストはまだ限定的です。
| 機能 | Veo 3.1 | Sora 2 | Runway Gen-4 / Gen-4.5 |
|---|---|---|---|
| ネイティブな縦長出力 | 対応 | 限定的なワークフロー対応 | 対応 |
| 画像から動画 | 対応 | 対応 | 対応 |
| 音声統合の重視度 | 強い | 中程度 | 中程度 |
| フレーム条件付け | 対応 | 対応 | 部分的 |
| ソーシャル動画向け最適化 | 強い | 中程度 | 強い |
| API エコシステム統合 | Google エコシステム | OpenAI エコシステム | クリエイターツールのエコシステム |
CometAPI で Veo 3.1 API を使うには?
- CometAPI の API キーを作成する
- モデルエンドポイントとして
veo-3.1-generate-001を選択する - 動画生成 API を通じてプロンプトまたは画像入力を送信する
- 結果をポーリングし、生成された動画を取得する
- カメラワーク、シーンの連続性、一貫性の向上に向けてプロンプトを反復する