Veo 3.1 の技術仕様
| 項目 | Veo 3.1(公開仕様) |
|---|---|
| 公式モデル ID | veo-3.1-generate-001 |
| プロバイダ | Google DeepMind / Google Cloud |
| モデルタイプ | テキストから動画、画像から動画の生成 |
| 入力タイプ | テキストプロンプト、画像入力、先頭フレーム + 最終フレームのガイダンス |
| 出力タイプ | AI 生成動画 |
| 対応解像度 | 720p と 1080p、4K |
| 対応アスペクト比 | 16:9 および 9:16 |
| 対応フレームレート | 24 FPS |
| 動画の長さ | 4 秒、6 秒、または 8 秒のクリップ(モード依存) |
| プロンプト言語 | 英語 |
| リクエストあたりの動画数 | 最大 4 本 |
| API レート制限 | プロジェクトあたり毎分最大 50 リクエスト |
| 対応デプロイ | Vertex AI、Gemini エコシステム統合、Flow |
| 非対応機能(公式ドキュメント) | 動的な共有クォータ、一部の参照画像ワークフロー、標準 API フローでのネイティブなビデオ拡張 |
Veo 3.1 とは?
Veo 3.1 は、シネマティック品質の動画合成、プロンプト遵守性の強化、シーン一貫性、そしてマルチモーダルな動画制作ワークフローに焦点を当てた Google のフラッグシップ生成動画モデルファミリーです。テキストから動画の生成にとどまらず、画像ガイド生成やフレーム制御型のストーリーテリング ワークフローをサポートします。公式には、テキストから動画、画像から動画、プロンプト書き換え、First/Last Frame 生成ワークフローがサポートされています。
コア機能
Veo 3.1 は実用的なコンテンツ制作機能に注力しています:
- 出力に統合されたネイティブ音声生成(セリフ、環境音、効果音)。Veo 3.1 は、セリフ + アンビエンス + SFX のネイティブ音声を映像タイムラインに合わせて生成し、セリフのリップシンクと音声・映像の整合を維持することを目指します。
- より長い出力(Veo 3 の非常に短いクリップ(8 秒)に対して、1080p で最大約 60 秒に対応)と、物語の連続性のための複数プロンプトによるマルチショットシーケンス。
- キーフレーム間のフッテージを拡張または補間する Scene Extension と First/Last Frame モード。
- Flow 内でのオブジェクト挿入と(今後対応予定の)オブジェクト削除、および編集用プリミティブ。
上記の各機能は手動の VFX 作業を減らすために設計されています。音声とシーンの連続性が、付加要素ではなく第一級の出力になりました。
技術的詳細(モデル動作と入力)
モデルファミリーとバリアント: Veo は Google の Veo-3 ファミリーに属します。プレビューのモデル ID は一般に veo3.1-pro; veo3.1(CometAPI ドキュメント)。入力としては、テキストプロンプト、画像参照(単一フレームまたはシーケンス)、およびマルチショット生成のための構造化されたマルチプロンプトレイアウトを受け付けます。
解像度と長さ: プレビュードキュメントでは、720p/1080p の出力、特定のプレビュー設定で最大約 60 秒までの長尺、そして以前の Veo バリアントより高い忠実度が記載されています。
アスペクト比: 16:9(対応)および 9:16(一部の参照画像フローを除き対応)。
プロンプト言語: 英語(プレビュー)。
API 制限: 典型的なプレビュー制限として、プロジェクトあたり毎分最大 10 API リクエスト、リクエストあたり最大 4 本の動画、および動画の長さは 4/6/8 秒から選択(参照画像フローは 8 秒に対応)などが含まれます。
ベンチマーク性能
Google の内部評価および公開概要では、テキスト整合性、映像品質、音声・映像の一貫性(テキスト→動画および画像→動画タスク)などの指標において、人間評価者の比較で Veo 3.1 の出力が強く支持されると報告されています。
Veo 3.1 は、MovieGenBench や VBench といったベンチマークデータセット上で、総合的嗜好、プロンプト整合(テキスト→動画および画像→動画)、映像品質、音声・映像の整合、そして「視覚的に現実的な物理」といった複数の客観軸において、内部の人間評価比較で最先端の結果を達成しました。
制約と安全性に関する考慮事項
制約:
- アーティファクトと不整合: 改善があるものの、特定のライティング、微細な物理、複雑な遮蔽では依然としてアーティファクトが発生する可能性があります。画像→動画の一貫性(特に長尺)も改善していますが完璧ではありません。
- ミスインフォメーション/ディープフェイクのリスク: より豊かな音声とオブジェクト挿入/削除により、悪用のリスク(現実的な偽音声や延長クリップ)が高まります。Google は(ポリシーやセーフガードなどの)緩和策に言及しており、以前の Veo ではプロビナンス支援のためのウォーターマーク/SynthID が参照されましたが、技術的セーフガードだけで悪用リスクを完全には排除できません。
- コストとスループット制約: 高解像度・長尺動画は計算コストが高く、現在は有料プレビューで制限されています。画像モデルと比べてレイテンシとコストが高くなることが予想されます。コミュニティ投稿や Google フォーラムでは、提供時間帯やフォールバック戦略について議論されています。
安全管理: Veo 3.1 には統合されたコンテンツポリシー、以前の Veo リリースでのウォーターマーク/SynthID シグナリング、プレビューアクセス制御が含まれます。ユーザーには、プラットフォームポリシーの遵守と高リスク出力に対する人的レビューの実施が推奨されます。
実用的なユースケース
- クリエイターの迅速なプロトタイピング: 絵コンテ → マルチショットのクリップやアニマティクスにネイティブなセリフを付与し、早期クリエイティブレビューを可能に。
- マーケティング/短尺コンテンツ: 15~60 秒のプロダクトスポット、ソーシャルクリップ、コンセプトティーザーなど、完全なフォトリアリズムよりスピードを重視する用途。
- 画像→動画の適用: First/Last Frame や Scene Extension により、イラストやキャラクター、2 枚のフレームを滑らかなトランジションやアニメーションシーンへ。
- ツール補強: Flow に統合され、反復編集(オブジェクト挿入/削除、ライティングプリセット)により手動の VFX 工程を削減。
他の主要モデルとの比較
Veo 3.1 と Veo 3(前モデル)の比較: Veo 3.1 は、プロンプト遵守性の改善、音声品質、マルチショット一貫性に注力しています。アーティファクト低減と編集容易性の向上を狙った、漸進的ながら実用的な更新です。
Veo 3.1 と OpenAI Sora 2 の比較: メディア報道でのトレードオフとして、Veo 3.1 は長尺の物語制御、統合音声、Flow での編集統合を強調しています。Sora 2(報道比較時)は異なる強み(スピード、異なる編集パイプライン)に注力。TechRadar などでは、長尺動画とナラティブ対応における Google の Sora 2 対抗モデルとして Veo 3.1 を位置付けています。独立した並行比較テストはまだ限定的です。
| 機能 | Veo 3.1 | Sora 2 | Runway Gen-4 / Gen-4.5 |
|---|---|---|---|
| ネイティブな縦向き出力 | はい | 限定的なワークフロー対応 | はい |
| 画像から動画 | はい | はい | はい |
| 音声統合の重視 | 強い | 中程度 | 中程度 |
| フレーム条件付け | はい | はい | 部分的 |
| ソーシャル動画最適化 | 強い | 中程度 | 強い |
| API エコシステム統合 | Google エコシステム | OpenAI エコシステム | クリエイターツール エコシステム |
CometAPI で Veo 3.1 API を使うには?
- CometAPI の API キーを作成する
- モデルエンドポイントとして
veo-3.1-generate-001を選択する - 動画生成 API を通じてプロンプトまたは画像入力を送信する
- 結果をポーリングし、生成された動画を取得する
- カメラワーク、シーンの連続性、一貫性の改善のためにプロンプトを反復調整する