コアの機能と能力
- 8秒のビデオクリップ: シームレスなショット切り替えとステッチにより、最長8秒のシーケンスを生成します。
- 統合オーディオ生成: セリフ、環境音、効果音、BGMを単一パスで生成します。
- 高精細出力: 4K (3840 × 2160) までの解像度に対応し、均一な照明、現実的な物理、詳細なシーンテクスチャを実現します。
- マルチモーダル入力: テキストから動画と画像から動画の両方のプロンプトを受け付け、柔軟なクリエイティブワークフローを可能にします。
これらの機能により、クリエイターは別途のオーディオポストプロダクションや複雑な編集パイプラインなしで、映画に近いナラティブを構築できます。
技術詳細
Veo 3 のアーキテクチャは、数百万本の YouTube 動画で訓練されたマルチモーダル Transformerを活用します。そのエンコーダ–デコーダ フレームワークは、動画トークナイズ層を介してテキストプロンプトを処理し、視覚合成モジュールを駆動する時空間特徴量を生成します。同時に、音声合成ブランチが整合した音声出力を生成します。クロスモーダル アテンション機構により、視覚と音声のモダリティが強く結合された状態を保ち、同期ずれのアーティファクトを低減します。学習には数十億回のパラメータ更新が含まれ、Google Cloud のVertex AIプラットフォーム上の混合精度 GPU クラスタで最適化されました。
ベンチマーク性能
社内ベンチマークにおいて、Veo 3 は次のとおりです:
- PSNR(ピーク信号対雑音比): 標準的な動画データセットで 38 dB、Veo 2 を 4 dB上回ります。
- SSIM(構造的類似度指数)スコア 0.92、高い視覚忠実度を示します。
- Audio–Video Sync Error は 15 ms未満で、音と動きの遅延が知覚できない水準を確保します。
- 推論速度: NVIDIA A100 GPU 上で ~12 frames per second、短尺クリップのほぼリアルタイム生成を可能にします。
これらの指標により、Veo 3 は生成系ビデオ AI の最前線に位置づけられ、品質と同期性の両面で Sora や Meta の近年のビデオモデルを凌駕します。 - Veo 3 API へのアクセス方法
ステップ 1: API キーにサインアップ
cometapi.com にログインします。まだ当社のユーザーでない場合は、まず登録してください。ご自身のCometAPI コンソールにサインインします。インターフェースのアクセス認証 API キーを取得します。個人センターの API トークンで“Add Token”をクリックし、トークンキー: sk-xxxxx を取得して送信します。
ステップ 2: Veo 3 API にリクエストを送信
API リクエストを送信するために “\Veo 3 \” エンドポイントを選択し、リクエストボディを設定します。リクエストメソッドとリクエストボディは当社ウェブサイトの API ドキュメントから取得できます。利便性のため、当社ウェブサイトでは Apifox のテストも提供しています。<YOUR_API_KEY> をアカウントの実際の CometAPI キーに置き換えます。ベース URL は Veo3 Async Generation(https://api.cometapi.com/v1/videos) です。
content フィールドに質問または要求を挿入します—モデルが応答するのはこの内容です。API レスポンスを処理して生成結果を取得します。
ステップ 3: 結果の取得と検証
API レスポンスを処理して生成結果を取得します。処理後、API はタスクのステータスと出力データを返します。