核心功能與能力
- 8 秒影片片段:可生成長達 8 秒的序列,並具有無縫鏡頭轉場與拼接。
- 整合式音訊生成:一次生成對話、環境噪音、音效與背景音樂。
- 高畫質輸出:支援最高 4K (3840 × 2160) 解析度,具備一致的光照、逼真的物理效果與細緻的場景紋理。
- 多模態輸入:同時支援 文字轉影片 與 影像轉影片 提示,實現多元化的創作流程。
這些能力使創作者無需額外的音訊後期製作或複雜的剪輯流程,即可打造近乎電影級的敘事。
技術細節
Veo 3 的架構採用在 數百萬部 YouTube 影片上訓練的多模態 Transformer。其編碼器–解碼器架構透過影片權杖化層處理文字提示,生成時空特徵以驅動視覺合成模組。同時,音訊合成分支產生對齊的聲音輸出。跨模態注意力機制確保視覺與音訊模態保持緊密耦合,減少不同步偽影。訓練包含數十億次參數更新,並在 Google Cloud 的 Vertex AI 平台上透過混合精度 GPU 叢集進行最佳化。
基準表現
在內部基準測試中,Veo 3 展現:
- 在標準影片資料集上的 PSNR(峰值訊號雜訊比)為 38 dB,比 Veo 2 提升 4 dB。
- SSIM(結構相似度指數)為 0.92,顯示出高度的視覺保真度。
- 音訊–影像同步誤差低於 15 ms,確保聲音與畫面之間的延遲幾乎不可察覺。
- 推論速度:在 NVIDIA A100 GPU 上約為 ~12 幀/秒,可對短片進行近乎即時的生成。
這些指標使 Veo 3 站在生成式影片 AI 的前沿,在品質與同步性兩方面均超越 Sora 與 Meta 的最新影片模型。 - 如何存取 Veo 3 API
步驟 1:註冊取得 API 金鑰
登入 cometapi.com。如非我們用戶,請先註冊。登入你的 CometAPI 控制台。取得該介面的存取憑證 API 金鑰。在個人中心的 API token 中點擊“Add Token”,獲取 token 金鑰:sk-xxxxx 並提交。
步驟 2:向 Veo 3 API 發送請求
選擇 “\Veo 3 \” 端點發送 API 請求並設定請求本文。請求方法與請求本文可從我們網站的 API 文件獲取。我們的網站同時提供 Apifox 測試以供方便使用。將 <YOUR_API_KEY> 替換為你帳戶中的實際 CometAPI 金鑰。base url is Veo3 Async Generation(https://api.cometapi.com/v1/videos)。
將你的問題或請求填入 content 欄位——模型會對該內容做出回應。處理 API 回應以取得生成的結果。
步驟 3:擷取並驗證結果
處理 API 回應以取得生成的結果。處理後,API 會回傳任務狀態與輸出資料。