Veo 3.1 的技術規格
| 項目 | Veo 3.1(公開規格) |
|---|---|
| Official model ID | veo-3.1-generate-001 |
| Provider | Google DeepMind / Google Cloud |
| Model type | 文字轉影片與圖片轉影片生成 |
| Input types | 文字提示、圖片輸入、首幀 + 末幀引導 |
| Output type | AI 生成影片 |
| Supported resolutions | 720p 與 1080p,4K |
| Supported aspect ratios | 16:9 與 9:16 |
| Supported framerate | 24 FPS |
| Video duration | 4 秒、6 秒或 8 秒片段(取決於模式) |
| Prompt language | 英文 |
| Videos per request | 最多 4 部 |
| API rate limit | 每個專案每分鐘最多 50 次請求 |
| Supported deployment | Vertex AI、Gemini 生態系整合、Flow |
| Unsupported features (official docs) | 動態共享配額、部分參考圖片工作流程、標準 API 流程中的原生影片延伸 |
什麼是 Veo 3.1?
Veo 3.1 是 Google 的旗艦生成式影片模型家族,專注於電影級影片合成、更強的提示遵從、更好的場景一致性,以及多模態影片創作工作流程。它超越標準的文字轉影片生成功能,支援以圖片為引導的生成與幀控制的敘事工作流程。官方支援包括文字轉影片、圖片轉影片、提示改寫,以及首/末幀生成工作流程。
核心功能
Veo 3.1 聚焦於實用的內容創作功能:
- 原生音訊生成(對話、環境音、音效)整合於輸出。Veo 3.1 產生與視覺時間線對齊的原生音訊(對話 + 氛圍 + 音效);模型旨在維持口型同步與對話及場景提示的聲畫對齊。
- 更長的輸出(相較於 Veo 3 的超短片段,8s,Veo 3.1 在 1080p 下支援最長約 60 秒),以及多提示的多鏡頭序列以維持敘事連貫性。
- Scene Extension 與 First/Last Frame 模式,可在關鍵幀之間延伸或插值素材。
- Flow 內的物件插入與(即將推出的)物件移除,以及基本編輯操作。
以上每點都旨在減少手動 VFX 工作:音訊與場景連貫性如今是核心輸出,而非事後補足。
技術細節(模型行為與輸入)
**Model family & variants:**Veo 隸屬於 Google 的 Veo-3 系列;預覽模型 ID 通常為 veo3.1-pro;veo3.1(CometAPI 文件)。它接受文字提示、圖片參考(單幀或序列),以及用於多鏡頭生成的結構化多提示佈局。
**Resolution & duration:**預覽文件描述輸出為 720p/1080p,在某些預覽設定下可選更長時長(最長約 60 秒),且相較早期 Veo 變體具有更高保真度。
Aspect ratios: 16:9(支援)與 9:16(支援,但在某些參考圖片流程中例外)。
**Prompt language:**英文(預覽)。
API limits:典型的預覽限制包括每個專案每分鐘最多 10 次 API 請求、每次請求最多 4 段影片,以及影片長度可在4、6 或 8 秒之間選擇(參考圖片流程支援 8 秒)。
基準表現
Google 的內部與對外彙總評估顯示,在文字對齊、視覺品質、聲畫一致性(文字→影片與圖片→影片任務)等指標的人類評審對比中,Veo 3.1 的輸出獲得強烈偏好。
在多個客觀面向的人類評審對比中,Veo 3.1 達到最先進結果——整體偏好、提示對齊(文字→影片與圖片→影片)、視覺品質、影音對齊,以及在 MovieGenBench 與 VBench 等基準資料集上的「視覺上逼真的物理效果」。
限制與安全考量
限制:
- **偽影與不一致性:**儘管已有改進,某些光照、細微物理與複雜遮擋仍可能產生偽影;圖片→影片的一致性(尤其長時長)有所改善但仍非完美。
- **錯誤資訊/深偽風險:**更豐富的音訊與物件插入/移除提高濫用風險(擬真假音訊與延長片段)。Google 指出有相應的緩解措施(政策、保護機制),先前 Veo 發佈曾提到浮水印/SynthID 以協助來源溯源;然而技術防護無法完全消除濫用風險。
- **成本與吞吐量限制:**高解析度、長影片計算成本高,目前在付費預覽中管控——相較影像模型,預期延遲與成本更高。社群貼文與 Google 論壇討論串提及可用時間窗與回退策略。
**安全控管:**Veo 3.1 內建內容政策、先前 Veo 版本中的浮水印/SynthID 標記,以及預覽存取控管;建議客戶遵循平台政策,對高風險輸出實施人工審核。
實際用例
- 創意快速原型:分鏡 → 多鏡頭片段與動畫預覽,含原生對話,便於早期創意評審。
- **行銷與短影音:**15–60 秒產品短片、社群短片與概念預告,速度比極致寫實更重要的情境。
- **圖片→影片改編:**透過 First/Last Frame 與 Scene Extension,將插畫、角色或兩個畫面轉為平滑轉場或動畫場景。
- **工具增強:**整合進 Flow 以迭代編輯(物件插入/移除、光照預設),減少手動 VFX 工序。
與其他領先模型的比較
Veo 3.1 vs Veo 3(前代):Veo 3.1 著重於更好的提示遵從、音訊品質與多鏡頭一致性——屬於漸進但影響顯著的更新,旨在減少偽影並提升可編輯性。
Veo 3.1 vs OpenAI Sora 2:媒體報導中的取捨:Veo 3.1 強調較長篇幅的敘事控制、整合音訊與 Flow 編輯整合;Sora 2(媒體對比時)則聚焦於不同長處(速度、不同編輯管線)。TechRadar 等媒體將 Veo 3.1 定位為 Google 面向 Sora 2 的敘事與長影片競品。獨立的並排測試仍然有限。
| 能力 | Veo 3.1 | Sora 2 | Runway Gen-4 / Gen-4.5 |
|---|---|---|---|
| 原生直式輸出 | 是 | 工作流程支援有限 | 是 |
| 圖片轉影片 | 是 | 是 | 是 |
| 音訊整合側重 | 強 | 中等 | 中等 |
| 幀條件化 | 是 | 是 | 部分 |
| 社交影片最佳化 | 強 | 中等 | 強 |
| API 生態系整合 | Google 生態系 | OpenAI 生態系 | 創作者工具生態系 |
如何搭配 CometAPI 使用 Veo 3.1 API?
- 建立 CometAPI API 金鑰
- 選擇 veo-3.1-generate-001 作為模型端點
- 透過影片生成 API 發送提示或圖片輸入
- 輪詢結果並擷取生成影片
- 迭代提示以改進鏡頭運動、場景連貫性與一致性