Veo 3.1 的技術規格
| 項目 | Veo 3.1 (公開規格) |
|---|---|
| 官方模型 ID | veo-3.1-generate-001 |
| 提供方 | Google DeepMind / Google Cloud |
| 模型類型 | 文字轉影片與圖片轉影片生成 |
| 輸入類型 | 文字提示、圖片輸入、首幀 + 末幀引導 |
| 輸出類型 | AI 生成的影片 |
| 支援解析度 | 720p、1080p、4K |
| 支援長寬比 | 16:9 與 9:16 |
| 支援影格率 | 24 FPS |
| 影片時長 | 4s、6s 或 8s 片段 (視模式而定) |
| 提示語言 | 英文 |
| 每次請求的影片數量 | 最多 4 部 |
| API 速率限制 | 每個專案每分鐘最多 50 次請求 |
| 支援的部署 | Vertex AI、Gemini 生態系統整合、Flow |
| 不支援的功能 (官方文件) | 動態共用配額、部分參考圖片工作流程、標準 API 流程中的原生影片延伸 |
什麼是 Veo 3.1?
Veo 3.1 是 Google 旗艦級的生成式影片模型家族,專注於電影級畫質的影片合成、更強的提示遵從、更佳的場景一致性,以及多模態影片創作流程。它超越標準的文字轉影片生成,支援以圖片引導的生成與以畫格控制的敘事工作流程。官方支援包括文字轉影片、圖片轉影片、提示語重寫,以及首/末幀生成等工作流程。
核心功能
Veo 3.1 聚焦於實用的內容創作功能:
- 原生音訊生成(對白、環境音、音效)整合於輸出。Veo 3.1 會生成與視覺時間線對齊的原生音訊(對白 + 氣氛 + 音效);模型旨在維持口型同步與對白、場景提示的音畫對齊。
- 更長的輸出(支援最長約 ~60 秒/1080p,相較於 Veo 3 的非常短片段,8s),以及多提示語的多鏡頭序列以維持敘事連貫性。
- 場景延伸與首/末幀模式,可在關鍵畫格之間延展或插補影像。
- 物件插入與(即將推出的)物件移除,以及 Flow 中的基礎編輯操作。
以上各點均旨在減少手動 VFX 工作:音訊與場景連貫性現在是第一等級的輸出,而非事後補強。
技術細節(模型行為與輸入)
模型家族與變體:Veo 屬於 Google 的 Veo-3 系列;預覽模型 ID 通常為 veo3.1-pro;veo3.1(CometAPI 文件)。它接受文字提示、圖片參考(單幀或序列),以及用於多鏡頭生成的結構化多提示語版面。
解析度與時長:預覽文件描述輸出為720p/1080p,並提供更長時長選項(在部分預覽設定下最長約 ~60s),且相較於早期 Veo 變體具有更高保真度。
長寬比:16:9(支援)與9:16(支援,但在部分參考圖片流程中例外)。
**提示語言:**英文(預覽)。
API 限制:典型的預覽限制包含每個專案每分鐘最多 10 次 API 請求、每次請求最多 4 部影片,以及影片長度可選4、6 或 8 秒(參考圖片流程支援 8s)。
基準表現
Google 的內部與對外匯總評估顯示,在人工評審比較中,Veo 3.1 的輸出在文字對齊、視覺品質,以及音畫一致性等指標上獲得強烈偏好(涵蓋文字→影片與圖片→影片任務)。
Veo 3.1 在多個客觀面向的內部人工評審比較上達到最先進水準——整體偏好、提示對齊(文字→影片與圖片→影片)、視覺品質、音畫對齊,以及在 MovieGenBench 與 VBench 等基準數據集上的「視覺上真實的物理效果」。
限制與安全考量
限制:
- **人工痕跡與不一致:**儘管有所改進,特定光照、細微物理效果與複雜遮擋仍可能產生人工痕跡;圖片→影片的一致性(特別是長時長)已有提升但仍非完美。
- **錯誤資訊/深偽風險:**更豐富的音訊與物件插入/移除提高了誤用風險(擬真假音訊與延長片段)。Google 指出有緩解措施(政策、保護機制),且早期 Veo 發布曾提及用於來源的浮水印/SynthID 以協助溯源;然而技術防護無法消除誤用風險。
- **成本與吞吐限制:**高解析度、長影片計算成本高,當前在付費預覽中設有閘控——相較影像模型,預期延遲與成本更高。社群貼文與 Google 論壇討論了可用時窗與回退策略。
**安全控制:**Veo 3.1 內建內容政策、早期 Veo 版本中的浮水印/SynthID 訊號,以及預覽存取控制;建議客戶遵循平台政策,並對高風險輸出實施人工審查。
實際使用情境
- 創作者的快速原型:分鏡稿 → 多鏡頭片段與動畫樣片,並具備原生對白以供早期創意審閱。
- **行銷與短影音內容:**15–60 秒產品廣告、社群短片與概念預告,速度優先於完美寫實。
- 圖片→影片改編:透過首/末幀與場景延伸,將插畫、角色或兩個畫格轉換成平滑過場或動畫場景。
- **工具增強:**整合進 Flow 以反覆編輯(物件插入/移除、燈光預設),減少手動 VFX 流程。
與其他領先模型的比較
Veo 3.1 vs Veo 3(前代):Veo 3.1 著重於更佳的提示遵從性、音訊品質與多鏡頭一致性——屬於漸進但影響重大的更新,旨在降低人工痕跡並提升可編輯性。
Veo 3.1 vs OpenAI Sora 2:媒體報導的取捨:Veo 3.1 強調較長篇幅的敘事控制、整合式音訊,以及 Flow 的編輯整合;Sora 2(媒體比較時)側重於不同優勢(速度、不同的編輯管線)。TechRadar 等媒體將 Veo 3.1 定位為 Google 在敘事與長影片支援上的針對性競品。獨立的並排測試仍然有限。
| 能力 | Veo 3.1 | Sora 2 | Runway Gen-4 / Gen-4.5 |
|---|---|---|---|
| 原生直式輸出 | 是 | 有限的工作流程支援 | 是 |
| 圖片轉影片 | 是 | 是 | 是 |
| 音訊整合重點 | 強 | 中等 | 中等 |
| 畫格條件控制 | 是 | 是 | 部分 |
| 社群影片最佳化 | 強 | 中等 | 強 |
| API 生態系統整合 | Google 生態系統 | OpenAI 生態系統 | 創作者工具生態系統 |
如何透過 CometAPI 使用 Veo 3.1 API?
- 建立 CometAPI API 金鑰
- 選擇
veo-3.1-generate-001作為模型端點 - 透過影片生成 API 傳送提示語或圖片輸入
- 輪詢結果並擷取生成的影片
- 針對鏡頭運動、場景連貫與一致性改進反覆調整提示語