สเปกทางเทคนิคของ Veo 3.1
| รายการ | Veo 3.1 (สเปกสาธารณะ) |
|---|---|
| รหัสรุ่นอย่างเป็นทางการ | veo-3.1-generate-001 |
| ผู้ให้บริการ | Google DeepMind / Google Cloud |
| ประเภทโมเดล | การสร้างข้อความเป็นวิดีโอและภาพเป็นวิดีโอ |
| ประเภทอินพุต | พรอมต์ข้อความ, อินพุตภาพ, การกำกับจากเฟรมแรก + เฟรมสุดท้าย |
| ประเภทเอาต์พุต | วิดีโอที่สร้างด้วย AI |
| ความละเอียดที่รองรับ | 720p และ 1080p, 4K |
| อัตราส่วนภาพที่รองรับ | 16:9 และ 9:16 |
| อัตราเฟรมที่รองรับ | 24 FPS |
| ระยะเวลาวิดีโอ | คลิป 4s, 6s หรือ 8s (ขึ้นอยู่กับโหมด) |
| ภาษาพรอมต์ | อังกฤษ |
| วิดีโอต่อคำขอ | สูงสุด 4 |
| ขีดจำกัดอัตรา API | สูงสุด 50 คำขอ/นาที/โปรเจกต์ |
| การปรับใช้ที่รองรับ | Vertex AI, การผสานเข้ากับระบบนิเวศ Gemini, Flow |
| ฟีเจอร์ที่ไม่รองรับ (ตามเอกสารทางการ) | โควตาแบบแชร์แบบไดนามิก, เวิร์กโฟลว์ภาพอ้างอิงบางแบบ, ส่วนขยายวิดีโอแบบเนทีฟในโฟลว์ API มาตรฐาน |
Veo 3.1 คืออะไร?
Veo 3.1 คือกลุ่มโมเดลวิดีโอเชิงกำเนิดระดับเรือธงของ Google ที่มุ่งเน้นการสังเคราะห์วิดีโอคุณภาพระดับภาพยนตร์ การยึดตามพรอมต์ที่แข็งแกร่งขึ้น ความสอดคล้องของฉากที่ดีขึ้น และเวิร์กโฟลว์การสร้างวิดีโอแบบหลายโมดัล มันก้าวข้ามการสร้างข้อความเป็นวิดีโอมาตรฐานด้วยการรองรับการสร้างที่กำกับด้วยภาพและเวิร์กโฟลว์การเล่าเรื่องที่ควบคุมด้วยเฟรม การสนับสนุนอย่างเป็นทางการรวมถึง text-to-video, image-to-video, การเขียนพรอมต์ใหม่ และเวิร์กโฟลว์การสร้างเฟรมแรก/เฟรมสุดท้าย
คุณสมบัติหลัก
Veo 3.1 มุ่งเน้นฟีเจอร์เพื่อการสร้างคอนเทนต์ที่ใช้งานได้จริง:
- การสร้างเสียงแบบเนทีฟ (บทสนทนา เสียงบรรยากาศ SFX) ที่ผนวกรวมในผลลัพธ์ Veo 3.1 สร้างเสียงแบบเนทีฟ (บทสนทนา + เสียงบรรยากาศ + SFX) ที่จัดวางตามไทม์ไลน์ภาพ โดยมีเป้าหมายเพื่อรักษาการซิงก์ริมฝีปากและความสอดคล้องระหว่างเสียง–ภาพสำหรับบทสนทนาและคิวของฉาก
- ผลลัพธ์ยาวขึ้น (รองรับได้ถึง ~60 วินาที / 1080p เมื่อเทียบกับคลิปสั้นมากของ Veo 3 ที่ 8 วินาที) และซีเควนซ์หลายชอตด้วยหลายพรอมต์เพื่อความต่อเนื่องของเรื่องราว
- โหมด Scene Extension และ First/Last Frame ที่ขยายหรือแทรกเฟรมระหว่างเฟรมสำคัญ
- การแทรกวัตถุและ (กำลังจะมี) การลบวัตถุ และ primitive สำหรับการแก้ไขภายใน Flow
แต่ละข้อข้างต้นถูกออกแบบมาเพื่อลดงาน VFX แบบแมนนวล: เสียงและความต่อเนื่องของฉากกลายเป็นเอาต์พุตระดับแรก แทนที่จะเป็นสิ่งที่มาคิดทีหลัง
รายละเอียดทางเทคนิค (พฤติกรรมโมเดลและอินพุต)
ตระกูลโมเดลและเวอร์ชันย่อย: Veo อยู่ในตระกูล Veo-3 ของ Google; รหัสรุ่นพรีวิวโดยทั่วไปคือ veo3.1-pro; veo3.1 (เอกสาร CometAPI) รองรับพรอมต์ข้อความ อ้างอิงภาพ (เฟรมเดี่ยวหรือเป็นลำดับ) และเลย์เอาต์หลายพรอมต์แบบมีโครงสร้างสำหรับการสร้างหลายชอต
ความละเอียดและระยะเวลา: เอกสารพรีวิวอธิบายเอาต์พุตที่ 720p/1080p โดยมีตัวเลือกความยาวมากขึ้น (สูงสุด ~60 วินาทีในบางการตั้งค่าพรีวิว) และความเที่ยงตรงสูงกว่ารุ่น Veo ก่อนหน้า
อัตราส่วนภาพ: 16:9 (รองรับ) และ 9:16 (รองรับ ยกเว้นในบางโฟลว์ภาพอ้างอิง)
ภาษาพรอมต์: อังกฤษ (พรีวิว)
ขีดจำกัด API: ในพรีวิวโดยทั่วไปประกอบด้วย สูงสุด 10 คำขอ API/นาทีต่อโปรเจกต์, วิดีโอสูงสุด 4 รายการต่อคำขอ และความยาววิดีโอเลือกได้ 4, 6 หรือ 8 วินาที (โฟลว์อ้างอิงภาพรองรับ 8s)
ประสิทธิภาพตามเกณฑ์วัด
การประเมินภายในของ Google และสรุปสาธารณะรายงานว่า Veo 3.1 ได้รับ “การเลือกโดยรวม” ที่แข็งแกร่งจากผู้ประเมินมนุษย์ในการเปรียบเทียบตามเกณฑ์ เช่น ความสอดคล้องกับข้อความ คุณภาพภาพ และความสอดคล้องระหว่างเสียง–ภาพ (งาน text→video และ image→video)
Veo 3.1 ทำได้ระดับแนวหน้าในการเปรียบเทียบภายในโดยผู้ประเมินมนุษย์ในหลายมิติที่เป็นเชิงวัตถุ — การชอบโดยรวม ความสอดคล้องกับพรอมต์ (text→video และ image→video) คุณภาพภาพ การจัดแนวเสียง–ภาพ และ “ฟิสิกส์ที่สมจริงทางสายตา” บนชุดข้อมูลมาตรฐานเช่น MovieGenBench และ VBench
ข้อจำกัดและข้อพิจารณาด้านความปลอดภัย
ข้อจำกัด:
- อาร์ติแฟกต์และความไม่สม่ำเสมอ: แม้จะพัฒนาแล้ว แต่สภาวะแสง ฟิสิกส์ที่ละเอียด และการบังที่ซับซ้อนยังอาจก่อให้เกิดอาร์ติแฟกต์; ความคงเส้นคงวาจากภาพ→วิดีโอ (โดยเฉพาะช่วงเวลาที่ยาว) ดีขึ้นแต่ยังไม่สมบูรณ์
- ความเสี่ยงด้านข้อมูลผิด/ดีปเฟก: เสียงที่สมจริงยิ่งขึ้น + การแทรก/ลบวัตถุเพิ่มความเสี่ยงการใช้ในทางที่ผิด (เสียงปลอมสมจริงและคลิปที่ยาวขึ้น) Google ระบุการบรรเทาความเสี่ยง (นโยบาย มาตรการความปลอดภัย) และการเปิดตัว Veo ก่อนหน้าอ้างถึงการทำวอเตอร์มาร์ก/SynthID เพื่อช่วยเรื่องแหล่งที่มา; อย่างไรก็ดี มาตรการทางเทคนิคไม่อาจขจัดความเสี่ยงการใช้งานผิดได้
- ข้อจำกัดด้านต้นทุนและปริมาณงาน: วิดีโอความละเอียดสูงและยาวมีต้นทุนคำนวณสูง และขณะนี้จำกัดในพรีวิวแบบชำระเงิน — คาดว่าจะมีความหน่วงและต้นทุนสูงกว่าเมื่อเทียบกับโมเดลภาพ โพสต์ชุมชนและกระทู้ในฟอรั่มของ Google กล่าวถึงช่วงเวลาให้ใช้งานและกลยุทธ์สำรอง
มาตรการความปลอดภัย: Veo 3.1 มีนโยบายเนื้อหาแบบบูรณาการ การทำวอเตอร์มาร์ก/สัญญาณ SynthID ในรุ่น Veo ก่อนหน้า และการควบคุมการเข้าถึงเวอร์ชันพรีวิว; แนะนำให้ลูกค้าปฏิบัติตามนโยบายแพลตฟอร์มและจัดให้มีการตรวจทานโดยมนุษย์สำหรับผลลัพธ์ที่มีความเสี่ยงสูง
กรณีการใช้งานจริง
- การสร้างต้นแบบอย่างรวดเร็วสำหรับครีเอทีฟ: สตอรีบอร์ด → คลิปหลายชอตและอนิเมติกพร้อมบทสนทนาแบบเนทีฟเพื่อการรีวิวเชิงสร้างสรรค์ระยะต้น
- การตลาดและคอนเทนต์สั้น: สปอตสินค้า 15–60 วินาที คลิปโซเชียล และทีเซอร์คอนเซ็ปต์ ที่ความเร็วสำคัญกว่าความเหมือนจริงสมบูรณ์แบบ
- การดัดแปลงภาพ→วิดีโอ: เปลี่ยนภาพประกอบ ตัวละคร หรือสองเฟรมให้เป็นทรานซิชันลื่นไหลหรือฉากแอนิเมชันผ่านโหมด First/Last Frame และ Scene Extension
- การเสริมด้วยเครื่องมือ: ผสานเข้ากับ Flow เพื่อการแก้ไขแบบวนซ้ำ (แทรก/ลบวัตถุ พรีเซ็ตแสง) ช่วยลดงาน VFX แบบแมนนวล
การเปรียบเทียบกับโมเดลชั้นนำอื่นๆ
Veo 3.1 เทียบกับ Veo 3 (รุ่นก่อน): Veo 3.1 มุ่งเน้นการยึดตามพรอมต์ที่ดีขึ้น คุณภาพเสียงที่ดีขึ้น และความสม่ำเสมอของหลายชอต — เป็นการอัปเดตแบบค่อยเป็นค่อยไปแต่ส่งผลชัดเจน มุ่งลดอาร์ติแฟกต์และเพิ่มความสะดวกในการแก้ไข
Veo 3.1 เทียบกับ OpenAI Sora 2: สื่อต่างรายงานการแลกเปลี่ยนข้อดี: Veo 3.1 เน้นการควบคุมเรื่องราวรูปแบบยาว การผนวกเสียงแบบบูรณาการ และการผสานการแก้ไขกับ Flow; Sora 2 (ตามที่มีการเทียบในสื่อ) เน้นจุดแข็งที่ต่างออกไป (ความเร็ว เวิร์กโฟลว์การแก้ไขต่างกัน) TechRadar และสำนักอื่นๆ มองว่า Veo 3.1 เป็นคู่แข่งที่ Google เล็งเป้าเพื่อรองรับการเล่าเรื่องและวิดีโอที่ยาวขึ้น การทดสอบเทียบเคียงแบบอิสระยังมีจำกัด
| ความสามารถ | Veo 3.1 | Sora 2 | Runway Gen-4 / Gen-4.5 |
|---|---|---|---|
| เอาต์พุตแนวตั้งแบบเนทีฟ | ใช่ | รองรับเวิร์กโฟลว์อย่างจำกัด | ใช่ |
| ภาพเป็นวิดีโอ | ใช่ | ใช่ | ใช่ |
| โฟกัสการผสานเสียง | แข็งแกร่ง | ปานกลาง | ปานกลาง |
| การกำหนดเงื่อนไขด้วยเฟรม | ใช่ | ใช่ | บางส่วน |
| การปรับให้เหมาะกับวิดีโอโซเชียล | แข็งแกร่ง | ปานกลาง | แข็งแกร่ง |
| การผสานเข้ากับระบบนิเวศ API | ระบบนิเวศของ Google | ระบบนิเวศของ OpenAI | ระบบนิเวศเครื่องมือสำหรับครีเอเตอร์ |
ฉันจะใช้ Veo 3.1 API กับ CometAPI ได้อย่างไร?
- สร้างคีย์ API ของ CometAPI
- เลือก
veo-3.1-generate-001เป็นปลายทางโมเดล - ส่งพรอมต์หรืออินพุตภาพผ่าน API การสร้างวิดีโอ
- โพลล์ผลลัพธ์และดึงวิดีโอที่สร้างแล้ว
- ปรับแต่งพรอมต์เพื่อการเคลื่อนไหวกล้อง ความต่อเนื่องของฉาก และความสม่ำเสมอที่ดีขึ้น