ข้อกำหนดทาง技术ของ Veo 3.1
| รายการ | Veo 3.1 (ข้อกำหนดสาธารณะ) |
|---|---|
| รหัสรุ่นอย่างเป็นทางการ | veo-3.1-generate-001 |
| ผู้ให้บริการ | Google DeepMind / Google Cloud |
| ประเภทโมเดล | การสร้างแบบข้อความเป็นวิดีโอและภาพเป็นวิดีโอ |
| ประเภทอินพุต | พรอมต์ข้อความ, อินพุตภาพ, คำแนะนำเฟรมแรก + เฟรมสุดท้าย |
| ประเภทเอาต์พุต | วิดีโอที่สร้างโดย AI |
| ความละเอียดที่รองรับ | 720p และ 1080p, 4K |
| อัตราส่วนภาพที่รองรับ | 16:9 และ 9:16 |
| เฟรมเรตที่รองรับ | 24 FPS |
| ความยาววิดีโอ | คลิป 4s, 6s หรือ 8s (ขึ้นอยู่กับโหมด) |
| ภาษาของพรอมต์ | ภาษาอังกฤษ |
| จำนวนวิดีโอต่อคำขอ | สูงสุด 4 |
| ขีดจำกัดอัตรา API | สูงสุด 50 คำขอ/นาที/โปรเจ็กต์ |
| การปรับใช้ที่รองรับ | Vertex AI, การผสานในระบบนิเวศ Gemini, Flow |
| ฟีเจอร์ที่ไม่รองรับ (เอกสารทางการ) | โควตาแบบแชร์แบบไดนามิก, เวิร์กโฟลว์ภาพอ้างอิงบางส่วน, ส่วนขยายวิดีโอแบบเนทีฟในโฟลว์ API มาตรฐาน |
Veo 3.1 คืออะไร?
Veo 3.1 คือครอบครัวโมเดลสร้างวิดีโอแบบกำเนิดรุ่นเรือธงของ Google ที่มุ่งเน้นการสังเคราะห์วิดีโอคุณภาพระดับภาพยนตร์ การยึดตามพรอมต์ที่ดียิ่งขึ้น ความสอดคล้องของฉากที่ดีขึ้น และเวิร์กโฟลว์การสร้างวิดีโอแบบมัลติโหมด มันก้าวไกลกว่าการสร้างแบบข้อความเป็นวิดีโอมาตรฐานด้วยการรองรับการสร้างแบบมีภาพเป็นตัวกำกับและเวิร์กโฟลว์การเล่าเรื่องที่ควบคุมด้วยเฟรม การรองรับอย่างเป็นทางการรวมถึงข้อความเป็นวิดีโอ ภาพเป็นวิดีโอ การเขียนพรอมต์ใหม่ และเวิร์กโฟลว์การสร้างเฟรมแรก/เฟรมสุดท้าย
ฟีเจอร์หลัก
Veo 3.1 เน้นฟีเจอร์การสร้างคอนเทนต์ที่ใช้งานได้จริง:
- การสร้างเสียงแบบเนทีฟ (บทสนทนา เสียงบรรยากาศ SFX) แบบบูรณาการในเอาต์พุต Veo 3.1 สร้างเสียงแบบเนทีฟ (บทสนทนา + บรรยากาศ + SFX) ที่สอดคล้องกับไทม์ไลน์ภาพ โดยมุ่งหมายคงการลิปซิงก์และการจัดแนวเสียง–ภาพให้ตรงกับบทสนทนาและคิวของฉาก
- เอาต์พุตที่ยาวขึ้น (รองรับสูงสุดราว ~60 วินาที / 1080p เทียบกับคลิปสั้นมากของ Veo 3 ที่ 8s) และลำดับหลายช็อตแบบหลายพรอมต์เพื่อความต่อเนื่องของเรื่องราว
- โหมด Scene Extension และ First/Last Frame ที่ขยายหรืออินเตอร์โพเลตฟุตเทจระหว่างคีย์เฟรม
- การแทรกวัตถุและ (กำลังมา) การลบวัตถุ และพริมิทีฟการแก้ไขภายใน Flow
แต่ละหัวข้อด้านบนถูกออกแบบมาเพื่อลดงาน VFX แบบทำมือ: เสียงและความต่อเนื่องของฉากกลายเป็นเอาต์พุตระดับหลักแทนที่จะเป็นส่วนเสริมภายหลัง
รายละเอียดทางเทคนิค (พฤติกรรมโมเดลและอินพุต)
ตระกูลโมเดลและเวอร์ชันย่อย: Veo อยู่ในตระกูล Veo-3 ของ Google; รหัสรุ่นพรีวิวมักเป็น veo3.1-pro; veo3.1 (เอกสาร CometAPI) รองรับพรอมต์ข้อความ อ้างอิงภาพ (เฟรมเดี่ยวหรือชุดเฟรม) และเลย์เอาต์หลายพรอมต์แบบมีโครงสร้างสำหรับการสร้างหลายช็อต
ความละเอียดและระยะเวลา: เอกสารพรีวิวระบุเอาต์พุตที่ 720p/1080p พร้อมตัวเลือกความยาวที่มากขึ้น (สูงสุดราว ~60s ในบางการตั้งค่าพรีวิว) และความเที่ยงตรงสูงกว่า Veo รุ่นก่อนหน้า
อัตราส่วนภาพ: 16:9 (รองรับ) และ 9:16 (รองรับ ยกเว้นในบางโฟลว์ภาพอ้างอิง)
ภาษาของพรอมต์: ภาษาอังกฤษ (พรีวิว)
ขีดจำกัด API: ขีดจำกัดพรีวิวทั่วไป ได้แก่ สูงสุด 10 คำขอ API/นาที/โปรเจ็กต์ สูงสุด 4 วิดีโอต่อคำขอ และเลือกความยาววิดีโอได้ 4, 6 หรือ 8 วินาที (โฟลว์ภาพอ้างอิงรองรับ 8s)
ผลการทดสอบมาตรฐาน
การประเมินภายในของ Google และสรุปสาธารณะรายงานความชอบที่แข็งแกร่งต่อเอาต์พุตของ Veo 3.1 จากการเปรียบเทียบโดยผู้ประเมินมนุษย์ในเมตริกอย่างการจัดแนวกับข้อความ คุณภาพภาพ และความสอดคล้องเสียง–ภาพ (งาน ข้อความ→วิดีโอ และ ภาพ→วิดีโอ)
Veo 3.1 ทำได้ผลลัพธ์ระดับ ล้ำสมัยระดับแนวหน้า จากการเปรียบเทียบโดยผู้ประเมินภายในบนแกนวัดเชิงวัตถุหลายด้าน — ความชอบโดยรวม การจัดแนวพรอมต์ (ข้อความ→วิดีโอ และ ภาพ→วิดีโอ) คุณภาพภาพ การจัดแนวเสียง–ภาพ และ “ฟิสิกส์ที่ดูสมจริงทางสายตา” บนชุดข้อมูลมาตรฐานเช่น MovieGenBench และ VBench
ข้อจำกัดและข้อพิจารณาด้านความปลอดภัย
ข้อจำกัด:
- สิ่งรบกวนและความไม่สอดคล้อง: แม้จะปรับปรุงแล้ว แสงบางประเภท ฟิสิกส์ระดับละเอียด และการบังที่ซับซ้อนยังอาจก่อให้เกิดสิ่งรบกวนได้; ความสอดคล้องภาพ→วิดีโอ (โดยเฉพาะช่วงยาว) ดีขึ้นแต่ยังไม่สมบูรณ์
- ความเสี่ยงข้อมูลเท็จ/ดีพเฟก: เสียงที่สมบูรณ์ยิ่งขึ้น + การแทรก/ลบวัตถุเพิ่มความเสี่ยงการใช้ในทางที่ผิด (เสียงปลอมสมจริงและคลิปที่ยาวขึ้น) Google ระบุการบรรเทา (นโยบาย มาตรการคุ้มครอง) และการเปิดตัว Veo ก่อนหน้าอ้างอิงวอเตอร์มาร์ก/SynthID เพื่อช่วยเรื่องแหล่งที่มา; อย่างไรก็ดี มาตรการเทคนิคไม่สามารถขจัดความเสี่ยงการใช้ผิดได้ทั้งหมด
- ข้อจำกัดด้านต้นทุนและปริมาณงาน: วิดีโอความละเอียดสูงและยาวมีต้นทุนคำนวณสูงและขณะนี้ถูกจำกัดในพรีวิวแบบมีค่าใช้จ่าย — คาดว่าจะมีเวลาแฝงและต้นทุนสูงกว่าโมเดลภาพ โพสต์ชุมชนและเธรดฟอรัมของ Google กล่าวถึงช่วงเวลาความพร้อมใช้งานและกลยุทธ์สำรอง
การควบคุมด้านความปลอดภัย: Veo 3.1 มีนโยบายเนื้อหาในตัว สัญญาณวอเตอร์มาร์ก/SynthID ในการเปิดตัว Veo ก่อนหน้า และการควบคุมการเข้าถึงเวอร์ชันพรีวิว; ลูกค้าได้รับคำแนะนำให้ปฏิบัติตามนโยบายแพลตฟอร์มและมีการทบทวนโดยมนุษย์สำหรับเอาต์พุตที่มีความเสี่ยงสูง
กรณีใช้งานจริง
- การทำต้นแบบอย่างรวดเร็วสำหรับครีเอทีฟ: จากสตอรีบอร์ด → คลิปหลายช็อตและแอนิเมติกส์พร้อม “บทสนทนาแบบเนทีฟ” สำหรับการรีวิวเชิงสร้างสรรค์ระยะแรก
- การตลาดและคอนเทนต์รูปแบบสั้น: สปอตสินค้า 15–60s คลิปโซเชียล และทีเซอร์คอนเซปต์ที่ความเร็วสำคัญกว่าความสมจริงสมบูรณ์แบบ
- การปรับภาพ→วิดีโอ: แปลงภาพประกอบ ตัวละคร หรือสองเฟรมให้เป็นทรานซิชันลื่นไหลหรือฉากแอนิเมชันผ่าน First/Last Frame และ Scene Extension
- การเสริมเครื่องมือ: ผสานใน Flow เพื่อการแก้ไขแบบวนซ้ำ (การแทรก/ลบวัตถุ พรีเซ็ตแสง) ที่ลดการทำ VFX แบบแมนนวล
การเปรียบเทียบกับโมเดลชั้นนำอื่นๆ
Veo 3.1 เทียบกับ Veo 3 (รุ่นก่อนหน้า): Veo 3.1 เน้นการยึดตามพรอมต์ที่ดีขึ้น คุณภาพเสียงที่ดีขึ้น และความสม่ำเสมอของหลายช็อต — การอัปเดตแบบค่อยเป็นค่อยไปแต่ส่งผลอย่างมีนัยสำคัญเพื่อช่วยลดสิ่งรบกวนและเพิ่มความสามารถในการแก้ไข
Veo 3.1 เทียบกับ OpenAI Sora 2: ข้อแลกเปลี่ยนที่สื่อรายงาน: Veo 3.1 เน้นการควบคุมการเล่าเรื่องระยะยาว การผสานเสียงแบบในตัว และการผนวกรวมการแก้ไขใน Flow; Sora 2 (เมื่อเทียบในสื่อ) เน้นจุดแข็งที่ต่างออกไป (ความเร็ว สายการแก้ไขที่ต่างกัน) TechRadar และสำนักอื่นมอง Veo 3.1 ว่าเป็นคู่แข่งที่มุ่งเป้าของ Google ต่อ Sora 2 ในด้านการเล่าเรื่องและการรองรับวิดีโอที่ยาวขึ้น การทดสอบเทียบเคียงแบบวางเคียงกันโดยอิสระยังมีจำกัด
| ขีดความสามารถ | Veo 3.1 | Sora 2 | Runway Gen-4 / Gen-4.5 |
|---|---|---|---|
| เอาต์พุตแนวตั้งแบบเนทีฟ | ใช่ | รองรับเวิร์กโฟลว์จำกัด | ใช่ |
| ภาพเป็นวิดีโอ | ใช่ | ใช่ | ใช่ |
| โฟกัสด้านการผสานเสียง | แข็งแกร่ง | ปานกลาง | ปานกลาง |
| การคอนดิชันตามเฟรม | ใช่ | ใช่ | บางส่วน |
| การปรับให้เหมาะกับวิดีโอโซเชียล | แข็งแกร่ง | ปานกลาง | แข็งแกร่ง |
| การผสานในระบบนิเวศ API | ระบบนิเวศของ Google | ระบบนิเวศของ OpenAI | ระบบนิเวศเครื่องมือสำหรับครีเอเตอร์ |
ฉันจะใช้ Veo 3.1 API กับ CometAPI ได้อย่างไร?
- สร้างคีย์ API ของ CometAPI
- เลือก
veo-3.1-generate-001เป็นปลายทางโมเดล - ส่งพรอมต์หรืออินพุตภาพผ่าน API การสร้างวิดีโอ
- โพลล์ผลลัพธ์และรับวิดีโอที่สร้าง
- ปรับแต่งพรอมต์ซ้ำเพื่อการเคลื่อนกล้อง ความต่อเนื่องของฉาก และปรับปรุงความสอดคล้อง