Spesifikasi Teknikal Veo 3.1
| Item | Veo 3.1 (spesifikasi awam) |
|---|---|
| Official model ID | veo-3.1-generate-001 |
| Provider | Google DeepMind / Google Cloud |
| Model type | Penjanaan teks-ke-video dan imej-ke-video |
| Input types | Arahan teks, input imej, panduan bingkai pertama + bingkai terakhir |
| Output type | Video yang dijana AI |
| Supported resolutions | 720p dan 1080p, 4K |
| Supported aspect ratios | 16:9 dan 9:16 |
| Supported framerate | 24 FPS |
| Video duration | Klip 4s, 6s atau 8s (bergantung mod) |
| Prompt language | Bahasa Inggeris |
| Videos per request | Sehingga 4 |
| API rate limit | Sehingga 50 permintaan/minit/projek |
| Supported deployment | Vertex AI, integrasi ekosistem Gemini, Flow |
| Unsupported features (official docs) | Kuota kongsi dinamik, sesetengah aliran kerja imej rujukan, peluasan video asli dalam aliran API standard |
Apakah Veo 3.1?
Veo 3.1 ialah keluarga model video generatif utama Google yang memfokus pada sintesis video berkualiti sinematik, pematuhan arahan yang lebih kukuh, konsistensi babak yang lebih baik, dan aliran kerja penciptaan video multimodal. Ia melangkaui penjanaan teks-ke-video standard dengan menyokong penjanaan berpandukan imej dan aliran kerja penceritaan terkawal bingkai. Sokongan rasmi merangkumi teks-ke-video, imej-ke-video, penulisan semula arahan, serta aliran kerja penjanaan bingkai pertama/terakhir.
Ciri teras
Veo 3.1 memfokus pada ciri penciptaan kandungan yang praktikal:
- Penjanaan audio asli (dialog, bunyi ambien, SFX) yang diintegrasikan dalam output. Veo 3.1 menjana audio asli (dialog + ambien + SFX) yang sejajar dengan garis masa visual; model ini bertujuan mengekalkan penyegerakan bibir dan penjajaran audio–visual untuk dialog dan petunjuk adegan.
- Output lebih panjang (sokongan sehingga ~60 saat / 1080p berbanding klip yang sangat pendek pada Veo 3, 8s), dan jujukan berbilang arahan berbilang syot untuk kesinambungan naratif.
- Mod Scene Extension dan First/Last Frame yang memanjangkan atau menginterpolasi rakaman antara bingkai utama.
- Penyisipan objek dan (akan datang) pembuangan objek serta primitif penyuntingan dalam Flow.
Setiap poin di atas direka untuk mengurangkan kerja VFX manual: audio dan kesinambungan adegan kini menjadi output kelas pertama, bukannya perkara susulan.
Butiran teknikal (tingkah laku model & input)
Keluarga model & varian: Veo tergolong dalam keluarga Veo-3 Google; ID model pratonton biasanya veo3.1-pro; veo3.1 (dokumen CometAPI). Ia menerima arahan teks, rujukan imej (bingkai tunggal atau jujukan), dan susun atur berstruktur berbilang arahan untuk penjanaan berbilang syot.
Resolusi & tempoh: Dokumentasi pratonton menerangkan output pada 720p/1080p dengan pilihan tempoh lebih panjang (sehingga ~60s dalam tetapan pratonton tertentu) dan fideliti yang lebih tinggi berbanding varian Veo terdahulu.
Nisbah bidang: 16:9 (disokong) dan 9:16 (disokong kecuali dalam sesetengah aliran imej rujukan).
Bahasa arahan: Bahasa Inggeris (pratonton).
Had API: had pratonton lazim termasuk maks 10 permintaan API/min setiap projek, maks 4 video setiap permintaan, dan panjang video boleh dipilih antara 4, 6, atau 8 saat (aliran imej rujukan menyokong 8s).
Prestasi penanda aras
Penilaian dalaman Google dan ringkasan awam melaporkan keutamaan yang kuat terhadap output Veo 3.1 dalam perbandingan oleh penilai manusia pada metrik seperti penjajaran teks, kualiti visual, dan koheren audio–visual (tugas teks→video dan imej→video).
Veo 3.1 mencapai hasil tahap termaju dalam perbandingan dalaman oleh penilai manusia merentas beberapa paksi objektif — keutamaan keseluruhan, penjajaran arahan (teks→video dan imej→video), kualiti visual, penjajaran audio–video, dan “fizik yang realistik secara visual” pada set data penanda aras seperti MovieGenBench dan VBench.
Batasan & pertimbangan keselamatan
Batasan:
- Artifak & ketidakselarasan: walaupun ada penambahbaikan, pencahayaan tertentu, fizik berbutir halus, dan oklusi kompleks masih boleh menghasilkan artifak; konsistensi imej→video (terutamanya untuk tempoh panjang) dipertingkat tetapi belum sempurna.
- Risiko maklumat palsu/deepfake: audio yang lebih kaya + penyisipan/pembuangan objek meningkatkan risiko penyalahgunaan (audio palsu realistik dan klip yang dipanjangkan). Google menyatakan langkah mitigasi (dasar, perlindungan) dan pelancaran Veo terdahulu merujuk penandaan air/SynthID untuk membantu ketulenan; namun perlindungan teknikal tidak menghapuskan risiko penyalahgunaan.
- Kekangan kos & throughput: video resolusi tinggi dan panjang adalah mahal dari segi pengiraan dan pada masa ini dihadkan dalam pratonton berbayar — jangkakan latensi dan kos yang lebih tinggi berbanding model imej. Catatan komuniti dan benang forum Google membincangkan tetingkap ketersediaan dan strategi gantian.
Kawalan keselamatan: Veo3.1 mempunyai dasar kandungan bersepadu, penandaan air/isyarat SynthID dalam keluaran Veo terdahulu, dan kawalan capaian pratonton; pelanggan dinasihatkan mematuhi dasar platform dan melaksanakan semakan manusia untuk output berisiko tinggi.
Kes penggunaan praktikal
- Pembuatan prototaip pantas untuk kreatif: papan cerita → klip berbilang syot dan animatik dengan dialog asli untuk semakan kreatif awal.
- Pemasaran & kandungan bentuk pendek: spot produk 15–60s, klip sosial, dan penggoda konsep apabila kelajuan lebih penting daripada fotorealisme yang sempurna.
- Penyesuaian imej→video: menukar ilustrasi, watak, atau dua bingkai kepada peralihan licin atau adegan animasi melalui First/Last Frame dan Scene Extension.
- Peningkatan alatan: disepadukan ke dalam Flow untuk penyuntingan beriterasi (penyisipan/pembuangan objek, praset pencahayaan) yang mengurangkan lelaran VFX manual.
Perbandingan dengan model terkemuka lain
Veo 3.1 vs Veo 3 (pendahulu): Veo 3.1 memfokus pada pematuhan arahan yang dipertingkat, kualiti audio, dan konsistensi berbilang syot — kemas kini bertahap tetapi berimpak yang bertujuan mengurangkan artifak dan memperbaiki keboleheditan.
Veo 3.1 vs OpenAI Sora 2: pertukaran kelebihan yang dilaporkan dalam media: Veo 3.1 menekankan kawalan naratif bentuk lebih panjang, audio bersepadu, dan integrasi penyuntingan Flow; Sora 2 (apabila dibandingkan dalam media) memberi tumpuan pada kekuatan berbeza (kelajuan, saluran penyuntingan berbeza). TechRadar dan saluran lain menggambarkan Veo 3.1 sebagai pesaing sasar Google kepada Sora 2 untuk naratif dan sokongan video lebih panjang. Ujian perbandingan bebas secara bersebelahan masih terhad.
| Capability | Veo 3.1 | Sora 2 | Runway Gen-4 / Gen-4.5 |
|---|---|---|---|
| Native vertical output | Ya | Sokongan aliran kerja terhad | Ya |
| Image-to-video | Ya | Ya | Ya |
| Audio integration focus | Kuat | Sederhana | Sederhana |
| Frame conditioning | Pengkondisian bingkai | Ya | Sebahagian |
| Social-video optimization | Pengoptimuman video sosial | Sederhana | Kuat |
| API ecosystem integration | Integrasi ekosistem API | Ekosistem OpenAI | Ekosistem alatan pencipta |
Bagaimanakah saya menggunakan API Veo 3.1 dengan CometAPI?
- Cipta kunci API CometAPI
- Pilih
veo-3.1-generate-001sebagai titik akhir model - Hantar arahan atau input imej melalui API penjanaan video
- Kutip keputusan dan dapatkan video yang dijana
- Ulang tambah baik arahan untuk pergerakan kamera, kesinambungan adegan, dan penambahbaikan konsistensi