Spesifikasi Teknikal Wan 3.0
| Spesifikasi | Wan 3.0 |
|---|---|
| Jenis Model | Model penjanaan video berbilang modaliti semua-dalam-satu |
| Status Model | Pratonton API awam |
| Jenis Input | Teks, imej, video, audio, dokumen, laman web |
| Penjanaan Video | Teks-ke-video, imej-ke-video, rujukan-ke-video |
| Penyuntingan Video | Penyuntingan berasaskan arahan dan berasaskan rujukan |
| Tempoh Maksimum | 30 saat dalam satu penjanaan |
| Resolusi Output | 480P, 720P, 1080P |
| Penjanaan Audio-Visual Natif | Ya |
| Aset Rujukan | Sehingga 20 aset rujukan multimodal |
| Input Dokumen | DOC, XLS, PPT, PDF, TXT, KEY, PAGES, NUMBERS, MD |
| Saiz Dokumen Maksimum | 100 MB |
| Halaman Dokumen Maksimum | 50 halaman |
| Akses API | Pratonton API Alibaba Cloud Model Studio |
| Mod Penjanaan API | Asinkron |
| Harga 480P | $0.05/sec |
| Harga 720P | $0.10/sec |
| Harga 1080P | $0.20/sec |
Wan 3.0 ialah model penjanaan video berbilang modaliti semua-dalam-satu terbaru daripada Alibaba Cloud, dilancarkan secara rasmi pada Ogos 2026. Peningkatan paling signifikan berbanding generasi Wan sebelumnya bukan sekadar kualiti visual yang lebih tinggi, tetapi penyatuan teks, imej, video, audio, dokumen dan laman web ke dalam satu aliran kerja kreatif. Alibaba Cloud menerangkan model ini sebagai menyokong penjanaan video natif 30 saat, input rujukan multimodal, penjanaan audiovisual terselaraskan dan penyuntingan video yang tepat.
Apakah Wan 3.0?
Wan 3.0 ialah model penjanaan video berbilang modaliti generasi seterusnya daripada Alibaba yang direka untuk menukar teks, imej, video, audio, dokumen dan kandungan web menjadi video yang koheren.
Aliran kerja video AI terdahulu selalunya memerlukan beberapa model khusus: satu untuk teks-ke-video, satu lagi untuk imej-ke-video, satu lagi untuk kekonsistenan rujukan, dan alat berasingan untuk penyuntingan atau audio. Wan 3.0 bergerak ke arah model pengeluaran semua-dalam-satu di mana input-input ini boleh digabungkan sekitar satu arahan kreatif.
Keupayaan utamanya ialah penjanaan natif 30 saat. Daripada menghasilkan klip pendek 5 atau 10 saat yang perlu dilanjutkan dan dicantumkan berulang kali, Wan 3.0 boleh menjana urutan berterusan selama 30 saat dalam satu lintasan. Demonstrasi Alibaba menunjukkan model ini mengekalkan watak, persekitaran, aksi, pergerakan kamera, dialog dan bunyi merentas babak yang lebih panjang.
Perubahan besar lain ialah Omni-Reference. Pembangun boleh menggunakan pelbagai aset rujukan untuk mewujudkan watak, produk, persekitaran, pergerakan atau ciri visual lain. Repositori rasmi Wan 3.0 menerangkan sokongan sehingga 20 aset rujukan, manakala halaman produk Alibaba Cloud menekankan keupayaan untuk menggabungkan imej, teks, video, audio, dokumen dan laman web sebagai rujukan kreatif.
Ini menjadikan Wan 3.0 kurang seperti penjana prompt-ke-video yang ringkas dan lebih seperti enjin pengeluaran kreatif multimodal.
Ciri Utama Wan 3.0
- Penjanaan video natif 30 saat: Wan 3.0 boleh menjana sehingga 30 saat video dalam satu lintasan, dengan pemilihan tempoh pintar dan keupayaan lanjutan video.
- Omni-Reference: Teks, imej, video dan audio boleh digabungkan sebagai rujukan. Wan 3.0 juga memperluas penjanaan berasaskan rujukan kepada dokumen dan laman web.
- Dokumen-ke-video: Fail PPT, PDF, DOC, XLS, TXT, KEY, PAGES, NUMBERS dan MD boleh digunakan sebagai input kreatif, membolehkan pembentangan, laporan dan maklumat berstruktur menjadi kandungan video.
- Penjanaan audiovisual natif: Wan 3.0 boleh menjana video dan bunyi serentak, menyokong dialog, audio persekitaran dan adegan audiovisual berorientasikan muzik.
- Kekonsistenan rujukan: Model ini direka untuk mengekalkan watak, prop, persekitaran, hubungan ruang dan gaya dalam penjanaan berasaskan rujukan.
- Penyuntingan video: Wan 3.0 menyokong pengubahsuaian pada kandungan visual yang dijana, plot dan dialog tanpa memerlukan setiap iterasi bermula dari awal.
Bagaimana Wan 3.0 Berbanding Dengan Model Video Lain?
| Model | Tempoh Natif | Imej-ke-Video | Kawalan Rujukan | Audio | Input Dokumen/Web | Kekuatan Utama |
|---|---|---|---|---|---|---|
| Wan 3.0 | 30s | ✓ | Kuat | ✓ | ✓ | Pengeluaran multimodal semua-dalam-satu |
| Wan 2.7 | 15s | ✓ | ✓ | ✓ | Terhad | Aliran kerja video Wan yang mantap |
| Grok Imagine Video 1.5 | Sehingga 15s | ✓ | ✓ | ✓ | — | Video kreatif bentuk pendek pantas |
| Veo | Bergantung model | ✓ | ✓ | ✓ | Multimodal | Penjanaan sinematik |
| Kling | Bergantung model | ✓ | ✓ | ✓ | — | Penjanaan watak dan pergerakan |
| Seedance | Bergantung model | ✓ | ✓ | ✓ | — | Video kreatif dan berbilang shot |
Pembeza utama ialah keluasan input.
Berbanding Grok Imagine Video 1.5, Wan 3.0 bergerak jauh ke arah aliran kerja pengeluaran semua-dalam-satu. Grok memfokuskan pada penjanaan video pendek dengan aliran kerja teks, imej dan rujukan, manakala Wan 3.0 turut menggabungkan dokumen, laman web, audio dan video sebagai rujukan kreatif terus.
Berbanding Wan 2.7, perubahan terbesar pada peringkat seni bina/produk ialah peralihan ke arah aliran kerja multimodal bersatu dan had penjanaan natif 30 saat, berbanding klip yang lebih pendek pada generasi sebelumnya. Bahan Wan 3.0 semasa daripada Alibaba Cloud secara jelas memposisikan model ini sekitar naratif bentuk panjang dan penjanaan Omni-Reference.
Berbanding Kling dan Veo, pembeza terkuat Wan 3.0 bukan semestinya bahawa setiap bingkai yang dijana akan lebih baik. Sebaliknya, ia ialah keupayaan untuk menggabungkan sejumlah besar bahan sumber dan mengekalkan maklumat tersebut sepanjang penjanaan yang lebih panjang.
Untuk aplikasi di mana inputnya hanya "tulis prompt ini dan jana klip sinematik," model lain mungkin kekal berdaya saing. Untuk aliran kerja di mana inputnya "ini imej produk, rujukan watak, PDF, hamparan, sampel audio dan ringkasan kreatif—jadikannya video yang koheren," Wan 3.0 menjadi jauh lebih menarik.
Kes Penggunaan Perwakilan untuk Wan 3.0
1. Pembuatan filem AI dan penghasilan cerita
Keupayaan penjanaan 30 saat tunggal menjadikan Wan 3.0 berguna untuk babak yang memerlukan pergerakan kamera berterusan, dialog dan berbilang aksi tanpa mencantumkan banyak klip pendek.
2. Pengiklanan produk
Imej produk atau koleksi rujukan boleh digabungkan dengan prompt gaya pengarah untuk mencipta demonstrasi produk, iklan UGC dan video jenama sinematik.
3. Penjanaan pembentangan-ke-video
Wan 3.0 boleh memproses PPT, PDF, DOC, XLS dan format dokumen lain yang disokong, menjadikannya sesuai untuk menukar laporan, pembentangan dan maklumat berstruktur menjadi naratif visual.
4. Video dengan konsistensi watak
Imej rujukan, video dan media lain boleh digunakan untuk mewujudkan watak, objek dan persekitaran sebelum menjana sesuatu babak.
5. Kandungan media sosial
Tempoh 30 saat dan nisbah aspek menegak 9:16 menjadikan Wan 3.0 sesuai untuk kandungan media sosial bentuk pendek, iklan dan klip naratif.
6. Penyuntingan dan iterasi video
Wan 3.0 boleh mengubah suai kandungan yang dijana sedia ada, termasuk elemen visual, kandungan cerita dan dialog, membolehkan aliran kerja kreatif beriterasi.
Parameter API Wan 3.0
API rasmi menggunakan titik akhir penjanaan video asinkron. Permintaan ringkas mengandungi objek model, input dan parameters.
Parameter penting termasuk:
| Parameter | Penerangan |
|---|---|
| model | wan3.0-video |
| input.prompt | Arahan penjanaan gaya pengarah |
| input.media | Imej, video, audio, fail atau sumber web rujukan |
| parameters.resolution | 480P, 720P, 1080P |
| parameters.ratio | adaptive, 16:9, 4:3, 1:1, 3:4, 9:16 |
| parameters.duration | 2–30 saat; -1 mengaktifkan tempoh pintar |
| parameters.audio | Sama ada untuk menyertakan trek audio |
| parameters.seed | Benih rawak untuk kebolehulangan |
| parameters.watermark | Sama ada untuk menambah tera air |
Dokumentasi rasmi menyatakan bahawa apabila tiada input video dibekalkan, tempoh boleh menjadi integer dari 2 hingga 30 saat. Apabila input video dibekalkan, jumlah tempoh input dan output mesti kekal dalam jumlah tempoh yang disokong.
Cara Menggunakan API Wan 3.0 pada CometAPI
Untuk pembangun yang menggunakan pelbagai model video AI, CometAPI boleh bertindak sebagai lapisan akses bersepadu untuk bereksperimen dengan Wan 3.0 bersama model penjanaan video lain.
Aliran kerja tipikal ialah:
- Cipta atau log masuk ke akaun CometAPI.
- Dapatkan kunci API CometAPI.
- Pilih titik akhir model Wan 3.0.
- Hantar permintaan penjanaan teks-ke-video, imej-ke-video, atau berasaskan rujukan.
- Nyatakan resolusi, tempoh, nisbah aspek dan parameter lain yang disokong.
- Pantau tugas penjanaan asinkron.
- Dapatkan video yang dijana apabila pemprosesan selesai.
Titik akhir CometAPI yang tepat dan parameter yang disokong hendaklah disemak terhadap integrasi CometAPI Wan 3.0 semasa sebelum pelaksanaan, khususnya kerana API Alibaba huluan masih dalam pratonton.