Specyfikacja techniczna Wan 3.0
| Specyfikacja | Wan 3.0 |
|---|---|
| Typ modelu | Wielomodalny model generowania wideo typu wszystko w jednym |
| Status modelu | Publiczna wersja zapoznawcza API |
| Typy wejść | Tekst, obraz, wideo, audio, dokumenty, strony internetowe |
| Generowanie wideo | tekst‑na‑wideo, obraz‑na‑wideo, referencja‑na‑wideo |
| Edycja wideo | Edycja oparta na instrukcjach i referencjach |
| Maksymalny czas trwania | 30 sekund w pojedynczym generowaniu |
| Rozdzielczość wyjściowa | 480P, 720P, 1080P |
| Natywne generowanie audiowizualne | Tak |
| Zasoby referencyjne | Do 20 wielomodalnych zasobów referencyjnych |
| Wejścia dokumentów | DOC, XLS, PPT, PDF, TXT, KEY, PAGES, NUMBERS, MD |
| Maksymalny rozmiar dokumentu | 100 MB |
| Maksymalna liczba stron dokumentu | 50 stron |
| Dostęp do API | Wersja zapoznawcza API w Alibaba Cloud Model Studio |
| Tryb generowania API | Asynchroniczny |
| Cena 480P | $0.05/sec |
| Cena 720P | $0.10/sec |
| Cena 1080P | $0.20/sec |
Wan 3.0 to najnowszy, kompleksowy, wielomodalny model generowania wideo od Alibaba Cloud, oficjalnie udostępniony w sierpniu 2026 r. Najistotniejszym ulepszeniem względem poprzednich generacji Wan nie jest tylko wyższa jakość obrazu, lecz konsolidacja tekstu, obrazów, wideo, audio, dokumentów i stron WWW w jeden spójny przepływ twórczy. Alibaba Cloud opisuje model jako obsługujący natywne generowanie 30‑sekundowych wideo, wielomodalne wejścia referencyjne, zsynchronizowane generowanie audiowizualne oraz precyzyjną edycję wideo.
Czym jest Wan 3.0?
Wan 3.0 to nowej generacji wielomodalny model generowania wideo firmy Alibaba, zaprojektowany do przekształcania tekstu, obrazów, wideo, audio, dokumentów i treści web w spójny film.
Dotychczasowe przepływy pracy AI dla wideo często wymagały kilku wyspecjalizowanych modeli: jednego do text‑to‑video, innego do image‑to‑video, kolejnego do spójności referencyjnej, oraz osobnych narzędzi do edycji czy dźwięku. Wan 3.0 zmierza w kierunku produkcji typu all‑in‑one, w której te wejścia można połączyć wokół pojedynczej instrukcji kreatywnej.
Flagową możliwością jest natywne generowanie 30‑sekundowe. Zamiast tworzyć krótkie, 5‑ lub 10‑sekundowe klipy, które trzeba wielokrotnie wydłużać i sklejać, Wan 3.0 potrafi wygenerować ciągłą, 30‑sekundową sekwencję w jednym przebiegu. Demonstracje Alibaba pokazują, że model utrzymuje spójność postaci, środowisk, działań, ruchu kamery, dialogu i dźwięku w dłuższych scenach.
Kolejną dużą zmianą jest Omni-Reference. Deweloperzy mogą używać wielu zasobów referencyjnych do zdefiniowania postaci, produktów, środowisk, ruchu czy innych cech wizualnych. Oficjalne repozytorium Wan 3.0 opisuje obsługę do 20 zasobów referencyjnych, a strona produktu Alibaba Cloud podkreśla możliwość łączenia obrazów, tekstu, wideo, audio, dokumentów i stron WWW jako referencji kreatywnych.
Dzięki temu Wan 3.0 mniej przypomina prosty generator prompt‑na‑wideo, a bardziej wielomodalny silnik produkcji kreatywnej.
Główne funkcje Wan 3.0
- Natywne generowanie 30‑sekundowego wideo: Wan 3.0 potrafi wygenerować do 30 sekund materiału w jednym przebiegu, oferując inteligentny dobór długości i możliwość wydłużania wideo.
- Omni-Reference: Tekst, obrazy, wideo i audio mogą być łączone jako referencje. Wan 3.0 rozszerza generowanie oparte na referencjach także na dokumenty i strony WWW.
- Dokument‑na‑wideo: Pliki PPT, PDF, DOC, XLS, TXT, KEY, PAGES, NUMBERS oraz MD mogą służyć jako wejścia kreatywne, dzięki czemu prezentacje, raporty i informacje strukturalne stają się treścią wideo.
- Natywne generowanie audiowizualne: Wan 3.0 potrafi jednocześnie generować obraz i dźwięk, obsługując dialogi, dźwięki otoczenia i sceny audiowizualne z orientacją na muzykę.
- Spójność względem referencji: Model zaprojektowano tak, aby zachowywał postaci, rekwizyty, środowiska, relacje przestrzenne i style w generowaniu sterowanym referencjami.
- Edycja wideo: Wan 3.0 wspiera modyfikacje wygenerowanej treści wizualnej, fabuły i dialogów, bez konieczności zaczynania każdej iteracji od zera.
Jak Wan 3.0 wypada na tle innych modeli wideo?
| Model | Natywna długość | Obraz‑na‑wideo | Kontrola referencji | Audio | Wejście: dokument/WWW | Główna mocna strona |
|---|---|---|---|---|---|---|
| Wan 3.0 | 30s | ✓ | Mocna | ✓ | ✓ | Wielomodalna produkcja all‑in‑one |
| Wan 2.7 | 15s | ✓ | ✓ | ✓ | Ograniczone | Ugruntowane przepływy pracy Wan dla wideo |
| Grok Imagine Video 1.5 | Do 15s | ✓ | ✓ | ✓ | — | Szybkie kreatywne wideo krótkiej formy |
| Veo | Zależna od modelu | ✓ | ✓ | ✓ | Wielomodalne | Generowanie filmowe |
| Kling | Zależna od modelu | ✓ | ✓ | ✓ | — | Generowanie postaci i ruchu |
| Seedance | Zależna od modelu | ✓ | ✓ | ✓ | — | Kreatywne i wieloujęciowe wideo |
Kluczowym wyróżnikiem jest szerokość zakresu wejść.
W porównaniu z Grok Imagine Video 1.5, Wan 3.0 idzie znacznie dalej w stronę workflow produkcyjnego all‑in‑one. Grok koncentruje się na krótkich formach z tekstem, obrazem i referencjami, podczas gdy Wan 3.0 dodatkowo włącza dokumenty, strony WWW, audio i wideo jako bezpośrednie referencje kreatywne.
W porównaniu z Wan 2.7, największą zmianą architektoniczno‑produktową jest przejście do ujednoliconego, wielomodalnego przepływu pracy oraz natywny limit 30 sekund zamiast krótszych klipów poprzedniej generacji. Aktualne materiały Alibaba Cloud dotyczące Wan 3.0 wyraźnie pozycjonują model wokół dłuższych narracji i generowania Omni-Reference.
W porównaniu z Kling i Veo, najsilniejszym wyróżnikiem Wan 3.0 nie jest koniecznie lepsza jakość każdego kadru, lecz możliwość połączenia dużej ilości materiału źródłowego i utrzymania tych informacji przez dłuższy proces generowania.
W zastosowaniach, gdzie wejście to po prostu „napisz ten prompt i wygeneruj filmowy klip”, inne modele mogą pozostać konkurencyjne. W workflow, gdzie wejście brzmi „oto obraz produktu, referencja postaci, PDF, arkusz, próbka audio i brief kreatywny — zamień to w spójne wideo”, Wan 3.0 staje się znacznie bardziej przekonujący.
Przykładowe zastosowania Wan 3.0
1. Tworzenie filmów AI i produkcja fabuł
Możliwość jednorazowego wygenerowania 30 sekund czyni Wan 3.0 użytecznym w scenach wymagających ciągłego ruchu kamery, dialogu i wielu akcji bez sklejania licznych krótkich klipów.
2. Reklama produktów
Obraz produktu lub zestaw referencji można połączyć z reżyserską instrukcją, aby tworzyć demonstracje produktów, reklamy UGC i filmowe wideo brandingowe.
3. Generowanie prezentacji na wideo
Wan 3.0 potrafi przetwarzać formaty PPT, PDF, DOC, XLS i inne wspierane dokumenty, co czyni go odpowiednim do konwersji raportów, prezentacji i informacji strukturalnych w narracje wizualne.
4. Wideo ze spójnymi postaciami
Obrazy referencyjne, wideo i inne media mogą posłużyć do zdefiniowania postaci, obiektów i środowisk przed wygenerowaniem sceny.
5. Treści do mediów społecznościowych
Długość 30 sekund i pionowy format 9:16 sprawiają, że Wan 3.0 nadaje się do krótkich treści społecznościowych, reklam i klipów narracyjnych.
6. Edycja wideo i iteracja
Wan 3.0 potrafi modyfikować wcześniej wygenerowaną treść — w tym elementy wizualne, fabułę i dialogi — umożliwiając iteracyjne przepływy pracy kreatywnej.
Parametry API Wan 3.0
Oficjalne API korzysta z asynchronicznego endpointu do generowania wideo. Uproszczone żądanie zawiera obiekt model, input i parameters.
Ważne parametry:
| Parametr | Opis |
|---|---|
| model | wan3.0-video |
| input.prompt | Instrukcja generowania w stylu reżyserskim |
| input.media | Obrazy referencyjne, wideo, audio, pliki lub zasoby web |
| parameters.resolution | 480P, 720P, 1080P |
| parameters.ratio | adaptive, 16:9, 4:3, 1:1, 3:4, 9:16 |
| parameters.duration | 2–30 seconds; -1 włącza inteligentny czas trwania |
| parameters.audio | Czy dołączyć ścieżkę audio |
| parameters.seed | Losowe ziarno dla powtarzalności |
| parameters.watermark | Czy dodać znak wodny |
W oficjalnej dokumentacji stwierdzono, że gdy nie podano wejściowego wideo, czas trwania może być liczbą całkowitą od 2 do 30 sekund. Gdy dostarczono wejściowe wideo, łączny czas wejścia i wyjścia musi mieścić się w obsługiwanym całkowitym limicie czasu.
Jak używać API Wan 3.0 na CometAPI
Dla deweloperów korzystających z wielu modeli AI do wideo, CometAPI może pełnić rolę ujednoliconej warstwy dostępowej do eksperymentów z Wan 3.0 obok innych modeli generowania wideo.
Typowy workflow:
- Utworzyć konto CometAPI lub zalogować się.
- Uzyskać klucz API CometAPI.
- Wybrać endpoint modelu Wan 3.0.
- Wysłać żądanie generowania: tekst‑na‑wideo, obraz‑na‑wideo lub w oparciu o referencje.
- Określić rozdzielczość, czas trwania, proporcje obrazu i inne wspierane parametry.
- Monitorować asynchroniczne zadanie generowania.
- Pobrać wygenerowane wideo po zakończeniu przetwarzania.
Dokładny endpoint CometAPI i wspierane parametry należy zweryfikować względem bieżącej integracji Wan 3.0 w CometAPI przed implementacją, zwłaszcza że nadrzędne API Alibaba wciąż jest w wersji zapoznawczej.