TLDR Wan 3.0 (również zapisywane jako Wan3.0), najnowszy wszechstronny model wideo Tongyi Lab Alibaby, generuje natywne 30‑sekundowe ciągłe klipy w rozdzielczości do 1080p ze zsynchronizowanym dźwiękiem w jednym przebiegu. Obsługuje text-to-video, image-to-video, warunkowanie pierwszą i ostatnią klatką oraz potężne przepływy pracy Omni-Reference, które akceptują obrazy, wideo, audio, dokumenty (PDF, PPT, XLS, DOC, MD itp.) oraz strony internetowe.
Publiczna beta została otwarta 6 sierpnia 2026; szerszy dostęp nastąpił około 24 sierpnia 2026. Cennik to w przybliżeniu $0.05/s (480p), $0.10/s (720p) i $0.20/s (1080p). Dla deweloperów i zespołów szukających ujednoliconego, zgodnego z OpenAI interfejsu API do dostępu do rodziny modeli Wan i 500+ innych z prostą integracją, CometAPI zapewnia efektywną ścieżkę — aktualnie oferuje Wan 2.7 i rosnący katalog wideo przez /v1/videos.
Najważniejsze informacje
- Native 30-second single-ujęciowe generowanie (podwojony wcześniejszy limit Wan 2.7/2.5 ~15 s) z inteligentnym dopasowaniem długości.
- Omni-Reference: do ~10–20 mieszanych zasobów (obrazy, wideo ≤15 s łącznie, audio, jeden dokument/strona) dla silnej spójności bohatera, produktu i stylu.
- Konwersja dokumentów i stron WWW na wideo to wyróżnik: przekaż PDF, prezentację, arkusz kalkulacyjny lub publiczny URL i otrzymaj ustrukturyzowany film.
- Natywne generowanie audio w tym samym przebiegu; rozdzielczości 480p/720p/1080p; wiele proporcji obrazu.
- Silniejsza wierność twarzy/mikroekspresji, stabilniejsze odniesienia i czystszy tekst ekranowy niż we wcześniejszych generacjach.
- Dostęp przez Alibaba Cloud Model Studio / Qwen Cloud (model
wan3.0-video), wan.video oraz platformy zewnętrzne. Dla usprawnienia wielomodelowego rozwoju użyj zunifikowanego punktu końcowego wideo CometAPI. - Twórz prompty jak skrót ujęcia (subject + action + camera + timing + constraints) i jawnie etykietuj odniesienia (@Image1 itd.).
Czym jest Wan 3.0?
Wan 3.0 to najnowsza flagowa wersja rodziny generatorów wideo Tongyi Wanxiang (Wan) Alibaby, opracowana przez Tongyi Lab. Nawiązuje do linii diffusion-transformer wcześniejszych otwartych i zamkniętych wydań Wan (w tym szeroko analizowanej otwartej serii Wan z 2025 roku).
Kluczowe ulepszenia względem Wan 2.7 / 2.5 obejmują:
- Maksymalny natywny czas wydłużony do 30 sekund w jednej ciągłej generacji (nie sklejane klipy).
- Rozszerzone wejścia multimodalne poza tekst/obraz/wideo/audio o dokumenty biurowe i publiczne strony WWW.
- Ulepszony rendering „Reality-grade” dla twarzy, mikroekspresji, detali produktów oraz spójności treści cyfrowych/interfejsów.
- Ujednolicony model all-in-one obejmujący text-to-video (T2V), image-to-video (I2V), pierwszą i ostatnią klatkę, reference-to-video oraz pokrewne możliwości edycji/rozszerzania.
Alibaba pozycjonuje go do tworzenia filmów marketingowych, krótkich dramatów, treści społecznościowych, demonstracji produktów, materiałów szkoleniowych/symulacyjnych (np. robotyka lub AV) oraz korporacyjnych explainerów. Model pozostaje zamknięty (weights) / dostępny wyłącznie przez API (otwarte wagi kończą się na wcześniejszych wydaniach Wan 2.x).
Dane i źródła wspierające: List pricing examples (international): 480p $0.05/s, 720p $0.10/s, 1080p $0.20/s (30‑sekundowy klip 1080p ≈ $6 standard). Niektóre platformy oferują poziomy Standard vs szybszy Prime lub tymczasowe rabaty.
Jak używać interfejsu API Wan 3.0
Alibaba Cloud udostępnia Wan 3.0 przez interfejs API generowania wideo Model Studio. Obecny identyfikator modelu to:
wan3.0-video
API wykorzystuje asynchroniczną generację wideo. Przykładowe żądanie:
curl --location 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
-H 'X-DashScope-Async: enable' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "wan3.0-video",
"input": {
"prompt": "A cinematic product commercial showing a premium coffee machine in a modern kitchen."
},
"parameters": {
"resolution": "720P",
"ratio": "16:9",
"duration": 10,
"enable_thinking": false
}
}'
Dokumentacja API Alibaby wskazuje, że model, endpoint i klucz API muszą należeć do tego samego regionu. API jest asynchroniczne, więc aplikacje powinny przesłać zadanie, a następnie pobrać wygenerowany wynik po zakończeniu przetwarzania.
Dla image-to-video i przepływów opartych na odniesieniach obiekt input może zawierać media referencyjne. Aktualny przykład Alibaby demonstruje połączenie wideo referencyjnego i obrazów referencyjnych w tym samym żądaniu.
Jak używać Wan 3.0 przez CometAPI (zalecane dla deweloperów)
CometAPI oferuje ujednolicony, zgodny z OpenAI interfejs do 500+ modeli, w tym wideo z rodziny Alibaba Wan (obecnie lista zawiera Wan 2.7 z konkurencyjnym cennikiem za sekundę; sprawdź aktualny katalog, gdy dostępność Wan 3.0 się rozszerza). Generowanie wideo używa endpointu /v1/videos z multipart form data — idealne dla środowisk produkcyjnych, automatyzacji n8n/Make lub przełączania między Wan, Seedance, Kling, Veo, MiniMax itd. pod jednym kluczem.
Kroki CometAPI:
- Zarejestruj się / zaloguj na cometapi.com i utwórz klucz API (sk-…).
- Przejrzyj dokumentację API wideo (apidoc.cometapi.com) i listę modeli, aby poznać dokładny identyfikator Wan (np. wzorzec
wan2.7; potwierdź najnowszą wersję). - Wyślij żądanie POST na
https://api.cometapi.com/v1/videosz polami formularza: - Odbierz zadanie/ID; odpytywaj endpoint statusu lub użyj webhooków do czasu ukończenia.
- Pobierz wynikowy plik wideo.
- Monitoruj zużycie i koszty w panelu CometAPI (rozliczenie pay-as-you-go, bez minimalnych miesięcznych progów).
Jak skutecznie tworzyć prompty dla Wan 3.0
Traktuj prompty jak skróty ujęć, a nie luźne podpisy. Sprawdzona struktura (zaadaptowana z wytycznych społeczności i platform):
Formuła w stylu SPACE lub lista ujęć:
- Temat: konkretne opisanie kto/co.
- Wykonanie/Akcja: widoczny ruch i zmiany stanów w kolejności czasowej.
- Atmosfera/Sceneria: miejsce, czas, oświetlenie, pogoda.
- Kamera: wielkość ujęcia + jeden wyraźny ruch (powolny najazd, orbitowanie, tracking, statyczne).
- Dodatkowe: styl, wskazówki audio, tempo, ograniczenia („zachowaj czytelność etykiety”, „zachowaj tożsamość twarzy”).
Dla 30‑sekundowych klipów wieloczęściowych ponumeruj ujęcia z zakresami czasu:
Overall: A premium product reveal of a ceramic perfume bottle on wet black stone at dusk.
Shot 1 [0-8s]: Wide establishing, slow three-quarter orbit, warm rim light, gentle rain.
Shot 2 [8-18s]: Closer product focus, bottle rotates slowly, label and gold cap remain sharp.
Shot 3 [18-30s]: Final push-in to detail, soft ambient score, hold on the logo.
Keep bottle shape, label position, and gold cap consistent. Cinematic, calm pacing, no text overlays.
Wiązanie odniesień (kluczowe dla Omni-Reference):
@Image1 is the female character (face and yellow jacket).
@Image2 is the rainy alley background.
@Audio1 provides the voice timbre.
The character from @Image1 walks through the alley from @Image2 and says “…” using the voice of @Audio1.
Dodatkowe wskazówki:
- Bądź precyzyjny w kwestii obserwowalnych działań i relacji przestrzennych.
- Używaj negatywnych promptów dla typowych błędów (zniekształcone dłonie, niepożądany tekst, dryf stylu).
- Dla dokumentów: „Utwórz wideo wyjaśniające zgodne ze strukturą dołączonego PDF, z naciskiem na trzy kluczowe metryki ze strony 2 i rekomendacje w podsumowaniu.”
- Iteruj: najpierw generuj krótsze wersje, następnie rozwijaj udane segmenty.
- Język kamery i opisy oświetlenia poprawiają jakość filmową.
Dlaczego warto używać Wan 3.0?
Wan 3.0 jest najbardziej przekonujący, gdy aplikacja musi przekształcić wiele rodzajów materiału źródłowego w spójne wideo, a nie tylko zamienić prompt tekstowy w krótki klip.
Jego najsilniejsze zalety to:
- Natywne generowanie 30‑sekundowych wideo
- Text-to-video i image-to-video
- Generowanie wideo z wieloma odniesieniami
- Wejścia: tekst, obraz, wideo, audio i dokumenty
- Przepływy pracy: dokument/strona WWW → wideo
- Natywne generowanie audiowizualne
- Wyjście 1080P
- Edycja wideo oparta na instrukcjach
- Silna spójność odniesień
- Rozliczanie per sekunda
- Jeden model dla wielu kreatywnych przepływów pracy
Dla deweloperów budujących narzędzia filmowe AI, systemy reklamowe, generatory wideo produktowych, platformy edukacyjne lub multimodalne agentowe narzędzia kreatywne, te możliwości mogą znacząco zredukować liczbę oddzielnych modeli i etapów wstępnego przetwarzania.
Wnioski i rekomendacja
Wan 3.0 stanowi istotny krok w kierunku praktycznego, produkcyjnego wideo AI: dłuższe ciągłe ujęcia, rzeczywista konwersja dokumentów na wideo i silniejsza kontrola multimodalna. Połączone z przemyślanymi promptami i dyscypliną odniesień może skompresować dni tradycyjnej produkcji do minut dla wielu zastosowań marketingowych, wyjaśniających i krótkich form.
Dla zespołów i deweloperów budujących aplikacje lub narzędzia wewnętrzne, zacznij od oficjalnych kanałów Alibaby dla najczystszego doświadczenia Wan 3.0, a rozważ CometAPI (cometapi.com) jako wysoko produktywną bramę. Jego zunifikowane API wideo, szerokie pokrycie modeli (w tym obecny Wan 2.7 i rozszerzający się katalog), zgodny z OpenAI interfejs oraz przejrzysty model pay-as-you-go ułatwiają eksperymenty, skalowanie i łączenie generacji klasy Wan z komplementarnymi LLM, obrazami i modelami audio w ramach jednej integracji.
Sprawdź najnowszą listę modeli i dokumentację w CometAPI oraz Alibaba Cloud Model Studio, eksperymentuj z krótkimi klipami, dopracuj prompty w formie listy ujęć i skaluj do pełnych 30‑sekundowych produkcji. Połączenie dłuższego natywnego czasu i Omni-Reference otwiera nowe kreatywne i biznesowe przepływy pracy, które wcześniej były kłopotliwe lub kosztowne.
