Specyfikacja techniczna Wan 2.7
| Element | Wan 2.7 (Video Suite) |
|---|---|
| Provider | Alibaba Tongyi Lab |
| Model family | Wan 2.7 Video Suite |
| Architecture | Mixture-of-Experts (MoE) o 27B parametrach |
| Input types | Tekst, obrazy, wideo, referencje audio |
| Output types | Generowane/edytowane klipy wideo z opcjonalnym dźwiękiem |
| Supported modes | Tekst-na-wideo (T2V), Obraz-na-wideo (I2V), Referencja-na-wideo (R2V), edycja wideo |
| Resolution | Wyjścia 720P i 1080P |
| Video duration | 2–15 sekund |
| Audio support | Natywne generowanie audio, referencje głosowe, przepływy pracy lip-sync |
| Reference capability | Wiele referencji obrazów/wideo, spójność tożsamości |
| Character consistency | Obsługuje wielu referencyjnych bohaterów w zależności od przepływu pracy |
| Release generation | Główny następca Wan 2.6 |
Czym jest Wan 2.7?
Wan 2.7 to flagowy multimodalny pakiet generowania wideo firmy Alibaba, zbudowany z myślą o kontrolowalnych przepływach pracy filmowych opartych na AI, a nie o prostym tworzeniu wideo na podstawie promptu. Rodzina modeli łączy generowanie, edycję, kontynuację i spójność sterowaną referencjami w jeden system, umożliwiając twórcom budowanie krótkich, filmowych klipów z lepszym zachowaniem spójności obiektu i większą kontrolą nad sceną.
W przeciwieństwie do wcześniejszych generatorów wideo, które skupiały się głównie na jakości promptu, Wan 2.7 kładzie nacisk na kontrolowalność poprzez zakotwiczenie klatek, wejścia referencyjne, synchronizację audio i ustrukturyzowane, wieloujęciowe przepływy pracy.
Główne funkcje Wan 2.7
- Potok planowania Thinking Mode: Model planuje kompozycję sceny i ruch przed renderingiem, poprawiając zgodność z promptem i ograniczając błędy spójności.
- Kontrola pierwszej i ostatniej klatki: Użytkownicy mogą zdefiniować klatkę otwierającą i końcową, a system interpoluje ruch pomiędzy nimi.
- Spójność tożsamości oparta na referencjach: Utrzymuje wygląd postaci, garderobę, obiekty i styl w wielu ujęciach.
- Natywne przepływy pracy multimodalne: Obsługuje tekst, obraz, audio i referencje wideo w ramach tego samego przepływu pracy.
- Zintegrowane generowanie audio: Muzyka w tle, dźwięki otoczenia i synchronizacja mowy mogą być generowane wraz z obrazem.
- Obsługa edycji i kontynuacji: Istniejące nagrania można wydłużać, przekształcać lub zmieniać ich styl bez budowania od zera.
Wyniki benchmarków Wan 2.7
Upublicznienie benchmarków Wan 2.7 pozostaje ograniczone w porównaniu z tekstowymi LLM-ami, ale oceny stron trzecich i testy społeczności wskazują na zauważalne poprawy stabilności ruchu, zgodności z promptem i kontrolowalności względem Wan 2.6.
Zgłaszane obserwacje w ekosystemie obejmują:
- Lepszą ciągłość ruchu względem wcześniejszych wydań Wan.
- Wyższe pozycje w rankingach zewnętrznych ewaluacji text-to-video.
- Poprawioną spójność wielu obiektów/bohaterów oraz zachowanie referencji.
- Lepszą integrację audio niż w wielu wcześniejszych otwartych modelach wideo.
Formalna transparentność benchmarków wciąż jest ograniczona, dlatego deklaracje wydajności należy interpretować ostrożnie.
Wan 2.7 vs Other Video Models
| Funkcja | Wan 2.7 | Veo 3.1 | Seedance 2.0 |
|---|---|---|---|
| Natywne przepływy pracy audio | Silna | Silna | Umiarkowana |
| Spójność oparta na referencjach | Silna | Umiarkowana | Umiarkowana |
| Kontrola pierwszej i ostatniej klatki | Tak | Częściowa | Ograniczona |
| Przepływy pracy edycji wideo | Tak | Tak | Ograniczona |
| Maksymalna typowa rozdzielczość | 1080P | Wyższej klasy, kinowej jakości wyjście | 1080P |
| Obsługa wielu referencji | Silny nacisk | Umiarkowana | Umiarkowana |
Ograniczenia Wan 2.7
- Krótki czas trwania klipów w porównaniu z narzędziami do produkcji długiej formy.
- Maksymalne wyjście 1080P ogranicza przepływy pracy wymagające ultrawysokiej rozdzielczości.
- Szybkie sceny ruchu mogą nadal generować artefakty niestabilności.
- Przepływy pracy z wieloma referencjami zwiększają złożoność i wymagania dotyczące inżynierii promptów.
- Publiczne raportowanie benchmarków pozostaje relatywnie skąpe.
Przykładowe zastosowania
- Krótkie filmy i storyboardy ze spójną postacią.
- Klipy marketingowe z synchronizacją audio.
- Generowanie wideo na media społecznościowe.
- Wizualizacja produktów i zwiastuny koncepcyjne.
- Kontynuacja wideo i przepływy pracy interpolacji scen.
- Animacja awatarów i postaci oparta na referencjach.
Jak korzystać z WAN 2.7 Video API w CometAPI
Krok 1: Wypróbuj WAN 2.7 Video API w Kie Al Playground
Najpierw przetestuj funkcje WAN 2.7, korzystając z WAN 2.7 Video API w CometAPI Playground. Prześlij obrazy, dodaj prompty lub użyj referencji, aby podejrzeć wygenerowane wideo WAN przed włączeniem WAN 2.7 AI video do swojego produkcyjnego przepływu pracy.
Krok 2: Uzyskaj klucz WAN 2.7 API i zapoznaj się z dokumentacją API
Uzyskaj klucz WAN 2.7 API z konsoli CometAPI i zapoznaj się z dokumentacją. Zapoznaj się z punktami końcowymi WAN 2.7 Video API, uwierzytelnianiem i parametrami wspierającymi text-to-video, image-to-video oraz przepływy pracy wideo WAN.
Krok 3: Generuj filmy WAN 2.7 AI i integruj je w swoim przepływie pracy
Użyj WAN 2.7 Video API, aby generować filmy WAN 2.7 AI na podstawie promptów, obrazów lub referencji. Integruj wyniki WAN 2.7 z przepływami pracy produktowymi, potokami treści lub narzędziami do wideo AI, aby umożliwić skalowalne tworzenie wideo.