Технические характеристики Wan 3.0
| Спецификация | Wan 3.0 |
|---|---|
| Тип модели | Универсальная мультимодальная модель генерации видео |
| Статус модели | Публичный предварительный просмотр API |
| Типы ввода | Текст, изображение, видео, аудио, документы, веб-страницы |
| Генерация видео | Из текста в видео, из изображений в видео, по референсам — в видео |
| Редактирование видео | Редактирование на основе инструкций и референсов |
| Максимальная продолжительность | 30 секунд в одной генерации |
| Разрешение на выходе | 480P, 720P, 1080P |
| Нативная аудиовизуальная генерация | Да |
| Референсные материалы | До 20 мультимодальных референсных материалов |
| Входные документы | DOC, XLS, PPT, PDF, TXT, KEY, PAGES, NUMBERS, MD |
| Максимальный размер документа | 100 MB |
| Максимальное число страниц | 50 страниц |
| Доступ к API | Предварительный просмотр API Alibaba Cloud Model Studio |
| Режим генерации API | Асинхронный |
| Стоимость 480P | $0.05/sec |
| Стоимость 720P | $0.10/sec |
| Стоимость 1080P | $0.20/sec |
Wan 3.0 — это последняя универсальная мультимодальная модель генерации видео от Alibaba Cloud, официально запущенная в августе 2026 года. Ее главное улучшение по сравнению с предыдущими поколениями Wan — не просто более высокое визуальное качество, а объединение текста, изображений, видео, аудио, документов и веб-страниц в единый креативный рабочий процесс. По описанию Alibaba Cloud, модель поддерживает нативную 30-секундную генерацию видео, мультимодальные референсные входы, синхронизированную аудиовизуальную генерацию и точное редактирование видео.
Что такое Wan 3.0?
Wan 3.0 — это мультимодальная модель генерации видео нового поколения от Alibaba, предназначенная для преобразования текста, изображений, видео, аудио, документов и веб-контента в цельное видео.
Ранние пайплайны ИИ-видео часто требовали нескольких специализированных моделей: одна для text-to-video, другая для image-to-video, еще одна для сохранения согласованности по референсам, а также отдельные инструменты для монтажа и аудио. Wan 3.0 движется к производственной модели «все-в-одном», где эти входы можно объединять вокруг одной креативной инструкции.
Ключевая возможность — нативная 30-секундная генерация. Вместо короткого 5–10-секундного клипа, который нужно неоднократно продлевать и склеивать, Wan 3.0 может сгенерировать непрерывную 30-секундную последовательность за один проход. Демонстрации Alibaba показывают, что модель поддерживает целостность персонажей, окружения, действий, движения камеры, диалога и звука на протяжении более длинных сцен.
Еще одно важное изменение — Omni-Reference. Разработчики могут использовать несколько референсных материалов для задания персонажей, продуктов, окружений, движения и других визуальных характеристик. В официальном репозитории Wan 3.0 заявлена поддержка до 20 референсных ассетов, а на продуктовой странице Alibaba Cloud подчеркивается возможность сочетать изображения, текст, видео, аудио, документы и веб-страницы в качестве креативных референсов.
Это делает Wan 3.0 меньше похожей на простой генератор «промпт-в-видео» и больше — на мультимодальный креативный производственный движок.
Основные возможности Wan 3.0
- Нативная 30-секундная генерация видео: Wan 3.0 может генерировать до 30 секунд видео за один проход, поддерживает интеллектуальный выбор длительности и расширение видео.
- Omni-Reference: Текст, изображения, видео и аудио можно комбинировать как референсы. Wan 3.0 также распространяет генерацию на основе референсов на документы и веб-страницы.
- От документов к видео: Файлы PPT, PDF, DOC, XLS, TXT, KEY, PAGES, NUMBERS и MD можно использовать как креативные входы, превращая презентации, отчеты и структурированную информацию в видео-контент.
- Нативная аудиовизуальная генерация: Wan 3.0 может генерировать видео и звук одновременно, поддерживая диалоги, окружающие звуки и музыкально ориентированные аудиовизуальные сцены.
- Согласованность референсов: Модель спроектирована для сохранения персонажей, реквизита, окружений, пространственных отношений и стилей в референсно-управляемых генерациях.
- Редактирование видео: Wan 3.0 поддерживает изменения сгенерированного визуального контента, сюжета и диалогов без необходимости начинать каждую итерацию с нуля.
Как Wan 3.0 сравнивается с другими видеомоделями?
| Модель | Нативная длительность | Изображение-в-видео | Контроль по референсам | Аудио | Ввод документов/веб | Основное преимущество |
|---|---|---|---|---|---|---|
| Wan 3.0 | 30s | ✓ | Strong | ✓ | ✓ | Универсальное мультимодальное производство |
| Wan 2.7 | 15s | ✓ | ✓ | ✓ | Limited | Устоявшиеся видеопроцессы Wan |
| Grok Imagine Video 1.5 | Up to 15s | ✓ | ✓ | ✓ | — | Быстрое креативное короткое видео |
| Veo | Model-dependent | ✓ | ✓ | ✓ | Multimodal | Кинематографическая генерация |
| Kling | Model-dependent | ✓ | ✓ | ✓ | — | Генерация персонажей и движений |
| Seedance | Model-dependent | ✓ | ✓ | ✓ | — | Креативное и многокадровое видео |
Ключевое отличие — широта входных данных.
По сравнению с Grok Imagine Video 1.5, Wan 3.0 значительно ближе к производственному процессу «все-в-одном». Grok ориентирован на короткую генерацию видео с текстом, изображениями и референсами, тогда как Wan 3.0 дополнительно включает документы, веб-страницы, аудио и видео как прямые креативные референсы.
По сравнению с Wan 2.7, крупнейшее архитектурное и продуктовое изменение — переход к единому мультимодальному рабочему процессу и нативной 30-секундной планке генерации, тогда как предыдущие версии ограничивались более короткими клипами. Текущие материалы Alibaba Cloud о Wan 3.0 явно позиционируют модель вокруг длинных повествований и генерации Omni-Reference.
По сравнению с Kling и Veo, сильнейшее отличие Wan 3.0 — не обязательно «лучшие кадры в каждом фрейме», а способность объединять большой объем исходных материалов и удерживать эту информацию на протяжении более длинной генерации.
Для сценариев, где ввод — просто «напишите этот промпт и сгенерируйте кинематографичный клип», другие модели могут оставаться конкурентоспособными. Для процессов, где ввод — «вот изображение продукта, референс персонажа, PDF, таблица, аудиосэмпл и креативный бриф — превратите это в цельное видео», Wan 3.0 становится гораздо более привлекательной.
Представительные сценарии использования Wan 3.0
1. Создание фильмов и историй с ИИ
Возможность единовременной 30-секундной генерации делает Wan 3.0 полезной для сцен с непрерывным движением камеры, диалогами и множеством действий без склейки коротких клипов.
2. Рекламные ролики о продуктах
Изображение продукта или набор референсов можно комбинировать с промптом «в стиле режиссера» для создания демонстраций продукта, UGC-рекламы и кинематографичных бренд-роликов.
3. Преобразование презентаций в видео
Wan 3.0 может обрабатывать форматы PPT, PDF, DOC, XLS и другие поддерживаемые документы, что делает ее подходящей для превращения отчетов, презентаций и структурированной информации в визуальные повествования.
4. Видео с сохранением согласованности персонажей
Референсные изображения, видео и другие медиа можно использовать для задания персонажей, объектов и окружений перед генерацией сцены.
5. Контент для социальных сетей
30-секундная длительность и вертикальное соотношение сторон 9:16 делают Wan 3.0 подходящей для короткого контента, рекламы и повествовательных клипов.
6. Монтаж и итерации видео
Wan 3.0 может изменять уже сгенерированный контент, включая визуальные элементы, сюжет и диалоги, поддерживая итеративные креативные процессы.
Параметры API Wan 3.0
Официальный API использует асинхронную конечную точку генерации видео. Упрощенный запрос содержит объекты model, input и parameters.
Важные параметры:
| Параметр | Описание |
|---|---|
| model | wan3.0-video |
| input.prompt | Режиссерская инструкция для генерации |
| input.media | Референсные изображения, видео, аудио, файлы или веб-ресурсы |
| parameters.resolution | 480P, 720P, 1080P |
| parameters.ratio | adaptive, 16:9, 4:3, 1:1, 3:4, 9:16 |
| parameters.duration | 2–30 секунд; -1 включает интеллектуальный выбор длительности |
| parameters.audio | Включать ли звуковую дорожку |
| parameters.seed | Случайное зерно для воспроизводимости |
| parameters.watermark | Добавлять ли водяной знак |
В официальной документации указано, что при отсутствии входного видео длительность может быть целым числом от 2 до 30 секунд. При наличии входного видео суммарная длительность входа и выхода должна укладываться в поддерживаемый общий лимит.
Как использовать API Wan 3.0 в CometAPI
Для разработчиков, использующих несколько моделей генерации видео с ИИ, CometAPI может служить единым слоем доступа для экспериментов с Wan 3.0 наряду с другими моделями.
Типовой рабочий процесс:
- Создайте аккаунт или войдите в CometAPI.
- Получите ключ API CometAPI.
- Выберите конечную точку модели Wan 3.0.
- Отправьте запрос на генерацию: из текста в видео, из изображения в видео или на основе референсов.
- Укажите разрешение, длительность, соотношение сторон и другие поддерживаемые параметры.
- Отслеживайте асинхронную задачу генерации.
- Получите сгенерированное видео по завершении обработки.
Точный endpoint CometAPI и поддерживаемые параметры следует сверить с актуальной интеграцией Wan 3.0 в CometAPI перед внедрением, особенно учитывая, что исходный API Alibaba все еще находится в режиме предварительного просмотра.