Alibaba и ByteDance теперь предлагают две необычно полнофункциональные 30‑секундные системы ИИ‑видео. Одна делает приоритетом единый конвейер «всё‑в‑одном», который может превращать документы и веб‑страницы в видео; другая — длительное повествование, плотное управление референсами и «ювелирный» аудиовизуальный монтаж. Это руководство отделяет проверенные спецификации от независимых бенчмарков, чтобы разработчики выбирали по пригодности к продакшену, а не по заявлениям при запуске.
TL;DR
Суть: Wan 3.0 — более сильный вариант по умолчанию, если вам нужен наиболее ясный независимый сигнал качества, вывод 1080p, входы документ/веб‑страница и более низкая текущая стартовая стоимость API. Seedance 2.5 — более специализированный выбор для креативного продакшена, когда нужны до 50 референсов, многораундовое продолжение, редактирование на уровне таймштампов, рабочие процессы с green screen или предвизуализация white‑model.
Пока нет чистого публичного head‑to‑head бенчмарка. Artificial Analysis на данный момент ставит модель Alibaba на первое место в своем поле text‑to‑video с аудио, тогда как релиз ByteDance пока не фигурирует в этой же оценке. Поскольку Seedance 2.5 ещё не оценён в том же поле, эта таблица лидеров не может поддержать прямое сравнение качества между двумя моделями.
Wan 3.0 vs Seedance 2.5: Быстрое сравнение
| Категория | Wan 3.0 | Seedance 2.5 |
|---|---|---|
| Разработчик | Alibaba Tongyi / Wan | ByteDance Seed |
| Релиз / доступность | Публичный релиз API: Aug 24, 2026 | Официальный запуск: Jul 31; маршрут CometAPI: Aug 6, 2026 |
| Основная концепция | Мультимодальный видеопродакшен «всё‑в‑одном» | Совместная генерация аудио‑видео для управляемого сторителлинга |
| Макс. нативная длительность | 2–30 секунд | 4–30 секунд. |
| Разрешение вывода | 480p, 720p, 1080p | КометAPI на текущий момент документирует маршруты 480p и 720p |
| Объём референсов | До 10 изображений + 5 видеоклипов + 5 аудиоклипов; плюс 1 документ или 1 публичная веб‑страница | 30 изображений + 10 видео + 10 аудио |
| Типы входа | Текст, изображение, видео, аудио, документы, веб‑страницы | Текст, изображение, видео, аудио |
| Нативное аудио | Речь, фоновая музыка, звуковые эффекты | Совместная генерация аудио‑видео с синхронизированным звуком |
| Редактирование | Редактирование по инструкциям, продление, контроль первого/последнего кадра | Редактирование по таймштампам, green screen, правки камеры и референсов |
| Независимый бенчмарк | #1 T2V с аудио; 1,241 Elo | Пока не указан в той же оценке |
| Стартовая цена CometAPI | $0.04 за сгенерированную секунду | $0.0824 за сгенерированную секунду |
| Лучший стартовый кейс | Демонстрации продуктов, объясняющие ролики, документ‑в‑видео, дефолт с упором на качество | Нарратив с большим числом референсов, контроль в рекламе/кино, точечные правки |
Что такое Wan 3.0?
Последняя хостинговая видеомодель Alibaba объединяет text‑to‑video, image‑to‑video, генерацию по референсам, редактирование, продление и нативное аудио в одной системе. Её определяющая особенность — не только потолок в 30 секунд: она принимает творческий контекст из изображений, видео, аудио, офисных документов и публичных веб‑страниц, позволяя использовать продуктовый бриф или презентацию как часть инструкции к генерации.
Официальное руководство по API Wan 3.0 указывает до 30 секунд при 30 fps, вывод 480p/720p/1080p и нативные речь/фон-музыку/звуковые эффекты. Документированные лимиты на запрос: до 10 референс‑изображений, 5 референс‑видео и 5 референс‑аудио; также запрос может включать один поддерживаемый документ или одну публичную веб‑страницу. Также задокументированы контроль первого кадра и первого/последнего кадра, продолжение видео и редактирование на естественном языке.
Источник: Официальная витрина Alibaba Tongyi Wan
Спецификации модели Alibaba
| Спецификация | Проверенное значение |
|---|---|
| Статус модели | Хостинговая коммерческая модель; API доступен |
| Режимы генерации | Text‑to‑video, image‑to‑video, reference‑to‑video, редактирование, продолжение |
| Максимальная длительность | 30 секунд на генерацию; документировано 2–30 секунд |
| Частота кадров | 30 fps |
| Разрешение | 480p, 720p, 1080p |
| Соответствия | До 10 референс‑изображений, 5 референс‑видео и 5 референс‑аудио; также можно использовать 1 документ или 1 публичную веб‑страницу |
| Документы | DOC, XLS, PPT, PDF, TXT, KEY, PAGES, NUMBERS, MD |
| Ограничения документов | До 100 MB и 50 страниц |
| Аудио | Нативная речь/диалоги, фоновая музыка и звуковые эффекты |
| Идентификатор модели CometAPI | wan3.0 |
| Endpoint CometAPI | POST /v1/videos; асинхронный конвейер «создать‑и‑проверять статус» |
Где выделяется модель Alibaba
- Конвертация документа и веб‑страницы в видео убирает этап препроцессинга для презентаций, отчётов, продуктовых страниц, обучающих материалов и корпоративных объяснителей.
- Маршрут 1080p и вывод 30 fps дают чётко задокументированный путь к финальной доставке.
- Одна и та же модель покрывает генерацию, кондиционирование по референсам, редактирование и продление, снижая оркестрацию между моделями.
- Текущие независимые результаты по T2V и видеомонтажу дают более сильные публичные доказательства, чем одни лишь демонстрации вендора.
Что такое Seedance 2.5?
Новая аудио‑видео модель ByteDance построена вокруг полноценных 30‑секундных историй, больших мультимодальных наборов референсов и продакшен‑редактирования. Модель может организовывать несколько связанных шотов в одной генерации, продолжать существующий результат в дополнительных раундах и поддерживать устойчивый аудиовизуальный язык на длинных нарративах.
В официальном анонсе ByteDance документирует до 30 изображений, 10 видеоклипов и 10 аудиоклипов за проход. Также описаны правки на уровне таймштампов, замена фона по green screen, правки перспективы камеры, референсы движения, творческие референсы и управление clay‑render для композиции, мизансцены, освещения и планирования камеры.

Источник: Официальная витрина ByteDance Seedance 2.5
Спецификации модели ByteDance
| Спецификация | Проверенное значение |
|---|---|
| Статус модели | Официально запущена; коммерческая платформа и доступ к API |
| Режимы генерации | Text‑to‑video, image‑to‑video, reference‑to‑video, продление, редактирование |
| Максимальная длительность | ByteDance официально подтверждает до 30 секунд на генерацию; текущий маршрут CometAPI принимает 4–30 секунд |
| Продолжение | Многораундовое продление; на странице продукта описано до двух продлений |
| Разрешение | CometAPI на текущий момент документирует платные маршруты 480p и 720p |
| Референсы | До 30 изображений, 10 видеоклипов и 10 аудиоклипов |
| Типы входа | Текст, изображение, видео, аудио |
| Документы | Не указаны как нативный вход референсов в официальных материалах Seedance 2.5 |
| Лимиты документов | Не применимо / не задокументировано для текущего маршрута Seedance 2.5 |
| Аудио | Совместная аудио‑видео генерация и референс‑аудио |
| Редактирование | Контроль по таймштампам, green screen, перспектива камеры, редактирование по референсам |
| Предвизуализация | Управление clay‑render / white‑model |
| Идентификатор модели CometAPI | seedance-2-5 |
| Endpoint CometAPI | POST /v1/videos; асинхронный конвейер «создать‑и‑проверять статус» |
Где выделяется модель ByteDance
- Пятьдесят суммарных референсов дают авторам больше пространства для ограничений по множеству персонажей, локаций, бренду, реквизиту, голосам и движению.
- Правки на уровне таймштампов позволяют менять конкретный бит, действие, звук или сегмент камеры, не рассматривая всё видео как одноразовый черновик.
- Рабочие процессы с green screen и clay‑render связывают генеративное видео с традиционными практиками превиза и композитинга.
- Многораундовое продление предназначено для расширения связного визуального и звукового языка за пределы исходного 30‑секундного клипа.
Wan 3.0 vs Seedance 2.5: Результаты бенчмарков
Правило бенчмарка: напрямую сопоставимы только результаты, полученные в одной и той же таблице лидеров, по одной задаче, в одном режиме аудио и одним методом голосования. Демонстрации вендоров и оценки старых версий полезны как контекст, но они не заменяют отсутствующий head‑to‑head результат.
Текущая Artificial Analysis Text to Video Leaderboard ставит модель Alibaba на первое место в поле с аудио при 1,241 Elo, с 95% доверительным интервалом +/-9 и 6,195 слепыми сравнениями. Тот же оценщик также ставит её первой в аудио‑включённом видеомонтаже — 1,189 Elo, с интервалом +/-7 и 5,231 выборкой.
Релиз ByteDance пока не фигурирует в этих двух таблицах. Artificial Analysis приводит более старую генерацию Seedance, но использовать этот старый балл как представление новой модели методологически неверно. Следовательно, наиболее справедливый вывод: у Alibaba сейчас более сильные независимые доказательства, а не то, что ByteDance независимо доказана слабее.

Источник: Таблица лидеров Artificial Analysis по Text to Video
| Тип доказательств | Модель Alibaba | Модель ByteDance | Интерпретация |
|---|---|---|---|
| Text‑to‑video с аудио | 1,241 Elo; #1; +/-9; 6,195 образцов | Не указана | Независимое прямое сравнение недоступно |
| Видеомонтаж с аудио | 1,189 Elo; #1; +/-7; 5,231 образцов | Не указана | Независимое прямое сравнение недоступно |
| Официальные качественные данные | Рендер «уровня реальности», длительная согласованность, omni‑reference | Долговременный сторителлинг, плотный контроль референсов, правки по таймштампам | Разные демо и заявления; не оценены напрямую |
Wan 3.0 vs Seedance 2.5: Ключевые различия
1. Длинный нарратив и временная согласованность
Обе модели генерируют до 30 секунд за раз. Официальный диапазон API Wan 3.0 — 2–30 секунд, тогда как официальная документация BytePlus для Seedance 2.5 указывает 4–30 секунд; текущий маршрут CometAPI для Seedance также документирует 4–30 секунд. Таким образом, Wan — задокументированный вариант для нативных шотов 2–3 секунды на этих маршрутах. Подход Alibaba наиболее силён, когда клип должен поглотить разнородный исходный материал и превратить его в единый результат. Подход ByteDance — когда в 30 секунд нужно уместить продуманный нарратив, несколько связанных шотов и последующее продолжение с согласованными персонажами, окружением, ритмом и звуком.
Итог: выбирайте Alibaba для самостоятельного мультимодального продакшен‑запроса; выбирайте ByteDance для эпизодического или многораундового нарратива.
2. Визуальное качество, движение и физическая правдоподобность
У Alibaba более ясный публичный сигнал качества, поскольку её вывод сейчас лидирует в слепом предпочтении в поле T2V с аудио. Материалы продукта также акцентируют лица, микро‑мимику, детали продукта, текст, пространственную компоновку и физические взаимодействия. ByteDance делает упор на более плавные переходы, стабильность объектов между склейками, более реалистичные текстуры и свет, а также движение, следующее пространственной структуре clay‑render референсов.
Итог: Alibaba — первый тест, подтверждённый данными, для общего визуального предпочтения. ByteDance остаётся крайне сильной для поставленного мизансценирования, хореографии камеры и сцен, спланированных из превиз‑активов.
3. Контроль по референсам и согласованность персонажей
Wan 3.0 принимает до 10 референс‑изображений, 5 референс‑видео и 5 референс‑аудио, плюс один поддерживаемый документ или одну публичную веб‑страницу. Seedance 2.5 принимает более крупный традиционный набор: до 30 изображений, 10 видео и 10 аудио, но официальные материалы не указывают документы или веб‑страницы как нативные входы. Этот более высокий потолок традиционных референсов важен при брифе с актёрским составом, множеством окружений, вариациями продукта, костюмами, реквизитом, голосовыми образцами, референсами камеры и движения.
Итог: ByteDance выигрывает по плотности референсов; Alibaba — по широте типов референсов.
4. Нативное аудио, диалоги и звуковой дизайн
Обе модели генерируют звук вместе с изображением, а не требуют отдельного дубляжа. Alibaba явно документирует диалоги, фоновую музыку и звуковые эффекты. ByteDance опирается на единую аудио‑видео архитектуру и поддерживает аудио‑референсы, согласованность голоса и таргетированные аудиовизуальные правки.
Итог: на уровне спецификаций паритет. Протестируйте разборчивость диалога, лип‑синхронность, идентичность голоса, стабильность фоновой музыки и тайминг эффектов по одному сценарию, прежде чем выбирать маршрут.
5. Редактирование и итерации
Alibaba покрывает редактирование на естественном языке, продление и процессы с опорой на кадры внутри одной модели «всё‑в‑одном». ByteDance идёт глубже к рабочему процессу уровня редактора: подсказки могут целиться в конкретные таймштампы, заменять фон через green screen, настраивать перспективу камеры и править персонажей, действия, сюжет или аудио при сохранении окружающей непрерывности.
Итог: у ByteDance более мощная документированная панель точечных творческих правок; у Alibaba — более простой унифицированный конвейер.
6. Документы, веб‑страницы и бизнес‑контент
Это наиболее бесспорное преимущество Alibaba. PDF, презентация, таблица, текстовый документ, файл Apple, Markdown или веб‑страница могут стать исходным материалом для объясняющего ролика, продуктового видео, обучающего клипа или руководящего резюме. Обзор модели ByteDance фокусируется на тексте, изображениях, видео и аудио, а не на парсинге документов.
Итог: выбирайте Alibaba для документ‑в‑видео, веб‑страница‑в‑видео, корпоративных знаний и автоматизированного репурпоза контента.
7. Разрешение и рабочий процесс доставки
Alibaba документирует маршруты 480p, 720p и 1080p. Это поддерживает чистую лестницу: итерации на 480p, обзор на 720p и генерация принятых шотов в 1080p. CometAPI сейчас документирует цены 480p и 720p для маршрута ByteDance; официальный запуск ByteDance не приводит эквивалентную таблицу разрешений по маршрутам.
Итог: у Alibaba более чётко задокументированный путь к высокому разрешению. Подтверждайте активный маршрут ByteDance, прежде чем обещать разрешение как твёрдую продуктовую метрику.
Сравнение цен
Публичные карточки моделей CometAPI показывают стартовую цену $0.04 за секунду для Alibaba и $0.0824 за секунду для ByteDance. Их детальные разделы цен также отражают верхние цены по маршрутам: у Alibaba $0.05/$0.10/$0.20 за секунду для 480p/720p/1080p, у ByteDance $0.103 и $0.231 за секунду для 480p и 720p. Поскольку страницы моделей и скидки по маршрутам могут меняться независимо, производственные оценки следует считать по точному маршруту, выбранному при отправке.
| Статья затрат | Wan 3.0 | Seedance 2.5 | Примечания |
|---|---|---|---|
| Заголовочная стартовая цена CometAPI | $0.04/с | $0.0824/с | У Alibaba примерно на 51% ниже при минимальной цене |
| Клип 10 секунд по стартовой цене | $0.40 | $0.824 | До повторных прогонов |
| Клип 30 секунд по стартовой цене | $1.20 | $2.472 | До повторных прогонов |
| Опубликованная цена маршрута 480p | $0.05/с | $0.103/с | Верхний/листинговый маршрут |
| Опубликованная цена маршрута 720p | $0.10/с | $0.231/с | Верхний/листинговый маршрут |
| Опубликованная цена маршрута 1080p | $0.20/с | Не указана в текущей таблице CometAPI | Проверяйте доступность маршрута |
Правило расчёта продакшен‑стоимости: сравнивайте цену за принятый клип, а не цену за секунду. Учитывайте отклонённые выходы, ретраи, апскейл, хранение, время на правки и человеческую проверку, необходимую для публикации.
Wan 3.0 vs Seedance 2.5: сильные стороны и компромиссы
| Модель | Сильные стороны | Компромиссы |
|---|---|---|
| Модель Alibaba | Независимое лидерство #1 в T2V с аудио; #1 в монтаже; входы документ/веб; 1080p; более низкая стартовая цена; унифицированный пайплайн | Потолок 20 референсов; хостинговая закрытая модель; длинные клипы всё ещё могут «плыть»; аудио/текст иногда требуют пост‑продакшена |
| Модель ByteDance | 50 референсов; многораундовое продление; правки по таймштампам; green screen; правки камеры; превиз clay‑render | Нет оценки в той же независимой системе; текущая таблица разрешений CometAPI ограничена 720p; официальные материалы признают ограничения сложной динамики и многосубъектных сцен |
Какую модель выбрать?
| Сценарий | Начальный выбор | Почему |
|---|---|---|
| Лучший дефолт для новой видео‑фичи | Модель Alibaba | Более сильные независимые доказательства и более низкая цена |
| 30‑секундный рекламный ролик продукта | Модель Alibaba | Входы документ/продукт, маршрут 1080p, более дёшевые итерации |
| PDF или веб‑страница → объясняющее видео | Модель Alibaba | Нативный парсинг документов и веб‑страниц |
| Кампания с множеством референсов | Модель ByteDance | До 50 креативных референсов |
| Короткая драма с множеством персонажей | Модель ByteDance | Нарративная целостность, плотные референсы, продление |
| Точная правка конкретного интервала | Модель ByteDance | Редактирование на уровне таймштампов |
| Green screen или clay‑render воркфлоу | Модель ByteDance | Явные профессиональные продакшен‑контроли |
| Качество по независимой оценке | Модель Alibaba | Текущее лидерство по слепым предпочтениям и монтажу |
| Финальное решение о внедрении | Тестируйте обе | Одинаковые ассеты, длительность, рубрика и порог приёмки |
Как провести корректный A/B‑тест
- Соберите набор из 20–40 подсказок, покрывающий продуктовые шоты, диалоги людей, сцены с несколькими персонажами, движение камеры, физику, текст/интерфейс и генерацию с большим числом референсов.
- Используйте совпадающие длительность, разрешение, соотношение сторон, требования к аудио и исходные ассеты там, где оба маршрута поддерживают эквивалентные настройки.
- Ослепите рецензентов относительно модели и отдельно оценивайте визуальное качество, соответствие подсказке, согласованность объектов, движение, тайминг аудио, качество диалога и объём правок.
- Записывайте провалы, ретраи, отказы по безопасностям, латентность генерации и минуты пост‑продакшена в дополнение к успешным выходам.
- Выбирайте маршрут с наименьшей стоимостью за принятый клип для каждой нагрузки, а не навязывайте универсального победителя.
Как получить доступ к обеим моделям через CometAPI
Оба маршрута доступны через CometAPI, что позволяет командам держать один аккаунт, ключ API, биллинг и асинхронный жизненный цикл видео при оценке разных провайдеров. Текущие ID моделей, видимые клиентам: wan3.0 и seedance-2-5.
- Создайте аккаунт и сгенерируйте ключ API. Сохраните его в переменной окружения на сервере.
- Откройте документацию видео‑API и подтвердите точные поля, поддерживаемые выбранным маршрутом модели.
- Отправьте POST /v1/videos, сохраните возвращённый ID задачи видео и опрашивайте GET /v1/videos/{id}, пока задача не достигнет конечного статуса.
- Скачайте готовый ассет и сохраните ID модели, маршрут, длительность, разрешение, задержку, цену и результат ревью вместе с артефактом.
Язык: Bash
export COMETAPI_KEY="your_api_key"
curl -X POST "https://api.cometapi.com/v1/videos" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-F 'model=wan3.0' \
-F 'prompt=Кинематографичное раскрытие продукта с синхронизированным атмосферным аудио.' \
-F 'seconds=10' \
-F 'size=1280x720'
# Для A/B-теста отправьте валидированный payload для Seedance с:
# -F 'model=seedance-2-5'
Не предполагайте, что каждый медиапараметр переносим лишь потому, что обе модели разделяют endpoint. Поля референсов, поддерживаемые разрешения, элементы редактирования и поведение callback могут оставаться специфичными для маршрута. Валидируйте каждый payload перед переключением продакшен‑трафика.
Wan 3.0 vs Seedance 2.5: ограничения и оговорки
- Независимые бенчмарки меняются по мере поступления новых голосов; Elo — сигнал относительного предпочтения, а не абсолютная мера соответствия подсказке или коммерческой пригодности.
- Отсутствие у ByteDance оценки в текущей независимой рамке не позволяет статистически обоснованного прямого ранжирования качества.
- Официальные демонстрации используют курируемые подсказки и ассеты. Реальные результаты зависят от сложности сюжета, фильтров безопасности, языка, соотношения сторон и качества референсов.
- В собственном посте о запуске ByteDance признаёт необходимость улучшений в физической правдоподобности сложной динамики и устойчивости взаимодействий многих субъектов.
- Длинные выходы Alibaba всё ещё могут страдать дрейфом идентичности, деформацией объектов, ошибками текста или дефектами аудио; 30 секунд — это лимит ёмкости, а не гарантия качества.
- Цены и доступность маршрутов могут меняться. Перепроверяйте живую страницу модели CometAPI перед публикацией фиксированных цен или закреплением unit‑экономики.
Заключение
Наиболее обоснованный ответ — по конкретной задаче. Alibaba сейчас предлагает более сильный пакет по умолчанию: лидерство в слепых предпочтениях, первое место в монтаже, входы документ и веб‑страница, задокументированный маршрут 1080p и более низкая отображаемая стартовая цена. Это логичный первый тест для продуктового видео, объясняющих роликов, автоматизированной конвертации бизнес‑контента и общих API‑внедрений.
ByteDance предлагает более специализированную систему творческого контроля. Её потолок в 50 референсов, многораундовое продление, правки на уровне таймштампов, рабочий процесс с green screen, правки камеры и превиз white‑model могут перевесить отсутствие бенчмарка, когда критериями приёмки являются профессиональная драматургия и точечные итерации.
В продакшене не выбирайте только по заголовкам. Пропустите один и тот же бриф через обе модели, измеряйте принятые выходы, а не первые попытки, и направляйте каждую задачу в систему, которая даёт нужное качество с меньшим числом ретраев и меньшим объёмом правок.
Частые вопросы
Wan 3.0 лучше, чем Seedance 2.5?
У Alibaba сейчас более сильные независимые доказательства и более широкая поддержка бизнес‑входов. ByteDance может быть лучше для плотных референсов, расширенного сторителлинга и точного творческого редактирования. Пока нет прямого сравнения Elo в одной системе.
Какая модель дешевле?
Текущие страницы CometAPI показывают стартовые цены $0.04 за секунду для Alibaba и $0.0824 за секунду для ByteDance. Итоговая стоимость зависит от маршрута, разрешения, ретраев и доли принятых клипов.
Какая модель поддерживает больше референсов?
Seedance 2.5 поддерживает более крупный традиционный набор: до 30 изображений, 10 видео и 10 аудио. Wan 3.0 поддерживает до 10 изображений, 5 видео и 5 аудио, и дополнительно может использовать один поддерживаемый документ или одну публичную веб‑страницу.
Какая модель лучше для видеомонтажа?
Alibaba сейчас лидирует в независимом поле аудио‑включённого видеомонтажа. ByteDance документирует более детальный творческий воркфлоу с правками по таймштампам, заменой фона через green screen, изменением перспективы камеры и редактированием по референсам. Лучший выбор зависит от того, важнее ли качество предпочтения или глубина контроля.
Обе модели генерируют нативное аудио?
Да. Обе рассчитаны на синхронную генерацию аудио и видео. Оцените ясность диалогов, лип‑синхронизацию, звуковые эффекты, стабильность музыки и согласованность голоса на собственных подсказках.
Можно ли получить доступ к обеим с одним ключом API?
Да. Обе сейчас доступны на CometAPI и используют его асинхронный рабочий процесс генерации видео, хотя допустимые поля запроса всё же нужно проверять по каждому маршруту.
