GPT-6.1 Sol are now live on CometAPI →
ai-model/Исследования CometAPI

Что такое FLUX 3? Характеристики, бенчмарки, возможности, цены и доступ к API

Изучите мультимодальную модель ИИ Black Forest Labs, включая спецификации FLUX 3, бенчмарки, функциональные возможности, цены, архитектуру Self-Flow, конкурентов и доступ к API.

CometAPI
Deon GoodwinКоманда исследователей AI-моделей и API
Обновлено Oct 3, 2026 18 мин. чтения
Что такое FLUX 3? Характеристики, бенчмарки, возможности, цены и доступ к API
Использовать этот подход

Сделайте первый вызов API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Кратко: FLUX 3 — это унифицированная мультимодальная базовая модель Black Forest Labs. Ее публичный Video API генерирует ролики до 20 секунд при 24 fps, с опциональным синхронным звуком, из текста, изображений, ключевых кадров или существующего видео. Поддерживаются разрешения от HD до UHD/4K, при этом FLUX 3 Image и модель с открытыми весами FLUX 3 Dev остаются отдельными пунктами дорожной карты.

Что такое FLUX 3?

FLUX 3 — передовая мультимодальная модель от Black Forest Labs. Вместо независимого обучения одной модели для изображений, другой — для видео и третьей — для аудио, BFL обучает общее представление сразу по нескольким модальностям.

Ключевая идея в том, что изображения, видео и звук — это разные наблюдения одного и того же базового мира. Едущая машина имеет визуальный облик, движение, звук, пространственные отношения, материальные свойства и причинное поведение. Совместное обучение этих сигналов дает модели больше ограничений, чем обучение по отдельным кадрам.

Именно поэтому Black Forest Labs описывает FLUX 3 как шаг к модели реальности или модели мира, а не просто генератору изображений или видео. Уже выпущенная видеосистема демонстрирует это направление: синхронный звук, движение, структура сцены, диалоги, поведение камеры и звуки окружения обрабатываются в одном процессе генерации.

Не все заявленные возможности FLUX 3 пока доступны публично. По состоянию на сентябрь 2026 года доступна FLUX 3 Video, тогда как FLUX 3 Image и модель с открытыми весами FLUX 3 Dev остаются отдельными пунктами развёртывания.

Характеристики FLUX 3 — кратко

Следующие характеристики отражают текущее разработческое руководство FLUX 3, а не предварительную конфигурацию июльского запуска.

ХарактеристикаОфициальная документация FLUX 3
РазработчикBlack Forest Labs
Семейство моделейFLUX 3
Тип моделиУнифицированная мультимодальная базовая / генеративная видеомодель
Публичный релиз видео4 августа 2026 г.
Основное направление обученияСовместное представление изображений, видео и аудио
Исследовательская базаSelf-Flow
Текущий основной вывод APIВидео с синхронизированным звуком
Text-to-videoПоддерживается
Image-to-videoПоддерживается
Keyframe-to-videoПоддерживается
Продолжение видеоПоддерживается
Макс. длительность T2V/I2V20 секунд
Длительность продолжения видео5–15 секунд
Частота кадров24 fps
РазрешениеHD, FHD, QHD/2K и UHD/4K
Разрешение FHD 16:91920 × 1088
Ссылки на изображенияДо 10 для I2V/ключевых кадров
Нативное аудиоДа
Многоязычный диалогДа
Синхронизация губДа
Генерация нескольких шотовДа
Draft ModeДа
Публичная конечная точка FLUX 3 ImageПока не выпущена BFL
FLUX 3 Dev с открытыми весамиПланируется

Текущая документация BFL указывает 5–20 секунд для текст-видео и изображение-видео, тогда как продолжение видео принимает окно генерации 5–15 секунд. Поддерживаемые соотношения сторон: 21:9, 2:1, 16:9, 4:3, 1:1, 3:4 и 9:16.

Как работает FLUX 3?

Self-Flow

Ключевой исследовательской основой является Self-Flow — самообучающийся подход flow-matching от Black Forest Labs. Традиционные генеративные пайплайны часто полагаются на отдельные предобученные модели представлений или вспомогательное обучение. Self-Flow призван учить полезные представления прямо из генеративной цели.

Важным механизмом является Dual-Timestep Scheduling. Разным группам токенов могут назначаться разные уровни шума во время обучения. Это создает информационную асимметрию: некоторые части входа содержат больше полезной информации, чем другие, заставляя сеть строить представления, помогающие восстановить недостающее.

На практике FLUX 3 стимулируется к изучению отношений между объектами, кадрами, движением, звуком и временными событиями, а не к простому запоминанию того, как должен выглядеть отдельный кадр.

Что такое FLUX 3? Характеристики, бенчмарки, возможности, цены и доступ к API

Архитектура метода Self-Flow — официальный источник изображения: Black Forest Labs Self-Flow project

BFL также тестировала совместное мультимодальное обучение с использованием бэкбона на базе FLUX.2 на миллионах видео и сотнях миллионов изображений. Эксперименты поддерживают более широкую гипотезу FLUX 3 о том, что обучение представлений и генерация не обязаны быть отдельными системами.

Почему видео — центральный элемент FLUX 3

Видео особенно ценно для моделирования мира, поскольку содержит информацию, недоступную в статичном изображении. Один кадр может показать мяч над полом; видео раскрывает, что мяч падает, отскакивает, деформируется при ударе, издает звук и затем меняет направление.

BFL сообщила, что предсказание видео составляет более 95% вычислительных затрат обучения FLUX 3. Аудио сравнительно недорого, поскольку является гораздо более низкоразмерным сигналом, тесно связанным с видимыми событиями. Такое распределение помогает объяснить, почему именно видео стало первой возможностью FLUX 3, доступной в общем порядке.

Что умеет FLUX 3?

Текст-видео

Пользователи могут сгенерировать полноценный видеоролик по инструкциям на естественном языке. BFL заявляет, что выпущенная модель справляется с простыми и сложными промптами, координируя движение, логику сцены, визуальную композицию и звук. Это особенно полезно для подсказок, содержащих несколько последовательных событий, а не одного анимированного объекта.

Изображение-видео и ключевые кадры

FLUX 3 может анимировать исходное изображение, стремиться к конечному кадру или использовать несколько изображений как временные ключевые кадры. Текущий API поддерживает до десяти ссылок на изображения в сценариях изображение-видео, позволяя создателям контролировать, как сцена меняется со временем, вместо того чтобы просить модель импровизировать всю последовательность.

Продолжение видео

Можно передать существующее видео и его звук как контекст, и FLUX 3 сгенерирует, что будет дальше. BFL описывает продолжение, которое сохраняет движение, поведение камеры, диалог и звук на переходе — это существенно отличается от генерации второго независимого клипа и последующего склеивания файлов.

Нативное аудио и диалог

FLUX 3 создает звук во время генерации, не требуя отдельного этапа синтеза речи или звука. Выпущенные возможности аудио включают диалог, звуковые эффекты и фоновое звучание. Также поддерживаются многоязычные диалоги с синхронизацией губ.

Несколько шотов за одну генерацию

Один промпт может содержать несколько сцен или ракурсов. Это важно, поскольку многие прежние видеомодели сильнее всего работают при запросе одного короткого, визуально непрерывного плана; FLUX 3 явно спроектирован для поддержки многосценных последовательностей в одной генерации.

Draft Mode

Draft Mode — одно из наиболее практичных дополнений для массовой генерации видео. Вместо полной оплаты за каждый эксперимент с промптом разработчики могут создать более быстрый и недорогой предварительный просмотр, а затем улучшить выбранный черновик, сохраняя композицию и движение. Согласно текущему прайсингу BFL, стандартный черновик T2V/I2V стоит $0.06 за секунду против $0.17 за секунду для обычной HD-генерации.

Что еще не выпущено?

В анонсе FLUX 3 описывались возможности по изображениям, видео, аудио и действиям в рамках одной архитектурной концепции, но доступ появляется поэтапно.

ВозможностьТекущая дорожная карта BFL и доступность
Генерация видео FLUX 3Доступна в общем порядке
Нативное аудио для видеоДоступно в общем порядке
Текст-видеоДоступно в общем порядке
Изображение-видео / ключевые кадрыДоступно в общем порядке
Продолжение видеоДоступно в общем порядке
Более богатые комбинации ссылок изображение/видео/аудиоПланируется расширение
Генерация и редактирование изображений FLUX 3Ожидается
FLUX 3 Dev с открытыми весамиПланируется
Развертывание предсказания действийИсследования / коммерческое партнерство

Это особенно важно для пользователей, знакомых с FLUX.2 Max. FLUX.2 остается текущим специализированным вариантом для генерации статичных изображений, тогда как публичный продукт FLUX 3 сосредоточен на видео и аудио.

Результаты бенчмарков FLUX 3

Сейчас полезны два типа свидетельств по бенчмаркам FLUX 3: пострелизная внутренняя оценка BFL и независимая внешняя оценка. Первая показывает относительные человеческие предпочтения по протоколу BFL; вторая проверяет, сохраняются ли эти сильные стороны в отдельно разработанном бенчмарке.

Пострелизная ELO-оценка BFL

Первоначальный июльский анонс включал предварительные показатели побед. Более релевантным для текущих пользователей является оценивание выпущенной модели от 4 августа. Black Forest Labs сообщает ELO для текст-видео 1135 в своей внутренней all-vs-all оценке.

Что такое FLUX 3? Характеристики, бенчмарки, возможности, цены и доступ к API

ELO-оценка выпущенной модели FLUX 3 — официальный источник изображения: Black Forest Labs

МетрикаОценка выпущенной модели BFL
ELO для текст-видео1135
Позиция T2VНаивысшая в протестированной группе BFL
Результат изображение-видеоНичья с сильнейшим протестированным конкурентом и превосходство над остальными
Тип оцениванияВнутренняя оценка человеческих предпочтений
Стадия моделиПубличный релиз FLUX 3 Video

Это более сильное свидетельство, чем предварительный бенчмарк запуска, поскольку оно оценивает выпущенную августовскую модель. Тем не менее это бенчмарк от вендора и не должен трактоваться как доказательство превосходства FLUX 3 над каждым конкурентом во всех категориях промптов.

Независимый бенчмарк FLUX 3

v-benchmark v2 от Megaton предоставляет независимую проверку. FLUX 3 оценивалась в августе 2026 года и на данный момент имеет индекс Megaton 76.51/100, занимая 3-е место в опубликованном наборе на момент оценивания.

Измерение бенчмаркаОценка Megaton FLUX 3
Megaton Index76.51
Соответствие промпту87.07
Согласованность сцены94.76
Физика70.63
Фотореализм людей73.70
Точность объектов и продуктов83.82
Причинно-семантическая связность80.91
Текстовая точность82.41
Кинематография71.43
Вкус и арт-дирекция65.00

Профиль более информативен, чем общий балл. Согласованность сцены 94.76 — самая сильная крупная категория, при этом соответствие промпту, точность объектов, причинная связность и текстовая точность также превышают 80. Физика, фотореализм людей и «вкус/арт-дирекция» слабее, что показывает: более сильное временное представление не устраняет синтетичность движения или вариативность художественного качества.

Это также объясняет расхождения выводов бенчмарков: внутренняя оценка предпочтений BFL ставит FLUX 3 на первое место в своей выборке, тогда как независимый рейтинг Megaton размещает модель на третьем. Разные промпты, измерения, аудитории оценщиков и методы агрегации дают разные ранжирования.

FLUX 3 против Seedance 2.5, MiniMax H3 и Wan 3.0

Рынок ИИ-видео быстро развивался в 2026 году. FLUX 3 теперь конкурирует с мультимодальными системами, которые все чаще объединяют длинную генерацию, синхронное аудио, референсы и редактирование.

ИзмерениеFLUX 3Seedance 2.5MiniMax H3Wan 3.0
РазработчикBlack Forest LabsByteDance SeedMiniMaxAlibaba
Макс. заявленная длительность20 с30 с15 с30 с
Разрешение видеоHD / FHD / QHD (2K) / UHD (4K)Зависит от уровня APIДо 2KДо 1080p
Нативное аудиоДаДаДа, стереоДа
Текст-видеоДаДаДаДа
Ввод изображений/референсовДаДаДаДа
Контроль ключевых кадров/референсовСильные временные ключевые кадрыСильный контроль мультимодальных референсовМультимодальное кондиционированиеКонтроль мультимодальных референсов
Продолжение/редактирование видеоДоступно продолжениеОриентация на редактированиеФокус на омни-генерацииРедактирование и референс-потоки
Генерация нескольких шотовДаДаДаДа
Отличительная силаАрхитектура «модель реальности», согласованность сцен, Self-FlowДлинные истории и референс-контроль2K аудиовизуальная генерация и омни-контекстДлинные клипы и более низкая стартовая цена
Стартовая/юнит-цена CometAPI*$0.136/с$0.0824/с указана$0.064/с$0.040/с

* Ценообразование — только ориентировочное. Видео-API используют разные разрешения, длительности, уровни качества и правила биллинга, поэтому самая низкая цена за секунду не обязательно означает самую дешевую эквивалентную по качеству генерацию.

FLUX 3 против Seedance 2.5

Seedance 2.5 имеет очевидное преимущество по длительности: до 30 секунд против 20 секунд у FLUX 3. Он также сильно ориентирован на генерацию с референсами, редактирование и длинные истории. FLUX 3 выделяется своей общей архитектурой «модель мира», согласованностью сцен, нативной аудиовизуальной генерацией, временными ключевыми кадрами и более широкой дорожной картой по изображениям/действиям.

Независимые тесты подтверждают высокий уровень конкуренции: Megaton сейчас ставит Seedance 2.5 выше FLUX 3 по общей оценке.

FLUX 3 против MiniMax H3

MiniMax H3 предлагает до 2K и нативное стерео-аудио, что дает сильные технические параметры для аудиовизуального контента. FLUX 3 поддерживает более длинное окно генерации — 20 секунд против 15 у H3 — и его Draft Mode обеспечивает контролируемую по стоимости итерацию.

FLUX 3 против Wan 3.0

Wan 3.0 делает акцент на широкие мультимодальные входы, аудиовизуальную генерацию, редактирование и клипы до 30 секунд. Он также дешевле по стартовой цене CometAPI. FLUX 3 дороже, но выделяется позиционированием как «модель реальности», согласованностью сцен, исследовательской базой Self-Flow, Draft Mode и интеграцией с предсказанием действий.

Цены FLUX 3

Black Forest Labs тарифицирует FLUX 3 по длительности сгенерированного видео.

РежимОфициальные цены BFL FLUX 3
T2V / I2V Draft HD$0.06/с
T2V / I2V HD$0.17/с
T2V / I2V FHD$0.29/с
T2V / I2V QHD (2K)$0.40/с
T2V / I2V UHD (4K)$0.80/с
Продолжение видео Draft$0.12/с
Продолжение видео HD$0.41/с
Продолжение видео FHD$0.53/с
Продолжение видео QHD (2K)$0.65/с
Продолжение видео UHD (4K)$0.95/с

Стандартная 10-секундная HD-генерация стоит примерно $1.70 по указанной BFL ставке, а 10-секундная FHD — около $2.90. Продолжение видео существенно дороже обычной генерации, поэтому приложениям, часто продлевающим клипы, следует моделировать эти расходы отдельно.

Цена FLUX 3 на CometAPI

CometAPI в настоящее время указывает доступность FLUX 3 с идентификатором модели flux-3.

РазрешениеЦена CometAPI для FLUX 3
720p$0.136/с
1080p$0.232/с

Для 10-секундной генерации это соответствует примерно $1.36 при 720p или $2.32 при 1080p. По сравнению с заявленными BFL ставками $0.17/с и $0.29/с, стандартные цены CometAPI примерно на 20% ниже для этих двух уровней.

Примечание о доступности: часть старого описательного текста на CometAPI все еще относится к июльскому периоду раннего доступа. Текущие живые карточки модели, раздел с ценами и пример API указывают flux-3 как Available, с датой релиза CometAPI 13 августа 2026 г. Для интеграции более релевантны текущие API и поля цен, чем старые описания доступности.

Почему FLUX 3 важна не только для ИИ-видео

Самая необычная часть FLUX 3 — это не генерация 20-секундных видео. Несколько конкурентов уже умеют создавать столь же длинные или более длинные клипы. Более крупная техническая ставка — что сильное видеопредставление может стать фундаментом для других форм интеллекта.

От предсказания видео к предсказанию действий

Сигналы управления роботом — это временные предсказания, обусловленные визуальными наблюдениями, поэтому BFL использует видеопредставление FLUX 3 как основу для предсказания действий. В коллаборации с mimic robotics создан FLUX-mimic, где декодер действий считывает представления из видеомодели вместо обучения полностью независимого стека восприятия.

BFL сообщает, что бэкбон FLUX-mimic может работать менее чем за 80 мс на одном RTX 5090, а полный робот-систем достигает примерно 101 мс цикла реакции. Компания также упоминала промышленную оценку с Audi.

Это не делает публичный FLUX 3 Video API роботическим API. Но это демонстрирует, почему BFL инвестировала в мультимодальное видеопредставление, а не рассматривала генерацию видео как изолированную медиазадачу.

Основные сильные стороны FLUX 3

  • Темпоральная и сценовая согласованность. Показатель Scene Consistency 94.76 от Megaton — самая сильная категория модели.
  • Нативная аудиовизуальная генерация. Диалоги, эффекты, амбиент и визуал формируются вместе, а не собираются из отдельных моделей.
  • Сильное следование промптам. Независимый показатель Prompt Adherence 87.07 говорит о том, что сильные стороны модели выходят за рамки чистой визуальной «полировки».
  • Контроль ключевых кадров. До десяти изображений могут участвовать в текущих сценариях изображение-видео, давая явный временной контроль.
  • Черновик → финал. Draft Mode решает реальную проблему стоимости в ИИ-видео: множество генераций отбрасываются в процессе итераций промпта.
  • Широкий визуальный диапазон. BFL позиционирует FLUX 3 как способную к «сырому», натуральному, кинематографичному, ностальгическому, игривому, стилизованному и необычному выходу, а не к одному «фирменному» стилю.
  • Исследовательское направление «модель мира». Self-Flow и предсказание действий делают FLUX 3 релевантной за пределами медиагенерации.

Ограничения FLUX 3

  • Полная мультимодальная дорожная карта еще не поставлена. Публичные FLUX 3 Image и FLUX 3 Dev с открытыми весами не стоит подразумевать из описания семейства.
  • 20 секунд — уже не лидер по длительности. Некоторые конкуренты 2026 года поддерживают 30-секундные генерации.
  • Физика не «решена». Megaton дает FLUX 3 по физике 70.63, заметно ниже согласованности сцен.
  • Фотореализм людей можно улучшать. Независимый показатель 73.70 означает, что сложная анатомия и реалистичное движение человека иногда дают сбои.
  • Продолжение видео — дорого. Цена BFL на продолжение существенно выше за секунду, чем на обычные T2V/I2V.
  • Витринный конкурентный бенчмарк BFL — внутренний. Производственные решения следует дополнять независимыми тестами с использованием собственных промптов, типов шотов, языков и референсов приложения.

Как использовать FLUX 3 с CometAPI

Более ранний обзор FLUX 3 на CometAPI (https://www.cometapi.com/flux-3-api/) описывает июльский этап раннего доступа, предварительные бенчмарки и план развёртывания. Этот раздел фокусируется на текущей продакшн-интеграции, ценах и рабочем API-потоке, чтобы не повторять историю. Продакшн-модель FLUX 3 использует идентификатор модели flux-3.

Базовый запрос 720p использует endpoint /v1/videos:

Bash

curl --request POST "https://api.cometapi.com/v1/videos" \
--header "Authorization: Bearer $COMETAPI_KEY" \
--form-string "model=flux-3" \
--form-string "prompt=Бумажная лодочка скользит по спокойному пруду в мягком утреннем свете" \
--form-string "seconds=5" \
--form-string "size=1280x720"

Видеопоток асинхронный. После первоначального ответа с task ID приложение проверяет задачу до завершения генерации и затем получает итоговое видео. В продакшне генерацию обычно следует выполнять фоновым заданием или в очереди задач, а не удерживать HTTP-запрос на все время рендера.

Кому подходит FLUX 3?

FLUX 3 особенно привлекателен для приложений, которым нужно больше, чем визуально приятные 5-секундные клипы: рекламные системы с синхронизированными визуалом и аудио, автоматизированное производство коротких роликов, демонстрации продуктов с важной персистентностью объектов, многоязычные диалоги, сценарии сториборд-видео, анимация с контролем ключевых кадров, образовательный контент и эксперименты с более длинными мультимодальными пайплайнами.

Он может быть менее привлекателен, когда требуется минимально возможная стоимость за секунду, когда нужно более 20 секунд за один проход или когда основная задача — генерация статичных изображений. Для изображений текущая модель FLUX, такая как FLUX.2 Max, может быть более подходящей.

Лучше ли FLUX 3 других видеомоделей ИИ?

Единого обоснованного ответа для всех случаев нет. Внутренняя оценка BFL ставит выпущенный FLUX 3 на первое место в своем сравнении текст-видео, тогда как независимая оценка Megaton размещает FLUX 3 на третьем месте, уступая более новым конкурентам. Оба результата могут быть верными, поскольку тесты измеряют разные распределения промптов и измерения качества.

FLUX 3 особенно сильна, когда важны согласованность сцены, следование промпту, точность объектов, причинная связность, рендеринг текста, синхронный звук и управляемые ключевые кадры. Другие модели могут выигрывать по максимальной длительности, разрешению, художественным предпочтениям, фотореализму людей, возможностям редактирования или стоимости. Для разработчиков корректное сравнение — это сравнение на уровне конкретной рабочей нагрузки, а не лидерборда.

Часто задаваемые вопросы

Доступна ли FLUX 3 сейчас?

Да. FLUX 3 Video стала доступна в общем порядке через BFL 4 августа 2026 г. CometAPI также указывает FLUX 3 как Available под идентификатором модели flux-3. Релиз FLUX 3 Image и FLUX 3 Dev с открытыми весами остаются отдельными пунктами дорожной карты.

Может ли FLUX 3 генерировать аудио?

Да. FLUX 3 Video генерирует синхронизированное нативное аудио, включающее диалоги, амбиент и эффекты. Также поддерживаются многоязычные диалоги и синхронизация губ.

Какой длины ролики может создавать FLUX 3?

Текущая генерация текст-видео и изображение-видео поддерживает 5–20 секунд. Продолжение видео поддерживает 5–15 секунд нового контента.

Какое разрешение поддерживает FLUX 3?

BFL поддерживает HD (до 1 мегапикселя на кадр), FHD (до 2 МП), QHD/2K (до 4 МП) и UHD/4K (до 8 МП). Выход FHD 16:9 — 1920 × 1088. Диапазоны разрешений основаны на общем числе пикселей на кадр, а не на соотношении сторон; Draft Mode — только HD.

Поддерживает ли FLUX 3 изображение-видео?

Да. Изображение-видео и генерация по ключевым кадрам входят в доступный набор функций FLUX 3 Video.

Является ли FLUX 3 моделью генерации изображений?

Архитектурно FLUX 3 обучается по изображениям, видео и аудио, и BFL продемонстрировала исследования по генерации и редактированию изображений. Однако продукт FLUX 3 Image — будущий релиз; не путайте семейную дорожную карту с текущим публичным FLUX 3 Video API.

Является ли FLUX 3 открытой?

Пока нет. BFL объявила FLUX 3 Dev, мультимодальный вариант с открытыми весами, но публичная дата релиза еще не предоставлена.

Сколько стоит FLUX 3?

BFL оценивает текст/изображение-видео в $0.06/с для Draft HD, $0.17/с для HD, $0.29/с для FHD, $0.40/с для QHD и $0.80/с для UHD. Видео-видео стоит $0.12/с для Draft HD, затем $0.41/с для HD, $0.53/с для FHD, $0.65/с для QHD и $0.95/с для UHD. CometAPI в настоящее время указывает $0.136/с для 720p и $0.232/с для 1080p.

Что такое Self-Flow?

Self-Flow — самообучающийся подход flow-matching от BFL. Он призван позволить генеративной модели развивать полезные внутренние представления без зависимости от внешней модели представлений. Использование разных уровней шума по токенам поощряет сеть к восстановлению недостающей информации и изучению отношений между мультимодальными наблюдениями.

Является ли FLUX 3 «моделью мира»?

Black Forest Labs позиционирует FLUX 3 как базу «модели реальности», поскольку ее общие представления простираются от аудиовизуального предсказания к предсказанию действий. Называть ее полноценной универсальной «моделью мира» было бы сильнее, чем это подтверждают данные; более точное описание — мультимодальная генеративная базовая модель, явно спроектированная с целями моделирования мира.

Заключение

FLUX 3 — это более значимое изменение для Black Forest Labs, чем обычное обновление от одной модели FLUX изображений к другой. Ключевая идея — обучать общее мультимодальное представление мира, а затем использовать его для видео, звука, изображений и в перспективе — действий. Self-Flow обеспечивает исследовательскую базу, а выпущенная FLUX 3 Video — первая производственная демонстрация этой стратегии.

По состоянию на сентябрь 2026 года FLUX 3 Video поддерживает клипы до 20 секунд, 24 fps, вывод от HD до UHD/4K, синхронное аудио, многоязычные диалоги, изображение-видео, ключевые кадры, продолжение видео, генерацию нескольких шотов и Draft Mode.

Картина бенчмарков также стала более достоверной, чем на запуске. Текущая оценка выпущенной модели BFL ставит FLUX 3 первой в ее внутреннем ELO-тесте T2V, тогда как независимая оценка Megaton размещает ее на третьем месте и выделяет особенно сильную согласованность сцены.

FLUX 3 поэтому не автоматически лучшая видеомодель для любой нагрузки. Seedance 2.5, MiniMax H3 и Wan 3.0 могут предложить более длинную генерацию, более высокое номинальное разрешение, более низкие цены или иные возможности по референсам и редактированию.

То, что делает FLUX 3 особенно интересной, — это направление под видеогенератором: BFL делает ставку, что те же представления, которые нужны для предсказания убедительного видео, в итоге смогут поддерживать генерацию изображений, аудио, физическое рассуждение и действия роботов. Разработчики уже могут протестировать первый производственный шаг через FLUX 3 на CometAPI, используя идентификатор модели flux-3.

Продолжить обучение

Свяжите эту статью со следующим решением.

Посмотреть все темы
Опубликовано Oct 3, 2026
Последнее обновление Oct 3, 2026
0 просмотров
Проверено на ясность, указание источников и актуальную терминологию API.

Читать далее