GPT-6.1 Sol are now live on CometAPI →
ai-model/Badania CometAPI

Czym jest FLUX 3? Specyfikacje, benchmarki, funkcje, cennik i dostęp do API

Poznaj multimodalny model AI firmy Black Forest Labs, w tym specyfikacje FLUX 3, wyniki benchmarków, funkcjonalności, ceny, architekturę Self-Flow, konkurencję oraz dostęp do API.

CometAPI
Deon GoodwinZespół badań AI modeli i API
Zaktualizowano Oct 3, 2026 18 min czyt.
Czym jest FLUX 3? Specyfikacje, benchmarki, funkcje, cennik i dostęp do API
Użyj tego wzorca

Wykonaj pierwsze wywołanie API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR: FLUX 3 to zunifikowany multimodalny model bazowy Black Forest Labs. Jego publiczne Video API generuje klipy do 20 sekund w 24 kl./s, opcjonalnie z zsynchronizowanym dźwiękiem, na podstawie tekstu, obrazów, klatek kluczowych lub istniejącego wideo. Obsługuje rozdzielczości od HD po UHD/4K, natomiast FLUX 3 Image i otwartowagowy model FLUX 3 Dev pozostają osobnymi elementami wdrożenia.

Czym jest FLUX 3?

FLUX 3 to czołowy multimodalny model Black Forest Labs. Zamiast niezależnie trenować jeden model do obrazów, inny do wideo, a jeszcze inny do dźwięku, BFL uczy współdzielonej reprezentacji obejmującej te modality.

Centralna idea głosi, że obraz, wideo i dźwięk to różne obserwacje tego samego, leżącego u podstaw świata. Poruszający się samochód ma wygląd wizualny, ruch, dźwięk, relacje przestrzenne, właściwości materiałowe i zachowanie przyczynowe. Wspólne uczenie tych sygnałów daje modelowi więcej ograniczeń niż uczenie samych pojedynczych klatek.

Dlatego Black Forest Labs opisuje FLUX 3 jako krok w kierunku modelu rzeczywistości lub modelu świata, a nie tylko generatora obrazów czy wideo. Udostępniony system wideo już demonstruje ten kierunek: zsynchronizowany dźwięk, ruch, struktura sceny, dialog, zachowanie kamery i dźwięki otoczenia są obsługiwane w jednym przebiegu generacji.

Nie każda ogłoszona możliwość FLUX 3 jest już publicznie dostępna. Stan na wrzesień 2026 r.: dostępny jest FLUX 3 Video, natomiast FLUX 3 Image i otwartowagowy model FLUX 3 Dev pozostają osobnymi elementami wdrożenia.

Specyfikacja FLUX 3 w skrócie

Poniższe dane odzwierciedlają bieżącą dokumentację deweloperską FLUX 3, a nie wstępną konfigurację z lipcowego startu.

SpecyfikacjaOficjalna dokumentacja FLUX 3
DeweloperBlack Forest Labs
Rodzina modeliFLUX 3
Typ modeluZunifikowany multimodalny model bazowy / generatywny wideo
Publiczne wydanie wideo4 sierpnia 2026
Główny kierunek treninguWspólna reprezentacja obrazu, wideo i dźwięku
Podstawa badawczaSelf-Flow
Bieżący główny wynik APIWideo z zsynchronizowanym dźwiękiem
Tekst na wideoObsługiwane
Obraz na wideoObsługiwane
Klatki kluczowe na wideoObsługiwane
Kontynuacja wideoObsługiwane
Maks. czas T2V/I2V20 sekund
Czas kontynuacji wideo5–15 sekund
Liczba klatek na sekundę24 kl./s
RozdzielczośćHD, FHD, QHD/2K i UHD/4K
Rozdzielczość FHD 16:91920 × 1088
Referencje obrazówDo 10 dla przepływów I2V/klatek kluczowych
Natywny dźwiękTak
Wielojęzyczne dialogiTak
Synchronizacja ruchu wargTak
Generowanie wieloujęcioweTak
Draft ModeTak
Publiczny endpoint FLUX 3 dla obrazów statycznychJeszcze nieudostępniony ogólnie przez BFL
FLUX 3 Dev (otwarte wagi)Planowane

Aktualna dokumentacja BFL określa 5–20 sekund dla generowania tekst-na-wideo i obraz-na-wideo, natomiast kontynuacja wideo przyjmuje okno generacji 5–15 sekund. Obsługiwane proporcje to 21:9, 2:1, 16:9, 4:3, 1:1, 3:4 i 9:16.

Jak działa FLUX 3?

Self-Flow

Kluczową podstawą badawczą jest Self-Flow, samonadzorowane dopasowywanie przepływu Black Forest Labs. Tradycyjne generatywne ścieżki treningowe często polegają na oddzielnych, wstępnie wytrenowanych modelach reprezentacji lub nadzorze pomocniczym. Self-Flow jest zaprojektowane tak, aby uczyć użytecznych reprezentacji bezpośrednio z celu generatywnego.

Głównym mechanizmem jest Dual-Timestep Scheduling. Różnym grupom tokenów można przypisać różne poziomy szumu podczas treningu. Tworzy to asymetrię informacji: niektóre części wejścia zawierają więcej użytecznych informacji niż inne, zmuszając sieć do budowania reprezentacji, które pomagają wnioskować o brakujących elementach.

W praktyce FLUX 3 jest zachęcany do uczenia się relacji między obiektami, klatkami, ruchem, dźwiękiem i zdarzeniami w czasie, zamiast po prostu zapamiętywać, jak powinny wyglądać pojedyncze klatki.

Czym jest FLUX 3? Specyfikacje, benchmarki, funkcje, cennik i dostęp do API

Architektura metody Self-Flow — oficjalne źródło obrazu: Projekt Self-Flow Black Forest Labs

BFL testowało także wspólny trening multimodalny z wykorzystaniem backbone’u pochodzącego z FLUX.2 na milionach filmów i setkach milionów obrazów. Eksperymenty wspierają szerszą hipotezę FLUX 3, że uczenie reprezentacji i generacja nie muszą być oddzielnymi systemami.

Dlaczego wideo jest centralne dla FLUX 3

Wideo jest szczególnie wartościowe dla modelowania świata, ponieważ zawiera informacje, których nie dostarcza pojedynczy obraz. Pojedyncza klatka może pokazywać piłkę nad podłogą; wideo może ujawnić, że piłka spada, odbija się, odkształca przy uderzeniu, wydaje dźwięk i zmienia kierunek potem.

BFL ujawniło, że predykcja wideo stanowi ponad 95% mocy obliczeniowej treningu FLUX 3. Dźwięk jest relatywnie tani, bo to znacznie niżej wymiarowy sygnał ściśle sprzężony z widocznymi zdarzeniami. Taki przydział pomaga wyjaśnić, dlaczego wideo jest pierwszą zdolnością FLUX 3, która osiągnęła ogólną dostępność.

Co potrafi FLUX 3?

Tekst na wideo

Użytkownicy mogą generować kompletne wideo na podstawie instrukcji w języku naturalnym. BFL podaje, że wydany model radzi sobie z prostymi i złożonymi promptami, koordynując ruch, logikę sceny, kompozycję wizualną i dźwięk. Jest to szczególnie użyteczne dla promptów zawierających wiele kolejnych zdarzeń, a nie jeden animowany obiekt.

Obraz na wideo i klatki kluczowe

FLUX 3 może animować obraz początkowy, dążyć do klatki końcowej lub używać wielu obrazów jako czasowanych klatek kluczowych. Obecne API obsługuje do dziesięciu referencji obrazów w przepływach obraz-na-wideo, co pozwala twórcom kontrolować zmiany sceny w czasie zamiast prosić model o improwizowanie całej sekwencji.

Kontynuacja wideo

Istniejące wideo i jego dźwięk mogą zostać dostarczone jako kontekst, a FLUX 3 wygeneruje, co dzieje się dalej. BFL opisuje kontynuację, która zachowuje ruch, zachowanie kamery, dialog i dźwięk przez przejście, co istotnie różni się od wygenerowania drugiego niezależnego klipu i połączenia obu plików później.

Natywny dźwięk i dialog

FLUX 3 generuje dźwięk w trakcie generacji zamiast wymagać osobnego przebiegu generowania mowy lub efektów. Udostępnione możliwości audio obejmują dialog, efekty dźwiękowe i dźwięki otoczenia. Obsługiwana jest także wielojęzyczna mowa z synchronizacją ruchu warg.

Wiele ujęć w jednej generacji

Pojedynczy prompt może zawierać wiele scen lub kątów kamery. Ma to znaczenie, ponieważ wiele wcześniejszych modeli wideo jest najmocniejszych, gdy prosi się je o jedno krótkie, wizualnie ciągłe ujęcie; FLUX 3 jest explicite zaprojektowany do obsługi sekwencji wieloujęciowych w jednym przebiegu generacji.

Draft Mode

Draft Mode to jedno z bardziej praktycznych udogodnień dla masowej generacji wideo. Zamiast płacić pełną cenę za każdy eksperyment z promptem, deweloperzy mogą utworzyć szybszy, tańszy podgląd, a następnie ulepszyć wybrany szkic, zachowując wybraną kompozycję i ruch. Według aktualnych cen BFL standardowy szkic T2V/I2V kosztuje $0.06 za sekundę, wobec $0.17 za sekundę dla zwykłej generacji HD.

Czego jeszcze nie wydano?

Ogłoszenie startu FLUX 3 opisywało możliwości obrazu, wideo, dźwięku i akcji w ramach jednej architektury, ale dostępność jest rozłożona w czasie.

ZdolnośćBieżąca mapa drogowa BFL i dostępność
Generowanie FLUX 3 VideoOgólnie dostępne
Natywny dźwięk wideoOgólnie dostępne
Tekst na wideoOgólnie dostępne
Obraz na wideo / klatki kluczoweOgólnie dostępne
Kontynuacja wideoOgólnie dostępne
Bogatsze kombinacje referencji obraz/wideo/dźwiękPlanowane rozszerzenia
Generowanie i edycja obrazów FLUX 3Nadchodzące
FLUX 3 Dev (otwarte wagi)Planowane
Wdrożenie predykcji akcjiBadania / ścieżka partnerska

To rozróżnienie jest szczególnie ważne dla użytkowników zaznajomionych z FLUX.2 Max. FLUX.2 pozostaje aktualną, dedykowaną opcją dla generowania obrazów statycznych, podczas gdy publiczny FLUX 3 jest skoncentrowany na wideo i dźwięku.

Wydajność FLUX 3 w benchmarkach

Istnieją obecnie dwa użyteczne rodzaje dowodów benchmarkowych FLUX 3: powydaniowa wewnętrzna ewaluacja BFL i niezależna ewaluacja zewnętrzna. Pierwsza pokazuje względne preferencje ludzi w protokole BFL; druga sprawdza, czy te mocne strony są widoczne w osobno zaprojektowanym benchmarku.

Powydaniowa ewaluacja ELO BFL

Wstępne ogłoszenie z lipca zawierało wstępne wskaźniki wygranych. Bardziej relewantnym benchmarkiem dla obecnych użytkowników jest ewaluacja wydanego modelu z 4 sierpnia. Black Forest Labs raportuje wynik ELO tekst-na-wideo na poziomie 1135 w wewnętrznej ewaluacji „wszyscy kontra wszyscy”.

Czym jest FLUX 3? Specyfikacje, benchmarki, funkcje, cennik i dostęp do API

Ewaluacja ELO wydanego modelu FLUX 3 — oficjalne źródło obrazu: Black Forest Labs

MetrykaEwaluacja wydanego modelu BFL
ELO tekst-na-wideo1135
Pozycja T2VNajwyższy wynik w testowanej grupie BFL
Wynik obraz-na-wideoRemis z najsilniejszym testowanym konkurentem i przewaga nad resztą
Typ ewaluacjiWewnętrzna ocena preferencji ludzkich
Etap modeluOgólnie dostępne wydanie FLUX 3 Video

To mocniejszy dowód niż wstępny benchmark startowy, bo ocenia wydany model sierpniowy. Nadal jest to jednak benchmark prowadzony przez dostawcę i nie należy go interpretować jako dowodu, że FLUX 3 przewyższy każdego konkurenta w każdej kategorii promptów.

Niezależny benchmark FLUX 3

v-benchmark v2 Megaton zapewnia niezależną weryfikację. FLUX 3 został oceniony w sierpniu 2026 i obecnie osiąga wskaźnik Megaton 76.51/100, zajmując miejsce nr 3 w opublikowanym zestawie w czasie ewaluacji.

Wymiar benchmarkuOcena Megaton FLUX 3
Indeks Megaton76.51
Zgodność z promptem87.07
Spójność sceny94.76
Fizyka70.63
Wierność ludziom73.70
Wierność obiektom/produktom83.82
Spójność przyczynowo-semantyczna80.91
Wierność tekstu82.41
Kinematografia71.43
Smak i kierunek artystyczny65.00

Profil jest bardziej informatywny niż ogólny wynik. Spójność sceny na poziomie 94.76 to najsilniejsza duża kategoria, a zgodność z promptem, wierność obiektom, spójność przyczynowa i wierność tekstu także przekraczają 80. Fizyka, wierność ludziom i smak/kierunek artystyczny są słabsze, co pokazuje, że silniejsza reprezentacja temporalna nie eliminuje sztuczności ruchu ani zmienności jakości artystycznej.

To także wyjaśnia, czemu wnioski z benchmarków mogą się różnić: wewnętrzny test preferencji BFL stawia FLUX 3 na szczycie własnego zestawu porównań, podczas gdy niezależna lista Megaton umieszcza go na trzecim miejscu. Różne prompty, wymiary oceny, populacje ewaluatorów i metody agregacji mogą dawać różne rankingi.

FLUX 3 vs Seedance 2.5 vs MiniMax H3 vs Wan 3.0

Rynek wideo AI szybko się zmienił w 2026 r. FLUX 3 konkuruje teraz z multimodalnymi systemami, które coraz częściej łączą długą generację, zsynchronizowany dźwięk, referencje i edycję.

WymiarFLUX 3Seedance 2.5MiniMax H3Wan 3.0
DeweloperBlack Forest LabsByteDance SeedMiniMaxAlibaba
Maksymalna reklamowana długość klipu20 s30 s15 s30 s
Rozdzielczość wideoHD / FHD / QHD (2K) / UHD (4K)Zależnie od tieru APIDo 2KDo 1080p
Natywny dźwiękTakTakTak, stereoTak
Tekst na wideoTakTakTakTak
Wejście obraz/referencjeTakTakTakTak
Kontrola klatek kluczowych/referencjiSilne, czasowane klatki kluczoweSilna multimodalna kontrola referencjiMultimodalne uwarunkowanieMultimodalna kontrola referencji
Kontynuacja/edycja wideoDostępna kontynuacjaPrzepływ pracy zorientowany na edycjęSkupienie na omni-generacjiPrzepływy edycji i referencji
Generowanie wieloujęcioweTakTakTakTak
Cecha wyróżniającaArchitektura „modelu rzeczywistości”, spójność scen, Self-FlowDługie opowieści i kontrola referencjiGeneracja audiowizualna 2K i kontekst omni-modalnyDługie klipy i niższy koszt startowy
Cena początkowa/jednostkowa w CometAPI*$0.136/s$0.0824/s (listowana)$0.064/s$0.040/s

* Cennik to jedynie przybliżone porównanie. API wideo używają różnych rozdzielczości, czasów trwania, poziomów jakości i zasad rozliczeń, więc najniższa cena za sekundę nie musi oznaczać najtańszego wyjścia o równoważnej jakości.

FLUX 3 vs Seedance 2.5

Seedance 2.5 ma oczywistą przewagę długości klipu — do 30 sekund wobec 20 sekund w FLUX 3. Jest też silnie zorientowany na generację sterowaną referencjami, edycję i długą narrację. FLUX 3 wyróżnia się wspólną architekturą „modelu świata”, spójnością scen, natywną generacją audiowizualną, czasowanymi klatkami kluczowymi i szerszą mapą drogową w zakresie obrazu/akcji.

Niezależne testy wzmacniają tezę o realnej rywalizacji w segmencie high-end: Megaton obecnie plasuje Seedance 2.5 powyżej FLUX 3 w ujęciu ogólnym.

FLUX 3 vs MiniMax H3

MiniMax H3 oferuje do 2K i natywny dźwięk stereo, co daje mocną specyfikację techniczną treści audiowizualnych. FLUX 3 obsługuje dłuższe okno generacji — 20 sekund wobec 15 sekund w H3 — a Draft Mode zapewnia kosztowo kontrolowany przepływ iteracji.

FLUX 3 vs Wan 3.0

Wan 3.0 akcentuje szerokie wejścia multimodalne, generację audiowizualną, edycję i klipy do 30 sekund. Jest też tańszy w listowanej cenie startowej CometAPI. FLUX 3 jest droższy, ale wyróżnia się pozycjonowaniem jako „model rzeczywistości”, spójnością scen, podstawą badawczą Self-Flow, Draft Mode i integracją z predykcją akcji.

Cennik FLUX 3

Black Forest Labs rozlicza FLUX 3 według czasu wygenerowanego wideo.

TrybOficjalny cennik FLUX 3 BFL
T2V / I2V Draft HD$0.06/s
T2V / I2V HD$0.17/s
T2V / I2V FHD$0.29/s
T2V / I2V QHD (2K)$0.40/s
T2V / I2V UHD (4K)$0.80/s
Kontynuacja wideo Draft$0.12/s
Kontynuacja wideo HD$0.41/s
Kontynuacja wideo FHD$0.53/s
Kontynuacja wideo QHD (2K)$0.65/s
Kontynuacja wideo UHD (4K)$0.95/s

Standardowa 10‑sekundowa generacja HD kosztuje zatem około $1.70 według stawek BFL, podczas gdy 10 sekund FHD kosztuje około $2.90. Kontynuacja wideo jest znacząco droższa niż zwykła generacja, więc aplikacje często wydłużające klipy powinny modelować te koszty osobno.

Cena FLUX 3 w CometAPI

CometAPI obecnie listuje FLUX 3 jako dostępny z identyfikatorem modelu flux-3.

RozdzielczośćCennik CometAPI dla FLUX 3
720p$0.136/s
1080p$0.232/s

Dla 10‑sekundowej generacji odpowiada to około $1.36 w 720p lub $2.32 w 1080p. W porównaniu z listowanymi stawkami BFL $0.17/s i $0.29/s domyślne ceny CometAPI są o około 20% niższe dla tych dwóch progów.

Uwaga dot. dostępności: część starszego opisu w CometAPI wciąż odzwierciedla lipcowy okres Wczesnego Dostępu. Obecna karta modelu na żywo, sekcja cen i przykład API wskazują, że flux-3 jest Available, z datą wydania w CometAPI 13 sierpnia 2026. Dla decyzji integracyjnych bardziej relewantne są bieżące pola API i cennika niż starszy opis dostępności.

Dlaczego FLUX 3 ma znaczenie poza wideo AI

Najbardziej niezwykłą częścią FLUX 3 nie jest generacja 20‑sekundowych klipów. Kilku konkurentów potrafi już generować równie długie lub dłuższe klipy. Większym zakładem technicznym jest to, że silna reprezentacja wideo może stać się fundamentem innych form inteligencji.

Od predykcji wideo do predykcji akcji

Sygnały sterowania robotem to predykcje temporalne warunkowane obserwacjami wizualnymi, więc BFL używa reprezentacji wideo FLUX 3 jako podstawy do predykcji akcji. Współpraca z mimic robotics przyniosła FLUX-mimic, w którym dekoder akcji odczytuje reprezentacje z modelu wideo zamiast trenować całkowicie niezależny stos percepcyjny.

BFL raportuje, że backbone FLUX-mimic może działać w poniżej 80 ms na pojedynczym RTX 5090, podczas gdy kompletny system robotyczny osiąga pętlę reakcji około 101 ms. Firma omawiała także ewaluację przemysłową z Audi.

To nie czyni publicznego FLUX 3 Video API interfejsem do robotyki. Pokazuje jednak, dlaczego BFL zainwestowało mocno w multimodalną reprezentację wideo zamiast traktować generację wideo jako izolowane zadanie medialne.

Główne mocne strony FLUX 3

  • Spójność temporalna i scen. Wynik Spójności Sceny 94.76 w Megaton to najsilniejsza duża kategoria modelu.
  • Natywna generacja audiowizualna. Dialog, efekty, ambient i obraz mogą być generowane razem, zamiast zszywania wyników z osobnych modeli.
  • Silna zgodność z promptem. Niezależny wynik Zgodności z promptem 87.07 sugeruje, że mocne strony wykraczają poza samą oprawę wizualną.
  • Kontrola klatek kluczowych. Do dziesięciu obrazów może uczestniczyć w obecnych przepływach obraz‑na‑wideo, dając twórcom wyraźną kontrolę temporalną.
  • Przepływ szkic‑do‑finalnej wersji. Draft Mode adresuje realny problem kosztowy w wideo AI: wiele generacji jest odrzucanych w trakcie iterowania promptów.
  • Szeroki zakres wizualny. BFL pozycjonuje FLUX 3 jako zdolny do surowych, naturalnych, filmowych, nostalgicznych, figlarnych, stylizowanych i nietypowych wyjść, a nie jednego, sztywnego stylu.
  • Kierunek badawczy „modelu świata”. Self-Flow i predykcja akcji czynią FLUX 3 relewantnym poza generacją mediów.

Ograniczenia FLUX 3

  • Pełna multimodalna mapa drogowa nie została jeszcze zrealizowana. Publiczny FLUX 3 Image i otwartowagowy FLUX 3 Dev nie powinny być zakładane na podstawie ogłoszenia rodzinnego.
  • 20 sekund to już nie wiodąca długość w branży. Niektórzy konkurenci z 2026 obsługują 30‑sekundowe generacje.
  • Fizyka nie jest „rozwiązana”. Megaton daje FLUX 3 wynik Fizyczności 70.63, znacznie poniżej spójności scen.
  • Wierność ludziom wciąż ma pole do poprawy. Niezależny wynik 73.70 oznacza, że trudna anatomia i realistyczny ruch ludzi mogą nadal zawodzić.
  • Kontynuacja wideo jest droga. Cena kontynuacji BFL jest znacząco wyższa za sekundę niż zwykłe T2V/I2V.
  • Flagowy benchmark konkurencyjny BFL jest wewnętrzny. Decyzje produkcyjne powinny także obejmować niezależne testy z użyciem własnych promptów, typów ujęć, języków i zasobów referencyjnych aplikacji.

Jak używać FLUX 3 z CometAPI

Wcześniejsze omówienie FLUX 3 w CometAPI wyjaśnia lipcową fazę Wczesnego Dostępu, wstępne benchmarki i planowany rollout. Ta sekcja koncentruje się na bieżącej integracji produkcyjnej, cenach i działającym przepływie API, tak aby nie powtarzać historycznego przewodnika. Produkcyjny model FLUX 3 używa identyfikatora flux-3.

Podstawowe żądanie 720p używa endpointu /v1/videos:

Bash

curl --request POST "https://api.cometapi.com/v1/videos" \
--header "Authorization: Bearer $COMETAPI_KEY" \
--form-string "model=flux-3" \
--form-string "prompt=A paper boat glides across a still pond in soft morning light" \
--form-string "seconds=5" \
--form-string "size=1280x720"

Przepływ wideo jest asynchroniczny. Po tym, jak początkowe żądanie zwróci identyfikator zadania, aplikacja sprawdza zadanie, aż generacja się zakończy, a następnie pobiera wynikowe wideo. W aplikacjach produkcyjnych generacja powinna być zwykle obsługiwana przez zadanie w tle lub kolejkę zadań, zamiast utrzymywać otwarte żądanie HTTP przez cały czas renderowania.

Kto powinien używać FLUX 3?

FLUX 3 jest szczególnie atrakcyjny dla aplikacji wymagających czegoś więcej niż efektownych wizualnie pięciosekundowych klipów: systemów reklamowych ze zsynchronizowaną warstwą wizualną i audio, zautomatyzowanej produkcji krótkich form, demonstracji produktów, gdzie ważna jest trwałość obiektów, generowania wielojęzycznych dialogów, przepływów storyboard‑na‑wideo, animacji kontrolowanej klatkami kluczowymi, treści edukacyjnych i eksperymentów z dłuższymi multimodalnymi potokami.

Może być mniej atrakcyjny, gdy jedynym wymaganiem jest najniższy możliwy koszt za sekundę, gdy trzeba generować ponad 20 sekund w jednym przebiegu, lub gdy głównym zadaniem jest generowanie obrazów statycznych. Do obrazów statycznych lepiej może się obecnie nadać istniejący model obrazu FLUX, taki jak FLUX.2 Max.

Czy FLUX 3 jest lepszy niż inne modele wideo AI?

Nie ma jednej obronionej odpowiedzi dla każdego przypadku użycia. Wewnętrzna ewaluacja BFL lokuje wydany FLUX 3 na szczycie porównania T2V, podczas gdy niezależna ewaluacja Megaton plasuje FLUX 3 na trzecim miejscu, za nowszymi konkurentami. Oba wyniki mogą być prawdziwe, bo testy mierzą różne rozkłady promptów i wymiary jakości.

FLUX 3 wydaje się szczególnie silny, gdy ważne są spójność scen, podążanie za promptem, wierność obiektów, spójność przyczynowa, renderowanie tekstu, zsynchronizowany dźwięk i kontrolowalne klatki kluczowe. Inne modele mogą wygrywać długością maksymalną, rozdzielczością, preferencjami artystycznymi, wiernością ludziom, przepływami edycyjnymi lub kosztem. Dla deweloperów właściwe porównanie powinno dotyczyć konkretnego obciążenia, a nie tylko tabeli wyników.

Najczęściej zadawane pytania

Czy FLUX 3 jest już dostępny?

Tak. FLUX 3 Video stał się ogólnie dostępny przez BFL 4 sierpnia 2026 r. CometAPI także listuje FLUX 3 jako Available pod identyfikatorem flux-3. Wydanie FLUX 3 dla obrazów statycznych i FLUX 3 Dev (otwarte wagi) pozostają osobnymi pozycjami mapy drogowej.

Czy FLUX 3 potrafi generować dźwięk?

Tak. FLUX 3 Video generuje zsynchronizowany, natywny dźwięk, w tym dialog, dźwięki otoczenia i efekty. Obsługiwane są wielojęzyczne dialogi i synchronizacja ruchu warg.

Jak długie mogą być filmy FLUX 3?

Obecnie generacja tekst‑na‑wideo i obraz‑na‑wideo obsługuje 5–20 sekund. Kontynuacja wideo obsługuje 5–15 sekund nowo wygenerowanej treści.

Jaką rozdzielczość obsługuje FLUX 3?

BFL obsługuje HD (do 1 megapiksela na klatkę), FHD (do 2 MP), QHD/2K (do 4 MP) i UHD/4K (do 8 MP). Wyjście FHD 16:9 to 1920 × 1088. Przedziały rozdzielczości bazują na łącznej liczbie pikseli na klatkę, a nie na proporcjach; Draft Mode jest tylko w HD.

Czy FLUX 3 obsługuje obraz‑na‑wideo?

Tak. Generowanie obraz‑na‑wideo i klatek kluczowych jest częścią ogólnie dostępnego zestawu funkcji FLUX 3 Video.

Czy FLUX 3 jest modelem do generowania obrazów?

Architektonicznie FLUX 3 jest trenowany na obrazach, wideo i dźwięku, a BFL zademonstrowało badania w zakresie generowania i edycji obrazów. Jednak produkt FLUX 3 Image pozostaje nadchodzącym wydaniem; nie należy mylić mapy rodzinnej z obecnie publicznym FLUX 3 Video API.

Czy FLUX 3 jest open source?

Obecnie nie. BFL ogłosiło FLUX 3 Dev, multimodalny wariant z otwartymi wagami, ale nie podało jeszcze publicznej daty wydania.

Ile kosztuje FLUX 3?

BFL wycenia tekst/obraz‑na‑wideo na $0.06/s dla Draft HD, $0.17/s dla HD, $0.29/s dla FHD, $0.40/s dla QHD i $0.80/s dla UHD. Wideo‑na‑wideo kosztuje $0.12/s dla Draft HD, a następnie $0.41/s dla HD, $0.53/s dla FHD, $0.65/s dla QHD i $0.95/s dla UHD. CometAPI obecnie listuje $0.136/s dla 720p i $0.232/s dla 1080p.

Czym jest Self-Flow?

Self-Flow to samonadzorowane podejście dopasowywania przepływu BFL. Jest zaprojektowane tak, by pozwolić modelowi generatywnemu rozwijać użyteczne wewnętrzne reprezentacje bez zależności od zewnętrznego modelu reprezentacji. Zastosowanie różnych poziomów szumu wśród tokenów zachęca sieć do wnioskowania o brakujących informacjach i uczenia się relacji między obserwacjami multimodalnymi.

Czy FLUX 3 to model świata?

Black Forest Labs pozycjonuje FLUX 3 jako fundament „modelu rzeczywistości”, ponieważ jego współdzielone reprezentacje rozciągają się od predykcji audiowizualnej w kierunku predykcji akcji fizycznych. Nazwanie go kompletnym, ogólnego przeznaczenia modelem świata byłoby stwierdzeniem wykraczającym poza obecne dowody; precyzyjniejszy opis to multimodalny model generatywny explicite zaprojektowany wokół celów modelowania świata.

Podsumowanie

FLUX 3 to dla Black Forest Labs większa zmiana niż konwencjonalne uaktualnienie jednego modelu obrazu FLUX do kolejnego. Kluczowym pomysłem jest wytrenowanie współdzielonej, multimodalnej reprezentacji świata, a następnie wykorzystanie jej do wideo, dźwięku, obrazów i docelowo akcji. Self-Flow stanowi podstawę badawczą, a wydany FLUX 3 Video to pierwszy produkcyjny dowód tej strategii.

Stan na wrzesień 2026 r.: FLUX 3 Video obsługuje klipy do 20 sekund, 24 kl./s, wyjście od HD po UHD/4K, zsynchronizowany dźwięk, wielojęzyczne dialogi, obraz‑na‑wideo, klatki kluczowe, kontynuację wideo, generację wieloujęciową i Draft Mode.

Obraz benchmarkowy jest też bardziej wiarygodny niż przy starcie. Bieżąca ewaluacja wydanego modelu BFL stawia FLUX 3 na pierwszym miejscu w wewnętrznym teście ELO T2V, podczas gdy niezależne testy Megaton klasyfikują go na trzecim miejscu ogółem i podkreślają szczególnie silną spójność scen.

FLUX 3 nie jest więc automatycznie najlepszym modelem wideo dla każdego obciążenia. Seedance 2.5, MiniMax H3 i Wan 3.0 mogą oferować dłuższą generację, wyższą nominalną rozdzielczość, niższe ceny lub inne możliwości referencyjne i edycyjne.

Tym, co czyni FLUX 3 wyjątkowo interesującym, jest kierunek stojący za generatorem wideo: BFL zakłada, że te same reprezentacje potrzebne do przewidywania przekonującego wideo mogą docelowo wspierać generowanie obrazów, dźwięk, rozumowanie fizyczne i działania robotów. Deweloperzy już dziś mogą przetestować pierwszy krok produkcyjny poprzez FLUX 3 w CometAPI, używając identyfikatora modelu flux-3.

Kontynuuj naukę

Połącz ten artykuł z następną decyzją.

Zobacz wszystkie tematy
Opublikowano Oct 3, 2026
Ostatnia aktualizacja Oct 3, 2026
1 wyświetleń
Sprawdzone pod kątem przejrzystości, atrybucji źródeł i aktualnej terminologii API.

Czytaj więcej