Szybka odpowiedź
FLUX 3 to multimodalny model wideo Black Forest Labs do generowania tekst-na-wideo i obraz-na-wideo z zsynchronizowanym audio. W CometAPI identyfikator modelu produkcyjnego to flux-3. Zweryfikowany asynchroniczny przepływ pracy używa POST /v1/videos do utworzenia zadania, GET /v1/videos/{task_id} aby je odpytywać, oraz GET /v1/videos/{task_id}/content do pobrania ukończonego pliku MP4.
Aktualizacja dostępności (zweryfikowano 24 września 2026): Black Forest Labs przeniosło FLUX 3 Video poza lipcową fazę Early Access i 4 sierpnia 2026 udostępniło początkową wersję tekst-na-wideo oraz obraz-na-wideo w ramach BFL API i u wybranych partnerów. CometAPI dodało produkcyjny identyfikator modelu flux-3 w swoim formacie Video API 13 sierpnia 2026. Traktuj ogłoszenie BFL o wydaniu oraz aktywną stronę modelu CometAPI jako źródło prawdy w sprawie dostępności, pól i cen.
Co się zmieniło od FLUX 3 Early Access?
Najważniejszą zmianą jest dostępność operacyjna. Wcześniejsze materiały skupiały się na lipcowym wdrożeniu z aplikacją, ale sierpniowe wydanie BFL wprowadziło wywoływalny endpoint wideo, opublikowane ograniczenia i ceny produkcyjne. Następnie CometAPI udostępniło flux-3 poprzez swój ujednolicony przepływ Video API.
Wcześniejszy artykuł CometAPI, FLUX 3 API: Availability, Early Access, Video & Dev, pozostaje przydatny dla historii uruchomienia i wstępnej lipcowej oceny. Szersze porównanie Best AI Video APIs in 2026 obejmuje wybór na poziomie rynku. Ten przewodnik utrzymuje te tematy w skrócie i koncentruje się na działających żądaniach, odpytywaniu, promptach, kontroli kosztów i obsłudze produkcyjnej.
Czym jest FLUX 3?
FLUX 3 to rodzina multimodalnych modeli BFL dla wideo, audio, obrazów i predykcji związanych z działaniem. Obecne wydanie wideo obsługuje tekst-na-wideo, obraz-na-wideo i kontynuację wideo przez jeden natywny dla dostawcy endpoint.
Dla twórców wideo kluczowe możliwości to do 20 sekund przy 24 kl./s, wyjście HD lub Full HD, zsynchronizowane audio, wielojęzyczna mowa z lip-sync, wiele ujęć w jednym generowaniu oraz nawet dziesięć przypiętych klatek kluczowych dla kontroli obraz-na-wideo.
Specyfikacja API FLUX 3
| Specyfikacja | Oficjalna specyfikacja BFL | Integracja CometAPI |
|---|---|---|
| Główne przepływy | Tekst-na-wideo, obraz-na-wideo, kontynuacja wideo | Wymienione tekst-na-wideo i obraz-na-wideo |
| Maks. czas trwania | 5–20 s dla T2V/I2V; 5–15 s dla V2V | Używaj wartości z aktualnego quickstartu dla bramki |
| Klatkaż | 24 kl./s | Wyjście dostawcy |
| Rozdzielczość | rHD natywnie; FHD przez upsampler wideo. Obecna dokumentacja FLUX 3 Video BFL nie podaje wyjścia 4K/UHD. Specyfikacja „do 4 MP” dotyczy modeli obrazowych FLUX.2, nie FLUX 3 Video. | Wymieniono ceny dla 720p i 1080p |
| Natywne audio | Tak; domyślnie włączone | Funkcja wyjścia zależna od aktywnej integracji |
| Kontrola obrazem | 1–10 klatek kluczowych w natywnym I2V | Zweryfikuj bieżące mapowanie obrazu referencyjnego w bramce |
| Proporcje obrazu | 21:9, 2:1, 16:9, 4:3, 1:1, 3:4, 9:16 | Quickstart używa jawnych wymiarów, np. 1280x720 |
| Wywołanie | Asynchroniczne | Utwórz → odpytywaj → pobierz |
| Identyfikator modelu w CometAPI | — | flux-3 |
Jak dobry jest FLUX 3 Video?
BFL raportuje wynik Elo 1135 dla tekst-na-wideo w ocenie preferencji ludzi w trybie każdy z każdym. W tej samej opublikowanej porównawczej analizie FLUX 3 zremisował z Seedance 2.0 w preferencjach obraz-na-wideo i uplasował się przed pozostałymi testowanymi modelami.
Te wyniki są użytecznym potwierdzeniem pozycjonowania, ale to oceny preferencji ludzi prowadzone przez dostawcę, a nie niezależny benchmark produkcyjny. Nie mierzą opóźnień bramki, niezawodności kolejki, spójności kosztów ani stabilności powtarzalnych generacji, więc zespoły produkcyjne nadal powinny ocenić własny zestaw promptów.
Wydajność benchmarkowa FLUX 3
| Metryka | Opublikowany wynik | Interpretacja |
|---|---|---|
| Elo all-vs-all dla tekst-na-wideo | 1135 | BFL raportuje, że FLUX 3 prowadzi w swoim wewnętrznym porównaniu |
| Preferencja obraz-na-wideo | Remis z Seedance 2.0 | Wynik kierunkowy dostawcy, nie niezależny leaderboard |
| Typ ewaluacji | Preferencja ludzka | Mierzy postrzeganą jakość wyjścia, nie infrastrukturę API |

Źródło: Black Forest Labs — FLUX 3 Video, Part 1: Generation.
Co jest potrzebne przed użyciem FLUX 3 API
- Konto CometAPI i klucz API przechowywany w zmiennej środowiskowej backendu.
- Prompt definiujący temat, ruch, kierunek kamery, atmosferę oraz wymagane audio lub dialog.
- Trwała ścieżka obsługi zadań, ponieważ generowanie wideo jest asynchroniczne.
- Wystarczający kredyt na iteracyjne testy; rozliczanie zależy od wygenerowanego czasu trwania i rozdzielczości.
Utwórz klucz w panelu API CometAPI. Nie umieszczaj go w frontendowym JavaScript, pakietach mobilnych, publicznych repozytoriach ani zrzutach ekranu.
Identyfikator modelu FLUX 3 i endpointy
| Operacja | Metoda i endpoint | Cel |
|---|---|---|
| Utwórz wideo | POST https://api.cometapi.com/v1/videos | Złóż zadanie generacji |
| Sprawdź zadanie | GET https://api.cometapi.com/v1/videos/{task\_id} | Odczytaj status i postęp |
| Pobierz wynik | GET https://api.cometapi.com/v1/videos/{task\_id}/content | Pobierz ukończony plik MP4 |
Jak używać FLUX 3 API z CometAPI
Krok 1: Ustaw klucz API
Na macOS lub Linux:
export COMETAPI_KEY="your_api_key"
W Windows PowerShell:
$env:COMETAPI_KEY="your_api_key"
Krok 2: Utwórz wideo FLUX 3
Aktualny quickstart FLUX 3 używa żądania multipart z polami model, prompt, seconds i size. Ten przykład prosi o pięciosekundowy klip 720p:
curl https://api.cometapi.com/v1/videos \
-H "Authorization: Bearer $COMETAPI_KEY" \
-F "model=flux-3" \
-F "prompt=A paper boat glides across a still pond in soft morning light" \
-F "seconds=5" \
-F "size=1280x720"
To żądanie uruchamia zadanie. Nie projektuj aplikacji tak, aby oczekiwała gotowego MP4 w tej samej odpowiedzi HTTP.
Krok 3: Zapisz identyfikator zadania
Utrwal identyfikator natychmiast po powodzeniu żądania utworzenia:
{
"id": "video_task_id",
"status": "queued"
}
Przechowuj identyfikator zadania obok rekordu użytkownika lub zadania przed rozpoczęciem odpytywania. Restart procesu nie powinien spowodować utraty generacji, za którą już naliczono opłatę.
Krok 4: Odpytuj status wideo
curl https://api.cometapi.com/v1/videos/{task_id} \
-H "Authorization: Bearer $COMETAPI_KEY"
Rozpocznij od umiarkowanego interwału, np. dziesięciu sekund. Traktuj completed, succeeded lub success jako końcowe stany powodzenia; traktuj failed, failure, cancelled lub canceled jako końcowe stany niepowodzenia.
Krok 5: Pobierz MP4
curl https://api.cometapi.com/v1/videos/{task_id}/content \
-H "Authorization: Bearer $COMETAPI_KEY" \
--output flux3_output.mp4
Po zakończeniu skopiuj plik do własnej pamięci obiektowej lub potoku medialnego zamiast utrzymywać tymczasowy adres URL dostawcy jako trwały zasób.
Kompletny przepływ w Pythonie dla generowania wideo FLUX 3
Poniższy przykład tworzy zadanie, zapisuje jego ID, odpytywuje do zakończenia, sprawdza stany niepowodzenia, weryfikuje sygnaturę MP4 i zapisuje wynik na dysku.
import os
import time
from pathlib import Path
import requests
api_key = os.environ["COMETAPI_KEY"]
base_url = "https://api.cometapi.com"
headers = {"Authorization": f"Bearer {api_key}"}
response = requests.post(
f"{base_url}/v1/videos",
headers=headers,
files={
"model": (None, "flux-3"),
"prompt": (
None,
"A product bottle rotates slowly on wet black stone, "
"soft rim lighting, macro lens, realistic reflections.",
),
"seconds": (None, "5"),
"size": (None, "1280x720"),
},
timeout=120,
)
response.raise_for_status()
task = response.json()
data = task.get("data") or {}
task_id = (
task.get("id")
or task.get("task_id")
or data.get("id")
or data.get("task_id")
)
if not task_id:
raise RuntimeError(f"Create response has no task ID: {task}")
while True:
response = requests.get(
f"{base_url}/v1/videos/{task_id}",
headers=headers,
timeout=60,
)
response.raise_for_status()
task = response.json()
data = task.get("data") or {}
status = str(task.get("status") or data.get("status") or "").lower()
progress = task.get("progress") or data.get("progress") or "unknown"
print(f"Status: {status or 'unknown'}; progress: {progress}")
if status in {"failed", "failure", "cancelled", "canceled"}:
raise RuntimeError(f"Video generation failed: {task}")
if status in {"completed", "succeeded", "success"} or progress == "100%":
break
time.sleep(10)
response = requests.get(
f"{base_url}/v1/videos/{task_id}/content",
headers=headers,
timeout=300,
)
response.raise_for_status()
video = response.content
if len(video) < 12 or video[4:8] != b"ftyp":
raise RuntimeError("Content response is not a non-empty MP4 file")
output_dir = Path("output")
output_dir.mkdir(parents=True, exist_ok=True)
output_path = output_dir / f"{task_id}.mp4"
output_path.write_bytes(video)
print(f"Saved: {output_path} ({len(video)} bytes)")
Jak używać obraz-na-wideo i klatek kluczowych
Strona FLUX 3 w CometAPI wymienia obraz-na-wideo jako obsługiwaną funkcję. Jej publiczny przykład pokazuje tekst-na-wideo, więc zweryfikuj bieżącą dokumentację bramki przed założeniem, że pole obrazu referencyjnego skopiowane z innego modelu zadziała bez zmian.
Natywne API BFL jest precyzyjne: obraz-na-wideo używa trybu i2v i pola keyframes. Jeden obraz przypina klatkę startową, dwa obrazy mogą przypiąć początek i koniec, a do dziesięciu obrazów z czasem może stworzyć storyboard ciągłego klipu.
Natywny przykład klatek kluczowych BFL
curl -X POST https://api.bfl.ai/v1/flux-3-video \
-H "x-key: $BFL_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"mode": "i2v",
"prompt": "They sprint through the lantern-lit alley as the camera tracks behind them.",
"keyframes": [
[0, "data:image/png;base64,<first-frame>"],
[8, "data:image/png;base64,<last-frame>"]
],
"duration": 8
}'
Utrzymuj osobne adaptery dla parametrów natywnych i bramkowych. BFL używa pól takich jak mode, keyframes, start_video, resolution i draft; zweryfikowany przykład CometAPI używa model, prompt, seconds i size.
Wyjaśnienie parametrów FLUX 3 API
| Parametr | API | Co kontroluje | Wskazówki praktyczne |
|---|---|---|---|
| model | CometAPI | Wybór modelu | Używaj flux-3 |
| prompt | Oba | Scena, akcja, kamera, audio | Opisz widoczną zmianę w czasie |
| seconds | Przykład CometAPI | Żądana długość klipu | Zacznij od 5–8 sekund podczas strojenia |
| size | Przykład CometAPI | Wymiary wyjściowe | Zacznij od 1280x720 dla ekonomicznych testów |
| mode | Natywne BFL | t2v / i2v / v2v / draft_enhance | Nie wysyłaj, chyba że bramka to mapuje |
| duration | Natywne BFL | 5–20 s T2V/I2V; 5–15 s V2V | auto jest obsługiwane przez natywne API |
| resolution | Natywne BFL | hd lub fhd; 4K/UHD nie jest obecnie wymienione dla FLUX 3 Video | FHD kończy przez upsampler wideo |
| generate_audio | Natywne BFL | Włączenie/wyłączenie zsynchronizowanego audio | Domyślnie true |
| draft | Natywne BFL | Szybki tryb podglądu | Używaj do tańszych iteracji kreatywnych |
Jak pisać lepsze prompty dla FLUX 3
Przewodnik BFL dotyczący tworzenia promptów wideo zaleca jasne wskazanie tematu i akcji, kamery, sceny i atmosfery, jakości ruchu oraz ciągłości. W scenach prowadzonych przez audio określ dialog, głos, efekty dźwiękowe i ambience.
Praktyczna struktura promptu
Subject + Environment + Action + Camera + Lighting
+ Dialogue/Voice + Sound Effects + Ambience + Constraints
Prompt filmowy
A lone cyclist rides through a rain-soaked neon street at midnight.
The camera begins low beside the rear wheel, then rises into a smooth tracking shot.
Reflections stretch across wet asphalt under moving cyan and magenta light.
Audio: steady rainfall, chain noise, distant traffic, no music, no dialogue.
Keep the same rider, bicycle, jacket, and weather throughout the shot.
Prompt produktowy
A premium stainless-steel espresso machine stands on a dark stone counter.
Begin with a macro close-up of water droplets on the metal housing.
Orbit clockwise as the machine brews; steam catches warm side light.
Finish on a clean three-quarter hero angle with the cup in the foreground.
Audio: pump vibration, steam hiss, ceramic contact, quiet cafe ambience.
Do not change the product shape, logo placement, material, or color.
Prompt z dialogiem i natywnym audio
A young chef works alone in a compact Tokyo ramen shop at night.
Start close on boiling broth, then pull back as the chef sets down a bowl.
Warm tungsten lighting, natural reflections, documentary handheld motion.
The chef quietly says in Japanese: 「お待たせしました。」
Audio: bubbling broth, soft rain outside, distant street traffic.
No subtitles and no background music.
Prompt taki jak „make a cinematic ramen shop video” pozostawia ruch, kadrowanie, dźwięk i ciągłość niesprecyzowane. Jasne wskazówki tworzą bardziej testowalny brief produkcyjny.
Cennik FLUX 3 API
Ceny BFL są specyficzne dla przepływu: pełne renderingi tekst-na-wideo i obraz-na-wideo kosztują $0.17/s w HD lub $0.29/s w FHD, a HD Draft Mode $0.06/s. Kontynuacja wideo kosztuje $0.43/s w HD lub $0.54/s w FHD, z HD draftami po $0.12/s. CometAPI obecnie wymienia flux-3 po $0.136/s dla 720p i $0.232/s dla 1080p. Zweryfikuj bieżące ceny przed dużą partią.
| Dostawca / przepływ | HD / 720p pełny | FHD / 1080p pełny | Draft | 5 s pełny render | 10 s pełny render |
|---|---|---|---|---|---|
| BFL T2V | $0.17/s | $0.29/s | $0.06/s (HD) | $0.85 / $1.45 | $1.70 / $2.90 |
| BFL I2V | $0.17/s | $0.29/s | $0.06/s (HD) | $0.85 / $1.45 | $1.70 / $2.90 |
| BFL V2V continuation | $0.43/s | $0.54/s | $0.12/s (HD) | $2.15 / $2.70 | $4.30 / $5.40 |
| CometAPI flux-3 | $0.136/s | $0.232/s | Not listed | $0.68 / $1.16 | $1.36 / $2.32 |
Czytanie dwóch ostatnich kolumn: wartości są podane najpierw dla HD/720p, a następnie dla FHD/1080p.
Jak zmniejszyć koszty iteracji
- Prototypuj w 720p, zanim przeniesiesz wybrany prompt do 1080p.
- Używaj klipów pięciosekundowych do weryfikacji kompozycji, ruchu i interpretacji promptu.
- Zmieniaj jedną główną zmienną promptu naraz.
- Korzystając z natywnego API BFL, testuj Draft Mode przed pełnym renderem.
- Przechowuj udane prompty i decyzje referencyjne w metadanych aplikacji.
FLUX 3 vs Wan 3.0 vs Seedance 2.5
Porównuj FLUX 3, Wan 3.0 i Seedance 2.5 według przepływu, zamiast szukać jednego uniwersalnego zwycięzcy. Autorytatywne linki do specyfikacji pozostają w nagłówku tabeli poniżej.
| Wymiar | FLUX 3 Oficjalna specyfikacja | Wan 3.0 Oficjalna specyfikacja | Seedance 2.5 Oficjalna specyfikacja |
|---|---|---|---|
| Maksymalna długość klipu | Do 20 s T2V/I2V | Do 30 s | Do 30 s |
| Zsynchronizowane audio | Tak | Tak | Tak |
| Tekst-na-wideo | Tak | Tak | Tak |
| Obraz-na-wideo | Tak | Tak | Tak |
| Strategia referencji | Do 10 natywnych klatek kluczowych | Szeroki przepływ multimodalny i Omni-Reference | Duża pojemność odniesień multimodalnych |
| Kontynuacja/edycja | Natywna kontynuacja v2v BFL | Długie formy i przepływy edycyjne | Wydłużanie i przepływy edycyjne |
| Cechy wyróżniające | Logika ruchu, wielo-ujęciowe sceny, zsynchronizowane audio-wideo | Szeroka gama wejść i generacja 30-sekundowa | Dłuższe opowiadanie i kontrola tożsamości/stylu |
| Cena wyjściowa w CometAPI | $0.136/s | $0.04/s | $0.0824/s |
| Najlepsze zastosowanie | Filmowe lub realistyczne ujęcia audiowizualne | Kompleksowe multimodalne potoki produkcyjne | Dłuższe, referencyjne opowiadanie historii |
Uwaga cenowa: ceny wyjściowe nie są porównaniem jabłka do jabłek jakości czy rozdzielczości. Do budżetowania używaj tabeli rozdzielczościowej na każdej aktywnej stronie modelu.
Które Video API wybrać?
- Wybierz FLUX 3 dla realistycznego ruchu, zsynchronizowanego dźwięku, logiki wielu ujęć, natywnych klatek kluczowych lub kontynuacji.
- Wybierz Wan 3.0, gdy przepływ zaczyna się od wielu typów wejść i liczy się 30-sekundowe okno generacji.
- Wybierz Seedance 2.5 dla dłuższego, silnie referencyjnego storytellingu z mocną kontrolą tożsamości, produktu i stylu.
Najlepsze praktyki produkcyjne FLUX 3 API
Utrwalaj zadania asynchroniczne jako trwały stan
Zapisuj identyfikator zadania natychmiast po wysłaniu. Restart serwera lub ponowienie pracy nie powinny zmuszać użytkownika do płacenia za kolejną generację, bo aplikacja utraciła oryginalne zadanie.
Unikaj zbyt częstego odpytywania
Zacznij od interwału około dziesięciu sekund, chyba że bieżąca dokumentacja zaleca inaczej. Odpytywanie co sekundę zwiększa presję na API bez materialnej poprawy doświadczenia.
Waliduj pobrany plik
Sprawdź długość treści i sygnaturę MP4 przed oznaczeniem zasobu jako kompletnego. Udana odpowiedź HTTP nie zawsze dowodzi, że ciało jest prawidłowym wideo.
Rozdziel schematy natywne i bramkowe
Utrzymuj osobne adaptery dla żądań natywnych BFL i CometAPI. Zapobiega to przenikaniu pól natywnych, takich jak mode, keyframes i start_video, do wywołania bramki oczekującej model, prompt, seconds i size.
Przechowuj pełny kontekst awarii
Loguj status HTTP, treść odpowiedzi, identyfikator zadania, identyfikator modelu, wersję promptu, rozmiar, czas trwania i wewnętrzny identyfikator pracy. Zredaguj klucz API.
Użyj niewielkiego zestawu ewaluacyjnego przed wdrożeniem
Zbuduj 10–30 reprezentatywnych promptów obejmujących ruch kamery, ludzi, produkty, typografię, dialog, sceny o dużym ruchu i wymagane proporcje. Uruchamiaj ten sam zestaw, gdy zmienia się wersja modelu lub integracji, i powtarzaj ważne prompty, ponieważ generowanie wideo jest stochastyczne.
FAQ
Jaki jest identyfikator modelu FLUX 3 w CometAPI?
Aktualny identyfikator modelu to flux-3.
Z którego endpointu CometAPI korzysta FLUX 3?
Zweryfikowany przepływ Video API używa POST /v1/videos, następnie GET /v1/videos/{task_id} i GET /v1/videos/{task_id}/content.
Czy FLUX 3 działa synchronicznie?
Nie. Traktuj go jako zadanie asynchroniczne: wyślij, utrwal identyfikator zadania, odpytywaj i pobierz.
Jak długi klip może generować FLUX 3?
BFL dokumentuje 5–20 sekund dla T2V/I2V i 5–15 sekund dla kontynuacji.
Czy FLUX 3 generuje audio?
Tak. BFL dokumentuje zsynchronizowane audio domyślnie włączone w swoim natywnym API.
Czy FLUX 3 obsługuje obraz-na-wideo?
Tak. CometAPI wymienia obsługę obraz-na-wideo, podczas gdy natywne API BFL realizuje to przez tryb i2v i klatki kluczowe.
Czy mogę używać klatek kluczowych BFL przez CometAPI bez zmian?
Nie zakładaj tego. Schematy żądań różnią się; zweryfikuj bieżący quickstart CometAPI przed wdrożeniem przepływu obrazu referencyjnego w bramce.
Ile kosztuje pięciosekundowe wideo FLUX 3 w CometAPI?
Przy obecnie wymienionych stawkach CometAPI pięć sekund kosztuje $0.68 w 720p lub $1.16 w 1080p. Zobacz skonsolidowaną tabelę cen powyżej dla linku do bieżącej referencji.
Czy FLUX 3 jest lepszy niż Wan 3.0 lub Seedance 2.5?
To zależy od przepływu pracy. FLUX 3 jest przekonujący dla spójnych ruchowo ujęć audiowizualnych oraz natywnych klatek kluczowych lub kontynuacji; Wan 3.0 kładzie nacisk na szerokość wejść; Seedance 2.5 na dłuższe, silnie referencyjne opowiadanie historii.
Wnioski
FLUX 3 ma teraz działającą asynchroniczną ścieżkę Video API w CometAPI, podczas gdy natywna dokumentacja BFL ujawnia głębsze sterowanie klatkami kluczowymi, kontynuacją, audio i Draft Mode.
Bezpieczna ścieżka integracji jest prosta: zacznij od krótkiego żądania tekst-na-wideo w 720p, utrwal identyfikator zadania, odpytywaj konserwatywnie, pobierz i zweryfikuj MP4, a następnie dodaj szablony promptów, przechowywanie, logikę ponowień i powtarzalny zestaw ewaluacyjny. Rozdziel schematy natywne i bramkowe oraz weryfikuj aktywną stronę modelu przed twardym zakodowaniem pól lub cen.
