TL;DR: FLUX 3 ialah model asas multimodal bersatu oleh Black Forest Labs. Video API awamnya menjana klip sehingga 20 saat pada 24 fps, dengan audio tersegerak pilihan, daripada teks, imej, bingkai utama atau video sedia ada. Ia menyokong resolusi daripada HD hingga UHD/4K, manakala FLUX 3 Image dan model FLUX 3 Dev berat terbuka kekal sebagai item pelancaran berasingan.
Apakah FLUX 3?
FLUX 3 ialah model multimodal terkehadapan daripada Black Forest Labs. Daripada melatih satu model untuk imej, satu lagi untuk video, dan satu lagi untuk audio secara berasingan, BFL melatih perwakilan bersama merentas modaliti ini.
Idea utamanya ialah imej, video dan bunyi merupakan pemerhatian berbeza tentang dunia yang mendasari sama. Sebuah kereta yang bergerak mempunyai rupa visual, gerakan, bunyi, hubungan ruang, sifat bahan, dan tingkah laku kausal. Mempelajari isyarat-isyarat ini bersama-sama memberi model lebih banyak kekangan berbanding mempelajari bingkai individu sahaja.
Inilah sebabnya Black Forest Labs menerangkan FLUX 3 sebagai satu langkah ke arah model realiti atau model dunia dan bukan sekadar penjana imej atau video. Sistem video yang dikeluarkan sudah menunjukkan hala tuju itu: audio tersegerak, gerakan, struktur adegan, dialog, tingkah laku kamera dan bunyi persekitaran dikendalikan dalam satu aliran kerja penjanaan.
Tidak semua keupayaan FLUX 3 yang diumumkan tersedia untuk umum lagi. Setakat September 2026, FLUX 3 Video tersedia, manakala FLUX 3 Image dan model FLUX 3 Dev berat terbuka kekal sebagai item pelancaran berasingan.
Spesifikasi FLUX 3 Sekilas Pandang
Spesifikasi berikut mencerminkan dokumentasi pembangun FLUX 3 semasa dan bukannya konfigurasi pelancaran awal bulan Julai.
| Spesifikasi | Dokumentasi rasmi FLUX 3 |
|---|---|
| Pembangun | Black Forest Labs |
| Keluarga model | FLUX 3 |
| Jenis model | Model asas multimodal bersatu / model video generatif |
| Keluaran video awam | 4 Ogos 2026 |
| Arah latihan teras | Pembelajaran perwakilan imej, video dan audio bersama |
| Asas penyelidikan | Self-Flow |
| Output API utama semasa | Video dengan audio tersegerak |
| Teks ke video | Disokong |
| Imej ke video | Disokong |
| Bingkai utama ke video | Disokong |
| Sambungan video | Disokong |
| Tempoh maksimum T2V/I2V | 20 saat |
| Tempoh sambungan video | 5–15 saat |
| Kadar bingkai | 24 fps |
| Resolusi | HD, FHD, QHD/2K dan UHD/4K |
| Resolusi FHD 16:9 | 1920 × 1088 |
| Rujukan imej | Sehingga 10 untuk aliran kerja I2V/bingkai utama |
| Audio natif | Ya |
| Dialog berbilang bahasa | Ya |
| Penyegerakan bibir | Ya |
| Penjanaan berbilang syot | Ya |
| Mod Draf | Ya |
| Titik akhir imej pegun FLUX 3 awam | Belum dikeluarkan secara umum oleh BFL |
| FLUX 3 Dev berat terbuka | Dirancang |
Dokumentasi BFL semasa menyatakan 5–20 saat untuk teks-ke-video dan imej-ke-video, manakala sambungan video menerima tetingkap penjanaan 5–15 saat. Nisbah aspek yang disokong termasuk 21:9, 2:1, 16:9, 4:3, 1:1, 3:4 dan 9:16.
Bagaimanakah FLUX 3 Berfungsi?
Self-Flow
Asas penyelidikan utama ialah Self-Flow, pendekatan padanan aliran pembelajaran sendiri oleh Black Forest Labs. Rangkaian latihan penjanaan tradisional sering bergantung pada model perwakilan terlatih sedia ada atau penyeliaan tambahan. Self-Flow direka untuk mempelajari perwakilan berguna terus daripada objektif penjanaan.
Mekanisme utama ialah Dual-Timestep Scheduling. Kumpulan token berbeza boleh diberikan tahap hingar berbeza semasa latihan. Ini mewujudkan asimetri maklumat: sesetengah bahagian input mengandungi lebih banyak maklumat berguna berbanding yang lain, memaksa rangkaian membina perwakilan yang membantu meneka apa yang hilang.
Secara praktikal, FLUX 3 digalakkan mempelajari hubungan antara objek, bingkai, gerakan, bunyi dan peristiwa temporal dan bukannya sekadar menghafal rupa bingkai individu.

Senibina kaedah Self-Flow - sumber imej rasmi: Black Forest Labs Self-Flow project
BFL juga menguji latihan multimodal bersama menggunakan rangka belakang terbitan FLUX.2 dengan jutaan video dan ratusan juta imej. Eksperimen ini menyokong hipotesis FLUX 3 yang lebih luas bahawa pembelajaran perwakilan dan penjanaan tidak perlu menjadi sistem berasingan.
Mengapa Video Pusat kepada FLUX 3
Video amat bernilai untuk pemodelan dunia kerana ia mengandungi maklumat yang imej pegun tidak dapat sediakan. Satu bingkai boleh menunjukkan bola di atas lantai; video boleh mendedahkan bahawa bola sedang jatuh, melantun, berubah bentuk ketika hentaman, mengeluarkan bunyi, dan mengubah arah selepas itu.
BFL mendedahkan bahawa ramalan video merangkumi lebih daripada 95% penggunaan pengkomputeran latihan FLUX 3. Audio jauh lebih murah kerana ia isyarat berdimensi lebih rendah yang sangat berkait dengan peristiwa yang kelihatan. Peruntukan itu membantu menjelaskan mengapa video menjadi keupayaan pertama FLUX 3 yang mencapai ketersediaan umum.
Apa yang Boleh Dilakukan FLUX 3?
Teks-ke-Video
Pengguna boleh menjana video lengkap daripada arahan bahasa semula jadi. BFL menyatakan model keluaran mengendalikan prompt mudah dan kompleks sambil menyelaras pergerakan, logik adegan, komposisi visual dan bunyi. Ini amat berguna untuk prompt yang mengandungi beberapa peristiwa berurutan dan bukannya satu subjek animasi sahaja.
Imej-ke-Video dan Bingkai Utama
FLUX 3 boleh menganimasikan imej awal, berusaha ke arah bingkai akhir, atau menggunakan berbilang imej sebagai bingkai utama berjadual. API semasa menyokong sehingga sepuluh rujukan imej dalam aliran kerja imej-ke-video, membolehkan pencipta mengawal cara adegan berubah dari masa ke masa dan bukannya meminta model mengimprovisasi keseluruhan urutan.
Sambungan Video
Video sedia ada dan audionya boleh dibekalkan sebagai konteks dan FLUX 3 boleh menjana apa yang berlaku seterusnya. BFL menerangkan sambungan yang mengekalkan pergerakan, tingkah laku kamera, dialog dan bunyi merentasi peralihan, yang secara material berbeza daripada menjana klip kedua secara berasingan dan menyambungkan kedua-dua fail selepas itu.
Audio Natif dan Dialog
FLUX 3 menghasilkan audio semasa penjanaan dan tidak memerlukan laluan penjanaan pertuturan atau bunyi berasingan. Keupayaan audio yang dikeluarkan termasuk dialog, kesan bunyi dan bunyi ambien. Dialog berbilang bahasa dengan penyegerakan bibir juga disokong.
Pelbagai Syot dalam Satu Penjanaan
Satu prompt boleh mengandungi beberapa adegan atau sudut kamera. Ini penting kerana banyak model video awal paling kuat apabila diminta satu syot pendek yang berterusan secara visual; FLUX 3 direka secara eksplisit untuk menyokong urutan berbilang syot dalam satu penjanaan.
Mod Draf
Mod Draf ialah salah satu penambahan yang lebih praktikal untuk penjanaan video volum tinggi. Daripada membayar harga penuh untuk setiap eksperimen prompt, pembangun boleh mencipta pratonton yang lebih pantas dan berkos rendah dan kemudian menambah baik draf terpilih sambil mengekalkan komposisi dan gerakan yang dipilih. Mengikut harga BFL semasa, draf T2V/I2V standard berharga $0.06 sesaat, berbanding $0.17 sesaat untuk penjanaan HD biasa.
Apa yang Belum Dihantar?
Pengumuman pelancaran FLUX 3 menerangkan keupayaan imej, video, audio dan tindakan di bawah satu hala tuju seni bina, tetapi ketersediaannya berperingkat.
| Keupayaan | Peta jalan dan ketersediaan BFL semasa |
|---|---|
| Penjanaan FLUX 3 Video | Tersedia secara umum |
| Audio video natif | Tersedia secara umum |
| Teks-ke-video | Tersedia secara umum |
| Imej-ke-video / bingkai utama | Tersedia secara umum |
| Sambungan video | Tersedia secara umum |
| Gabungan rujukan imej/video/audio yang lebih kaya | Pengembangan dirancang |
| Penjanaan dan penyuntingan FLUX 3 Image | Akan datang |
| FLUX 3 Dev berat terbuka | Dirancang |
| Pengerahan ramalan tindakan | Penyelidikan / trek rakan komersial |
Perbezaan ini amat penting bagi pengguna yang biasa dengan FLUX.2 Max. FLUX.2 kekal sebagai pilihan khusus semasa untuk penjanaan imej pegun, manakala produk FLUX 3 awam memfokuskan pada video dan audio.
Prestasi Penanda Aras FLUX 3
Kini terdapat dua jenis bukti penanda aras FLUX 3 yang berguna: penilaian dalaman pasca-keluaran BFL dan penilaian pihak ketiga bebas. Yang pertama menunjukkan keutamaan manusia relatif di bawah protokol BFL; yang kedua memeriksa sama ada kekuatan itu kekal kelihatan di bawah penanda aras yang direka secara berasingan.
Penilaian ELO Pasca-Keluaran BFL
Pengumuman Julai awal termasuk kadar kemenangan awal. Penanda aras yang lebih relevan untuk pengguna semasa ialah penilaian model keluaran BFL pada 4 Ogos. Black Forest Labs melaporkan skor ELO teks-ke-video sebanyak 1135 dalam penilaian semua-lawan-semua dalaman.

Penilaian ELO model keluaran FLUX 3 - sumber imej rasmi: Black Forest Labs
| Metrik | Penilaian model keluaran BFL |
|---|---|
| ELO teks-ke-video | 1135 |
| Kedudukan T2V | Skor tertinggi dalam kumpulan diuji BFL |
| Keputusan imej-ke-video | Setara dengan pesaing terkuat yang diuji dan mengatasi model lain yang dinilai |
| Jenis penilaian | Penilaian keutamaan manusia dalaman |
| Peringkat model | Keluaran FLUX 3 Video tersedia umum |
Ini bukti yang lebih kukuh daripada penanda aras pelancaran awal kerana ia menilai model Ogos yang dikeluarkan. Namun ia masih penanda aras dikendalikan vendor, dan tidak boleh ditafsirkan sebagai bukti bahawa FLUX 3 akan mengatasi semua pesaing dalam setiap kategori prompt.
Penanda Aras FLUX 3 Bebas
v-benchmark v2 Megaton menyediakan semakan bebas. FLUX 3 dinilai pada Ogos 2026 dan ketika ini mencatat Indeks Megaton 76.51/100, berada di tempat #3 dalam set diterbitkan pada masa penilaian.
| Dimensi penanda aras | Penilaian Megaton FLUX 3 |
|---|---|
| Indeks Megaton | 76.51 |
| Pematuhan Prompt | 87.07 |
| Konsistensi Adegan | 94.76 |
| Fizik | 70.63 |
| Kesetiaan Manusia | 73.70 |
| Kesetiaan Objek & Produk | 83.82 |
| Koheren Kausal & Semantik | 80.91 |
| Kesetiaan Teks | 82.41 |
| Sinematografi | 71.43 |
| Cita Rasa & Arahan Seni | 65.00 |
Profil ini lebih bermaklumat daripada skor keseluruhan. Konsistensi Adegan pada 94.76 ialah kategori utama terkuat, manakala Pematuhan Prompt, kesetiaan objek, koheren kausal, dan kesetiaan teks juga melebihi 80. Fizik, Kesetiaan Manusia, dan Cita Rasa & Arahan Seni lebih lemah, menunjukkan bahawa perwakilan temporal yang lebih kuat tidak menghapuskan gerakan sintetik atau variasi kualiti artistik.
Ini juga menjelaskan mengapa kesimpulan penanda aras boleh berbeza: ujian keutamaan dalaman BFL meletakkan FLUX 3 di puncak set perbandingannya, manakala papan kedudukan bebas Megaton meletakkannya di tempat ketiga. Prompt, dimensi pemarkahan, populasi penilai dan kaedah pengagregatan yang berbeza boleh menghasilkan kedudukan yang berbeza.
FLUX 3 vs Seedance 2.5 vs MiniMax H3 vs Wan 3.0
Pasaran video AI bergerak pantas pada 2026. FLUX 3 kini bersaing dengan sistem multimodal yang semakin menggabungkan penjanaan bentuk panjang, audio tersegerak, rujukan dan penyuntingan.
| Dimensi | FLUX 3 | Seedance 2.5 | MiniMax H3 | Wan 3.0 |
|---|---|---|---|---|
| Pembangun | Black Forest Labs | ByteDance Seed | MiniMax | Alibaba |
| Klip maksimum diiklankan | 20 s | 30 s | 15 s | 30 s |
| Resolusi video | HD / FHD / QHD (2K) / UHD (4K) | Bergantung pada tier API | Sehingga 2K | Sehingga 1080p |
| Audio natif | Ya | Ya | Ya, stereo | Ya |
| Teks-ke-video | Ya | Ya | Ya | Ya |
| Input imej/rujukan | Ya | Ya | Ya | Ya |
| Kawalan bingkai utama/rujukan | Bingkai utama berjadual yang kuat | Kawalan rujukan multimodal yang kuat | Pengkondisian multimodal | Kawalan rujukan multimodal |
| Sambungan/penyuntingan video | Sambungan tersedia | Aliran kerja berorientasikan penyuntingan | Fokus generasi omni | Aliran kerja penyuntingan dan rujukan |
| Penjanaan berbilang syot | Ya | Ya | Ya | Ya |
| Kekuatan tersendiri | Seni bina model realiti, konsistensi adegan, Self-Flow | Penceritaan bentuk panjang dan kawalan rujukan | Penjanaan audiovisual 2K dan konteks omni-modal | Klip panjang dan kos permulaan lebih rendah |
| Harga permulaan/unit CometAPI* | $0.136/s | $0.0824/s disenaraikan | $0.064/s | $0.040/s |
* Perbandingan harga adalah anggaran sahaja. API video menggunakan resolusi, durasi, tier kualiti dan peraturan bil berbeza, jadi nombor termurah per saat bukan semestinya output kualiti setara yang paling murah.
FLUX 3 vs Seedance 2.5
Seedance 2.5 mempunyai kelebihan durasi jelas, dengan penjanaan sehingga 30 saat berbanding 20 saat untuk FLUX 3. Ia juga berorientasikan kuat kepada penjanaan dipacu rujukan, penyuntingan dan penceritaan bentuk panjang. FLUX 3 membezakan diri melalui seni bina model dunia bersama, konsistensi adegan, penjanaan audiovisual natif, bingkai utama berjadual dan peta jalan imej/tindakan yang lebih luas.
Ujian bebas mengukuhkan bahawa ini persaingan bertahap tinggi: Megaton kini meletakkan Seedance 2.5 di atas FLUX 3 secara keseluruhan.
FLUX 3 vs MiniMax H3
MiniMax H3 menawarkan output sehingga 2K dan audio stereo natif, memberikan spesifikasi teknikal yang kukuh untuk kandungan audiovisual. FLUX 3 menyokong tetingkap penjanaan maksimum yang lebih panjang—20 saat berbanding 15 saat untuk H3—dan Mod Drafnya menyediakan aliran kerja iterasi terkawal kos.
FLUX 3 vs Wan 3.0
Wan 3.0 menekankan input multimodal yang luas, penjanaan audiovisual, penyuntingan, dan klip sehingga 30 saat. Ia juga lebih murah pada harga permulaan yang disenaraikan oleh CometAPI. FLUX 3 lebih mahal tetapi membezakan melalui kedudukan model realiti, konsistensi adegan, asas penyelidikan Self-Flow, Mod Draf, dan integrasi dengan peramalan tindakan.
Harga FLUX 3
Black Forest Labs mengenakan caj FLUX 3 mengikut durasi video yang dijana.
| Mod | Harga rasmi BFL FLUX 3 |
|---|---|
| T2V / I2V Draf HD | $0.06/s |
| T2V / I2V HD | $0.17/s |
| T2V / I2V FHD | $0.29/s |
| T2V / I2V QHD (2K) | $0.40/s |
| T2V / I2V UHD (4K) | $0.80/s |
| Sambungan video Draf | $0.12/s |
| Sambungan video HD | $0.41/s |
| Sambungan video FHD | $0.53/s |
| Sambungan video QHD (2K) | $0.65/s |
| Sambungan video UHD (4K) | $0.95/s |
Penjanaan HD standard selama 10 saat oleh itu berharga kira-kira $1.70 pada kadar disenaraikan BFL, manakala penjanaan FHD 10 saat berharga kira-kira $2.90. Sambungan video jauh lebih mahal daripada penjanaan biasa, jadi aplikasi yang kerap memanjangkan klip harus memodelkan kos tersebut secara berasingan.
Harga FLUX 3 di CometAPI
CometAPI kini menyenaraikan FLUX 3 sebagai tersedia dengan ID model flux-3.
| Resolusi | Harga FLUX 3 di CometAPI |
|---|---|
| 720p | $0.136/s |
| 1080p | $0.232/s |
Untuk penjanaan 10 saat, itu bersamaan kira-kira $1.36 pada 720p atau $2.32 pada 1080p. Berbanding kadar $0.17/s dan $0.29/s yang disenaraikan BFL, harga lalai CometAPI kira-kira 20% lebih rendah untuk dua tier ini.
Nota ketersediaan: sesetengah salinan deskriptif lama di CometAPI masih mencerminkan tempoh Akses Awal bulan Julai. kartu model langsung, bahagian harga, dan contoh API semasa menyenaraikan flux-3 sebagai Available, dengan tarikh keluaran CometAPI 13 Ogos 2026. Untuk keputusan integrasi, API langsung dan medan harga lebih relevan daripada salinan ketersediaan lama.
Mengapa FLUX 3 Penting Melangkaui Video AI
Bahagian paling luar biasa FLUX 3 bukanlah penjanaan video 20 saat. Beberapa pesaing sudah boleh menjana klip yang sama panjang atau lebih panjang. Pertaruhan teknikal yang lebih besar ialah perwakilan video yang kuat boleh menjadi asas untuk bentuk kecerdasan lain.
Daripada Peramalan Video ke Peramalan Tindakan
Isyarat kawalan robot ialah ramalan temporal terkondisi pada pemerhatian visual, jadi BFL menggunakan perwakilan video FLUX 3 sebagai asas untuk peramalan tindakan. Kerjasamanya dengan mimic robotics menghasilkan FLUX-mimic, di mana penyahkod tindakan membaca perwakilan daripada model video dan bukannya melatih timbunan persepsi yang benar-benar berasingan.
BFL melaporkan bahawa rangka belakang FLUX-mimic boleh berjalan dalam di bawah 80 ms pada satu RTX 5090, manakala sistem robot lengkap mencapai gelung tindak balas sekitar 101 ms. Syarikat itu juga membincangkan penilaian industri dengan Audi.
Ini tidak menjadikan API Video FLUX 3 awam sebagai API robotik. Ia menunjukkan mengapa BFL banyak melabur dalam perwakilan video multimodal dan bukannya menganggap penjanaan video sebagai tugas media terasing.
Apakah Kekuatan Utama FLUX 3?
- Konsistensi temporal dan adegan. Skor Konsistensi Adegan 94.76 oleh Megaton ialah kategori penanda aras utama terkuat model ini.
- Penjanaan audiovisual natif. Dialog, kesan, ambien dan visual boleh dijana bersama dan bukannya digabungkan daripada model berasingan.
- Pematuhan prompt yang kukuh. Keputusan Pematuhan Prompt bebas 87.07 menunjukkan kekuatan model melangkaui penggilapan visual semata-mata.
- Kawalan bingkai utama. Sehingga sepuluh imej boleh terlibat dalam aliran kerja imej-ke-video semasa, memberi pencipta kawalan temporal yang jelas.
- Aliran kerja draf ke akhir. Mod Draf menangani masalah kos sebenar dalam video AI: banyak penjanaan dibuang semasa iterasi prompt.
- Julat visual yang luas. BFL memposisikan FLUX 3 sebagai mampu menghasilkan output mentah, semula jadi, sinematik, nostalgia, ceria, bergaya dan luar kebiasaan dan bukannya satu gaya rumah tetap.
- Hala tuju penyelidikan model dunia. Self-Flow dan peramalan tindakan menjadikan FLUX 3 relevan melangkaui penjanaan media.
Apakah Batasan FLUX 3?
- Peta jalan multimodal penuh belum dihantar. FLUX 3 Image awam dan berat terbuka FLUX 3 Dev tidak boleh diandaikan daripada pengumuman peringkat keluarga.
- 20 saat bukan lagi durasi terdepan industri. Sesetengah pesaing 2026 sudah menyokong penjanaan 30 saat.
- Fizik belum diselesaikan. Megaton memberikan FLUX 3 skor Fizik 70.63, jauh di bawah skor konsistensi adegan.
- Kesetiaan manusia masih ruang untuk ditambah baik. Skor bebas 73.70 bermakna anatomi sukar dan gerakan manusia realistik masih boleh gagal.
- Sambungan video mahal. Harga sambungan BFL jauh lebih tinggi per saat daripada T2V/I2V biasa.
- Penanda aras kompetitif utama BFL adalah dalaman. Keputusan produksi juga harus merangkumi ujian bebas menggunakan prompt, jenis syot, bahasa dan aset rujukan aplikasi sendiri.
Cara Menggunakan FLUX 3 dengan CometAPI
Liputan FLUX 3 terdahulu oleh CometAPI menerangkan fasa Akses Awal Julai, penanda aras awal dan pelan pelancaran. Bahagian ini memfokuskan integrasi produksi semasa, harga dan aliran API kerja supaya tidak mengulangi laluan sejarah itu. Model produksi FLUX 3 menggunakan ID model flux-3.
Permintaan 720p asas menggunakan titik akhir /v1/videos:
Bash
curl --request POST "https://api.cometapi.com/v1/videos" \--header "Authorization: Bearer $COMETAPI_KEY" \ --form-string "model=flux-3" \ --form-string "prompt=A paper boat glides across a still pond in soft morning light" \ --form-string "seconds=5" \ --form-string "size=1280x720" |
|---|
Aliran kerja video adalah asinkron. Selepas permintaan awal mengembalikan ID tugas, aplikasi menyemak tugas sehingga penjanaan selesai dan kemudian mengambil video yang terhasil. Untuk aplikasi produksi, penjanaan biasanya harus dikendalikan oleh kerja latar atau baris tugas dan bukannya menahan permintaan HTTP terbuka sepanjang masa render.
Siapa Patut Menggunakan FLUX 3?
FLUX 3 amat menarik untuk aplikasi yang memerlukan lebih daripada klip lima saat yang menarik secara visual: sistem pengiklanan dengan visual dan audio tersegerak, produksi bentuk pendek automatik, demonstrasi produk di mana keutuhan objek penting, penjanaan dialog berbilang bahasa, aliran kerja papan cerita ke video, animasi terkawal bingkai utama, kandungan pendidikan dan eksperimen dengan paip multimodal yang lebih panjang.
Ia mungkin kurang menarik apabila satu-satunya keperluan ialah kos serendah mungkin per saat, apabila lebih daripada 20 saat mesti dijana dalam satu laluan, atau apabila penjanaan imej pegun ialah tugas utama. Untuk imej pegun, model imej FLUX sedia ada seperti FLUX.2 Max mungkin lebih sesuai pada masa ini.
Adakah FLUX 3 Lebih Baik Daripada Model Video AI Lain?
Tiada jawapan tunggal yang boleh dipertahankan merentas setiap kes guna. Penilaian dalaman BFL meletakkan FLUX 3 keluaran di puncak perbandingan teks-ke-video, manakala penilaian bebas Megaton meletakkan FLUX 3 di tempat ketiga secara keseluruhan di belakang pesaing yang lebih baharu. Kedua-dua hasil boleh sah kerana ujian mengukur taburan prompt dan dimensi kualiti yang berbeza.
FLUX 3 kelihatan khususnya kuat apabila konsistensi adegan, pematuhan prompt, kesetiaan objek, koheren kausal, render teks, bunyi tersegerak, dan bingkai utama yang boleh dikawal adalah penting. Model lain mungkin menang pada durasi maksimum, resolusi, keutamaan artistik, kesetiaan manusia, aliran kerja penyuntingan atau kos. Bagi pembangun, perbandingan yang betul adalah khusus beban kerja dan bukannya khusus papan kedudukan.
Soalan Lazim
Adakah FLUX 3 tersedia sekarang?
Ya. FLUX 3 Video menjadi tersedia umum melalui BFL pada 4 Ogos 2026. CometAPI juga menyenaraikan FLUX 3 sebagai Available di bawah ID model flux-3. Keluaran imej FLUX 3 dan berat terbuka FLUX 3 Dev kekal sebagai item peta jalan berasingan.
Bolehkah FLUX 3 menjana audio?
Ya. FLUX 3 Video menjana audio natif tersegerak termasuk dialog, bunyi ambien dan kesan. Dialog berbilang bahasa dan penyegerakan bibir juga disokong.
Berapa lama video FLUX 3 boleh jadi?
Penjanaan teks-ke-video dan imej-ke-video semasa menyokong 5–20 saat. Sambungan video menyokong 5–15 saat kandungan baharu yang dijana.
Apakah resolusi yang disokong FLUX 3?
BFL menyokong HD (sehingga 1 megapiksel per bingkai), FHD (sehingga 2 MP), QHD/2K (sehingga 4 MP), dan UHD/4K (sehingga 8 MP). Output FHD 16:9 ialah 1920 × 1088. Jalur resolusi berdasarkan jumlah piksel per bingkai dan bukan nisbah aspek; Mod Draf hanya HD.
Adakah FLUX 3 menyokong imej-ke-video?
Ya. Penjanaan imej-ke-video dan bingkai utama adalah sebahagian daripada set ciri FLUX 3 Video yang tersedia umum.
Adakah FLUX 3 model penjanaan imej?
Secara seni bina, FLUX 3 dilatih merentas imej, video dan audio, dan BFL telah menunjukkan penyelidikan penjanaan dan penyuntingan imej. Namun, produk FLUX 3 Image kekal keluaran akan datang; jangan kelirukan peta jalan keluarga dengan API FLUX 3 Video awam semasa.
Adakah FLUX 3 sumber terbuka?
Buat masa ini tidak. BFL telah mengumumkan FLUX 3 Dev, varian multimodal berat terbuka, tetapi belum menyediakan tarikh keluaran awam.
Berapakah kos FLUX 3?
BFL menetapkan harga teks/imej-ke-video pada $0.06/s untuk Draf HD, $0.17/s untuk HD, $0.29/s untuk FHD, $0.40/s untuk QHD, dan $0.80/s untuk UHD. Video-ke-video berharga $0.12/s untuk Draf HD, kemudian $0.41/s untuk HD, $0.53/s untuk FHD, $0.65/s untuk QHD, dan $0.95/s untuk UHD. CometAPI kini menyenaraikan $0.136/s untuk 720p dan $0.232/s untuk 1080p.
Apakah itu Self-Flow?
Self-Flow ialah pendekatan padanan aliran pembelajaran sendiri oleh BFL. Ia direka untuk membolehkan model penjanaan membangunkan perwakilan dalaman yang berguna tanpa bergantung pada model perwakilan luaran. Penggunaan tahap hingar berbeza merentas token menggalakkan rangkaian meneka maklumat yang hilang dan mempelajari hubungan antara pemerhatian multimodal.
Adakah FLUX 3 model dunia?
Black Forest Labs memposisikan FLUX 3 sebagai asas model realiti kerana perwakilan berkongsi meluas daripada ramalan audiovisual ke arah peramalan tindakan fizikal. Menyebutnya sebagai model dunia tujuan umum lengkap lebih kuat daripada bukti semasa; penerangan yang lebih tepat ialah model asas penjanaan multimodal yang direka secara eksplisit sekitar objektif pemodelan dunia.
Kesimpulan
FLUX 3 mewakili perubahan yang lebih besar bagi Black Forest Labs berbanding naik taraf konvensional daripada satu model imej FLUX ke yang lain. Idea utamanya ialah melatih perwakilan multimodal bersama tentang dunia, kemudian menggunakan perwakilan itu untuk video, bunyi, imej, dan akhirnya tindakan. Self-Flow menyediakan asas penyelidikan, manakala model FLUX 3 Video yang dikeluarkan ialah demonstrasi produksi pertama strategi itu.
Setakat September 2026, FLUX 3 Video menyokong klip sehingga 20 saat, 24 fps, output daripada HD hingga UHD/4K, audio tersegerak, dialog berbilang bahasa, imej-ke-video, bingkai utama, sambungan video, penjanaan berbilang syot dan Mod Draf.
Gambar penanda aras juga lebih kredibel berbanding ketika pelancaran. Penilaian model keluaran BFL meletakkan FLUX 3 pertama dalam ujian ELO T2V dalaman, manakala ujian bebas Megaton meletakkannya di tempat ketiga secara keseluruhan dan menonjolkan konsistensi adegan yang khususnya kuat.
FLUX 3 oleh itu bukan secara automatik model video terbaik untuk setiap beban kerja. Seedance 2.5, MiniMax H3, dan Wan 3.0 boleh menawarkan penjanaan lebih panjang, resolusi nominal lebih tinggi, harga lebih rendah, atau keupayaan rujukan dan penyuntingan berbeza.
Apa yang menjadikan FLUX 3 luar biasa menarik ialah hala tuju di bawah penjana video: BFL mempertaruhkan bahawa perwakilan sama yang diperlukan untuk meramal video meyakinkan akhirnya boleh menyokong penjanaan imej, audio, penaakulan fizikal dan tindakan robot. Pembangun sudah boleh menguji langkah produksi pertama melalui FLUX 3 di CometAPI menggunakan ID model flux-3.
