TL;DR: FLUX 3 adalah model fondasi multimodal terpadu dari Black Forest Labs. Video API publiknya menghasilkan klip hingga 20 detik pada 24 fps, dengan audio tersinkron opsional, dari teks, gambar, keyframe, atau video yang ada. Mendukung resolusi dari HD hingga UHD/4K, sementara FLUX 3 Image dan model bobot-terbuka FLUX 3 Dev tetap sebagai item rollout terpisah.
Apa Itu FLUX 3?
FLUX 3 adalah model multimodal frontier dari Black Forest Labs. Alih-alih melatih satu model untuk gambar, satu lagi untuk video, dan satu lagi untuk audio secara terpisah, BFL melatih representasi bersama di seluruh modalitas tersebut.
Gagasan utamanya adalah bahwa gambar, video, dan suara adalah observasi berbeda dari dunia mendasar yang sama. Sebuah mobil yang bergerak memiliki penampilan visual, gerak, suara, hubungan spasial, sifat material, dan perilaku kausal. Mempelajari sinyal-sinyal ini bersama-sama memberi model lebih banyak batasan daripada mempelajari bingkai individual saja.
Inilah mengapa Black Forest Labs menggambarkan FLUX 3 sebagai langkah menuju model realitas atau model dunia alih-alih sekadar generator gambar atau video. Sistem video yang dirilis saja sudah menunjukkan arah itu: audio tersinkron, gerak, struktur adegan, dialog, perilaku kamera, dan suara lingkungan ditangani dalam satu alur generasi.
Tidak semua kapabilitas FLUX 3 yang diumumkan sudah tersedia untuk publik. Per September 2026, FLUX 3 Video tersedia, sementara FLUX 3 Image dan model FLUX 3 Dev bobot terbuka tetap menjadi item rollout terpisah.
Spesifikasi FLUX 3 Sekilas
Spesifikasi berikut mencerminkan dokumentasi pengembang FLUX 3 saat ini, bukan konfigurasi peluncuran awal Juli.
| Spesifikasi | Dokumentasi resmi FLUX 3 |
|---|---|
| Pengembang | Black Forest Labs |
| Keluarga model | FLUX 3 |
| Jenis model | Fondasi multimodal terpadu / model video generatif |
| Rilis video publik | 4 Agustus 2026 |
| Arah pelatihan inti | Pembelajaran representasi gabungan gambar, video, audio |
| Landasan riset | Self-Flow |
| Output API utama saat ini | Video dengan audio tersinkron |
| Teks-ke-video | Didukung |
| Gambar-ke-video | Didukung |
| Keyframe-ke-video | Didukung |
| Kelanjutan video | Didukung |
| Durasi maksimum T2V/I2V | 20 detik |
| Durasi kelanjutan video | 5–15 detik |
| Frame rate | 24 fps |
| Resolusi | HD, FHD, QHD/2K, dan UHD/4K |
| Resolusi FHD 16:9 | 1920 × 1088 |
| Referensi gambar | Hingga 10 untuk alur I2V/keyframe |
| Audio bawaan | Ya |
| Dialog multibahasa | Ya |
| Sinkronisasi bibir | Ya |
| Generasi multi-shot | Ya |
| Mode Draft | Ya |
| Endpoint gambar diam FLUX 3 publik | Belum dirilis umum oleh BFL |
| FLUX 3 Dev bobot terbuka | Direncanakan |
Dokumentasi BFL saat ini menetapkan 5–20 detik untuk teks-ke-video dan gambar-ke-video, sementara kelanjutan video menerima jendela generasi 5–15 detik. Rasio aspek yang didukung meliputi 21:9, 2:1, 16:9, 4:3, 1:1, 3:4, dan 9:16.
Bagaimana FLUX 3 Bekerja?
Self-Flow
Landasan riset kuncinya adalah Self-Flow, pendekatan flow-matching swa-supervisi dari Black Forest Labs. Pipeline pelatihan generatif tradisional sering bergantung pada model representasi pralatih terpisah atau supervisi tambahan. Self-Flow dirancang untuk mempelajari representasi yang berguna langsung dari objektif generatif.
Mekanisme utama adalah Dual-Timestep Scheduling. Kelompok token berbeda dapat diberi tingkat noise berbeda selama pelatihan. Ini menciptakan asimetri informasi: beberapa bagian masukan mengandung lebih banyak informasi yang dapat digunakan daripada yang lain, memaksa jaringan membangun representasi yang membantu menyimpulkan apa yang hilang.
Secara praktis, FLUX 3 didorong untuk mempelajari hubungan antara objek, bingkai, gerak, suara, dan peristiwa temporal alih-alih hanya menghafal bagaimana rupa tiap bingkai individual.

Arsitektur metode Self-Flow - sumber gambar resmi: Proyek Self-Flow Black Forest Labs
BFL juga menguji pelatihan multimodal gabungan menggunakan backbone turunan FLUX.2 dengan jutaan video dan ratusan juta gambar. Eksperimen ini mendukung hipotesis FLUX 3 yang lebih luas bahwa pembelajaran representasi dan generasi tidak perlu menjadi sistem terpisah.
Mengapa Video Sentral bagi FLUX 3
Video sangat berharga untuk pemodelan dunia karena mengandung informasi yang tidak dapat diberikan gambar diam. Sebuah bingkai dapat menunjukkan bola di atas lantai; sebuah video dapat mengungkap bahwa bola jatuh, memantul, berubah bentuk saat benturan, menghasilkan suara, dan berubah arah setelahnya.
BFL mengungkapkan bahwa prediksi video menyumbang lebih dari 95% komputasi pelatihan FLUX 3. Audio relatif murah karena merupakan sinyal berdimensi lebih rendah yang erat terkait dengan peristiwa yang terlihat. Alokasi itu membantu menjelaskan mengapa video adalah kapabilitas FLUX 3 pertama yang mencapai ketersediaan umum.
Apa yang Dapat Dilakukan FLUX 3?
Teks-ke-Video
Pengguna dapat menghasilkan video lengkap dari instruksi bahasa alami. BFL mengatakan model yang dirilis menangani prompt sederhana dan kompleks sambil mengoordinasikan gerak, logika adegan, komposisi visual, dan suara. Ini sangat berguna untuk prompt yang berisi beberapa peristiwa berurutan alih-alih satu subjek animasi tunggal.
Gambar-ke-Video dan Keyframe
FLUX 3 dapat menganimasikan gambar awal, bekerja menuju bingkai akhir, atau menggunakan beberapa gambar sebagai keyframe bertempo. API saat ini mendukung hingga sepuluh referensi gambar dalam alur gambar-ke-video, memungkinkan kreator mengontrol bagaimana adegan berubah dari waktu ke waktu alih-alih meminta model mengimprovisasi seluruh urutan.
Kelanjutan Video
Video yang ada beserta audionya dapat disuplai sebagai konteks dan FLUX 3 dapat menghasilkan apa yang terjadi selanjutnya. BFL menggambarkan kelanjutan yang mempertahankan gerakan, perilaku kamera, dialog, dan suara di seluruh transisi, yang secara material berbeda dari menghasilkan klip kedua secara independen lalu menyambungkan kedua file setelahnya.
Audio Bawaan dan Dialog
FLUX 3 menghasilkan audio pada waktu generasi alih-alih membutuhkan proses pembuatan suara atau ucapan terpisah. Kapabilitas audio yang dirilis mencakup dialog, efek suara, dan suara ambien. Dialog multibahasa dengan sinkronisasi bibir juga didukung.
Beberapa Shot dalam Satu Generasi
Satu prompt dapat berisi beberapa adegan atau sudut kamera. Ini penting karena banyak model video sebelumnya paling kuat saat diminta satu shot pendek yang secara visual berkesinambungan; FLUX 3 secara eksplisit dirancang untuk mendukung urutan multi-shot dalam satu generasi.
Mode Draft
Mode Draft adalah salah satu tambahan paling praktis untuk pembuatan video volume tinggi. Alih-alih membayar harga penuh untuk setiap eksperimen prompt, pengembang dapat membuat pratinjau yang lebih cepat dan berbiaya lebih rendah lalu meningkatkan draft terpilih sambil mempertahankan komposisi dan gerak yang dipilih. Menurut harga BFL saat ini, draft T2V/I2V standar berharga $0.06 per detik, dibanding $0.17 per detik untuk generasi HD reguler.
Apa yang Belum Dikirim?
Pengumuman peluncuran FLUX 3 menggambarkan kapabilitas gambar, video, audio, dan aksi di bawah satu arah arsitektural, tetapi ketersediaannya bertahap.
| Kapabilitas | Roadmap dan ketersediaan BFL saat ini |
|---|---|
| Generasi FLUX 3 Video | Tersedia secara umum |
| Audio video bawaan | Tersedia secara umum |
| Teks-ke-video | Tersedia secara umum |
| Gambar-ke-video / keyframe | Tersedia secara umum |
| Kelanjutan video | Tersedia secara umum |
| Kombinasi referensi gambar/video/audio lebih kaya | Ekspansi direncanakan |
| Generasi dan penyuntingan FLUX 3 Image | Akan datang |
| FLUX 3 Dev bobot terbuka | Direncanakan |
| Deployment prediksi aksi | Riset / jalur mitra komersial |
Pembedaan ini sangat penting bagi pengguna yang familiar dengan FLUX.2 Max. FLUX.2 tetap menjadi opsi khusus terkini untuk generasi gambar diam, sementara produk FLUX 3 publik berpusat pada video dan audio.
Performa Benchmark FLUX 3
Kini ada dua jenis bukti benchmark FLUX 3 yang berguna: evaluasi internal pasca-rilis BFL dan evaluasi independen pihak ketiga. Yang pertama menunjukkan preferensi manusia relatif di bawah protokol BFL; yang kedua memeriksa apakah kekuatan tersebut tetap terlihat di bawah benchmark yang dirancang terpisah.
Evaluasi ELO Pasca-Rilis BFL
Pengumuman awal Juli mencakup tingkat kemenangan awal. Benchmark yang lebih relevan untuk pengguna saat ini adalah evaluasi model yang dirilis pada 4 Agustus. Black Forest Labs melaporkan skor ELO teks-ke-video sebesar 1135 dalam evaluasi internal all-vs-all.

Evaluasi ELO model rilis FLUX 3 - sumber gambar resmi: Black Forest Labs
| Metrik | Evaluasi model rilis BFL |
|---|---|
| ELO teks-ke-video | 1135 |
| Posisi T2V | Skor tertinggi di grup yang diuji BFL |
| Hasil gambar-ke-video | Seri dengan pesaing terkuat yang diuji dan mengungguli model lain yang dievaluasi |
| Jenis evaluasi | Evaluasi preferensi manusia internal |
| Tahap model | Rilis FLUX 3 Video yang tersedia umum |
Ini adalah bukti yang lebih kuat daripada benchmark peluncuran awal karena mengevaluasi model Agustus yang dirilis. Namun ini tetap benchmark yang dijalankan vendor, dan tidak boleh ditafsirkan sebagai bukti bahwa FLUX 3 akan mengungguli setiap pesaing pada setiap kategori prompt.
Benchmark Independen FLUX 3
v-benchmark v2 dari Megaton memberikan pemeriksaan independen. FLUX 3 dievaluasi pada Agustus 2026 dan saat ini membukukan Megaton Index 76.51/100, peringkat #3 dalam set yang dipublikasikan pada saat evaluasi.
| Dimensi benchmark | Evaluasi Megaton FLUX 3 |
|---|---|
| Megaton Index | 76.51 |
| Kepatuhan Prompt | 87.07 |
| Konsistensi Adegan | 94.76 |
| Fisika | 70.63 |
| Fidelitas Manusia | 73.70 |
| Fidelitas Objek & Produk | 83.82 |
| Koherensi Kausal & Semantik | 80.91 |
| Fidelitas Teks | 82.41 |
| Sinematografi | 71.43 |
| Selera & Arah Artistik | 65.00 |
Profilnya lebih informatif daripada skor keseluruhan. Konsistensi Adegan 94.76 adalah kategori utama terkuat model, sementara Kepatuhan Prompt, fidelitas objek, koherensi kausal, dan fidelitas teks juga melampaui 80. Fisika, Fidelitas Manusia, dan Selera & Arah Artistik lebih lemah, menunjukkan bahwa representasi temporal yang lebih kuat tidak menghilangkan gerak sintetis atau variasi kualitas artistik.
Ini juga menjelaskan mengapa kesimpulan benchmark bisa berbeda: uji preferensi internal BFL menempatkan FLUX 3 di puncak set perbandingannya, sementara leaderboard independen Megaton menempatkannya ketiga. Prompt, dimensi penilaian, populasi evaluator, dan metode agregasi yang berbeda dapat menghasilkan peringkat yang berbeda.
FLUX 3 vs Seedance 2.5 vs MiniMax H3 vs Wan 3.0
Pasar video AI bergerak cepat pada 2026. FLUX 3 kini bersaing dengan sistem multimodal yang semakin menggabungkan generasi durasi panjang, audio tersinkron, referensi, dan penyuntingan.
| Dimensi | FLUX 3 | Seedance 2.5 | MiniMax H3 | Wan 3.0 |
|---|---|---|---|---|
| Pengembang | Black Forest Labs | ByteDance Seed | MiniMax | Alibaba |
| Klip maksimum yang diiklankan | 20 d | 30 d | 15 d | 30 d |
| Resolusi video | HD / FHD / QHD (2K) / UHD (4K) | Bergantung tingkat API | Hingga 2K | Hingga 1080p |
| Audio bawaan | Ya | Ya | Ya, stereo | Ya |
| Teks-ke-video | Ya | Ya | Ya | Ya |
| Masukan gambar/referensi | Ya | Ya | Ya | Ya |
| Kontrol keyframe/referensi | Keyframe bertempo yang kuat | Kontrol referensi multimodal yang kuat | Pengkondisian multimodal | Kontrol referensi multimodal |
| Kelanjutan/penyuntingan video | Kelanjutan tersedia | Alur kerja berorientasi penyuntingan | Fokus generasi omni | Alur penyuntingan dan referensi |
| Kekuatan khas | Arsitektur model realitas, konsistensi adegan, Self-Flow | Penceritaan durasi panjang dan kontrol referensi | Generasi audiovisual 2K dan konteks omni | Klip panjang dan biaya awal lebih rendah |
| Harga awal/satuan CometAPI* | $0.136/d | $0.0824/d tercantum | $0.064/d | $0.040/d |
* Harga hanyalah perbandingan kasar. API video menggunakan resolusi, durasi, tier kualitas, dan aturan penagihan yang berbeda, sehingga angka per detik termurah tidak selalu keluaran setara termurah.
FLUX 3 vs Seedance 2.5
Seedance 2.5 memiliki keunggulan durasi yang jelas, dengan generasi hingga 30 detik dibanding 20 detik FLUX 3. Ia juga sangat berorientasi pada generasi berbasis referensi, penyuntingan, dan penceritaan durasi panjang. FLUX 3 berbeda melalui arsitektur model dunia bersama, konsistensi adegan, generasi audiovisual bawaan, keyframe bertempo, dan roadmap gambar/aksi yang lebih luas.
Pengujian independen menegaskan bahwa ini kompetisi kelas atas yang nyata: Megaton saat ini menempatkan Seedance 2.5 di atas FLUX 3 secara keseluruhan.
FLUX 3 vs MiniMax H3
MiniMax H3 menawarkan output hingga 2K dan audio stereo bawaan, memberikan spesifikasi teknis yang kuat untuk konten audiovisual. FLUX 3 mendukung jendela generasi maksimum yang lebih panjang—20 detik dibanding 15 detik pada H3—dan Mode Draft yang menyediakan alur iterasi berbiaya terkontrol.
FLUX 3 vs Wan 3.0
Wan 3.0 menekankan masukan multimodal luas, generasi audiovisual, penyuntingan, dan klip hingga 30 detik. Ia juga lebih murah pada harga awal yang tercantum CometAPI. FLUX 3 lebih mahal tetapi berbeda melalui positioning model realitas, konsistensi adegan, landasan riset Self-Flow, Mode Draft, dan integrasi dengan prediksi aksi.
Harga FLUX 3
Black Forest Labs menagih FLUX 3 berdasarkan durasi video yang dihasilkan.
| Mode | Harga resmi FLUX 3 BFL |
|---|---|
| T2V / I2V Draft HD | $0.06/d |
| T2V / I2V HD | $0.17/d |
| T2V / I2V FHD | $0.29/d |
| T2V / I2V QHD (2K) | $0.40/d |
| T2V / I2V UHD (4K) | $0.80/d |
| Kelanjutan video Draft | $0.12/d |
| Kelanjutan video HD | $0.41/d |
| Kelanjutan video FHD | $0.53/d |
| Kelanjutan video QHD (2K) | $0.65/d |
| Kelanjutan video UHD (4K) | $0.95/d |
Generasi HD standar 10 detik karenanya berharga sekitar $1.70 pada tarif BFL yang tercantum, sementara generasi FHD 10 detik berharga sekitar $2.90. Kelanjutan video secara substansial lebih mahal daripada generasi biasa, sehingga aplikasi yang sering memperpanjang klip harus memodelkan biaya tersebut secara terpisah.
Harga FLUX 3 di CometAPI
CometAPI saat ini mencantumkan FLUX 3 tersedia dengan ID model flux-3.
| Resolusi | Harga FLUX 3 CometAPI |
|---|---|
| 720p | $0.136/d |
| 1080p | $0.232/d |
Untuk generasi 10 detik, itu setara sekitar $1.36 pada 720p atau $2.32 pada 1080p. Dibandingkan dengan tarif BFL $0.17/d dan $0.29/d, harga default CometAPI sekitar 20% lebih rendah untuk dua tier ini.
Catatan ketersediaan: beberapa salinan deskriptif lama di CometAPI masih mencerminkan periode Early Access Juli. Kartu model live, bagian harga, dan contoh API saat ini mencantumkan flux-3 sebagai Available, dengan tanggal rilis CometAPI 13 Agustus 2026. Untuk keputusan integrasi, bidang API dan harga live lebih relevan daripada salinan ketersediaan lama.
Mengapa FLUX 3 Penting Melampaui Video AI
Bagian paling tidak biasa dari FLUX 3 bukanlah generasi video 20 detik. Beberapa pesaing sudah dapat menghasilkan klip sama panjang atau lebih panjang. Taruhan teknis yang lebih besar adalah bahwa representasi video yang kuat dapat menjadi fondasi untuk bentuk kecerdasan lainnya.
Dari Prediksi Video ke Prediksi Aksi
Sinyal kontrol robot adalah prediksi temporal yang dikondisikan pada observasi visual, sehingga BFL menggunakan representasi video FLUX 3 sebagai fondasi untuk prediksi aksi. Kolaborasinya dengan mimic robotics menghasilkan FLUX-mimic, di mana dekoder aksi membaca representasi dari model video alih-alih melatih tumpukan persepsi independen sepenuhnya.
BFL melaporkan bahwa backbone FLUX-mimic dapat berjalan dalam di bawah 80 ms pada satu RTX 5090, sementara sistem robot lengkap mencapai loop reaksi sekitar 101 ms. Perusahaan juga membahas evaluasi industri dengan Audi.
Ini tidak membuat FLUX 3 Video API publik menjadi API robotika. Ini menunjukkan mengapa BFL berinvestasi besar dalam representasi video multimodal alih-alih memperlakukan generasi video sebagai tugas media terisolasi.
Kekuatan Utama FLUX 3
- Konsistensi temporal dan adegan. Skor Konsistensi Adegan 94.76 dari Megaton adalah kategori benchmark utama terkuat model.
- Generasi audiovisual bawaan. Dialog, efek, ambience, dan visual dapat dihasilkan bersama alih-alih disatukan dari model terpisah.
- Kepatuhan prompt yang kuat. Hasil Kepatuhan Prompt independen 87.07 menunjukkan kekuatan model melampaui polesan visual semata.
- Kontrol keyframe. Hingga sepuluh gambar dapat berpartisipasi dalam alur gambar-ke-video saat ini, memberi kreator kontrol temporal eksplisit.
- Alur dari draft ke final. Mode Draft mengatasi masalah biaya nyata dalam video AI: banyak generasi dibuang selama iterasi prompt.
- Rentang visual luas. BFL memosisikan FLUX 3 sebagai mampu menghasilkan output mentah, natural, sinematik, nostalgik, playful, bergaya, dan tidak biasa alih-alih satu gaya tunggal.
- Arah riset model dunia. Self-Flow dan prediksi aksi membuat FLUX 3 relevan melampaui generasi media.
Keterbatasan FLUX 3
- Roadmap multimodal penuh belum dikirim. FLUX 3 Image publik dan bobot terbuka FLUX 3 Dev tidak boleh diasumsikan dari pengumuman level keluarga.
- 20 detik bukan lagi durasi terdepan industri. Beberapa pesaing 2026 sudah mendukung generasi 30 detik.
- Fisika belum terselesaikan. Megaton memberi FLUX 3 skor Fisika 70.63, jauh di bawah skor konsistensi adegannya.
- Fidelitas manusia masih perlu ditingkatkan. Skor independen 73.70 berarti anatomi sulit dan gerak manusia realistis masih bisa gagal.
- Kelanjutan video mahal. Harga kelanjutan BFL jauh lebih tinggi per detik dibanding T2V/I2V biasa.
- Benchmark kompetitif utama BFL bersifat internal. Keputusan produksi juga harus mencakup tes independen menggunakan prompt, jenis shot, bahasa, dan aset referensi milik aplikasi.
Cara Menggunakan FLUX 3 dengan CometAPI
Cakupan FLUX 3 sebelumnya milik CometAPI menjelaskan fase Early Access Juli, benchmark awal, dan rencana rollout. Bagian ini fokus pada integrasi produksi saat ini, harga, dan alur API kerja sehingga tidak mengulang walkthrough historis tersebut. Model produksi FLUX 3 menggunakan ID model flux-3.
Permintaan 720p dasar menggunakan endpoint /v1/videos:
Bash
curl --request POST "https://api.cometapi.com/v1/videos" \--header "Authorization: Bearer $COMETAPI_KEY" \ --form-string "model=flux-3" \ --form-string "prompt=Sebuah perahu kertas meluncur melintasi kolam tenang dalam cahaya pagi yang lembut" \ --form-string "seconds=5" \ --form-string "size=1280x720" |
|---|
Alur kerja video bersifat asinkron. Setelah permintaan awal mengembalikan ID tugas, aplikasi memeriksa tugas hingga generasi selesai dan kemudian mengambil video yang dihasilkan. Untuk aplikasi produksi, generasi biasanya harus ditangani oleh job latar belakang atau antrean tugas alih-alih menahan permintaan HTTP tetap terbuka selama waktu render penuh.
Siapa yang Harus Menggunakan FLUX 3?
FLUX 3 sangat menarik untuk aplikasi yang membutuhkan lebih dari klip lima detik yang menarik secara visual: sistem periklanan dengan visual dan audio tersinkron, produksi short-form otomatis, demonstrasi produk di mana persistensi objek penting, generasi dialog multibahasa, alur storyboard-ke-video, animasi terkontrol keyframe, konten edukasi, dan eksperimen dengan pipeline multimodal yang lebih panjang.
Mungkin kurang menarik ketika satu-satunya kebutuhan adalah biaya per detik serendah mungkin, ketika lebih dari 20 detik harus dihasilkan dalam satu kali, atau ketika generasi gambar diam adalah tugas utama. Untuk gambar diam, model gambar FLUX yang ada seperti FLUX.2 Max saat ini mungkin lebih cocok.
Apakah FLUX 3 Lebih Baik daripada Model Video AI Lain?
Tidak ada jawaban tunggal yang dapat dipertahankan untuk setiap use case. Evaluasi internal BFL menempatkan FLUX 3 rilis di puncak perbandingan teks-ke-video mereka, sementara evaluasi independen Megaton menempatkan FLUX 3 ketiga secara keseluruhan di belakang pesaing yang lebih baru. Kedua hasil bisa valid karena tes mengukur distribusi prompt dan dimensi kualitas yang berbeda.
FLUX 3 tampak sangat kuat ketika konsistensi adegan, kepatuhan prompt, fidelitas objek, koherensi kausal, perenderan teks, suara tersinkron, dan keyframe yang dapat dikontrol penting. Model lain mungkin menang pada durasi maksimum, resolusi, preferensi artistik, fidelitas manusia, alur kerja penyuntingan, atau biaya. Bagi pengembang, perbandingan yang benar adalah spesifik beban kerja, bukan spesifik leaderboard.
Pertanyaan yang Sering Diajukan
Apakah FLUX 3 tersedia sekarang?
Ya. FLUX 3 Video menjadi tersedia umum melalui BFL pada 4 Agustus 2026. CometAPI juga mencantumkan FLUX 3 sebagai Available dengan ID model flux-3. Rilis FLUX 3 Image dan bobot terbuka FLUX 3 Dev tetap item roadmap terpisah.
Apakah FLUX 3 dapat menghasilkan audio?
Ya. FLUX 3 Video menghasilkan audio bawaan tersinkron termasuk dialog, suara ambien, dan efek. Dialog multibahasa dan sinkronisasi bibir juga didukung.
Berapa lama video FLUX 3 dapat dibuat?
Generasi teks-ke-video dan gambar-ke-video saat ini mendukung 5–20 detik. Kelanjutan video mendukung 5–15 detik konten yang baru dihasilkan.
Resolusi apa yang didukung FLUX 3?
BFL mendukung HD (hingga 1 megapiksel per bingkai), FHD (hingga 2 MP), QHD/2K (hingga 4 MP), dan UHD/4K (hingga 8 MP). Output FHD 16:9 adalah 1920 × 1088. Pita resolusi didasarkan pada total piksel per bingkai alih-alih rasio aspek; Mode Draft hanya HD.
Apakah FLUX 3 mendukung gambar-ke-video?
Ya. Generasi gambar-ke-video dan keyframe adalah bagian dari set fitur FLUX 3 Video yang tersedia umum.
Apakah FLUX 3 adalah model generasi gambar?
Secara arsitektural, FLUX 3 dilatih di seluruh gambar, video, dan audio, dan BFL telah menunjukkan riset generasi dan penyuntingan gambar. Namun, produk FLUX 3 Image tetap rilis mendatang; jangan bingungkan roadmap keluarga dengan FLUX 3 Video API publik saat ini.
Apakah FLUX 3 open source?
Saat ini tidak. BFL telah mengumumkan FLUX 3 Dev, varian multimodal bobot terbuka, tetapi belum menyediakan tanggal rilis publik.
Berapa biaya FLUX 3?
BFL memberi harga teks/gambar-ke-video sebesar $0.06/d untuk Draft HD, $0.17/d untuk HD, $0.29/d untuk FHD, $0.40/d untuk QHD, dan $0.80/d untuk UHD. Video-ke-video berharga $0.12/d untuk Draft HD, kemudian $0.41/d untuk HD, $0.53/d untuk FHD, $0.65/d untuk QHD, dan $0.95/d untuk UHD. CometAPI saat ini mencantumkan $0.136/d untuk 720p dan $0.232/d untuk 1080p.
Apa itu Self-Flow?
Self-Flow adalah pendekatan flow-matching swa-supervisi dari BFL. Ia dirancang agar model generatif mengembangkan representasi internal yang berguna tanpa bergantung pada model representasi eksternal. Penggunaan tingkat noise berbeda di seluruh token mendorong jaringan menyimpulkan informasi yang hilang dan mempelajari hubungan antarobservasi multimodal.
Apakah FLUX 3 merupakan model dunia?
Black Forest Labs memosisikan FLUX 3 sebagai fondasi model realitas karena representasi bersama yang meluas dari prediksi audiovisual menuju prediksi aksi fisik. Menyebutnya model dunia serbaguna lengkap akan lebih kuat daripada bukti yang ada saat ini; deskripsi yang lebih tepat adalah model fondasi generatif multimodal yang secara eksplisit dirancang di sekitar objektif pemodelan dunia.
Kesimpulan
FLUX 3 mewakili perubahan yang lebih besar bagi Black Forest Labs daripada peningkatan konvensional dari satu model gambar FLUX ke yang lain. Gagasan kuncinya adalah melatih representasi multimodal bersama tentang dunia, lalu menggunakan representasi itu untuk video, suara, gambar, dan pada akhirnya aksi. Self-Flow menyediakan landasan riset, sementara model FLUX 3 Video yang dirilis adalah demonstrasi produksi pertama dari strategi tersebut.
Per September 2026, FLUX 3 Video mendukung klip hingga 20 detik, 24 fps, output dari HD hingga UHD/4K, audio tersinkron, dialog multibahasa, gambar-ke-video, keyframe, kelanjutan video, generasi multi-shot, dan Mode Draft.
Gambar benchmark juga lebih kredibel daripada saat peluncuran. Evaluasi model rilis BFL saat ini menempatkan FLUX 3 pertama dalam uji ELO T2V internalnya, sementara pengujian independen Megaton menempatkannya ketiga secara keseluruhan dan menyoroti konsistensi adegan yang sangat kuat.
FLUX 3 karenanya tidak secara otomatis menjadi model video terbaik untuk setiap beban kerja. Seedance 2.5, MiniMax H3, dan Wan 3.0 dapat menawarkan generasi lebih panjang, resolusi nominal lebih tinggi, harga lebih rendah, atau kapabilitas referensi dan penyuntingan yang berbeda.
Yang membuat FLUX 3 menarik adalah arah di balik generator video: BFL bertaruh bahwa representasi yang sama yang dibutuhkan untuk memprediksi video meyakinkan pada akhirnya dapat mendukung generasi gambar, audio, penalaran fisik, dan aksi robot. Pengembang sudah dapat menguji langkah produksi pertama melalui FLUX 3 di CometAPI menggunakan ID model flux-3.
