GPT-6.1 Sol are now live on CometAPI →
ai-model/Riset CometAPI

Apa itu FLUX 3? Spesifikasi, Benchmark, Fitur, Harga dan Akses API

Jelajahi model AI multimodal dari Black Forest Labs, termasuk spesifikasi FLUX 3, tolok ukur, fitur, harga, arsitektur Self-Flow, pesaing, dan akses API.

CometAPI
Deon GoodwinTim riset model AI dan API
Diperbarui Oct 3, 2026 18 menit baca
Apa itu FLUX 3? Spesifikasi, Benchmark, Fitur, Harga dan Akses API
Gunakan pola ini

Lakukan API call pertama.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR: FLUX 3 adalah model fondasi multimodal terpadu dari Black Forest Labs. Video API publiknya menghasilkan klip hingga 20 detik pada 24 fps, dengan audio tersinkron opsional, dari teks, gambar, keyframe, atau video yang ada. Mendukung resolusi dari HD hingga UHD/4K, sementara FLUX 3 Image dan model bobot-terbuka FLUX 3 Dev tetap sebagai item rollout terpisah.

Apa Itu FLUX 3?

FLUX 3 adalah model multimodal frontier dari Black Forest Labs. Alih-alih melatih satu model untuk gambar, satu lagi untuk video, dan satu lagi untuk audio secara terpisah, BFL melatih representasi bersama di seluruh modalitas tersebut.

Gagasan utamanya adalah bahwa gambar, video, dan suara adalah observasi berbeda dari dunia mendasar yang sama. Sebuah mobil yang bergerak memiliki penampilan visual, gerak, suara, hubungan spasial, sifat material, dan perilaku kausal. Mempelajari sinyal-sinyal ini bersama-sama memberi model lebih banyak batasan daripada mempelajari bingkai individual saja.

Inilah mengapa Black Forest Labs menggambarkan FLUX 3 sebagai langkah menuju model realitas atau model dunia alih-alih sekadar generator gambar atau video. Sistem video yang dirilis saja sudah menunjukkan arah itu: audio tersinkron, gerak, struktur adegan, dialog, perilaku kamera, dan suara lingkungan ditangani dalam satu alur generasi.

Tidak semua kapabilitas FLUX 3 yang diumumkan sudah tersedia untuk publik. Per September 2026, FLUX 3 Video tersedia, sementara FLUX 3 Image dan model FLUX 3 Dev bobot terbuka tetap menjadi item rollout terpisah.

Spesifikasi FLUX 3 Sekilas

Spesifikasi berikut mencerminkan dokumentasi pengembang FLUX 3 saat ini, bukan konfigurasi peluncuran awal Juli.

SpesifikasiDokumentasi resmi FLUX 3
PengembangBlack Forest Labs
Keluarga modelFLUX 3
Jenis modelFondasi multimodal terpadu / model video generatif
Rilis video publik4 Agustus 2026
Arah pelatihan intiPembelajaran representasi gabungan gambar, video, audio
Landasan risetSelf-Flow
Output API utama saat iniVideo dengan audio tersinkron
Teks-ke-videoDidukung
Gambar-ke-videoDidukung
Keyframe-ke-videoDidukung
Kelanjutan videoDidukung
Durasi maksimum T2V/I2V20 detik
Durasi kelanjutan video5–15 detik
Frame rate24 fps
ResolusiHD, FHD, QHD/2K, dan UHD/4K
Resolusi FHD 16:91920 × 1088
Referensi gambarHingga 10 untuk alur I2V/keyframe
Audio bawaanYa
Dialog multibahasaYa
Sinkronisasi bibirYa
Generasi multi-shotYa
Mode DraftYa
Endpoint gambar diam FLUX 3 publikBelum dirilis umum oleh BFL
FLUX 3 Dev bobot terbukaDirencanakan

Dokumentasi BFL saat ini menetapkan 5–20 detik untuk teks-ke-video dan gambar-ke-video, sementara kelanjutan video menerima jendela generasi 5–15 detik. Rasio aspek yang didukung meliputi 21:9, 2:1, 16:9, 4:3, 1:1, 3:4, dan 9:16.

Bagaimana FLUX 3 Bekerja?

Self-Flow

Landasan riset kuncinya adalah Self-Flow, pendekatan flow-matching swa-supervisi dari Black Forest Labs. Pipeline pelatihan generatif tradisional sering bergantung pada model representasi pralatih terpisah atau supervisi tambahan. Self-Flow dirancang untuk mempelajari representasi yang berguna langsung dari objektif generatif.

Mekanisme utama adalah Dual-Timestep Scheduling. Kelompok token berbeda dapat diberi tingkat noise berbeda selama pelatihan. Ini menciptakan asimetri informasi: beberapa bagian masukan mengandung lebih banyak informasi yang dapat digunakan daripada yang lain, memaksa jaringan membangun representasi yang membantu menyimpulkan apa yang hilang.

Secara praktis, FLUX 3 didorong untuk mempelajari hubungan antara objek, bingkai, gerak, suara, dan peristiwa temporal alih-alih hanya menghafal bagaimana rupa tiap bingkai individual.

Apa itu FLUX 3? Spesifikasi, Benchmark, Fitur, Harga dan Akses API

Arsitektur metode Self-Flow - sumber gambar resmi: Proyek Self-Flow Black Forest Labs

BFL juga menguji pelatihan multimodal gabungan menggunakan backbone turunan FLUX.2 dengan jutaan video dan ratusan juta gambar. Eksperimen ini mendukung hipotesis FLUX 3 yang lebih luas bahwa pembelajaran representasi dan generasi tidak perlu menjadi sistem terpisah.

Mengapa Video Sentral bagi FLUX 3

Video sangat berharga untuk pemodelan dunia karena mengandung informasi yang tidak dapat diberikan gambar diam. Sebuah bingkai dapat menunjukkan bola di atas lantai; sebuah video dapat mengungkap bahwa bola jatuh, memantul, berubah bentuk saat benturan, menghasilkan suara, dan berubah arah setelahnya.

BFL mengungkapkan bahwa prediksi video menyumbang lebih dari 95% komputasi pelatihan FLUX 3. Audio relatif murah karena merupakan sinyal berdimensi lebih rendah yang erat terkait dengan peristiwa yang terlihat. Alokasi itu membantu menjelaskan mengapa video adalah kapabilitas FLUX 3 pertama yang mencapai ketersediaan umum.

Apa yang Dapat Dilakukan FLUX 3?

Teks-ke-Video

Pengguna dapat menghasilkan video lengkap dari instruksi bahasa alami. BFL mengatakan model yang dirilis menangani prompt sederhana dan kompleks sambil mengoordinasikan gerak, logika adegan, komposisi visual, dan suara. Ini sangat berguna untuk prompt yang berisi beberapa peristiwa berurutan alih-alih satu subjek animasi tunggal.

Gambar-ke-Video dan Keyframe

FLUX 3 dapat menganimasikan gambar awal, bekerja menuju bingkai akhir, atau menggunakan beberapa gambar sebagai keyframe bertempo. API saat ini mendukung hingga sepuluh referensi gambar dalam alur gambar-ke-video, memungkinkan kreator mengontrol bagaimana adegan berubah dari waktu ke waktu alih-alih meminta model mengimprovisasi seluruh urutan.

Kelanjutan Video

Video yang ada beserta audionya dapat disuplai sebagai konteks dan FLUX 3 dapat menghasilkan apa yang terjadi selanjutnya. BFL menggambarkan kelanjutan yang mempertahankan gerakan, perilaku kamera, dialog, dan suara di seluruh transisi, yang secara material berbeda dari menghasilkan klip kedua secara independen lalu menyambungkan kedua file setelahnya.

Audio Bawaan dan Dialog

FLUX 3 menghasilkan audio pada waktu generasi alih-alih membutuhkan proses pembuatan suara atau ucapan terpisah. Kapabilitas audio yang dirilis mencakup dialog, efek suara, dan suara ambien. Dialog multibahasa dengan sinkronisasi bibir juga didukung.

Beberapa Shot dalam Satu Generasi

Satu prompt dapat berisi beberapa adegan atau sudut kamera. Ini penting karena banyak model video sebelumnya paling kuat saat diminta satu shot pendek yang secara visual berkesinambungan; FLUX 3 secara eksplisit dirancang untuk mendukung urutan multi-shot dalam satu generasi.

Mode Draft

Mode Draft adalah salah satu tambahan paling praktis untuk pembuatan video volume tinggi. Alih-alih membayar harga penuh untuk setiap eksperimen prompt, pengembang dapat membuat pratinjau yang lebih cepat dan berbiaya lebih rendah lalu meningkatkan draft terpilih sambil mempertahankan komposisi dan gerak yang dipilih. Menurut harga BFL saat ini, draft T2V/I2V standar berharga $0.06 per detik, dibanding $0.17 per detik untuk generasi HD reguler.

Apa yang Belum Dikirim?

Pengumuman peluncuran FLUX 3 menggambarkan kapabilitas gambar, video, audio, dan aksi di bawah satu arah arsitektural, tetapi ketersediaannya bertahap.

KapabilitasRoadmap dan ketersediaan BFL saat ini
Generasi FLUX 3 VideoTersedia secara umum
Audio video bawaanTersedia secara umum
Teks-ke-videoTersedia secara umum
Gambar-ke-video / keyframeTersedia secara umum
Kelanjutan videoTersedia secara umum
Kombinasi referensi gambar/video/audio lebih kayaEkspansi direncanakan
Generasi dan penyuntingan FLUX 3 ImageAkan datang
FLUX 3 Dev bobot terbukaDirencanakan
Deployment prediksi aksiRiset / jalur mitra komersial

Pembedaan ini sangat penting bagi pengguna yang familiar dengan FLUX.2 Max. FLUX.2 tetap menjadi opsi khusus terkini untuk generasi gambar diam, sementara produk FLUX 3 publik berpusat pada video dan audio.

Performa Benchmark FLUX 3

Kini ada dua jenis bukti benchmark FLUX 3 yang berguna: evaluasi internal pasca-rilis BFL dan evaluasi independen pihak ketiga. Yang pertama menunjukkan preferensi manusia relatif di bawah protokol BFL; yang kedua memeriksa apakah kekuatan tersebut tetap terlihat di bawah benchmark yang dirancang terpisah.

Evaluasi ELO Pasca-Rilis BFL

Pengumuman awal Juli mencakup tingkat kemenangan awal. Benchmark yang lebih relevan untuk pengguna saat ini adalah evaluasi model yang dirilis pada 4 Agustus. Black Forest Labs melaporkan skor ELO teks-ke-video sebesar 1135 dalam evaluasi internal all-vs-all.

Apa itu FLUX 3? Spesifikasi, Benchmark, Fitur, Harga dan Akses API

Evaluasi ELO model rilis FLUX 3 - sumber gambar resmi: Black Forest Labs

MetrikEvaluasi model rilis BFL
ELO teks-ke-video1135
Posisi T2VSkor tertinggi di grup yang diuji BFL
Hasil gambar-ke-videoSeri dengan pesaing terkuat yang diuji dan mengungguli model lain yang dievaluasi
Jenis evaluasiEvaluasi preferensi manusia internal
Tahap modelRilis FLUX 3 Video yang tersedia umum

Ini adalah bukti yang lebih kuat daripada benchmark peluncuran awal karena mengevaluasi model Agustus yang dirilis. Namun ini tetap benchmark yang dijalankan vendor, dan tidak boleh ditafsirkan sebagai bukti bahwa FLUX 3 akan mengungguli setiap pesaing pada setiap kategori prompt.

Benchmark Independen FLUX 3

v-benchmark v2 dari Megaton memberikan pemeriksaan independen. FLUX 3 dievaluasi pada Agustus 2026 dan saat ini membukukan Megaton Index 76.51/100, peringkat #3 dalam set yang dipublikasikan pada saat evaluasi.

Dimensi benchmarkEvaluasi Megaton FLUX 3
Megaton Index76.51
Kepatuhan Prompt87.07
Konsistensi Adegan94.76
Fisika70.63
Fidelitas Manusia73.70
Fidelitas Objek & Produk83.82
Koherensi Kausal & Semantik80.91
Fidelitas Teks82.41
Sinematografi71.43
Selera & Arah Artistik65.00

Profilnya lebih informatif daripada skor keseluruhan. Konsistensi Adegan 94.76 adalah kategori utama terkuat model, sementara Kepatuhan Prompt, fidelitas objek, koherensi kausal, dan fidelitas teks juga melampaui 80. Fisika, Fidelitas Manusia, dan Selera & Arah Artistik lebih lemah, menunjukkan bahwa representasi temporal yang lebih kuat tidak menghilangkan gerak sintetis atau variasi kualitas artistik.

Ini juga menjelaskan mengapa kesimpulan benchmark bisa berbeda: uji preferensi internal BFL menempatkan FLUX 3 di puncak set perbandingannya, sementara leaderboard independen Megaton menempatkannya ketiga. Prompt, dimensi penilaian, populasi evaluator, dan metode agregasi yang berbeda dapat menghasilkan peringkat yang berbeda.

FLUX 3 vs Seedance 2.5 vs MiniMax H3 vs Wan 3.0

Pasar video AI bergerak cepat pada 2026. FLUX 3 kini bersaing dengan sistem multimodal yang semakin menggabungkan generasi durasi panjang, audio tersinkron, referensi, dan penyuntingan.

DimensiFLUX 3Seedance 2.5MiniMax H3Wan 3.0
PengembangBlack Forest LabsByteDance SeedMiniMaxAlibaba
Klip maksimum yang diiklankan20 d30 d15 d30 d
Resolusi videoHD / FHD / QHD (2K) / UHD (4K)Bergantung tingkat APIHingga 2KHingga 1080p
Audio bawaanYaYaYa, stereoYa
Teks-ke-videoYaYaYaYa
Masukan gambar/referensiYaYaYaYa
Kontrol keyframe/referensiKeyframe bertempo yang kuatKontrol referensi multimodal yang kuatPengkondisian multimodalKontrol referensi multimodal
Kelanjutan/penyuntingan videoKelanjutan tersediaAlur kerja berorientasi penyuntinganFokus generasi omniAlur penyuntingan dan referensi
Kekuatan khasArsitektur model realitas, konsistensi adegan, Self-FlowPenceritaan durasi panjang dan kontrol referensiGenerasi audiovisual 2K dan konteks omniKlip panjang dan biaya awal lebih rendah
Harga awal/satuan CometAPI*$0.136/d$0.0824/d tercantum$0.064/d$0.040/d

* Harga hanyalah perbandingan kasar. API video menggunakan resolusi, durasi, tier kualitas, dan aturan penagihan yang berbeda, sehingga angka per detik termurah tidak selalu keluaran setara termurah.

FLUX 3 vs Seedance 2.5

Seedance 2.5 memiliki keunggulan durasi yang jelas, dengan generasi hingga 30 detik dibanding 20 detik FLUX 3. Ia juga sangat berorientasi pada generasi berbasis referensi, penyuntingan, dan penceritaan durasi panjang. FLUX 3 berbeda melalui arsitektur model dunia bersama, konsistensi adegan, generasi audiovisual bawaan, keyframe bertempo, dan roadmap gambar/aksi yang lebih luas.

Pengujian independen menegaskan bahwa ini kompetisi kelas atas yang nyata: Megaton saat ini menempatkan Seedance 2.5 di atas FLUX 3 secara keseluruhan.

FLUX 3 vs MiniMax H3

MiniMax H3 menawarkan output hingga 2K dan audio stereo bawaan, memberikan spesifikasi teknis yang kuat untuk konten audiovisual. FLUX 3 mendukung jendela generasi maksimum yang lebih panjang—20 detik dibanding 15 detik pada H3—dan Mode Draft yang menyediakan alur iterasi berbiaya terkontrol.

FLUX 3 vs Wan 3.0

Wan 3.0 menekankan masukan multimodal luas, generasi audiovisual, penyuntingan, dan klip hingga 30 detik. Ia juga lebih murah pada harga awal yang tercantum CometAPI. FLUX 3 lebih mahal tetapi berbeda melalui positioning model realitas, konsistensi adegan, landasan riset Self-Flow, Mode Draft, dan integrasi dengan prediksi aksi.

Harga FLUX 3

Black Forest Labs menagih FLUX 3 berdasarkan durasi video yang dihasilkan.

ModeHarga resmi FLUX 3 BFL
T2V / I2V Draft HD$0.06/d
T2V / I2V HD$0.17/d
T2V / I2V FHD$0.29/d
T2V / I2V QHD (2K)$0.40/d
T2V / I2V UHD (4K)$0.80/d
Kelanjutan video Draft$0.12/d
Kelanjutan video HD$0.41/d
Kelanjutan video FHD$0.53/d
Kelanjutan video QHD (2K)$0.65/d
Kelanjutan video UHD (4K)$0.95/d

Generasi HD standar 10 detik karenanya berharga sekitar $1.70 pada tarif BFL yang tercantum, sementara generasi FHD 10 detik berharga sekitar $2.90. Kelanjutan video secara substansial lebih mahal daripada generasi biasa, sehingga aplikasi yang sering memperpanjang klip harus memodelkan biaya tersebut secara terpisah.

Harga FLUX 3 di CometAPI

CometAPI saat ini mencantumkan FLUX 3 tersedia dengan ID model flux-3.

ResolusiHarga FLUX 3 CometAPI
720p$0.136/d
1080p$0.232/d

Untuk generasi 10 detik, itu setara sekitar $1.36 pada 720p atau $2.32 pada 1080p. Dibandingkan dengan tarif BFL $0.17/d dan $0.29/d, harga default CometAPI sekitar 20% lebih rendah untuk dua tier ini.

Catatan ketersediaan: beberapa salinan deskriptif lama di CometAPI masih mencerminkan periode Early Access Juli. Kartu model live, bagian harga, dan contoh API saat ini mencantumkan flux-3 sebagai Available, dengan tanggal rilis CometAPI 13 Agustus 2026. Untuk keputusan integrasi, bidang API dan harga live lebih relevan daripada salinan ketersediaan lama.

Mengapa FLUX 3 Penting Melampaui Video AI

Bagian paling tidak biasa dari FLUX 3 bukanlah generasi video 20 detik. Beberapa pesaing sudah dapat menghasilkan klip sama panjang atau lebih panjang. Taruhan teknis yang lebih besar adalah bahwa representasi video yang kuat dapat menjadi fondasi untuk bentuk kecerdasan lainnya.

Dari Prediksi Video ke Prediksi Aksi

Sinyal kontrol robot adalah prediksi temporal yang dikondisikan pada observasi visual, sehingga BFL menggunakan representasi video FLUX 3 sebagai fondasi untuk prediksi aksi. Kolaborasinya dengan mimic robotics menghasilkan FLUX-mimic, di mana dekoder aksi membaca representasi dari model video alih-alih melatih tumpukan persepsi independen sepenuhnya.

BFL melaporkan bahwa backbone FLUX-mimic dapat berjalan dalam di bawah 80 ms pada satu RTX 5090, sementara sistem robot lengkap mencapai loop reaksi sekitar 101 ms. Perusahaan juga membahas evaluasi industri dengan Audi.

Ini tidak membuat FLUX 3 Video API publik menjadi API robotika. Ini menunjukkan mengapa BFL berinvestasi besar dalam representasi video multimodal alih-alih memperlakukan generasi video sebagai tugas media terisolasi.

Kekuatan Utama FLUX 3

  • Konsistensi temporal dan adegan. Skor Konsistensi Adegan 94.76 dari Megaton adalah kategori benchmark utama terkuat model.
  • Generasi audiovisual bawaan. Dialog, efek, ambience, dan visual dapat dihasilkan bersama alih-alih disatukan dari model terpisah.
  • Kepatuhan prompt yang kuat. Hasil Kepatuhan Prompt independen 87.07 menunjukkan kekuatan model melampaui polesan visual semata.
  • Kontrol keyframe. Hingga sepuluh gambar dapat berpartisipasi dalam alur gambar-ke-video saat ini, memberi kreator kontrol temporal eksplisit.
  • Alur dari draft ke final. Mode Draft mengatasi masalah biaya nyata dalam video AI: banyak generasi dibuang selama iterasi prompt.
  • Rentang visual luas. BFL memosisikan FLUX 3 sebagai mampu menghasilkan output mentah, natural, sinematik, nostalgik, playful, bergaya, dan tidak biasa alih-alih satu gaya tunggal.
  • Arah riset model dunia. Self-Flow dan prediksi aksi membuat FLUX 3 relevan melampaui generasi media.

Keterbatasan FLUX 3

  • Roadmap multimodal penuh belum dikirim. FLUX 3 Image publik dan bobot terbuka FLUX 3 Dev tidak boleh diasumsikan dari pengumuman level keluarga.
  • 20 detik bukan lagi durasi terdepan industri. Beberapa pesaing 2026 sudah mendukung generasi 30 detik.
  • Fisika belum terselesaikan. Megaton memberi FLUX 3 skor Fisika 70.63, jauh di bawah skor konsistensi adegannya.
  • Fidelitas manusia masih perlu ditingkatkan. Skor independen 73.70 berarti anatomi sulit dan gerak manusia realistis masih bisa gagal.
  • Kelanjutan video mahal. Harga kelanjutan BFL jauh lebih tinggi per detik dibanding T2V/I2V biasa.
  • Benchmark kompetitif utama BFL bersifat internal. Keputusan produksi juga harus mencakup tes independen menggunakan prompt, jenis shot, bahasa, dan aset referensi milik aplikasi.

Cara Menggunakan FLUX 3 dengan CometAPI

Cakupan FLUX 3 sebelumnya milik CometAPI menjelaskan fase Early Access Juli, benchmark awal, dan rencana rollout. Bagian ini fokus pada integrasi produksi saat ini, harga, dan alur API kerja sehingga tidak mengulang walkthrough historis tersebut. Model produksi FLUX 3 menggunakan ID model flux-3.

Permintaan 720p dasar menggunakan endpoint /v1/videos:

Bash

curl --request POST "https://api.cometapi.com/v1/videos" \
--header "Authorization: Bearer $COMETAPI_KEY" \
--form-string "model=flux-3" \
--form-string "prompt=Sebuah perahu kertas meluncur melintasi kolam tenang dalam cahaya pagi yang lembut" \
--form-string "seconds=5" \
--form-string "size=1280x720"

Alur kerja video bersifat asinkron. Setelah permintaan awal mengembalikan ID tugas, aplikasi memeriksa tugas hingga generasi selesai dan kemudian mengambil video yang dihasilkan. Untuk aplikasi produksi, generasi biasanya harus ditangani oleh job latar belakang atau antrean tugas alih-alih menahan permintaan HTTP tetap terbuka selama waktu render penuh.

Siapa yang Harus Menggunakan FLUX 3?

FLUX 3 sangat menarik untuk aplikasi yang membutuhkan lebih dari klip lima detik yang menarik secara visual: sistem periklanan dengan visual dan audio tersinkron, produksi short-form otomatis, demonstrasi produk di mana persistensi objek penting, generasi dialog multibahasa, alur storyboard-ke-video, animasi terkontrol keyframe, konten edukasi, dan eksperimen dengan pipeline multimodal yang lebih panjang.

Mungkin kurang menarik ketika satu-satunya kebutuhan adalah biaya per detik serendah mungkin, ketika lebih dari 20 detik harus dihasilkan dalam satu kali, atau ketika generasi gambar diam adalah tugas utama. Untuk gambar diam, model gambar FLUX yang ada seperti FLUX.2 Max saat ini mungkin lebih cocok.

Apakah FLUX 3 Lebih Baik daripada Model Video AI Lain?

Tidak ada jawaban tunggal yang dapat dipertahankan untuk setiap use case. Evaluasi internal BFL menempatkan FLUX 3 rilis di puncak perbandingan teks-ke-video mereka, sementara evaluasi independen Megaton menempatkan FLUX 3 ketiga secara keseluruhan di belakang pesaing yang lebih baru. Kedua hasil bisa valid karena tes mengukur distribusi prompt dan dimensi kualitas yang berbeda.

FLUX 3 tampak sangat kuat ketika konsistensi adegan, kepatuhan prompt, fidelitas objek, koherensi kausal, perenderan teks, suara tersinkron, dan keyframe yang dapat dikontrol penting. Model lain mungkin menang pada durasi maksimum, resolusi, preferensi artistik, fidelitas manusia, alur kerja penyuntingan, atau biaya. Bagi pengembang, perbandingan yang benar adalah spesifik beban kerja, bukan spesifik leaderboard.

Pertanyaan yang Sering Diajukan

Apakah FLUX 3 tersedia sekarang?

Ya. FLUX 3 Video menjadi tersedia umum melalui BFL pada 4 Agustus 2026. CometAPI juga mencantumkan FLUX 3 sebagai Available dengan ID model flux-3. Rilis FLUX 3 Image dan bobot terbuka FLUX 3 Dev tetap item roadmap terpisah.

Apakah FLUX 3 dapat menghasilkan audio?

Ya. FLUX 3 Video menghasilkan audio bawaan tersinkron termasuk dialog, suara ambien, dan efek. Dialog multibahasa dan sinkronisasi bibir juga didukung.

Berapa lama video FLUX 3 dapat dibuat?

Generasi teks-ke-video dan gambar-ke-video saat ini mendukung 5–20 detik. Kelanjutan video mendukung 5–15 detik konten yang baru dihasilkan.

Resolusi apa yang didukung FLUX 3?

BFL mendukung HD (hingga 1 megapiksel per bingkai), FHD (hingga 2 MP), QHD/2K (hingga 4 MP), dan UHD/4K (hingga 8 MP). Output FHD 16:9 adalah 1920 × 1088. Pita resolusi didasarkan pada total piksel per bingkai alih-alih rasio aspek; Mode Draft hanya HD.

Apakah FLUX 3 mendukung gambar-ke-video?

Ya. Generasi gambar-ke-video dan keyframe adalah bagian dari set fitur FLUX 3 Video yang tersedia umum.

Apakah FLUX 3 adalah model generasi gambar?

Secara arsitektural, FLUX 3 dilatih di seluruh gambar, video, dan audio, dan BFL telah menunjukkan riset generasi dan penyuntingan gambar. Namun, produk FLUX 3 Image tetap rilis mendatang; jangan bingungkan roadmap keluarga dengan FLUX 3 Video API publik saat ini.

Apakah FLUX 3 open source?

Saat ini tidak. BFL telah mengumumkan FLUX 3 Dev, varian multimodal bobot terbuka, tetapi belum menyediakan tanggal rilis publik.

Berapa biaya FLUX 3?

BFL memberi harga teks/gambar-ke-video sebesar $0.06/d untuk Draft HD, $0.17/d untuk HD, $0.29/d untuk FHD, $0.40/d untuk QHD, dan $0.80/d untuk UHD. Video-ke-video berharga $0.12/d untuk Draft HD, kemudian $0.41/d untuk HD, $0.53/d untuk FHD, $0.65/d untuk QHD, dan $0.95/d untuk UHD. CometAPI saat ini mencantumkan $0.136/d untuk 720p dan $0.232/d untuk 1080p.

Apa itu Self-Flow?

Self-Flow adalah pendekatan flow-matching swa-supervisi dari BFL. Ia dirancang agar model generatif mengembangkan representasi internal yang berguna tanpa bergantung pada model representasi eksternal. Penggunaan tingkat noise berbeda di seluruh token mendorong jaringan menyimpulkan informasi yang hilang dan mempelajari hubungan antarobservasi multimodal.

Apakah FLUX 3 merupakan model dunia?

Black Forest Labs memosisikan FLUX 3 sebagai fondasi model realitas karena representasi bersama yang meluas dari prediksi audiovisual menuju prediksi aksi fisik. Menyebutnya model dunia serbaguna lengkap akan lebih kuat daripada bukti yang ada saat ini; deskripsi yang lebih tepat adalah model fondasi generatif multimodal yang secara eksplisit dirancang di sekitar objektif pemodelan dunia.

Kesimpulan

FLUX 3 mewakili perubahan yang lebih besar bagi Black Forest Labs daripada peningkatan konvensional dari satu model gambar FLUX ke yang lain. Gagasan kuncinya adalah melatih representasi multimodal bersama tentang dunia, lalu menggunakan representasi itu untuk video, suara, gambar, dan pada akhirnya aksi. Self-Flow menyediakan landasan riset, sementara model FLUX 3 Video yang dirilis adalah demonstrasi produksi pertama dari strategi tersebut.

Per September 2026, FLUX 3 Video mendukung klip hingga 20 detik, 24 fps, output dari HD hingga UHD/4K, audio tersinkron, dialog multibahasa, gambar-ke-video, keyframe, kelanjutan video, generasi multi-shot, dan Mode Draft.

Gambar benchmark juga lebih kredibel daripada saat peluncuran. Evaluasi model rilis BFL saat ini menempatkan FLUX 3 pertama dalam uji ELO T2V internalnya, sementara pengujian independen Megaton menempatkannya ketiga secara keseluruhan dan menyoroti konsistensi adegan yang sangat kuat.

FLUX 3 karenanya tidak secara otomatis menjadi model video terbaik untuk setiap beban kerja. Seedance 2.5, MiniMax H3, dan Wan 3.0 dapat menawarkan generasi lebih panjang, resolusi nominal lebih tinggi, harga lebih rendah, atau kapabilitas referensi dan penyuntingan yang berbeda.

Yang membuat FLUX 3 menarik adalah arah di balik generator video: BFL bertaruh bahwa representasi yang sama yang dibutuhkan untuk memprediksi video meyakinkan pada akhirnya dapat mendukung generasi gambar, audio, penalaran fisik, dan aksi robot. Pengembang sudah dapat menguji langkah produksi pertama melalui FLUX 3 di CometAPI menggunakan ID model flux-3.

Lanjut belajar

Hubungkan artikel ini ke keputusan berikutnya.

Lihat semua topik
Dipublikasikan pada Oct 3, 2026
Terakhir diperbarui Oct 3, 2026
0 tampilan
Ditinjau untuk kejelasan, atribusi sumber, dan terminologi API terkini.

Baca Selengkapnya