TL;DR: FLUX 3 là mô hình nền tảng đa phương thức hợp nhất của Black Forest Labs. Video API công khai tạo clip tối đa 20 giây ở 24 fps, có thể kèm âm thanh đồng bộ, từ văn bản, hình ảnh, khung khóa hoặc video sẵn có. Hỗ trợ từ HD đến UHD/4K, trong khi FLUX 3 Image và mô hình mở trọng số FLUX 3 Dev vẫn là các hạng mục triển khai riêng biệt.
FLUX 3 là gì?
FLUX 3 là mô hình đa phương thức tiên phong từ Black Forest Labs. Thay vì huấn luyện riêng một mô hình cho ảnh, một cho video và một cho âm thanh, BFL huấn luyện một biểu diễn chung cho các phương thức này.
Ý tưởng trung tâm là ảnh, video và âm thanh là những quan sát khác nhau về cùng một thế giới nền tảng. Một chiếc xe đang chạy có ngoại hình, chuyển động, âm thanh, quan hệ không gian, đặc tính vật liệu và hành vi nhân quả. Học các tín hiệu này cùng nhau đặt ra nhiều ràng buộc hơn so với chỉ học từng khung hình đơn lẻ.
Đó là lý do Black Forest Labs mô tả FLUX 3 như một bước tiến tới mô hình thực tại hay mô hình thế giới hơn là chỉ là một trình tạo ảnh hoặc video. Hệ thống video đã phát hành cho thấy rõ hướng đó: âm thanh đồng bộ, chuyển động, cấu trúc cảnh, đối thoại, hành vi máy quay và âm thanh môi trường đều được xử lý trong một quy trình tạo duy nhất.
Không phải mọi khả năng của FLUX 3 đã công bố đều sẵn sàng công khai. Tính đến tháng 9 năm 2026, FLUX 3 Video đã khả dụng, trong khi FLUX 3 Image và mô hình mở trọng số FLUX 3 Dev vẫn là các hạng mục triển khai riêng.
Thông số FLUX 3 tóm lược
Các thông số sau phản ánh tài liệu nhà phát triển FLUX 3 hiện tại thay vì cấu hình ra mắt sơ bộ tháng 7.
| Thông số | Tài liệu chính thức của FLUX 3 |
|---|---|
| Nhà phát triển | Black Forest Labs |
| Họ mô hình | FLUX 3 |
| Loại mô hình | Nền tảng đa phương thức hợp nhất / mô hình video sinh |
| Phát hành video công khai | 4 tháng 8, 2026 |
| Định hướng huấn luyện cốt lõi | Học biểu diễn chung cho ảnh, video và âm thanh |
| Nền tảng nghiên cứu | Self-Flow |
| Đầu ra API chính hiện tại | Video với âm thanh đồng bộ |
| Văn bản thành video | Hỗ trợ |
| Ảnh thành video | Hỗ trợ |
| Khung khóa thành video | Hỗ trợ |
| Tiếp tục video | Hỗ trợ |
| Thời lượng tối đa T2V/I2V | 20 giây |
| Thời lượng tiếp tục video | 5–15 giây |
| Tốc độ khung hình | 24 fps |
| Độ phân giải | HD, FHD, QHD/2K và UHD/4K |
| Độ phân giải FHD 16:9 | 1920 × 1088 |
| Tham chiếu hình ảnh | Tối đa 10 cho quy trình I2V/khung khóa |
| Âm thanh gốc | Có |
| Hội thoại đa ngôn ngữ | Có |
| Đồng bộ khẩu hình | Có |
| Tạo nhiều shot trong một lần | Có |
| Chế độ Bản nháp | Có |
| Điểm cuối ảnh tĩnh FLUX 3 công khai | Chưa phát hành rộng rãi bởi BFL |
| FLUX 3 Dev mở trọng số | Đã lên kế hoạch |
Tài liệu BFL hiện quy định 5–20 giây cho văn bản-sang-video và ảnh-sang-video, trong khi tiếp tục video chấp nhận cửa sổ tạo 5–15 giây. Hỗ trợ các tỉ lệ khung hình gồm 21:9, 2:1, 16:9, 4:3, 1:1, 3:4 và 9:16.
FLUX 3 hoạt động như thế nào?
Self-Flow
Nền tảng nghiên cứu then chốt là Self-Flow, cách tiếp cận tự giám sát theo flow-matching của Black Forest Labs. Các quy trình huấn luyện tạo sinh truyền thống thường dựa vào các mô hình biểu diễn tiền huấn luyện riêng hoặc giám sát bổ trợ. Self-Flow được thiết kế để học các biểu diễn hữu ích trực tiếp từ mục tiêu tạo sinh.
Cơ chế chủ đạo là Dual-Timestep Scheduling. Các nhóm token khác nhau có thể được gán mức nhiễu khác nhau trong huấn luyện. Điều này tạo ra bất cân xứng thông tin: một số phần đầu vào chứa nhiều thông tin hữu dụng hơn những phần khác, buộc mạng lưới xây dựng các biểu diễn giúp suy ra phần còn thiếu.
Về thực tế, FLUX 3 được khuyến khích học các mối quan hệ giữa đối tượng, khung hình, chuyển động, âm thanh và sự kiện thời gian thay vì chỉ ghi nhớ hình thức của từng khung hình riêng lẻ.

Kiến trúc phương pháp Self-Flow - nguồn ảnh chính thức: Black Forest Labs Self-Flow project
BFL cũng thử nghiệm huấn luyện đa phương thức chung sử dụng backbone dẫn xuất từ FLUX.2 với hàng triệu video và hàng trăm triệu ảnh. Các thí nghiệm ủng hộ giả thuyết rộng hơn của FLUX 3 rằng học biểu diễn và tạo sinh không cần là các hệ thống tách biệt.
Vì sao video là trung tâm của FLUX 3
Video đặc biệt giá trị cho mô hình thế giới vì chứa thông tin mà ảnh tĩnh không thể cung cấp. Một khung hình có thể cho thấy quả bóng ở trên sàn; video có thể cho thấy quả bóng đang rơi, nảy, biến dạng khi va chạm, phát ra âm thanh và đổi hướng sau đó.
BFL tiết lộ rằng dự đoán video chiếm hơn 95% tài nguyên tính toán huấn luyện của FLUX 3. Âm thanh tương đối rẻ hơn vì là tín hiệu có chiều thấp hơn nhiều và gắn chặt với các sự kiện nhìn thấy. Phân bổ đó giúp giải thích vì sao video là khả năng đầu tiên của FLUX 3 đạt mức khả dụng rộng rãi.
FLUX 3 có thể làm gì?
Văn bản thành video
Người dùng có thể tạo một video hoàn chỉnh từ hướng dẫn ngôn ngữ tự nhiên. BFL cho biết mô hình phát hành xử lý được cả prompt đơn giản lẫn phức tạp, đồng thời phối hợp chuyển động, logic cảnh, bố cục hình ảnh và âm thanh. Điều này đặc biệt hữu ích cho prompt chứa nhiều sự kiện tuần tự thay vì chỉ một chủ thể được hoạt hình.
Ảnh thành video và khung khóa
FLUX 3 có thể hoạt hình hóa một ảnh ban đầu, hướng tới một khung kết thúc hoặc dùng nhiều ảnh làm khung khóa theo thời gian. API hiện hỗ trợ tối đa mười tham chiếu ảnh trong quy trình ảnh-sang-video, cho phép nhà sáng tạo kiểm soát cách cảnh thay đổi theo thời gian thay vì để mô hình ứng tác cả chuỗi.
Tiếp tục video
Có thể cung cấp một video hiện có cùng âm thanh làm ngữ cảnh và FLUX 3 sẽ tạo phần tiếp theo. BFL mô tả khả năng tiếp nối giữ nguyên chuyển động, hành vi máy quay, đối thoại và âm thanh qua điểm chuyển, khác biệt rõ với việc tạo một clip thứ hai độc lập rồi ghép tệp sau đó.
Âm thanh và đối thoại gốc
FLUX 3 tạo âm thanh ngay khi tạo video thay vì yêu cầu một lượt sinh giọng nói/âm thanh riêng. Các khả năng âm thanh phát hành bao gồm đối thoại, hiệu ứng âm thanh và âm thanh môi trường. Hỗ trợ hội thoại đa ngôn ngữ với đồng bộ khẩu hình.
Nhiều shot trong một lần tạo
Một prompt có thể chứa nhiều cảnh hoặc góc máy. Điều này quan trọng vì nhiều mô hình video trước đây mạnh nhất khi được yêu cầu một shot ngắn liền mạch về mặt hình ảnh; FLUX 3 được thiết kế rõ ràng để hỗ trợ chuỗi nhiều shot trong một lần tạo.
Chế độ Bản nháp
Chế độ Bản nháp là bổ sung thực tiễn cho tạo video khối lượng lớn. Thay vì trả đủ chi phí cho mọi lần thử prompt, nhà phát triển có thể tạo bản xem trước nhanh, chi phí thấp rồi nâng cấp bản đã chọn, đồng thời giữ bố cục và chuyển động đã chọn. Theo bảng giá BFL hiện tại, một bản nháp T2V/I2V tiêu chuẩn tốn $0.06 mỗi giây, so với $0.17 mỗi giây cho tạo HD thông thường.
Những gì chưa ra mắt?
Thông báo ra mắt của FLUX 3 mô tả khả năng ảnh, video, âm thanh và hành động dưới một định hướng kiến trúc, nhưng thời điểm khả dụng được triển khai theo giai đoạn.
| Khả năng | Lộ trình và tình trạng của BFL |
|---|---|
| Tạo video FLUX 3 | Khả dụng rộng rãi |
| Âm thanh gốc trong video | Khả dụng rộng rãi |
| Văn bản thành video | Khả dụng rộng rãi |
| Ảnh thành video / khung khóa | Khả dụng rộng rãi |
| Tiếp tục video | Khả dụng rộng rãi |
| Kết hợp tham chiếu ảnh/video/âm thanh phong phú hơn | Mở rộng đã lên kế hoạch |
| Tạo và chỉnh sửa ảnh FLUX 3 | Sắp ra mắt |
| FLUX 3 Dev mở trọng số | Đã lên kế hoạch |
| Triển khai dự đoán hành động | Nghiên cứu / kênh đối tác thương mại |
Phân biệt này đặc biệt quan trọng với người dùng quen với FLUX.2 Max. FLUX.2 vẫn là lựa chọn chuyên dụng hiện tại cho tạo ảnh tĩnh, trong khi sản phẩm FLUX 3 công khai tập trung vào video và âm thanh.
Hiệu năng chuẩn đo lường của FLUX 3
Hiện có hai dạng bằng chứng chuẩn đo lường hữu ích cho FLUX 3: đánh giá nội bộ sau phát hành của BFL và đánh giá độc lập từ bên thứ ba. Cái đầu cho thấy mức ưa thích của con người theo giao thức của BFL; cái thứ hai kiểm tra liệu các điểm mạnh đó có còn thể hiện dưới một bộ chuẩn được thiết kế độc lập hay không.
Đánh giá ELO sau phát hành của BFL
Thông báo tháng 7 ban đầu bao gồm các tỉ lệ thắng sơ bộ. Chuẩn liên quan hơn cho người dùng hiện tại là đánh giá mô hình phát hành ngày 4 tháng 8 của BFL. Black Forest Labs báo cáo điểm ELO văn bản-sang-video là 1135 trong đánh giá all-vs-all nội bộ.

Đánh giá ELO mô hình phát hành FLUX 3 - nguồn ảnh chính thức: Black Forest Labs
| Chỉ số | Đánh giá mô hình phát hành của BFL |
|---|---|
| ELO văn bản-sang-video | 1135 |
| Vị trí T2V | Điểm cao nhất trong nhóm mô hình BFL đã thử nghiệm |
| Kết quả ảnh-sang-video | Hòa với đối thủ mạnh nhất và vượt các mô hình còn lại trong nhóm đánh giá |
| Loại đánh giá | Đánh giá nội bộ dựa trên mức ưa thích của con người |
| Giai đoạn mô hình | Bản phát hành FLUX 3 Video khả dụng rộng rãi |
Đây là bằng chứng mạnh hơn so với benchmark ra mắt sơ bộ vì đánh giá mô hình phát hành tháng 8. Tuy nhiên vẫn là benchmark do nhà cung cấp thực hiện và không nên hiểu là bằng chứng rằng FLUX 3 sẽ vượt mọi đối thủ trên mọi loại prompt.
Chuẩn độc lập cho FLUX 3
v-benchmark v2 của Megaton cung cấp một phép kiểm độc lập. FLUX 3 được đánh giá vào tháng 8 năm 2026 và hiện đạt Megaton Index 76.51/100, xếp hạng #3 trong bộ công bố tại thời điểm đánh giá.
| Chiều đánh giá | Đánh giá FLUX 3 của Megaton |
|---|---|
| Megaton Index | 76.51 |
| Mức tuân thủ lời nhắc | 87.07 |
| Tính nhất quán cảnh | 94.76 |
| Vật lý | 70.63 |
| Độ trung thực với con người | 73.70 |
| Độ trung thực đối tượng & sản phẩm | 83.82 |
| Mạch lạc nhân quả & ngữ nghĩa | 80.91 |
| Độ trung thực văn bản | 82.41 |
| Quay phim | 71.43 |
| Gu thẩm mỹ & chỉ đạo nghệ thuật | 65.00 |
Hồ sơ này cung cấp thông tin nhiều hơn điểm tổng. Tính nhất quán cảnh 94.76 là hạng mục mạnh nhất, trong khi tuân thủ lời nhắc, độ trung thực đối tượng, mạch lạc nhân quả và độ trung thực văn bản cũng vượt 80. Vật lý, độ trung thực con người và gu thẩm mỹ & chỉ đạo nghệ thuật yếu hơn, cho thấy biểu diễn thời gian mạnh hơn không loại bỏ hoàn toàn chuyển động tổng hợp hoặc biến thiên về chất lượng nghệ thuật.
Điều này cũng giải thích vì sao kết luận benchmark có thể khác nhau: kiểm thử ưa thích nội bộ của BFL đặt FLUX 3 đứng đầu tập so sánh của họ, trong khi bảng xếp hạng độc lập của Megaton xếp thứ ba. Prompt, chiều đánh giá, nhóm người chấm và phương pháp tổng hợp khác nhau có thể cho ra thứ hạng khác nhau.
FLUX 3 vs Seedance 2.5 vs MiniMax H3 vs Wan 3.0
Thị trường video AI năm 2026 phát triển nhanh. FLUX 3 nay cạnh tranh với các hệ thống đa phương thức kết hợp ngày càng nhiều khả năng tạo dài hơn, âm thanh đồng bộ, tham chiếu và chỉnh sửa.
| Chiều so sánh | FLUX 3 | Seedance 2.5 | MiniMax H3 | Wan 3.0 |
|---|---|---|---|---|
| Nhà phát triển | Black Forest Labs | ByteDance Seed | MiniMax | Alibaba |
| Clip tối đa quảng bá | 20 s | 30 s | 15 s | 30 s |
| Độ phân giải video | HD / FHD / QHD (2K) / UHD (4K) | Phụ thuộc hạng API | Tối đa 2K | Tối đa 1080p |
| Âm thanh gốc | Có | Có | Có, stereo | Có |
| Văn bản thành video | Có | Có | Có | Có |
| Đầu vào ảnh/tham chiếu | Có | Có | Có | Có |
| Điều khiển khung khóa/tham chiếu | Khung khóa theo thời gian mạnh | Điều khiển tham chiếu đa phương thức mạnh | Điều kiện đa phương thức | Điều khiển tham chiếu đa phương thức |
| Tiếp tục/chỉnh sửa video | Có tiếp tục | Quy trình thiên về chỉnh sửa | Trọng tâm tạo sinh toàn diện | Quy trình chỉnh sửa và tham chiếu |
| Tạo nhiều shot | Có | Có | Có | Có |
| Điểm mạnh nổi bật | Kiến trúc mô hình thực tại, nhất quán cảnh, Self-Flow | Kể chuyện dài hơi và điều khiển tham chiếu | Tạo sinh âm thanh-hình ảnh 2K và ngữ cảnh đa phương thức | Clip dài và chi phí khởi điểm thấp |
| Giá khởi điểm/đơn vị CometAPI* | $0.136/s | $0.0824/s niêm yết | $0.064/s | $0.040/s |
* Giá chỉ mang tính so sánh sơ bộ. API video dùng các độ phân giải, thời lượng, hạng chất lượng và quy tắc tính phí khác nhau, nên con số rẻ nhất theo giây không nhất thiết là chi phí thấp nhất cho chất lượng tương đương.
FLUX 3 vs Seedance 2.5
Seedance 2.5 có lợi thế rõ về thời lượng, với tạo tối đa 30 giây so với 20 giây của FLUX 3. Sản phẩm cũng định hướng mạnh vào tạo dựa trên tham chiếu, chỉnh sửa và kể chuyện dài hơi. FLUX 3 khác biệt nhờ kiến trúc mô hình thế giới chung, nhất quán cảnh, tạo âm thanh-hình ảnh gốc, khung khóa theo thời gian và lộ trình rộng hơn về ảnh/hành động.
Kiểm thử độc lập củng cố rằng đây là cạnh tranh cao cấp thực sự: Megaton hiện xếp Seedance 2.5 trên FLUX 3 tổng thể.
FLUX 3 vs MiniMax H3
MiniMax H3 cung cấp đầu ra tới 2K và âm thanh stereo gốc, mang thông số kỹ thuật mạnh cho nội dung âm thanh-hình ảnh. FLUX 3 hỗ trợ cửa sổ tạo tối đa dài hơn — 20 giây so với 15 giây của H3 — và Chế độ Bản nháp mang lại quy trình lặp chi phí kiểm soát.
FLUX 3 vs Wan 3.0
Wan 3.0 nhấn mạnh đầu vào đa phương thức rộng, tạo âm thanh-hình ảnh, chỉnh sửa và clip lên đến 30 giây. Giá cũng rẻ hơn ở mức khởi điểm của CometAPI. FLUX 3 đắt hơn nhưng khác biệt nhờ định vị mô hình thực tại, nhất quán cảnh, nền tảng nghiên cứu Self-Flow, Chế độ Bản nháp và tích hợp dự đoán hành động.
Giá FLUX 3
Black Forest Labs tính phí FLUX 3 theo thời lượng video được tạo.
| Chế độ | Bảng giá FLUX 3 của BFL |
|---|---|
| T2V / I2V Bản nháp HD | $0.06/s |
| T2V / I2V HD | $0.17/s |
| T2V / I2V FHD | $0.29/s |
| T2V / I2V QHD (2K) | $0.40/s |
| T2V / I2V UHD (4K) | $0.80/s |
| Tiếp tục video Bản nháp | $0.12/s |
| Tiếp tục video HD | $0.41/s |
| Tiếp tục video FHD | $0.53/s |
| Tiếp tục video QHD (2K) | $0.65/s |
| Tiếp tục video UHD (4K) | $0.95/s |
Một lần tạo HD 10 giây tiêu chuẩn vì vậy xấp xỉ $1.70 theo mức BFL niêm yết, trong khi 10 giây FHD xấp xỉ $2.90. Tiếp tục video đắt hơn đáng kể theo giây so với tạo thông thường, nên các ứng dụng thường xuyên kéo dài clip cần mô hình hóa chi phí riêng.
Giá FLUX 3 trên CometAPI
CometAPI hiện liệt kê FLUX 3 là khả dụng với model ID flux-3.
| Độ phân giải | Giá FLUX 3 trên CometAPI |
|---|---|
| 720p | $0.136/s |
| 1080p | $0.232/s |
Với 10 giây tạo, tương ứng khoảng $1.36 ở 720p hoặc $2.32 ở 1080p. So với mức $0.17/s và $0.29/s BFL niêm yết, giá mặc định trên CometAPI thấp hơn khoảng 20% cho hai hạng này.
Lưu ý về khả dụng: một số nội dung mô tả cũ trên CometAPI vẫn phản ánh giai đoạn Early Access tháng 7. Thẻ mô hình live hiện tại, phần giá và ví dụ API liệt kê flux-3 là Available, với ngày phát hành trên CometAPI là 13 tháng 8, 2026. Với quyết định tích hợp, API live và trường giá hiện hành phù hợp hơn so với mô tả khả dụng cũ.
Vì sao FLUX 3 quan trọng vượt ra ngoài video AI
Điểm khác thường nhất của FLUX 3 không phải là tạo video 20 giây. Vài đối thủ đã có thể tạo clip dài bằng hoặc dài hơn. Cược kỹ thuật lớn hơn là một biểu diễn video mạnh có thể trở thành nền tảng cho các dạng trí tuệ khác.
Từ dự đoán video đến dự đoán hành động
Tín hiệu điều khiển robot là dự đoán theo thời gian có điều kiện trên quan sát thị giác, nên BFL dùng biểu diễn video của FLUX 3 làm nền tảng cho dự đoán hành động. Hợp tác với mimic robotics tạo ra FLUX-mimic, trong đó bộ giải mã hành động đọc biểu diễn từ mô hình video thay vì huấn luyện một ngăn xếp tri giác độc lập hoàn toàn.
BFL báo cáo backbone FLUX-mimic có thể chạy dưới 80 ms trên một RTX 5090, trong khi hệ thống robot hoàn chỉnh đạt vòng phản ứng khoảng 101 ms. Công ty cũng thảo luận đánh giá công nghiệp với Audi.
Điều này không biến FLUX 3 Video API công khai thành API robot. Nó cho thấy vì sao BFL đầu tư mạnh vào biểu diễn video đa phương thức thay vì xem tạo video như một tác vụ truyền thông cô lập.
Các điểm mạnh chính của FLUX 3
- Tính nhất quán theo thời gian và cảnh. Điểm Tính nhất quán cảnh 94.76 của Megaton là hạng mục chuẩn lớn mạnh nhất của mô hình.
- Tạo âm thanh-hình ảnh gốc. Đối thoại, hiệu ứng, âm vực và hình ảnh có thể được tạo cùng lúc thay vì ghép từ các mô hình riêng.
- Mức tuân thủ prompt mạnh. Kết quả Tuân thủ lời nhắc độc lập 87.07 gợi ý điểm mạnh của mô hình vượt ngoài độ bóng hình ảnh thuần túy.
- Điều khiển khung khóa. Tối đa mười ảnh có thể tham gia quy trình ảnh-sang-video hiện tại, cho phép điều khiển thời gian rõ ràng.
- Quy trình từ bản nháp tới bản cuối. Chế độ Bản nháp giải quyết vấn đề chi phí thực tế trong video AI: nhiều lần tạo bị loại trong quá trình lặp prompt.
- Phổ hình ảnh rộng. BFL định vị FLUX 3 có khả năng tạo tự nhiên, điện ảnh, hoài cổ, vui nhộn, cách điệu và khác thường, thay vì một phong cách cố định.
- Định hướng mô hình thế giới. Self-Flow và dự đoán hành động khiến FLUX 3 có liên quan vượt ngoài tạo nội dung truyền thông.
Hạn chế của FLUX 3
- Lộ trình đa phương thức đầy đủ chưa ra mắt. FLUX 3 Image công khai và FLUX 3 Dev mở trọng số không nên được mặc định từ thông báo cấp họ mô hình.
- 20 giây không còn là thời lượng dẫn đầu ngành. Một số đối thủ 2026 đã hỗ trợ tạo 30 giây.
- Vật lý chưa được giải quyết. Megaton chấm FLUX 3 điểm Vật lý 70.63, thấp đáng kể so với điểm nhất quán cảnh.
- Độ trung thực con người còn dư địa cải thiện. Điểm độc lập 73.70 nghĩa là giải phẫu khó và chuyển động người thực vẫn có thể thất bại.
- Tiếp tục video đắt. Giá tiếp tục của BFL cao hơn đáng kể theo giây so với T2V/I2V thông thường.
- Benchmark đối đầu nổi bật của BFL là nội bộ. Quyết định sản xuất cũng nên bao gồm kiểm thử độc lập bằng prompt, kiểu shot, ngôn ngữ và tài sản tham chiếu của chính ứng dụng.
Cách sử dụng FLUX 3 với CometAPI
Bài viết trước đây về FLUX 3 của CometAPI giải thích giai đoạn Early Access tháng 7, benchmark sơ bộ và lộ trình dự kiến. Phần này tập trung vào tích hợp sản xuất hiện tại, giá và luồng API đang hoạt động để không lặp lại hướng dẫn lịch sử đó. Mô hình sản xuất FLUX 3 dùng model ID flux-3.
Yêu cầu 720p cơ bản dùng endpoint /v1/videos:
Bash
curl --request POST "https://api.cometapi.com/v1/videos" \--header "Authorization: Bearer $COMETAPI_KEY" \ --form-string "model=flux-3" \ --form-string "prompt=Một chiếc thuyền giấy lướt trên mặt ao tĩnh lặng trong ánh sáng ban mai dịu nhẹ" \ --form-string "seconds=5" \ --form-string "size=1280x720" |
|---|
Quy trình video là không đồng bộ. Sau khi yêu cầu ban đầu trả về task ID, ứng dụng kiểm tra tác vụ cho tới khi tạo xong rồi lấy video kết quả. Trong môi trường sản xuất, quá trình tạo thường nên được xử lý bởi job nền hoặc hàng đợi tác vụ thay vì giữ kết nối HTTP mở suốt thời gian render.
Ai nên dùng FLUX 3?
FLUX 3 đặc biệt hấp dẫn cho các ứng dụng cần hơn những clip 5 giây đẹp mắt: hệ thống quảng cáo với hình-âm đồng bộ, sản xuất nội dung ngắn tự động, demo sản phẩm nơi tính bền vững đối tượng quan trọng, tạo hội thoại đa ngôn ngữ, quy trình storyboard-thành-video, hoạt hình điều khiển bằng khung khóa, nội dung giáo dục và thử nghiệm với pipeline đa phương thức dài hơn.
Có thể kém hấp dẫn khi yêu cầu duy nhất là chi phí thấp nhất theo giây, khi cần tạo hơn 20 giây trong một lần, hoặc khi tạo ảnh tĩnh là tác vụ chính. Với ảnh tĩnh, một mô hình ảnh FLUX hiện có như FLUX.2 Max có thể phù hợp hơn.
FLUX 3 có tốt hơn các mô hình video AI khác không?
Không có câu trả lời bảo vệ được cho mọi trường hợp sử dụng. Đánh giá nội bộ của BFL đặt FLUX 3 phát hành đứng đầu so sánh văn bản-sang-video, trong khi đánh giá độc lập của Megaton xếp FLUX 3 thứ ba, sau các đối thủ mới hơn. Cả hai kết quả đều có thể đúng vì các bài kiểm tra đo những phân bố prompt và chiều chất lượng khác nhau.
FLUX 3 có vẻ đặc biệt mạnh khi tính nhất quán cảnh, tuân thủ prompt, độ trung thực đối tượng, mạch lạc nhân quả, dựng chữ, âm thanh đồng bộ và khung khóa có thể điều khiển là quan trọng. Các mô hình khác có thể thắng về thời lượng tối đa, độ phân giải, sở thích nghệ thuật, độ trung thực con người, quy trình chỉnh sửa hoặc chi phí. Với nhà phát triển, so sánh đúng là theo khối công việc cụ thể chứ không phải theo bảng xếp hạng.
Câu hỏi thường gặp
FLUX 3 hiện đã khả dụng chưa?
Có. FLUX 3 Video trở nên khả dụng rộng rãi qua BFL vào ngày 4 tháng 8, 2026. CometAPI cũng liệt kê FLUX 3 là Available dưới model ID flux-3. Bản phát hành ảnh tĩnh FLUX 3 và FLUX 3 Dev mở trọng số vẫn là các hạng mục lộ trình riêng.
FLUX 3 có thể tạo âm thanh không?
Có. FLUX 3 Video tạo âm thanh gốc đồng bộ bao gồm đối thoại, âm thanh môi trường và hiệu ứng. Hỗ trợ hội thoại đa ngôn ngữ và đồng bộ khẩu hình.
Video FLUX 3 có thể dài bao lâu?
Tạo văn bản-sang-video và ảnh-sang-video hiện hỗ trợ 5–20 giây. Tiếp tục video hỗ trợ 5–15 giây nội dung mới được tạo.
FLUX 3 hỗ trợ độ phân giải nào?
BFL hỗ trợ HD (tối đa 1 megapixel mỗi khung hình), FHD (tối đa 2 MP), QHD/2K (tối đa 4 MP) và UHD/4K (tối đa 8 MP). Đầu ra FHD 16:9 là 1920 × 1088. Dải độ phân giải dựa trên tổng số pixel mỗi khung hình thay vì tỉ lệ khung; Chế độ Bản nháp chỉ hỗ trợ HD.
FLUX 3 có hỗ trợ ảnh-sang-video không?
Có. Ảnh-sang-video và tạo bằng khung khóa là một phần của bộ tính năng FLUX 3 Video khả dụng rộng rãi.
FLUX 3 có phải là mô hình tạo ảnh không?
Về kiến trúc, FLUX 3 được huấn luyện trên ảnh, video và âm thanh, và BFL đã trình diễn nghiên cứu tạo/chỉnh sửa ảnh. Tuy nhiên, sản phẩm FLUX 3 Image vẫn là bản phát hành sắp tới; đừng nhầm lẫn lộ trình của cả họ với FLUX 3 Video API công khai hiện tại.
FLUX 3 có mã nguồn mở không?
Hiện chưa. BFL đã công bố FLUX 3 Dev, một biến thể đa phương thức mở trọng số, nhưng chưa cung cấp ngày phát hành công khai.
FLUX 3 giá bao nhiêu?
BFL tính $0.06/s cho Bản nháp HD văn bản/ảnh-sang-video, $0.17/s cho HD, $0.29/s cho FHD, $0.40/s cho QHD và $0.80/s cho UHD. Video-to-video tốn $0.12/s cho Bản nháp HD, sau đó $0.41/s cho HD, $0.53/s cho FHD, $0.65/s cho QHD và $0.95/s cho UHD. CometAPI hiện liệt kê $0.136/s cho 720p và $0.232/s cho 1080p.
Self-Flow là gì?
Self-Flow là cách tiếp cận nghiên cứu tự giám sát theo flow-matching của BFL. Nó được thiết kế để cho phép mô hình tạo sinh phát triển các biểu diễn nội bộ hữu ích mà không phụ thuộc vào một mô hình biểu diễn bên ngoài. Việc sử dụng mức nhiễu khác nhau trên các token khuyến khích mạng suy ra thông tin thiếu và học các mối quan hệ giữa quan sát đa phương thức.
FLUX 3 có phải là mô hình thế giới không?
Black Forest Labs định vị FLUX 3 là nền tảng mô hình thực tại vì các biểu diễn chung của nó mở rộng từ dự đoán âm thanh-hình ảnh sang dự đoán hành động vật lý. Gọi nó là mô hình thế giới tổng quát hoàn chỉnh sẽ mạnh hơn so với bằng chứng hiện có; mô tả chính xác hơn là mô hình nền tảng tạo sinh đa phương thức được thiết kế rõ ràng quanh mục tiêu mô hình hóa thế giới.
Kết luận
FLUX 3 đại diện cho một thay đổi lớn với Black Forest Labs hơn là nâng cấp thông thường từ một mô hình ảnh FLUX sang mô hình khác. Ý tưởng chủ chốt là huấn luyện một biểu diễn đa phương thức chung về thế giới, rồi dùng biểu diễn đó cho video, âm thanh, ảnh và cuối cùng là hành động. Self-Flow cung cấp nền tảng nghiên cứu, trong khi FLUX 3 Video phát hành là minh chứng sản xuất đầu tiên cho chiến lược đó.
Tính đến tháng 9 năm 2026, FLUX 3 Video hỗ trợ clip tới 20 giây, 24 fps, đầu ra từ HD đến UHD/4K, âm thanh đồng bộ, hội thoại đa ngôn ngữ, ảnh-sang-video, khung khóa, tiếp tục video, tạo nhiều shot và Chế độ Bản nháp.
Bức tranh benchmark cũng đáng tin hơn so với lúc ra mắt. Đánh giá mô hình phát hành hiện tại của BFL đặt FLUX 3 đầu tiên trong bài test ELO T2V nội bộ, trong khi kiểm thử độc lập của Megaton xếp thứ ba tổng thể và nhấn mạnh tính nhất quán cảnh đặc biệt mạnh.
FLUX 3 vì vậy không tự động là mô hình video tốt nhất cho mọi khối công việc. Seedance 2.5, MiniMax H3, và Wan 3.0 có thể cung cấp thời lượng dài hơn, độ phân giải danh nghĩa cao hơn, giá thấp hơn, hoặc khả năng tham chiếu và chỉnh sửa khác biệt.
Điều khiến FLUX 3 đặc biệt thú vị là định hướng bên dưới trình tạo video: BFL đặt cược rằng các biểu diễn cần thiết để dự đoán video thuyết phục cuối cùng có thể hỗ trợ tạo ảnh, âm thanh, suy luận vật lý và hành động robot. Nhà phát triển có thể kiểm thử bước sản xuất đầu tiên qua FLUX 3 trên CometAPI với model ID flux-3.
