TL;DR: FLUX 3 คือโมเดลฐานมัลติโหมดแบบรวมศูนย์ของ Black Forest Labs API วิดีโอที่เปิดให้ใช้สาธารณะสามารถสร้างคลิปยาวสูงสุด 20 วินาทีที่ 24 fps พร้อมเสียงที่ซิงก์ได้ จากข้อความ ภาพ คีย์เฟรม หรือวิดีโอที่มีอยู่ รองรับความละเอียดตั้งแต่ HD จนถึง UHD/4K ขณะที่ FLUX 3 Image และโมเดลเปิดน้ำหนัก FLUX 3 Dev ยังอยู่ในแผนเปิดตัวแยกต่างหาก
FLUX 3 คืออะไร?
FLUX 3 คือโมเดลมัลติโหมดระดับแนวหน้าจาก Black Forest Labs แทนที่จะเทรนโมเดลภาพ วิดีโอ และเสียงแยกกัน BFL ใช้การแทนนำเสนอร่วมกันข้ามหลายโมดาลิตี้
แนวคิดแกนกลางคือ ภาพ วิดีโอ และเสียง เป็นการสังเกตที่ต่างกันของโลกพื้นฐานเดียวกัน รถที่กำลังวิ่งมีทั้งรูปลักษณ์ การเคลื่อนไหว เสียง ความสัมพันธ์เชิงพื้นที่ คุณสมบัติวัสดุ และพฤติกรรมเชิงเหตุผล การเรียนรู้สัญญาณเหล่านี้ร่วมกันให้ข้อจำกัดกับโมเดลมากกว่าการเรียนรู้จากเฟรมเดี่ยวๆ
นี่จึงเป็นเหตุผลที่ Black Forest Labs อธิบาย FLUX 3 ว่าเป็นก้าวสู่ reality model หรือ world model แทนที่จะเป็นเพียงตัวสร้างภาพหรือวิดีโอ ระบบวิดีโอที่เปิดตัวแล้วแสดงทิศทางนี้ชัดเจน: เสียงที่ซิงก์ การเคลื่อนไหว โครงสร้างฉาก บทสนทนา พฤติกรรมกล้อง และเสียงแวดล้อม จัดการได้ในเวิร์กโฟลว์การสร้างเดียว
ยังไม่ใช่ว่าความสามารถของ FLUX 3 ที่ประกาศทั้งหมดจะเปิดให้ใช้สาธารณะ ณ เดือนกันยายน 2026 FLUX 3 Video เปิดให้ใช้งานแล้ว ขณะที่ FLUX 3 Image และโมเดลเปิดน้ำหนัก FLUX 3 Dev ยังคงเป็นรายการเปิดตัวแยกต่างหาก
สเปค FLUX 3 โดยสรุป
สเปคต่อไปนี้สะท้อนเอกสารสำหรับนักพัฒนา FLUX 3 ปัจจุบัน ไม่ใช่คอนฟิกช่วงเปิดตัวเบื้องต้นในเดือนกรกฎาคม
| Specification | Official FLUX 3 documentation |
|---|---|
| Developer | Black Forest Labs |
| Model family | FLUX 3 |
| Model type | Unified multimodal foundation / generative video model |
| Public video release | August 4, 2026 |
| Core training direction | Joint image, video, and audio representation learning |
| Research foundation | Self-Flow |
| Current primary API output | Video with synchronized audio |
| Text-to-video | Supported |
| Image-to-video | Supported |
| Keyframe-to-video | Supported |
| Video continuation | Supported |
| Maximum T2V/I2V duration | 20 seconds |
| Video continuation duration | 5–15 seconds |
| Frame rate | 24 fps |
| Resolution | HD, FHD, QHD/2K, and UHD/4K |
| FHD 16:9 resolution | 1920 × 1088 |
| Image references | Up to 10 for I2V/keyframe workflows |
| Native audio | Yes |
| Multilingual dialogue | Yes |
| Lip synchronization | Yes |
| Multi-shot generation | Yes |
| Draft Mode | Yes |
| Public still-image FLUX 3 endpoint | Not yet generally released by BFL |
| Open-weight FLUX 3 Dev | Planned |
เอกสาร BFL ปัจจุบันระบุว่า T2V/I2V รองรับ 5–20 วินาที ขณะที่ video continuation รับหน้าต่างการสร้าง 5–15 วินาที อัตราส่วนภาพที่รองรับ ได้แก่ 21:9, 2:1, 16:9, 4:3, 1:1, 3:4 และ 9:16
FLUX 3 ทำงานอย่างไร?
Self-Flow
รากฐานงานวิจัยหลักคือ Self-Flow แนวทาง self-supervised flow-matching ของ Black Forest Labs ปกติแล้วสายการเทรนการสร้างมักพึ่งโมเดลแทนนำเสนอที่พรีเทรนหรือซูเปอร์วิชันเสริม Self-Flow ถูกออกแบบให้เรียนรู้ representation ที่มีประโยชน์โดยตรงจากวัตถุประสงค์การสร้าง
กลไกสำคัญคือ Dual-Timestep Scheduling กลุ่มโทเคนต่างๆ สามารถถูกกำหนดระดับสัญญาณรบกวนต่างกันระหว่างการเทรน สิ่งนี้สร้างความไม่สมมาตรของข้อมูล: บางส่วนของอินพุตมีข้อมูลที่ใช้ได้มากกว่าส่วนอื่น บีบให้เครือข่ายสร้าง representation ที่ช่วยคาดเดาสิ่งที่ขาดหาย
ในทางปฏิบัติ FLUX 3 ถูกกระตุ้นให้เรียนรู้ความสัมพันธ์ระหว่างวัตถุ เฟรม การเคลื่อนไหว เสียง และเหตุการณ์ตามเวลา แทนที่จะจดจำเพียงหน้าตาของเฟรมเดี่ยวๆ

สถาปัตยกรรมวิธี Self-Flow - แหล่งภาพอย่างเป็นทางการ: โครงการ Self-Flow ของ Black Forest Labs
BFL ยังทดสอบการเทรนมัลติโหมดร่วมกัน โดยใช้แบ็กโบนที่สืบจาก FLUX.2 กับวิดีโอหลักล้านและภาพหลักร้อยล้าน การทดลองสนับสนุนสมมติฐานกว้างของ FLUX 3 ว่าการเรียนรู้ representation และการสร้างไม่จำเป็นต้องเป็นระบบแยกกัน
เหตุใดวิดีโอจึงเป็นศูนย์กลางของ FLUX 3
วิดีโอมีคุณค่าพิเศษสำหรับการสร้างแบบจำลองโลก เพราะมีข้อมูลที่ภาพนิ่งให้ไม่ได้ เฟรมเดี่ยวอาจแสดงลูกบอลอยู่เหนือพื้น แต่วิดีโอเผยได้ว่าลูกบอลกำลังตก เด้ง บิดตัวเมื่อกระแทก ส่งเสียง และเปลี่ยนทิศหลังจากนั้น
BFL เปิดเผยว่าการทำนายวิดีโอคิดเป็น มากกว่า 95% ของคอมพิวต์การเทรนของ FLUX 3 เสียงมีต้นทุนเทียบกันต่ำกว่าเพราะเป็นสัญญาณมิติต่ำกว่ามากและผูกแนบกับเหตุการณ์ที่มองเห็นได้ การจัดสรรเช่นนี้ช่วยอธิบายว่าทำไมความสามารถด้านวิดีโอจึงเป็นส่วนแรกของ FLUX 3 ที่เปิดใช้ทั่วไป
FLUX 3 ทำอะไรได้บ้าง?
Text-to-Video
ผู้ใช้สามารถสร้างวิดีโอสมบูรณ์จากคำสั่งภาษาธรรมชาติ BFL ระบุว่าโมเดลที่ปล่อยแล้วจัดการพรอมป์ตทั้งง่ายและซับซ้อนได้ พร้อมประสานการเคลื่อนไหว ตรรกะฉาก องค์ประกอบภาพ และเสียง มีประโยชน์มากกับพรอมป์ตที่มีเหตุการณ์ต่อเนื่องหลายช่วง มากกว่าการขอให้แอนิเมตวัตถุเดี่ยว
Image-to-Video และคีย์เฟรม
FLUX 3 สามารถทำให้ภาพเริ่มต้นเคลื่อนไหว มุ่งสู่อินด์เฟรม หรือใช้หลายภาพเป็นคีย์เฟรมแบบจับเวลา ปัจจุบัน API รองรับ ภาพอ้างอิงได้สูงสุดสิบภาพ ในเวิร์กโฟลว์ image-to-video ช่วยให้ผู้สร้างควบคุมการเปลี่ยนแปลงฉากตามเวลา แทนที่จะปล่อยให้โมเดลด้นทั้งลำดับ
Video Continuation
สามารถส่งวิดีโอและเสียงที่มีอยู่เป็นบริบทแล้วให้ FLUX 3 สร้างสิ่งที่จะเกิดต่อไป BFL อธิบายว่า continuation รักษาการเคลื่อนไหว พฤติกรรมกล้อง บทสนทนา และเสียงข้ามจุดเชื่อมต่อ ซึ่งต่างอย่างมีนัยสำคัญจากการสร้างคลิปที่สองแบบอิสระแล้วนำไฟล์มาชนกันภายหลัง
เสียงและบทสนทนาแบบเนทีฟ
FLUX 3 สร้างเสียงพร้อมกับการสร้างภาพ แทนที่จะต้องทำสเต็ปสังเคราะห์เสียงแยก ความสามารถเสียงที่ปล่อยแล้วรวมถึง บทสนทนา เอฟเฟกต์เสียง และเสียงบรรยากาศ รองรับบทสนทนาหลายภาษาและการซิงก์ริมฝีปาก
หลายช็อตในครั้งเดียว
พรอมป์ตเดียวสามารถประกอบด้วย หลายฉากหรือหลายมุมกล้อง เรื่องนี้สำคัญเพราะโมเดลวิดีโอรุ่นก่อนๆ มักเด่นเมื่อขอช็อตสั้นต่อเนื่องภาพเดียว FLUX 3 ถูกออกแบบให้รองรับลำดับหลายช็อตในหนึ่งการสร้างโดยเจตนา
Draft Mode
Draft Mode เป็นหนึ่งในฟีเจอร์ที่ใช้งานได้จริงสำหรับการสร้างวิดีโอปริมาณมาก แทนที่จะจ่ายราคาเต็มทุกครั้งที่ลองพรอมป์ต นักพัฒนาสามารถสร้างพรีวิวที่เร็วกว่า ต้นทุนต่ำกว่า แล้วอัปเกรดดราฟต์ที่เลือกโดยคงองค์ประกอบและการเคลื่อนไหวเดิมไว้ ตาม ราคา BFL ปัจจุบัน ดราฟต์ T2V/I2V มาตรฐานมีค่าใช้จ่าย $0.06 ต่อวินาที เทียบกับ $0.17 ต่อวินาทีสำหรับการสร้าง HD ปกติ
อะไรที่ยังไม่เปิดให้ใช้?
ประกาศเปิดตัว FLUX 3 อธิบายความสามารถด้านภาพ วิดีโอ เสียง และแอ็กชันภายใต้ทิศทางสถาปัตยกรรมเดียว แต่การเปิดใช้งานถูกไล่ลำดับ
| Capability | Current BFL roadmap and availability |
|---|---|
| FLUX 3 Video generation | Generally available |
| Native video audio | Generally available |
| Text-to-video | Generally available |
| Image-to-video / keyframes | Generally available |
| Video continuation | Generally available |
| Richer image/video/audio reference combinations | Planned expansion |
| FLUX 3 Image generation and editing | Upcoming |
| FLUX 3 Dev open weights | Planned |
| Action-prediction deployment | Research / commercial partner track |
ความแตกต่างนี้สำคัญเป็นพิเศษสำหรับผู้ใช้ที่คุ้นเคยกับ FLUX.2 Max FLUX.2 ยังคงเป็นตัวเลือกเฉพาะสำหรับการสร้างภาพนิ่ง ขณะที่ผลิตภัณฑ์ FLUX 3 สาธารณะเน้นวิดีโอและเสียง
ประสิทธิภาพบนเบนช์มาร์กของ FLUX 3
ตอนนี้มีหลักฐานเบนช์มาร์กสองแบบที่มีประโยชน์: การประเมินภายในของ BFL หลังเปิดตัว และการประเมินอิสระจากบุคคลที่สาม แบบแรกแสดงความชอบของมนุษย์ตามโปรโตคอลของ BFL ส่วนแบบที่สองตรวจว่าจุดแข็งเหล่านั้นยังคงเห็นได้ภายใต้เบนช์มาร์กที่ออกแบบแยกต่างหาก
การประเมิน ELO หลังปล่อยของ BFL
ประกาศเดือนกรกฎาคมมีอัตราชนะเบื้องต้น เบนช์มาร์กที่เกี่ยวข้องกว่าสำหรับผู้ใช้ปัจจุบันคือการประเมินวันที่ 4 สิงหาคมของ โมเดลที่ปล่อยแล้ว Black Forest Labs รายงานคะแนน ELO ของ text-to-video เท่ากับ 1135 ในการประเมินแบบจับคู่ทั้งหมดภายใน

การประเมิน ELO ของโมเดลที่ปล่อยแล้วของ FLUX 3 - แหล่งภาพอย่างเป็นทางการ: Black Forest Labs
| Metric | BFL released-model evaluation |
|---|---|
| Text-to-video ELO | 1135 |
| T2V position | คะแนนสูงสุดในกลุ่มที่ BFL ทดสอบ |
| Image-to-video result | เทียบเท่าคู่แข่งที่แข็งแกร่งสุด และชนะโมเดลที่ถูกประเมินอื่นๆ |
| Evaluation type | การประเมินความชอบของมนุษย์ภายใน |
| Model stage | การปล่อย FLUX 3 Video ที่ใช้งานทั่วไป |
นี่ให้หลักฐานที่แข็งแรงกว่าเบนช์มาร์กตอนเปิดตัว เพราะประเมินโมเดลเดือนสิงหาคมที่ปล่อยแล้ว อย่างไรก็ดี ยังเป็นเบนช์ม์มาร์กที่ผู้ขายจัดทำ ไม่ควรตีความว่า FLUX 3 จะเหนือกว่าคู่แข่งทุกตัวในทุกหมวดพรอมป์ต
เบนช์มาร์กอิสระของ FLUX 3
v-benchmark v2 ของ Megaton ให้การตรวจสอบอิสระ FLUX 3 ถูกประเมินในเดือนสิงหาคม 2026 และปัจจุบันได้ดัชนี Megaton 76.51/100 จัดอยู่อันดับที่ 3 ในชุดที่เผยแพร่ ณ เวลาประเมิน
| Benchmark dimension | Megaton FLUX 3 evaluation |
|---|---|
| Megaton Index | 76.51 |
| Prompt Adherence | 87.07 |
| Scene Consistency | 94.76 |
| Physics | 70.63 |
| Human Fidelity | 73.70 |
| Object & Product Fidelity | 83.82 |
| Causal & Semantic Coherence | 80.91 |
| Text Fidelity | 82.41 |
| Cinematography | 71.43 |
| Taste & Art Direction | 65.00 |
โปรไฟล์ให้ข้อมูลมากกว่าคะแนนรวม Scene Consistency ที่ 94.76 เป็นหมวดหลักที่แข็งแกร่งสุด ขณะที่การยึดตามพรอมป์ต ความซื่อสัตย์ของวัตถุ ความสอดคล้องเชิงเหตุและความหมาย และความซื่อสัตย์ของข้อความ ก็เกิน 80 ฟิสิกส์ ความสมจริงของมนุษย์ และรสนิยมและศิลปะอ่อนกว่า แสดงว่าการแทนเวลาที่แข็งแกร่งขึ้นยังไม่ลบการเคลื่อนไหวสังเคราะห์หรือความแปรปรวนด้านคุณภาพเชิงศิลป์
นี่ยังอธิบายว่าทำไมข้อสรุปบนเบนช์มาร์กจึงต่างกันได้: การทดสอบความชอบภายในของ BFL จัด FLUX 3 ไว้สูงสุดในชุดเปรียบเทียบของตน ขณะที่ลีดเดอร์บอร์ดอิสระของ Megaton จัดไว้เป็นอันดับสาม พรอมป์ต มิติการให้คะแนน กลุ่มผู้ประเมิน และวิธีรวมคะแนนที่ต่างกัน ทำให้ได้อันดับต่างกัน
FLUX 3 เทียบกับ Seedance 2.5, MiniMax H3, Wan 3.0
ตลาดวิดีโอ AI ขยับเร็วในปี 2026 FLUX 3 ตอนนี้แข่งขันกับระบบมัลติโหมดที่รวมการสร้างคลิปยาว เสียงที่ซิงก์ อ้างอิง และการแก้ไขมากขึ้น
| Dimension | FLUX 3 | Seedance 2.5 | MiniMax H3 | Wan 3.0 |
|---|---|---|---|---|
| Developer | Black Forest Labs | ByteDance Seed | MiniMax | Alibaba |
| Maximum advertised clip | 20 s | 30 s | 15 s | 30 s |
| Video resolution | HD / FHD / QHD (2K) / UHD (4K) | ขึ้นกับระดับ API | สูงสุด 2K | สูงสุด 1080p |
| Native audio | Yes | Yes | Yes, stereo | Yes |
| Text-to-video | Yes | Yes | Yes | Yes |
| Image/reference input | Yes | Yes | Yes | Yes |
| Keyframe/reference control | ควบคุมคีย์เฟรมแบบจับเวลาได้แข็งแกร่ง | ควบคุมอ้างอิงมัลติโหมดได้แข็งแกร่ง | เงื่อนไขมัลติโหมด | เวิร์กโฟลว์อ้างอิงมัลติโหมด |
| Video continuation/editing | มี continuation | เวิร์กโฟลว์เน้นการแก้ไข | โฟกัสการสร้างแบบออมนิ | เวิร์กโฟลว์แก้ไขและอ้างอิง |
| Multi-shot generation | Yes | Yes | Yes | Yes |
| Distinctive strength | สถาปัตยกรรม reality-model ความคงเส้นคงวาของฉาก Self-Flow | การเล่าเรื่องแบบยาวและควบคุมอ้างอิงแข็งแรง | การสร้างภาพและเสียง 2K และบริบทออมนิโหมด | คลิปยาวและราคาเริ่มต่ำกว่า |
| CometAPI starting/unit price* | $0.136/s | $0.0824/s listed | $0.064/s | $0.040/s |
* เปรียบเทียบราคาโดยคร่าวเท่านั้น. API วิดีโอใช้ความละเอียด ระยะเวลา ระดับคุณภาพ และกฎคิดเงินต่างกัน ตัวเลขราคาต่อวินาทีที่ถูกกว่าไม่ได้หมายความว่าผลลัพธ์คุณภาพเทียบเท่าถูกกว่าด้วย
FLUX 3 vs Seedance 2.5
Seedance 2.5 ได้เปรียบเรื่องระยะเวลา สร้างได้สูงสุด 30 วินาที เทียบกับ 20 วินาทีของ FLUX 3 อีกทั้งเน้นการสร้างแบบขับเคลื่อนด้วยอ้างอิง การแก้ไข และการเล่าเรื่องยาว FLUX 3 แตกต่างด้วยสถาปัตยกรรม world-model ร่วม การคงเส้นคงวาของฉาก การสร้างภาพและเสียงแบบเนทีฟ คีย์เฟรมแบบจับเวลา และโร้ดแม็ปภาพ/แอ็กชันที่กว้างกว่า
การทดสอบอิสระตอกย้ำว่านี่คือการแข่งขันระดับไฮเอนด์จริง: Megaton ปัจจุบัน จัด Seedance 2.5 ไว้เหนือ FLUX 3 โดยรวม
FLUX 3 vs MiniMax H3
MiniMax H3 ให้เอาต์พุตสูงสุด 2K และเสียงสเตอริโอเนทีฟ ช่วยให้มีสเปกด้านภาพและเสียงที่แข็งแรงสำหรับคอนเทนต์ FLUX 3 รองรับหน้าต่างการสร้างที่ยาวกว่า—20 วินาที เทียบกับ 15 วินาทีของ H3—และ Draft Mode มอบเวิร์กโฟลว์การทำซ้ำที่ควบคุมต้นทุน
FLUX 3 vs Wan 3.0
Wan 3.0 เน้นอินพุตมัลติโหมดกว้าง การสร้างภาพและเสียง การแก้ไข และคลิปยาวถึง 30 วินาที อีกทั้งราคาถูกกว่าตามราคาเริ่มของ CometAPI FLUX 3 แพงกว่า แต่แตกต่างด้วยการวางตำแหน่งแบบ reality-model ความคงเส้นคงวาของฉาก รากฐานวิจัย Self-Flow Draft Mode และการบูรณาการกับการทำนายแอ็กชัน
ราคา FLUX 3
Black Forest Labs คิดค่าบริการ FLUX 3 ตามระยะเวลาวิดีโอที่สร้าง
| Mode | Official BFL FLUX 3 pricing |
|---|---|
| T2V / I2V Draft HD | $0.06/s |
| T2V / I2V HD | $0.17/s |
| T2V / I2V FHD | $0.29/s |
| T2V / I2V QHD (2K) | $0.40/s |
| T2V / I2V UHD (4K) | $0.80/s |
| Video continuation Draft | $0.12/s |
| Video continuation HD | $0.41/s |
| Video continuation FHD | $0.53/s |
| Video continuation QHD (2K) | $0.65/s |
| Video continuation UHD (4K) | $0.95/s |
การสร้าง HD มาตรฐาน 10 วินาทีจึงมีค่าใช้จ่ายประมาณ $1.70 ตามอัตราที่ระบุของ BFL ขณะที่ FHD 10 วินาทีอยู่ประมาณ $2.90 Video continuation มีราคาแพงกว่าการสร้าง T2V/I2V ปกติมาก ดังนั้นแอปพลิเคชันที่ขยายคลิปบ่อยควรคำนวณต้นทุนส่วนนั้นแยกต่างหาก
ราคา FLUX 3 บน CometAPI
CometAPI ปัจจุบัน ระบุว่า FLUX 3 พร้อมใช้งาน ด้วยรหัสโมเดล flux-3
| Resolution | CometAPI FLUX 3 pricing |
|---|---|
| 720p | $0.136/s |
| 1080p | $0.232/s |
สำหรับการสร้าง 10 วินาที เทียบได้กับประมาณ $1.36 ที่ 720p หรือ $2.32 ที่ 1080p เมื่อเทียบกับอัตรา $0.17/s และ $0.29/s ของ BFL ราคาเริ่มต้นบน CometAPI สำหรับสองระดับนี้ต่ำกว่าประมาณ 20%
หมายเหตุความพร้อมใช้งาน: ข้อความบรรยายบางส่วนบน CometAPI ยังสะท้อนช่วง Early Access เดือนกรกฎาคม การ์ดโมเดลสดปัจจุบัน* ส่วนราคา และตัวอย่าง API ระบุว่า flux-3 พร้อมใช้งาน โดย CometAPI เปิดเมื่อ 13 สิงหาคม 2026 สำหรับการตัดสินใจอินทิเกรต ให้ยึด API และฟิลด์ราคาสดมากกว่าข้อความบรรยายเก่า*
เหตุใด FLUX 3 จึงสำคัญเกินกว่าวิดีโอ AI
ส่วนที่แปลกใหม่ของ FLUX 3 ไม่ใช่แค่การสร้างวิดีโอ 20 วินาที หลายคู่แข่งสร้างคลิปยาวเท่ากันหรือยาวกว่าได้อยู่แล้ว เดิมพันทางเทคนิคที่ใหญ่กว่าคือ representation วิดีโอที่แข็งแรงสามารถเป็นพื้นฐานสำหรับความฉลาดรูปแบบอื่น
จากการทำนายวิดีโอสู่การทำนายแอ็กชัน
สัญญาณควบคุมหุ่นยนต์คือการทำนายตามเวลาโดยมีภาพเป็นเงื่อนไข ดังนั้น BFL ใช้ representation วิดีโอของ FLUX 3 เป็นพื้นฐานสำหรับการทำนายแอ็กชัน ความร่วมมือกับ mimic robotics สร้าง FLUX-mimic โดยตัวถอดรหัสแอ็กชันอ่าน representation จากโมเดลวิดีโอ แทนการเทรนสแต็กการรับรู้แยก
BFL รายงานว่าแบ็กโบนของ FLUX-mimic ทำงานได้ ต่ำกว่า 80 ms บน RTX 5090 เดียว ขณะที่ระบบหุ่นยนต์สมบูรณ์มีลูปตอบสนองประมาณ 101 ms บริษัทได้พูดถึงการประเมินในอุตสาหกรรมกับ Audi ด้วย
สิ่งนี้ไม่ได้ทำให้ FLUX 3 Video API สำหรับสาธารณะกลายเป็น API หุ่นยนต์ แต่มันแสดงให้เห็นว่าทำไม BFL จึงลงทุนหนักใน representation วิดีโอมัลติโหมด แทนการมองว่าการสร้างวิดีโอคือภาระงานสื่อแยกเดี่ยว
จุดแข็งหลักของ FLUX 3 คืออะไร?
- ความคงเส้นคงวาตามเวลาและฉาก คะแนน Scene Consistency 94.76 ของ Megaton เป็นหมวดหลักที่แข็งแรงที่สุดของโมเดล
- การสร้างภาพและเสียงแบบเนทีฟ บทสนทนา เอฟเฟกต์ บรรยากาศ และภาพ สร้างร่วมกันได้ แทนการต่อจากโมเดลแยก
- การยึดตามพรอมป์ตที่แข็งแรง ผลลัพธ์ Prompt Adherence 87.07 จากอิสระบ่งชี้ว่าโมเดลเด่นเกินความสละสลวยทางภาพ
- การควบคุมคีย์เฟรม ใช้ภาพได้สูงสุดสิบภาพในเวิร์กโฟลว์ I2V ปัจจุบัน ให้การควบคุมตามเวลาอย่างชัดเจน
- เวิร์กโฟลว์จากดราฟต์สู่ไฟนอล Draft Mode แก้ปัญหาต้นทุนจริงในวิดีโอ AI: การลองพรอมป์ตจำนวนมากถูกทิ้ง
- พิสัยภาพกว้าง BFL วางตำแหน่ง FLUX 3 ว่าทำได้ทั้งดิบ ธรรมชาติ ภาพยนตร์ โนสตาลเจีย เล่นสนุก สไตลাইজ และแปลกใหม่ ไม่ได้หมกอยู่กับสไตล์เดียว
- ทิศทางวิจัยแบบ world-model Self-Flow และการทำนายแอ็กชันทำให้ FLUX 3 มีความเกี่ยวข้องเหนือการสร้างมีเดีย
ข้อจำกัดของ FLUX 3 คืออะไร?
- โร้ดแม็ปมัลติโหมดเต็มยังไม่ส่งมอบ FLUX 3 Image แบบสาธารณะและน้ำหนักเปิด FLUX 3 Dev ไม่ควรสรุปจากการประกาศระดับตระกูล
- 20 วินาทีไม่ใช่ระยะเวลานำอุตสาหกรรมอีกต่อไป บางคู่แข่งปี 2026 รองรับ 30 วินาทีแล้ว
- ฟิสิกส์ยังไม่ถูกแก้ คะแนน Physics 70.63 ยังค่อนข้างต่ำเมื่อเทียบกับความคงเส้นคงวาฉาก
- ความสมจริงของมนุษย์ยังมีช่องให้พัฒนา คะแนนอิสระ 73.70 หมายความว่ากายวิภาคยากและการเคลื่อนไหวมนุษย์สมจริงยังผิดพลาดได้
- Video continuation ราคาแพง ราคาต่อวินาทีของ BFL สำหรับ continuation สูงกว่าการสร้าง T2V/I2V ปกติมาก
- เบนช์มาร์กชูโรงของ BFL เป็นภายใน การตัดสินใจใช้งานจริงควรรวมการทดสอบอิสระด้วยพรอมป์ต ชนิดช็อต ภาษา และแอสเซ็ตอ้างอิงของแอปตนเอง
วิธีใช้ FLUX 3 กับ CometAPI
บทความ ก่อนหน้าเกี่ยวกับ FLUX 3 ของ CometAPI อธิบายช่วง Early Access เดือนกรกฎาคม เบนช์มาร์กเบื้องต้น และแผนเปิดตัว ส่วนนี้โฟกัสการอินทิเกรตระดับโปรดักชัน ราคา และโฟลว์ API ปัจจุบันเพื่อไม่ต้องย้ำย้อน โมเดลโปรดักชัน FLUX 3 ใช้รหัสโมเดล flux-3
คำขอ 720p ขั้นพื้นฐานใช้ endpoint /v1/videos:
Bash
curl --request POST "https://api.cometapi.com/v1/videos" \--header "Authorization: Bearer $COMETAPI_KEY" \ --form-string "model=flux-3" \ --form-string "prompt=A paper boat glides across a still pond in soft morning light" \ --form-string "seconds=5" \ --form-string "size=1280x720" |
|---|
เวิร์กโฟลว์วิดีโอเป็นแบบ asynchronous หลังคำขอเริ่มต้นส่งกลับ task ID แอปจะตรวจสอบงานจนการสร้างเสร็จ แล้วดึงวิดีโอผลลัพธ์ สำหรับโปรดักชัน ควรให้การสร้างรันโดยงานเบื้องหลังหรือคิวงาน แทนการเปิดคำขอ HTTP ค้างตลอดเวลาประมวลผล
ใครควรใช้ FLUX 3?
FLUX 3 น่าสนใจเป็นพิเศษสำหรับแอปที่ต้องการมากกว่าคลิปสวยๆ 5 วินาที: ระบบโฆษณาที่ซิงก์ภาพและเสียง การผลิตช็อตสั้นอัตโนมัติ เดโมสินค้าเมื่อความคงอยู่ของวัตถุสำคัญ การสร้างบทสนทนาหลายภาษา เวิร์กโฟลว์จากสตอรีบอร์ดสู่วิดีโอ แอนิเมชันควบคุมด้วยคีย์เฟรม คอนเทนต์การศึกษา และการทดลองกับไปป์ไลน์มัลติโหมดที่ยาวขึ้น
อาจไม่น่าดึงดูดเมื่อข้อกำหนดเดียวคือราคาต่อวินาทีต่ำสุด เมื่อจำเป็นต้องสร้างเกิน 20 วินาทีในครั้งเดียว หรือเมื่อการสร้างภาพนิ่งเป็นภารกิจหลัก สำหรับภาพนิ่ง โมเดลภาพ FLUX ที่มีอยู่ เช่น FLUX.2 Max อาจเหมาะกว่าในตอนนี้
FLUX 3 ดีกว่าโมเดลวิดีโอ AI อื่นหรือไม่?
ไม่มีคำตอบเดียวที่ปกป้องได้สำหรับทุกเคสใช้งาน การประเมินภายในของ BFL จัด FLUX 3 ที่ปล่อยแล้วไว้สูงสุดใน T2V ของตน ขณะที่การประเมินอิสระของ Megaton จัด FLUX 3 ไว้อันดับสามรองจากคู่แข่งที่ใหม่กว่า ทั้งสองผลลัพธ์อาจถูกต้องพร้อมกัน เพราะทดสอบด้วยการแจกแจงพรอมป์ตและมิติคุณภาพต่างกัน
FLUX 3 ดูจะเด่นเป็นพิเศษเมื่อความคงเส้นคงวาของฉาก การทำตามพรอมป์ต ความซื่อสัตย์ของวัตถุ ความสอดคล้องเชิงเหตุและความหมาย การเรนเดอร์ข้อความ เสียงที่ซิงก์ และคีย์เฟรมที่ควบคุมได้ สำคัญ โมเดลอื่นอาจชนะที่ระยะเวลาสูงสุด ความละเอียด ความชอบเชิงศิลป์ ความสมจริงของมนุษย์ เวิร์กโฟลว์แก้ไข หรือราคา สำหรับนักพัฒนา การเปรียบเทียบที่ถูกต้องคือเฉพาะงาน มากกว่าดูแต่ลีดเดอร์บอร์ด
คำถามที่พบบ่อย
FLUX 3 พร้อมให้ใช้งานแล้วหรือไม่?
พร้อมแล้ว FLUX 3 Video เปิดใช้งานทั่วไปผ่าน BFL เมื่อ 4 สิงหาคม 2026 CometAPI ก็ระบุว่า FLUX 3 พร้อมใช้งาน ภายใต้รหัสโมเดล flux-3 ส่วนการปล่อยภาพนิ่งของ FLUX 3 และน้ำหนักเปิด FLUX 3 Dev ยังเป็นแผนแยก
FLUX 3 สร้างเสียงได้หรือไม่?
ได้ FLUX 3 Video สร้างเสียงเนทีฟที่ซิงก์ รวมถึงบทสนทนา เสียงบรรยากาศ และเอฟเฟกต์ รองรับบทสนทนาหลายภาษาและการซิงก์ริมฝีปาก
วิดีโอของ FLUX 3 ยาวได้แค่ไหน?
การสร้างจากข้อความและภาพปัจจุบันรองรับ 5–20 วินาที Video continuation รองรับคอนเทนต์ที่สร้างใหม่ 5–15 วินาที
FLUX 3 รองรับความละเอียดอะไร?
BFL รองรับ HD (สูงสุด 1 เมกะพิกเซลต่อเฟรม) FHD (สูงสุด 2 MP) QHD/2K (สูงสุด 4 MP) และ UHD/4K (สูงสุด 8 MP) เอาต์พุต FHD สัดส่วน 16:9 คือ 1920 × 1088 กลุ่มความละเอียดอิงจำนวนพิกเซลต่อเฟรม ไม่ขึ้นกับอัตราส่วนภาพ; Draft Mode มีเฉพาะ HD
FLUX 3 รองรับ image-to-video หรือไม่?
รองรับ การสร้างจากภาพและคีย์เฟรม เป็นส่วนหนึ่งของฟีเจอร์ FLUX 3 Video ที่เปิดใช้งานทั่วไป
FLUX 3 เป็นโมเดลสร้างภาพหรือไม่?
ในเชิงสถาปัตยกรรม FLUX 3 ถูกเทรนคร่อมภาพ วิดีโอ และเสียง และ BFL แสดงงานวิจัยการสร้างและแก้ไขภาพ อย่างไรก็ดี ผลิตภัณฑ์ FLUX 3 Image ยังเป็นการปล่อยที่กำลังจะมาถึง อย่าสับสนโร้ดแม็ประดับตระกูลกับ FLUX 3 Video API ที่เปิดสาธารณะในตอนนี้
FLUX 3 เป็นโอเพนซอร์สหรือไม่?
ยังไม่ใช่ BFL ประกาศ FLUX 3 Dev เวอร์ชันมัลติโหมดแบบน้ำหนักเปิด แต่ยังไม่กำหนดวันปล่อยสาธารณะ
FLUX 3 ราคาเท่าไร?
BFL คิดราคา T2V/I2V ที่ $0.06/s สำหรับ Draft HD, $0.17/s สำหรับ HD, $0.29/s สำหรับ FHD, $0.40/s สำหรับ QHD และ $0.80/s สำหรับ UHD วิดีโอสู่วิดีโอคิด $0.12/s สำหรับ Draft HD, จากนั้น $0.41/s สำหรับ HD, $0.53/s สำหรับ FHD, $0.65/s สำหรับ QHD และ $0.95/s สำหรับ UHD ขณะที่ CometAPI ปัจจุบันระบุ $0.136/s สำหรับ 720p และ $0.232/s สำหรับ 1080p
Self-Flow คืออะไร?
Self-Flow คือแนวทาง self-supervised flow-matching ของ BFL ออกแบบมาให้โมเดล generative พัฒนา representation ภายในที่มีประโยชน์โดยไม่ต้องพึ่งโมเดล representation ภายนอก การใช้ระดับสัญญาณรบกวนต่างกันข้ามโทเคนกระตุ้นให้เครือข่ายคาดเดาข้อมูลที่หายไปและเรียนรู้ความสัมพันธ์ระหว่างการสังเกตแบบมัลติโหมด
FLUX 3 คือ world model หรือไม่?
Black Forest Labs วางตำแหน่ง FLUX 3 ว่าเป็นฐาน reality-model เพราะ representation ร่วมขยายจากการทำนายภาพและเสียงไปสู่การทำนายแอ็กชันทางกายภาพ การเรียกมันว่า world model อเนกประสงค์ที่สมบูรณ์จะเกินกว่าหลักฐานปัจจุบัน คำอธิบายที่แม่นยำกว่าคือโมเดลฐาน generative มัลติโหมดที่ออกแบบอย่างชัดเจนรอบวัตถุประสงค์การสร้างแบบจำลองโลก
บทสรุป
FLUX 3 เป็นการเปลี่ยนแปลงที่ใหญ่กว่าสำหรับ Black Forest Labs มากกว่าการอัปเกรดโมเดลภาพ FLUX รุ่นต่อรุ่น ไอเดียหลักคือการเทรน representation มัลติโหมดร่วมของโลก แล้วใช้ representation นั้นกับวิดีโอ เสียง ภาพ และท้ายที่สุดคือแอ็กชัน Self-Flow ให้รากฐานงานวิจัย ขณะที่ FLUX 3 Video ที่ปล่อยแล้วเป็นการสาธิตขั้นโปรดักชันแรกของกลยุทธ์นี้
ณ กันยายน 2026 FLUX 3 Video รองรับคลิปยาวสูงสุด 20 วินาที 24 fps เอาต์พุตตั้งแต่ HD ถึง UHD/4K เสียงที่ซิงก์ บทสนทนาหลายภาษา image-to-video คีย์เฟรม video continuation การสร้างหลายช็อต และ Draft Mode
ภาพรวมเบนช์มาร์กตอนนี้น่าเชื่อถือกว่าตอนเปิดตัว การประเมินโมเดลที่ปล่อยของ BFL จัด FLUX 3 ไว้อันดับหนึ่งใน T2V ภายในของตน ขณะที่การทดสอบอิสระของ Megaton จัดอยู่อันดับสามโดยชี้ว่าความคงเส้นคงวาฉากแข็งแกร่งเป็นพิเศษ
ดังนั้น FLUX 3 ไม่ใช่ตัวเลือกที่ดีที่สุดโดยอัตโนมัติสำหรับทุกภาระงาน Seedance 2.5, MiniMax H3, และ Wan 3.0 อาจให้การสร้างที่ยาวกว่า ความละเอียดสูงกว่า ราคาเริ่มต่ำกว่า หรือความสามารถอ้างอิงและแก้ไขที่ต่างกัน
สิ่งที่ทำให้ FLUX 3 น่าสนใจเป็นพิเศษคือทิศทางใต้เครื่องสร้างวิดีโอ: BFL กำลังเดิมพันว่า representation แบบเดียวกันที่จำเป็นต่อการทำนายวิดีโอที่น่าเชื่อถือ จะรองรับการสร้างภาพ เสียง การให้เหตุผลทางกายภาพ และการกระทำของหุ่นยนต์ได้ในที่สุด นักพัฒนาสามารถทดสอบก้าวแรกระดับโปรดักชันได้แล้วผ่าน FLUX 3 บน CometAPI โดยใช้รหัสโมเดล flux-3
