GPT-6.1 Sol are now live on CometAPI →
ai-model/งานวิจัย CometAPI

FLUX 3 คืออะไร? สเปก, เบนช์มาร์ก, คุณสมบัติ, ราคา และการเข้าถึง API

สำรวจโมเดล AI แบบมัลติโมดัลของ Black Forest Labs ซึ่งรวมถึงสเปกของ FLUX 3, เบนช์มาร์ก, คุณสมบัติ, ราคา, สถาปัตยกรรม Self-Flow, คู่แข่ง และการเข้าถึง API.

CometAPI
Deon Goodwinทีมวิจัยโมเดล AI และ API
อัปเดตแล้ว Oct 3, 2026 10 นาทีในการอ่าน
FLUX 3 คืออะไร? สเปก, เบนช์มาร์ก, คุณสมบัติ, ราคา และการเข้าถึง API
ใช้รูปแบบนี้

เรียกใช้ API ครั้งแรก

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR: FLUX 3 คือโมเดลฐานมัลติโหมดแบบรวมศูนย์ของ Black Forest Labs API วิดีโอที่เปิดให้ใช้สาธารณะสามารถสร้างคลิปยาวสูงสุด 20 วินาทีที่ 24 fps พร้อมเสียงที่ซิงก์ได้ จากข้อความ ภาพ คีย์เฟรม หรือวิดีโอที่มีอยู่ รองรับความละเอียดตั้งแต่ HD จนถึง UHD/4K ขณะที่ FLUX 3 Image และโมเดลเปิดน้ำหนัก FLUX 3 Dev ยังอยู่ในแผนเปิดตัวแยกต่างหาก

FLUX 3 คืออะไร?

FLUX 3 คือโมเดลมัลติโหมดระดับแนวหน้าจาก Black Forest Labs แทนที่จะเทรนโมเดลภาพ วิดีโอ และเสียงแยกกัน BFL ใช้การแทนนำเสนอร่วมกันข้ามหลายโมดาลิตี้

แนวคิดแกนกลางคือ ภาพ วิดีโอ และเสียง เป็นการสังเกตที่ต่างกันของโลกพื้นฐานเดียวกัน รถที่กำลังวิ่งมีทั้งรูปลักษณ์ การเคลื่อนไหว เสียง ความสัมพันธ์เชิงพื้นที่ คุณสมบัติวัสดุ และพฤติกรรมเชิงเหตุผล การเรียนรู้สัญญาณเหล่านี้ร่วมกันให้ข้อจำกัดกับโมเดลมากกว่าการเรียนรู้จากเฟรมเดี่ยวๆ

นี่จึงเป็นเหตุผลที่ Black Forest Labs อธิบาย FLUX 3 ว่าเป็นก้าวสู่ reality model หรือ world model แทนที่จะเป็นเพียงตัวสร้างภาพหรือวิดีโอ ระบบวิดีโอที่เปิดตัวแล้วแสดงทิศทางนี้ชัดเจน: เสียงที่ซิงก์ การเคลื่อนไหว โครงสร้างฉาก บทสนทนา พฤติกรรมกล้อง และเสียงแวดล้อม จัดการได้ในเวิร์กโฟลว์การสร้างเดียว

ยังไม่ใช่ว่าความสามารถของ FLUX 3 ที่ประกาศทั้งหมดจะเปิดให้ใช้สาธารณะ ณ เดือนกันยายน 2026 FLUX 3 Video เปิดให้ใช้งานแล้ว ขณะที่ FLUX 3 Image และโมเดลเปิดน้ำหนัก FLUX 3 Dev ยังคงเป็นรายการเปิดตัวแยกต่างหาก

สเปค FLUX 3 โดยสรุป

สเปคต่อไปนี้สะท้อนเอกสารสำหรับนักพัฒนา FLUX 3 ปัจจุบัน ไม่ใช่คอนฟิกช่วงเปิดตัวเบื้องต้นในเดือนกรกฎาคม

SpecificationOfficial FLUX 3 documentation
DeveloperBlack Forest Labs
Model familyFLUX 3
Model typeUnified multimodal foundation / generative video model
Public video releaseAugust 4, 2026
Core training directionJoint image, video, and audio representation learning
Research foundationSelf-Flow
Current primary API outputVideo with synchronized audio
Text-to-videoSupported
Image-to-videoSupported
Keyframe-to-videoSupported
Video continuationSupported
Maximum T2V/I2V duration20 seconds
Video continuation duration5–15 seconds
Frame rate24 fps
ResolutionHD, FHD, QHD/2K, and UHD/4K
FHD 16:9 resolution1920 × 1088
Image referencesUp to 10 for I2V/keyframe workflows
Native audioYes
Multilingual dialogueYes
Lip synchronizationYes
Multi-shot generationYes
Draft ModeYes
Public still-image FLUX 3 endpointNot yet generally released by BFL
Open-weight FLUX 3 DevPlanned

เอกสาร BFL ปัจจุบันระบุว่า T2V/I2V รองรับ 5–20 วินาที ขณะที่ video continuation รับหน้าต่างการสร้าง 5–15 วินาที อัตราส่วนภาพที่รองรับ ได้แก่ 21:9, 2:1, 16:9, 4:3, 1:1, 3:4 และ 9:16

FLUX 3 ทำงานอย่างไร?

Self-Flow

รากฐานงานวิจัยหลักคือ Self-Flow แนวทาง self-supervised flow-matching ของ Black Forest Labs ปกติแล้วสายการเทรนการสร้างมักพึ่งโมเดลแทนนำเสนอที่พรีเทรนหรือซูเปอร์วิชันเสริม Self-Flow ถูกออกแบบให้เรียนรู้ representation ที่มีประโยชน์โดยตรงจากวัตถุประสงค์การสร้าง

กลไกสำคัญคือ Dual-Timestep Scheduling กลุ่มโทเคนต่างๆ สามารถถูกกำหนดระดับสัญญาณรบกวนต่างกันระหว่างการเทรน สิ่งนี้สร้างความไม่สมมาตรของข้อมูล: บางส่วนของอินพุตมีข้อมูลที่ใช้ได้มากกว่าส่วนอื่น บีบให้เครือข่ายสร้าง representation ที่ช่วยคาดเดาสิ่งที่ขาดหาย

ในทางปฏิบัติ FLUX 3 ถูกกระตุ้นให้เรียนรู้ความสัมพันธ์ระหว่างวัตถุ เฟรม การเคลื่อนไหว เสียง และเหตุการณ์ตามเวลา แทนที่จะจดจำเพียงหน้าตาของเฟรมเดี่ยวๆ

FLUX 3 คืออะไร? สเปก, เบนช์มาร์ก, คุณสมบัติ, ราคา และการเข้าถึง API

สถาปัตยกรรมวิธี Self-Flow - แหล่งภาพอย่างเป็นทางการ: โครงการ Self-Flow ของ Black Forest Labs

BFL ยังทดสอบการเทรนมัลติโหมดร่วมกัน โดยใช้แบ็กโบนที่สืบจาก FLUX.2 กับวิดีโอหลักล้านและภาพหลักร้อยล้าน การทดลองสนับสนุนสมมติฐานกว้างของ FLUX 3 ว่าการเรียนรู้ representation และการสร้างไม่จำเป็นต้องเป็นระบบแยกกัน

เหตุใดวิดีโอจึงเป็นศูนย์กลางของ FLUX 3

วิดีโอมีคุณค่าพิเศษสำหรับการสร้างแบบจำลองโลก เพราะมีข้อมูลที่ภาพนิ่งให้ไม่ได้ เฟรมเดี่ยวอาจแสดงลูกบอลอยู่เหนือพื้น แต่วิดีโอเผยได้ว่าลูกบอลกำลังตก เด้ง บิดตัวเมื่อกระแทก ส่งเสียง และเปลี่ยนทิศหลังจากนั้น

BFL เปิดเผยว่าการทำนายวิดีโอคิดเป็น มากกว่า 95% ของคอมพิวต์การเทรนของ FLUX 3 เสียงมีต้นทุนเทียบกันต่ำกว่าเพราะเป็นสัญญาณมิติต่ำกว่ามากและผูกแนบกับเหตุการณ์ที่มองเห็นได้ การจัดสรรเช่นนี้ช่วยอธิบายว่าทำไมความสามารถด้านวิดีโอจึงเป็นส่วนแรกของ FLUX 3 ที่เปิดใช้ทั่วไป

FLUX 3 ทำอะไรได้บ้าง?

Text-to-Video

ผู้ใช้สามารถสร้างวิดีโอสมบูรณ์จากคำสั่งภาษาธรรมชาติ BFL ระบุว่าโมเดลที่ปล่อยแล้วจัดการพรอมป์ตทั้งง่ายและซับซ้อนได้ พร้อมประสานการเคลื่อนไหว ตรรกะฉาก องค์ประกอบภาพ และเสียง มีประโยชน์มากกับพรอมป์ตที่มีเหตุการณ์ต่อเนื่องหลายช่วง มากกว่าการขอให้แอนิเมตวัตถุเดี่ยว

Image-to-Video และคีย์เฟรม

FLUX 3 สามารถทำให้ภาพเริ่มต้นเคลื่อนไหว มุ่งสู่อินด์เฟรม หรือใช้หลายภาพเป็นคีย์เฟรมแบบจับเวลา ปัจจุบัน API รองรับ ภาพอ้างอิงได้สูงสุดสิบภาพ ในเวิร์กโฟลว์ image-to-video ช่วยให้ผู้สร้างควบคุมการเปลี่ยนแปลงฉากตามเวลา แทนที่จะปล่อยให้โมเดลด้นทั้งลำดับ

Video Continuation

สามารถส่งวิดีโอและเสียงที่มีอยู่เป็นบริบทแล้วให้ FLUX 3 สร้างสิ่งที่จะเกิดต่อไป BFL อธิบายว่า continuation รักษาการเคลื่อนไหว พฤติกรรมกล้อง บทสนทนา และเสียงข้ามจุดเชื่อมต่อ ซึ่งต่างอย่างมีนัยสำคัญจากการสร้างคลิปที่สองแบบอิสระแล้วนำไฟล์มาชนกันภายหลัง

เสียงและบทสนทนาแบบเนทีฟ

FLUX 3 สร้างเสียงพร้อมกับการสร้างภาพ แทนที่จะต้องทำสเต็ปสังเคราะห์เสียงแยก ความสามารถเสียงที่ปล่อยแล้วรวมถึง บทสนทนา เอฟเฟกต์เสียง และเสียงบรรยากาศ รองรับบทสนทนาหลายภาษาและการซิงก์ริมฝีปาก

หลายช็อตในครั้งเดียว

พรอมป์ตเดียวสามารถประกอบด้วย หลายฉากหรือหลายมุมกล้อง เรื่องนี้สำคัญเพราะโมเดลวิดีโอรุ่นก่อนๆ มักเด่นเมื่อขอช็อตสั้นต่อเนื่องภาพเดียว FLUX 3 ถูกออกแบบให้รองรับลำดับหลายช็อตในหนึ่งการสร้างโดยเจตนา

Draft Mode

Draft Mode เป็นหนึ่งในฟีเจอร์ที่ใช้งานได้จริงสำหรับการสร้างวิดีโอปริมาณมาก แทนที่จะจ่ายราคาเต็มทุกครั้งที่ลองพรอมป์ต นักพัฒนาสามารถสร้างพรีวิวที่เร็วกว่า ต้นทุนต่ำกว่า แล้วอัปเกรดดราฟต์ที่เลือกโดยคงองค์ประกอบและการเคลื่อนไหวเดิมไว้ ตาม ราคา BFL ปัจจุบัน ดราฟต์ T2V/I2V มาตรฐานมีค่าใช้จ่าย $0.06 ต่อวินาที เทียบกับ $0.17 ต่อวินาทีสำหรับการสร้าง HD ปกติ

อะไรที่ยังไม่เปิดให้ใช้?

ประกาศเปิดตัว FLUX 3 อธิบายความสามารถด้านภาพ วิดีโอ เสียง และแอ็กชันภายใต้ทิศทางสถาปัตยกรรมเดียว แต่การเปิดใช้งานถูกไล่ลำดับ

CapabilityCurrent BFL roadmap and availability
FLUX 3 Video generationGenerally available
Native video audioGenerally available
Text-to-videoGenerally available
Image-to-video / keyframesGenerally available
Video continuationGenerally available
Richer image/video/audio reference combinationsPlanned expansion
FLUX 3 Image generation and editingUpcoming
FLUX 3 Dev open weightsPlanned
Action-prediction deploymentResearch / commercial partner track

ความแตกต่างนี้สำคัญเป็นพิเศษสำหรับผู้ใช้ที่คุ้นเคยกับ FLUX.2 Max FLUX.2 ยังคงเป็นตัวเลือกเฉพาะสำหรับการสร้างภาพนิ่ง ขณะที่ผลิตภัณฑ์ FLUX 3 สาธารณะเน้นวิดีโอและเสียง

ประสิทธิภาพบนเบนช์มาร์กของ FLUX 3

ตอนนี้มีหลักฐานเบนช์มาร์กสองแบบที่มีประโยชน์: การประเมินภายในของ BFL หลังเปิดตัว และการประเมินอิสระจากบุคคลที่สาม แบบแรกแสดงความชอบของมนุษย์ตามโปรโตคอลของ BFL ส่วนแบบที่สองตรวจว่าจุดแข็งเหล่านั้นยังคงเห็นได้ภายใต้เบนช์มาร์กที่ออกแบบแยกต่างหาก

การประเมิน ELO หลังปล่อยของ BFL

ประกาศเดือนกรกฎาคมมีอัตราชนะเบื้องต้น เบนช์มาร์กที่เกี่ยวข้องกว่าสำหรับผู้ใช้ปัจจุบันคือการประเมินวันที่ 4 สิงหาคมของ โมเดลที่ปล่อยแล้ว Black Forest Labs รายงานคะแนน ELO ของ text-to-video เท่ากับ 1135 ในการประเมินแบบจับคู่ทั้งหมดภายใน

FLUX 3 คืออะไร? สเปก, เบนช์มาร์ก, คุณสมบัติ, ราคา และการเข้าถึง API

การประเมิน ELO ของโมเดลที่ปล่อยแล้วของ FLUX 3 - แหล่งภาพอย่างเป็นทางการ: Black Forest Labs

MetricBFL released-model evaluation
Text-to-video ELO1135
T2V positionคะแนนสูงสุดในกลุ่มที่ BFL ทดสอบ
Image-to-video resultเทียบเท่าคู่แข่งที่แข็งแกร่งสุด และชนะโมเดลที่ถูกประเมินอื่นๆ
Evaluation typeการประเมินความชอบของมนุษย์ภายใน
Model stageการปล่อย FLUX 3 Video ที่ใช้งานทั่วไป

นี่ให้หลักฐานที่แข็งแรงกว่าเบนช์มาร์กตอนเปิดตัว เพราะประเมินโมเดลเดือนสิงหาคมที่ปล่อยแล้ว อย่างไรก็ดี ยังเป็นเบนช์ม์มาร์กที่ผู้ขายจัดทำ ไม่ควรตีความว่า FLUX 3 จะเหนือกว่าคู่แข่งทุกตัวในทุกหมวดพรอมป์ต

เบนช์มาร์กอิสระของ FLUX 3

v-benchmark v2 ของ Megaton ให้การตรวจสอบอิสระ FLUX 3 ถูกประเมินในเดือนสิงหาคม 2026 และปัจจุบันได้ดัชนี Megaton 76.51/100 จัดอยู่อันดับที่ 3 ในชุดที่เผยแพร่ ณ เวลาประเมิน

Benchmark dimensionMegaton FLUX 3 evaluation
Megaton Index76.51
Prompt Adherence87.07
Scene Consistency94.76
Physics70.63
Human Fidelity73.70
Object & Product Fidelity83.82
Causal & Semantic Coherence80.91
Text Fidelity82.41
Cinematography71.43
Taste & Art Direction65.00

โปรไฟล์ให้ข้อมูลมากกว่าคะแนนรวม Scene Consistency ที่ 94.76 เป็นหมวดหลักที่แข็งแกร่งสุด ขณะที่การยึดตามพรอมป์ต ความซื่อสัตย์ของวัตถุ ความสอดคล้องเชิงเหตุและความหมาย และความซื่อสัตย์ของข้อความ ก็เกิน 80 ฟิสิกส์ ความสมจริงของมนุษย์ และรสนิยมและศิลปะอ่อนกว่า แสดงว่าการแทนเวลาที่แข็งแกร่งขึ้นยังไม่ลบการเคลื่อนไหวสังเคราะห์หรือความแปรปรวนด้านคุณภาพเชิงศิลป์

นี่ยังอธิบายว่าทำไมข้อสรุปบนเบนช์มาร์กจึงต่างกันได้: การทดสอบความชอบภายในของ BFL จัด FLUX 3 ไว้สูงสุดในชุดเปรียบเทียบของตน ขณะที่ลีดเดอร์บอร์ดอิสระของ Megaton จัดไว้เป็นอันดับสาม พรอมป์ต มิติการให้คะแนน กลุ่มผู้ประเมิน และวิธีรวมคะแนนที่ต่างกัน ทำให้ได้อันดับต่างกัน

FLUX 3 เทียบกับ Seedance 2.5, MiniMax H3, Wan 3.0

ตลาดวิดีโอ AI ขยับเร็วในปี 2026 FLUX 3 ตอนนี้แข่งขันกับระบบมัลติโหมดที่รวมการสร้างคลิปยาว เสียงที่ซิงก์ อ้างอิง และการแก้ไขมากขึ้น

DimensionFLUX 3Seedance 2.5MiniMax H3Wan 3.0
DeveloperBlack Forest LabsByteDance SeedMiniMaxAlibaba
Maximum advertised clip20 s30 s15 s30 s
Video resolutionHD / FHD / QHD (2K) / UHD (4K)ขึ้นกับระดับ APIสูงสุด 2Kสูงสุด 1080p
Native audioYesYesYes, stereoYes
Text-to-videoYesYesYesYes
Image/reference inputYesYesYesYes
Keyframe/reference controlควบคุมคีย์เฟรมแบบจับเวลาได้แข็งแกร่งควบคุมอ้างอิงมัลติโหมดได้แข็งแกร่งเงื่อนไขมัลติโหมดเวิร์กโฟลว์อ้างอิงมัลติโหมด
Video continuation/editingมี continuationเวิร์กโฟลว์เน้นการแก้ไขโฟกัสการสร้างแบบออมนิเวิร์กโฟลว์แก้ไขและอ้างอิง
Multi-shot generationYesYesYesYes
Distinctive strengthสถาปัตยกรรม reality-model ความคงเส้นคงวาของฉาก Self-Flowการเล่าเรื่องแบบยาวและควบคุมอ้างอิงแข็งแรงการสร้างภาพและเสียง 2K และบริบทออมนิโหมดคลิปยาวและราคาเริ่มต่ำกว่า
CometAPI starting/unit price*$0.136/s$0.0824/s listed$0.064/s$0.040/s

* เปรียบเทียบราคาโดยคร่าวเท่านั้น. API วิดีโอใช้ความละเอียด ระยะเวลา ระดับคุณภาพ และกฎคิดเงินต่างกัน ตัวเลขราคาต่อวินาทีที่ถูกกว่าไม่ได้หมายความว่าผลลัพธ์คุณภาพเทียบเท่าถูกกว่าด้วย

FLUX 3 vs Seedance 2.5

Seedance 2.5 ได้เปรียบเรื่องระยะเวลา สร้างได้สูงสุด 30 วินาที เทียบกับ 20 วินาทีของ FLUX 3 อีกทั้งเน้นการสร้างแบบขับเคลื่อนด้วยอ้างอิง การแก้ไข และการเล่าเรื่องยาว FLUX 3 แตกต่างด้วยสถาปัตยกรรม world-model ร่วม การคงเส้นคงวาของฉาก การสร้างภาพและเสียงแบบเนทีฟ คีย์เฟรมแบบจับเวลา และโร้ดแม็ปภาพ/แอ็กชันที่กว้างกว่า

การทดสอบอิสระตอกย้ำว่านี่คือการแข่งขันระดับไฮเอนด์จริง: Megaton ปัจจุบัน จัด Seedance 2.5 ไว้เหนือ FLUX 3 โดยรวม

FLUX 3 vs MiniMax H3

MiniMax H3 ให้เอาต์พุตสูงสุด 2K และเสียงสเตอริโอเนทีฟ ช่วยให้มีสเปกด้านภาพและเสียงที่แข็งแรงสำหรับคอนเทนต์ FLUX 3 รองรับหน้าต่างการสร้างที่ยาวกว่า—20 วินาที เทียบกับ 15 วินาทีของ H3—และ Draft Mode มอบเวิร์กโฟลว์การทำซ้ำที่ควบคุมต้นทุน

FLUX 3 vs Wan 3.0

Wan 3.0 เน้นอินพุตมัลติโหมดกว้าง การสร้างภาพและเสียง การแก้ไข และคลิปยาวถึง 30 วินาที อีกทั้งราคาถูกกว่าตามราคาเริ่มของ CometAPI FLUX 3 แพงกว่า แต่แตกต่างด้วยการวางตำแหน่งแบบ reality-model ความคงเส้นคงวาของฉาก รากฐานวิจัย Self-Flow Draft Mode และการบูรณาการกับการทำนายแอ็กชัน

ราคา FLUX 3

Black Forest Labs คิดค่าบริการ FLUX 3 ตามระยะเวลาวิดีโอที่สร้าง

ModeOfficial BFL FLUX 3 pricing
T2V / I2V Draft HD$0.06/s
T2V / I2V HD$0.17/s
T2V / I2V FHD$0.29/s
T2V / I2V QHD (2K)$0.40/s
T2V / I2V UHD (4K)$0.80/s
Video continuation Draft$0.12/s
Video continuation HD$0.41/s
Video continuation FHD$0.53/s
Video continuation QHD (2K)$0.65/s
Video continuation UHD (4K)$0.95/s

การสร้าง HD มาตรฐาน 10 วินาทีจึงมีค่าใช้จ่ายประมาณ $1.70 ตามอัตราที่ระบุของ BFL ขณะที่ FHD 10 วินาทีอยู่ประมาณ $2.90 Video continuation มีราคาแพงกว่าการสร้าง T2V/I2V ปกติมาก ดังนั้นแอปพลิเคชันที่ขยายคลิปบ่อยควรคำนวณต้นทุนส่วนนั้นแยกต่างหาก

ราคา FLUX 3 บน CometAPI

CometAPI ปัจจุบัน ระบุว่า FLUX 3 พร้อมใช้งาน ด้วยรหัสโมเดล flux-3

ResolutionCometAPI FLUX 3 pricing
720p$0.136/s
1080p$0.232/s

สำหรับการสร้าง 10 วินาที เทียบได้กับประมาณ $1.36 ที่ 720p หรือ $2.32 ที่ 1080p เมื่อเทียบกับอัตรา $0.17/s และ $0.29/s ของ BFL ราคาเริ่มต้นบน CometAPI สำหรับสองระดับนี้ต่ำกว่าประมาณ 20%

หมายเหตุความพร้อมใช้งาน: ข้อความบรรยายบางส่วนบน CometAPI ยังสะท้อนช่วง Early Access เดือนกรกฎาคม การ์ดโมเดลสดปัจจุบัน* ส่วนราคา และตัวอย่าง API ระบุว่า flux-3 พร้อมใช้งาน โดย CometAPI เปิดเมื่อ 13 สิงหาคม 2026 สำหรับการตัดสินใจอินทิเกรต ให้ยึด API และฟิลด์ราคาสดมากกว่าข้อความบรรยายเก่า*

เหตุใด FLUX 3 จึงสำคัญเกินกว่าวิดีโอ AI

ส่วนที่แปลกใหม่ของ FLUX 3 ไม่ใช่แค่การสร้างวิดีโอ 20 วินาที หลายคู่แข่งสร้างคลิปยาวเท่ากันหรือยาวกว่าได้อยู่แล้ว เดิมพันทางเทคนิคที่ใหญ่กว่าคือ representation วิดีโอที่แข็งแรงสามารถเป็นพื้นฐานสำหรับความฉลาดรูปแบบอื่น

จากการทำนายวิดีโอสู่การทำนายแอ็กชัน

สัญญาณควบคุมหุ่นยนต์คือการทำนายตามเวลาโดยมีภาพเป็นเงื่อนไข ดังนั้น BFL ใช้ representation วิดีโอของ FLUX 3 เป็นพื้นฐานสำหรับการทำนายแอ็กชัน ความร่วมมือกับ mimic robotics สร้าง FLUX-mimic โดยตัวถอดรหัสแอ็กชันอ่าน representation จากโมเดลวิดีโอ แทนการเทรนสแต็กการรับรู้แยก

BFL รายงานว่าแบ็กโบนของ FLUX-mimic ทำงานได้ ต่ำกว่า 80 ms บน RTX 5090 เดียว ขณะที่ระบบหุ่นยนต์สมบูรณ์มีลูปตอบสนองประมาณ 101 ms บริษัทได้พูดถึงการประเมินในอุตสาหกรรมกับ Audi ด้วย

สิ่งนี้ไม่ได้ทำให้ FLUX 3 Video API สำหรับสาธารณะกลายเป็น API หุ่นยนต์ แต่มันแสดงให้เห็นว่าทำไม BFL จึงลงทุนหนักใน representation วิดีโอมัลติโหมด แทนการมองว่าการสร้างวิดีโอคือภาระงานสื่อแยกเดี่ยว

จุดแข็งหลักของ FLUX 3 คืออะไร?

  • ความคงเส้นคงวาตามเวลาและฉาก คะแนน Scene Consistency 94.76 ของ Megaton เป็นหมวดหลักที่แข็งแรงที่สุดของโมเดล
  • การสร้างภาพและเสียงแบบเนทีฟ บทสนทนา เอฟเฟกต์ บรรยากาศ และภาพ สร้างร่วมกันได้ แทนการต่อจากโมเดลแยก
  • การยึดตามพรอมป์ตที่แข็งแรง ผลลัพธ์ Prompt Adherence 87.07 จากอิสระบ่งชี้ว่าโมเดลเด่นเกินความสละสลวยทางภาพ
  • การควบคุมคีย์เฟรม ใช้ภาพได้สูงสุดสิบภาพในเวิร์กโฟลว์ I2V ปัจจุบัน ให้การควบคุมตามเวลาอย่างชัดเจน
  • เวิร์กโฟลว์จากดราฟต์สู่ไฟนอล Draft Mode แก้ปัญหาต้นทุนจริงในวิดีโอ AI: การลองพรอมป์ตจำนวนมากถูกทิ้ง
  • พิสัยภาพกว้าง BFL วางตำแหน่ง FLUX 3 ว่าทำได้ทั้งดิบ ธรรมชาติ ภาพยนตร์ โนสตาลเจีย เล่นสนุก สไตลাইজ และแปลกใหม่ ไม่ได้หมกอยู่กับสไตล์เดียว
  • ทิศทางวิจัยแบบ world-model Self-Flow และการทำนายแอ็กชันทำให้ FLUX 3 มีความเกี่ยวข้องเหนือการสร้างมีเดีย

ข้อจำกัดของ FLUX 3 คืออะไร?

  • โร้ดแม็ปมัลติโหมดเต็มยังไม่ส่งมอบ FLUX 3 Image แบบสาธารณะและน้ำหนักเปิด FLUX 3 Dev ไม่ควรสรุปจากการประกาศระดับตระกูล
  • 20 วินาทีไม่ใช่ระยะเวลานำอุตสาหกรรมอีกต่อไป บางคู่แข่งปี 2026 รองรับ 30 วินาทีแล้ว
  • ฟิสิกส์ยังไม่ถูกแก้ คะแนน Physics 70.63 ยังค่อนข้างต่ำเมื่อเทียบกับความคงเส้นคงวาฉาก
  • ความสมจริงของมนุษย์ยังมีช่องให้พัฒนา คะแนนอิสระ 73.70 หมายความว่ากายวิภาคยากและการเคลื่อนไหวมนุษย์สมจริงยังผิดพลาดได้
  • Video continuation ราคาแพง ราคาต่อวินาทีของ BFL สำหรับ continuation สูงกว่าการสร้าง T2V/I2V ปกติมาก
  • เบนช์มาร์กชูโรงของ BFL เป็นภายใน การตัดสินใจใช้งานจริงควรรวมการทดสอบอิสระด้วยพรอมป์ต ชนิดช็อต ภาษา และแอสเซ็ตอ้างอิงของแอปตนเอง

วิธีใช้ FLUX 3 กับ CometAPI

บทความ ก่อนหน้าเกี่ยวกับ FLUX 3 ของ CometAPI อธิบายช่วง Early Access เดือนกรกฎาคม เบนช์มาร์กเบื้องต้น และแผนเปิดตัว ส่วนนี้โฟกัสการอินทิเกรตระดับโปรดักชัน ราคา และโฟลว์ API ปัจจุบันเพื่อไม่ต้องย้ำย้อน โมเดลโปรดักชัน FLUX 3 ใช้รหัสโมเดล flux-3

คำขอ 720p ขั้นพื้นฐานใช้ endpoint /v1/videos:

Bash

curl --request POST "https://api.cometapi.com/v1/videos" \
--header "Authorization: Bearer $COMETAPI_KEY" \
--form-string "model=flux-3" \
--form-string "prompt=A paper boat glides across a still pond in soft morning light" \
--form-string "seconds=5" \
--form-string "size=1280x720"

เวิร์กโฟลว์วิดีโอเป็นแบบ asynchronous หลังคำขอเริ่มต้นส่งกลับ task ID แอปจะตรวจสอบงานจนการสร้างเสร็จ แล้วดึงวิดีโอผลลัพธ์ สำหรับโปรดักชัน ควรให้การสร้างรันโดยงานเบื้องหลังหรือคิวงาน แทนการเปิดคำขอ HTTP ค้างตลอดเวลาประมวลผล

ใครควรใช้ FLUX 3?

FLUX 3 น่าสนใจเป็นพิเศษสำหรับแอปที่ต้องการมากกว่าคลิปสวยๆ 5 วินาที: ระบบโฆษณาที่ซิงก์ภาพและเสียง การผลิตช็อตสั้นอัตโนมัติ เดโมสินค้าเมื่อความคงอยู่ของวัตถุสำคัญ การสร้างบทสนทนาหลายภาษา เวิร์กโฟลว์จากสตอรีบอร์ดสู่วิดีโอ แอนิเมชันควบคุมด้วยคีย์เฟรม คอนเทนต์การศึกษา และการทดลองกับไปป์ไลน์มัลติโหมดที่ยาวขึ้น

อาจไม่น่าดึงดูดเมื่อข้อกำหนดเดียวคือราคาต่อวินาทีต่ำสุด เมื่อจำเป็นต้องสร้างเกิน 20 วินาทีในครั้งเดียว หรือเมื่อการสร้างภาพนิ่งเป็นภารกิจหลัก สำหรับภาพนิ่ง โมเดลภาพ FLUX ที่มีอยู่ เช่น FLUX.2 Max อาจเหมาะกว่าในตอนนี้

FLUX 3 ดีกว่าโมเดลวิดีโอ AI อื่นหรือไม่?

ไม่มีคำตอบเดียวที่ปกป้องได้สำหรับทุกเคสใช้งาน การประเมินภายในของ BFL จัด FLUX 3 ที่ปล่อยแล้วไว้สูงสุดใน T2V ของตน ขณะที่การประเมินอิสระของ Megaton จัด FLUX 3 ไว้อันดับสามรองจากคู่แข่งที่ใหม่กว่า ทั้งสองผลลัพธ์อาจถูกต้องพร้อมกัน เพราะทดสอบด้วยการแจกแจงพรอมป์ตและมิติคุณภาพต่างกัน

FLUX 3 ดูจะเด่นเป็นพิเศษเมื่อความคงเส้นคงวาของฉาก การทำตามพรอมป์ต ความซื่อสัตย์ของวัตถุ ความสอดคล้องเชิงเหตุและความหมาย การเรนเดอร์ข้อความ เสียงที่ซิงก์ และคีย์เฟรมที่ควบคุมได้ สำคัญ โมเดลอื่นอาจชนะที่ระยะเวลาสูงสุด ความละเอียด ความชอบเชิงศิลป์ ความสมจริงของมนุษย์ เวิร์กโฟลว์แก้ไข หรือราคา สำหรับนักพัฒนา การเปรียบเทียบที่ถูกต้องคือเฉพาะงาน มากกว่าดูแต่ลีดเดอร์บอร์ด

คำถามที่พบบ่อย

FLUX 3 พร้อมให้ใช้งานแล้วหรือไม่?

พร้อมแล้ว FLUX 3 Video เปิดใช้งานทั่วไปผ่าน BFL เมื่อ 4 สิงหาคม 2026 CometAPI ก็ระบุว่า FLUX 3 พร้อมใช้งาน ภายใต้รหัสโมเดล flux-3 ส่วนการปล่อยภาพนิ่งของ FLUX 3 และน้ำหนักเปิด FLUX 3 Dev ยังเป็นแผนแยก

FLUX 3 สร้างเสียงได้หรือไม่?

ได้ FLUX 3 Video สร้างเสียงเนทีฟที่ซิงก์ รวมถึงบทสนทนา เสียงบรรยากาศ และเอฟเฟกต์ รองรับบทสนทนาหลายภาษาและการซิงก์ริมฝีปาก

วิดีโอของ FLUX 3 ยาวได้แค่ไหน?

การสร้างจากข้อความและภาพปัจจุบันรองรับ 5–20 วินาที Video continuation รองรับคอนเทนต์ที่สร้างใหม่ 5–15 วินาที

FLUX 3 รองรับความละเอียดอะไร?

BFL รองรับ HD (สูงสุด 1 เมกะพิกเซลต่อเฟรม) FHD (สูงสุด 2 MP) QHD/2K (สูงสุด 4 MP) และ UHD/4K (สูงสุด 8 MP) เอาต์พุต FHD สัดส่วน 16:9 คือ 1920 × 1088 กลุ่มความละเอียดอิงจำนวนพิกเซลต่อเฟรม ไม่ขึ้นกับอัตราส่วนภาพ; Draft Mode มีเฉพาะ HD

FLUX 3 รองรับ image-to-video หรือไม่?

รองรับ การสร้างจากภาพและคีย์เฟรม เป็นส่วนหนึ่งของฟีเจอร์ FLUX 3 Video ที่เปิดใช้งานทั่วไป

FLUX 3 เป็นโมเดลสร้างภาพหรือไม่?

ในเชิงสถาปัตยกรรม FLUX 3 ถูกเทรนคร่อมภาพ วิดีโอ และเสียง และ BFL แสดงงานวิจัยการสร้างและแก้ไขภาพ อย่างไรก็ดี ผลิตภัณฑ์ FLUX 3 Image ยังเป็นการปล่อยที่กำลังจะมาถึง อย่าสับสนโร้ดแม็ประดับตระกูลกับ FLUX 3 Video API ที่เปิดสาธารณะในตอนนี้

FLUX 3 เป็นโอเพนซอร์สหรือไม่?

ยังไม่ใช่ BFL ประกาศ FLUX 3 Dev เวอร์ชันมัลติโหมดแบบน้ำหนักเปิด แต่ยังไม่กำหนดวันปล่อยสาธารณะ

FLUX 3 ราคาเท่าไร?

BFL คิดราคา T2V/I2V ที่ $0.06/s สำหรับ Draft HD, $0.17/s สำหรับ HD, $0.29/s สำหรับ FHD, $0.40/s สำหรับ QHD และ $0.80/s สำหรับ UHD วิดีโอสู่วิดีโอคิด $0.12/s สำหรับ Draft HD, จากนั้น $0.41/s สำหรับ HD, $0.53/s สำหรับ FHD, $0.65/s สำหรับ QHD และ $0.95/s สำหรับ UHD ขณะที่ CometAPI ปัจจุบันระบุ $0.136/s สำหรับ 720p และ $0.232/s สำหรับ 1080p

Self-Flow คืออะไร?

Self-Flow คือแนวทาง self-supervised flow-matching ของ BFL ออกแบบมาให้โมเดล generative พัฒนา representation ภายในที่มีประโยชน์โดยไม่ต้องพึ่งโมเดล representation ภายนอก การใช้ระดับสัญญาณรบกวนต่างกันข้ามโทเคนกระตุ้นให้เครือข่ายคาดเดาข้อมูลที่หายไปและเรียนรู้ความสัมพันธ์ระหว่างการสังเกตแบบมัลติโหมด

FLUX 3 คือ world model หรือไม่?

Black Forest Labs วางตำแหน่ง FLUX 3 ว่าเป็นฐาน reality-model เพราะ representation ร่วมขยายจากการทำนายภาพและเสียงไปสู่การทำนายแอ็กชันทางกายภาพ การเรียกมันว่า world model อเนกประสงค์ที่สมบูรณ์จะเกินกว่าหลักฐานปัจจุบัน คำอธิบายที่แม่นยำกว่าคือโมเดลฐาน generative มัลติโหมดที่ออกแบบอย่างชัดเจนรอบวัตถุประสงค์การสร้างแบบจำลองโลก

บทสรุป

FLUX 3 เป็นการเปลี่ยนแปลงที่ใหญ่กว่าสำหรับ Black Forest Labs มากกว่าการอัปเกรดโมเดลภาพ FLUX รุ่นต่อรุ่น ไอเดียหลักคือการเทรน representation มัลติโหมดร่วมของโลก แล้วใช้ representation นั้นกับวิดีโอ เสียง ภาพ และท้ายที่สุดคือแอ็กชัน Self-Flow ให้รากฐานงานวิจัย ขณะที่ FLUX 3 Video ที่ปล่อยแล้วเป็นการสาธิตขั้นโปรดักชันแรกของกลยุทธ์นี้

ณ กันยายน 2026 FLUX 3 Video รองรับคลิปยาวสูงสุด 20 วินาที 24 fps เอาต์พุตตั้งแต่ HD ถึง UHD/4K เสียงที่ซิงก์ บทสนทนาหลายภาษา image-to-video คีย์เฟรม video continuation การสร้างหลายช็อต และ Draft Mode

ภาพรวมเบนช์มาร์กตอนนี้น่าเชื่อถือกว่าตอนเปิดตัว การประเมินโมเดลที่ปล่อยของ BFL จัด FLUX 3 ไว้อันดับหนึ่งใน T2V ภายในของตน ขณะที่การทดสอบอิสระของ Megaton จัดอยู่อันดับสามโดยชี้ว่าความคงเส้นคงวาฉากแข็งแกร่งเป็นพิเศษ

ดังนั้น FLUX 3 ไม่ใช่ตัวเลือกที่ดีที่สุดโดยอัตโนมัติสำหรับทุกภาระงาน Seedance 2.5, MiniMax H3, และ Wan 3.0 อาจให้การสร้างที่ยาวกว่า ความละเอียดสูงกว่า ราคาเริ่มต่ำกว่า หรือความสามารถอ้างอิงและแก้ไขที่ต่างกัน

สิ่งที่ทำให้ FLUX 3 น่าสนใจเป็นพิเศษคือทิศทางใต้เครื่องสร้างวิดีโอ: BFL กำลังเดิมพันว่า representation แบบเดียวกันที่จำเป็นต่อการทำนายวิดีโอที่น่าเชื่อถือ จะรองรับการสร้างภาพ เสียง การให้เหตุผลทางกายภาพ และการกระทำของหุ่นยนต์ได้ในที่สุด นักพัฒนาสามารถทดสอบก้าวแรกระดับโปรดักชันได้แล้วผ่าน FLUX 3 บน CometAPI โดยใช้รหัสโมเดล flux-3

เรียนรู้ต่อ

เชื่อมโยงบทความนี้กับการตัดสินใจถัดไป

ดูทุกหัวข้อ
เผยแพร่เมื่อ Oct 3, 2026
อัปเดตล่าสุด Oct 3, 2026
0 ครั้งที่ดู
ตรวจสอบความชัดเจน การอ้างอิงแหล่งที่มา และคำศัพท์ API ปัจจุบันแล้ว

อ่านเพิ่มเติม