TL;DR
FLUX 3 API 尚未作為公共的生產環境 API 一般性開放。Black Forest Labs 已宣布 FLUX 3,並為 FLUX 3 Video 開放早期存取,但穩定的模型 ID、完整的公開 API 規格與更廣泛的存取仍在等待釋出。
開發者現在可申請早期存取,或在準備於存取擴大後評估 FLUX 3 的同時,持續以現有的影片 API 進行基準測試。
What Is FLUX 3?
FLUX 3 是 Black Forest Labs 推出的新一代多模態基礎模型,面向圖像、影片、音訊與動作相關任務。
不同於主要聚焦於圖像生成與編輯的 FLUX.2,FLUX 3 在圖像、影片與音訊上進行聯合訓練。根據 Black Forest Labs 的官方 FLUX 3 公告,其目標是在共享架構內建模視覺結構、運動、物理交互與聲音,而非將各模態視為相互獨立的系統。
對開發者而言,最重要的問題是這些能力目前是否已能透過可用於生產的 API 存取。
Is the FLUX 3 API Available Now?
不,FLUX 3 API 目前尚未作為公共的生產環境 API 一般性開放。
截至 2026 年 7 月 24 日,Black Forest Labs 以申請制提供早期存取,首先開放 FLUX 3 Video。穩定的生產用模型 ID、完整的公開 API 規格、速率限制與其他生產細節尚未對一般使用釋出。
有意測試該模型的開發者可透過官方 FLUX 3 模型頁申請。
FLUX 3 Availability at a Glance
| Item | Current Status |
|---|---|
| Official announcement | Released July 23, 2026 |
| Public FLUX 3 API | Not generally available |
| Stable production model IDs | Not published |
| FLUX 3 Video | Early Access |
| Maximum announced video length | Up to 20 seconds per generation |
| Native audio | Supported |
| FLUX 3 Image | Early Access planned in the following weeks |
| FLUX 3 Action | Selected research and commercial partners |
| FLUX 3 Dev | Open-weight multimodal backbone planned |
Black Forest Labs 表示,不同的 FLUX 3 能力將在接下來的數週與數月分階段推出。
這層區別很重要:FLUX 3 已宣布並向部分早期存取用戶開放,但它尚未成為任何開發者都可整合進生產環境的公共端點。
What Can FLUX 3 Video Do?
FLUX 3 Video 是首個進入早期存取的主要 FLUX 3 能力。
根據 BFL 的說法,它能在一次生成中產出最長 20 秒、帶原生音訊的片段。它同時支援僅憑提示生成,以及使用圖像、影片或視聽序列作為參考的工作流程。
Watch FLUX 3 in Action
此預覽展示了 FLUX 3 在影片、音訊、圖像生成與動作預測上的多模態能力早期一瞥。
https://www.youtube.com/watch?v=PCPhl8qMF_Y
已公告的功能包括:
- 文字轉影片生成;
- 從起始畫面或視覺參考進行圖像轉影片生成;
- 影片轉影片轉換;
- 影片與音訊續接;
- 關鍵幀轉影片生成;
- 多語言對話;
- 音訊與視覺事件同步;
- 多種長寬比與視覺風格;
- 將片段串接為更長的多鏡頭序列;
- 文字排版與動態設計生成。
BFL 的初步評估使用了 10 秒、720p 的文字轉影片片段並包含音訊。然而,涵蓋支援的解析度、幀率、編解碼器、佇列行為、延遲與輸出格式等完整的生產規格尚未公佈。
這些細節最終將決定 FLUX 3 Video 對真實生產工作負載的實用性。
What Is FLUX 3 Dev?
FLUX 3 Dev 是計劃中的 FLUX 3 多模態骨幹的開放權重版本。
Black Forest Labs 將其描述為一個開放權重的骨幹模型,旨在支援圖像、影片、音訊、內容創作與動作預測等工作負載。該公司尚未公佈其模型權重、參數規模、硬體需求、發佈日期或授權條款。
對於關注在地部署、微調、研究,或希望更大程度掌控推論基礎設施的開發者而言,FLUX 3 Dev 值得關注。
在 BFL 公佈最終技術規格與使用條款前,團隊應避免提前做出基礎設施或授權規劃。
請追蹤官方 FLUX 3 頁面以獲取發佈更新。
FLUX 3 vs FLUX.2: What Changed?
FLUX 3 的變化不僅是為 FLUX.2 增加了影片生成功能。
| Feature / Dimension | FLUX.2 | FLUX 3 |
|---|---|---|
| Primary focus | Image generation and editing | Multimodal generation and prediction |
| Main modalities | Image | Image, video, audio, and action prediction |
| Temporal modeling | Not a primary focus | Core capability |
| Native video audio | No | Yes |
| Video generation | No | Yes |
| Maximum video length | N/A | Up to 20 seconds per generation |
| Action prediction | Not a primary capability | Planned through FLUX 3 Action for selected partners |
| Open-weight version | FLUX.2 Dev is available | FLUX 3 Dev is planned; specifications are pending |
| Current availability | Released model family | Phased Early Access |
FLUX.2 仍是可用於生產的圖像生成與編輯模型家族,具有受管 API 變體與可用的開放權重 Dev 版本。FLUX 3 則將架構擴展至時序、視聽與動作相關的工作負載。
對當前專注於圖像生成的團隊而言,FLUX.2 仍是更務實的選擇。
可參考 CometAPI 的FLUX.2 概述或FLUX.2 API 整合指南以瞭解現有的圖像生成流程。
FLUX 3 亦延伸至動作預測。
在FLUX 3 x mimic 報告中,BFL 描述了 FLUX-mimic,一個基於 FLUX 3 骨幹、與 mimic robotics 合作打造的影片動作模型。BFL 表示該系統已在 Audi 的生產任務中進行測試。
其核心理念是:能學習物理場景隨時間推進之方式的模型,或可發展出對機器人動作預測有用的表徵。
這項工作應與未來的內容生成 API 分開看待。FLUX 3 Action 起初將面向特定的研究與商業合作夥伴。
What Do the Early FLUX 3 Benchmarks Show?
Black Forest Labs 已公佈一個早期 FLUX 3 Video 候選模型的初步偏好評測,使用 10 秒、720p 的文字轉影片片段並包含音訊。
在已發佈的評測中,FLUX 3 獲得:
- 對 Seedance 2.0:52% 偏好;
- 對 Gemini Omni Flash:52%;
- 對 Happy Horse 1.1:57%;
- 對 Happy Horse v1:59%;
- 對 Kling v3 Pro:60%;
- 對 Grok Imagine Video:最高 69%;
- 對 Runway Gen-4.5:77%;
- 對 Luma Ray 3.2:93%。

來源*: Black Forest Labs,* FLUX 3: Real World Models**, 2026 年 7 月 23 日。結果基於對早期 FLUX 3 候選模型的初步評估。
這些結果令人期待,但 BFL 亦指出,模型與其評估工具仍在開發中。因此,這些結果應視為供參考的供應商自辦初步評估,而非獨立、可直接用於生產的基準。
偏好分數也無法反映模型在 API 延遲、可靠性、吞吐量、技術故障,或重複生成的一致性等方面的表現。
一旦更廣泛的 FLUX 3 API 存取可用,團隊應在一致的測試條件下,將相同提示同時運行於 FLUX 3 與現有模型。
How Can Developers Access FLUX 3?
截至 2026 年 7 月 24 日,FLUX 3 是透過 Black Forest Labs 的申請制早期存取計畫提供,而非一般性公共 API 存取。
希望測試該模型的開發者可透過官方 FLUX 3 頁面申請。
CometAPI 計劃在其 API 可用性與整合規格正式確認後支援 FLUX 3。屆時,開發者可透過同一 API 基礎設施,在無需自建整合的情況下存取 FLUX 3 與其他 AI 模型。
同時,團隊可持續使用 CometAPI 上已可用的模型進行開發:
| Your Use Case | Current Status |
|---|---|
| AI video generation | Start with Veo 3 or explore Seedance, Kling, Sora, Runway, and other models through the CometAPI Video Generation API. |
| Video with native audio | Evaluate Veo 3 for video generation with synchronized dialogue, sound effects, and ambient audio. |
| Image generation and editing | Use the released FLUX.2 family through the FLUX.2 API integration guide or test FLUX.2 Pro. |
| Open-weight workflows | Explore FLUX.2 Dev while waiting for the FLUX 3 Dev weights, license, and hardware requirements. |
| Future FLUX 3 comparison | Build a reusable benchmark using the evaluation framework below, then run the same tests when FLUX 3 access expands. |
這種做法可讓開發者在今日持續交付、使用合適的替代方案,同時保持隨時準備好在更廣泛的 API 存取開放後評估或整合 FLUX 3。
How to Evaluate the FLUX 3 API After Release
對 FLUX 3 感興趣的團隊,可在公共 API 存取到來前先準備一套基準。
具代表性的測試集應涵蓋產品最重要的工作負載:
| Test Group | What to Measure |
|---|---|
| Prompt adherence | Required objects, actions, camera instructions, and exclusions |
| Character consistency | Identity, clothing, proportions, and voice |
| Physical motion | Contact, weight, trajectories, and continuity |
| Native audio | Lip sync, dialogue accuracy, timing, and ambience |
| Editing and references | Image references, video transformations, keyframes, and continuation |
| Typography and multilingual output | Spelling, layout stability, animation, and language accuracy |
對每個請求,追蹤:
- 提示與參考素材;
- 模型與端點版本;
- 解析度、時長與長寬比;
- 佇列、生成與傳遞延遲;
- 技術失敗與安全性拒絕;
- 人工驗收分數;
- 常見的視覺、運動、文字與音訊失敗模式。
將重要提示重複執行多次。
生成式影片具有隨機性,一次出色的輸出不代表模型已足夠穩定可用於生產。重複測試能揭示一致性與失敗模式,避免被精心挑選的示範所掩蓋。
當 FLUX 3 公開可用時,將相同工作負載同時運行於你現有的模型。這比對每個模型使用不同提示或手選樣本更具比較價值。
What Should Developers Watch Next?
在將 FLUX 3 視為可用於生產之前,請關注以下五項關鍵進展:
- 穩定的公共 API 端點與生產用模型 ID。
- 支援的解析度、時長、幀率、編解碼器與原生音訊控制。
- 速率限制、併發度、佇列行為與生成延遲。
- 商業使用、內容審核、隱私與資料保留條款。
- FLUX 3 Dev 權重、參數規模、硬體需求與授權細節。
這些細節將決定 FLUX 3 不僅是一個令人印象深刻的模型家族,亦能成為生產應用的務實選擇。
FAQ
FLUX 3 API 是否已可用?
截至 2026 年 7 月 24 日,FLUX 3 尚未作為公共 API 一般性開放。它正透過分階段的早期存取計畫推出,開發者可透過Black Forest Labs 官方 FLUX 3 頁面申請。
如何取得 FLUX 3 Video 存取?
開發者與公司可透過FLUX 3 模型頁申請 FLUX 3 Video 的早期存取。
FLUX 3 會生成帶音訊的影片嗎?
會。FLUX 3 Video 可在影片中生成原生音訊,並支援多語言對話、視聽續接、以及與視覺事件同步的聲音等能力。BFL 表示單次生成可達最長 20 秒。
什麼是 FLUX 3 Dev?
FLUX 3 Dev 是計劃中的 FLUX 3 多模態骨幹的開放權重版本。BFL 尚未公佈其模型權重、參數規模、硬體需求、發佈日期或授權條款。
FLUX 3 與 FLUX.2 有何差異?
FLUX.2 專注於可用於生產的圖像生成與編輯;FLUX 3 則擴展為涵蓋圖像、影片、原生音訊與動作預測的多模態架構。
Final Thoughts
FLUX 3 值得關注,特別是對於關心具原生音訊的影片生成與更廣泛多模態工作流程的開發者。
目前較務實的做法是持續以可用模型進行開發與基準測試,同時準備一套可重用的評估集。當 FLUX 3 API 存取擴大時,團隊即可以相同提示跨模型運行,並比較輸出品質、一致性、延遲、可靠性與常見失敗模式。
準備好今天就整合影片生成了嗎?前往探索 CometAPI Video Generation API,使用目前可用的模型開始開發。
