什麼是 Flux 3?
新一代多模態基礎模型
FLUX 3 是由 Black Forest Labs 開發的最新前沿模型,該公司由多位最初的 Stable Diffusion 研究人員創立。
不同於將圖像生成、影片生成、音訊理解與機器人技術視為彼此獨立的 AI 系統,FLUX 3 嘗試以一個共享的神經表示來統一解決這些問題。
傳統擴散模型主要學習:
- 文字 → 圖像
- 圖像編輯
- 圖像變體
而 FLUX 3 則學習:
- 圖像生成
- 影片生成
- 音訊理解
- 運動預測
- 時序一致性
- 動作預測
- 世界動態
此架構超越純粹的生成式 AI,邁向研究人員日益稱之為 世界模型 的方向。
技術規格
| 規格 | Flux 3 |
|---|---|
| 開發者 | Black Forest Labs |
| 發佈 | 2026 (預覽公告) |
| 模型類型 | 統一多模態基礎模型 |
| 架構 | Flow Matching / 多模態基礎架構 |
| 輸入模態 | 文字、圖像、影片、音訊 |
| 輸出模態 | 圖像、影片、音訊、動作預測 |
| 訓練策略 | 聯合多模態訓練 |
| 主要目標 | 世界建模 |
| 圖像生成 | 是 |
| 影片生成 | 是 |
| 音訊建模 | 是 |
| 機器人支援 | 是 |
| 動作預測 | 是 |
| API 可用性 | 早期存取 |
| 開源 | 否(目前) |
| 商用 API | 規劃中 |
Flux 3 的功能與亮點
**更正:**您的大綱要求的是「Features and Highlights of Claude Sonnet 5」。由於本文是關於 Flux 3,因此相應章節應為「Features and Highlights of Flux 3」。
1. 統一的多模態訓練
Flux 3 並非拼裝多個專家模型,而是跨所有支援的模態進行聯合最佳化。
好處包括:
- 共享語義理解
- 跨模態推理
- 更佳一致性
- 減少模態切換
2. 世界建模
最大的創新或許在於從圖像合成轉向對世界的理解。
模型嘗試學習:
- 重力
- 物體恆常性
- 碰撞
- 時序運動
- 因果關係
- 人類動作
這使得 Flux 3 適用於機器人模擬與互動環境。
3. 原生影片學習
不同於許多將圖像生成延伸至影片的擴散系統,據稱 Flux 3 將影片視為核心學習訊號。
根據 Black Forest Labs:
- 影片訓練佔用超過 95% 的訓練算力
- 相較於靜態渲染,更優先強化時序理解
- 運動預測可提升一致性
4. 音訊整合
Flux 3 對音訊進行聯合學習,而非事後疊加。
潛在能力包括:
- 口型同步
- 環境聲音理解
- 多模態推理
- 同步的影片生成
5. 面向機器人的設計
公告強調機器人是重要的部署目標。
潛在應用:
- 機器人規劃
- 導航
- 工業自動化
- 自主系統
6. 高品質圖像生成
Flux 3 延續 BFL 在以下方面的強勁口碑:
- 照片級寫實
- 文字排版
- 提示遵循度
- 光照寫實性
- 構圖
同時擴展至超越僅限圖像的任務。
模型版本
在推出時,Black Forest Labs 將 Flux 3 作為統一的多模態平台發佈,而非一系列廣泛的變體。當前公開資訊包括:
| 模型 | 狀態 |
|---|---|
| Flux 3 | 早期存取 |
| Flux 3 API | 規劃中 |
| 圖像生成 | 可用 |
| 影片生成 | 預覽 |
| 音訊生成 | 預覽 |
| 動作預測 | 預覽 |
其他變體(如 Pro、Dev 或輕量版)尚未正式宣佈。
基準測試表現
由於模型及其相關配套仍在開發中,以下結果屬於初步數據,預期在早期存取階段還會進一步改進。在早期評估中,FLUX 3 相較於 Grok Imagine Video 的偏好率最高達 69%,相較於 Kling v3 Pro 為 60%,Happy Horse v1 為 59%,Happy Horse 1.1 為 57%,Seedance 2.0 與 Gemini Omni Flash 為 52%。FLUX 3 在與 Runway Gen-4.5 的對比中被偏好於 77%,與 Luma Ray 3.2 的對比中則為 93%。

宣稱的優勢包括:
- 更優的時序一致性
- 更佳的物理推理
- 更佳的運動生成
- 原生多模態學習
- 面向機器人的世界建模
不同於傳統的圖像基準(FID、CLIPScore、GenEval),Flux 3 設計目標所對應的許多應用很可能需要新的評估方法,重點關注影片連貫性、多模態對齊與動作預測。
限制
儘管其架構令人印象深刻,Flux 3 仍存在若干限制。
早期存取
該模型目前尚未全面向公眾開放。
定價未知
官方 API 定價尚未公佈。
硬體需求
由於模型同時學習圖像、影片、音訊與動作預測,推論預計將比僅限圖像的 FLUX 模型需要顯著更多的算力。
文件有限
許多架構細節尚未披露。
如何在 CometAPI 上使用 Flux 3 API
一旦 Flux 3 透過 API 供應商上線,CometAPI 等統一 API 門戶可簡化整合。
典型流程為:
- 註冊 CometAPI 帳戶。
- 從控制台取得 API 金鑰。
- 選擇 Flux 3 模型(可用時)。
- 使用標準 REST 或 SDK 介面發送請求。
- 接收生成的圖像、影片或多模態輸出。
確切的端點與負載將取決於 CometAPI 公佈的文件,待 Flux 3 支援釋出後確定。
為何使用 CometAPI?
對於可能使用多個 AI 供應商的開發者而言,API 聚合平台可帶來多項運營層面的好處:
- 統一介面: 一個 API 對接多個基礎模型,無需維護多套整合。
- 供應商彈性: 隨著能力或定價演進,更容易在模型之間切換。
- 簡化金鑰管理: 集中式驗證與計費。
- 更快的實驗: 只需極少程式碼變更即可比較不同圖像或多模態模型。
- 可擴展性: 在不同供應商之間路由請求,並更有效率地管理用量。
CometAPI 是否支援 Flux 3——以及具體功能集——取決於其當前的模型目錄與發佈時程。