重點摘要
MiniMax H3 Max 並不是取代 MiniMax H3 的全新基礎模型。它是由 fal Research 使用 H3 開放權重進行後訓練、並針對提示遵從度、視覺美感與推理效率做額外優化的 MiniMax H3 後訓練變體。
這一差異解釋了兩者的大多數不同點。MiniMax H3 Max 針對快速生產推理與更強的提示遵從度進行最佳化,而 MiniMax H3 仍是更廣義的全模態系統,包含更豐富的多模態條件控制、開放的 H3-Base 權重、影片編輯工作流程,以及透過 H3-Regenerate-2K 產出最高可至 2K。
截至 2026 年 9 月 18 日,獨立偏好數據顯示:在含音訊的文生影片測試中,H3 Max 的 Elo 為 1227,而 H3 為 1220;在含音訊的圖生影片測試中,H3 Max 的 Elo 為 1195,而 H3 為 1181。差距值得追蹤,但不足以代表在每個提示上都有戲劇性的品質差異。
核心要點
- H3 Max 是 H3 的後訓練變體,不是 H4,也不是更大的 H3 架構。 fal 以 MiniMax H3 開放權重為起點,同步優化模型與服務堆疊。
- 速度是 H3 Max 最明顯的差異化。 fal 報告在其最佳化基礎設施上,768p、5 秒影片的生成約 3 秒內完成。
- 在此處採用的兩項可直接比較的獨立偏好測試中,H3 Max 目前領先 H3。 最新快照顯示含音訊文生影片 +7 Elo、含音訊圖生影片 +14 Elo。
- MiniMax H3 仍是更廣的基礎模型工作流程。 它支援更豐富的多模態參考、編輯、開放 H3-Base 權重與 2K 再生。
- 解析度是重要區別。H3 Max 提供 480p/768p 生成與 1080p 潛空間細化,而 H3 可透過 H3-Regenerate-2K 觸達 2K。
什麼是 MiniMax H3 Max?
MiniMax H3 Max 是由 fal Research 將 MiniMax H3 開放權重進行後訓練而成的 AI 影片生成模型。fal 並非用全新的基礎模型取代底層 H3 架構,而是聚焦於 提示遵從、審美與推理吞吐。
因此,「Max」一詞若被理解為傳統的大參數等級,可能具誤導性。公開資料未證實 H3 Max 採用更大的 Transformer 或新的參數規模。其差異主要來自後訓練與圍繞修改後模型設計的服務堆疊。
fal 也描述了大量面向使用者可見品質的新後訓練數據與評估迴路。實務上,與其把 H3 Max 視為全新繼任者,不如將其視為面向生產的 H3 最佳化變體。
MiniMax H3 Max 一覽規格
| 規格 | MiniMax H3 Max |
|---|---|
| 基礎模型 | MiniMax H3 |
| 後訓練開發者 | fal Research |
| 模型類別 | 音訊-影片生成 |
| 文字轉影片 | 是 |
| 圖片轉影片 | 是 |
| 首/末幀控制 | 是 |
| 參考轉影片 | 是 |
| 輸出時長 | 5–15 秒 |
| 原生生成解析度 | 480p / 768p |
| 1080p 選項 | 由原生 768p 進行潛空間細化 |
| 影格率 | 24 FPS |
| 音訊 | 同步立體聲音訊 |
| 長寬比 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 |
| 主要最佳化方向 | 提示遵從、審美、吞吐量 |
| CometAPI 模型 ID | minimax-h3-max |
目前 fal API 結構將 1080p 選項描述為來自原生 768p 的潛空間細化;與能在更高解析度重新生成的系統比較時,這點很重要。
MiniMax H3 Max 如何運作?
理解 H3 Max 需要先看其底層的 H3 基礎。MiniMax 將 H3 描述為全模態生成系統,而非一組互相孤立的文生影片、圖生影片、音訊與編輯模型。
完整的 H3 工作流程圍繞 H3-Context-IR、H3-Base 與 H3-Regenerate-2K 組織而成。H3-Context-IR 解析自由形式的多模態指令,H3-Base 在 768p 進行核心視聽生成,而 H3-Regenerate-2K 會重用原始上下文與較低解析度結果,以再生更高解析度的輸出。
H3 Max 之下的 H3 基礎
MiniMax 將 H3-Omni-Transformer 記載為一個 330 億參數的稠密單流 Transformer,其中約有 130 億參數位於與 AdaLN 相關的分支。H3-Encoder 使用預訓練的 Qwen3-VL-32B 權重,而獨立的視覺與音訊 VAE 先對各自模態進行編碼,之後再進行聯合生成。
H3-Omni-Transformer 會聯合預測影片與音訊的潛表示,而非把聲音視為獨立的後處理階段。這種架構使得 H3 與 H3 Max 都能產生同步的影音輸出。
MiniMax H3 官方模型架構
fal 為 H3 Max 做了哪些改動
fal 使用額外數據對 H3 進行後訓練,以提升指令忠實度與視覺品質,並在訓練過程中同步開發推理系統,而非在訓練完成後才優化服務。發佈文章將這種模型與推理的協同設計視為 H3 Max 能調整品質—速度取捨的核心原因。
這點很重要,因為僅僅減少取樣步數或精度固然能降低延遲,但也可能犧牲輸出品質。fal 表示,只有在候選最佳化後的檢查點仍能通過其偏好評估時,才會保留。
MiniMax H3 提供多模態生成的基礎;H3 Max 則改變了這個基礎在品質—速度—成本曲線上的位置。
MiniMax H3 Max 的主要特性是什麼?
更強的提示遵從
提示遵從是直接的後訓練目標。這對結構化提示尤為重要,例如同時包含多個動作、場景轉換、鏡頭運動、時間約束與風格指令。
快於影片時長的生成速度
H3 Max 專為極低生成延遲而設計。fal 報告在其最佳化基礎設施上,768p、5 秒片段約 3 秒內即可完成,讓創作迭代更為緊湊。
原生同步音訊
H3 Max 延續 H3 的聯合音訊—影片生成方法,能在同一工作流程中協調產生對白、環境音、音效與動作。
多種生成工作流程
H3 Max 系列支援文字轉影片、圖片轉影片、首到末幀生成與參考轉影片等工作流程。
內建提示擴寫
文生影片端點提供如 disabled、balanced、quality 等提示擴寫模式,讓開發者可用更長的前處理時間換取更豐富的提示解讀。
MiniMax H3 Max 的效能如何?
MiniMax H3 Max 的基準測試
供應商自辦的基準測試有助於呈現後訓練的目標,但持續更新的第三方偏好測試更適合在相同「競技場」方法學下比較 H3 Max 與原始 H3。
| 基準快照 — 2026 年 9 月 18 日 | MiniMax H3 Max | MiniMax H3 | 差異 |
|---|---|---|---|
| 文生影片(含音訊)Elo | 1227 ±9 | 1220 ±8 | +7 |
| 文生影片樣本數 | 5,689 | 8,602 | — |
| 圖生影片(含音訊)Elo | 1195 ±10 | 1181 ±8 | +14 |
| 圖生影片樣本數 | 5,569 | 6,949 | — |
| 影片編輯(含音訊)Elo | 在此比較中未排名 | 1132 ±6 | — |
「基準方法學」說明:Artificial Analysis 數據為帶日期的盲測人工偏好 Elo 快照;此文報告分數、95% 信賴區間、樣本數、類別與快照日期。fal 的第 1 名結果為供應商於 fal 基礎設施上運行,且其 公開比較圖表 並未披露所有提示、硬體或服務參數,無法獨立重現。
當前快照支持一個有限結論:H3 Max 在兩個可直接比較的影音生成類別中,測得的偏好分數更高。由於信賴區間重疊,因此不應將此差距描述為普遍或戲劇性的品質領先。
fal 自家對 H3 Max 的評估
fal 報告在其與 12 個影片模型的正面對決中,H3 Max 在整體偏好、提示理解與美學上均排名第一。這屬於供應商自辦的證據,因此應與獨立「競技場」數據一併參考,而非將其視為替代。

fal 官方 H3 Max 成本對品質圖表
最有用的解讀並非「H3 Max 全面勝出」,而是 H3 Max 顯著改善了 H3 的速度—品質運作點;同時,對 H3 的獨立偏好分數領先幅度仍相對有限。
速度、品質與取捨
fal 報告在其最佳化基礎設施上,H3 Max 能在 3 秒內生成一段 5 秒、768p 的影片——相較 fal 比較中的 MiniMax H3 官方端點,吞吐量約高 35 倍。將此視為供應商特定的推理證據:排隊、網路傳輸、安全檢查與不同後端都會增加端到端延遲。
品質優勢不及速度優勢顯著。在 9 月 18 日的獨立快照中,H3 Max 於含音訊文生影片領先 7 Elo、於含音訊圖生影片領先 14 Elo,但信賴區間重疊。合理的結論是:H3 Max 推進了速度—品質前沿;它不保證每個提示都能帶來顯而易見的更佳結果。
實務選擇:當需要快速迭代、高吞吐短片生產、以及高度提示遵從時,使用 H3 Max。當工作流程仰賴更廣的多模態系統、影片編輯、開放權重部署,或 H3-Regenerate-2K 時,優先選擇標準 H3。
MiniMax H3 Max 的費用是多少?
定價需要脈絡,因為供應商費率與促銷可能獨立變動。以下為 2026 年 9 月 18 日查核的公開費率快照。
| 定價來源 | H3 Max | H3 |
|---|---|---|
| fal 480p | $0.025/秒(促銷) | — |
| fal 768p | $0.04/秒(促銷) | — |
| fal 1080p 細化 | $0.08/秒(促銷) | — |
| MiniMax 官方 768p | — | $0.08/秒 |
| MiniMax 官方 2K | — | $0.13/秒 |
| MiniMax 768p → 2K 再生 | — | $0.05/秒 |
| CometAPI 起始價格 | $0.064/秒 | $0.064/秒 |
fal 目前標示其 H3 Max 費率為發佈促銷,並稱折扣將於 2026 年 9 月 30 日結束。CometAPI 中的 MiniMax H3 Max API 目前顯示每秒 $0.064,而 MiniMax H3 API 的起價也為每秒 $0.064。在規劃大規模生產工作負載前,應重新確認供應商定價。
如何試用 MiniMax H3 Max
CometAPI 中的 MiniMax H3 Max API 目前可用,模型 ID 為 minimax-h3-max,為 /v1/videos 之下的生產端點,採非同步任務處理,顯示起始價格為每秒 $0.064。
- 建立 API 金鑰。登入 CometAPI,建立權杖,並安全保存為
COMETAPI_KEY。 - 提交生成任務。向
https://api.cometapi.com/v1/videos發出POST請求,指定模型minimax-h3-max、提示詞、時長與輸出尺寸。使用圖生影片時加入圖片 URL。 - 輪詢非同步任務。讀取回傳的任務 ID,並請求
GET /v1/videos/{task_id},直到狀態變為completed或failed。使用輪詢間隔,避免連續不斷的請求。 - 下載與檢視。取得
GET /v1/videos/{task_id}/content,保存 MP4,並在擴大量產前檢查提示遵從、運動、音訊同步與視覺雜訊。
為公平比較 H3 Max 與 H3,請固定提示、時長、長寬比、解析度、參考輸入、音訊設定與重試策略。在投入生產前,請在模型頁確認即時結構與價格,因為路由與公開參數可能獨立於底層模型而改變。
MiniMax H3 Max 的限制
首先,H3 Max 並未取代 H3 的 2K 再生工作流程。其目前文件化的 1080p 選項屬於原生 768p 輸出的細化,而非 H3 所使用、在上下文內進行的 2K 再生路徑。
其次,H3 Max 的標稱延遲與 fal 的最佳化推理堆疊緊密相關,因此不應假設在其他後端也能得到相同的實際速度。
第三,對 H3 的獨立品質領先目前仍然有限。9 月 18 日的基準快照顯示:含音訊文生影片 +7 Elo、含音訊圖生影片 +14 Elo,且信賴區間重疊。
最後,若「更好」指的是影片編輯、多模態參考深度、開放權重部署或最高輸出解析度,而非原始生成吞吐,H3 仍是更廣的系統。
結論
將 MiniMax H3 Max 理解為面向生產最佳化的 H3 變體,而非更大的繼任者,更為貼切。fal 的後訓練與推理協同設計,為快速短片影音生成帶來具吸引力的運作點;同時,相較標準 H3 的獨立偏好領先屬於有限而非普遍。
當迭代速度、吞吐與提示遵從是主要限制時,選擇 H3 Max。當你需要更廣的多模態工作流程、影片編輯、開放 H3-Base 權重或 2K 再生時,選擇標準 H3。在兩條路線間做決策前,請以相同提示與設定進行受控基準,並計算每個被接受片段的成本——而非僅計算每秒生成成本。
常見問題
當信賴區間重疊時,團隊應如何解讀 H3 Max 的基準領先?
將領先視為方向性證據,而非 H3 Max 在每個提示上都勝出的證明。在所引的快照中,H3 Max 於含音訊文生影片領先 7 Elo、於含音訊圖生影片領先 14 Elo,但信賴區間重疊。因此,團隊應測試具代表性的提示集,回報勝率與失敗模式,避免把有限的整體領先演繹為普遍的品質主張。
團隊應如何在標示的「每秒價格」之外,比較 H3 Max 與 H3 的真實生產成本?
計算「每個被接受片段的成本」而非「每秒生成成本」。納入重試、被拒輸出、1080p 細化或 2K 再生、存儲與傳輸、審稿時間,以及任何後續剪輯。H3 Max 可能透過更快生成與更強提示遵從,降低迭代成本;而當 H3 的編輯、多模態控制或 2K 工作流程能避免額外工具與返工時,H3 也可能更經濟。
實際可期待的生成速度為何?哪些因素影響端到端延遲?
fal 報告在其最佳化基礎設施上,768p、5 秒片段的推理低於 3 秒。這並非端到端的通用保證:排隊時間、輸入上傳、提示擴寫、安全處理、解析度、時長與供應商路由都會影響觀測到的延遲。請對計畫部署的確切端點與設定進行基準測試。
文字、圖片、關鍵幀控制或參考導向的任務,應如何選擇 H3 Max 的工作流程?
當場景可完全用語言描述時,使用文字轉影片;當需要從提供的畫面確立人像、構圖或風格時,使用圖片轉影片。當起始與結尾狀態都很重要時,選擇首到末幀控制;當需要與多個視覺參考保持一致性時,使用參考轉影片。先確定正確的工作流程可降低提示歧義,且應在比較 H3 Max 與 H3 前先固定。
團隊應如何在 480p、768p、H3 Max 1080p 細化與 H3 2K 再生之間做出選擇?
使用 480p 進行低成本草稿與高量概念篩選,接著移至 768p 進行常規評估與多數網頁交付。當仍以快速生產為優先、但交付格式需要更多像素時,選擇 H3 Max 的 1080p 細化。當最高細節與更廣的 H3 工作流程能支撐更高延遲與成本時,選擇 H3 的 2K 再生;請在實際顯示尺寸比較最終成品,而非僅憑解析度標籤做選擇。
MiniMax H3 的 2K 再生與 H3 Max 的 1080p 細化有何不同?
是的。標準 MiniMax H3 可透過 H3-Regenerate-2K 觸達 2K。這是一個在上下文內的再生階段,會重用原始多模態指令與 768p 結果,使其能重建細節,而非套用傳統的超解析度。這個更廣的工作流程是為何在追求最高解析度時,可能更偏好 H3 而非 H3 Max 的原因。
MiniMax H3 的哪些部分是開放權重,哪些仍需託管 API?
部分是。MiniMax 以 H3 Community License 釋出了 H3-Base 的 FL2VA 與 Ref2VA 檢查點,允許在本地驗證核心 768p 生成。完整的生產系統並非完全開放:H3-Context-IR 與 H3-Regenerate-2K 仍為託管組件,因此要重現官方完整的 2K 工作流程仍需使用 MiniMax API。
API 產品應在何時選擇 H3 Max 而非標準 H3?
當應用看重低延遲、快速創作迭代與生產吞吐時,經常會選擇 H3 Max。但它並非自動更優:若需要 2K 再生、更廣的多模態條件控制、影片編輯或開放權重部署,標準 H3 會更合適。請進行驗收測試,並比較每個可用輸出的成本,再做選擇。
在從 H3 切換到 H3 Max 前,生產評估套件應量測什麼?
量測提示遵從、運動連貫性、視覺雜訊、音訊品質與同步、身份一致性與審稿通過率。加入營運指標,例如任務失敗率、重試率、端到端延遲的 p50 與 p95,以及每個被接受片段的成本。依文字轉影片、圖片轉影片、時長、解析度、長寬比與提示複雜度分段結果,避免強勁的平均值掩蓋對生產至關重要的弱項。
