GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
ai-model/CometAPI 研究

什麼是 MiniMax H3 Max?

了解 MiniMax H3 Max 是什麼,以及其架構、速度、基準測試、功能、定價、音訊與 API 存取。

CometAPI
Deon GoodwinAI 模型與 API 研究團隊
更新於 Sep 21, 2026 5 分鐘閱讀
什麼是 MiniMax H3 Max?
套用此模式

發出第一個 API 請求。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

重點摘要

MiniMax H3 Max 並不是取代 MiniMax H3 的全新基礎模型。它是由 fal Research 使用 H3 開放權重進行後訓練、並針對提示遵從度、視覺美感與推理效率做額外優化的 MiniMax H3 後訓練變體

這一差異解釋了兩者的大多數不同點。MiniMax H3 Max 針對快速生產推理與更強的提示遵從度進行最佳化,而 MiniMax H3 仍是更廣義的全模態系統,包含更豐富的多模態條件控制、開放的 H3-Base 權重、影片編輯工作流程,以及透過 H3-Regenerate-2K 產出最高可至 2K。

截至 2026 年 9 月 18 日,獨立偏好數據顯示:在含音訊的文生影片測試中,H3 Max 的 Elo 為 1227,而 H3 為 1220;在含音訊的圖生影片測試中,H3 Max 的 Elo 為 1195,而 H3 為 1181。差距值得追蹤,但不足以代表在每個提示上都有戲劇性的品質差異。

核心要點

  • H3 Max 是 H3 的後訓練變體,不是 H4,也不是更大的 H3 架構。 fal 以 MiniMax H3 開放權重為起點,同步優化模型與服務堆疊。
  • 速度是 H3 Max 最明顯的差異化。 fal 報告在其最佳化基礎設施上,768p、5 秒影片的生成約 3 秒內完成。
  • 在此處採用的兩項可直接比較的獨立偏好測試中,H3 Max 目前領先 H3。 最新快照顯示含音訊文生影片 +7 Elo、含音訊圖生影片 +14 Elo。
  • MiniMax H3 仍是更廣的基礎模型工作流程。 它支援更豐富的多模態參考、編輯、開放 H3-Base 權重與 2K 再生。
  • 解析度是重要區別。H3 Max 提供 480p/768p 生成與 1080p 潛空間細化,而 H3 可透過 H3-Regenerate-2K 觸達 2K。

什麼是 MiniMax H3 Max?

MiniMax H3 Max 是由 fal Research 將 MiniMax H3 開放權重進行後訓練而成的 AI 影片生成模型。fal 並非用全新的基礎模型取代底層 H3 架構,而是聚焦於 提示遵從、審美與推理吞吐

因此,「Max」一詞若被理解為傳統的大參數等級,可能具誤導性。公開資料未證實 H3 Max 採用更大的 Transformer 或新的參數規模。其差異主要來自後訓練與圍繞修改後模型設計的服務堆疊。

fal 也描述了大量面向使用者可見品質的新後訓練數據與評估迴路。實務上,與其把 H3 Max 視為全新繼任者,不如將其視為面向生產的 H3 最佳化變體。

MiniMax H3 Max 一覽規格

規格MiniMax H3 Max
基礎模型MiniMax H3
後訓練開發者fal Research
模型類別音訊-影片生成
文字轉影片
圖片轉影片
首/末幀控制
參考轉影片
輸出時長5–15 秒
原生生成解析度480p / 768p
1080p 選項由原生 768p 進行潛空間細化
影格率24 FPS
音訊同步立體聲音訊
長寬比21:9, 16:9, 4:3, 1:1, 3:4, 9:16
主要最佳化方向提示遵從、審美、吞吐量
CometAPI 模型 IDminimax-h3-max

目前 fal API 結構將 1080p 選項描述為來自原生 768p 的潛空間細化;與能在更高解析度重新生成的系統比較時,這點很重要。

MiniMax H3 Max 如何運作?

理解 H3 Max 需要先看其底層的 H3 基礎。MiniMax 將 H3 描述為全模態生成系統,而非一組互相孤立的文生影片、圖生影片、音訊與編輯模型。

完整的 H3 工作流程圍繞 H3-Context-IR、H3-Base 與 H3-Regenerate-2K 組織而成。H3-Context-IR 解析自由形式的多模態指令,H3-Base 在 768p 進行核心視聽生成,而 H3-Regenerate-2K 會重用原始上下文與較低解析度結果,以再生更高解析度的輸出。

H3 Max 之下的 H3 基礎

MiniMax 將 H3-Omni-Transformer 記載為一個 330 億參數的稠密單流 Transformer,其中約有 130 億參數位於與 AdaLN 相關的分支。H3-Encoder 使用預訓練的 Qwen3-VL-32B 權重,而獨立的視覺與音訊 VAE 先對各自模態進行編碼,之後再進行聯合生成。

H3-Omni-Transformer 會聯合預測影片與音訊的潛表示,而非把聲音視為獨立的後處理階段。這種架構使得 H3 與 H3 Max 都能產生同步的影音輸出。

MiniMax H3 官方模型架構

fal 為 H3 Max 做了哪些改動

fal 使用額外數據對 H3 進行後訓練,以提升指令忠實度與視覺品質,並在訓練過程中同步開發推理系統,而非在訓練完成後才優化服務。發佈文章將這種模型與推理的協同設計視為 H3 Max 能調整品質—速度取捨的核心原因。

這點很重要,因為僅僅減少取樣步數或精度固然能降低延遲,但也可能犧牲輸出品質。fal 表示,只有在候選最佳化後的檢查點仍能通過其偏好評估時,才會保留。

MiniMax H3 提供多模態生成的基礎;H3 Max 則改變了這個基礎在品質—速度—成本曲線上的位置。

MiniMax H3 Max 的主要特性是什麼?

更強的提示遵從

提示遵從是直接的後訓練目標。這對結構化提示尤為重要,例如同時包含多個動作、場景轉換、鏡頭運動、時間約束與風格指令。

快於影片時長的生成速度

H3 Max 專為極低生成延遲而設計。fal 報告在其最佳化基礎設施上,768p、5 秒片段約 3 秒內即可完成,讓創作迭代更為緊湊。

原生同步音訊

H3 Max 延續 H3 的聯合音訊—影片生成方法,能在同一工作流程中協調產生對白、環境音、音效與動作。

多種生成工作流程

H3 Max 系列支援文字轉影片、圖片轉影片、首到末幀生成與參考轉影片等工作流程。

內建提示擴寫

文生影片端點提供如 disabled、balanced、quality 等提示擴寫模式,讓開發者可用更長的前處理時間換取更豐富的提示解讀。

MiniMax H3 Max 的效能如何?

MiniMax H3 Max 的基準測試

供應商自辦的基準測試有助於呈現後訓練的目標,但持續更新的第三方偏好測試更適合在相同「競技場」方法學下比較 H3 Max 與原始 H3。

基準快照 — 2026 年 9 月 18 日MiniMax H3 MaxMiniMax H3差異
文生影片(含音訊)Elo1227 ±91220 ±8+7
文生影片樣本數5,6898,602
圖生影片(含音訊)Elo1195 ±101181 ±8+14
圖生影片樣本數5,5696,949
影片編輯(含音訊)Elo在此比較中未排名1132 ±6

「基準方法學」說明:Artificial Analysis 數據為帶日期的盲測人工偏好 Elo 快照;此文報告分數、95% 信賴區間、樣本數、類別與快照日期。fal 的第 1 名結果為供應商於 fal 基礎設施上運行,且其 公開比較圖表 並未披露所有提示、硬體或服務參數,無法獨立重現。

當前快照支持一個有限結論:H3 Max 在兩個可直接比較的影音生成類別中,測得的偏好分數更高。由於信賴區間重疊,因此不應將此差距描述為普遍或戲劇性的品質領先。

fal 自家對 H3 Max 的評估

fal 報告在其與 12 個影片模型的正面對決中,H3 Max 在整體偏好、提示理解與美學上均排名第一。這屬於供應商自辦的證據,因此應與獨立「競技場」數據一併參考,而非將其視為替代。

什麼是 MiniMax H3 Max?

fal 官方 H3 Max 成本對品質圖表

最有用的解讀並非「H3 Max 全面勝出」,而是 H3 Max 顯著改善了 H3 的速度—品質運作點;同時,對 H3 的獨立偏好分數領先幅度仍相對有限。

速度、品質與取捨

fal 報告在其最佳化基礎設施上,H3 Max 能在 3 秒內生成一段 5 秒、768p 的影片——相較 fal 比較中的 MiniMax H3 官方端點,吞吐量約高 35 倍。將此視為供應商特定的推理證據:排隊、網路傳輸、安全檢查與不同後端都會增加端到端延遲。

品質優勢不及速度優勢顯著。在 9 月 18 日的獨立快照中,H3 Max 於含音訊文生影片領先 7 Elo、於含音訊圖生影片領先 14 Elo,但信賴區間重疊。合理的結論是:H3 Max 推進了速度—品質前沿;它不保證每個提示都能帶來顯而易見的更佳結果。

實務選擇:當需要快速迭代、高吞吐短片生產、以及高度提示遵從時,使用 H3 Max。當工作流程仰賴更廣的多模態系統、影片編輯、開放權重部署,或 H3-Regenerate-2K 時,優先選擇標準 H3。

MiniMax H3 Max 的費用是多少?

定價需要脈絡,因為供應商費率與促銷可能獨立變動。以下為 2026 年 9 月 18 日查核的公開費率快照。

定價來源H3 MaxH3
fal 480p$0.025/秒(促銷)
fal 768p$0.04/秒(促銷)
fal 1080p 細化$0.08/秒(促銷)
MiniMax 官方 768p$0.08/秒
MiniMax 官方 2K$0.13/秒
MiniMax 768p → 2K 再生$0.05/秒
CometAPI 起始價格$0.064/秒$0.064/秒

fal 目前標示其 H3 Max 費率為發佈促銷,並稱折扣將於 2026 年 9 月 30 日結束。CometAPI 中的 MiniMax H3 Max API 目前顯示每秒 $0.064,而 MiniMax H3 API 的起價也為每秒 $0.064。在規劃大規模生產工作負載前,應重新確認供應商定價。

如何試用 MiniMax H3 Max

CometAPI 中的 MiniMax H3 Max API 目前可用,模型 ID 為 minimax-h3-max,為 /v1/videos 之下的生產端點,採非同步任務處理,顯示起始價格為每秒 $0.064。

  1. 建立 API 金鑰。登入 CometAPI,建立權杖,並安全保存為 COMETAPI_KEY
  2. 提交生成任務。向 https://api.cometapi.com/v1/videos 發出 POST 請求,指定模型 minimax-h3-max、提示詞、時長與輸出尺寸。使用圖生影片時加入圖片 URL。
  3. 輪詢非同步任務。讀取回傳的任務 ID,並請求 GET /v1/videos/{task_id},直到狀態變為 completedfailed。使用輪詢間隔,避免連續不斷的請求。
  4. 下載與檢視。取得 GET /v1/videos/{task_id}/content,保存 MP4,並在擴大量產前檢查提示遵從、運動、音訊同步與視覺雜訊。

為公平比較 H3 Max 與 H3,請固定提示、時長、長寬比、解析度、參考輸入、音訊設定與重試策略。在投入生產前,請在模型頁確認即時結構與價格,因為路由與公開參數可能獨立於底層模型而改變。

MiniMax H3 Max 的限制

首先,H3 Max 並未取代 H3 的 2K 再生工作流程。其目前文件化的 1080p 選項屬於原生 768p 輸出的細化,而非 H3 所使用、在上下文內進行的 2K 再生路徑。

其次,H3 Max 的標稱延遲與 fal 的最佳化推理堆疊緊密相關,因此不應假設在其他後端也能得到相同的實際速度。

第三,對 H3 的獨立品質領先目前仍然有限。9 月 18 日的基準快照顯示:含音訊文生影片 +7 Elo、含音訊圖生影片 +14 Elo,且信賴區間重疊。

最後,若「更好」指的是影片編輯、多模態參考深度、開放權重部署或最高輸出解析度,而非原始生成吞吐,H3 仍是更廣的系統。

結論

將 MiniMax H3 Max 理解為面向生產最佳化的 H3 變體,而非更大的繼任者,更為貼切。fal 的後訓練與推理協同設計,為快速短片影音生成帶來具吸引力的運作點;同時,相較標準 H3 的獨立偏好領先屬於有限而非普遍。

當迭代速度、吞吐與提示遵從是主要限制時,選擇 H3 Max。當你需要更廣的多模態工作流程、影片編輯、開放 H3-Base 權重或 2K 再生時,選擇標準 H3。在兩條路線間做決策前,請以相同提示與設定進行受控基準,並計算每個被接受片段的成本——而非僅計算每秒生成成本。

常見問題

當信賴區間重疊時,團隊應如何解讀 H3 Max 的基準領先?

將領先視為方向性證據,而非 H3 Max 在每個提示上都勝出的證明。在所引的快照中,H3 Max 於含音訊文生影片領先 7 Elo、於含音訊圖生影片領先 14 Elo,但信賴區間重疊。因此,團隊應測試具代表性的提示集,回報勝率與失敗模式,避免把有限的整體領先演繹為普遍的品質主張。

團隊應如何在標示的「每秒價格」之外,比較 H3 Max 與 H3 的真實生產成本?

計算「每個被接受片段的成本」而非「每秒生成成本」。納入重試、被拒輸出、1080p 細化或 2K 再生、存儲與傳輸、審稿時間,以及任何後續剪輯。H3 Max 可能透過更快生成與更強提示遵從,降低迭代成本;而當 H3 的編輯、多模態控制或 2K 工作流程能避免額外工具與返工時,H3 也可能更經濟。

實際可期待的生成速度為何?哪些因素影響端到端延遲?

fal 報告在其最佳化基礎設施上,768p、5 秒片段的推理低於 3 秒。這並非端到端的通用保證:排隊時間、輸入上傳、提示擴寫、安全處理、解析度、時長與供應商路由都會影響觀測到的延遲。請對計畫部署的確切端點與設定進行基準測試。

文字、圖片、關鍵幀控制或參考導向的任務,應如何選擇 H3 Max 的工作流程?

當場景可完全用語言描述時,使用文字轉影片;當需要從提供的畫面確立人像、構圖或風格時,使用圖片轉影片。當起始與結尾狀態都很重要時,選擇首到末幀控制;當需要與多個視覺參考保持一致性時,使用參考轉影片。先確定正確的工作流程可降低提示歧義,且應在比較 H3 Max 與 H3 前先固定。

團隊應如何在 480p、768p、H3 Max 1080p 細化與 H3 2K 再生之間做出選擇?

使用 480p 進行低成本草稿與高量概念篩選,接著移至 768p 進行常規評估與多數網頁交付。當仍以快速生產為優先、但交付格式需要更多像素時,選擇 H3 Max 的 1080p 細化。當最高細節與更廣的 H3 工作流程能支撐更高延遲與成本時,選擇 H3 的 2K 再生;請在實際顯示尺寸比較最終成品,而非僅憑解析度標籤做選擇。

MiniMax H3 的 2K 再生與 H3 Max 的 1080p 細化有何不同?

是的。標準 MiniMax H3 可透過 H3-Regenerate-2K 觸達 2K。這是一個在上下文內的再生階段,會重用原始多模態指令與 768p 結果,使其能重建細節,而非套用傳統的超解析度。這個更廣的工作流程是為何在追求最高解析度時,可能更偏好 H3 而非 H3 Max 的原因。

MiniMax H3 的哪些部分是開放權重,哪些仍需託管 API?

部分是。MiniMax 以 H3 Community License 釋出了 H3-Base 的 FL2VA 與 Ref2VA 檢查點,允許在本地驗證核心 768p 生成。完整的生產系統並非完全開放:H3-Context-IR 與 H3-Regenerate-2K 仍為託管組件,因此要重現官方完整的 2K 工作流程仍需使用 MiniMax API。

API 產品應在何時選擇 H3 Max 而非標準 H3?

當應用看重低延遲、快速創作迭代與生產吞吐時,經常會選擇 H3 Max。但它並非自動更優:若需要 2K 再生、更廣的多模態條件控制、影片編輯或開放權重部署,標準 H3 會更合適。請進行驗收測試,並比較每個可用輸出的成本,再做選擇。

在從 H3 切換到 H3 Max 前,生產評估套件應量測什麼?

量測提示遵從、運動連貫性、視覺雜訊、音訊品質與同步、身份一致性與審稿通過率。加入營運指標,例如任務失敗率、重試率、端到端延遲的 p50 與 p95,以及每個被接受片段的成本。依文字轉影片、圖片轉影片、時長、解析度、長寬比與提示複雜度分段結果,避免強勁的平均值掩蓋對生產至關重要的弱項。

繼續學習

把這篇文章連到下一個決策。

查看所有主題
發布於 Sep 21, 2026
最後更新 Sep 21, 2026
0 次瀏覽
已審核內容清晰度、來源標註與最新 API 術語。

準備好將 AI 開發成本降低 20% 了嗎?

幾分鐘內免費開始。包含免費試用點數。無需信用卡。

閱讀更多