GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
ai-model/CometAPIリサーチ

MiniMax H3 Max とは

MiniMax H3 Max とは何か、そのアーキテクチャ、速度、ベンチマーク、機能、価格、音声、および API アクセスについて学ぶ。

CometAPI
Deon GoodwinAIモデルとAPIの調査チーム
更新日 Sep 21, 2026 6 分読み
MiniMax H3 Max とは
このパターンを使う

最初のAPI呼び出しを行う。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

MiniMax H3 Max は、MiniMax H3 を置き換えるまったく新しい基盤モデルではありません。これは H3 のオープンウェイトを用い、プロンプト順守、ビジュアルの美観、推論効率に焦点を当てた追加のポストトレーニングによって fal Research が作成した MiniMax H3 のポストトレーニング版 です。

この区別が両モデルのほとんどの違いを説明します。 MiniMax H3 Max は本番推論の高速化と強いプロンプト順守に最適化され、MiniMax H3 は依然としてより広範なオムニモーダルのシステムであり、より豊かなマルチモーダル条件付け、オープンな H3-Base ウェイト、動画編集ワークフロー、H3-Regenerate-2K による 2K 出力を含みます。

2026年9月18日現在、独立した選好データでは、音声付きテキストから動画において H3 Max は Elo 1227、H3 は 1220、音声付き画像から動画において H3 Max は Elo 1195、H3 は 1181 です。差は追跡に値する意味のあるものですが、すべてのプロンプトで劇的な品質差を示すほど大きくはありません。

Key Takeaways

  • H3 Max は H4 でも、より大きな H3 アーキテクチャでもなく、H3 のポストトレーニング版です。fal は MiniMax H3 のオープンウェイトから出発し、モデルとサービングスタックを同時に最適化しました。
  • 速度は H3 Max の最も明確な差別化要因です。fal は最適化されたインフラ上で、5 秒・768p の生成がおおむね 3 秒程度以下であると報告しています。
  • 本稿で用いる 2 つの直接比較可能な独立選好テストでは、現状 H3 Max が H3 を上回っています。最新スナップショットでは、音声付きテキストから動画で +7 Elo、音声付き画像から動画で +14 Elo です。
  • MiniMax H3 は依然としてより広い基盤モデルのワークフローです。より豊富なマルチモーダル参照、編集、オープンな H3-Base ウェイト、2K 再生成をサポートします。
  • 解像度は重要な相違点です。H3 Max は 480p/768p 生成に加え 1080p の潜在精緻化を公開しており、H3 は H3-Regenerate-2K により 2K に到達できます。

What Is MiniMax H3 Max?

MiniMax H3 Max は、MiniMax H3 のオープンウェイトに対するポストトレーニングを通じて fal Research が開発した AI 動画生成モデルです。基盤となる H3 アーキテクチャを完全に新しい基盤モデルに置き換えるのではなく、fal はプロンプト順守、美観、推論スループット に集中しました。

したがって「Max」という語は、従来型のパラメータを増やした上位ティアと解釈されると誤解を招き得ます。公開情報は、H3 Max に対するより大きな Transformer や新しいパラメータ規模を示していません。差別化は主にポストトレーニングと、改変されたモデルを中心に設計されたサービングスタックに由来します。

fal はまた、ユーザーが視認できる品質に焦点を当てた大規模な新規ポストトレーニングデータと評価ループについて述べています。実務上、H3 Max はクリーンシートの後継ではなく、本番最適化された H3 のバリアントとして理解するのが適切です。

MiniMax H3 Max specifications at glance

SpecificationMiniMax H3 Max
Base modelMiniMax H3
Post-training developerfal Research
Model category音声・映像生成
Text-to-videoYes
Image-to-videoYes
First/last-frame controlYes
Reference-to-videoYes
Output duration5-15 seconds
Native generation resolution480p / 768p
1080p optionネイティブ 768p からの潜在精緻化
Frame rate24 FPS
Audio同期ステレオ音声
Aspect ratios21:9, 16:9, 4:3, 1:1, 3:4, 9:16
Primary optimizationプロンプト順守、美観、スループット
CometAPI model IDminimax-h3-max

現行の fal の API スキーマでは、1080p オプションはネイティブ 768p からの潜在精緻化として記述されています。これは、H3 Max と、真に高解像度で再生成するシステムとの比較において重要です。

How Does MiniMax H3 Max Work?

H3 Max を理解するには、その基盤となる H3 から始めるのがよいでしょう。MiniMax は H3 を、テキストから動画、画像から動画、音声、編集モデルの寄せ集めではなく、オムニモーダルな生成システムとして説明しています。

完全な H3 ワークフローは H3-Context-IR、H3-Base、H3-Regenerate-2K を中心に構成されています。H3-Context-IR は自由形式のマルチモーダル指示を解釈し、H3-Base は 768p でコアの音声映像生成を行い、H3-Regenerate-2K は元のコンテキストと低解像度の結果を再利用して、より高解像度の出力を再生成します。

The H3 foundation beneath H3 Max

MiniMax は H3-Omni-Transformer を330億パラメータの密な単一ストリーム Transformer として文書化しており、AdaLN 関連の分岐に約 130 億パラメータを有します。H3-Encoder は事前学習済みの Qwen3-VL-32B ウェイトを使用し、個別のビジュアルおよびオーディオの VAE がそれぞれのモダリティを符号化した後、共同生成を行います。

H3-Omni-Transformer は、音を別個の後処理段階として扱うのではなく、動画と音声の潜在表現を共同で予測します。そのアーキテクチャにより、H3 と H3 Max の両方が同期した音声・映像出力を生成できます。

Official MiniMax H3 model architecture

What fal changed for H3 Max

fal は、指示の忠実度と視覚的品質を狙った追加データで H3 をポストトレーニングし、トレーニング完了後にサービングのみを最適化するのではなく、モデルと推論システムを並行して開発しました。ローンチ記事は、このモデルと推論のコーデザインこそが H3 Max が品質と速度のトレードオフをシフトできる核心だと述べています。

これは重要です。というのも、単にサンプリングステップや精度を削減するだけでは、レイテンシは下がる一方で出力品質が劣化しかねないからです。fal は、候補となる最適化は、その結果得られたチェックポイントが自社の選好評価で引き続き有効である場合にのみ採用したと述べています。

MiniMax H3 はマルチモーダル生成の基盤を提供し、H3 Max はその基盤が品質・速度・コスト曲線のどこに位置するかを変えます。

What Are the Main Features of MiniMax H3 Max?

Stronger prompt adherence

プロンプト順守は直接的なポストトレーニングの対象でした。これは、複数のアクション、シーン遷移、カメラ指示、時間的制約、スタイル指示を組み合わせた構造化プロンプトで重要になります。

Faster-than-video-duration generation

H3 Max は、異例に低い生成レイテンシを目指して設計されています。fal は最適化されたインフラ上で、5 秒・768p のクリップをおおむね 3 秒程度以下で生成すると報告しており、よりタイトな反復的クリエイティブループを可能にします。

Native synchronized audio

H3 Max は H3 の音声・動画の共同生成アプローチを維持しており、台詞、アンビエンス、効果音、モーションを、統合された音声・映像ワークフローで協調生成できます。

Multiple generation workflows

H3 Max ファミリーは、テキストから動画、画像から動画、最初から最後のフレームの生成、参照から動画のワークフローをサポートします。

Built-in prompt expansion

テキストから動画のエンドポイントは、disabled、balanced、quality のようなプロンプト展開モードを公開しており、開発者は前処理時間と豊かなプロンプト解釈の間でトレードオフできます。

How Does MiniMax H3 Max Perform ?

Benchmarks of MiniMax H3 Max

プロバイダ実施のベンチマークは、ポストトレーニングが何を狙ったかを示すのに有用ですが、同じアリーナ手法の下で H3 Max と元の H3 を比較するには、継続更新される第三者の選好テストの方が有用です。

Benchmark snapshot — Sep. 18, 2026MiniMax H3 MaxMiniMax H3Difference
Text-to-Video with Audio Elo1227 ±91220 ±8+7
Text-to-Video samples5,6898,602
Image-to-Video with Audio Elo1195 ±101181 ±8+14
Image-to-Video samples5,5696,949
Video Editing with Audio EloNot ranked in this comparison1132 ±6

Benchmark methodology note. Artificial Analysis の数値は、日付付きのブラインドな人間選好 Elo のスナップショットであり、本稿ではスコア、95% 信頼区間、サンプル数、カテゴリ、スナップショット日を報告しています。正確なプロンプト、生成設定、評価手順は、最新の Artificial Analysis の手法 に照らして確認するべきです。fal の #1 の結果は fal のインフラ上でのプロバイダ実施であり、その公開比較チャート は、独立再現に必要なすべてのプロンプト、ハードウェア、サービングパラメータを開示していません。

現行スナップショットが支持するのは狭い結論です。すなわち、H3 Max は、直接比較可能な音声・動画生成の両カテゴリーで、より高い測定選好スコアを持つということです。信頼区間は重なるため、その差を普遍的または劇的な品質リードとして提示すべきではありません。

fal’s own H3 Max evaluation

fal は、12 の動画モデルとの直接対決評価において、総合選好、プロンプト理解、美観の各項目で H3 Max が 1 位だったと報告しています。これはプロバイダ実施の証拠であり、それ自体の代替ではなく、独立したアリーナデータと併せて読むのが最善です。

MiniMax H3 Max とは

Official fal H3 Max cost-vs-quality chart

最も有用な解釈は「H3 Max が普遍的に勝つ」ということではありません。H3 Max が H3 の速度と品質の作動点を実質的に改善した一方で、H3 に対する独立選好スコアの差は比較的控えめにとどまっている、ということです。

Speed, Quality, and the Trade-off

fal は、最適化されたインフラ上で 5 秒・768p の動画を 3 秒未満で生成すると報告しています。これは、fal の比較における公式 MiniMax H3 エンドポイントの約 35 倍のスループットに相当します。これはプロバイダ固有の推論に関する証拠として扱ってください。キューイング、ネットワーク転送、安全性チェック、異なるバックエンドは、エンドツーエンドのレイテンシを増加させ得ます。

品質優位は速度優位より控えめです。本稿で用いた 9 月 18 日の独立スナップショットでは、H3 Max は音声付きテキストから動画で H3 に対し 7 Elo、音声付き画像から動画で 14 Elo のリードでしたが、信頼区間は重なります。防御可能な結論は、H3 Max が速度—品質のフロンティアをシフトするというものであり、すべてのプロンプトで目に見えて優れた結果を保証するわけではない、ということです。

Practical choice: 反復速度、高スループットの短尺制作、プロンプト順守が重要なプロンプトには H3 Max を使用してください。ワークフローがより広範なマルチモーダルシステム、動画編集、オープンウェイトのデプロイ、または H3-Regenerate-2K に依存する場合は標準の H3 を優先してください。

How Much Do MiniMax H3 Max Cost?

価格は文脈が必要です。プロバイダの料金やプロモーションは独立して変動しうるからです。以下のスナップショットは、2026年9月18日に確認した公開表示の料金を反映しています。

Pricing sourceH3 MaxH3
fal 480p$0.025/sec promotional
fal 768p$0.04/sec promotional
fal 1080p refinement$0.08/sec promotional
MiniMax official 768p$0.08/sec
MiniMax official 2K$0.13/sec
MiniMax 768p → 2K regeneration$0.05/sec
CometAPI starting price$0.064/sec$0.064/sec

fal は現在、H3 Max の料金にローンチプロモーションのラベルを付けており、割引は 2026年9月30日で終了すると記載しています。CometAPI の MiniMax H3 Max API は現状 $0.064/秒 を表示し、CometAPI の MiniMax H3 API も $0.064/秒 から開始します。大規模な本番ワークロードを見積もる前に、プロバイダの料金を再確認してください。

How to try MiniMax H3 Max

CometAPI の MiniMax H3 Max API は現在、モデル ID minimax-h3-max、/v1/videos 配下の本番エンドポイント、非同期タスク処理、表示上の開始価格 $0.064/秒 で利用可能です。

  1. Create an API key. CometAPI にサインインし、トークンを作成して COMETAPI_KEY として安全に保管します。
  2. Submit a generation task. モデルに minimax-h3-max、プロンプト、duration、出力サイズを指定して https://api.cometapi.com/v1/videosPOST リクエストを送ります。image-to-video を使う場合は画像 URL を追加します。
  3. Poll the asynchronous task. 返却されたタスク ID を読み取り、ステータスが completed または failed になるまで GET /v1/videos/{task_id} をリクエストします。連続リクエストではなくポーリング間隔を設定してください。
  4. Download and review. GET /v1/videos/{task_id}/content を取得して MP4 を保存し、プロンプト順守、モーション、音声同期、視覚的アーティファクトを確認してからワークロードを拡大します。

H3 Max と H3 の公正な比較のために、プロンプト、duration、アスペクト比、解像度、参照入力、オーディオ設定、リトライ方針を固定してください。本番前にモデルページでライブのスキーマと価格を確認してください。ルーティングや公開パラメータは、基盤モデルとは独立に変更される可能性があります。

Limitations of MiniMax H3 Max

第一に、H3 Max は H3 の 2K 再生成ワークフローを置き換えません。現時点で文書化されている 1080p オプションは、ネイティブの 768p 出力からの精緻化であり、H3 が用いるコンテキスト内 2K 再生成経路と同一ではありません。

第二に、H3 Max の目玉となるレイテンシは fal の最適化された推論スタックに強く結びついているため、他のバックエンドでも同じ実時間速度を前提とすべきではありません。

第三に、H3 に対する独立した品質優位は現状控えめです。9 月 18 日のベンチマークスナップショットでは、音声付きテキストから動画で +7 Elo、音声付き画像から動画で +14 Elo であり、信頼区間は重なります。

最後に、「優れている」の意味が動画編集、マルチモーダル参照の奥行き、オープンウェイトのデプロイ、または最大出力解像度であって、単なる生成スループットではない場合、H3 は依然としてより広いシステムです。

Conclusion

MiniMax H3 Max は、より大きな後継ではなく、本番最適化された H3 バリアントとして理解するのが最適です。fal のポストトレーニングと推論のコーデザインにより、短尺の音声・映像生成を高速に行う説得力ある作動点が生まれる一方で、標準の H3 に対する独立選好の優位は普遍的というより控えめです。

反復速度、スループット、プロンプト順守が主要制約である場合は H3 Max を選びましょう。より広いマルチモーダルワークフロー、動画編集、オープンな H3-Base ウェイト、2K 再生成が必要な場合は標準の H3 を選びましょう。どちらに進むにせよ、同一のプロンプトと設定でコントロールされたベンチマークを実施し、生成秒単価ではなく「受け入れられたクリップあたりのコスト」を算出してください。

FAQ

How should teams interpret H3 Max's benchmark lead when the confidence intervals overlap?

リードは方向性を示す証拠として扱い、H3 Max がすべてのプロンプトで勝つ証明とは見なさないでください。引用したスナップショットでは、H3 Max は音声付きテキストから動画で H3 に対し 7 Elo、音声付き画像から動画で 14 Elo のリードですが、信頼区間は重なります。したがって、チームは代表的なプロンプトセットでテストし、勝率と失敗様式を報告し、控えめな集計リードを普遍的な品質主張にすり替えないようにすべきです。

How should teams compare the true production cost of H3 Max and H3 beyond the listed price per second?

生成秒単価ではなく「受け入れられたクリップあたりのコスト」を算出してください。リトライ、却下出力、1080p 精緻化または 2K 再生成、ストレージと転送、レビュー時間、下流の編集を含めます。H3 Max は高速生成と強いプロンプト順守によって反復コストを下げられる可能性があり、H3 はその編集機能、マルチモーダル制御、2K ワークフローによって追加ツールや手戻りを避けられる場合に、より経済的になり得ます。

What generation speed can teams realistically expect, and which factors affect end-to-end latency?

fal は、最適化されたインフラ上で 5 秒・768p のクリップに対し 3 秒未満の推論を報告しています。これは普遍的なエンドツーエンド保証ではありません。キュー時間、入力アップロード、プロンプト展開、安全性処理、解像度、duration、プロバイダのルーティングなどが観測レイテンシに影響します。導入予定のエンドポイントと構成そのものをベンチマークしてください

Which H3 Max workflow should be used for text-only, image-conditioned, keyframe-controlled, or reference-driven jobs?

シーンを言語だけで定義できる場合は text-to-video を使用し、アイデンティティ、構図、ビジュアルスタイルを供給フレームから始める必要がある場合は image-to-video を使用します。開始状態と終了状態の双方が重要な場合は first-to-last-frame 制御を選び、複数のビジュアル参照との整合性が重要な場合は reference-to-video を選びます。適切なワークフローを選ぶことでプロンプトの曖昧さが減り、H3 Max と H3 の比較前に固定すべきです。

How should teams choose among 480p, 768p, H3 Max 1080p refinement, and H3 2K regeneration?

480p は安価なドラフトや大規模コンセプトスクリーニングに使い、その後 768p に移行して通常の評価や多くのウェブ配信に用います。迅速な制作を優先しつつも配信フォーマットでより多くのピクセルが必要な場合は、H3 Max の 1080p 精緻化を選びます。最大のディテールとより広い H3 ワークフローが、より高いレイテンシとコストを正当化する場合は、H3 の 2K 再生成を選んでください。解像度ラベルだけで選ばず、実際の表示サイズで最終成果物を比較しましょう。

How does MiniMax H3's 2K regeneration differ from H3 Max's 1080p refinement?

はい。標準の MiniMax H3 は H3-Regenerate-2K を通じて 2K に到達できます。これは、元のマルチモーダル指示と 768p の結果の両方を再利用するコンテキスト内再生成段であり、従来の超解像パスを適用するのではなくディテールを再構築できます。最大解像度を求める場合に H3 を H3 Max より好む理由の一つです。

Which parts of MiniMax H3 are open-weight, and which parts still require hosted APIs?

一部です。MiniMax は、H3-Base の FL2VA と Ref2VA チェックポイントを H3 Community License の下で公開し、コアの 768p 生成をローカルで検証できるようにしました。完全な本番システムは完全にはオープンではありません。H3-Context-IR と H3-Regenerate-2K はホストされたコンポーネントのままであり、公式の 2K ワークフロー全体を再現するには MiniMax の API が必要です。

When should an API product choose H3 Max instead of standard H3?

多くの場合、低レイテンシ、迅速なクリエイティブ反復、本番スループットを重視するアプリケーションに適します。ただし自動的に優れる API 選択肢というわけではありません。2K 再生成、より広いマルチモーダル条件付け、動画編集、オープンウェイトのデプロイが必要な場合は標準の H3 が好ましいです。受け入れ基準テストを実施し、使用可能な出力あたりのコストを比較してから選択してください。

What should a production evaluation suite measure before switching from H3 to H3 Max?

プロンプト順守、モーション一貫性、視覚的アーティファクト、音質と同期、アイデンティティの一貫性、レビュアー受け入れ率を測定します。運用メトリクスとして、タスク失敗率、リトライ率、エンドツーエンドの p50 と p95 レイテンシ、受け入れられたクリップあたりのコストを追加します。テキストから動画、画像から動画、duration、解像度、アスペクト比、プロンプトの複雑さで結果をセグメントし、強い平均値の陰に本番クリティカルなシナリオの弱点が隠れないようにします。

学習を続ける

この記事を次の判断につなげる。

すべてのトピックを見る
公開日 Sep 21, 2026
最終更新 Sep 21, 2026
1 回視聴
明確性、出典の帰属、最新のAPI用語について確認済みです。

AI開発コストを20%削減する準備はできていますか?

数分で無料スタート。無料トライアルクレジット付き。クレジットカード不要。

もっと読む