TLDR 高速な探索、大量のソーシャル/広告コンテンツ、コスト効率のよいテストには H3 Max を選択。2K 納品、より深い参照制御、オープンウェイト、最終的な仕上げが必要な場合は H3 に切り替え。
MiniMax H3 は、MiniMax が提供するオープンウェイトでプロダクション指向のマルチモーダル動画モデルで、ネイティブのステレオ音声、最大 2K 解像度(ホスティング時)、豊富なマルチモーダル参照(画像・動画・音声)、商用最終成果物に向けた強力なコントロールを備えています。MiniMax H3 Max は fal Research によるポストトレーニング版で、極端な速度(5 秒・768p クリップを 3 秒未満)、独立系リーダーボードでのより強いプロンプト追従性と美学、480p/768p における低レイテンシ反復に最適化されています。両者ともネイティブ同期音声を生成し、CometAPI などの統一プラットフォームからアクセスできます。
重要なポイント
- 現時点で H3 Max は Artificial Analysis の with-audio リーダーボードでベースの H3 より上位にランク(image-to-video: 1 位 Elo 1,204 対 H3 3 位 Elo 1,184/text-to-video: 3 位 Elo 1,235 対 H3 4 位 Elo 1,226。いずれも 2026 年 8 月下旬のスナップショット)。
- 速度差は顕著:fal は公式 H3 エンドポイント比で約 ~35× のスループット、5 秒・768p 生成が 3 秒未満と報告。
- 解像度上限に本質的差:H3 Max は 768p が上限(ネイティブは 480p/768p)。ホスト版 H3 は再生成ステージで 2K に到達。セルフホスト/オープンウェイト版 H3 も 768p 制限。
- 両モデルとも text-to-video、image-to-video、先頭/末尾フレーム制御、ネイティブ 32 kHz ステレオ音声、24 fps、最大 15 秒に対応(H3 は 4 秒から、H3 Max は 5 秒から)。参照マルチモーダル入力は H3 の方がより強力または網羅的だが、H3 Max も一部プラットフォームで後発的に参照モードを追加。
- 価格は競争力がありプラットフォーム依存。MiniMax 公式レート(2026 年 9 月中旬時点)は H3 が 約 $0.08/s(768p)/$0.13/s(2K)、H3 Max が $0.05/s(480p)/$0.08/s(768p)。CometAPI のようなアグリゲーターは実効コストを改善し、マルチモデルの運用を簡素化することが多い。
- 実務的ワークフロー:H3 Max で素早く低コストに反復し、高解像度や参照が重いショットは H3 で仕上げ。
- 両モデルとも広告、ソーシャル、EC、ブランディング、シネマティックな短尺でプロダクション対応。CometAPI の単一の OpenAI 互換エンドポイントから効率的にアクセス可能(モデル ID は
minimax-h3とminimax-h3-max)。
MiniMax H3 Max と MiniMax H3:クイック比較
| 次元 | MiniMax H3 Max | MiniMax H3 |
|---|---|---|
| 起源 | H3 オープンウェイト + fal によるポストトレーニング | MiniMax H3 オリジナル基盤 |
| 開発者 | MiniMax H3 を基にした fal Research | MiniMax |
| 中核目的 | 速度、追従性、美観 | 汎用オムニモーダル生成 |
| 基盤アーキテクチャ | H3 ベース | 33B dense H3-Omni-Transformer |
| 主な入力 | テキスト、画像、参照 | テキスト、画像、動画、音声 |
| Text-to-Video | Yes | Yes |
| Image-to-Video | Yes | Yes |
| 先頭/末尾フレーム制御 | Yes | Yes |
| 参照からの動画生成 | Yes | Yes |
| 動画編集 | 主要な H3 Max エンドポイントの目的ではない | Yes |
| ネイティブ音声 | Yes | Yes |
| 尺 | 5–15 秒 | 4–15 秒 |
| ネイティブ/ベース解像度 | 最大 768p | 768p |
| 高解像度ワークフロー | 1080p の潜在精緻化 | H3-Regenerate-2K による最大 2K |
| フレームレート | 24 FPS | 24 FPS |
| オープンウェイトの位置付け | ホストされたポストトレーニング版 H3 | H3-Base チェックポイントを公開 |
| 主な強み | 推論スループットと追従性 | マルチモーダルの幅、2K、編集 |
| 最適な適用 | 高速な T2V/I2V 反復 | 完全なマルチモーダルのプロダクションワークフロー |
| コンテキストウィンドウ | ホストされた H3 Max 動画エンドポイントにはトークンベースの仕様は公開なし | トークンベースの仕様はなし。H3 は制約付きのマルチモーダル参照入力を文書化 |
| 推論(Reasoning) | 汎用推論モデルとしては位置付けず。プロンプト拡張は利用可能 | H3-Context-IR がマルチモーダル指示理解を扱うが、汎用推論 API としては未文書化 |
| コーディング | 該当せず:H3 Max は動画生成モデル | 該当せず:H3 は動画生成モデル |
| API 提供状況 | fal および CometAPI を通じたホスト API が利用可能 | MiniMax API、公開 H3-Base ウェイト、CometAPI でのアクセスが利用可能 |
2026 年中盤から後半にかけて、MiniMax H3 と、その速度最適化版である H3 Max の登場により、AI 動画生成の状況は大きく変化しました。クリエイター、代理店、開発者は、最大限の制作コントロール/解像度と、最大限の反復速度/スループットの間で、実務的で明快な選択が可能になりました。本ガイドでは、アーキテクチャの起源、ベンチマーク、機能差、価格、実運用ユースケース、推奨アクセス手順を解説し、CometAPI などのプラットフォームが両モデルの本番利用をどのように容易かつ高コスト効率にするかも取り上げます。
MiniMax H3 とは?
MiniMax H3(広義の Hailuo 系譜で言及されることもある)は、MiniMax が 2026 年 7 月下旬に公開した汎用オムニモーダル生成システムで、オープンウェイトはその後ほどなく(2026 年 8 月 3 日、地域的配慮を含むコミュニティライセンス)公開されました。
テキスト、画像、動画、音声といったマルチモーダル文脈を統合的に理解し、単一パスでネイティブのステレオ音声付き動画を生成します。主な技術ハイライトは以下の通りです。
- 出力尺:24 fps で 4–15 秒。
- 解像度:デフォルトは短辺 768p。ホストパイプラインでは専用の再生成ステージ(H3-Regenerate-2K)により 2K(2560×1440 クラス)に対応。セルフホストのオープンウェイトは 768p のまま。
- アスペクト比:21:9、16:9、4:3、1:1、3:4、9:16(インターフェースによってはアダプティブも)。
- 音声:32 kHz ステレオを映像と同時生成—台詞、フォーリー、環境音、音楽が既に同期済み。基本的な同期に別モデルや後処理は不要。
- コンディショニングモード:Text-to-Video、先頭フレーム・末尾フレーム・先頭+末尾フレームの Image-to-Video、フル・オムニ参照(最大 9 枚の画像 + 最大 3 本の動画クリップ[各 2–15 秒、合計 ≤15 秒]+ 視覚参照に付随必須の最大 3 本の音声クリップ)。
- アーキテクチャ注記:Contextual Omni Representation、H3-VAE(高圧縮)、H3-Omni Transformer、In-Context Regeneration を活用。オープンリリースには FL2VA(先頭/末尾フレーム重視)と Ref2VA(参照重視)の Transformer 変種を含む。
MiniMax は H3 を、広告、ブランディング、EC、プロダクトデザイン、UI/UX モーション、ゲームなど、商用コンテンツ制作向けに位置付けています。指示追従性、正確なテキスト/ブランド描画、動画から動画へのモーション転写を重視。オープンウェイトにより、ローカル展開、研究、独自のポストトレーニングが可能で、これが後の H3 Max の土台となりました。
MiniMax H3 Max とは?
MiniMax H3 Max は、オープンウェイトの MiniMax H3 ベースを fal Research が MiniMax と連携してポストトレーニングした派生モデルで、2026 年 8 月 27 日頃に公開。最大速度、より強いプロンプト追従性、美観を重視しつつ、親モデルの中核的な音声・映像品質を維持しています。
主な特徴:
- 生成速度:fal の最適化推論スタックでは、5 秒・768p クリップを 3 秒未満で生成—公式 MiniMax H3 エンドポイント比で概ね 35× のスループット、多くの実運用シナリオで実時間を大きく上回る速度。
- 解像度:ネイティブは 480p と 768p(プラットフォームによって限定的な 1080p 精緻化オプションの言及あり。ただし再生成ステージがオープンウェイトに含まれないため、構造的上限はフル 2K 未満)。
- 尺:5–15 秒(秒数は整数)。
- 入力:Text-to-Video と Image-to-Video(先頭/末尾フレーム制御)。マルチモーダル参照(画像/動画/音声)はローンチ後に複数プラットフォームで追加されたが、実装によっては完全版 H3 より表面機能が絞られる場合あり。
- ネイティブステレオ音声:H3 同様に同時生成。
- ベンチマーク:fal と第三者アリーナ(Artificial Analysis、Design Arena)による独立の人間嗜好評価で、総合品質、プロンプト理解、美観で H3 を上回るか同等のトップ水準を記録することが多い。
MiniMax H3 Max は、従来の「品質 vs 速度」のトレードオフを打破し、低レイテンシながら高い嗜好スコアを実現します。
重要なのは、“Max” が常に優れていることを意味しない点です。スループットと反復速度に重心を移しつつ、768p ティアにおける H3 の音声・映像的強みの大半を継承した、という意味です。
ベンチマーク性能と品質
独立アリーナの指標が有用です。Artificial Analysis の with-audio ボード(2026 年 8 月下旬のスナップショット)では、H3 Max が image-to-video(Elo 1,204)で首位、text-to-video(Elo 1,235)で 3 位となり、ベースの H3(それぞれ 1,184 と 1,226)を僅差で上回りました。差は小さいながらも一貫し、text-to-video の上位は極めて拮抗していました。
fal の内部人間嗜好評価(信頼区間付きベイズ Elo)では、H3 Max は総合品質、プロンプト理解、美観でオリジナル H3 を含む主要モデル群に対して 1 位。Design Arena も、H3 レベルの品質を劇的な速度で実現する点を指摘しています。
これらはベンダーの自己申告ではなく、ブラインドの嗜好テストによるため、実務上の意味があります。実際、多くのユーザーは、768p において H3 Max の方が複雑なプロンプトにより反応的で、審美的にも好ましい結果が得られると感じる一方、H3 の優位は高解像度や重い参照コンディショニングで特に明確だと報告しています。
時間的一貫性、モーション品質、(台詞がある場合の)リップシンク、テキスト/ブランド描画は、いずれも 2025 年〜2026 年前半の旧世代システムと比べて両モデルの強みです。音声・映像の同時生成により、従来のポストプロダクションの摩擦が一段階取り除かれます。
速度、レイテンシ、スループットの実際
「5 秒・768p を 3 秒未満」という数値は制作ワークフローを変えます。コンセプト探索、モーションの A/B テスト、プロンプト精緻化、大量のソーシャル用短尺生成が、バッチではなくインタラクティブに。fal は、ポストトレーニングに加え、推論基盤の最適化(マルチノード提供、カーネルキャッシュ、FlashPack 風手法、オートスケーリング)への大規模投資を速度向上の要因として挙げています。
fal は、5 秒・768p の MiniMax H3 Max 生成が約 3 秒以下で、ローンチ時比較における公式 H3 エンドポイント対比で概ね 35× のスループットであると述べています。
ただし、これはあらゆる GPU やプロバイダで本質的に 35× の優位を保証するものではありません。速度の一部は、ポストトレーニングされたモデルと fal の推論エンジンの共同設計に起因します。本番レイテンシは、キューイング、解像度、尺、バッチ、精度戦略、キャッシュ、エンドポイント実装にも依存します。
解像度、尺、技術的制約
解像度は最も明確な構造的差異です。ホスト版 H3 の 2K パイプラインは、元のコンテキストを利用する第 2 段の再生成で、オープンウェイトには含まれません。そのため、それらウェイトから派生したすべてのポストトレイン—H3 Max を含む—は 768p に上限があります。
最短尺もわずかに異なり(4 秒 vs 5 秒)、非常に短いトランジションやソーシャル形式では差となる場合があります。両モデルとも、VAE に適したグリッドにフレーム数をスナップし、同系統のアスペクト比をサポートします。
参照制限は H3 の方が寛容で文書化も進んでいます。H3 Max はローンチ以降、複数のホストで参照機能を拡充していますが、複雑な多数画像によるキャラクター一貫性、参照クリップからのモーション転写、音声による誘導に依拠するチームは、選択するエンドポイントの具体的な表面機能を確認すべきです。
MiniMax H3 Max は MiniMax H3 より速い?
fal の最適化インフラ上では、はい。fal は、5 秒・768p の H3 Max 生成が約 3 秒以下であり、ローンチ比較では公式 H3 エンドポイント対比で概ね 35× のスループットであると報告しています。
ただし、これはあらゆる GPU やプロバイダで本質的に 35× の優位を意味するわけではありません。速度の一部は、ポストトレーニングモデルと fal 推論エンジンの共同設計に起因します。本番レイテンシは、キュー、解像度、尺、バッチ、精度戦略、キャッシュ、エンドポイント実装にも左右されます。
どちらを使うべきか:MiniMax H3 Max か MiniMax H3 か?
高速生成には MiniMax H3 Max を選ぶ
H3 Max は、高速な Text-to-Video や Image-to-Video の反復、インタラクティブなユーザー体験、大量の短尺動画生成、詳細なプロンプトで恩恵のある強い指示追従性、そして 480p/768p あるいは 1080p 精緻化で十分な案件に適しています。
幅広いプロダクション制御には MiniMax H3 を選ぶ
最終出力を 2K にしたい、より豊かなマルチモーダル参照、動画編集、オープンウェイト展開、H3-Base チェックポイントでの直接実験が必要なワークフローでは標準の H3 が適しています。
二段構成のワークフローも有効
多くのチームでは、両モデルは相補的です。H3 Max で素早くコンセプトを反復し候補を作り、2K 再生成や編集、より深いマルチモーダル条件付けが必要な段階で標準 H3 に移行するやり方が機能します。
MiniMax H3 Max は MiniMax H3 より優れている?
最も正確には、動画生成パイプラインの異なる部分を最適化している、ということです。H3 Max は本記事で参照した 2 つの比較可能な Artificial Analysis カテゴリで H3 より高い嗜好スコアを記録しており、fal による最適化推論は大幅に高速です。
一方で MiniMax H3 は、より広い能力範囲—公開された H3-Base ウェイト、豊かなマルチモーダルワークフロー、動画編集、2K 再生成—を維持しています。
MiniMax H3 Max は速度と追従性に最適化された H3 の変種であり、H3 はより完全なオムニモーダル動画基盤です。
インタラクティブ生成や高スループットの API ワークロードには H3 Max が特に有力。最大解像度、オープンウェイトでのカスタマイズ、編集、幅広いマルチモーダル制作には、H3 が H3 Max の設計範囲外の能力を保持しています。
CometAPI 経由での MiniMax H3 と H3 Max へのアクセス
MiniMax、fal、その他ホスト間で鍵や課金、微妙に異なるリクエストスキーマを個別管理するのは運用負荷になります。CometAPI は 500+ モデル—MiniMax H3(minimax-h3)と MiniMax H3 Max(minimax-h3-max)を含む—へのアクセスを、単一の API キーとベース URL(https://api.cometapi.com/v1)の背後に統合した OpenAI 互換ゲートウェイを提供します。
動画ワークフローにおける利点:
- テキスト・画像・動画モデルに対して、資格情報はひとつ、リクエストパターンは一貫。
- 多くのモデルでベンダー直販価格比 20–40% 低い競争力のある価格設定。純粋な従量課金で月額固定費は不要。
- 切り替えが簡単:
modelフィールドを変えるだけで H3、H3 Max、他の競合動画モデル間を移動可能。 - エンタープライズ向けの信頼性(稼働率目標 99.9%)と動画エンドポイント向けの開発者フレンドリーなドキュメント。
- 同一アプリ内で、H3/H3 Max による生成と LLM オーケストレーション、画像モデル、他ツールをベンダー分散なく組み合わせ可能。
CometAPI のドキュメントには、MiniMax H3 / H3 Max の動画作成(Text-to-Video、Image-to-Video、参照モード、サイズ/尺制御)に関する具体的なガイドが含まれています。新規ユーザーにはテストクレジットが付与されることが多く、試行の障壁を下げます。
既に OpenAI SDKs を使用しているチームにとっては、ベース URL とキーを差し替えるだけで移行可能。これにより、MiniMax H3 ファミリーのスピード層とプロダクション層の双方—および補完的モデル群—への信頼性が高く費用対効果のよいアクセスを必要とする本番パイプラインに対して、CometAPI は実践的な選択肢となります。
結論:ジョブに最適なモデルを選ぶ
MiniMax H3 と H3 Max は序列ではなく相補関係です。H3 Max は、高ボリュームで反復的な動画制作を実用化する速度と嗜好スコアを提供。H3 は、最終商用品質に必要な解像度の余裕、参照の深さ、オープンなエコシステムを供給します。多くのチームにとって最適戦略はハイブリッド:Max で速く進め、H3 で仕上げる。
両モデルはすでに広告、ソーシャル、EC、短尺シネマティックなどの本番パイプラインに十分成熟しています。CometAPI のようなプラットフォームは統合の摩擦を大幅に減らし、開発者やクリエイターがベンダー管理ではなく、クリエイティブ品質とコスト管理に集中できるようにします。
