TL;DR
Les modèles vidéo d’IA dépassent l’ancien schéma texte-vers-vidéo pour évoluer vers des systèmes capables de comprendre un brief créatif complet — texte, images, séquences de référence, mouvements, voix, musique et effets sonores — et de le transformer en une scène audiovisuelle cohérente. MiniMax a officiellement lancé H3 le 31 juillet 2026 en tant que modèle de génération omni‑modal polyvalent qui comprend conjointement le texte, l’image, la vidéo et l’audio, et génère des clips jusqu’à 15 secondes avec un son stéréo natif. Son changement clé est une architecture unifiée qui traite le texte‑vers‑vidéo, l’image‑vers‑vidéo, la génération de première/dernière image, la génération basée sur références, le transfert de mouvement, l’édition audiovisuelle et la création conditionnée par l’audio comme des variantes d’un seul problème de génération multimodale plutôt que des pipelines isolés. Le produit hébergé propose par défaut une sortie 2K via un flux où H3‑Base génère d’abord avec un côté court à 768p, puis H3‑Regenerate‑2K reconstruit la scène en utilisant le contexte original. Cette combinaison d’une qualité audiovisuelle compétitive, d’un contrôle multimodal flexible, de poids H3‑Base téléchargeables et d’une finition 2K contextuelle fait de H3 l’une des sorties vidéo techniquement les plus distinctives de 2026.
Key Takeaways
- Nouvelle architecture : Contextual Omni Representation, H3‑VAE, H3‑Omni Transformer et In‑Context Regeneration unifient la compréhension et la génération à travers les modalités.
- Améliorations de performance : H3 génère des clips de 4 à 15 secondes avec vidéo à 24 FPS, audio stéréo 32 kHz et sortie 2K hébergée reconstruite à partir du contexte multimodal original.
- API et disponibilité open‑weight : MiniMax fournit les API H3‑2K, H3‑Context‑IR et H3‑Regenerate‑2K, tandis que H3‑Base‑FL2VA et H3‑Base‑Ref2VA sont disponibles en checkpoints téléchargeables.
- Principaux cas d’usage : Publicité, branding, e‑commerce, design produit, UI/UX, jeu vidéo, cinéma, génération référencée, transfert de mouvement et édition audiovisuelle.
- Tarification et périmètre de déploiement : la tarification officielle à l’usage est de 0,08 $/seconde à 768P et 0,13 $/seconde à 2K ; seul H3‑Base est téléchargeable, tandis que H3‑Context‑IR et H3‑Regenerate‑2K restent des services hébergés.
What Is MiniMax H3?
MiniMax H3 est un système de génération audio‑vidéo omnimodal polyvalent développé par MiniMax. Au lieu d’accepter uniquement un prompt ou une image de référence, H3 peut raisonner sur un contexte contenant du texte, des images, des vidéos et de l’audio, puis générer une vidéo synchronisée et un son stéréo.
Le système H3 hébergé prend en charge des sorties de 4 à 15 secondes, une vidéo à 24 FPS et un audio stéréo 32 kHz. MiniMax présente le système hébergé comme fournissant par défaut du 2K. Techniquement, H3‑Base produit un résultat avec côté court à 768p et H3‑Regenerate‑2K réinjecte ce résultat et le contexte original dans H3 pour une reconstruction en 2K. MiniMax signale également une génération de dialogues stable dans 11 langues, dont l’anglais, le chinois, le japonais, le coréen, le français, l’allemand, l’espagnol, le portugais, l’italien, le russe et l’arabe.
Cette distinction est importante. Beaucoup d’anciens workflows vidéo sont en pratique des pipelines :
prompt -> vidéo muette -> voix -> effets sonores -> musique -> synchronisation
H3 modélise au contraire l’audio et la vidéo comme des parties d’un même processus de génération. Son H3‑Omni‑Transformer prédit conjointement les latents vidéo et audio, réduisant le besoin d’assembler après coup des étapes indépendantes de vidéo, doublage, musique et synchronisation.
MiniMax H3 Specifications at a Glance
| Specification | MiniMax H3 |
|---|---|
| Developer | MiniMax |
| Model category | Génération vidéo omnimodale polyvalente |
| Input modalities | Texte, image, vidéo, audio |
| Output | Vidéo plus audio stéréo natif |
| Output duration | 4–15 seconds |
| Base resolution | Côté court à 768p pour H3‑Base |
| Hosted resolution | Jusqu’à 2K via H3‑Regenerate‑2K 2K proposé par défaut ; produit via H3‑Regenerate‑2K après génération de base à 768p |
| Frame rate | 24 FPS |
| Audio | 32 kHz stéréo |
| Stable dialogue languages | 11 |
| Aspect ratios | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 et dimensions supplémentaires |
| Reference limits | Jusqu’à 9 images, 3 vidéos, 3 clips audio et 12 fichiers mixtes |
| Core generative model | H3‑Omni‑Transformer dense 33B |
| Position encoding | RoPE multimodal 3D |
| Open-weight checkpoints | H3‑Base‑FL2VA et H3‑Base‑Ref2VA |
| Checkpoint precision | BF16 |
| License | MiniMax H3 Community License |
Le chiffre 33B se réfère au H3‑Omni‑Transformer plutôt qu’à chaque composant utilisé dans l’ensemble du pipeline hébergé.
What Makes MiniMax H3 Different?
One Model for Multiple Video Tasks
La plupart des générateurs vidéo séparent historiquement texte‑vers‑vidéo, image‑vers‑vidéo, référence de mouvement, édition vidéo, génération audio et capacités de référence de sujet.
MiniMax adopte une approche différente. H3 a été pré‑entraîné autour de relations généralisées entre un contexte multimodal et la sortie souhaitée, permettant aux instructions de décrire ces relations en langage naturel.
Par exemple, un créateur peut demander conceptuellement à H3 de suivre le mouvement de caméra d’une vidéo, de préserver le personnage d’une image et d’utiliser un autre clip audio comme référence vocale. Les démonstrations de lancement de MiniMax utilisent ce type d’instruction intermodale pour illustrer le système de références généralisées de H3.
Cela rend H3 moins proche d’une collection de modes de génération et davantage d’un moteur créatif multimodal.
Native Video and Stereo Audio Generation
La description technique de MiniMax indique que le H3‑Omni‑Transformer prévoit conjointement des latents vidéo et audio. Le côté audio fonctionne via H3‑AudioVAE, qui compresse l’audio 32 kHz en une séquence latente à 40 Hz avant de décoder le résultat généré en son stéréo.
Cela confère à H3 un avantage pratique pour les scènes contenant des dialogues, de l’audio d’environnement, de la musique ou des effets sonores : le son fait partie du contexte génératif au lieu d’une étape de post‑production entièrement séparée.
Omni-Reference Inputs
H3‑Base‑Ref2VA prend en charge jusqu’à 9 images, 3 clips vidéo et 3 clips audio, sous réserve d’un maximum de 12 fichiers d’entrée mixtes. Les vidéos et clips audio de référence peuvent chacun durer 2 à 15 secondes, avec des restrictions de durée totales pour chaque modalité. L’audio ne peut pas servir d’unique entrée de référence en mode Ref2VA.
L’important n’est pas seulement la quantité de références. H3 est conçu pour déduire la relation entre ces ressources.
- préserver un personnage à partir d’une image ;
- reproduire un mouvement à partir d’un clip de référence ;
- transférer un style visuel ou cinématographique ;
- préserver ou remplacer l’audio ;
- utiliser une voix comme référence de timbre ;
- éditer une scène audiovisuelle existante à l’aide d’instructions en langage naturel.
In-Context 2K Regeneration
L’approche de H3 pour la haute résolution est particulièrement importante.
Au lieu de simplement passer la sortie 768p par un réseau de super‑résolution classique, H3‑Regenerate‑2K réintroduit le contexte multimodal original avec le résultat de base et demande à H3 de régénérer la scène en plus haute résolution.
L’avantage visé est la récupération sémantique. Un upscaler normal peut interpoler des pixels mais ne peut pas reconstruire de manière fiable des informations disparues — petites lettres, éléments de marque ou détails fins d’objets. L’étape de régénération de H3 peut à nouveau consulter le prompt et les références originaux lors de la construction du résultat 2K.

How Does the MiniMax H3 Architecture Work?
Le workflow H3 complet comporte trois étapes majeures :
H3‑Context‑IR -> H3‑Base -> H3‑Regenerate‑2K
H3‑Context‑IR interprète une instruction potentiellement complexe et multimodale et la convertit en une Context Intermediate Representation structurée. H3‑Base consomme cette représentation et génère une vidéo 768p plus audio. H3‑Regenerate‑2K combine ensuite le résultat généré avec le contexte original pour construire une version en plus haute résolution.

H3-Contextual Omni Representation and H3-Context-IR
Contextual Omni Representation est le concept de conception plus large de MiniMax : le langage sert de pont décrivant les relations entre le contexte, la cible et plusieurs modalités. Dans la description du système publiée, H3‑Context‑IR est la couche d’orchestration et de prétraitement hébergée qui analyse les instructions, associe les modalités, raisonne sur le temps et sérialise le résultat pour H3‑Base.
Le H3‑Encoder reste un composant spécifique au sein de H3‑Base. Il utilise les poids pré‑entraînés de Qwen3‑VL‑32B et transmet les états cachés de la couche 50 au H3‑Omni‑Transformer.
H3-VAE
La terminologie de lancement “H3‑VAE” couvre les représentations latentes visuelles et audio de la famille de modèles. La documentation open‑weight distingue H3‑VisualVAE de H3‑AudioVAE. H3‑VisualVAE utilise un encodage causal temporel avec une compression spatiale ×16, une compression temporelle ×4 et 24 canaux latents, suivis d’une patchification 1 × 2 × 2. H3‑AudioVAE compresse l’audio stéréo 32 kHz en tokens latents à un débit temporel de 40 Hz.
H3-Omni-Transformer
Le billet de lancement orthographie le nom “H3‑Omni Transformer” ; la documentation technique open‑weight utilise “H3‑Omni‑Transformer”. Les deux se réfèrent au même composant génératif central. Il s’agit d’un Transformer dense, monoflux, de 33B paramètres. Environ 13B de paramètres résident dans des branches liées à AdaLN ; leurs sorties de modulation peuvent être pré‑calculées et mises en cache, de sorte qu’elles n’ont pas besoin de rester chargées lors d’un déploiement en inférence seule.
Les composants spécifiques à une modalité sont concentrés dans les couches d’entrée/sortie et les branches AdaLN, tandis que le Transformer central opère sur une séquence packée unifiée. RoPE multimodal tridimensionnel représente les positions temporelles et spatiales sur (t, h, w).
H3-In-Context Regeneration
Le billet de lancement de MiniMax appelle la technique H3‑In‑Context Regeneration ; le module de production est nommé H3‑Regenerate‑2K. Il réinjecte le résultat 768p et le contexte original dans H3 pour reconstruire une sortie 2K, permettant de régénérer des détails sémantiques plutôt que de simplement les interpoler.
Is MiniMax H3 Really Open Source?
Déplacé ici depuis sa position précédente après la section de comparaison, car la frontière open‑weight est une distinction architecturale clé.
“Open‑weight” est plus précis que “entièrement open source”. MiniMax met à disposition les checkpoints H3‑Base‑FL2VA et H3‑Base‑Ref2VA pour un usage local, incluant les composants nécessaires du processeur, tokenizer, encodeur de texte, Transformer, VAE visuel et VAE audio.
Cependant, le pipeline de production complet n’est pas téléchargeable de bout en bout. H3‑Context‑IR reste hébergé, et H3‑Regenerate‑2K n’est pas inclus dans la première sortie open‑weight. La génération locale H3‑Base vise une résolution à côté court 768p ; reproduire le workflow officiel complet 2K requiert des services hébergés pour le traitement de contexte et la régénération.
H3 utilise également la MiniMax H3 Community License plutôt qu’une licence permissive standard comme Apache 2.0 ou MIT. Les organisations doivent examiner les conditions de territoire, d’attribution, de sécurité et d’usage commercial de la licence avant déploiement.
MiniMax H3 Benchmark Performance
Les documents de lancement de MiniMax se concentrent principalement sur des démonstrations, l’architecture et des cas d’usage, plutôt que de publier une matrice de benchmark de type VBench classique. Pour une photographie plus neutre, une source utile est Video Arena d’Artificial Analysis, où les utilisateurs comparent à l’aveugle des générations à partir des mêmes prompts.
| Artificial Analysis task | H3 rank | H3 Elo | Leader | Leader Elo |
|---|---|---|---|---|
| Text-to-Video with Audio | #4 | ≈1,228 | Wan 3.0 | 1,242 |
| Image-to-Video with Audio | #3 | 1,185 | H3 Max, post‑entraîné par fal | 1,202 |
| Video Editing with Audio | #2 | 1,129 | Wan 3.0 | 1,190 |
Ces classements constituent un instantané au 2 septembre 2026, et non des scores permanents. H3 rivalise avec les principaux systèmes propriétaires et se distingue particulièrement parmi les entrées open‑weight. Sa proposition de valeur tient à la combinaison d’une qualité compétitive, de la génération audiovisuelle native, de références multimodales et de poids de base téléchargeables — pas simplement à une revendication du score de benchmark le plus élevé.
MiniMax H3 Pricing
Les prix suivants à l’usage ont été revérifiés par rapport à la page de tarification officielle de MiniMax le 24 septembre 2026. Les prix peuvent changer ; les équipes de production doivent donc les revalider avant budgétisation.
| Usage | Official list price |
|---|---|
| H3 generation at 768P | $0.08/second |
| H3 generation at 2K | $0.13/second |
| 768P → 2K regeneration output | $0.05/second |
| Standard-generation reference audio | Free |
| Standard-generation reference images | First 5 free; then $0.04/image |
| Regeneration reference images | First 5 free; then $0.025/image |
| Regeneration reference video | $0.05/second of original 768P input |
| H3-Context-IR input | $0.90/M tokens |
| H3-Context-IR output | $3.60/M tokens |
Au prix catalogue, une génération directe de 10 secondes coûte environ 0,80 $ à 768P ou 1,30 $ à 2K ; une génération de 15 secondes coûte environ 1,20 $ ou 1,95 $. Ces exemples excluent les références facturables, les tokens Context‑IR et d’autres frais spécifiques au workflow.
MiniMax H3 est également disponible via CometAPI. Sa page modèle annonce un tarif de départ de 0,064 $/seconde sous l’ID de modèle minimax-h3. Les prix affichés par des tiers peuvent dépendre de l’itinéraire, de la résolution et des règles de facturation ; ils ne doivent donc pas être considérés comme des tarifs unitaires universels.
MiniMax H3 vs Wan3.0 vs Seedance 2.5 vs Vidu Q3
Les concurrents les plus utiles ne sont pas nécessairement des modèles identiques sur le papier. MiniMax H3, Wan3.0, Seedance 2.5 et Vidu Q3 mettent l’accent sur des parties différentes du workflow vidéo professionnel.
| Dimension | MiniMax H3 | Wan3.0 | Seedance 2.5 | Vidu Q3 |
|---|---|---|---|---|
| Maximum single generation | 15s | 30s | 30s | 16s |
| Video resolution | 2K hébergé ; base open‑weight 768p | Jusqu’à 1080P | Dépend de l’itinéraire | Jusqu’à 1080P |
| Native audio-video | Yes | Yes | Yes | Yes |
| Reference inputs | Texte, image, vidéo, audio | Image, vidéo, audio, documents, webpages | Images, vidéos, audio | Workflows image/référence |
| Reference capacity | 12 fichiers mixtes | Jusqu’à 20 matériaux | Jusqu’à 50 matériaux | Non indiqué sur la page principale |
| Major differentiator | H3‑Base open‑weight plus régénération 2K | 30s plus larges entrées | Narration 30s avec large ensemble de réf. | Courtes scènes narratives et contrôle de dialogue |
| Strongest fit | Pipelines créatifs personnalisables | Production longue tout‑en‑un | Storytelling commercial riche en références | Courtes scènes dramatiques et dialogue |
Which Model Is Better?
Il n’y a pas de vainqueur universel. Choisissez MiniMax H3 lorsque les poids ouverts, le conditionnement multimodal, l’audio stéréo natif, l’édition audiovisuelle et la finition 2K comptent plus que la durée maximale du clip. Choisissez Wan 3.0 lorsque la sortie 30 secondes, 1080P, des références document/web étendues et de solides performances en arena sont prioritaires. Choisissez Seedance 2.5 pour de très grands ensembles de références, une structure narrative sur 30 secondes, une cohérence d’identité ou un montage ciblé. Choisissez Vidu Q3 pour de courtes scènes narratives, des dialogues multi‑personnes, le timing et un contrôle de caméra de type réalisateur.
Une évaluation responsable doit exécuter le même ensemble de prompts internes sur toutes les API candidates. Les classements publics n’exposent pas toujours des versions directement comparables, et remplacer par une variante plus ancienne ou “turbo” peut fausser le résultat.
What Are MiniMax H3's Main Limitations?
- Durée : H3 culmine à 15 secondes, tandis que certains concurrents prennent désormais en charge des générations de 30 secondes.
- Portée open‑weight : seul H3‑Base est téléchargeable ; Context‑IR et la régénération 2K restent hébergés.
- Exigences matérielles : un modèle vidéo dense de 33B demeure coûteux à déployer localement, même avec des optimisations d’inférence.
- Complexité tarifaire : génération, régénération, vidéos et images de référence, et Context‑IR peuvent générer des frais séparés.
- Conditions de licence : la Community License nécessite un examen juridique plus approfondi que les licences permissives standard.
- Volatilité des benchmarks : les classements d’arena évoluent et ne remplacent pas des tests spécifiques à la charge de travail.
Who Should Use MiniMax H3?
H3 convient particulièrement aux développeurs et aux équipes créatives construisant des workflows vidéo multimodaux nécessitant des sujets cohérents, des références de mouvement ou de voix, un audio stéréo natif, de l’édition et une finition haute résolution. Il est également pertinent pour les équipes souhaitant personnaliser ou auto‑héberger le modèle de base tout en n’utilisant les étapes hébergées qu’en cas de besoin.
Les équipes ayant principalement besoin de la plus longue génération unique, du déploiement local le plus léger ou d’une pile de bout en bout entièrement permissive peuvent préférer un autre modèle. MiniMax met en avant la publicité, le branding, l’e‑commerce, le design produit, l’UI/UX, le jeu vidéo et le cinéma comme scénarios de création commerciale.
How Can Developers Access MiniMax H3?
Il existe trois voies principales :
- Utiliser les produits hébergés de MiniMax, dont Hailuo et MiniMax Design.
- Utiliser la MiniMax Open Platform de première partie pour les API H3‑2K, H3‑Context‑IR et H3‑Regenerate‑2K.
- Télécharger les checkpoints H3‑Base pour un déploiement local via le dépôt officiel et les frameworks d’inférence pris en charge.
Pour les détails d’implémentation, utilisez la documentation officielle des API et du déploiement liée dans la liste des sources ci‑dessous ; cet article reste centré sur l’évaluation produit.
Conclusion
L’importance de MiniMax H3 tient moins au fait qu’il mène chaque métrique individuelle qu’à sa capacité à compresser une chaîne de production fragmentée en un système multimodal programmable unique. Les poids H3‑Base téléchargeables offrent aux développeurs la latitude de prototyper, personnaliser et itérer localement, tandis que les étapes hébergées H3‑Context‑IR et H3‑Regenerate‑2K fournissent le traitement d’instructions plus riche et la finition haute résolution nécessaires au travail de production. Ce modèle hybride crée aussi des compromis : la limite de 15 secondes, les besoins d’infrastructure locale, la dépendance aux services hébergés, les coûts au niveau du workflow et les conditions de la Community License doivent tous être évalués au regard des prompts réels et des contraintes de livraison d’une équipe. Pour les équipes qui privilégient le contrôle via références multimodales, l’audio natif synchronisé, l’édition audiovisuelle et des masters 2K, H3 est une plateforme convaincante ; celles qui ont surtout besoin de clips plus longs ou d’une pile entièrement autonome et permissive devraient comparer des alternatives avant de s’engager.
FAQ
How should a production team divide work between local H3-Base and MiniMax’s hosted services?
Un workflow hybride pratique consiste à utiliser H3‑Base local pour l’exploration rapide, l’itération de prompts, les tests de références et toute étape où le contrôle de l’infrastructure ou la localité des données importe. Les sorties prometteuses peuvent ensuite passer à H3‑Context‑IR hébergé pour un traitement d’instructions plus riche et à H3‑Regenerate‑2K pour la livraison en résolution finale. La bonne répartition dépend de la capacité GPU, du délai d’exécution, des exigences de gouvernance et de la mesure dans laquelle le gain de qualité des étapes hébergées justifie le surcroît de transfert, de latence et de facturation.
What should an internal evaluation set measure before a team adopts H3?
N’évaluez pas H3 uniquement avec des prompts visuellement impressionnants. Utilisez un ensemble reproductible de briefs de production réels et notez l’adhérence aux instructions, la cohérence des sujets et des marques, la stabilité temporelle, le rendu du texte, la précision des mouvements de caméra, la synchronisation audio‑vidéo, la qualité des dialogues, la fidélité de régénération, la latence, le taux d’échec et le coût total par clip accepté. Exécutez les mêmes ressources et critères d’acceptation sur les modèles concurrents afin que les classements publics ne se substituent pas aux preuves issues de la charge de travail réelle de l’équipe.
How should multimodal reference assets be prepared to improve controllability?
Les ressources de référence doivent avoir des rôles clairs et non conflictuels : une image peut définir l’identité, un clip peut définir le mouvement et un échantillon audio peut définir la voix ou l’ambiance. Supprimez les références de faible qualité ou contradictoires, coupez les clips à l’action pertinente et indiquez explicitement la relation entre chaque ressource et la sortie cible dans l’instruction. Commencer avec l’ensemble de références le plus petit suffisant facilite l’identification de la ressource qui améliore le résultat et de celle qui introduit de l’ambiguïté.
Which production costs are easy to miss when comparing H3 with another API?
Le prix par seconde de génération n’est que la base visible. Un modèle de coûts réaliste doit inclure les vidéos de référence facturables et les images supplémentaires, les tokens Context‑IR, la régénération 2K, les relances, les générations rejetées, la capacité GPU locale, le stockage et le transfert média, la gestion de la modération, l’intégration technique et la revue humaine. La comparaison utile est le coût par livrable approuvé à la résolution requise — pas le coût par génération brute.
How should teams interpret “2K by default” when H3-Base itself generates at 768p?
Les expressions décrivent différentes couches du produit. “2K par défaut” se réfère à l’expérience commerciale hébergée, tandis que 768p décrit la sortie à côté court de l’étape téléchargeable H3‑Base ; H3‑Regenerate‑2K reconstruit ensuite la sortie finale en utilisant à la fois le résultat de base et le contexte original. Les tests de qualité doivent donc comparer la sortie locale 768p et la sortie hébergée 2K finale comme des étapes de workflow distinctes, en prêtant attention à la capacité de la régénération à restaurer le texte, le branding, les visages et les détails fins plutôt que d’augmenter seulement les dimensions en pixels.
When is MiniMax H3 unlikely to be the best first choice?
H3 peut être un mauvais choix lorsqu’un projet exige des clips en un seul passage beaucoup plus longs, une finition 2K entièrement locale, une licence permissive standard, un investissement GPU minimal ou un workflow texte‑vers‑vidéo très simple qui gagne peu des références multimodales. Dans ces cas, la valeur de l’architecture généralisée de H3 peut ne pas compenser la complexité opérationnelle supplémentaire. Une preuve de concept courte utilisant des prompts représentatifs est le moyen le plus sûr de déterminer si son contrôle et son intégration audio‑vidéo améliorent matériellement le livrable final.
