TL;DR
Los modelos de video con IA están yendo más allá de la antigua fórmula de texto-a-video hacia sistemas capaces de entender un briefing creativo completo—texto, imágenes, metraje de referencia, movimiento, voces, música y efectos de sonido—y convertirlo en una escena audiovisual coherente. MiniMax lanzó oficialmente H3 el 31 de julio de 2026 como un modelo de generación omni-modal de propósito general que comprende conjuntamente texto, imágenes, video y audio, y genera clips de hasta 15 segundos con sonido estéreo nativo. Su cambio clave es una arquitectura unificada que trata el texto-a-video, imagen-a-video, generación de primer/último fotograma, generación basada en referencias, transferencia de movimiento, edición audiovisual y creación condicionada por audio como variaciones de un mismo problema de generación multimodal en lugar de pipelines aislados. El producto alojado ofrece salida 2K por defecto mediante un flujo en el que H3-Base primero genera con el lado corto a 768p y luego H3-Regenerate-2K reconstruye la escena utilizando el contexto original. Esta combinación de calidad audiovisual competitiva, control multimodal flexible, pesos descargables de H3-Base y acabado a 2K consciente del contexto convierte a H3 en uno de los lanzamientos de video técnicamente más distintivos de 2026.
Key Takeaways
- New architecture: Contextual Omni Representation, H3-VAE, H3-Omni Transformer e In-Context Regeneration unifican la comprensión y la generación entre modalidades.
- Performance improvements: H3 genera clips de 4 a 15 segundos con video a 24 FPS, audio estéreo a 32 kHz y salida alojada a 2K reconstruida desde el contexto multimodal original.
- API and open-weight availability: MiniMax ofrece APIs alojadas de H3-2K, H3-Context-IR y H3-Regenerate-2K, mientras que H3-Base-FL2VA y H3-Base-Ref2VA están disponibles como checkpoints descargables.
- Main use cases: Publicidad, branding, comercio electrónico, diseño de producto, UI/UX, gaming, cine, generación guiada por referencias, transferencia de movimiento y edición audiovisual.
- Pricing and deployment boundary: El precio oficial de pago por uso es de $0.08/segundo a 768P y $0.13/segundo a 2K; solo H3-Base es descargable, mientras que H3-Context-IR y H3-Regenerate-2K siguen siendo servicios alojados.
What Is MiniMax H3?
MiniMax H3 es un sistema de generación audio-video omni-modal de propósito general desarrollado por MiniMax. En lugar de aceptar únicamente un prompt o una imagen de referencia, H3 puede razonar sobre un contexto que contiene texto, imágenes, videos y audio, y luego generar video sincronizado y sonido estéreo.
El sistema H3 alojado admite salidas de 4-15 segundos, video a 24 FPS y audio estéreo a 32 kHz. MiniMax promociona el sistema alojado como que ofrece 2K por defecto. Técnicamente, H3-Base crea un resultado con el lado corto a 768p y H3-Regenerate-2K vuelve a introducir ese resultado y el contexto original en H3 para la reconstrucción a 2K. MiniMax también reporta generación de diálogos estable en 11 idiomas, incluidos inglés, chino, japonés, coreano, francés, alemán, español, portugués, italiano, ruso y árabe.
Esta distinción importa. Muchos flujos de trabajo de video anteriores son efectivamente pipelines:
prompt -> video silencioso -> voz -> efectos de sonido -> música -> sincronización
H3, en cambio, modela audio y video como partes de un único proceso de generación. Su H3-Omni-Transformer predice conjuntamente latentes de video y audio, reduciendo la necesidad de ensamblar después etapas independientes de video, doblaje, música y sincronización.
MiniMax H3 Specifications at a Glance
| Specification | MiniMax H3 |
|---|---|
| Developer | MiniMax |
| Model category | Generación de video omni-modal de propósito general |
| Input modalities | Texto, imagen, video, audio |
| Output | Video más audio estéreo nativo |
| Output duration | 4–15 segundos |
| Base resolution | Lado corto a 768p para H3-Base |
| Hosted resolution | Hasta 2K mediante H3-Regenerate-2K 2K ofrecido por defecto; producido a través de H3-Regenerate-2K tras la generación base a 768p |
| Frame rate | 24 FPS |
| Audio | 32 kHz estéreo |
| Stable dialogue languages | 11 |
| Aspect ratios | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 y dimensiones adicionales |
| Reference limits | Hasta 9 imágenes, 3 videos, 3 clips de audio y 12 archivos mixtos |
| Core generative model | H3-Omni-Transformer denso de 33B |
| Position encoding | 3D Multimodal RoPE |
| Open-weight checkpoints | H3-Base-FL2VA y H3-Base-Ref2VA |
| Checkpoint precision | BF16 |
| License | MiniMax H3 Community License |
La cifra de 33B se refiere a H3-Omni-Transformer y no a todos los componentes utilizados en todo el pipeline alojado.
What Makes MiniMax H3 Different?
One Model for Multiple Video Tasks
La mayoría de los generadores de video históricamente separan texto-a-video, imagen-a-video, referencia de movimiento, edición de video, generación de audio y capacidades de referencia de sujetos.
MiniMax adopta un enfoque diferente. H3 fue preentrenado en torno a relaciones generalizadas entre el contexto multimodal y la salida deseada, permitiendo que las instrucciones describan esas relaciones en lenguaje natural.
Por ejemplo, un creador puede pedir conceptualmente a H3 que siga el movimiento de cámara de un video, preserve el personaje de una imagen y use otro clip de audio como referencia de timbre. Las demostraciones de lanzamiento de MiniMax utilizan este tipo de instrucción cruzada entre modalidades para ilustrar el sistema de referencias generalizado de H3.
Eso hace que H3 se parezca menos a una colección de modos de generación y más a un motor creativo multimodal.
Native Video and Stereo Audio Generation
La descripción técnica de MiniMax indica que el H3-Omni-Transformer predice latentes de video y audio conjuntamente. El lado de audio opera a través de H3-AudioVAE, que comprime audio a 32 kHz en una secuencia latente de 40 Hz antes de decodificar el resultado generado de vuelta a sonido estéreo.
Esto da a H3 una ventaja práctica para escenas con diálogos, audio ambiental, música o efectos de sonido: el sonido forma parte del contexto generativo en lugar de ser un paso de posproducción completamente separado.
Omni-Reference Inputs
H3-Base-Ref2VA admite hasta 9 imágenes, 3 clips de video y 3 clips de audio, con un máximo de 12 archivos de entrada mixtos. Los videos y clips de audio de referencia pueden tener entre 2 y 15 segundos, con restricciones de duración total por modalidad. El audio no puede actuar como única entrada de referencia en el modo Ref2VA.
Lo importante no es solo la cantidad de referencias. H3 está diseñado para inferir la relación entre esos recursos.
- preservar un personaje a partir de una imagen;
- reproducir el movimiento de un clip de referencia;
- transferir un estilo visual o cinematográfico;
- preservar o reemplazar el audio;
- usar una voz como referencia de timbre;
- editar una escena audiovisual existente usando instrucciones en lenguaje natural.
In-Context 2K Regeneration
El enfoque de H3 para la alta resolución es inusualmente importante.
En lugar de simplemente pasar la salida a 768p por una red convencional de superresolución, H3-Regenerate-2K reintroduce el contexto multimodal original junto con el resultado base y pide a H3 regenerar la escena a mayor resolución.
La ventaja prevista es la recuperación semántica. Un escalador normal puede interpolar píxeles pero no puede reconstruir de forma fiable información que ha desaparecido: letras pequeñas, elementos de marca u objetos con detalles finos. La etapa de regeneración de H3 puede consultar nuevamente el prompt y las referencias originales mientras construye el resultado a 2K.

How Does the MiniMax H3 Architecture Work?
El flujo completo de H3 tiene tres etapas principales:
H3-Context-IR -> H3-Base -> H3-Regenerate-2K
H3-Context-IR interpreta una instrucción multimodal potencialmente complicada y la convierte en una Context Intermediate Representation estructurada. H3-Base consume esa representación y genera video a 768p más audio. H3-Regenerate-2K luego combina el resultado generado con el contexto original para construir una versión de mayor resolución.

H3-Contextual Omni Representation and H3-Context-IR
Contextual Omni Representation es el concepto de diseño más amplio de MiniMax: el lenguaje actúa como el puente que describe relaciones entre el contexto, el objetivo y múltiples modalidades. En la descripción del sistema publicada, H3-Context-IR es la capa de orquestación y preprocesamiento alojada que analiza instrucciones, asocia modalidades, razona sobre el tiempo y serializa el resultado para H3-Base.
El H3-Encoder sigue siendo un componente específico dentro de H3-Base. Utiliza los pesos preentrenados de Qwen3-VL-32B y pasa los estados ocultos de la capa 50 al H3-Omni-Transformer.
H3-VAE
La terminología de lanzamiento “H3-VAE” abarca las representaciones latentes visual y de audio de la familia de modelos. La documentación de pesos abiertos distingue H3-VisualVAE de H3-AudioVAE. H3-VisualVAE utiliza codificación causal temporal con compresión espacial 16×, compresión temporal 4× y 24 canales latentes, seguida de una división en parches de 1 × 2 × 2. H3-AudioVAE comprime audio estéreo a 32 kHz en tokens latentes a una tasa temporal de 40 Hz.
H3-Omni-Transformer
El blog de lanzamiento escribe el nombre como “H3-Omni Transformer”; la documentación técnica de pesos abiertos usa “H3-Omni-Transformer”. Ambos se refieren al mismo componente generativo central. Es un Transformer denso de 33B parámetros y flujo único. Aproximadamente 13B parámetros residen en ramas relacionadas con AdaLN; sus salidas de modulación pueden precomputarse y almacenarse en caché, por lo que no necesitan permanecer cargadas durante un despliegue solo de inferencia.
Los componentes específicos de modalidad se concentran en capas de entrada/salida y ramas AdaLN, mientras que el Transformer central opera sobre una secuencia empaquetada unificada. RoPE multimodal tridimensional representa posiciones temporales y espaciales a través de (t, h, w).
H3-In-Context Regeneration
El blog de lanzamiento de MiniMax llama a la técnica H3-In-Context Regeneration; el módulo de producción se denomina H3-Regenerate-2K. Alimenta el resultado a 768p y el contexto original de vuelta a H3 para reconstruir una salida a 2K, permitiendo que los detalles semánticos se regeneren en lugar de simplemente interpolarse.
Is MiniMax H3 Really Open Source?
Movido aquí desde su posición anterior tras la sección de comparación porque el límite de pesos abiertos es una distinción arquitectónica central.
“Open-weight” es más preciso que “open source” completo. MiniMax pone a disposición los checkpoints H3-Base-FL2VA y H3-Base-Ref2VA para uso local, incluidos el procesador requerido, el tokenizador, el codificador de texto, el Transformer, el VAE visual y el VAE de audio.
Sin embargo, el pipeline de producción completo no es descargable de extremo a extremo. H3-Context-IR permanece alojado, y H3-Regenerate-2K no está incluido en la versión inicial de pesos abiertos. La generación local con H3-Base apunta a una resolución con lado corto a 768p; reproducir el flujo oficial completo a 2K requiere servicios alojados para el procesamiento del contexto y la regeneración.
H3 también utiliza la MiniMax H3 Community License en lugar de una licencia permisiva estándar como Apache 2.0 o MIT. Las organizaciones deberían revisar las condiciones territoriales, de atribución, seguridad y uso comercial de la licencia antes del despliegue.
MiniMax H3 Benchmark Performance
Los materiales de lanzamiento de MiniMax se concentran principalmente en demostraciones, arquitectura y casos de uso, en lugar de publicar una matriz de benchmarks VBench amplia y convencional. Para una instantánea más neutral, una fuente útil es Video Arena de Artificial Analysis, donde los usuarios comparan a ciegas generaciones con los mismos prompts.
| Artificial Analysis task | H3 rank | H3 Elo | Leader | Leader Elo |
|---|---|---|---|---|
| Text-to-Video with Audio | #4 | ≈1,228 | Wan 3.0 | 1,242 |
| Image-to-Video with Audio | #3 | 1,185 | H3 Max, posentrenado por fal | 1,202 |
| Video Editing with Audio | #2 | 1,129 | Wan 3.0 | 1,190 |
Estas clasificaciones son una instantánea del 2 de septiembre de 2026, no puntuaciones permanentes. H3 es competitivo con los principales sistemas propietarios y destaca especialmente entre las entradas con pesos abiertos. Su propuesta de valor es la combinación de calidad competitiva, generación audiovisual nativa, referencias multimodales y pesos base descargables—no simplemente reclamar la puntuación más alta en benchmarks.
MiniMax H3 Pricing
Los siguientes precios de pago por uso se volvieron a comprobar frente a la página oficial de precios de MiniMax el 24 de septiembre de 2026. Los precios pueden cambiar, por lo que los equipos de producción deberían verificarlos de nuevo antes de presupuestar.
| Usage | Official list price |
|---|---|
| H3 generation at 768P | $0.08/second |
| H3 generation at 2K | $0.13/second |
| 768P → 2K regeneration output | $0.05/second |
| Standard-generation reference audio | Free |
| Standard-generation reference images | First 5 free; then $0.04/image |
| Regeneration reference images | First 5 free; then $0.025/image |
| Regeneration reference video | $0.05/second of original 768P input |
| H3-Context-IR input | $0.90/M tokens |
| H3-Context-IR output | $3.60/M tokens |
A precio de lista, una generación directa de 10 segundos cuesta aproximadamente $0.80 a 768P o $1.30 a 2K; una generación de 15 segundos cuesta aproximadamente $1.20 o $1.95. Estos ejemplos excluyen referencias facturables, tokens de Context-IR y otros cargos específicos del flujo.
MiniMax H3 también está disponible a través de CometAPI. Su página de modelo anuncia una tarifa inicial de $0.064/segundo bajo el ID de modelo minimax-h3. Los precios de terceros pueden depender de la ruta, la resolución y las reglas de facturación, por lo que no deben tratarse como tarifas unitarias universales.
MiniMax H3 vs Wan3.0 vs Seedance 2.5 vs Vidu Q3
Los competidores más útiles no son necesariamente modelos que se ven idénticos sobre el papel. MiniMax H3, Wan3.0, Seedance 2.5 y Vidu Q3 enfatizan diferentes partes del flujo de trabajo de video profesional.
| Dimension | MiniMax H3 | Wan3.0 | Seedance 2.5 | Vidu Q3 |
|---|---|---|---|---|
| Maximum single generation | 15s | 30s | 30s | 16s |
| Video resolution | 2K alojado; base abierta a 768p | Hasta 1080P | Dependiente de la ruta | Hasta 1080P |
| Native audio-video | Sí | Sí | Sí | Sí |
| Reference inputs | Texto, imagen, video, audio | Imagen, video, audio, documentos, webs | Imágenes, videos, audio | Flujos de imagen/referencia |
| Reference capacity | 12 archivos mixtos | Hasta 20 materiales | Hasta 50 materiales | No indicado en la página principal |
| Major differentiator | H3-Base con pesos abiertos más regeneración a 2K | 30s más entradas amplias | Narrativa de 30s más gran conjunto de referencias | Control de narrativa corta y diálogos |
| Strongest fit | Pipelines creativos personalizables | Producción larga todo-en-uno | Narrativa comercial con muchas referencias | Escenas breves de drama y diálogos |
| Strongest fit | Pipelines creativos personalizables | Producción larga todo-en-uno | Narrativa comercial con muchas referencias | Escenas breves de drama y diálogos |
Which Model Is Better?
No hay un ganador universal. Elige MiniMax H3 cuando importen más los pesos abiertos, el acondicionamiento multimodal, el audio estéreo nativo, la edición audiovisual y el acabado a 2K que la duración máxima del clip. Elige Wan 3.0 cuando importen más salidas de 30 segundos, 1080P, amplias referencias de documentos/web y un fuerte rendimiento en arenas. Elige Seedance 2.5 para conjuntos de referencias muy grandes, estructura narrativa de 30 segundos, consistencia de identidad o edición dirigida. Elige Vidu Q3 para escenas narrativas cortas, diálogo multiusuario, timing y control de cámara tipo director.
Una evaluación responsable debería ejecutar el mismo conjunto interno de prompts en todas las APIs candidatas. Los rankings públicos no siempre exponen versiones directamente comparables, y sustituir una variante antigua o turbo puede distorsionar el resultado.
What Are MiniMax H3's Main Limitations?
- Duración: H3 llega hasta 15 segundos, mientras que algunos competidores ahora admiten generaciones de 30 segundos.
- Alcance de pesos abiertos: solo H3-Base es descargable; Context-IR y la regeneración a 2K siguen alojados.
- Requisitos de hardware: un modelo de video denso de 33B sigue siendo costoso de desplegar localmente, incluso con optimizaciones de inferencia.
- Complejidad de precios: generación, regeneración, videos e imágenes de referencia y Context-IR pueden crear cargos separados.
- Condiciones de licencia: la Community License requiere una revisión legal más detenida que licencias permisivas estándar.
- Volatilidad de benchmarks: las clasificaciones de arena cambian y no sustituyen las pruebas específicas de cargas de trabajo.
Who Should Use MiniMax H3?
H3 encaja bien para desarrolladores y equipos creativos que construyen flujos de trabajo de video multimodal que necesitan sujetos consistentes, referencias de movimiento o voz, audio estéreo nativo, edición y acabado en alta resolución. También es relevante para equipos que desean personalizar o autoalojar el modelo base mientras usan etapas alojadas solo cuando sea necesario.
Los equipos que principalmente necesitan la generación más larga, el despliegue local más liviano o una pila end-to-end completamente permisiva pueden preferir otro modelo. MiniMax destaca publicidad, branding, comercio electrónico, diseño de producto, UI/UX, gaming y cine como escenarios de creación comercial.
How Can Developers Access MiniMax H3?
Hay tres vías principales:
- Usar los productos alojados de MiniMax, incluidos Hailuo y MiniMax Design.
- Usar la MiniMax Open Platform de primera parte para las APIs de H3-2K, H3-Context-IR y H3-Regenerate-2K.
- Descargar los checkpoints de H3-Base para despliegue local a través del repositorio oficial y frameworks de inferencia compatibles.
Para detalles de implementación, utiliza la documentación oficial de API y despliegue enlazada en la lista de fuentes a continuación; este artículo se mantiene enfocado en la evaluación del producto.
Conclusion
MiniMax H3 importa menos porque lidere cada métrica individual que porque comprime una cadena de producción fragmentada en un sistema multimodal programable. Los pesos descargables de H3-Base dan margen a los desarrolladores para prototipar, personalizar e iterar localmente, mientras que las etapas alojadas H3-Context-IR y H3-Regenerate-2K proporcionan el procesamiento de instrucciones más rico y el acabado a alta resolución necesario para el trabajo en producción. Ese modelo híbrido también crea compromisos: el límite de 15 segundos, los requisitos de infraestructura local, la dependencia de servicios alojados, los costos a nivel de flujo y las condiciones de la Community License deben evaluarse frente a los prompts reales y las restricciones de entrega del equipo. Para equipos que priorizan el control de referencias multimodales, audio nativo sincronizado, edición audiovisual y masters a 2K, H3 es una plataforma atractiva; los equipos que principalmente necesitan clips más largos o una pila permisiva completamente autocontenida deberían comparar alternativas antes de comprometerse.
FAQ
¿Cómo debería un equipo de producción dividir el trabajo entre H3-Base local y los servicios alojados de MiniMax?
Un flujo híbrido práctico es usar H3-Base local para exploración rápida, iteración de prompts, pruebas de referencias y cualquier etapa donde el control de infraestructura o la localidad de datos importen. Las salidas prometedoras pueden pasar luego a H3-Context-IR alojado para un procesamiento de instrucciones más rico y a H3-Regenerate-2K para entrega a resolución final. La división adecuada depende de la capacidad de GPU, el tiempo de entrega, los requisitos de gobernanza y de si la ganancia de calidad de las etapas alojadas justifica la transferencia adicional, la latencia y la facturación.
¿Qué debería medir un conjunto de evaluación interna antes de adoptar H3?
No evalúes H3 solo con prompts visualmente impresionantes. Usa un conjunto repetible de briefs reales de producción y puntúa la adherencia a instrucciones, consistencia de sujetos y marcas, estabilidad temporal, renderizado de texto, precisión del movimiento de cámara, sincronización audio-video, calidad del diálogo, fidelidad de regeneración, latencia, tasa de fallos y costo total por clip aceptado. Ejecuta los mismos recursos y criterios de aceptación en modelos competidores para que los rankings de arenas no sustituyan la evidencia de la carga real del equipo.
¿Cómo deberían prepararse los recursos de referencia multimodales para mejorar la controlabilidad?
Los recursos de referencia deberían tener roles claros y no conflictivos: una imagen puede definir la identidad, un clip puede definir el movimiento y una muestra de audio puede definir la voz o la atmósfera. Elimina referencias de baja calidad o contradictorias, recorta clips a la acción relevante y declara explícitamente la relación entre cada recurso y la salida objetivo en la instrucción. Empezar con el conjunto mínimo suficiente de referencias facilita diagnosticar qué recurso mejora el resultado y cuál introduce ambigüedad.
¿Qué costos de producción se pasan por alto fácilmente al comparar H3 con otra API?
El precio por segundo de generación es solo la base visible. Un modelo de costos realista debería incluir videos de referencia facturables e imágenes adicionales, tokens de Context-IR, regeneración a 2K, reintentos, generaciones rechazadas, capacidad de GPU local, almacenamiento y transferencia de medios, manejo de moderación, ingeniería de integración y revisión humana. La comparación útil es el costo por entregable aprobado a la resolución requerida—no el costo por generación bruta.
¿Cómo deberían los equipos interpretar “2K por defecto” cuando H3-Base en sí genera a 768p?
Las frases describen capas diferentes del producto. “2K por defecto” se refiere a la experiencia comercial alojada, mientras que 768p describe la salida del lado corto de la etapa descargable H3-Base; H3-Regenerate-2K luego reconstruye la salida final utilizando tanto el resultado base como el contexto original. Por lo tanto, las pruebas de calidad deberían comparar la salida local a 768p y la salida final alojada a 2K como etapas de flujo separadas, prestando atención a si la regeneración realmente restaura texto, branding, rostros y detalles finos en lugar de simplemente aumentar las dimensiones en píxeles.
¿Cuándo es poco probable que MiniMax H3 sea la mejor primera opción?
H3 puede ser una mala elección cuando un proyecto requiere clips sustancialmente más largos en una sola pasada, acabado a 2K completamente local, una licencia permisiva estándar, inversión mínima en GPU o un flujo de trabajo de texto-a-video muy simple que gana poco con referencias multimodales. En esos casos, el valor de la arquitectura generalizada de H3 puede no compensar la complejidad operativa adicional. Un proof of concept corto con prompts representativos es la forma más segura de determinar si su control y la integración audio-video mejoran materialmente el entregable final.
