TL;DR
AI-videomodeller bevæger sig ud over den gamle tekst-til-video-formel mod systemer, der kan forstå en komplet kreativ brief—tekst, billeder, referenceoptagelser, bevægelser, stemmer, musik og lydeffekter—og omsætte det til en sammenhængende audiovisuel scene. MiniMax lancerede officielt H3 den 31. juli 2026 som en alsidig omnimodal genereringsmodel, der i fællesskab forstår tekst, billeder, video og lyd og genererer klip på op til 15 sekunder med nativ stereolyd. Den vigtigste ændring er en samlet arkitektur, der behandler tekst-til-video, billede-til-video, generering af første/sidste frame, referencebaseret generering, bevægelsesoverførsel, audiovisuel redigering og lydkonditioneret skabelse som variationer af ét multimodalt genereringsproblem frem for isolerede pipelines. Den hostede løsning tilbyder 2K-output som standard gennem en arbejdsgang, hvor H3-Base først genererer ved en korteste side på 768p, og H3-Regenerate-2K derefter rekonstruerer scenen ved hjælp af den oprindelige kontekst. Denne kombination af konkurrencedygtig audiovisuelt kvalitet, fleksibel multimodal styring, downloadbare H3-Base-vægte og kontekstbevidst 2K-afslutning gør H3 til en af de mere teknisk særprægede videolanseringer i 2026.
Key Takeaways
- New architecture: Contextual Omni Representation, H3-VAE, H3-Omni Transformer og In-Context Regeneration forener forståelse og generering på tværs af modaliteter.
- Performance improvements: H3 genererer 4–15 sekunders klip med 24 FPS video, 32 kHz stereo og hostet 2K-output rekonstrueret fra den oprindelige multimodale kontekst.
- API and open-weight availability: MiniMax tilbyder hostede H3-2K, H3-Context-IR og H3-Regenerate-2K API’er, mens H3-Base-FL2VA og H3-Base-Ref2VA er tilgængelige som downloadbare checkpoints.
- Main use cases: Annoncering, branding, e-handel, produktdesign, UI/UX, gaming, film, referencebaseret generering, bevægelsesoverførsel og audiovisuel redigering.
- Pricing and deployment boundary: Officiel pay-as-you-go-pris er $0.08/second ved 768P og $0.13/second ved 2K; kun H3-Base kan downloades, mens H3-Context-IR og H3-Regenerate-2K forbliver hostede tjenester.
What Is MiniMax H3?
MiniMax H3 er et alsidigt omnimodalt audio-video-genereringssystem udviklet af MiniMax. I stedet for kun at acceptere en prompt eller ét referencebillede kan H3 ræsonnere over en kontekst, der indeholder tekst, billeder, videoer og lyd, og derefter generere synkroniseret video og stereolyd.
Det hostede H3-system understøtter 4–15 sekunders output, 24 FPS video og 32 kHz stereo. MiniMax markedsfører den hostede løsning som 2K som standard. Teknisk skaber H3-Base et resultat med korteste side på 768p, og H3-Regenerate-2K sender det resultat og den oprindelige kontekst tilbage i H3 for 2K-rekonstruktion. MiniMax rapporterer også stabil dialoggenerering på 11 sprog, herunder engelsk, kinesisk, japansk, koreansk, fransk, tysk, spansk, portugisisk, italiensk, russisk og arabisk.
Denne skelnen er vigtig. Mange tidligere videoworkflows er i praksis pipelines:
prompt -> stum video -> tale -> lydeffekter -> musik -> synkronisering
H3 modellerer i stedet lyd og video som dele af én genereringsproces. Dens H3-Omni-Transformer forudsiger i fællesskab video- og lydlatenter, hvilket reducerer behovet for efterfølgende at samle uafhængig video, dubbing, musik og synkroniseringsled.
MiniMax H3 Specifications at a Glance
| Specification | MiniMax H3 |
|---|---|
| Developer | MiniMax |
| Model category | Alsidig omnimodal videogenerering |
| Input modalities | Text, image, video, audio |
| Output | Video plus native stereo audio |
| Output duration | 4–15 seconds |
| Base resolution | 768p short-side for H3-Base |
| Hosted resolution | Up to 2K through H3-Regenerate-2K 2K offered by default; produced through H3-Regenerate-2K after 768p base generation |
| Frame rate | 24 FPS |
| Audio | 32 kHz stereo |
| Stable dialogue languages | 11 |
| Aspect ratios | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16, and additional dimensions |
| Reference limits | Up to 9 images, 3 videos, 3 audio clips, and 12 mixed files |
| Core generative model | 33B dense H3-Omni-Transformer |
| Position encoding | 3D Multimodal RoPE |
| Open-weight checkpoints | H3-Base-FL2VA and H3-Base-Ref2VA |
| Checkpoint precision | BF16 |
| License | MiniMax H3 Community License |
Tallet 33B henviser til H3-Omni-Transformer og ikke til alle komponenter, der bruges i den komplette hostede pipeline.
What Makes MiniMax H3 Different?
One Model for Multiple Video Tasks
De fleste videogeneratorer har historisk adskilt tekst-til-video, billede-til-video, bevægelsesreference, videoredigering, lydgenerering og subjektreferencer.
MiniMax tager en anden tilgang. H3 blev prætrænet omkring generaliserede relationer mellem multimodal kontekst og ønsket output, så instruktioner kan beskrive disse relationer i naturligt sprog.
For eksempel kan en kreatør konceptuelt bede H3 om at følge kamerabevægelsen i én video, bevare karakteren fra et billede og bruge et andet lydklip som vokalreference. MiniMax’ lanceringsdemonstrationer bruger denne slags krydsmodale instruktioner til at illustrere H3’s generaliserede referencesystem.
Det gør H3 mindre som en samling af genereringstilstande og mere som en multimodal kreativ motor.
Native Video and Stereo Audio Generation
MiniMax’ tekniske beskrivelse angiver, at H3-Omni-Transformer forudsiger video- og lydlatenter i fællesskab. Lydsiden fungerer via H3-AudioVAE, som komprimerer 32 kHz-lyd til en latent sekvens på 40 Hz, før det genererede resultat dekodes tilbage til stereolyd.
Dette giver H3 en praktisk fordel for scener med dialog, miljølyd, musik eller lydeffekter: lyden er en del af den generative kontekst i stedet for et helt separat efterproduktionsled.
Omni-Reference Inputs
H3-Base-Ref2VA understøtter op til 9 billeder, 3 videoklip og 3 lydklip, underlagt et maksimum på 12 blandede inputfiler. Referencevideoer og lydklip kan hver være 2–15 sekunder lange, med samlede varighedsbegrænsninger for hver modalitet. Lyd kan ikke fungere som det eneste referenceinput i Ref2VA-tilstand.
Det vigtige er ikke kun antallet af referencer. H3 er designet til at udlede relationen mellem disse aktiver.
- bevare en karakter fra et billede;
- reproducere bevægelse fra et referenceklip;
- overføre en visuel eller filmisk stil;
- bevare eller udskifte lyd;
- bruge én stemme som klangreference;
- redigere en eksisterende audiovisuel scene ved hjælp af naturlige sprog-instruktioner.
In-Context 2K Regeneration
H3’s tilgang til høj opløsning er usædvanligt vigtig.
I stedet for blot at sende 768p-outputtet gennem et konventionelt super-opløsningsnetværk introducerer H3-Regenerate-2K den oprindelige multimodale kontekst sammen med basisresultatet igen og beder H3 om at regenerere scenen i højere opløsning.
Den tilsigtede fordel er semantisk genopretning. En normal opscaler kan interpolere pixels, men kan ikke pålideligt genskabe information, der er forsvundet—små bogstaver, brandede elementer eller fine objektdetaljer. H3’s regenereringsfase kan konsultere den oprindelige prompt og referencer igen, mens 2K-resultatet konstrueres.

How Does the MiniMax H3 Architecture Work?
Den komplette H3-arbejdsgang har tre hovedfaser:
H3-Context-IR -> H3-Base -> H3-Regenerate-2K
H3-Context-IR fortolker en potentielt kompliceret multimodal instruktion og konverterer den til en struktureret Context Intermediate Representation. H3-Base forbruger den repræsentation og genererer 768p video plus lyd. H3-Regenerate-2K kombinerer derefter det genererede resultat med den oprindelige kontekst for at konstruere en version i højere opløsning.

H3-Contextual Omni Representation og H3-Context-IR
Contextual Omni Representation er MiniMax’ bredere designkoncept: sproget fungerer som broen, der beskriver relationer mellem konteksten, målet og flere modaliteter. I den frigivne systembeskrivelse er H3-Context-IR det hostede forbehandlings- og orkestreringslag, der parser instruktioner, knytter modaliteter, ræsonnerer om tid og serialiserer resultatet til H3-Base.
H3-Encoder forbliver en specifik komponent i H3-Base. Den bruger de prætrænede vægte fra Qwen3-VL-32B og sender skjulte tilstande fra lag 50 ind i H3-Omni-Transformer.
H3-VAE
Lanceringsterminologien “H3-VAE” dækker modelfamiliens visuelle og lydmæssige latente repræsentationer. Dokumentationen for åbne vægte skelner mellem H3-VisualVAE og H3-AudioVAE. H3-VisualVAE bruger tidskausal kodning med 16× rumlig komprimering, 4× tidslig komprimering og 24 latente kanaler, efterfulgt af 1 × 2 × 2 patchificering. H3-AudioVAE komprimerer 32 kHz stereolyd til latente tokens med en tidslig rate på 40 Hz.
H3-Omni-Transformer
Lanceringsbloggen skriver navnet som “H3-Omni Transformer”; den tekniske dokumentation for de åbne vægte bruger “H3-Omni-Transformer.” Begge refererer til den samme kernegenerative komponent. Det er en tæt 33B-parameter, enkeltstrøms Transformer. Omtrent 13B parametre ligger i AdaLN-relaterede grene; deres modulationsudgange kan præberegnes og caches, så de ikke behøver at forblive indlæst under ren inferens.
Modalitetsspecifikke komponenter er koncentreret i input/output-lag og AdaLN-grene, mens den centrale Transformer opererer på en samlet pakket sekvens. Tredimensionel Multimodal RoPE repræsenterer tidslige og rumlige positioner på tværs af (t, h, w).
H3-In-Context Regeneration
MiniMax’ lanceringsblog kalder teknikken H3-In-Context Regeneration; produktionsmodulet hedder H3-Regenerate-2K. Det sender 768p-resultatet og den oprindelige kontekst tilbage i H3 for at rekonstruere et 2K-output, hvilket gør det muligt at regenerere semantiske detaljer i stedet for blot at interpolere.
Is MiniMax H3 Really Open Source?
Flyttet hertil fra sin tidligere placering efter sammenligningsafsnittet, fordi grænsen for åbne vægte er en central arkitektonisk skelnen.
“Open-weight” er mere præcist end “fuldt open source.” MiniMax gør H3-Base-FL2VA- og H3-Base-Ref2VA-checkpoints tilgængelige til lokal brug, inklusive de nødvendige processor-, tokenizer-, tekstencoder-, Transformer-, visual VAE- og audio VAE-komponenter.
Den komplette produktionspipeline kan dog ikke downloades ende til ende. H3-Context-IR forbliver hostet, og H3-Regenerate-2K er ikke inkluderet i den første open-weight-udgivelse. Lokal H3-Base-generering sigter mod en korteste side på 768p; reproduktion af den officielle fulde 2K-arbejdsgang kræver hostede tjenester til kontekstbehandling og regenerering.
H3 bruger også MiniMax H3 Community License i stedet for en standard permissiv licens som Apache 2.0 eller MIT. Organisationer bør gennemgå licensens territoriale, krediterings-, sikkerheds- og kommercielle brugsbetingelser før idriftsættelse.
MiniMax H3 Benchmark Performance
MiniMax’ lanceringsmateriale fokuserer primært på demonstrationer, arkitektur og anvendelser frem for at offentliggøre en traditionel stor VBench-lignende benchmarkmatrix. For et mere neutralt øjebliksbillede er Artificial Analysis’ Video Arena nyttig, hvor brugere blindt sammenligner genereringer fra de samme prompts.
| Artificial Analysis task | H3 rank | H3 Elo | Leader | Leader Elo |
|---|---|---|---|---|
| Text-to-Video with Audio | #4 | ≈1,228 | Wan 3.0 | 1,242 |
| Image-to-Video with Audio | #3 | 1,185 | H3 Max, post-trained by fal | 1,202 |
| Video Editing with Audio | #2 | 1,129 | Wan 3.0 | 1,190 |
Disse placeringer er et øjebliksbillede pr. 2. september 2026, ikke permanente scorer. H3 er konkurrencedygtig med førende proprietære systemer og er især bemærkelsesværdig blandt indgange med åbne vægte. Dets værdiforslag er kombinationen af konkurrencedygtig kvalitet, native audiovisuel generering, multimodale referencer og downloadbare basisvægte—ikke blot et krav om den højeste benchmarkscore.
MiniMax H3 Pricing
Følgende pay-as-you-go-priser blev genkontrolleret mod MiniMax’ officielle prisside den 24. september 2026. Priser kan ændre sig, så produktionsteams bør verificere dem igen før budgettering.
| Usage | Official list price |
|---|---|
| H3 generation at 768P | $0.08/second |
| H3 generation at 2K | $0.13/second |
| 768P → 2K regeneration output | $0.05/second |
| Standard-generation reference audio | Free |
| Standard-generation reference images | First 5 free; then $0.04/image |
| Regeneration reference images | First 5 free; then $0.025/image |
| Regeneration reference video | $0.05/second of original 768P input |
| H3-Context-IR input | $0.90/M tokens |
| H3-Context-IR output | $3.60/M tokens |
Til listepris er en direkte generering på 10 sekunder cirka $0.80 ved 768P eller $1.30 ved 2K; en 15-sekunders generering er cirka $1.20 eller $1.95. Disse eksempler udelukker fakturerbare referencer, Context-IR-tokens og andre arbejdsgangsspecifikke omkostninger.
MiniMax H3 er også tilgængelig via CometAPI. Dens modelside annoncerer en startrate på $0.064/second under model-ID’et minimax-h3. Tredjeparts overskriftspriser kan afhænge af rute, opløsning og faktureringsregler, så de bør ikke betragtes som universelle enhedssatser.
MiniMax H3 vs Wan3.0 vs Seedance 2.5 vs Vidu Q3
De mest nyttige konkurrenter er ikke nødvendigvis modeller, der ser identiske ud på papiret. MiniMax H3, Wan3.0, Seedance 2.5 og Vidu Q3 lægger vægt på forskellige dele af den professionelle videoworkflow.
| Dimension | MiniMax H3 | Wan3.0 | Seedance 2.5 | Vidu Q3 |
|---|---|---|---|---|
| Maximum single generation | 15s | 30s | 30s | 16s |
| Video resolution | 2K hosted; 768p open-weight base | Up to 1080P | Route-dependent | Up to 1080P |
| Native audio-video | Yes | Yes | Yes | Yes |
| Reference inputs | Text, image, video, audio | Image, video, audio, documents, webpages | Images, videos, audio | Image/reference workflows |
| Reference capacity | 12 mixed files | Up to 20 materials | Up to 50 materials | Not stated on main page |
| Major differentiator | Open-weight H3-Base plus 2K regeneration | 30s plus broad inputs | 30s storytelling plus large reference set | Short narrative and dialogue control |
| Strongest fit | Customizable multimodal pipelines | Long all-in-one production | Reference-heavy commercial storytelling | Short narrative and dialogue-driven work |
| Strongest fit | Customizable creative pipelines | Long all-in-one production | Reference-heavy commercial storytelling | Short narrative and dialogue-driven work |
Which Model Is Better?
Der er ingen universel vinder. Vælg MiniMax H3, når åbne vægte, multimodal konditionering, nativ stereolyd, audiovisuel redigering og 2K-afslutning betyder mere end maksimal kliplængde. Vælg Wan 3.0, når 30-sekunders output, 1080P, brede dokument/web-referencer og stærk arena-performance er vigtigst. Vælg Seedance 2.5 for meget store referencesæt, 30-sekunders narrativ struktur, identitetskonsistens eller målrettet redigering. Vælg Vidu Q3 til korte fortællescener, dialog med flere personer, timing og instruktøragtig kamerakontrol.
En ansvarlig evaluering bør køre det samme interne prompt-sæt på tværs af alle kandidatapier. Offentlige ranglister afslører ikke altid direkte sammenlignelige versioner, og substitution af en ældre eller turbo-variant kan forvride resultatet.
What Are MiniMax H3's Main Limitations?
- Duration: H3 topper ved 15 sekunder, mens nogle konkurrenter nu understøtter 30-sekunders genereringer.
- Open-weight scope: kun H3-Base kan downloades; Context-IR og 2K-regenerering forbliver hostede.
- Hardware requirements: en tæt 33B videomodel er stadig dyr at køre lokalt, selv med inferensoptimeringer.
- Pricing complexity: generering, regenerering, referencevideoer og -billeder samt Context-IR kan skabe separate omkostninger.
- License conditions: Community License kræver en tættere juridisk gennemgang end standard permissive licenser.
- Benchmark volatility: arena-ranglister ændrer sig og erstatter ikke arbejdsbelastningsspecifik test.
Who Should Use MiniMax H3?
H3 passer godt til udviklere og kreative teams, der bygger multimodale videoworkflows med behov for konsistente subjekter, bevægelses- eller stemmereferencer, nativ stereolyd, redigering og højopløsningsafslutning. Det er også relevant for teams, der ønsker at tilpasse eller selvhoste basismodellen og kun bruge hostede trin, når det er nødvendigt.
Teams, der primært har brug for den længste enkeltgenerering, den letteste lokale udrulning eller en fuldt permissiv ende-til-ende-stack, kan foretrække en anden model. MiniMax fremhæver annoncering, branding, e-handel, produktdesign, UI/UX, gaming og film som kommercielle skabelsesscenarier.
How Can Developers Access MiniMax H3?
Der er tre hovedveje:
- Brug MiniMax’ hostede produkter, herunder Hailuo og MiniMax Design.
- Brug MiniMax Open Platform for H3-2K, H3-Context-IR og H3-Regenerate-2K API’er.
- Download H3-Base-checkpoints til lokal udrulning via det officielle repository og understøttede inferensrammeværk.
For implementeringsdetaljer, brug den officielle API- og udrulningsdokumentation linket i kildelisten nedenfor; denne artikel forbliver fokuseret på produktevaluering.
Conclusion
MiniMax H3 er mindre vigtig, fordi den fører på hver enkelt metrik, end fordi den komprimerer en fragmenteret produktionskæde til ét programmerbart multimodalt system. Downloadbare H3-Base-vægte giver udviklere mulighed for at prototypere, tilpasse og iterere lokalt, mens de hostede H3-Context-IR- og H3-Regenerate-2K-trin leverer den rigere instruktionsbehandling og højopløsningsafslutning, der er nødvendig til produktion. Den hybride model skaber også kompromiser: 15-sekunders grænsen, lokale infrastrukturkrav, afhængighed af hostede tjenester, omkostninger på arbejdsgangsniveau og Community License-betingelser skal alle vurderes i forhold til et teams virkelige prompts og leveringskrav. For teams, der prioriterer multimodal referencekontrol, synkroniseret nativ lyd, audiovisuel redigering og 2K-masters, er H3 en overbevisende platform; teams, der primært har brug for længere klip eller en fuldt selvstændig permissiv stack, bør benchmarktjekke alternativer, før de forpligter sig.
FAQ
How should a production team divide work between local H3-Base and MiniMax’s hosted services?
En praktisk hybrid arbejdsgang er at bruge lokal H3-Base til hurtig udforskning, prompt-iteration, referencetest og alle faser, hvor kontrol over infrastruktur eller datalokalitet er vigtig. Lovende output kan derefter flyttes til hostet H3-Context-IR for rigere instruktionsbehandling og til H3-Regenerate-2K for levering i slutopløsning. Den rette opdeling afhænger af GPU-kapacitet, svartid, styringskrav og om kvalitetsgevinsten fra de hostede trin retfærdiggør ekstra overførsel, latenstid og fakturering.
What should an internal evaluation set measure before a team adopts H3?
Evaluer ikke H3 kun med visuelt imponerende prompts. Brug et repeterbart sæt af reelle produktionsbriefs og scor instruktionsoverholdelse, subjekt- og brandkonsistens, temporal stabilitet, tekstrendering, kamerabevægelsesnøjagtighed, audio-videosynkronisering, dialogkvalitet, regenereringsfidelitet, latenstid, fejlrater og samlet pris pr. godkendt klip. Kør de samme aktiver og acceptkriterier på tværs af konkurrerende modeller, så arena-ranglister ikke erstatter bevis fra teamets faktiske arbejdsbelastning.
How should multimodal reference assets be prepared to improve controllability?
Referenceaktiver bør have klare, ikke-modstridende roller: ét billede kan definere identitet, ét klip kan definere bevægelse, og én lydprøve kan definere stemme eller atmosfære. Fjern lavkvalitets- eller modsatrettede referencer, trim klip til den relevante handling, og angiv eksplicit relationen mellem hvert aktiv og det ønskede output i instruktionen. At starte med det mindst tilstrækkelige referencesæt gør det lettere at diagnosticere, hvilket aktiv forbedrer resultatet, og hvilket der introducerer tvetydighed.
Which production costs are easy to miss when comparing H3 with another API?
Pris pr. sekund for generering er kun den synlige baseline. En realistisk omkostningsmodel bør inkludere fakturerbare referencevideoer og ekstra billeder, Context-IR-tokens, 2K-regenerering, retries, afviste genereringer, lokal GPU-kapacitet, medielagring og -overførsel, moderation, integrationsarbejde og menneskelig gennemgang. Den nyttige sammenligning er omkostning pr. godkendt leverance i den krævede opløsning—ikke omkostning pr. rå generering.
How should teams interpret “2K by default” when H3-Base itself generates at 768p?
Udtrykkene beskriver forskellige lag i produktet. “2K by default” refererer til den hostede kommercielle oplevelse, mens 768p beskriver kortesteside-output fra det downloadbare H3-Base-trin; H3-Regenerate-2K bygger derefter det endelige output op igen ved hjælp af både basisresultatet og den oprindelige kontekst. Kvalitetstest bør derfor sammenligne lokalt 768p-output og endeligt hostet 2K-output som separate arbejdsgangstrin med fokus på, om regenerering faktisk gendanner tekst, branding, ansigter og fine detaljer frem for blot at øge pixeldimensionerne.
When is MiniMax H3 unlikely to be the best first choice?
H3 kan være et dårligt match, når et projekt kræver væsentligt længere enkeltpass-klip, fuldt lokal 2K-afslutning, en standard permissiv licens, minimal GPU-investering eller et meget simpelt tekst-til-video-workflow, der kun opnår lidt ved multimodale referencer. I de tilfælde opvejer værdien af H3’s generaliserede arkitektur muligvis ikke den ekstra operationelle kompleksitet. Et kort proof of concept med repræsentative prompts er den sikreste måde at afgøre, om dens kontrol og audio-video-integration materielt forbedrer den endelige leverance.
