TL;DR
MiniMax H3 Max non è un nuovo foundation model che sostituisce MiniMax H3. È una variante post-addestrata di MiniMax H3 creata da fal Research, che utilizza i pesi open di H3 e un addestramento successivo mirato all’aderenza al prompt, all’estetica visiva e all’efficienza dell’inferenza.
Questa distinzione spiega la maggior parte delle differenze tra i due modelli. MiniMax H3 Max è ottimizzato per un’inferenza di produzione rapida e una maggiore aderenza al prompt, mentre MiniMax H3 resta il sistema omni-modale più ampio, con un condizionamento multimodale più ricco, flussi di lavoro di video editing, pesi H3-Base open e output fino a 2K tramite H3-Regenerate-2K.
Al 18 settembre 2026, dati indipendenti di preferenza mostrano H3 Max a 1227 Elo nel text-to-video con audio contro 1220 per H3, e 1195 Elo nell’image-to-video con audio contro 1181 per H3. Gli scarti sono abbastanza significativi da monitorare, ma non tali da implicare una differenza di qualità drastica in ogni prompt.
Key Takeaways
- H3 Max è una variante post-addestrata di H3, non H4 o un’architettura H3 più grande. fal è partita dai pesi open di MiniMax H3 e ha ottimizzato insieme il modello e lo stack di serving.
- La velocità è il differenziatore più chiaro di H3 Max. fal riporta circa tre secondi o meno per una generazione di cinque secondi a 768p sulla sua infrastruttura ottimizzata.
- H3 Max attualmente guida H3 nei due test indipendenti direttamente comparabili utilizzati qui. L’istantanea più recente mostra +7 Elo nel text-to-video con audio e +14 Elo nell’image-to-video con audio.
- MiniMax H3 resta il workflow da foundation model più ampio. Supporta riferimenti multimodali più ricchi, editing, pesi H3-Base open e rigenerazione 2K.
- La risoluzione è una distinzione importante.H3 Max espone generazione a 480p/768p più raffinamento latente a 1080p, mentre H3 può raggiungere 2K tramite H3-Regenerate-2K.
What Is MiniMax H3 Max?
MiniMax H3 Max è un modello di generazione video AI sviluppato da fal Research attraverso il post-addestramento dei pesi open di MiniMax H3. Invece di sostituire l’architettura H3 sottostante con un nuovo foundation model, fal si è concentrata su aderenza al prompt, estetica e throughput di inferenza.
Il termine “Max” può quindi essere fuorviante se interpretato come un livello convenzionale con più parametri. I materiali pubblici non stabiliscono un Transformer più grande o una nuova scala di parametri per H3 Max. La differenziazione deriva principalmente dal post-addestramento e da uno stack di serving progettato attorno al modello modificato.
fal descrive anche nuovi dati di post-addestramento sostanziali e loop di valutazione incentrati sulla qualità percepibile dall’utente. In pratica, H3 Max va inteso come una variante di H3 ottimizzata per la produzione più che come un successore progettato da zero.
MiniMax H3 Max specifications at glance
| Specification | MiniMax H3 Max |
|---|---|
| Base model | MiniMax H3 |
| Post-training developer | fal Research |
| Model category | Audio-video generation |
| Text-to-video | Yes |
| Image-to-video | Yes |
| First/last-frame control | Yes |
| Reference-to-video | Yes |
| Output duration | 5-15 seconds |
| Native generation resolution | 480p / 768p |
| 1080p option | Latent refinement from native 768p |
| Frame rate | 24 FPS |
| Audio | Synchronized stereo audio |
| Aspect ratios | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 |
| Primary optimization | Prompt adherence, aesthetics, throughput |
| CometAPI model ID | minimax-h3-max |
L’attuale schema API di fal descrive l’opzione 1080p come raffinamento latente da una sorgente nativa a 768p, il che conta quando si confronta H3 Max con sistemi che rigenerano a una risoluzione realmente più alta.
How Does MiniMax H3 Max Work?
Comprendere H3 Max parte dalla base H3 sottostante. MiniMax descrive H3 come un sistema generativo onnimodale piuttosto che una collezione di modelli separati per text-to-video, image-to-video, audio ed editing.
Il workflow completo di H3 è organizzato attorno a H3-Context-IR, H3-Base e H3-Regenerate-2K. H3-Context-IR interpreta istruzioni multimodali in linguaggio naturale, H3-Base esegue la generazione audiovisiva core a 768p e H3-Regenerate-2K riutilizza il contesto originale più il risultato a bassa risoluzione per rigenerare un output a risoluzione più alta.
The H3 foundation beneath H3 Max
MiniMax documenta H3-Omni-Transformer come un Transformer denso single-stream da 33 miliardi di parametri, con circa 13B di parametri nelle diramazioni legate ad AdaLN. L’H3-Encoder utilizza pesi Qwen3-VL-32B preaddestrati, mentre VAE visivi e audio separati codificano le rispettive modalità prima della generazione congiunta.
L’H3-Omni-Transformer predice congiuntamente i latenti di video e audio invece di trattare il suono come una fase di post-processing separata. Questa architettura è il motivo per cui sia H3 che H3 Max possono produrre output audiovisivi sincronizzati.
Architettura ufficiale del modello MiniMax H3
What fal changed for H3 Max
fal ha post-addestrato H3 con dati aggiuntivi mirati alla fedeltà alle istruzioni e alla qualità visiva, quindi ha sviluppato il sistema di inferenza insieme al modello invece di ottimizzare il serving solo a training concluso. L’articolo di lancio descrive questa co-progettazione modello-e-inferenza come la ragione principale per cui H3 Max può spostare il compromesso qualità-velocità.
Questo è importante perché semplicemente ridurre i passi di campionamento o la precisione può abbassare la latenza degradando la qualità dell’output. fal afferma che le ottimizzazioni candidate sono state mantenute solo quando i checkpoint risultanti hanno continuato a reggere nelle sue valutazioni di preferenza.
MiniMax H3 fornisce la base per la generazione multimodale; H3 Max cambia il punto su cui questa base si posiziona nella curva qualità-velocità-costo.
What Are the Main Features of MiniMax H3 Max?
Stronger prompt adherence
L’aderenza al prompt è stata un obiettivo diretto del post-addestramento. Questo è importante per prompt strutturati che combinano più azioni, transizioni di scena, direzioni di camera, vincoli temporali e istruzioni di stile.
Faster-than-video-duration generation
H3 Max è progettato per una latenza di generazione insolitamente bassa. fal riporta clip di cinque secondi a 768p in circa tre secondi o meno sulla sua infrastruttura ottimizzata, abilitando loop creativi iterativi molto più stretti.
Native synchronized audio
H3 Max mantiene l’approccio di generazione audio-video congiunta di H3, così dialogo, ambiente, effetti sonori e movimento possono essere prodotti in un workflow audiovisivo coordinato.
Multiple generation workflows
La famiglia H3 Max supporta text-to-video, image-to-video, generazione dal primo all’ultimo fotogramma e workflow da riferimento a video.
Built-in prompt expansion
L’endpoint text-to-video espone modalità di espansione del prompt come “disabled”, “balanced” e “quality”, consentendo agli sviluppatori di scambiare tempo di pre-processing con un’interpretazione del prompt più ricca.
How Does MiniMax H3 Max Perform ?
Benchmarks of MiniMax H3 Max
I benchmark eseguiti dal provider sono utili per mostrare ciò che il post-addestramento ha preso di mira, ma test di preferenza di terze parti aggiornati continuamente sono più utili per confrontare H3 Max con l’H3 originale sotto la stessa metodologia di arena.
| Benchmark snapshot — Sep. 18, 2026 | MiniMax H3 Max | MiniMax H3 | Difference |
|---|---|---|---|
| Text-to-Video with Audio Elo | 1227 ±9 | 1220 ±8 | +7 |
| Text-to-Video samples | 5,689 | 8,602 | — |
| Image-to-Video with Audio Elo | 1195 ±10 | 1181 ±8 | +14 |
| Image-to-Video samples | 5,569 | 6,949 | — |
| Video Editing with Audio Elo | Not ranked in this comparison | 1132 ±6 | — |
Nota sulla metodologia dei benchmark. Le cifre di Artificial Analysis sono istantanee datate di Elo basate su preferenze umane in cieco; questo articolo riporta il punteggio, l’intervallo di confidenza al 95%, il numero di campioni, la categoria e la data dell’istantanea. I risultati #1 di fal sono eseguiti dal fornitore sull’infrastruttura di fal, e il suo grafico comparativo pubblico non divulga ogni prompt, hardware o parametro di serving necessario per una riproduzione indipendente.
L’istantanea attuale supporta una conclusione ristretta: H3 Max ha un punteggio di preferenza misurato più alto in entrambe le categorie di generazione audio-video direttamente comparabili. Gli intervalli di confidenza si sovrappongono, quindi il divario non dovrebbe essere presentato come un vantaggio di qualità universale o drammatico.
fal’s own H3 Max evaluation
fal riporta che H3 Max si è classificato primo su preferenza complessiva, comprensione del prompt ed estetica nella sua valutazione testa a testa contro dodici modelli video. Si tratta di evidenze del fornitore, quindi è meglio leggerle insieme ai dati indipendenti di arena piuttosto che come loro sostituto.

Grafico ufficiale fal costi-vs-qualità di H3 Max
L’interpretazione più utile non è “H3 Max vince universalmente.” È che H3 Max migliora in modo sostanziale il punto operativo velocità-qualità di H3, mentre il divario nei punteggi di preferenza indipendenti rispetto a H3 rimane relativamente modesto.
Speed, Quality, and the Trade-off
fal riporta che H3 Max genera un video di cinque secondi a 768p in meno di tre secondi sulla sua infrastruttura ottimizzata—circa 35× il throughput dell’endpoint MiniMax H3 ufficiale nel confronto di fal. Trattatelo come evidenza di inferenza specifica del fornitore: accodamento, trasferimento di rete, controlli di sicurezza e un backend diverso possono aumentare la latenza end-to-end.
Il vantaggio in qualità è più modesto del vantaggio in velocità. Nell’istantanea indipendente del 18 settembre utilizzata qui, H3 Max ha guidato H3 di 7 Elo per text-to-video con audio e 14 Elo per image-to-video con audio, ma gli intervalli di confidenza si sovrappongono. La conclusione difendibile è che H3 Max sposta il fronte velocità-qualità; non garantisce un risultato visibilmente migliore per ogni prompt.
Scelta pratica: usare H3 Max per iterazioni rapide, produzione ad alto throughput in formato breve e prompt in cui l’aderenza è importante. Preferire H3 standard quando il workflow dipende dal sistema multimodale più ampio, dal video editing, dal deployment con pesi open o dal percorso H3-Regenerate-2K.
How Much Do MiniMax H3 Max Cost?
La tariffazione richiede contesto perché le tariffe del provider e le promozioni possono cambiare indipendentemente. La seguente istantanea riflette le tariffe esposte pubblicamente verificate il 18 settembre 2026.
| Pricing source | H3 Max | H3 |
|---|---|---|
| fal 480p | $0.025/sec promotional | — |
| fal 768p | $0.04/sec promotional | — |
| fal 1080p refinement | $0.08/sec promotional | — |
| MiniMax official 768p | — | $0.08/sec |
| MiniMax official 2K | — | $0.13/sec |
| MiniMax 768p → 2K regeneration | — | $0.05/sec |
| CometAPI starting price | $0.064/sec | $0.064/sec |
Attualmente fal etichetta le tariffe di H3 Max come prezzi promozionali di lancio e indica che lo sconto termina il 30 settembre 2026. L’API MiniMax H3 Max in CometAPI mostra attualmente $0.064 per secondo, mentre l’API MiniMax H3 in CometAPI parte anch’essa da $0.064 per secondo. Le tariffe del provider dovrebbero essere ricontrollate prima di prevedere un carico di produzione ampio.
How to try MiniMax H3 Max
L’API MiniMax H3 Max in CometAPI è attualmente disponibile con ID modello minimax-h3-max, un endpoint di produzione sotto /v1/videos, gestione asincrona dei task e un prezzo iniziale esposto di $0.064 per secondo.
- Create un’API key. Accedete a CometAPI, create un token e conservatelo in modo sicuro come
COMETAPI_KEY. - Submit a generation task. Inviate una richiesta
POSTahttps://api.cometapi.com/v1/videoscon modellominimax-h3-max, un prompt, la durata e la dimensione dell’output. Aggiungete un URL di immagine quando usate image-to-video. - Poll the asynchronous task. Leggete l’ID del task restituito e richiedete
GET /v1/videos/{task_id}finché lo stato non diventacompletedofailed. Usate un intervallo di polling invece di inviare richieste continue. - Download and review. Recuperate
GET /v1/videos/{task_id}/content, salvate l’MP4 e verificate aderenza al prompt, movimento, sincronizzazione audio e artefatti visivi prima di scalare il carico.
Per un confronto equo H3 Max versus H3, mantenete fissi prompt, durata, rapporto d’aspetto, risoluzione, input di riferimento, impostazioni audio e politica di ritentativi. Confermate lo schema live e il prezzo sulla pagina del modello prima della produzione, perché il routing e i parametri esposti possono cambiare indipendentemente dal modello sottostante.
Limitations of MiniMax H3 Max
Primo, H3 Max non sostituisce il workflow di rigenerazione 2K di H3. L’opzione 1080p attualmente documentata è un raffinamento dell’output nativo a 768p, non lo stesso percorso di rigenerazione in-context a 2K utilizzato da H3.
Secondo, la latenza di punta di H3 Max è strettamente legata allo stack di inferenza ottimizzato di fal, quindi la stessa velocità a muro non dovrebbe essere data per scontata su un altro backend.
Terzo, il vantaggio di qualità indipendente rispetto a H3 è attualmente modesto. L’istantanea del 18 settembre mostra +7 Elo nel text-to-video con audio e +14 Elo nell’image-to-video con audio, con intervalli di confidenza sovrapposti.
Infine, H3 rimane il sistema più ampio se “migliore” significa video editing, profondità dei riferimenti multimodali, deployment con pesi open o massima risoluzione di output, piuttosto che throughput di generazione puro.
Conclusion
MiniMax H3 Max va inteso come una variante di H3 ottimizzata per la produzione, non come un successore più grande. Il post-addestramento e la co-progettazione dell’inferenza da parte di fal creano un punto operativo convincente per la generazione audiovisiva rapida in formato breve, mentre il vantaggio di preferenza indipendente rispetto a H3 standard rimane modesto piuttosto che universale.
Scegliete H3 Max quando velocità d’iterazione, throughput e aderenza al prompt sono i vincoli principali. Scegliete H3 standard quando vi serve il workflow multimodale più ampio, il video editing, i pesi open H3-Base o la rigenerazione 2K. Prima di impegnarvi in uno dei due percorsi, eseguite un benchmark controllato con prompt e impostazioni identici e calcolate il costo per clip accettata—non solo il costo per secondo generato.
FAQ
How should teams interpret H3 Max's benchmark lead when the confidence intervals overlap?
Trattate il vantaggio come evidenza direzionale, non come prova che H3 Max vince ogni prompt. Nell’istantanea citata, H3 Max supera H3 di 7 Elo nel text-to-video con audio e di 14 Elo nell’image-to-video con audio, ma gli intervalli di confidenza si sovrappongono. I team dovrebbero quindi testare un set di prompt rappresentativo, riportare il tasso di vittoria e le modalità di fallimento, ed evitare di trasformare un vantaggio aggregato modesto in un’affermazione di qualità universale.
How should teams compare the true production cost of H3 Max and H3 beyond the listed price per second?
Calcolate il costo per clip accettata piuttosto che il costo per secondo generato. Includete ritentativi, output respinti, raffinamento a 1080p o rigenerazione 2K, storage e transfer, tempo di revisione e qualsiasi editing a valle. H3 Max può ridurre i costi di iterazione grazie a generazione più veloce e maggiore aderenza al prompt, mentre H3 può essere più economico quando il suo editing, i controlli multimodali o il workflow 2K evitano strumenti aggiuntivi e rework.
What generation speed can teams realistically expect, and which factors affect end-to-end latency?
fal riporta meno di tre secondi di inferenza per una clip di cinque secondi a 768p sulla sua infrastruttura ottimizzata. Non è una garanzia end-to-end universale: tempi di coda, upload degli input, espansione del prompt, elaborazioni di sicurezza, risoluzione, durata e routing del provider influenzano tutta la latenza osservata. Eseguite un benchmark dell’esatto endpoint e della configurazione che pianificate di distribuire
Which H3 Max workflow should be used for text-only, image-conditioned, keyframe-controlled, or reference-driven jobs?
Usate il text-to-video quando la scena può essere definita interamente in linguaggio; usate l’image-to-video quando identità, composizione o stile visivo devono partire da un frame fornito. Scegliete il controllo dal primo all’ultimo fotogramma quando sono importanti sia lo stato iniziale che quello finale, e il reference-to-video quando la coerenza con più riferimenti visivi è importante. Il workflow corretto riduce l’ambiguità del prompt e dovrebbe essere fissato prima di confrontare H3 Max con H3.
How should teams choose among 480p, 768p, H3 Max 1080p refinement, and H3 2K regeneration?
Usate 480p per bozze economiche e screening di concept ad alto volume, quindi passate a 768p per valutazioni normali e molte delivery web. Scegliete il raffinamento a 1080p di H3 Max quando la produzione rapida resta prioritaria ma il formato di delivery richiede più pixel. Scegliete la rigenerazione 2K di H3 quando il massimo dettaglio e il workflow H3 più ampio giustificano latenza e costi più alti; confrontate gli artefatti finali alla dimensione effettiva di visualizzazione piuttosto che selezionare solo in base all’etichetta di risoluzione.
How does MiniMax H3's 2K regeneration differ from H3 Max's 1080p refinement?
Sì. MiniMax H3 standard può raggiungere 2K tramite H3-Regenerate-2K. Si tratta di una fase di rigenerazione in-context che riutilizza sia le istruzioni multimodali originali sia il risultato a 768p, permettendole di ricostruire dettagli invece di applicare un passaggio di super-risoluzione convenzionale. Questo workflow più ampio è un motivo per preferire H3 a H3 Max per la massima risoluzione.
Which parts of MiniMax H3 are open-weight, and which parts still require hosted APIs?
Parzialmente. MiniMax ha rilasciato i checkpoint H3-Base FL2VA e Ref2VA sotto la H3 Community License, abilitando la validazione locale della generazione core a 768p. Il sistema di produzione completo non è completamente open: H3-Context-IR e H3-Regenerate-2K restano componenti hosted, quindi riprodurre l’intero workflow ufficiale 2K richiede le API MiniMax.
When should an API product choose H3 Max instead of standard H3?
Spesso, quando l’applicazione valorizza bassa latenza, iterazione creativa rapida e throughput di produzione. Non è automaticamente la scelta API migliore: H3 standard è preferibile per rigenerazione 2K, condizionamento multimodale più ampio, video editing o deployment con pesi open. Eseguite un test di accettazione e confrontate il costo per output utilizzabile prima di scegliere.
What should a production evaluation suite measure before switching from H3 to H3 Max?
Misurate aderenza al prompt, coerenza del movimento, artefatti visivi, qualità e sincronizzazione audio, coerenza dell’identità e tasso di accettazione da parte dei revisori. Aggiungete metriche operative come tasso di fallimento dei task, tasso di ritentativi, latenza end-to-end p50 e p95 e costo per clip accettata. Segmentate i risultati per text-to-video, image-to-video, durata, risoluzione, rapporto d’aspetto e complessità del prompt così che una media forte non nasconda uno scenario debole critico per la produzione.
