TL;DR
MiniMax H3 Max não é um novo modelo de base que substitui o MiniMax H3. É uma variante pós-treinada do MiniMax H3 criada pela fal Research, usando os pesos abertos do H3 e pós-treinamento adicional focado em adesão ao prompt, estética visual e eficiência de inferência.
Essa distinção explica a maioria das diferenças entre os dois modelos. O MiniMax H3 Max é otimizado para inferência de produção rápida e maior adesão ao prompt, enquanto o MiniMax H3 permanece como o sistema omnimodal mais amplo, incluindo condicionamento multimodal mais rico, fluxos de trabalho de edição de vídeo e saída até 2K por meio do H3-Regenerate-2K.
Em 18 de setembro de 2026, dados independentes de preferência mostram o H3 Max com 1227 Elo em texto-para-vídeo com áudio versus 1220 para o H3, e 1195 Elo em imagem-para-vídeo com áudio versus 1181 para o H3. As diferenças são relevantes o suficiente para serem acompanhadas, mas não grandes a ponto de implicar uma diferença dramática de qualidade em todo prompt.
Principais conclusões
- O H3 Max é uma variante pós-treinada do H3, não o H4 nem uma arquitetura H3 maior. A fal partiu dos pesos abertos do MiniMax H3 e otimizou o modelo e a pilha de serving em conjunto.
- Velocidade é o diferenciador mais claro do H3 Max. A fal relata cerca de três segundos ou menos para gerar cinco segundos em 768p na sua infraestrutura otimizada.
- O H3 Max atualmente lidera o H3 nos dois testes independentes diretamente comparáveis usados aqui. O snapshot mais recente mostra +7 Elo em texto-para-vídeo com áudio e +14 Elo em imagem-para-vídeo com áudio.
- O MiniMax H3 ainda é o fluxo de trabalho de modelo de base mais amplo. Suporta referências multimodais mais ricas, edição, pesos abertos H3-Base e regeneração em 2K.
- Resolução é uma distinção importante. H3 Max expõe geração 480p/768p mais refinamento latente em 1080p, enquanto o H3 pode alcançar 2K via H3-Regenerate-2K.
O que é o MiniMax H3 Max?
MiniMax H3 Max é um modelo de geração de vídeo com IA desenvolvido pela fal Research por meio de pós-treinamento dos pesos abertos do MiniMax H3. Em vez de substituir a arquitetura H3 subjacente por um novo modelo de base, a fal concentrou-se em adesão ao prompt, estética e vazão de inferência.
A palavra “Max” pode, portanto, ser enganosa se for interpretada como um nível convencional com mais parâmetros. Materiais públicos não estabelecem um Transformer maior ou uma nova escala de parâmetros para o H3 Max. A diferenciação vem principalmente do pós-treinamento e de uma pilha de serving desenhada em torno do modelo modificado.
A fal também descreve novos dados de pós-treinamento substanciais e ciclos de avaliação centrados na qualidade visível ao usuário. Na prática, o H3 Max é melhor entendido como uma variante do H3 otimizada para produção, em vez de um sucessor projetado do zero.
Especificações do MiniMax H3 Max em um relance
| Especificação | MiniMax H3 Max |
|---|---|
| Modelo base | MiniMax H3 |
| Desenvolvedor do pós-treinamento | fal Research |
| Categoria do modelo | Geração de áudio-vídeo |
| Texto para vídeo | Sim |
| Imagem para vídeo | Sim |
| Controle de primeiro/último quadro | Sim |
| Referência para vídeo | Sim |
| Duração de saída | 5-15 segundos |
| Resolução nativa de geração | 480p / 768p |
| Opção 1080p | Refinamento latente a partir de 768p nativo |
| Taxa de quadros | 24 FPS |
| Áudio | Áudio estéreo sincronizado |
| Proporções | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 |
| Otimização primária | Adesão ao prompt, estética, vazão |
| ID do modelo na CometAPI | minimax-h3-max |
O esquema atual da API da fal descreve a opção 1080p como refinamento latente a partir de uma fonte nativa 768p, o que importa ao comparar o H3 Max com sistemas que regeneram em uma resolução genuinamente mais alta.
Como o MiniMax H3 Max funciona?
Compreender o H3 Max começa com a fundação H3 que está abaixo dele. A MiniMax descreve o H3 como um sistema gerativo omnimodal, em vez de uma coleção de modelos isolados de texto-para-vídeo, imagem-para-vídeo, áudio e edição.
O fluxo de trabalho completo do H3 é organizado em torno de H3-Context-IR, H3-Base e H3-Regenerate-2K. O H3-Context-IR interpreta instruções multimodais em linguagem livre, o H3-Base executa a geração audiovisual central em 768p, e o H3-Regenerate-2K reutiliza o contexto original mais o resultado em menor resolução para regenerar uma saída em resolução mais alta.
A base H3 sob o H3 Max
A MiniMax documenta o H3-Omni-Transformer como um Transformer denso de fluxo único com 33 bilhões de parâmetros, com aproximadamente 13B de parâmetros em ramificações relacionadas a AdaLN. O H3-Encoder usa pesos pré-treinados Qwen3-VL-32B, enquanto VAEs visuais e de áudio separados codificam suas respectivas modalidades antes da geração conjunta.
O H3-Omni-Transformer prediz conjuntamente latentes de vídeo e áudio, em vez de tratar o som como uma etapa de pós-processamento separada. Essa arquitetura é a razão pela qual tanto o H3 quanto o H3 Max podem produzir saída audiovisual sincronizada.
Arquitetura oficial do modelo MiniMax H3
O que a fal mudou para o H3 Max
A fal pós-treinou o H3 com dados adicionais voltados à fidelidade de instruções e qualidade visual, depois desenvolveu o sistema de inferência ao lado do modelo, em vez de otimizar o serving apenas após o término do treinamento. O artigo de lançamento descreve esse co-design de modelo e inferência como a razão central pela qual o H3 Max consegue deslocar o trade-off qualidade-velocidade.
Isso é importante porque simplesmente reduzir etapas de amostragem ou precisão pode diminuir a latência enquanto degrada a qualidade de saída. A fal diz que otimizações candidatas foram mantidas apenas quando os checkpoints resultantes continuaram se sustentando em suas avaliações de preferência.
O MiniMax H3 fornece a fundação de geração multimodal; o H3 Max muda onde essa fundação se posiciona na curva qualidade-velocidade-custo.
Quais são os principais recursos do MiniMax H3 Max?
Maior adesão ao prompt
A adesão ao prompt foi um alvo direto do pós-treinamento. Isso importa para prompts estruturados que combinam múltiplas ações, transições de cena, direções de câmera, restrições temporais e instruções de estilo.
Geração mais rápida que a duração do vídeo
O H3 Max é projetado para uma latência de geração incomumente baixa. A fal relata clipes de cinco segundos em 768p em cerca de três segundos ou menos na sua infraestrutura otimizada, permitindo ciclos criativos iterativos muito mais ágeis.
Áudio sincronizado nativo
O H3 Max mantém a abordagem de geração conjunta de áudio e vídeo do H3, de modo que diálogo, ambiência, efeitos sonoros e movimento podem ser produzidos em um fluxo de trabalho audiovisual coordenado.
Múltiplos fluxos de geração
A família H3 Max suporta texto-para-vídeo, imagem-para-vídeo, geração do primeiro ao último quadro e referência-para-vídeo.
Expansão de prompt embutida
O endpoint de texto-para-vídeo expõe modos de expansão de prompt como disabled, balanced e quality, permitindo que desenvolvedores troquem tempo de pré-processamento por uma interpretação de prompt mais rica.
Como o MiniMax H3 Max performa?
Benchmarks do MiniMax H3 Max
Benchmarks conduzidos por provedores são úteis para mostrar o foco do pós-treinamento, mas testes de preferência de terceiros continuamente atualizados são mais úteis para comparar o H3 Max com o H3 original sob a mesma metodologia de arena.
| Instantâneo de benchmark — 18 de set. de 2026 | MiniMax H3 Max | MiniMax H3 | Diferença |
|---|---|---|---|
| Elo de Texto-para-Vídeo com Áudio | 1227 ±9 | 1220 ±8 | +7 |
| Amostras de Texto-para-Vídeo | 5.689 | 8.602 | — |
| Elo de Imagem-para-Vídeo com Áudio | 1195 ±10 | 1181 ±8 | +14 |
| Amostras de Imagem-para-Vídeo | 5.569 | 6.949 | — |
| Elo de Edição de Vídeo com Áudio | Não classificado nesta comparação | 1132 ±6 | — |
Nota sobre a metodologia de benchmark. As cifras do Artificial Analysis são instantâneos datados de Elo de preferência humana às cegas; este artigo reporta a pontuação, intervalo de confiança de 95%, contagem de amostras, categoria e data do snapshot. Prompts exatos, configurações de geração e procedimentos de avaliação devem ser verificados em relação à metodologia atual do Artificial Analysis. O resultado #1 da fal é executado pelo provedor na infraestrutura da fal, e seu gráfico público de comparação não divulga todos os prompts, hardware ou parâmetros de serving necessários para reprodução independente.
O snapshot atual sustenta uma conclusão estreita: o H3 Max tem a maior pontuação de preferência medida nas duas categorias diretamente comparáveis de geração audiovisual. Os intervalos de confiança se sobrepõem, portanto a diferença não deve ser apresentada como uma liderança universal ou dramática de qualidade.
Avaliação do H3 Max pela própria fal
A fal relata que o H3 Max ficou em primeiro lugar em preferência geral, entendimento de prompts e estética na sua avaliação frente a frente contra doze modelos de vídeo. Isso é evidência conduzida pelo provedor, então é melhor lê-la ao lado dos dados de arena independentes, e não como substituto.

Gráfico oficial da fal de custo versus qualidade do H3 Max
A interpretação mais útil não é “H3 Max vence universalmente.” É que o H3 Max melhora materialmente o ponto de operação de velocidade-qualidade do H3 enquanto a diferença de preferência independente sobre o H3 permanece comparativamente modesta.
Velocidade, qualidade e o trade-off
A fal relata que o H3 Max gera um vídeo de cinco segundos em 768p em menos de três segundos na sua infraestrutura otimizada — cerca de 35× a vazão do endpoint oficial do MiniMax H3 na comparação da fal. Trate isso como evidência de inferência específica do provedor: enfileiramento, transferência de rede, verificações de segurança e um backend diferente podem aumentar a latência fim a fim.
A vantagem de qualidade é mais modesta do que a vantagem de velocidade. No snapshot independente de 18 de setembro usado aqui, o H3 Max liderou o H3 por 7 Elo em texto-para-vídeo com áudio e 14 Elo em imagem-para-vídeo com áudio, mas os intervalos de confiança se sobrepõem. A conclusão defensável é que o H3 Max desloca a fronteira velocidade-qualidade; ele não garante um resultado visivelmente melhor para todo prompt.
Escolha prática: use o H3 Max para iteração rápida, produção de alto throughput em formatos curtos e prompts onde a adesão importa. Prefira o H3 padrão quando o fluxo de trabalho depende do sistema multimodal mais amplo, edição de vídeo, implantação com pesos abertos ou do caminho H3-Regenerate-2K.
Quanto custa o MiniMax H3 Max?
Precificação precisa de contexto porque tarifas e promoções de provedores podem mudar independentemente. O snapshot a seguir reflete tarifas exibidas publicamente verificadas em 18 de setembro de 2026.
| Fonte de preço | H3 Max | H3 |
|---|---|---|
| fal 480p | US$ 0,025/s promocional | — |
| fal 768p | US$ 0,04/s promocional | — |
| fal refinamento 1080p | US$ 0,08/s promocional | — |
| MiniMax oficial 768p | — | US$ 0,08/s |
| MiniMax oficial 2K | — | US$ 0,13/s |
| MiniMax 768p → regeneração 2K | — | US$ 0,05/s |
| Preço inicial na CometAPI | US$ 0,064/s | US$ 0,064/s |
Atualmente a fal rotula suas tarifas do H3 Max como preços promocionais de lançamento e afirma que o desconto termina em 30 de setembro de 2026. A API MiniMax H3 Max na CometAPI atualmente exibe US$ 0,064 por segundo, enquanto a API MiniMax H3 na CometAPI também começa em US$ 0,064 por segundo. A precificação do provedor deve ser verificada novamente antes de projetar uma grande carga de produção.
Como experimentar o MiniMax H3 Max
A API do MiniMax H3 Max na CometAPI está atualmente disponível com o ID de modelo minimax-h3-max, um endpoint de produção em /v1/videos, manuseio assíncrono de tarefas e um preço inicial exibido de US$ 0,064 por segundo.
- Crie uma chave de API. Faça login na CometAPI, crie um token e armazene-o com segurança como COMETAPI_KEY.
- Envie uma tarefa de geração. Envie uma requisição POST para
https://api.cometapi.com/v1/videoscom o modelo minimax-h3-max, um prompt, duração e tamanho de saída. Adicione uma URL de imagem ao usar imagem-para-vídeo. - Faça polling da tarefa assíncrona. Leia o ID da tarefa retornado e solicite GET /v1/videos/{task_id} até que o status se torne completed ou failed. Use um intervalo de polling em vez de enviar requisições contínuas.
- Baixe e revise. Recupere GET /v1/videos/{task_id}/content, salve o MP4 e inspecione adesão ao prompt, movimento, sincronização de áudio e artefatos visuais antes de escalar a carga de trabalho.
Para uma comparação justa H3 Max versus H3, mantenha fixos prompt, duração, proporção, resolução, entradas de referência, configurações de áudio e política de novas tentativas. Confirme o esquema vivo e o preço na página do modelo antes da produção, pois o roteamento e parâmetros expostos podem mudar independentemente do modelo subjacente.
Limitações do MiniMax H3 Max
Primeiro, o H3 Max não substitui o fluxo de trabalho de regeneração em 2K do H3. Sua opção 1080p atualmente documentada é um refinamento do output nativo de 768p, e não o mesmo caminho de regeneração em contexto em 2K usado pelo H3.
Segundo, a latência de destaque do H3 Max está intimamente ligada à pilha de inferência otimizada da fal, então a mesma velocidade de relógio não deve ser presumida em outro backend.
Terceiro, a liderança de qualidade independente sobre o H3 é atualmente modesta. O snapshot de 18 de setembro mostra +7 Elo em texto-para-vídeo com áudio e +14 Elo em imagem-para-vídeo com áudio, com intervalos de confiança sobrepostos.
Por fim, o H3 permanece sendo o sistema mais amplo se “melhor” significar edição de vídeo, profundidade de referências multimodais, implantação com pesos abertos ou resolução máxima de saída, em vez de vazão de geração bruta.
Conclusão
O MiniMax H3 Max é melhor entendido como uma variante do H3 otimizada para produção, não como um sucessor maior. O pós-treinamento e o co-design de inferência da fal criam um ponto de operação convincente para geração audiovisual rápida de formato curto, enquanto a liderança de preferência independente sobre o H3 padrão permanece modesta, e não universal.
Escolha o H3 Max quando velocidade de iteração, vazão e adesão ao prompt forem as principais restrições. Escolha o H3 padrão quando você precisar do fluxo de trabalho multimodal mais amplo, edição de vídeo, pesos abertos H3-Base ou regeneração em 2K. Antes de se comprometer com qualquer rota, execute um benchmark controlado com prompts e configurações idênticos e calcule o custo por clipe aceito — não apenas o custo por segundo gerado.
FAQ
Como as equipes devem interpretar a liderança de benchmark do H3 Max quando os intervalos de confiança se sobrepõem?
Trate a liderança como evidência direcional, não como prova de que o H3 Max vence todo prompt. No snapshot citado, o H3 Max lidera o H3 por 7 Elo em texto-para-vídeo com áudio e 14 Elo em imagem-para-vídeo com áudio, mas os intervalos de confiança se sobrepõem. As equipes devem, portanto, testar um conjunto de prompts representativo, reportar taxa de vitória e modos de falha e evitar transformar uma liderança modesta agregada em uma afirmação universal de qualidade.
Como as equipes devem comparar o verdadeiro custo de produção do H3 Max e do H3 além do preço listado por segundo?
Calcule o custo por clipe aceito, e não o custo por segundo gerado. Inclua novas tentativas, outputs rejeitados, refinamento 1080p ou regeneração em 2K, armazenamento e transferência, tempo de revisão e qualquer edição downstream. O H3 Max pode reduzir o custo de iteração por meio de geração mais rápida e maior adesão ao prompt, enquanto o H3 pode ser mais econômico quando sua edição, controles multimodais ou fluxo de 2K evitam ferramentas adicionais e retrabalho.
Que velocidade de geração as equipes podem realisticamente esperar e quais fatores afetam a latência fim a fim?
A fal relata menos de três segundos de inferência para um clipe de cinco segundos em 768p na sua infraestrutura otimizada. Isso não é uma garantia fim a fim universal: tempo de fila, uploads de entrada, expansão de prompt, processamento de segurança, resolução, duração e roteamento do provedor afetam a latência observada. Faça benchmark do endpoint e configuração exatos que você planeja implantar
Qual fluxo de trabalho do H3 Max deve ser usado para trabalhos apenas com texto, condicionados a imagem, controlados por keyframes ou orientados por referências?
Use texto-para-vídeo quando a cena puder ser definida inteiramente em linguagem; use imagem-para-vídeo quando identidade, composição ou estilo visual precisarem partir de um quadro fornecido. Escolha controle do primeiro ao último quadro quando os estados inicial e final forem ambos importantes, e referência-para-vídeo quando a consistência com múltiplas referências visuais importar. O fluxo de trabalho correto reduz a ambiguidade do prompt e deve ser fixado antes de comparar o H3 Max com o H3.
Como as equipes devem escolher entre 480p, 768p, refinamento 1080p do H3 Max e regeneração 2K do H3?
Use 480p para rascunhos baratos e triagem de conceitos em alto volume, depois vá para 768p para avaliação normal e muitas entregas web. Escolha o refinamento 1080p do H3 Max quando a produção rápida continuar sendo a prioridade, mas o formato de entrega exigir mais pixels. Escolha a regeneração 2K do H3 quando o máximo de detalhe e o fluxo de trabalho mais amplo do H3 justificarem maior latência e custo; compare os artefatos finais no tamanho real de exibição, em vez de selecionar apenas pelo rótulo de resolução.
Como a regeneração em 2K do MiniMax H3 difere do refinamento em 1080p do H3 Max?
Sim. O MiniMax H3 padrão pode alcançar 2K por meio do H3-Regenerate-2K. Esta é uma etapa de regeneração em contexto que reutiliza tanto as instruções multimodais originais quanto o resultado em 768p, permitindo reconstruir detalhes em vez de aplicar um passo convencional de super-resolução. Esse fluxo de trabalho mais amplo é uma razão para preferir o H3 ao H3 Max para resolução máxima.
Quais partes do MiniMax H3 têm pesos abertos e quais ainda exigem APIs hospedadas?
Parcialmente. A MiniMax lançou os checkpoints H3-Base FL2VA e Ref2VA sob a H3 Community License, permitindo validação local da geração central em 768p. O sistema de produção completo não é totalmente aberto: H3-Context-IR e H3-Regenerate-2K permanecem componentes hospedados, portanto reproduzir todo o fluxo oficial em 2K requer as APIs da MiniMax.
Quando um produto de API deve escolher o H3 Max em vez do H3 padrão?
Frequentemente, quando a aplicação valoriza baixa latência, iteração criativa rápida e vazão de produção. Não é automaticamente a melhor escolha de API: o H3 padrão é preferível para regeneração em 2K, condicionamento multimodal mais amplo, edição de vídeo ou implantação com pesos abertos. Execute um teste de aceitação e compare o custo por output utilizável antes de escolher.
O que uma suíte de avaliação de produção deve medir antes de migrar do H3 para o H3 Max?
Meça adesão ao prompt, coerência de movimento, artefatos visuais, qualidade e sincronização de áudio, consistência de identidade e taxa de aceitação por revisores. Adicione métricas operacionais como taxa de falha de tarefas, taxa de novas tentativas, latência fim a fim p50 e p95 e custo por clipe aceito. Segmente resultados por texto-para-vídeo, imagem-para-vídeo, duração, resolução, proporção e complexidade do prompt para que uma média forte não esconda um cenário fraco crítico para a produção.
