TL;DR
MiniMax H3 Max는 MiniMax H3를 대체하는 완전히 새로운 파운데이션 모델이 아니다. 이는 H3 오픈 가중치를 사용하고 프롬프트 준수성, 시각적 미학, 추론 효율성에 집중한 추가 후속 학습을 적용해 fal Research가 만든 MiniMax H3의 사후(포스트) 학습 변종이다.
이 구분은 두 모델 간 대부분의 차이를 설명한다. MiniMax H3 Max는 빠른 프로덕션 추론과 더 강한 프롬프트 준수성에 최적화된 반면, MiniMax H3는 더 풍부한 멀티모달 컨디셔닝, 오픈 H3-Base 가중치, 비디오 편집 워크플로, H3-Regenerate-2K를 통한 2K 출력까지 포함하는 더 광범위한 옴니모달 시스템의 성격을 유지한다.
2026년 9월 18일 기준, 독립 선호도 데이터에서 H3 Max는 오디오 포함 텍스트-투-비디오에서 Elo 1227로 H3의 1220보다 높고, 오디오 포함 이미지-투-비디오에서 Elo 1195로 H3의 1181보다 높게 나타났다. 격차는 추적할 만큼 의미가 있지만, 모든 프롬프트에서 극적인 품질 차이를 의미할 정도로 크지는 않다.
Key Takeaways
- H3 Max는 H4나 더 큰 H3 아키텍처가 아니라 H3의 사후(포스트) 학습 변형이다. fal은 MiniMax H3 오픈 가중치에서 시작해 모델과 서빙 스택을 함께 최적화했다.
- 속도는 H3 Max의 가장 분명한 차별점이다. fal은 최적화된 인프라에서 5초 길이 768p 영상을 약 3초 이하로 생성한다고 보고한다.
- 이 글에서 사용한 두 가지 직접 비교 가능한 독립 선호도 테스트에서 현재 H3 Max가 H3를 앞선다. 최신 스냅샷은 오디오 포함 텍스트-투-비디오에서 +7 Elo, 오디오 포함 이미지-투-비디오에서 +14 Elo를 보여준다.
- MiniMax H3는 여전히 더 넓은 파운데이션-모델 워크플로다. 더 풍부한 멀티모달 참조, 편집, 오픈 H3-Base 가중치, 2K 재생성을 지원한다.
- 해상도는 중요한 구분점이다. H3 Max는 480p/768p 생성과 1080p 잠재 정제를 제공하며, H3는 H3-Regenerate-2K를 통해 2K에 도달할 수 있다.
What Is MiniMax H3 Max?
MiniMax H3 Max는 MiniMax H3 오픈 가중치를 사후(포스트) 학습하여 fal Research가 개발한 AI 비디오 생성 모델이다. 기반 H3 아키텍처를 완전히 새로운 파운데이션 모델로 대체하는 대신, fal은 프롬프트 준수성, 미학, 추론 처리량에 집중했다.
따라서 “Max”라는 단어가 전통적인 더 큰 파라미터 등급으로 해석되면 오해를 낳을 수 있다. 공개 자료는 H3 Max가 더 큰 Transformer나 새로운 파라미터 규모를 갖추었다고 밝히고 있지 않다. 차별화는 주로 사후 학습과 변경된 모델을 중심으로 설계된 서빙 스택에서 나온다.
fal은 사용자 가시적 품질에 초점을 둔 상당한 신규 사후 학습 데이터와 평가 루프도 언급한다. 실무적으로 H3 Max는 클린시트 후속작이라기보다 프로덕션 최적화된 H3 변형으로 이해하는 것이 적절하다.
MiniMax H3 Max specifications at glance
| Specification | MiniMax H3 Max |
|---|---|
| Base model | MiniMax H3 |
| Post-training developer | fal Research |
| Model category | Audio-video generation |
| Text-to-video | Yes |
| Image-to-video | Yes |
| First/last-frame control | Yes |
| Reference-to-video | Yes |
| Output duration | 5-15 seconds |
| Native generation resolution | 480p / 768p |
| 1080p option | Latent refinement from native 768p |
| Frame rate | 24 FPS |
| Audio | Synchronized stereo audio |
| Aspect ratios | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 |
| Primary optimization | Prompt adherence, aesthetics, throughput |
| CometAPI model ID | minimax-h3-max |
현재 fal API 스키마는 1080p 옵션을 기본 768p 소스에서의 잠재 정제로 설명한다. 이는 H3 Max를 진정한 더 높은 해상도로 재생성하는 시스템과 비교할 때 중요한 포인트다.
How Does MiniMax H3 Max Work?
H3 Max를 이해하려면 그 밑단의 H3 파운데이션부터 시작해야 한다. MiniMax는 H3를 고립된 텍스트-투-비디오, 이미지-투-비디오, 오디오, 편집 모델들의 집합이 아니라 옴니모달 생성 시스템으로 설명한다.
완전한 H3 워크플로는 H3-Context-IR, H3-Base, H3-Regenerate-2K를 중심으로 구성된다. H3-Context-IR는 자유형 멀티모달 지시를 해석하고, H3-Base가 768p에서 핵심 오디오비주얼 생성을 수행하며, H3-Regenerate-2K는 원래 컨텍스트와 저해상도 결과를 재사용해 더 높은 해상도의 출력을 재생성한다.
The H3 foundation beneath H3 Max
MiniMax는 H3-Omni-Transformer를 약 330억 파라미터의 조밀한 싱글-스트림 Transformer로 문서화하고 있으며, 이 중 약 130억 파라미터가 AdaLN 관련 분기에 있다. H3-Encoder는 사전학습된 Qwen3-VL-32B 가중치를 사용하고, 별도의 비주얼 및 오디오 VAE가 각자 모달리티를 인코딩한 뒤 공동 생성을 수행한다.
H3-Omni-Transformer는 사운드를 별도의 사후 처리 단계로 취급하지 않고 비디오와 오디오 잠재를 공동으로 예측한다. 이러한 아키텍처 덕분에 H3와 H3 Max 모두 동기화된 오디오비주얼 출력을 생성할 수 있다.
MiniMax H3 모델 아키텍처(공식)
What fal changed for H3 Max
fal은 지시 충실도와 시각적 품질을 목표로 추가 데이터를 통해 H3를 사후 학습하고, 학습이 끝난 후에만 서빙을 최적화한 것이 아니라 모델과 추론 시스템을 동시에 개발했다. 출시 글은 이 모델-추론 공동 설계를 H3 Max가 품질-속도 트레이드오프를 이동시킬 수 있는 핵심 이유로 설명한다.
이는 단순히 샘플링 스텝이나 정밀도를 줄이면 지연을 낮출 수 있지만 출력 품질이 저하될 수 있기 때문에 중요하다. fal은 후보 최적화가 자사 선호도 평가에서 유지되는 경우에만 체크포인트에 반영했다고 말한다.
MiniMax H3가 멀티모달 생성의 기반을 제공하고, H3 Max는 그 기반이 서 있는 품질-속도-비용 곡선상의 위치를 바꾼다.
What Are the Main Features of MiniMax H3 Max?
Stronger prompt adherence
프롬프트 준수성은 직접적인 사후 학습 목표였다. 이는 여러 동작, 장면 전환, 카메라 지시, 시간적 제약, 스타일 지시가 결합된 구조화 프롬프트에서 중요하다.
Faster-than-video-duration generation
H3 Max는 이례적으로 낮은 생성 지연을 위해 설계되었다. fal은 최적화된 인프라에서 5초 길이 768p 클립을 약 3초 이하로 생성한다고 보고하며, 훨씬 촘촘한 반복적 크리에이티브 루프를 가능하게 한다.
Native synchronized audio
H3 Max는 H3의 오디오-비디오 공동 생성 접근을 유지하므로, 대사, 앰비언스, 효과음, 동작을 조율된 오디오비주얼 워크플로로 생성할 수 있다.
Multiple generation workflows
H3 Max 계열은 텍스트-투-비디오, 이미지-투-비디오, 첫-마지막 프레임 생성, 참조-투-비디오 워크플로를 지원한다.
Built-in prompt expansion
텍스트-투-비디오 엔드포인트는 disabled, balanced, quality와 같은 프롬프트 확장 모드를 제공하여, 더 풍부한 프롬프트 해석을 위해 전처리 시간을 늘리는 선택지를 개발자에게 제공한다.
How Does MiniMax H3 Max Perform ?
Benchmarks of MiniMax H3 Max
제공사 벤치마크는 사후 학습이 무엇을 목표로 했는지 보여주기에 유용하지만, 동일한 아레나 방법론에서 원래 H3와 H3 Max를 비교할 때는 지속적으로 업데이트되는 제3자 선호도 테스트가 더 유용하다.
| Benchmark snapshot — Sep. 18, 2026 | MiniMax H3 Max | MiniMax H3 | Difference |
|---|---|---|---|
| Text-to-Video with Audio Elo | 1227 ±9 | 1220 ±8 | +7 |
| Text-to-Video samples | 5,689 | 8,602 | — |
| Image-to-Video with Audio Elo | 1195 ±10 | 1181 ±8 | +14 |
| Image-to-Video samples | 5,569 | 6,949 | — |
| Video Editing with Audio Elo | Not ranked in this comparison | 1132 ±6 | — |
Benchmark methodology note. Artificial Analysis 수치는 날짜가 명시된 블라인드 인간-선호 Elo 스냅샷이다. 이 글은 점수, 95% 신뢰구간, 샘플 수, 카테고리, 스냅샷 날짜를 보고한다. 정확한 프롬프트, 생성 설정, 평가 절차는 현재의 Artificial Analysis 방법론과 대조해야 한다. fal의 1위 결과는 fal 인프라에서 수행된 제공사 기반이며, 공개 비교 차트는 독립 재현에 필요한 모든 프롬프트, 하드웨어, 서빙 매개변수를 공개하지 않는다.
현재 스냅샷은 좁은 결론을 지지한다: 두 개의 직접 비교 가능한 오디오-비디오 생성 카테고리에서 H3 Max가 더 높은 측정 선호 점수를 갖는다. 신뢰구간이 겹치므로, 이 격차를 보편적이거나 극적인 품질 우위로 제시해서는 안 된다.
fal’s own H3 Max evaluation
fal은 자체 헤드-투-헤드 평가에서 H3 Max가 12개 비디오 모델 대비 전체 선호도, 프롬프트 이해, 미학에서 1위를 기록했다고 보고한다. 이는 제공사 기반 증거이므로, 독립 아레나 데이터의 대체물이 아니라 보완 자료로 읽는 것이 바람직하다.

fal H3 Max 비용-대-품질 차트(공식)
가장 유용한 해석은 “H3 Max가 보편적으로 승리한다”가 아니다. H3 Max가 H3의 속도-품질 운용점을 실질적으로 개선하나, H3 대비 독립 선호 점수 격차는 비교적 온건하다는 것이다.
Speed, Quality, and the Trade-off
fal은 최적화된 인프라에서 5초 768p 비디오를 3초 미만에 생성한다고 보고하며—이는 fal의 비교에서 공식 MiniMax H3 엔드포인트 대비 약 35배 처리량이다. 이를 제공사-특정 추론 증거로 취급해야 한다: 대기열, 네트워크 전송, 안전 점검, 다른 백엔드 등은 종단 간 지연을 증가시킬 수 있다.
품질 우위는 속도 우위보다 더 온건하다. 9월 18일의 독립 스냅샷에서 H3 Max는 오디오 포함 텍스트-투-비디오에서 H3 대비 7 Elo, 오디오 포함 이미지-투-비디오에서 14 Elo 앞섰지만, 신뢰구간이 겹친다. 방어 가능한 결론은 H3 Max가 속도-품질 프론티어를 이동시킨다는 것이지, 모든 프롬프트에서 눈에 띄게 더 나은 결과를 보장한다는 것은 아니다.
실무적 선택: 빠른 반복, 고처리량의 숏폼 프로덕션, 프롬프트 준수성이 중요한 프롬프트에는 H3 Max를 사용하라. 더 넓은 멀티모달 시스템, 비디오 편집, 오픈 가중치 배포, H3-Regenerate-2K 경로에 의존하는 워크플로에는 표준 H3를 선호하라.
How Much Do MiniMax H3 Max Cost?
요금은 제공사 요율과 프로모션이 독립적으로 변동할 수 있으므로 맥락이 필요하다. 다음 스냅샷은 2026년 9월 18일에 확인된 공개 표시 요율을 반영한다.
| Pricing source | H3 Max | H3 |
|---|---|---|
| fal 480p | $0.025/sec promotional | — |
| fal 768p | $0.04/sec promotional | — |
| fal 1080p refinement | $0.08/sec promotional | — |
| MiniMax official 768p | — | $0.08/sec |
| MiniMax official 2K | — | $0.13/sec |
| MiniMax 768p → 2K regeneration | — | $0.05/sec |
| CometAPI starting price | $0.064/sec | $0.064/sec |
fal은 현재 H3 Max 요율을 출시 프로모션으로 표기하며, 할인이 2026년 9월 30일 종료된다고 명시한다. CometAPI의 MiniMax H3 Max API는 현재 초당 $0.064의 시작 가격을 표시하며, MiniMax H3 API도 초당 $0.064에서 시작한다. 대규모 프로덕션을 계획하기 전에 제공사 요금을 재확인해야 한다.
How to try MiniMax H3 Max
CometAPI의 MiniMax H3 Max API는 현재 모델 ID minimax-h3-max, /v1/videos 하의 프로덕션 엔드포인트, 비동기 작업 처리, 초당 $0.064의 시작 가격으로 제공된다.
- API 키 생성. CometAPI에 로그인해 토큰을 생성하고 COMETAPI_KEY로 안전하게 저장한다.
- 생성 작업 제출.
https://api.cometapi.com/v1/videos에 모델 minimax-h3-max, 프롬프트, 길이, 출력 크기를 포함한 POST 요청을 보낸다. 이미지-투-비디오를 사용할 때는 이미지 URL을 추가한다. - 비동기 작업 폴링. 반환된 작업 ID를 읽고 상태가 completed 또는 failed가 될 때까지 GET /v1/videos/{task_id} 를 요청한다. 연속 요청 대신 폴링 간격을 사용한다.
- 다운로드 및 검토. GET /v1/videos/{task_id}/content 를 통해 MP4를 가져와 저장하고, 프로덕션을 확장하기 전에 프롬프트 준수성, 모션, 오디오 동기화, 시각적 아티팩트를 점검한다.
H3 Max와 H3의 공정한 비교를 위해 프롬프트, 길이, 화면비, 해상도, 참조 입력, 오디오 설정, 재시도 정책을 동일하게 유지하라. 모델 페이지에서 라이브 스키마와 가격을 확인하라. 라우팅과 노출되는 매개변수는 기반 모델과 독립적으로 변경될 수 있다.
Limitations of MiniMax H3 Max
첫째, H3 Max는 H3의 2K 재생성 워크플로를 대체하지 않는다. 현재 문서화된 1080p 옵션은 기본 768p 출력의 정제이며, H3가 사용하는 동일한 인컨텍스트 2K 재생성 경로와는 다르다.
둘째, H3 Max의 헤드라인 지연 시간은 fal의 최적화된 추론 스택과 긴밀히 연결되어 있으므로, 다른 백엔드에서 동일한 실시간 속도를 가정해서는 안 된다.
셋째, H3 대비 독립 품질 우위는 현재로서는 온건하다. 9월 18일 벤치마크 스냅샷은 오디오 포함 텍스트-투-비디오에서 +7 Elo, 오디오 포함 이미지-투-비디오에서 +14 Elo를 보이며, 신뢰구간이 겹친다.
마지막으로, “더 낫다”는 의미가 비디오 편집, 멀티모달 참조 깊이, 오픈 가중치 배포, 최대 출력 해상도라면, H3가 H3 Max보다 더 넓은 시스템으로 남는다. 원시 생성 처리량만이 기준인 경우와 구분해야 한다.
Conclusion
MiniMax H3 Max는 더 큰 후속작이 아니라 프로덕션에 최적화된 H3 변형으로 이해하는 것이 맞다. fal의 사후 학습과 추론 공동 설계는 빠른 숏폼 오디오비주얼 생성에 매력적인 운용점을 만들어 주며, 표준 H3 대비 독립 선호도 우위는 보편적이라기보다 온건하다.
반복 속도, 처리량, 프롬프트 준수성이 주요 제약일 때는 H3 Max를, 더 넓은 멀티모달 워크플로, 비디오 편집, 오픈 H3-Base 가중치, 2K 재생성이 필요할 때는 표준 H3를 선택하라. 어느 경로든 투입하기 전에 동일한 프롬프트와 설정으로 통제된 벤치마크를 수행하고, 초당 생성 비용이 아니라 승인된 클립당 비용을 계산하라.
FAQ
How should teams interpret H3 Max's benchmark lead when the confidence intervals overlap?
리드를 방향성 있는 증거로 취급하되, H3 Max가 모든 프롬프트에서 승리한다는 증거로 해석하지 말라. 인용된 스냅샷에서 H3 Max는 오디오 포함 텍스트-투-비디오에서 H3 대비 7 Elo, 오디오 포함 이미지-투-비디오에서 14 Elo 앞섰지만, 신뢰구간이 겹친다. 팀은 대표 프롬프트 세트를 테스트하고, 승률과 실패 모드를 보고하며, 온건한 집계 우위를 보편적 품질 주장으로 확장하지 않도록 해야 한다.
How should teams compare the true production cost of H3 Max and H3 beyond the listed price per second?
초당 생성 비용이 아니라 승인된 클립당 비용을 계산하라. 재시도, 반려 출력, 1080p 정제 또는 2K 재생성, 저장·전송, 리뷰 시간, 후속 편집을 모두 포함하라. H3 Max는 더 빠른 생성과 더 강한 프롬프트 준수성으로 반복 비용을 낮출 수 있으며, H3는 편집, 멀티모달 제어, 2K 워크플로를 통해 추가 도구와 재작업을 피할 수 있을 때 경제적일 수 있다.
What generation speed can teams realistically expect, and which factors affect end-to-end latency?
fal은 최적화된 인프라에서 5초 길이 768p 클립에 대해 3초 미만의 추론 시간을 보고한다. 이는 보편적 종단 간 보장이 아니다: 대기 시간, 입력 업로드, 프롬프트 확장, 안전 처리, 해상도, 길이, 제공사 라우팅 등이 관측 지연에 영향을 준다. 배포 계획인 정확한 엔드포인트와 구성을 벤치마크하라
Which H3 Max workflow should be used for text-only, image-conditioned, keyframe-controlled, or reference-driven jobs?
장면을 전적으로 언어로 정의할 수 있으면 텍스트-투-비디오를 사용하라. 정체성, 구도, 시각적 스타일이 제공된 프레임에서 시작해야 하면 이미지-투-비디오를 사용하라. 시작과 종료 상태가 모두 중요하면 첫-마지막 프레임 제어를, 복수 시각 참조와의 일관성이 중요하면 참조-투-비디오를 선택하라. 올바른 워크플로는 프롬프트 모호성을 줄이며, H3 Max와 H3를 비교하기 전에 고정해야 한다.
How should teams choose among 480p, 768p, H3 Max 1080p refinement, and H3 2K regeneration?
480p는 저비용 드래프트와 대량 컨셉 스크리닝에 사용하고, 768p는 일반 평가와 많은 웹 전달에 사용하라. 빠른 프로덕션이 여전히 우선이지만 전달 형식에 더 많은 픽셀을 요구할 때는 H3 Max의 1080p 정제를 선택하라. 최대 디테일과 더 넓은 H3 워크플로가 더 높은 지연과 비용을 정당화할 때는 H3의 2K 재생성을 선택하라. 단순 해상도 라벨이 아니라 실제 표시 크기에서 최종 산출물을 비교하라.
How does MiniMax H3's 2K regeneration differ from H3 Max's 1080p refinement?
그렇다. 표준 MiniMax H3는 H3-Regenerate-2K를 통해 2K에 도달할 수 있다. 이는 원래 멀티모달 지시와 768p 결과를 모두 재사용하는 인컨텍스트 재생성 단계로, 통상적인 초해상 처리와 달리 디테일을 재구축할 수 있다. 이 더 넓은 워크플로는 최대 해상도가 중요한 경우 H3를 H3 Max보다 선호할 이유다.
Which parts of MiniMax H3 are open-weight, and which parts still require hosted APIs?
부분적이다. MiniMax는 H3-Base FL2VA와 Ref2VA 체크포인트를 H3 Community License로 공개하여 핵심 768p 생성의 로컬 검증을 가능하게 했다. 완전한 프로덕션 시스템은 전부 공개된 것이 아니다: H3-Context-IR와 H3-Regenerate-2K는 호스티드 구성요소로 남아 있으므로, 공식 2K 워크플로 전체를 재현하려면 MiniMax API가 필요하다.
When should an API product choose H3 Max instead of standard H3?
종종, 애플리케이션이 낮은 지연, 빠른 크리에이티브 반복, 프로덕션 처리량을 중시할 때다. 자동으로 더 나은 API 선택은 아니다: 2K 재생성, 더 넓은 멀티모달 컨디셔닝, 비디오 편집, 오픈 가중치 배포가 필요하면 표준 H3가 바람직하다. 수용 테스트를 수행하고, 사용 가능한 출력당 비용을 비교한 뒤에 선택하라.
What should a production evaluation suite measure before switching from H3 to H3 Max?
프롬프트 준수성, 모션 일관성, 시각적 아티팩트, 오디오 품질과 동기화, 정체성 일관성, 리뷰어 승인율을 측정하라. 작업 실패율, 재시도율, p50 및 p95 종단 간 지연, 승인된 클립당 비용과 같은 운영 지표도 추가하라. 텍스트-투-비디오, 이미지-투-비디오, 길이, 해상도, 화면비, 프롬프트 복잡도별로 결과를 세분화해, 강한 평균이 프로덕션-크리티컬 시나리오의 약점을 가리지 않도록 하라.
