MiniMax H3: 오픈 옴니모달 비디오 생성 모델
ComfyUI Wiki
MiniMax H3는 네이티브 32kHz 스테레오 오디오, 768p 출력, 2K 인컨텍스트 재생성을 갖춘 오픈 옴니모달 비디오 생성 모델입니다. 네이티브 ComfyUI 지원.
M
MiniMax H3
비디오 생성네이티브 오디오옴니모달텍스트 투 비디오이미지 투 비디오MiniMax H3는 텍스트, 이미지, 비디오, 오디오를 통합적으로 이해하고 단일 패스로 최대 15초 길이의 네이티브 32kHz 스테레오 오디오가 포함된 비디오를 생성하는 오픈 범용 옴니모달 생성 모델입니다. MiniMax Hailuo 비디오 라인의 최신 모델로, Qwen3-VL-32B 텍스트 인코더를 갖춘 33.1B 밀집 단일 스트림 옴니 트랜스포머를 기반으로 합니다.
| 개발사 | MiniMax |
| 출시일 | 2026-08 |
| 아키텍처 | 33.1B 밀집 단일 스트림 옴니 트랜스포머(13B adaLN 브랜치) |
| 텍스트 인코더 | Qwen3-VL-32B(50번째 레이어 히든 스테이트) |
| 비디오 VAE | 시간 인과 VAE, f16t4d24 |
| 오디오 VAE | 32kHz 스테레오에서 40Hz latent 토큰 |
| 라이선스 | MiniMax H3 커뮤니티 라이선스 |
MiniMax H3는 24 FPS로 최대 15초, 네이티브 32kHz 스테레오 오디오가 포함된 비디오를 11개 언어로 생성합니다. 출력은 기본적으로 768px 짧은 변을 사용하며, H3-Regenerate-2K 모듈이 결과를 2K 해상도로 인컨텍스트 재생성합니다. 모델은 2026년 8월 3일 MiniMax H3 커뮤니티 라이선스 계약에 따라 공식적으로 오픈소스화되었으며, 네이티브 ComfyUI 지원이 같은 날 병합되었습니다(Comfy-Org/ComfyUI #15224).
체크포인트
| 체크포인트 | 모드 |
|---|---|
| FL2VA | 텍스트 투 비디오, 첫 프레임, 마지막 프레임, 첫+마지막 프레임 |
| Ref2VA | 참조 기반: 최대 9개 이미지, 3개 비디오, 3개 오디오 클립(혼합 최대 12개 파일) |
리소스
Guides and workflows related to this model series.
No articles found.
댓글
GitHub로 로그인하고 토론에 참여하세요.