MiniMax H3: 오픈 옴니모달 비디오 생성 모델

ComfyUI Wiki

MiniMax H3는 네이티브 32kHz 스테레오 오디오, 768p 출력, 2K 인컨텍스트 재생성을 갖춘 오픈 옴니모달 비디오 생성 모델입니다. 네이티브 ComfyUI 지원.

M

MiniMax H3

비디오 생성네이티브 오디오옴니모달텍스트 투 비디오이미지 투 비디오

MiniMax H3는 텍스트, 이미지, 비디오, 오디오를 통합적으로 이해하고 단일 패스로 최대 15초 길이의 네이티브 32kHz 스테레오 오디오가 포함된 비디오를 생성하는 오픈 범용 옴니모달 생성 모델입니다. MiniMax Hailuo 비디오 라인의 최신 모델로, Qwen3-VL-32B 텍스트 인코더를 갖춘 33.1B 밀집 단일 스트림 옴니 트랜스포머를 기반으로 합니다.

개발사MiniMax
출시일2026-08
아키텍처33.1B 밀집 단일 스트림 옴니 트랜스포머(13B adaLN 브랜치)
텍스트 인코더Qwen3-VL-32B(50번째 레이어 히든 스테이트)
비디오 VAE시간 인과 VAE, f16t4d24
오디오 VAE32kHz 스테레오에서 40Hz latent 토큰
라이선스MiniMax H3 커뮤니티 라이선스

MiniMax H3는 24 FPS로 최대 15초, 네이티브 32kHz 스테레오 오디오가 포함된 비디오를 11개 언어로 생성합니다. 출력은 기본적으로 768px 짧은 변을 사용하며, H3-Regenerate-2K 모듈이 결과를 2K 해상도로 인컨텍스트 재생성합니다. 모델은 2026년 8월 3일 MiniMax H3 커뮤니티 라이선스 계약에 따라 공식적으로 오픈소스화되었으며, 네이티브 ComfyUI 지원이 같은 날 병합되었습니다(Comfy-Org/ComfyUI #15224).

체크포인트

체크포인트모드
FL2VA텍스트 투 비디오, 첫 프레임, 마지막 프레임, 첫+마지막 프레임
Ref2VA참조 기반: 최대 9개 이미지, 3개 비디오, 3개 오디오 클립(혼합 최대 12개 파일)

리소스

Guides and workflows related to this model series.

No articles found.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…