MiniMax H3: 네이티브 오디오를 갖춘 오픈 옴니모달 비디오 모델

ComfyUI Wiki

MiniMax H3는 오픈 범용 옴니모달 생성 모델입니다: 768p 비디오 + 네이티브 32kHz 스테레오 오디오, 11개 언어, 2K 인컨텍스트 재생성 지원.

M

MiniMax H3

비디오 생성네이티브 오디오옴니모달텍스트 투 비디오이미지 투 비디오

MiniMax H3는 텍스트, 이미지, 비디오, 오디오로 구성된 멀티모달 컨텍스트를 이해하고 단일 패스로 최대 15초 길이의 네이티브 32kHz 스테레오 오디오가 포함된 비디오를 생성하는 오픈 범용 옴니모달 생성 시스템입니다. MiniMax Hailuo 비디오 라인의 최신 모델로, Qwen3-VL-32B 텍스트 인코더를 갖춘 33.1B 밀집 단일 스트림 옴니 트랜스포머를 기반으로 합니다.

MiniMax 공식 데모의 예시 입력 이미지

MiniMax 공식 H3 멀티모달 컨텍스트 데모에서 사용된 예시 입력 이미지

MiniMax H3는 2026년 8월 3일 MiniMax H3 커뮤니티 라이선스 계약에 따라 공식적으로 오픈소스화되었습니다. 오픈 릴리스는 H3-Base를 두 개의 태스크 전용 checkpoint로 제공합니다: FL2VA(텍스트 투 비디오 및 첫/마지막 프레임 조건)와 Ref2VA(참조 기반 생성). H3-Context-IR 전처리 시스템과 H3-Regenerate-2K 업스케일링 모듈은 호스팅 API로 제공됩니다.

버전

버전설명
H3-Base FL2VA텍스트 투 비디오, 첫 프레임, 마지막 프레임, 첫+마지막 프레임 모드
H3-Base Ref2VA최대 9개 이미지, 3개 비디오, 3개 오디오 클립 기반 참조 생성

주요 기능

  • 네이티브 스테레오 오디오: 영상과 동일한 패스에서 32kHz 스테레오 생성, 별도 오디오 모델 불필요
  • 멀티모달 컨텍스트: 텍스트, 이미지, 비디오, 오디오의 모든 조합을 입력으로 사용
  • 2K 인컨텍스트 재생성: H3-Regenerate-2K가 원본 컨텍스트를 재사용하여 768p 출력을 2K로 재생성
  • 11개 언어: ar, zh, en, fr, de, it, ja, ko, pt, ru, es
  • 배포: SGLang, vLLM, diffusers, ComfyUI

설치

MiniMax H3는 ComfyUI에서 네이티브로 지원됩니다. 파일을 각각의 폴더에 배치하세요:

파일대상 폴더
minimax_h3_*_bf16.safetensors 또는 *_int8_convrot.safetensorsComfyUI/models/diffusion_models/
qwen3vl_32b_minimax_h3_*.safetensorsComfyUI/models/text_encoders/
minimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/
minimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/

공식 ComfyUI 리패키징 리포지토리(Comfy-Org/MiniMax-H3)는 bf16, INT8 convrot, pruned INT8 확산 모델 변형과 bf16, INT8, NVFP4 AWQ 텍스트 인코더 옵션을 제공합니다. pruned INT8 checkpoint는 미리 계산된 adaLN 커브 테이블 덕분에 표준 INT8 파일보다 약 40% 작으며, NVFP4 AWQ 텍스트 인코더는 모든 GPU에서 실행됩니다.

리소스

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…