MiniMax H3 오픈 가중치 공식 출시, 네이티브 ComfyUI 지원 병합

ComfyUI Wikinews

MiniMax H3 오픈 가중치가 Hugging Face에 공개되고 네이티브 ComfyUI 지원이 병합되었습니다. bf16, INT8, pruned, NVFP4 리패키징 파일과 공식 워크플로우 템플릿 6개가 제공됩니다.

MiniMax의 H3(Hailuo 시리즈의 기반이 되는 옴니모달 비디오 모델) 오픈 가중치가 공식 출시되었습니다. 가중치가 Hugging Face에 공개되었고, 네이티브 ComfyUI 지원도 같은 날 적용되었습니다. pull request Comfy-Org/ComfyUI #15224이 8월 3일에 병합되어 오디오-비디오 통합 생성을 위한 새 노드 4개와 공식 워크플로우 템플릿 6개가 추가되었습니다.

H3는 7월 31일에 출시되었습니다(출시 기사 읽기). 오픈 가중치 공개로 33.1B 오디오-비디오 통합 확산 트랜스포머를 여러 양자화 옵션과 함께 로컬 GPU에서 사용할 수 있게 되었습니다.

MiniMax 공식 데모의 예시 입력 이미지

MiniMax 공식 H3 멀티모달 컨텍스트 데모에서 사용된 예시 입력 이미지

참조 클립, 이미지, 오디오 트랙을 단일 프롬프트로 결합한 H3 생성 영상(출처: MiniMax 블로그)

시스템 개요

H3는 3개의 모듈로 구성된 범용 옴니모달 생성 시스템입니다:

  • H3-Context-IR: 멀티모달 컨텍스트(텍스트, 이미지, 비디오, 오디오)를 파싱하여 생성용 구조화된 중간 표현으로 변환하는 관리형 전처리·오케스트레이션 시스템. 이 모듈은 오픈소스 범위에 포함되지 않으며, MiniMax가 API로 제공하고 자체 구축을 위한 프롬프트 작성 가이드도 공개합니다.
  • H3-Base: 네이티브 스테레오 오디오가 포함된 768p 비디오를 생성하는 오픈 가중치 33.1B 옴니 트랜스포머.
  • H3-Regenerate-2K: 원본 멀티모달 컨텍스트를 재사용하여 768p 출력을 in-context 방식으로 2K 해상도로 재생성합니다. 이 모듈은 아직 오픈소스로 공개되지 않았으며, API로 전체 2K 파이프라인을 재현할 수 있습니다.

오픈 릴리스는 H3-Base를 2개의 태스크 전용 checkpoint로 제공합니다: FL2VA(텍스트 투 비디오, 첫 프레임, 마지막 프레임, 첫+마지막 프레임 모드)와 Ref2VA(참조 이미지, 비디오, 오디오 기반 참조 생성).

출력 사양

항목사양
길이4~15초
화면비21:9, 16:9, 4:3, 1:1, 3:4, 9:16
해상도기본 짧은 변 768px. 2K는 H3-Regenerate-2K
프레임 속도24 FPS
오디오32kHz 스테레오, 동일 패스에서 생성
언어11개 언어 안정 지원(ar, zh, en, fr, de, it, ja, ko, pt, ru, es)

입력 모드

FL2VA는 0, 1, 2개의 이미지를 받습니다: 이미지 없음은 텍스트 투 비디오, 1개는 첫 또는 마지막 프레임 조건, 2개는 첫+마지막 프레임 조건입니다.

Ref2VA는 최대 9개의 참조 이미지, 3개의 참조 비디오(각 215초, 총 15초 이내), 3개의 참조 오디오(각 215초, 총 15초 이내, 이미지 또는 비디오와 함께 입력 필수)를 받습니다. 혼합 입력은 총 12개 파일로 제한됩니다.

Hugging Face에 오픈 가중치 공개

현재 두 개의 리포지토리가 공개되어 있습니다:

  • MiniMaxAI/MiniMax-H3(Hugging Face): Diffusers 형식의 공식 릴리스. FL2VA와 Ref2VA 변형, 전체 모델 코드, 프롬프트 작성 가이드(베이스 / 참조)를 포함하며 MiniMax H3 커뮤니티 라이선스 계약에 따라 제공됩니다.
  • Comfy-Org/MiniMax-H3(Hugging Face): ComfyUI 네이티브 노드용으로 리패키징된 파일. models/diffusion_models, models/text_encoders, models/vae에 넣기만 하면 됩니다.
구성 요소파일
확산 모델minimax_h3_fl2va_bf16(61.7 GB), minimax_h3_fl2va_int8_convrot(31.7 GB), minimax_h3_fl2va_pruned_int8_convrot(19.5 GB), 및 해당 ref2va_* 변형
텍스트 인코더qwen3vl_32b_minimax_h3_bf16(48.0 GB), int8_convrot(25.3 GB), nvfp4_awq(14.6 GB)
VAEminimax_h3_video_vae_fp16(4.9 GB), minimax_h3_audio_vae_fp32(0.6 GB)

pruned INT8 checkpoint는 미리 계산된 adaLN 커브 테이블 덕분에 표준 INT8 파일보다 약 40% 작으며, NVFP4 AWQ 텍스트 인코더는 모든 GPU에서 실행됩니다.

네이티브 ComfyUI 지원 병합

네이티브 지원이 8월 3일에 Comfy-Org/ComfyUI #15224로 병합되어, 비디오와 스테레오 오디오 latent를 공동으로 디노이즈하는 단일 스트림 패킹 확산 트랜스포머를 통합하며 Qwen3-VL-32B 히든 스테이트를 토큰별 모달리티 태그와 함께 조건으로 사용합니다. 워크플로우를 처리하는 새 노드는 4개입니다: EmptyMiniMaxH3LatentAV, MiniMaxH3ImageToVideo, MiniMaxH3ReferenceToVideo, MiniMaxH3SigmaShift.

공식 텍스트 투 비디오 및 이미지 투 비디오 워크플로우를 다운로드하여 사용할 수 있습니다:

공식 워크플로우 템플릿

공식 템플릿 6개가 Comfy-Org/workflow_templates을 통해 배포되었습니다:

템플릿모드
video_minimax_h3_t2v.json로컬: 텍스트 투 비디오
video_minimax_h3_i2v.json로컬: 이미지 투 비디오
video_minimax_h3_r2v.json로컬: 참조 투 비디오
api_minimax_h3_t2v.jsonAPI: 텍스트 투 비디오
api_minimax_h3_r2v.jsonAPI: 참조 투 비디오
api_minimax_h3_flf2v.jsonAPI: 첫/마지막 프레임 투 비디오

로컬 오픈 가중치 워크플로우에 대한 단계별 가이드가 공식 문서에 게시되었습니다: MiniMax H3 오픈소스 워크플로우 튜토리얼.

사용 가능 여부

  • 오픈 가중치: Hugging Face에서 공개 중(MiniMaxAI/MiniMax-H3). ComfyUI 리패키징 버전은 Comfy-Org/MiniMax-H3.
  • ComfyUI: 네이티브 지원이 Comfy-Org/ComfyUI #15224에서 병합되었습니다. ComfyUI를 최신 버전으로 업데이트하면 새 노드를 사용할 수 있습니다.
  • 공식 템플릿: ComfyUI 내장 템플릿 갤러리에 워크플로우 6개.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
MiniMax H3 오픈 가중치 공식 출시, 네이티브 ComfyUI 지원 병합 | ComfyUI Wiki