MiniMax H3: 네이티브 오디오를 갖춘 오픈 옴니모달 비디오 모델
MiniMax가 H3를 출시했습니다. 네이티브 스테레오 오디오, 멀티모달 컨텍스트 이해, 명령 기반 편집을 지원하며 2K 15초 클립을 생성하는 옴니모달 비디오 모델입니다.
MiniMax가 MiniMax H3를 공식 출시했습니다. H3는 텍스트, 이미지, 비디오, 오디오를 함께 이해하는 범용 옴니모달 생성 모델로, 최대 2K 해상도와 15초 길이의 네이티브 스테레오 오디오가 포함된 비디오를 생성하며, 회사는 며칠 내에 모델 가중치를 공개할 계획입니다.
H3는 MiniMax의 Hailuo 01/02 비디오 모델 라인의 후속 모델입니다. 이는 비디오 생성 모델이지, 올해 초 MiniMax가 오픈소스로 공개한 M 시리즈 언어 모델 중 하나가 아닙니다.
멀티모달 컨텍스트 이해
실제 창작 작업은 여러 양식(modality)의 정보를 결합하는 것을 의미합니다. H3는 텍스트, 이미지, 비디오, 오디오의 모든 조합을 입력으로 받아들이며, 이들 사이의 관계를 자연어로 설명할 수 있습니다. MiniMax의 공식 데모는 다음과 같은 샷을 프롬프트로 제시합니다: "비디오 1의 히치콕 카메라 무브먼트를 참조하고, 이미지 2의 캐릭터가 오디오 3의 보컬과 일치하게 노래하게 하세요." 모델은 전체 양식 이해를 스스로 처리합니다.
MiniMax 공식 H3 멀티모달 컨텍스트 데모에 사용된 예시 입력 이미지
참조 클립, 이미지, 오디오 트랙을 하나의 프롬프트로 결합해 생성한 H3 비디오 (출처: MiniMax 블로그)
주요 기능
- 네이티브 2K 비디오 - 별도의 초해상도 모듈 대신 인컨텍스트 재생성 방식으로 구현한, 클립당 최대 15초의 2K 해상도.
- 네이티브 스테레오 오디오 - 대사, 효과음, 음악이 화면과 동일한 패스에서 생성되며, 음성, SFX, 음악 도메인이 분리되지 않습니다.
- 옴니 레퍼런스 생성 - 최대 9개의 참조 이미지, 3개의 참조 비디오, 3개의 참조 오디오 클립으로 단일 생성을 제어할 수 있습니다.
- 명령 기반 편집 - 자연어로 변경 사항을 설명하여 기존 이미지, 비디오 또는 오디오를 편집합니다.
- V2V 모션 전송 - 소스 비디오의 움직임을 새 장면으로 옮깁니다.
- 강력한 텍스트 및 브랜드 렌더링 - 광고, 브랜딩, 이커머스, 제품 디자인, UI/UX 사용 사례에 적합합니다.
네이티브 스테레오 오디오 데모
네이티브 스테레오 사운드 생성 데모 (출처: MiniMax 블로그)
가격
MiniMax는 H3의 가격 대비 성능이 업계 최고 수준이라고 강조합니다. 2K에서는 초당 가격이 주류 모델의 3분의 1 미만이며, 768p에서는 경쟁사의 720p 등급 가격의 절반 미만입니다. 종량제 가격은 2K 출력 기준 초당 0.13달러부터 시작합니다.
사용 가능 여부
MiniMax H3는 현재 MiniMax 플랫폼 API와 fal.ai 등의 타사 제공업체를 통해 사용할 수 있습니다. MiniMax는 적용 가능한 법률과 규정에 따라 며칠 내에 모델 가중치를 공개할 계획이라고 밝혔습니다. 이 글을 작성하는 시점에 아직 Hugging Face 저장소는 공개되지 않았으며, 전체 기술 보고서도 곧 공개될 예정입니다.
ComfyUI에서는 7월 31일 ComfyUI에 병합된 공식 MiniMax 파트너 노드(API 기반)를 통해 H3를 사용할 수 있습니다 (Comfy-Org/ComfyUI #15167). 오픈 가중치가 공개되면 네이티브 로컬 지원이 제공될 것으로 예상됩니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.