HuMo: 인간 중심 비디오 생성 모델 - 다운로드

ComfyUI Wiki

HuMo는 ByteDance Research의 통합 인간 중심 비디오 생성 프레임워크로, 텍스트, 이미지, 오디오 기반 인간 비디오 생성을 지원합니다.

H

HuMo

비디오인간 비디오 생성텍스트 기반 비디오 생성오디오 기반ByteDance

ByteDance Research의 통합 인간 중심 비디오 생성 프레임워크. 텍스트, 이미지, 오디오를 포함한 멀티모달 입력으로 고품질의 제어 가능한 인간 비디오를 생성합니다. 텍스트-이미지, 텍스트-오디오, 텍스트-이미지-오디오 생성 모드를 지원합니다. 1.7B 및 17B 매개변수 변형으로 제공되며 FP8 양자화 옵션이 있습니다.

개발자ByteDance Research
출시일2025-08
아키텍처Diffusion Transformer
모델 크기1.7B, 17B (FP16 + FP8)
라이선스Apache 2.0
기능텍스트-이미지, 텍스트-오디오, 텍스트-이미지-오디오 인간 비디오 생성
필수 오디오 인코더Whisper Large V3 (포함)

Guides and workflows related to this model series.

No articles found.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…