HuMo: 인간 중심 비디오 생성 모델 - 다운로드
ComfyUI Wiki
HuMo는 ByteDance Research의 통합 인간 중심 비디오 생성 프레임워크로, 텍스트, 이미지, 오디오 기반 인간 비디오 생성을 지원합니다.
H
HuMo
비디오인간 비디오 생성텍스트 기반 비디오 생성오디오 기반ByteDanceByteDance Research의 통합 인간 중심 비디오 생성 프레임워크. 텍스트, 이미지, 오디오를 포함한 멀티모달 입력으로 고품질의 제어 가능한 인간 비디오를 생성합니다. 텍스트-이미지, 텍스트-오디오, 텍스트-이미지-오디오 생성 모드를 지원합니다. 1.7B 및 17B 매개변수 변형으로 제공되며 FP8 양자화 옵션이 있습니다.
| 개발자 | ByteDance Research |
| 출시일 | 2025-08 |
| 아키텍처 | Diffusion Transformer |
| 모델 크기 | 1.7B, 17B (FP16 + FP8) |
| 라이선스 | Apache 2.0 |
| 기능 | 텍스트-이미지, 텍스트-오디오, 텍스트-이미지-오디오 인간 비디오 생성 |
| 필수 오디오 인코더 | Whisper Large V3 (포함) |
Guides and workflows related to this model series.
No articles found.
댓글
GitHub로 로그인하고 토론에 참여하세요.