HuMo: Модель генерации видео с человеком - Скачать
ComfyUI Wiki
HuMo - это унифицированная платформа генерации видео с человеком от ByteDance Research, поддерживающая текстовый, изображенческий и аудио-управляемый синтез человеческого видео.
H
HuMo
VideoГенерация видео с человекомТекст-в-видеоАудио-управляемыйByteDanceУнифицированная платформа генерации видео с человеком от ByteDance Research. Создает высококачественные, управляемые видео с людьми на основе мультимодальных входных данных, включая текст, изображения и аудио. Поддерживает режимы генерации Текст-Изображение, Текст-Аудио и Текст-Изображение-Аудио. Доступна в вариантах с 1,7B и 17B параметров с опцией квантизации FP8.
| Разработчик | ByteDance Research |
| Дата релиза | 2025-08 |
| Архитектура | Diffusion Transformer |
| Размеры модели | 1,7B, 17B (FP16 + FP8) |
| Лицензия | Apache 2.0 |
| Возможности | Текст-Изображение, Текст-Аудио, Текст-Изображение-Аудио генерация видео с человеком |
| Требуемый аудио-энкодер | Whisper Large V3 (включен) |
Guides and workflows related to this model series.
No articles found.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.