HuMo: Модель генерации видео с человеком - Скачать

ComfyUI Wiki

HuMo - это унифицированная платформа генерации видео с человеком от ByteDance Research, поддерживающая текстовый, изображенческий и аудио-управляемый синтез человеческого видео.

H

HuMo

VideoГенерация видео с человекомТекст-в-видеоАудио-управляемыйByteDance

Унифицированная платформа генерации видео с человеком от ByteDance Research. Создает высококачественные, управляемые видео с людьми на основе мультимодальных входных данных, включая текст, изображения и аудио. Поддерживает режимы генерации Текст-Изображение, Текст-Аудио и Текст-Изображение-Аудио. Доступна в вариантах с 1,7B и 17B параметров с опцией квантизации FP8.

РазработчикByteDance Research
Дата релиза2025-08
АрхитектураDiffusion Transformer
Размеры модели1,7B, 17B (FP16 + FP8)
ЛицензияApache 2.0
ВозможностиТекст-Изображение, Текст-Аудио, Текст-Изображение-Аудио генерация видео с человеком
Требуемый аудио-энкодерWhisper Large V3 (включен)

Guides and workflows related to this model series.

No articles found.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…