HuMo: Modelo de generación de video centrado en humanos - Descarga

ComfyUI Wiki

HuMo es un marco unificado de generación de video centrado en humanos de ByteDance Research que admite generación de video humano guiada por texto, imagen y audio.

H

HuMo

VideoGeneración de video humanoTexto a videoGuiado por audioByteDance

Marco unificado de generación de video centrado en humanos de ByteDance Research. Produce videos humanos de alta calidad y controlables a partir de entradas multimodales que incluyen texto, imágenes y audio. Admite modos de generación Texto-Imagen, Texto-Audio y Texto-Imagen-Audio. Disponible en variantes de 1.7B y 17B parámetros con opción de cuantización FP8.

DesarrolladorByteDance Research
Fecha de lanzamiento2025-08
ArquitecturaDiffusion Transformer
Tamaños del modelo1.7B, 17B (FP16 + FP8)
LicenciaApache 2.0
CapacidadesGeneración de video humano: Texto-Imagen, Texto-Audio, Texto-Imagen-Audio
Codificador de audio requeridoWhisper Large V3 (incluido)

Guides and workflows related to this model series.

No articles found.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…