HuMo: Modelo de generación de video centrado en humanos - Descarga
ComfyUI Wiki
HuMo es un marco unificado de generación de video centrado en humanos de ByteDance Research que admite generación de video humano guiada por texto, imagen y audio.
H
HuMo
VideoGeneración de video humanoTexto a videoGuiado por audioByteDanceMarco unificado de generación de video centrado en humanos de ByteDance Research. Produce videos humanos de alta calidad y controlables a partir de entradas multimodales que incluyen texto, imágenes y audio. Admite modos de generación Texto-Imagen, Texto-Audio y Texto-Imagen-Audio. Disponible en variantes de 1.7B y 17B parámetros con opción de cuantización FP8.
| Desarrollador | ByteDance Research |
| Fecha de lanzamiento | 2025-08 |
| Arquitectura | Diffusion Transformer |
| Tamaños del modelo | 1.7B, 17B (FP16 + FP8) |
| Licencia | Apache 2.0 |
| Capacidades | Generación de video humano: Texto-Imagen, Texto-Audio, Texto-Imagen-Audio |
| Codificador de audio requerido | Whisper Large V3 (incluido) |
Guides and workflows related to this model series.
No articles found.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.