HuMo : Modèle de génération vidéo centrée sur l'humain
ComfyUI Wiki
HuMo est un framework unifié de génération vidéo centrée sur l'humain développé par ByteDance Research, prenant en charge la génération de vidéos humaines à partir de texte, d'images et d'audio.
H
HuMo
VidéoGénération vidéo humaineTexte-vers-vidéoPilotage audioByteDanceFramework unifié de génération vidéo centrée sur l'humain par ByteDance Research. Produit des vidéos humaines de haute qualité et contrôlables à partir d'entrées multimodales incluant texte, images et audio. Prend en charge les modes de génération Texte-Image, Texte-Audio et Texte-Image-Audio. Disponible en variantes de 1,7B et 17B paramètres avec option de quantification FP8.
| Développeur | ByteDance Research |
| Date de sortie | 2025-08 |
| Architecture | Diffusion Transformer |
| Tailles de modèle | 1.7B, 17B (FP16 + FP8) |
| Licence | Apache 2.0 |
| Capacités | Génération vidéo humaine par Texte-Image, Texte-Audio, Texte-Image-Audio |
| Encodeur audio requis | Whisper Large V3 (inclus) |
Guides and workflows related to this model series.
No articles found.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.