HuMo : Modèle de génération vidéo centrée sur l'humain

ComfyUI Wiki

HuMo est un framework unifié de génération vidéo centrée sur l'humain développé par ByteDance Research, prenant en charge la génération de vidéos humaines à partir de texte, d'images et d'audio.

H

HuMo

VidéoGénération vidéo humaineTexte-vers-vidéoPilotage audioByteDance

Framework unifié de génération vidéo centrée sur l'humain par ByteDance Research. Produit des vidéos humaines de haute qualité et contrôlables à partir d'entrées multimodales incluant texte, images et audio. Prend en charge les modes de génération Texte-Image, Texte-Audio et Texte-Image-Audio. Disponible en variantes de 1,7B et 17B paramètres avec option de quantification FP8.

DéveloppeurByteDance Research
Date de sortie2025-08
ArchitectureDiffusion Transformer
Tailles de modèle1.7B, 17B (FP16 + FP8)
LicenceApache 2.0
CapacitésGénération vidéo humaine par Texte-Image, Texte-Audio, Texte-Image-Audio
Encodeur audio requisWhisper Large V3 (inclus)

Guides and workflows related to this model series.

No articles found.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…