- Accueil
- Models
- Dreamx Creator
- DreamX-Creator 1.0 : installation ComfyUI et guide du modèle
DreamX-Creator 1.0 : installation ComfyUI et guide du modèle
Exécutez DreamX-Creator dans ComfyUI avec les nœuds natifs : génération conjointe audio-vidéo 7B, refiner 2K en 1 étape et bundle de poids d'environ 54 Go.
DreamX-Creator 1.0
Génération vidéoAudio-vidéo conjoint2KComfyUIDreamX-Creator 1.0 est le générateur ouvert 7B d'AMap qui produit une vidéo et un audio synchronisés en une seule passe, complété par un refiner autoregressif en 1 étape qui sur-échantillonne le résultat en 2K. Les nœuds natifs ComfyUI V3 exposent le générateur et le refiner publiés.
À partir d'une première image et d'un prompt texte, DreamX-Creator modélise conjointement des flux vidéo et audio spécialisés par modalité via une attention intermodale à portes : les poids d'attention croisée permettent à chaque modalité de tenir compte de l'autre, une porte apprise contrôlant le volume d'informations échangées. L'entraînement conjoint progressif maintient la synchronisation des mouvements labiaux, de l'action à l'écran et de la bande sonore, au lieu de les assembler après coup. Un refiner autoregressif en 1 étape (SR-DiT, 5B) sur-échantillonne ensuite le clip en 2K tout en préservant le contenu, le mouvement et la synchronisation avec l'audio, et peut aussi raffiner des vidéos externes.
Installation
DreamX-Creator fonctionne dans ComfyUI grâce aux nœuds V3 natifs de DreamX Creator T8. Installez le paquet de nœuds depuis le ComfyUI Manager (recherchez « DreamX Creator T8 »), ou clonez-le dans ComfyUI/custom_nodes/ et installez ses exigences avec le même Python que celui qui démarre ComfyUI.
Téléchargez le bundle de poids prêt pour ComfyUI dans le répertoire de modèles partagé :
hf download t8star/DreamX-Creator-Comfy --local-dir ComfyUI/models/dreamx_creatorLe paramètre model_root=auto du loader recherche le dossier checkpoints/ du référentiel ainsi que ComfyUI/models/dreamx_creator/. Le bundle pèse environ 54 Go et sa racine doit contenir directement les dossiers creator/, audio_vae/, refiner/ et wan2.2_ti2v_5b/.
Flux de travail
Le graphique de génération exécute un loader complet, deux encodeurs de texte, un latent audio-vidéo de première image, les décalages de flux AV (le préréglage publié est 5.0 / 5.0), un GUIDE multimodal et un ÉCHANTILLONNEUR FlowMatch en planification normal, 20 étapes et euler, puis une séparation des latents AV, le décodage VAE vidéo et audio, et l'exportation vidéo. Le graphique de refiner distinct effectue la passe 2× tout en préservant l'audio et les FPS. Les durées demandées sont arrondies à l'entier inférieur vers un nombre d'images 4N+1 compatible avec Wan.
Le paquet de nœuds fournit des exemples importables dans le frontend (examples/dreamx_creator_ui.json pour passer d'une première image à une vidéo et un audio synchronisés, et examples/dreamx_refiner_ui.json pour la passe de raffinement 2×).
Ressources
Guides and workflows related to this model series.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.