DreamX-Creator 1.0 : generation conjointe audio-video 7B en 2K
AMap open-source DreamX-Creator 1.0 : generateur conjoint audio-video 7B avec attention croisee gated et raffineur 1 etape en 2K, base sur Wan2.2, entierement telechargeable.
Le teaser DreamX-Creator 1.0 montre les résultats de la génération conjointe audio-vidéo en résolution 2K.
Le générateur 7B qui parle à la fois vidéo et audio
À partir d'une première image et d'une invite textuelle, le générateur de base modélise conjointement des flux vidéo et audio spécialisés par modalité. Deux mécanismes assurent l'interaction bidirectionnelle :
- Attention intermodale à portes : les poids d'attention croisée (
cross_attn_weights.safetensors, 2,56 Go) permettent à chaque modalité de prêter attention à l'autre, une porte apprise contrôlant la quantité d'informations qui circule entre elles. - Entraînement conjoint progressif : les deux flux sont entraînés ensemble afin que les mouvements des lèvres, l'action à l'écran et la bande-son restent synchronisés plutôt que d'être assemblés après coup.
En complément du générateur de base, une étape d'apprentissage par renforcement audio-vidéo, dotée de retours multimodaux propres à chaque modalité, améliore la qualité visuelle et audio, la cohérence sémantique et l'alignement audio-vidéo fin.
Un raffinement en une étape jusqu'à la 2K
La seconde moitié du système est un raffineur 2K autorégressif en une étape (SR-DiT, 5B de paramètres). Il super-résout la vidéo générée en 2K tout en préservant le contenu, le mouvement et la synchronisation alignée sur l'audio. Le raffineur fonctionne également sur des vidéos externes : vous pouvez lui soumettre n'importe quel clip, l'audio étant transmis sans modification.
Le raffineur embarque ses propres réglages de vitesse : cache KV, attention par fenêtre et variantes de suréchantillonneur latent (un FlashLatentUpsampler par défaut, plus un décodeur rapide LightVAE distillé en option) permettent d'arbitrer entre qualité et latence.
Ce que vous pouvez télécharger
Tous les poids sont disponibles sur Hugging Face et ModelScope, soit environ 54 Go au total :
| Composant | Contenu |
|---|---|
creator/ | Générateur conjoint 7B : shards DiT vidéo (~20 Go), DiT audio (5,7 Go), poids d'attention croisée (2,6 Go) |
audio_vae/ | VAE audio CreatorDACVAE (0,74 Go) |
refiner/ | SR-DiT 5B (10 Go), FlashLatentUpsampler, suréchantillonneur causal 2D optionnel et décodeur LightVAE |
wan2.2_ti2v_5b/ | Dépendances partagées Wan2.2-TI2V-5B : VAE vidéo, encodeur de texte UMT5-xxl et tokeniseur |
Le dossier Wan2.2 peut être réutilisé tel quel depuis Wan-AI/Wan2.2-TI2V-5B : si vous exécutez déjà Wan2.2, seuls les trois dossiers spécifiques à DreamX représentent de nouveaux téléchargements.
L'inférence se fait en Python classique : chacune des deux étapes possède son propre requirements.txt et un script en une commande. Les options d'offload CPU et de parallélisme de séquence multi-GPU sont documentées dans les sous-README.
Disponibilité
Il n'existe pas encore de nœud ComfyUI natif pour DreamX-Creator : les poids sont au format diffusers et l'inférence s'effectue via le référentiel officiel. La feuille de route annonce comme prochaine étape des modèles distillés nécessitant moins d'étapes d'inférence.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.