DreamX-Creator 1.0: instalación en ComfyUI y guía del modelo

ComfyUI Wiki

Ejecuta DreamX-Creator en ComfyUI con nodos nativos: generación conjunta de audio y vídeo de 7B, un refinador de 2K en 1 paso y el paquete de pesos de ~54 GB.

D

DreamX-Creator 1.0

Generación de vídeoAudio-Vídeo conjunto2KComfyUI

DreamX-Creator 1.0 es el generador abierto de 7B de AMap que produce vídeo y audio sincronizados en una sola pasada, además de un refinador autoregresivo de 1 paso que aplica superresolución al resultado hasta 2K. Los nodos V3 nativos de ComfyUI exponen el generador y el refinador publicados.

DesarrolladorAMap ML (Alibaba)
Fecha de lanzamiento2026-09
ArquitecturaGenerador conjunto de audio-vídeo de 7B + refinador SR-DiT de 5B
Dependencias baseWan2.2-TI2V-5B (VAE de vídeo, codificador de texto UMT5-xxl)
SalidaVídeo + audio sincronizados, hasta 2K tras el refinado
LicenciaApache-2.0

Dado un primer fotograma y un prompt de texto, DreamX-Creator modela conjuntamente flujos de vídeo y audio especializados por modalidad mediante atención cruzada con compuerta: los pesos de atención cruzada permiten que cada modalidad atienda a la otra, con una compuerta aprendida que controla cuánta información fluye entre ambas. El entrenamiento conjunto progresivo mantiene sincronizados los movimientos labiales, la acción en pantalla y la banda sonora, en lugar de unirlos a posteriori. Un refinador autoregresivo de 1 paso (SR-DiT, 5B) aplica después superresolución al clip hasta 2K preservando el contenido, el movimiento y la sincronización temporal alineada con el audio, y también puede refinar vídeos externos.

Instalación

DreamX-Creator se ejecuta en ComfyUI mediante nodos V3 nativos de DreamX Creator T8. Instala el paquete de nodos desde ComfyUI Manager (busca "DreamX Creator T8"), o clónalo en ComfyUI/custom_nodes/ e instala sus requisitos con el mismo Python que inicia ComfyUI.

Descarga el paquete de pesos listo para ComfyUI en el directorio compartido de modelos:

hf download t8star/DreamX-Creator-Comfy --local-dir ComfyUI/models/dreamx_creator

El model_root=auto del cargador busca en checkpoints/ del repositorio y en ComfyUI/models/dreamx_creator/. El paquete ocupa unos 54 GB y su raíz debe contener directamente las carpetas creator/, audio_vae/, refiner/ y wan2.2_ti2v_5b/.

Flujos de trabajo

El gráfico de generación ejecuta un cargador completo, dos codificadores de texto, un latente de audio-vídeo del primer fotograma, los desplazamientos de flujo AV (el preset publicado es 5.0 / 5.0), un guía multimodal y un muestreador FlowMatch con programación normal, 20 pasos y euler, seguido de la división del latente AV, la decodificación VAE de vídeo y audio y la exportación de vídeo. El gráfico de refinado independiente realiza la pasada de 2× preservando el audio y los FPS. Las duraciones solicitadas se redondean a la baja a un número de fotogramas 4N+1 compatible con Wan.

El paquete de nodos incluye ejemplos importables desde el frontend (examples/dreamx_creator_ui.json para pasar del primer fotograma a vídeo y audio sincronizados, y examples/dreamx_refiner_ui.json para la pasada de refinado de 2×).

Recursos

Guides and workflows related to this model series.

No articles found.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…