DreamX-Creator 1.0: 2K 해상도에서 오디오-비디오 공동 생성을 지원하는 오픈 7B 모델

ComfyUI Wikinews

AMap이 Wan2.2 기반의 7B 오디오-비디오 공동 생성기 DreamX-Creator 1.0을 오픈소스로 공개했습니다. 게이트형 크로스모달 어텐션과 1-step 2K 리파이너를 갖추고 있으며 전체를 다운로드할 수 있습니다.

DreamX-Creator 1.0 (GitHub, Hugging Face)은 AMap ML 팀이 개발한 네이티브 오디오-비디오 공동 생성 연구 프레임워크로, 9월 3일 Apache-2.0 라이선스로 오픈소스 공개되었습니다. 7B 생성기는 게이트형 크로스모달 어텐션(gated cross-modal attention)을 통해 비디오와 오디오 스트림을 함께 모델링하며, 오토리그레시브(autoregressive) 1-step 리파이너가 결과물을 2K 해상도로 끌어올립니다.
DreamX-Creator teaser

2K 해상도에서의 오디오-비디오 공동 생성 결과를 보여주는 DreamX-Creator 1.0 티저.

비디오와 오디오를 동시에 생성하는 7B 생성기

첫 번째 프레임과 텍스트 프롬프트가 주어지면 기본 생성기는 모달리티별로 특화된 비디오 스트림과 오디오 스트림을 함께 모델링합니다. 양방향 상호작용을 이끄는 메커니즘은 두 가지입니다.

  • 게이트형 크로스모달 어텐션(Gated Cross-Modal Attention): 크로스 어텐션 가중치(cross_attn_weights.safetensors, 2.56GB)를 통해 각 모달리티가 다른 모달리티에 어텐션을 수행할 수 있으며, 학습된 게이트가 모달리티 간에 흐르는 정보의 양을 제어합니다.
  • 점진적 공동 학습(Progressive Joint Training): 두 스트림이 함께 학습되므로 입술 움직임, 화면 속 동작, 사운드트랙이 각각 생성된 이후에 이어 붙이는 방식이 아니라 처음부터 서로 동기화된 상태를 유지합니다.

기본 생성기 위에는 모달리티를 인지하는 멀티모달 피드백을 활용하는 오디오-비디오 강화 학습(Audio-Video Reinforcement Learning) 단계가 적용되어 시각 품질, 오디오 품질, 의미론적 일관성, 세밀한 오디오-비디오 정렬을 개선합니다.

1-step 리파인먼트로 2K까지

시스템의 나머지 절반은 오토리그레시브 1-step 2K 리파이너(SR-DiT, 5B 파라미터)입니다. 이 리파이너는 생성된 비디오의 콘텐츠, 모션, 오디오와 정렬된 타이밍을 유지하면서 2K로 초해상도 변환합니다. 또한 외부 비디오에서도 작동하므로 어떤 클립이든 입력할 수 있으며, 이때 오디오는 변경 없이 그대로 통과합니다.

리파이너에는 자체 속도 조절 옵션도 포함되어 있습니다. KV 캐시, 창 어텐션(window attention), 잠재 데이터 업샘플러 변형을 지원하며(기본값은 FlashLatentUpsampler, 선택적으로 증류된 LightVAE 고속 디코더 사용 가능), 이를 통해 품질과 지연 시간 사이의 균형을 조절할 수 있습니다.

다운로드 가능한 항목

모든 가중치는 Hugging FaceModelScope에서 제공되며, 총 약 54GB입니다.

구성 요소내용
creator/7B 공동 생성기: 비디오 DiT 샤드(약 20GB), 오디오 DiT(5.7GB), 크로스 어텐션 가중치(2.6GB)
audio_vae/CreatorDACVAE 오디오 VAE(0.74GB)
refiner/SR-DiT 5B(10GB), FlashLatentUpsampler, 선택적 인과(causal) 2D 업샘플러, LightVAE 디코더
wan2.2_ti2v_5b/Wan2.2-TI2V-5B 공용 의존성: 비디오 VAE, UMT5-xxl 텍스트 인코더, 토크나이저

Wan2.2 디렉터리는 Wan-AI/Wan2.2-TI2V-5B의 것을 그대로 재사용할 수 있습니다. 따라서 이미 Wan2.2를 사용 중이라면 DreamX 전용 폴더 3개만 새로 다운로드하면 됩니다.

추론은 일반 Python으로 실행됩니다. 두 단계 각각은 자체 requirements.txt와 단일 명령 스크립트를 제공하며, CPU 오프로드와 멀티 GPU 시퀀스 병렬 옵션은 하위 README에 문서화되어 있습니다.

사용 가능 여부

현재 DreamX-Creator용 네이티브 ComfyUI 노드는 아직 없습니다. 가중치가 diffusers 레이아웃으로 제공되고 추론은 공식 저장소를 통해 실행됩니다. 로드맵에는 증류되어 스텝 수를 줄인 모델이 다음 마일스톤으로 예정되어 있습니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
DreamX-Creator 1.0: 2K 해상도에서 오디오-비디오 공동 생성을 지원하는 오픈 7B 모델 | ComfyUI Wiki