DreamX-Creator 1.0: 2K 해상도에서 오디오-비디오 공동 생성을 지원하는 오픈 7B 모델
AMap이 Wan2.2 기반의 7B 오디오-비디오 공동 생성기 DreamX-Creator 1.0을 오픈소스로 공개했습니다. 게이트형 크로스모달 어텐션과 1-step 2K 리파이너를 갖추고 있으며 전체를 다운로드할 수 있습니다.
2K 해상도에서의 오디오-비디오 공동 생성 결과를 보여주는 DreamX-Creator 1.0 티저.
비디오와 오디오를 동시에 생성하는 7B 생성기
첫 번째 프레임과 텍스트 프롬프트가 주어지면 기본 생성기는 모달리티별로 특화된 비디오 스트림과 오디오 스트림을 함께 모델링합니다. 양방향 상호작용을 이끄는 메커니즘은 두 가지입니다.
- 게이트형 크로스모달 어텐션(Gated Cross-Modal Attention): 크로스 어텐션 가중치(
cross_attn_weights.safetensors, 2.56GB)를 통해 각 모달리티가 다른 모달리티에 어텐션을 수행할 수 있으며, 학습된 게이트가 모달리티 간에 흐르는 정보의 양을 제어합니다. - 점진적 공동 학습(Progressive Joint Training): 두 스트림이 함께 학습되므로 입술 움직임, 화면 속 동작, 사운드트랙이 각각 생성된 이후에 이어 붙이는 방식이 아니라 처음부터 서로 동기화된 상태를 유지합니다.
기본 생성기 위에는 모달리티를 인지하는 멀티모달 피드백을 활용하는 오디오-비디오 강화 학습(Audio-Video Reinforcement Learning) 단계가 적용되어 시각 품질, 오디오 품질, 의미론적 일관성, 세밀한 오디오-비디오 정렬을 개선합니다.
1-step 리파인먼트로 2K까지
시스템의 나머지 절반은 오토리그레시브 1-step 2K 리파이너(SR-DiT, 5B 파라미터)입니다. 이 리파이너는 생성된 비디오의 콘텐츠, 모션, 오디오와 정렬된 타이밍을 유지하면서 2K로 초해상도 변환합니다. 또한 외부 비디오에서도 작동하므로 어떤 클립이든 입력할 수 있으며, 이때 오디오는 변경 없이 그대로 통과합니다.
리파이너에는 자체 속도 조절 옵션도 포함되어 있습니다. KV 캐시, 창 어텐션(window attention), 잠재 데이터 업샘플러 변형을 지원하며(기본값은 FlashLatentUpsampler, 선택적으로 증류된 LightVAE 고속 디코더 사용 가능), 이를 통해 품질과 지연 시간 사이의 균형을 조절할 수 있습니다.
다운로드 가능한 항목
모든 가중치는 Hugging Face 및 ModelScope에서 제공되며, 총 약 54GB입니다.
| 구성 요소 | 내용 |
|---|---|
creator/ | 7B 공동 생성기: 비디오 DiT 샤드(약 20GB), 오디오 DiT(5.7GB), 크로스 어텐션 가중치(2.6GB) |
audio_vae/ | CreatorDACVAE 오디오 VAE(0.74GB) |
refiner/ | SR-DiT 5B(10GB), FlashLatentUpsampler, 선택적 인과(causal) 2D 업샘플러, LightVAE 디코더 |
wan2.2_ti2v_5b/ | Wan2.2-TI2V-5B 공용 의존성: 비디오 VAE, UMT5-xxl 텍스트 인코더, 토크나이저 |
Wan2.2 디렉터리는 Wan-AI/Wan2.2-TI2V-5B의 것을 그대로 재사용할 수 있습니다. 따라서 이미 Wan2.2를 사용 중이라면 DreamX 전용 폴더 3개만 새로 다운로드하면 됩니다.
추론은 일반 Python으로 실행됩니다. 두 단계 각각은 자체 requirements.txt와 단일 명령 스크립트를 제공하며, CPU 오프로드와 멀티 GPU 시퀀스 병렬 옵션은 하위 README에 문서화되어 있습니다.
사용 가능 여부
현재 DreamX-Creator용 네이티브 ComfyUI 노드는 아직 없습니다. 가중치가 diffusers 레이아웃으로 제공되고 추론은 공식 저장소를 통해 실행됩니다. 로드맵에는 증류되어 스텝 수를 줄인 모델이 다음 마일스톤으로 예정되어 있습니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.