Wan2.2 Dancer: 통이 연구소의 분 단위 음악-춤 비디오 생성 모델
Wan2.2 Dancer(Wan-Dancer-14B)는 통이 연구소(알리바바)가 개발한 음악-춤 비디오 생성 모델로, Wan2.2 MoE 아키텍처를 기반으로 합니다. 음악과 참조 이미지로부터 720p/30fps의 춤 비디오를 생성합니다.
Wan2.2 Dancer
VideoMusic-to-DanceImage-to-VideoOpen Source통이 연구소(알리바바 그룹)가 개발한 분 단위 음악-춤 비디오 생성 모델입니다. Wan2.2 MoE 아키텍처를 기반으로 하며, 참조 이미지로부터 음악에 동기화된 720p/30fps 춤 비디오를 생성하며 중국 고전 춤, K-Pop, 스트리트, 탭, 라틴 춤 장르를 지원합니다.
| 개발자 | 통이 연구소 (알리바바 그룹) |
| 출시일 | 2026-07-13 |
| 아키텍처 | Wan2.2 MoE 기반 계층적 프레임워크 (글로벌 키프레임 플래너 + 로컬 시간적 세부 조정기) |
| 라이선스 | Apache-2.0 |
| 파라미터 | 14B (전체: 글로벌 + 로컬 브랜치) |
| 기능 | 음악-춤, 이미지 기반 비디오 생성, 5가지 춤 장르, 분 단위 출력 |
| 출력 해상도 | 720p, 30fps, 최대 60초 이상 |
| 테스트된 하드웨어 | 8 x NVIDIA A800 80GB |
개요
Wan-Dancer-14B는 통이 연구소(알리바바 그룹의 AI 연구 기관으로 Qwen, Wan, Tongyi Fun을 개발)에서 만든 오픈소스 모델로, 음악과 참조 이미지에서 고품질의 리듬에 동기화된 춤 비디오를 생성합니다. 이 모델은 확산 기반 비디오 생성의 기존 시간 제한을 극복하고 1분 이상 동안 안정적인 720p 비디오를 30fps로 생성합니다. 이는 기존 모델이 20초를 넘기기 어려운 부분입니다.
모델은 참조 이미지(댄서의 모양과 포즈를 보여줌)와 오디오 파일(음악 트랙), 원하는 춤 스타일을 설명하는 텍스트 프롬프트를 입력받아 음악의 리듬과 구조에 맞는 전체 춤 비디오를 생성합니다.
아키텍처
Wan-Dancer는 생성 과정을 두 단계로 분리하는 계층적 프레임워크를 사용합니다.
1단계: 글로벌 키프레임 계획
첫 번째 단계는 전체 트랙의 음악 구조를 캡처하는 5초 키프레임 세그먼트를 생성하여 전체 시간에 걸친 글로벌 일관성을 보장합니다. 장기 계획을 위해 전체 음악 트랙을 컨텍스트로 처리합니다.
2단계: 로컬 시간적 세부 조정
두 번째 단계는 각 세그먼트를 고해상도 720p 프레임으로 세부 조정하여 세부 정보를 추가하면서 세그먼트 간 시간적 부드러움을 유지합니다.
주요 기술 혁신
- 시간 매핑 RoPE 임베딩: 동적 프레임 속도 적응으로 움직임 타이밍을 음악 비트 및 구조에 정밀하게 정렬하여 오디오와 비디오 간의 정확한 동기화를 구현합니다.
- 광학 흐름 기반 손실 함수: 인접 프레임 간의 떨림과 급격한 전환에 페널티를 부여하여 움직임 연속성을 향상시켜 더 부드러운 춤 동작을 만듭니다.
- 움직임 속도 제어: 빠른 움직임과 급격한 전환 중에도 고선명 세부 정보를 유지하여 장시간 비디오 생성에서 흔한 모션 블러와 아티팩트를 방지합니다.
- 전체 트랙 음악 컨텍스트: 짧은 오디오 윈도우를 처리하는 모델과 달리, 글로벌 단계는 전체 음악 트랙을 사용하여 전체 춤 시간에 걸쳐 일관된 장기 계획을 수립합니다.
프레임워크는 Wan2.1 작업, DiffSynth-Studio 및 Wan2.2 MoE 아키텍처를 기반으로 합니다.
춤 장르
Wan-Dancer는 완전한 음악 동기화와 함께 다섯 가지 춤 장르를 지원합니다.
| 장르 | 설명 |
|---|---|
| 중국 고전 춤 | 전통 중국 미학을 담은 우아하고 흐르는 듯한 움직임 |
| K-Pop 춤 | 팝 음악에 동기화된 현대적이고 에너지 넘치는 안무 |
| 스트리트 춤 | 힙합 영향의 도시적이고 자유로운 움직임 |
| 탭 춤 | 타악기 음악에 동기화된 리드미컬한 발놀림 |
| 라틴 춤 | 열정적이고 다이내믹한 파트너 댄스 스타일 |
ComfyUI 통합
Wan-Dancer-14B는 ComfyUI 0.22.0+에서 기본 지원됩니다. 공식 Wan-Dancer 워크플로로 시작하세요. ComfyUI를 최신 버전으로 업데이트했는지 확인하세요.
필수 모델 파일
다음 파일을 ComfyUI/models/ 디렉토리에 배치하세요.
+--- diffusion_models/
| +--- wan2.2_dancer_14b_global_fp8_scaled.safetensors
| +--- wan2.2_dancer_14b_local_fp8_scaled.safetensors
+--- loras/
| +--- lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors
+--- text_encoders/
| +--- umt5_xxl_fp16.safetensors
+--- clip_vision/
| +--- clip_vision_h.safetensors
+--- vae/
| +--- Wan2_1_VAE_bf16.safetensors모델 파일은 Comfy-Org/Wan-Dancer 및 Comfy-Org/Wan_2.1_ComfyUI_repackaged 저장소에서 호스팅됩니다.
리소스
| 리소스 | 링크 |
|---|---|
| 논문 | arXiv:2607.09581 |
| 프로젝트 페이지 | humanaigc.github.io/wan-dancer-project/ |
| GitHub 저장소 | github.com/Wan-Video/Wan-Dancer |
| HuggingFace (원본) | Wan-AI/Wan-Dancer-14B |
| HuggingFace (Comfy-Org) | Comfy-Org/Wan-Dancer |
| ComfyUI 워크플로 | video_wan_dancer.json |
| ModelScope | modelscope.cn/models/Wan-AI/Wan-Dancer-14B |
| ModelScope 데모 | modelscope.ai/studios/Wan-AI/Wan-Dancer |
Guides and workflows related to this model series.
댓글
GitHub로 로그인하고 토론에 참여하세요.