Wan2.2 Dancer: 통이 연구소의 분 단위 음악-춤 비디오 생성 모델

ComfyUI Wiki

Wan2.2 Dancer(Wan-Dancer-14B)는 통이 연구소(알리바바)가 개발한 음악-춤 비디오 생성 모델로, Wan2.2 MoE 아키텍처를 기반으로 합니다. 음악과 참조 이미지로부터 720p/30fps의 춤 비디오를 생성합니다.

W

Wan2.2 Dancer

VideoMusic-to-DanceImage-to-VideoOpen Source

통이 연구소(알리바바 그룹)가 개발한 분 단위 음악-춤 비디오 생성 모델입니다. Wan2.2 MoE 아키텍처를 기반으로 하며, 참조 이미지로부터 음악에 동기화된 720p/30fps 춤 비디오를 생성하며 중국 고전 춤, K-Pop, 스트리트, 탭, 라틴 춤 장르를 지원합니다.

개발자통이 연구소 (알리바바 그룹)
출시일2026-07-13
아키텍처Wan2.2 MoE 기반 계층적 프레임워크 (글로벌 키프레임 플래너 + 로컬 시간적 세부 조정기)
라이선스Apache-2.0
파라미터14B (전체: 글로벌 + 로컬 브랜치)
기능음악-춤, 이미지 기반 비디오 생성, 5가지 춤 장르, 분 단위 출력
출력 해상도720p, 30fps, 최대 60초 이상
테스트된 하드웨어8 x NVIDIA A800 80GB

개요

Wan-Dancer-14B는 통이 연구소(알리바바 그룹의 AI 연구 기관으로 Qwen, Wan, Tongyi Fun을 개발)에서 만든 오픈소스 모델로, 음악과 참조 이미지에서 고품질의 리듬에 동기화된 춤 비디오를 생성합니다. 이 모델은 확산 기반 비디오 생성의 기존 시간 제한을 극복하고 1분 이상 동안 안정적인 720p 비디오를 30fps로 생성합니다. 이는 기존 모델이 20초를 넘기기 어려운 부분입니다.

모델은 참조 이미지(댄서의 모양과 포즈를 보여줌)와 오디오 파일(음악 트랙), 원하는 춤 스타일을 설명하는 텍스트 프롬프트를 입력받아 음악의 리듬과 구조에 맞는 전체 춤 비디오를 생성합니다.

아키텍처

Wan-Dancer는 생성 과정을 두 단계로 분리하는 계층적 프레임워크를 사용합니다.

1단계: 글로벌 키프레임 계획

첫 번째 단계는 전체 트랙의 음악 구조를 캡처하는 5초 키프레임 세그먼트를 생성하여 전체 시간에 걸친 글로벌 일관성을 보장합니다. 장기 계획을 위해 전체 음악 트랙을 컨텍스트로 처리합니다.

2단계: 로컬 시간적 세부 조정

두 번째 단계는 각 세그먼트를 고해상도 720p 프레임으로 세부 조정하여 세부 정보를 추가하면서 세그먼트 간 시간적 부드러움을 유지합니다.

주요 기술 혁신

  • 시간 매핑 RoPE 임베딩: 동적 프레임 속도 적응으로 움직임 타이밍을 음악 비트 및 구조에 정밀하게 정렬하여 오디오와 비디오 간의 정확한 동기화를 구현합니다.
  • 광학 흐름 기반 손실 함수: 인접 프레임 간의 떨림과 급격한 전환에 페널티를 부여하여 움직임 연속성을 향상시켜 더 부드러운 춤 동작을 만듭니다.
  • 움직임 속도 제어: 빠른 움직임과 급격한 전환 중에도 고선명 세부 정보를 유지하여 장시간 비디오 생성에서 흔한 모션 블러와 아티팩트를 방지합니다.
  • 전체 트랙 음악 컨텍스트: 짧은 오디오 윈도우를 처리하는 모델과 달리, 글로벌 단계는 전체 음악 트랙을 사용하여 전체 춤 시간에 걸쳐 일관된 장기 계획을 수립합니다.

프레임워크는 Wan2.1 작업, DiffSynth-Studio 및 Wan2.2 MoE 아키텍처를 기반으로 합니다.

춤 장르

Wan-Dancer는 완전한 음악 동기화와 함께 다섯 가지 춤 장르를 지원합니다.

장르설명
중국 고전 춤전통 중국 미학을 담은 우아하고 흐르는 듯한 움직임
K-Pop 춤팝 음악에 동기화된 현대적이고 에너지 넘치는 안무
스트리트 춤힙합 영향의 도시적이고 자유로운 움직임
탭 춤타악기 음악에 동기화된 리드미컬한 발놀림
라틴 춤열정적이고 다이내믹한 파트너 댄스 스타일

ComfyUI 통합

Wan-Dancer-14B는 ComfyUI 0.22.0+에서 기본 지원됩니다. 공식 Wan-Dancer 워크플로로 시작하세요. ComfyUI를 최신 버전으로 업데이트했는지 확인하세요.

필수 모델 파일

다음 파일을 ComfyUI/models/ 디렉토리에 배치하세요.

+--- diffusion_models/
|    +--- wan2.2_dancer_14b_global_fp8_scaled.safetensors
|    +--- wan2.2_dancer_14b_local_fp8_scaled.safetensors
+--- loras/
|    +--- lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors
+--- text_encoders/
|    +--- umt5_xxl_fp16.safetensors
+--- clip_vision/
|    +--- clip_vision_h.safetensors
+--- vae/
|    +--- Wan2_1_VAE_bf16.safetensors

모델 파일은 Comfy-Org/Wan-DancerComfy-Org/Wan_2.1_ComfyUI_repackaged 저장소에서 호스팅됩니다.

이 모델은 한 번에 149개의 프레임을 렌더링하므로 많은 VRAM이 필요합니다. 기본 워크플로는 5초 분량의 비디오를 출력합니다. 실행 전에 강력한 GPU(24GB 이상 VRAM 권장)가 있는지 확인하세요.

리소스

Guides and workflows related to this model series.

No articles found.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…