Wan-Animate-2: ComfyUI 지원 엔드투엔드 캐릭터 애니메이션 모델

ComfyUI Wikinews

Alibaba Tongyi Lab이 Wan-Animate-2를 출시했습니다. 드라이빙 비디오를 직접 입력받는 엔드투엔드 캐릭터 애니메이션 모델로, 텍스트 기반 시점 제어와 네이티브 ComfyUI 노드를 지원합니다.

Alibaba Tongyi Lab이 2026년 8월 7일 Wan-Animate-2를 출시했습니다. 이 모델은 재설계된 Diffusion Transformer 내부에서 드라이빙 비디오를 직접 입력받는 엔드투엔드 캐릭터 애니메이션 프레임워크입니다. BaseDistillation 모델 가중치, 추론 스크립트, arXiv 논문이 모두 Apache-2.0 라이선스로 공개되었습니다.

Wan-Animate-2 아키텍처

Wan-Animate-2 이중 분기 DiT 아키텍처: 드라이빙 비디오를 직접 입력받으며, Time-Align RoPE와 Sparse-Ref Attention이 외형과 모션을 융합합니다 (출처: 프로젝트 페이지)

데모 비디오

단일 인물 고충실도 캐릭터 애니메이션

멀티 캐릭터 애니메이션: 일대다 및 다대다 모션 드라이빙

Wan-Animate-2-Lite를 사용한 실시간 스트리밍 캐릭터 애니메이션

Wan-Animate 대비 새로운 기능

  • 중간 모션 추출기 불필요. Wan-Animate-2는 드라이빙 비디오를 재설계된 Diffusion Transformer에 직접 입력하여, 아이덴티티 드리프트와 모션 오류를 유발하던 스켈레톤/표정 추출 단계를 제거했습니다.
  • 텍스트 기반 시점 제어. 출력 카메라 시점이 드라이빙 비디오에서 분리되어, 동일한 애니메이션을 일관된 아이덴티티로 다각도 촬영할 수 있습니다.
  • 멀티 캐릭터 애니메이션. 일대다 및 다대다 모션 드라이빙을 한 번의 패스로 지원합니다.
  • Wan-Animate-2-Lite. 스트리밍 캐릭터 애니메이션에 필요한 실시간 추론 기준을 충족하는 효율적인 변형 모델로, 디지털 아바타와 라이브 스트리밍 호스트를 대상으로 합니다.

작동 방식

Wan-Animate-2는 참조 이미지와 참조 비디오를 동시에 생성 조건으로 하는 이중 분기 DiT 아키텍처를 사용합니다:

  • Time-Align RoPE는 denoising 비디오 토큰과 참조 토큰 간의 시간적 위치를 정렬합니다.
  • Sparse-Ref Attention은 매 단계에서 전체 참조 시퀀스에 어텐션하는 대신 정보가 풍부한 참조 피처에 선택적으로 어텐션합니다.

증류 변형 모델은 classifier-free guidance 없이 10스텝(Euler scheduler)으로 실행되는 반면, 베이스 모델은 표준 40스텝 샘플링을 따릅니다.

ComfyUI 지원

Wan-Animate-2는 두 가지 새로운 실험적 노드를 통해 ComfyUI에서 네이티브로 지원됩니다: WanAnimate2ToVideo (포즈/드라이빙 비디오를 사용해 참조 이미지에서 캐릭터를 애니메이트하며, pose_strength, pose_start_percent, pose_end_percent, reference_image_strength 컨트롤 제공) 및 WanAnimate2Cache (포즈 브랜치의 블록별 활성화를 캐시하여 480x832/81프레임에서 약 12.5GB 시스템 RAM을 사용하는 대신 생성 시간을 약 절반으로 단축).

Comfy-Org 리패키지 가중치는 bf16 및 int8-convrot diffusion 모델, lightx2v 스텝 증류 LoRA, 텍스트 인코더, VAE, CLIP vision을 ComfyUI에서 바로 사용할 수 있는 폴더 구조로 제공합니다. 공식 워크플로 템플릿:

관련 링크

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
Wan-Animate-2: ComfyUI 지원 엔드투엔드 캐릭터 애니메이션 모델 | ComfyUI Wiki