SCAIL-2: 네이티브 ComfyUI 지원을 갖춘 엔드투엔드 캐릭터 애니메이션 모델
Zhipu의 zai-org가 SCAIL-2를 공개했습니다. 공식 ComfyUI 지원을 갖춘 엔드투엔드 캐릭터 애니메이션 모델로, 크로스 아이덴티티 교체, 멀티 캐릭터 및 동물 드라이빙, DPO LoRA를 지원합니다.
개요
SCAIL-2는 WAN2.1 14B 아키텍처를 기반으로 하며, 기존 캐릭터 애니메이션 모델들이 의존하던 스켈레톤 맵이나 인페인팅 마스크와 같은 중간 표현에 대한 의존성을 제거합니다. 팀은 기성 모델(SCAIL-Preview, Wan-Animate, MoCha)로부터 60K 모션 페어를 합성하고, 전용 마스킹 채널과 RoPE 설계를 갖춘 Unified Motion Transfer Interface를 통해 학습했습니다.
크로스 아이덴티티 교체 및 멀티 캐릭터 시나리오를 지원하는 SCAIL-2 엔드투엔드 캐릭터 애니메이션 (출처: 프로젝트 페이지)
역방향 드라이빙 학습 레시피를 통해 모델은 티처(teacher) 모델을 넘어서는 능력을 학습하며, 다음과 같은 창발적 능력이 나타납니다:
- 크로스 아이덴티티 캐릭터 교체: 동일한 드라이빙 모션으로 다른 캐릭터를 애니메이트
- 동물 드라이빙 시나리오: 동물 모션 소스로 캐릭터 드라이빙
- 제로샷 고급 제어: 재학습 없이 SAM3D-Body 메시 렌더링과 같은 중간 제어 지원
ComfyUI 지원 (네이티브)
SCAIL-2는 ComfyUI 코어에 직접 통합되었습니다. 출시일에 병합된 최초 지원 PR(Comfy-Org/ComfyUI #14373)에 이어 PR #14509에서 멀티 레퍼런스 지원이 추가되었습니다. 커스텀 노드 팩이 필요하지 않습니다.
Comfy-Org가 재포장한 가중치는 fp16, FP8, INT8, MXFP8, NVFP4/MXFP8 혼합 정밀도의 바로 사용 가능한 diffusion 모델과 함께 Bias-Aware DPO LoRA(손 왜곡 수정, 입/눈 싱크 개선) 및 Relighting LoRA(교체 캐릭터를 대상 조명에 자연스럽게 혼합)를 제공합니다.
SCAIL-2 네트워크 아키텍처: 마스킹 채널과 RoPE를 갖춘 Unified Motion Transfer Interface (출처: 프로젝트 페이지)
데모 비디오
SCAIL-2 티저 샘플 (출처: 프로젝트 페이지 비디오)
싱글 레퍼런스 애니메이션 비교 (출처: 프로젝트 페이지 비디오)
워크플로
Kijai의 ComfyUI-WanVideoWrapper에 포함된 SCAIL-2 예제 워크플로가 좋은 시작점입니다:
멀티 레퍼런스 모드의 경우 Comfy-Org의 통합 PR에 포함된 공식 테스트 워크플로도 사용할 수 있습니다:
주요 세부 정보
| 항목 | 세부 정보 |
|---|---|
| 해상도 | 엔드투엔드 드라이빙: 512p 및 704p; 포즈 기반 드라이빙은 704p에서 더 우수한 성능 |
| 제약 사항 | H와 W 모두 32로 나누어 떨어져야 함 (예: 704x1280) |
| 번들 모듈 | Wan VAE와 T5가 checkpoint에 통합됨 |
| 기타 | Bias-Aware DPO LoRA, Relighting LoRA, 학습 코드 (2026-08-06) |
댓글
GitHub로 로그인하고 토론에 참여하세요.