Viggle-Animate: 단일 재페인트 프레임으로 H3 캐릭터 교체 ComfyUI 모델 가이드

ComfyUI Wikinews

Viggle-Animate 는 MiniMax H3 ref2va 의 DMD 디스틸레이션을 적용한 33.1B 파인튜닝 모델입니다. 재페인트된 프레임 하나로 비디오 캐릭터를 교체하는 ComfyUI 워크플로우용 모델로, 3 회 순전파로 클립당 26 초가 걸립니다.

Viggle-Animate ([weights](https://hugging Face.co/Viggle/Viggle-Animate), demo Space) 는 캐릭터 교정을 위한 MiniMax H3 의 ref2va 트랜스포머에 대한 33.1B 전체 파인튜닝입니다. 두 가지 입력은 드라이빙 비디오와 해당 비디오의 캐릭터가 재페인트된 프레임 중 하나이며, 포즈 추정기, 세그멘테이션 마스크, 얼굴 추적기, 텍스트 프롬프트 없이 샷 전체에 걸쳐 편집을 전파합니다. 공동 DMD 디스틸레이션은 추론을 세 번의 순전파로 축소합니다: B200 에서 124 프레임을 26 초에 렌더링하며, Wan2.2-Animate-14B 대비 클립당 6.1 배 빠르다고 보고되었습니다.
Viggle-Animate teaser: 단일 재페인트 프레임에서의 캐릭터 교체

모델 카드의 티저: 페인트된 캐릭터가 드라이빙 비디오를 대체하지만, 모션, 카메라, 타이밍은 그대로 유지됩니다.

작동 방식

대부분의 캐릭터 교체 pipeline 은 중간 표현을 기반으로 구축됩니다: 포즈 골격, 세그멘테이션 마스크, 배경 플레이트, 얼굴 컷아웃 등. 각 추출기는 실행해야 할 또 다른 모델이고 정보를 잃을 또 다른 장소입니다. Viggle-Animate 는 그 어떤 것도 사용하지 않습니다. 참조가 클립 자체의 프레임 중 하나이기 때문에, 포즈, 카메라, 구도 및 조명 이미 촬영된 영상과 일치하므로, 이후 단계에서 다시 정렬할 필요가 없습니다. 모델에게 새 캐릭터가 무엇인지 알려지지 않았습니다: 클래스 없음, 아이덴티티 인코더 없음, 사용자 텍스트 프롬프트 없음.

Viggle-Animate pipeline diagram

두 가지 입력이 비디오 단계에 입력됩니다: 드라이빙 클립과 하나의 재페인트된 프레임. 텍스트 인코더는 전혀 로드되지 않습니다. 조건화는 가중치와 함께 제공되는 고정된 임베딩이며, 모든 렌더링에 동일합니다.

속도는 두 가지 이유로 나옵니다. 재페인트된 프레임이 존재하면 더 이상 실행할 것이 없으며, 샘플러 자체가 디스틸레이션되었습니다: 노이즈 레벨에 따라 분할된 두 교사 모델에 걸친 공동 디스틸레이션. 여기서 파인튜닝은 교체를 결정하는 고노이즈 끝을 감독하고, 원본 MiniMax H3 는 디테일과 질감을 결정하는 저노이즈 끝을 감독합니다. 기본값은 --steps 4 --flow-shift 3이며, 이는 네 개의 시그마 경계를 정의하므로 결과적으로 세 번의 순전파를 의미합니다. 팀은 네 단계가 단축키가 아닌 작동 지점이라고 명시했습니다: 디스틸레이션된 모델은 교사보다 더 선명하게 렌더링하며, 더 많은 단계는 과도한 선명화로 이어집니다.

Wan2.2-Animate 와 비교

같은 B200, 같은 소스 비디오, 같은 해상도 및 프레임 수로 매칭된 비교에서:

Viggle-AnimateWan2.2-Animate-14B
입력드라이빙 비디오 + 하나의 재페인트된 프레임드라이빙 비디오 + 캐릭터 이미지, plus 포즈, 얼굴, 마스크 및 배경 트랙을 생성하는 전처리 패스
렌더링, 가중치 로딩 후26 s160 s
순전파 횟수340 (20 스텝 x 2 청크)
파라미터33.1 B17.3 B

이는 렌더링당 6.1 배 빠르고, 샘플링만으로는 10.3 배 빠릅니다. Wan 의 전처리 패스는 160 초에 포함되지 않았습니다. 공개된 비교 클립은 빠른 움직임에서 격차가 가장 큽니다. Wan 은 흐려지고 Viggle-Animate 는 올바른 프레임에 포즈를 맞춥니다. 출력을 직접 판단하려면 demo Spaceviggle.ai/h3 가 운영 중입니다.

인간을 넘어 일반화

루프 내의 아무것도 캐릭터가 사람이라고 가정하지 않으므로, 애니메이션 가능한 것은 당신이 그릴 수 있는 것으로 제한됩니다. 모델 카드는 드라이빙 클립에 없는 사지에 귀와 지느러미가 있는 동물이 움직이는 모습, 스타일 경계를 유지하는 클레이 피규어, 그리고 페인트된 날개가 배우의 팔에 클립 전체에 묶여 있는 항공기의 예를 보여줍니다.

Viggle-Animate corgi swap sample

페인팅된 참조 및 출력: 페인트가 해부학을 배치하고, 렌더링은 항상 그곳에 있었던 것처럼 애니메이션합니다.

모델 카드의 알려진 한계: 클로즈업에서는 립싱크가 약하며, 다중 캐릭터 장면 및 컷되는 샷은 품질이 떨어집니다. 또한 모델은 이미지 편집을 계승하므로, 페인트와 비디오가 불일치할 경우 비디오가 우선합니다. 이 세 가지 사례를 목표로 하는 현저히 우수한 모델은 이미 학습 중입니다.

사용 가능성

  • 가중치: Viggle/Viggle-Animate on Hugging Face, MiniMax H3 커뮤니티 라이선스 하에. 33.1B bf16 파인튜닝 (14 조각) 과 2.5GB 랭크 128 DMD2 디스틸레이션 LoRA 를 포함합니다. VAE, 오디오 VAE 및 스케줄러는 베이스 모델의 복사본에서 로드됩니다.
  • 추론: diffusers 기반, 레포지토리의 inference/sample.py, 상류 파이프라인의 포크나 패치가 필요하지 않습니다. bf16 에서 80GB 카드는 충분하지 않습니다 (480x832 / 124 프레임 렌더링은 최대 80.1 GiB 에 도달): 96GB 이상 카드를 사용하거나 --offload 를 사용하세요.
  • 아직 공식 ComfyUI 지원 없음: 공식 Python 추론 경로를 사용하세요. LoRA 는 파인튜닝된 트랜스포머에 대한 델타이므로, 표준 H3 ref2va 가중치에 로드하면 잡음이 생성됩니다.
  • 데모: Viggle/viggle-animate Spaceviggle.ai/h3.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
Viggle-Animate: 단일 재페인트 프레임으로 H3 캐릭터 교체 ComfyUI 모델 가이드 | ComfyUI Wiki