MiniMax H3 캐릭터 스왑 LoRA: 참조 비디오 인물을 다른 캐릭터로 교체

ComfyUI Wikinews

Akatz Labs의 MiniMax H3 Ref2VA용 캐릭터 스왑 LoRA는 참조 비디오 속 한 인물을 캐릭터 이미지나 캐릭터 시트로 교체하며, 가중치와 데이터셋을 공개했습니다.

MiniMax-H3-Character-Swap-LoRA는 MiniMax H3 Ref2VA용 캐릭터 교체 어댑터입니다. 참조 비디오에 캐릭터 이미지나 완전한 캐릭터 시트를 함께 입력하면, 장면과 카메라, 소품, 그리고 다른 모든 인물은 그대로 유지한 채 그 한 사람만 참조 캐릭터로 교체합니다. Akatz Labs는 9월 25일 최종 1,000스텝 checkpoint를 데이터셋 및 이를 만든 학습 구성과 함께 공개했습니다.
소스 비디오 프레임캐릭터 시트 참조편집 대상
소스 비디오 프레임캐릭터 시트 참조데이터셋 대상: 교체되어 들어간 캐릭터

공개된 데이터셋의 학습 예시로, 소스 프레임, 캐릭터 시트, 그리고 LoRA가 생성하도록 학습된 편집 대상이 나란히 표시되어 있습니다. 출처: H3 Character Swap v1.

이 작업은 단순한 정체성 이전보다 범위가 넓습니다. H3 FaceSwap LoRA는 클립에 이미 담긴 연기 위에 얼굴을 옮겨 붙이는 반면, 이 어댑터는 의상과 렌더링 매체를 포함한 교체 캐릭터 전체를 복사하면서 소스 장면의 매체는 다시 그대로 유지합니다. 그래서 스타일 간 교체가 가능합니다. 일러스트 캐릭터를 실사 영상에 넣어도 일러스트 느낌을 유지하며, 94건의 학습 편집 중 34건이 정확히 이런 방식으로 만들어졌습니다.

데이터셋에 포함된 내용

Akatz Labs는 가중치와 함께 공개된 참조 조건화 데이터셋인 H3 Character Swap v1으로 어댑터를 학습했습니다.

  • 134개 예시: 94개의 캐릭터 스왑 편집과 40개의 보존 클립. 학습에는 76개 편집과 32개 클립을 사용하고, 18개 편집과 8개 클립은 홀드아웃으로 남겼습니다.
  • 편집은 각각 정지 이미지 하나로 구성됩니다. 장면은 5프레임 정적 비디오(<Video 1>)로 제공되고, 교체 대상은 캐릭터 이미지나 시트(<Picture 1>)로 입력되며, 각 쌍에는 Swap the man in the purple shirt in <Video 1> with the character in <Picture 1>. 같은 짧은 타기팅 지시문이 함께 붙습니다.
  • 스타일 간 교체 및 시트 적용 범위. 34개 편집은 렌더링 스타일 간 교체를 수행하고 20개는 완전한 캐릭터 시트를 사용하며, 세로형, 정사각형, 가로형 시트는 원래 비율 그대로 유지되었습니다.
  • 정규화 클립은 명시적인 보존 예시입니다. 동일한 비디오가 컨트롤과 대상 양쪽으로 사용되며 캡션은 Keep <Video 1> unchanged.입니다.
  • 한 번에 한 캐릭터만. 다중 캐릭터 교체는 학습 대상에서 지도되지 않았습니다.

어댑터 자체는 rank 16 LoRA, 148 MB이며, Ostris 학습 어시스턴트를 사용해 Comfy-Org/MiniMax-H3의 pruned INT8 Ref2VA 베이스 모델에서 1,000 업데이트 동안 학습되었습니다. 최종 checkpoint만 공개되며, 학습 런처와 실행 구성은 저장소의 training/ 아래에 포함되어 있습니다.

추가 예시

소스 비디오 프레임세로형 캐릭터 참조편집 대상
소스 비디오 프레임세로형 캐릭터 참조데이터셋 대상: 교체되어 들어간 캐릭터

두 번째 학습 쌍으로, 이번에는 시트가 아닌 세로형 참조를 조건으로 사용했습니다.

잘하는 점과 한계

작성자가 직접 수행한 베이스 모델과의 비교는 범위가 좁지만 다운로드 전에 읽어볼 가치가 있습니다.

  • 장면 보존 개선. 나란히 비교한 리뷰에서 어댑터는 베이스 모델보다 배경과 장면 구조를 소스에 더 가깝게 유지했지만, 작성자는 이를 벤치마크가 아닌 정성적 평가라고 밝혔습니다.
  • 긴 클립은 이탈합니다. 구간이 길어지면 프레이밍, 배치, 소스 타이밍이 흔들리고, 하드 컷은 편집이 아니라 느린 재배치로 퇴화할 수 있습니다.
  • 표정은 신뢰할 수 없습니다. 클로즈업 얼굴 표정은 원본 연기를 따르지 않는 경우가 많고, 더 강한 표정 지시는 때때로 스왑 자체를 억제했습니다.
  • 짧은 클립이 최적입니다. 약 4~5초의 연속 샷이 작성자의 14초 전체 시도보다 더 잘 버텼으며, 정확한 최대 재생 시간은 확립되지 않았습니다.
  • 트리거 단어 없음. 타기팅은 프롬프트에서 비롯되며, 카드는 프롬프트 문구가 소스와의 엄격한 정렬을 보장하지 않는다고 분명히 밝히고 있습니다.

Banodoco 테스터들도 같은 벽에 부딪혔습니다. Charlie는 하이브리드 FL2VA/Ref2VA H3 모델에 어댑터를 적용해 10초 테스트를 실행했고 약 5초까지 유지되었으며 15초 시도는 흐릿한 프레임이 되었다고 보고했습니다. 또 다른 테스터는 원본 인물의 포즈와 동작을 프롬프트에 설명하지 않으면 스왑이 움직임을 복사하지 않는다고 지적했습니다.

이탈의 원인은 구조적입니다. 모든 편집 대상이 정지 이미지였기 때문에, 모델은 연기를 시간에 걸쳐 유지하는 방법을 보여주는 움직이는 캐릭터 스왑 대상을 본 적이 없습니다. Akatz Labs는 이 진단을 바탕으로 Banodoco의 컴퓨트 그랜트 프로그램에 지원해 40 H100 시간을 승인받았으며, 표정, 컷, 가림, 더 긴 시퀀스를 다루는 12~24개의 움직이는 비디오 쌍을 촬영하고, 현재 참조 조건화와 명시적으로 정렬된 소스 및 대상 잠재 데이터 위치를 비교할 계획입니다.

ComfyUI에서 실행하기

이 어댑터는 노드 의존성이 없는 단일 model-only LoRA입니다.

  1. h3_character_swap_pro4500_1000.safetensors를 ComfyUI/models/loras/에 다운로드합니다.
  2. MiniMax H3 Ref2VA 워크플로를 만들거나 열고, pruned INT8 Ref2VA 베이스 모델과 텍스트 인코더, H3 비디오 및 오디오 VAE를 지정합니다.
  3. model-only LoRA 로더를 통해 LoRA를 strength 1.0으로 적용합니다.
  4. 유지하려는 클립을 <Video 1>로, 교체할 대상을 <Picture 1>로 로드한 다음, 프롬프트에서 대상 인물을 지정합니다. 예:
Replace only the man in the purple shirt in <Video 1> with the character in <Picture 1>.
Keep the replacement character's identity, outfit, and art style from <Picture 1>.
Preserve the source video's camera, background, lighting, objects, and all other people.
Match the target person's position, scale, pose, and movement.
Do not show the reference sheet or its background.

카드에서는 H3가 지원하는 프레임 그리드로 24 fps를 권장하며, 긴 연속 샷보다 짧은 연속 샷을 권장합니다. 또한 이 어댑터는 작동에 Turbo LoRA, Spectrum 또는 Sol 어텐션을 필요로 하지 않으며, 8스텝 Turbo LoRA와 결합한 것은 호환성 주장이 아닌 평가 선택이었다고 설명합니다.

다운로드 및 제공 정보

h3_character_swap_pro4500_1000.safetensors 다운로드 (148 MB)

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
MiniMax H3 캐릭터 스왑 LoRA: 참조 비디오 인물을 다른 캐릭터로 교체 | ComfyUI Wiki