ComfyUI용 MiniMax H3 360 Orbit LoRA: 사진 한 장으로 완전한 궤도 영상

ComfyUI Wikinews

MiniMax H3 FL2VA용 커뮤니티 LoRA로, 사진 한 장을 자기 첫 프레임으로 되돌아오는 완전한 360도 카메라 궤도로 바꿔 줍니다. 최적의 ComfyUI 설정도 함께 정리했습니다.

MiniMax-H3-360-Orbit-LoRA는 MiniMax H3 FL2VA용 커뮤니티 어댑터로, 장면은 한 순간에 정지된 채 카메라만 피사체 주위를 한 바퀴 돌고, 시작했던 바로 그 프레임에 정확히 도착합니다. 동일한 이미지를 첫 키프레임과 마지막 키프레임으로 넣으면 클립이 자기 자신으로 이어지므로, 이음새 없이 궤도를 연속 연결할 수 있습니다. Pablo Dawson은 9월 27일 가중치와 함께 설정, 프롬프트, 학습 레시피를 공개했습니다.
MiniMax H3 360 Orbit LoRA로 사진 한 장씩으로부터 생성한 네 개의 360도 궤도

네 개의 개별 궤도로, 각각 사진 한 장을 첫 키프레임과 마지막 키프레임으로 사용해 생성했습니다. 소스: MiniMax-H3-360-Orbit-LoRA.

LoRA가 하는 일

MiniMax H3에는 두 가지 비디오 경로가 있는데, 이 어댑터는 그 사이의 간극을 메웁니다. 레퍼런스 기반 비디오 생성은 입력 이미지를 느슨한 모양 참조로 취급하기 때문에 클립이 정해진 프레임에서 끝나지 않고 두 클립을 깔끔하게 이어 붙일 수 없습니다. 첫 프레임 및 마지막 프레임 생성은 양 끝을 고정하므로 이음새가 정확하지만, 기본 상태에서는 첫 프레임과 마지막 프레임이 같은 그림일 때 모델이 요청을 정지 이미지로 해석하기 때문에 거의 움직이지 않습니다.

이 어댑터는 대신 실제 기하학적으로 일관된 궤도를 모델에 학습시킵니다. 장면은 정지된 것으로 선언되고 카메라만 이동하며, 종료 프레임이 시작 프레임에 고정되기 때문에 움직임이 하나의 루프로 닫힙니다.

사진 한 장으로 렌더링한 궤도이며, 동일한 이미지를 첫 키프레임과 마지막 키프레임으로 사용했습니다.

베이스 모델과의 비교

아래의 각 비교는 동일한 시드, 프롬프트, 해상도, 스텝 수로 같은 입력을 세 번 렌더링한 것입니다. 왼쪽부터: 첫 프레임만 사용한 베이스 모델, 첫 프레임과 마지막 프레임을 사용한 베이스 모델, 그리고 베이스에 이 LoRA를 더해 첫 프레임과 마지막 프레임을 사용한 경우입니다.

키프레임 하나를 사용한 베이스 모델, 동일한 키프레임 두 개를 사용한 베이스 모델, 궤도 LoRA를 더한 모델의 비교

스케이트 장면: 베이스 모델은 시작 뷰에서 벗어나거나 그대로 멈춰 있는 반면, LoRA는 궤도를 완성하고 첫 프레임으로 돌아옵니다.

서 있는 인물 주위를 도는 베이스 모델과 LoRA 궤도의 두 번째 비교

서 있는 인물을 중심으로 한 동일한 삼자 비교.

위 삼자 비교의 전체 해상도 MP4입니다.

베이스 모델 패널 없이 LoRA만 사용한 결과입니다.

프롬프트

작성자는 이 프롬프트를 그대로 사용할 것을 요청합니다:

One frozen instant. Only the camera moves. In a continuous 360 orbit. Preserve every person and object in exactly the same world position, orientation, shape and pose throughout the shot. Airborne objects remain suspended at the captured height and angle: no wobbling, shaking, spinning, drifting, falling or continued action. Keep faces, hands, clothing, liquids and the background motionless while retaining their natural appearance. Camera parallax is the only source of apparent movement. No cuts, zoom, morphing or added objects.

권장 설정

설정값
베이스 가중치MiniMax H3 FL2VA pruned, Comfy-Org/MiniMax-H3의 INT8 ConvRot repack
키프레임완전한 360도 루프를 위해 동일한 이미지를 첫 프레임 및 마지막 프레임으로 사용
해상도768 × 768
프레임73 (24 fps에서 약 3초)
스텝28
가이드없음. MiniMax H3는 guidance-distilled 모델이므로 CFG도 네거티브 프롬프트도 없습니다
LoRA 강도1.0
오디오꺼짐

ComfyUI에서 실행하기

이 어댑터는 ComfyUI 명명 규칙(diffusion_model.* 키)을 사용하는 모델 전용 LoRA 하나이므로 커스텀 노드가 필요하지 않습니다:

  1. minimax_h3_flf2v_lora_v1.safetensors를 ComfyUI/models/loras/에 다운로드합니다.
  2. MiniMax H3 첫 프레임 및 마지막 프레임 워크플로를 열고, pruned INT8 FL2VA 베이스와 텍스트 인코더, H3 비디오 및 오디오 VAE를 지정합니다.
  3. 모델 전용 LoRA 로더를 통해 LoRA를 강도 1.0으로 적용합니다.
  4. 이미지 한 장을 두 키프레임 슬롯 모두에 로드하고 위 프롬프트를 그대로 붙여 넣습니다.

모델 카드에는 이 LoRA가 ostris/ai-toolkit과 그 minimax_h3 확장으로 학습 및 테스트되었으며, 학습 중 사용된 학습 어댑터는 추론 시 필요하지 않다고 명시되어 있습니다.

학습 방법

데이터셋은 의도적으로 단조롭습니다. 모든 클립이 LoRA가 학습해야 할 움직임만 보여주고 다른 것은 없기 때문에, 모델은 피사체가 움직이는 모습을 전혀 보지 못합니다:

  • 직접 고른 사람 Gaussian splat 주위의 궤도 렌더 28개. splat은 정적인 3D 장면이므로 모든 프레임이 구조적으로 기하학적 일관성을 가지며, 프레임 간에 변하는 것은 카메라뿐입니다.
  • 클립 형식: 768 × 768, 73프레임, 24 fps, 모든 클립에 하나의 캡션(위 프롬프트), 캡션 드롭아웃 0.05, 오디오 없음.
  • 어댑터: rank 16, alpha 16, adaln_proj를 제외한 모든 transformer linear 레이어에 적용, 총 208개 모듈.
  • 학습: 3,000 스텝(약 107 에폭), 배치 크기 1, AdamW 8-bit, lr 1e-4, bf16 및 gradient checkpointing, flow-matching shifted timesteps, MSE loss. NVIDIA A100 80 GB 한 대로 10시간 24분이 걸렸으며, 스텝당 약 12.5초입니다.

제한 사항

작성자는 이번 공개가 얼마나 좁은 범위인지 분명히 밝힙니다:

  • 도메인이 좁습니다. 학습에는 사람 중심의 정사각형 클립 28개(73프레임)가 사용되었습니다. 다른 피사체, 다른 화면 비율, 다른 클립 길이는 테스트되지 않았습니다.
  • 작은 움직임이 남을 수 있습니다. 장면이 정지되어 있어야 함에도 일부 미세한 움직임, 특히 눈 깜빡임이 여전히 나타날 수 있습니다.

제공

minimax_h3_flf2v_lora_v1.safetensors 다운로드 (148 MB)

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
ComfyUI용 MiniMax H3 360 Orbit LoRA: 사진 한 장으로 완전한 궤도 영상 | ComfyUI Wiki