Viggle Meridian, 기하학 기반 리카메라를 ComfyUI에 제공

ComfyUI Wikinews

Viggle Meridian은 기하학 렌더를 바탕으로 MiniMax H3 비디오를 리카메라합니다. 기존 클립과 카메라 경로를 입력하면 새로운 시점을 얻습니다. LoRA 2개, 노드 2개, 바로 쓸 수 있는 그래프.

Viggle MeridianMiniMax H3용 기하학 기반 리카메라 모델입니다. 기존 클립과 카메라 경로를 넘겨주면 같은 사건을 다른 위치에서 본 결과를 생성합니다. 수정되지 않은 H3 transformer 위에 LoRA 어댑터 2개로 제공되며, Viggle/Meridian 저장소에 ComfyUI 노드와 바로 사용할 수 있는 그래프 2개가 함께 들어 있습니다.
덩크 리카메라: 생성된 뷰와 원본 영상을 결합한 모습

새로운 각도에서 본 덩크. 이 편집은 생성된 뷰와 원본 영상에서 가져온 프레임을 섞습니다.

작동 방식

Meridian은 비디오 모델에게 카메라 이동을 무에서 상상하도록 요청하는 대신, 작업을 기하학과 생성으로 나눕니다.

  1. 기하학 구성. VGGT-Omega가 입력 비디오에서 깊이와 카메라 포즈를 추정하고, 선택된 프레임이 색이 입혀진 3D 포인트가 됩니다.
  2. 새 뷰 렌더링. 각 출력 프레임마다 입력의 한 순간이 선택한 카메라 시점과 짝지어지고, 해당 각도에서 포인트가 렌더링됩니다. 원본 카메라가 본 적 없는 영역은 회색 구멍으로 나타납니다.
  3. 샷 생성. 소스 비디오와 이에 대응하는 렌더링된 비디오가 모두 참조로 Meridian에 입력되어, 구멍을 메우고 결과를 다듬습니다.
VGGT-Omega가 깊이와 카메라 포즈를 추정한 뒤, 선택한 카메라 경로를 따라 포인트를 렌더링합니다

VGGT-Omega에서 얻은 깊이와 카메라 포즈를 선택한 경로를 따라 렌더링한 것. 프레임은 실제이고, 포인트와 카메라는 도식입니다.

포인트만 있으면 기하학 렌더가 저렴하기 때문에, 비디오 모델을 실행하기 전에 프레이밍을 미리 보고, 빈 곳을 찾아내고, 경로를 조정할 수 있습니다. 공간과 시간은 별도로 제어됩니다. 어디서 볼지 고르고, 언제 볼지 고르고, 둘이 어떻게 만날지 결정하는데, 이것이 불릿타임 스타일의 움직임을 가능하게 하면서도 모델이 할 수 있는 유일한 기술은 아닙니다.

LoRA 두 개, 병합된 checkpoint 없음

Meridian은 추론 시 텍스트 인코더를 로딩하지 않고 MiniMax H3의 transformer와 VAE를 사용합니다. 작업의 텍스트 임베딩은 미리 계산되어 있고, transformer 아키텍처는 변경되지 않습니다.

구성 요소역할
teacher_lora/기하학 렌더를 읽는 리카메라 어댑터입니다. 2.5 GiB이며 자체 설정은 --steps 50 --flow-shift 12입니다
turbo_lora/teacher를 3회 forward로 증류한 것입니다. 2.5 GiB, 기본값 --steps 4 --flow-shift 3
legacy/최초 릴리스: 61.7 GiB 융합 transformer 1개와 해당 어댑터로, 재현성을 위해 유지됩니다

두 어댑터는 함께 로드되며, 어느 것도 기본 가중치에 병합해서는 안 됩니다. 기본 실행은 두 어댑터를 가중치 1.0으로 합산하는데, 이는 turbo가 증류된 기준 조합입니다. bf16에서 병합은 손실이 있으며, turbo의 경우 사실상 모든 업데이트를 지워버립니다.

ComfyUI에서 실행하기

Viggle은 두 어댑터를 comfyui/ 아래 ComfyUI의 범용 LoRA 형식으로 공개했으며, 커스텀 노드 파일 2개와 API 형식 그래프 2개도 함께 제공합니다. 아무 그래프나 캔버스에 끌어다 놓으면 프런트엔드가 이를 구성합니다.

  • Comfy-Org/MiniMax-H3에서 **minimax_h3_fl2va_bf16.safetensors**를 로드하세요. Meridian은 H3의 fl2va 파티션으로 학습되었으므로, ref2va 파일은 잘못된 베이스입니다.
  • comfyui/meridian_teacher_lora.safetensors를 적용한 다음 comfyui/meridian_turbo_lora.safetensors를 적용하며, 둘 다 strength 1.0으로 설정합니다.
  • simple 스케줄러에서 euler로, cfg 1.0으로 샘플링합니다. 네거티브 분기가 없으므로 동일한 조건화를 두 입력에 모두 연결하세요.
  • ComfyUI의 steps는 저장소의 --steps보다 하나 적게 실행됩니다. ComfyUI 스케줄러가 마지막 0을 덧붙이기 때문입니다. turbo 조합은 MiniMaxH3SigmaShift 3.0에 steps 3이고, teacher 단독은 shift 12.0에 steps 49입니다.

출력은 768급, 화면비에 맞춘 캔버스에서 24 fps입니다. 16:9 입력의 경우 1344x768입니다. 유효한 길이는 73, 90, 107, 124, 141, 158, 175 또는 243 프레임이며, 테이크당 대략 3~10초입니다. CLI는 인덱스로 프레임을 읽으므로, 소스 영상은 일정한 24 fps로 내보낸 연속 샷이어야 합니다. 프레임 속도를 정규화하거나 컷을 감지하지는 않습니다.

예시

발레 사진 한 장에서 생성된 카메라 움직임

정지 사진 한 장으로 만들어낸 카메라 이동.

재생, 정지, 재개: 카메라가 움직이는 동안 물보라가 멈춥니다

소스 시간이 진행하다가 카메라가 움직이는 동안 멈추고, 다시 진행됩니다.

모터크로스 점프 주위로 복합 카메라 경로 구성하기

하나의 연속 샷 안에서 회전하고, 옆으로 이동하고, 거리를 바꿉니다.

요구 사항 및 제한

참조 구현은 고용량 메모리의 CUDA GPU 한 대에서 실행되며, 현재 양자화, CPU 오프로딩, 다중 GPU 샤딩을 제공하지 않으므로 소비자용 카드는 아직 범위 밖입니다. Viggle은 커뮤니티에 Meridian을 RTX 4090 같은 더 작은 GPU로 가져와 달라고 명시적으로 요청하며, H3의 아키텍처를 유지하고 텍스트 인코더를 제거하는 것이 메모리 절약 작업의 유용한 출발점이라고 언급합니다. VGGT-Omega의 기하학 모델은 자체 저장소를 통해 별도로 받아야 하며, 어댑터에 포함되어 있지 않습니다.

사용 가능 여부

가중치, 어댑터, ComfyUI 노드, 그래프, 추론 CLI는 Hugging Face에 있습니다. 저장소에는 샘플 클립과, 생성을 확정하기 전에 실시간 3D 피드백으로 카메라 경로를 설계하는 프로토타입 Studio도 포함되어 있습니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
Viggle Meridian, 기하학 기반 리카메라를 ComfyUI에 제공 | ComfyUI Wiki