MiniMax H3 Fun ControlNet Union: Canny, Depth, Pose 등 다양한 제어 지원
알리바바 PAI가 MiniMax H3용 ControlNet-Union을 공개: 6.8 GB 체크포인트 하나로 VideoX-Fun을 통해 Canny, Depth, HED, MLSD, Pose 비디오 제어와 인페인팅을 지원합니다.
무엇인가
이 체크포인트는 제어 브랜치만 담고 있습니다(control_proj_in + 5개의 control_blocks, 약 6.8 GB). 베이스 MiniMax H3 Transformer 위에 로드되며, 제어 신호는 50개 Transformer 블록 중 5곳(0, 10, 20, 30, 40층)에 주입되고 각 제어 스킵은 제로 게이트 투영을 통해 메인 브랜치에 합쳐집니다.
- Union 제어 — 하나의 체크포인트로 Canny, Depth, HED, MLSD, Pose 제어 비디오를 사용한 비디오 간 생성이 가능합니다.
- 가이던스 증류 —
guidance_scale = 1.0으로 실행하며 스텝당 단일 포워드 패스만 필요합니다. classifier-free guidance가 필요 없습니다. - 인페인팅 — 제어 입력이 49채널(latent + 마스크된 latent + mask)로 확장됩니다. 전용
predict_v2v_control_inpaint.py예제를 사용합니다. - 제어 강도 —
control_context_scale이 각 제어 스킵을 메인 브랜치에 더하기 전에 스케일링합니다.1.0이 가장 강한 제어이며, 값이 낮을수록 제어 비디오의 유도가 약해지고0.0이면 제어 브랜치가 꺼집니다.
생성은 제어 비디오를 따릅니다: 프레임 수는 비디오 VAE가 디코딩할 수 있는 가장 큰 17 × n + 5(최대 15초)로 맞춰지고, 캔버스는 height × width 픽셀 예산 내에서 제어 비디오의 종횡비를 유지하며, 24 fps 고정입니다. 장면, 피사체, 카메라를 자세히 설명하는 프롬프트가 가장 안정적인 결과를 만듭니다.
결과
아래 샘플은 모두 40스텝, guidance_scale = 1.0, control_context_scale = 1.00으로 생성되었습니다. 첫 번째 비디오는 제어 입력, 두 번째는 생성 출력입니다.
Canny
Canny 제어 입력(도쿄 거리)
Canny 구조를 따른 생성 출력
Pose
Pose 제어 입력(댄스)
댄스 포즈를 따른 생성 출력
사용 가능성
이 체크포인트는 현재 VideoX-Fun 추론 파이프라인으로 실행됩니다. VideoX-Fun 저장소를 클론하고, 베이스 MiniMax-H3 모델과 이 체크포인트를 models/Diffusion_Transformer/에 배치한 뒤 examples/minimax_h3_fun/predict_v2v_control.py 상단의 설정을 수정하고 실행합니다:
model_name = "models/Diffusion_Transformer/MiniMax-H3"
config_path = "config/minimax_h3/minimax_h3_control.yaml"
transformer_path = "models/Diffusion_Transformer/MiniMax-H3-Fun-Controlnet-Union/MiniMax-H3-Fun-Controlnet-Union.safetensors"
control_video = "your_control_video.mp4"
prompt = "your prompt"python examples/minimax_h3_fun/predict_v2v_control.py모델 카드의 중요한 설정 메모:
- 설정은 학습 때와 정확히 동일하게 제어 브랜치를 구성해야 합니다(
control_blocks_places: [0, 10, 20, 30, 40],control_in_dim: 49,control_apply_audio: false). 레이아웃이 일치하지 않으면 체크포인트 로드에 실패합니다. - 가이던스 증류 체크포인트이므로
guidance_scale = 1.0을 유지하세요. 1보다 큰 값은 가이던스를 두 번 적용해 출력을 저하시킵니다. - 제어 체크포인트에는 제어 브랜치만 포함되므로 베이스 MiniMax-H3 가중치가 반드시 필요합니다.
- Transformer(약 62 GB)와 Qwen3-VL 텍스트 인코더(약 62 GB)는 80 GB GPU 한 장에 완전히 로드되지 않습니다.
model_group_offload또는model_cpu_offload_and_qfloat8을 사용하세요.
현재 H3 ControlNet용 네이티브 ComfyUI 로더는 없습니다. 이번 릴리스는 VideoX-Fun 파이프라인을 대상으로 합니다. Gradio 데모 Space에서 공개된 5쌍의 결과 비디오와 함께 모델을 확인할 수 있습니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.