MiniMax H3 2× 잠재 업스케일러: ComfyUI 노드 사용 가이드
Mamad8이 MiniMax H3용 2× 클린 잠재 업스케일러를 두 개의 ComfyUI 노드와 함께 공개했습니다. 잠재 공간을 유지한 채 VAE 디코드 이전에 공간 해상도를 두 배로 늘립니다.
Mamad8이 8월 8일 MiniMax H3용 2× 잠재 업스케일러를 간결한 ComfyUI 노드 한 쌍과 함께 공개했습니다 (모델 카드, 커스텀 노드). 이 모델은 완전히 디노이즈된 H3 비디오 잠재 데이터의 공간 크기를 두 배로 늘려서, 워크플로가 VAE 디코드 → 픽셀 크기 조정 → VAE 재인코딩의 왕복 과정을 거치지 않고도 잠재 공간을 유지할 수 있게 합니다.
무엇인가
이것은 일반적인 이미지 또는 비디오 업스케일러가 아닙니다. 완료된 렌더링을 더 선명하게 만들지 않으며, 출력을 직접 디코드하면 원본보다 더 부드러워 보일 수 있습니다. 그 목적은 클린 H3 비디오 잠재 데이터를 2× 더 큰 공간 잠재 그리드로 빠르게 옮겨서, 고해상도 연속 생성 또는 두 번째 샘플링 패스를 더 큰 캔버스에서 실행할 수 있게 하는 것입니다.
- 공간 잠재 크기만 두 배로 늘립니다. 시간 축 길이는 변경되지 않습니다.
- 동반 노드를 통해 사용하면 H3의 비디오/오디오 결합 잠재 데이터에 포함된 오디오 스트림은 그대로 유지됩니다.
- 클린 잠재 데이터만 지원합니다. 중간 단계의 노이즈 잠재 데이터에 적용하는 것은 지원되지 않습니다.
학습 방법
학습 쌍은 클린 H3 잠재 데이터로 구성되었습니다. 각 저해상도 잠재 데이터는 H3 VAE로 디코드되고, Lanczos로 픽셀 공간에서 2× 확대된 다음, 결정론적으로 재인코딩되어 티처 잠재 데이터를 제공했습니다. 경량 네트워크는 잠재 데이터와 디코더를 고려한 재구성, SSIM, 공간 일관성 및 시간 일관성 손실을 사용하여 이중선형 잠재 보간 위에 보정을 학습했습니다. H3 생성기 자체는 학습되거나 수정되지 않았습니다.
ComfyUI 사용법
ComfyUI-H3-Latent-Upscaler-Mamad8을ComfyUI/custom_nodes/에 복제하고 ComfyUI를 재시작합니다. 추가 Python 패키지는 필요하지 않습니다.h3_clean_latent_upscaler_v1_mamad8.safetensors(~56 MB)을ComfyUI/models/h3_latent_upscalers/에 다운로드합니다.
이 노드 패키지는 두 가지 노드를 제공합니다: Load H3 Latent Upscaler와 Upscale Clean H3 Latent 2x. 샘플링이 완료된 이후, 일반 VAE 디코드 이전에 적용 노드를 배치하세요:
H3 sampler → Upscale Clean H3 Latent 2x → VAE Decode예를 들어, 672×384용으로 생성된 클린 잠재 데이터는 2× 잠재 업스케일링 이후 1344×768로 디코드됩니다. 프레임 수와 오디오는 변경되지 않습니다. 업스케일 이후 H3 디노이징을 계속하려면 명시적인 재노이즈 및 고해상도 연속 생성 워크플로가 필요하며, 이는 의도적으로 두 노드의 범위 밖으로 남겨졌습니다.
저장소에는 외부 의존성이 없는 핵심 ComfyUI 비디오 및 VAE 노드를 사용하는 기본 워크플로가 포함되어 있습니다:
커뮤니티 노트
Banodoco 커뮤니티 멤버들은 출시 당일 테스트를 시작했습니다. RuneX는 두 패스 설정을 실행했습니다: 저해상도에서 전체 25스텝 첫 번째 패스, 2× 잠재 업스케일, 그 다음 8스텝 두 번째 패스. 그리고 오디오가 눈에 띄게 더 풍부하게 나왔다고 보고했습니다 (테스트 노트). mamad8은 이번 출시가 MiniMax 자체가 H3용으로 출시할 것으로 예상되는 공식 업스케일러를 부분적으로 앞선 것이라고 언급했습니다.
샘플러 사이의 업스케일링(하나의 워크플로 안에서 재노이즈 + 두 번째 패스)의 경우, Tr1dae의 ComfyUI-MiniMaxH3_LatentUpscaler는 패스 1 오디오를 얼마나 다시 믹스할지 제어하는 audio_denoise 컨트롤로 다른 접근 방식을 사용합니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.