MiniMax H3 이미지 VAE: 단일 잠재 데이터 직접 이미지 디코딩
Mamad8이 커스텀 노드 없이 단일 T=1 시간적 잠재 데이터를 이미지로 직접 디코딩하는 실험적 이미지 특화 MiniMax H3 VAE를 공개합니다.
Mamad8이 8월 9일 Reddit에 공유한 실험적 이미지 특화 MiniMax H3 VAE를 Hugging Face에 공개했습니다. 이 체크포인트는 단일 시간적 잠재 데이터(T=1)를 하나의 이미지로 직접 디코딩하여 H3 24채널 잠재 데이터 형식에 사용 가능한 직접 단일 잠재 데이터 이미지 경로를 제공합니다. 표준 병합 H3 VAE 체크포인트로 배포되므로 커스텀 노드나 별도의 디코더 헤드가 필요하지 않습니다.
무엇을 할 수 있고 무엇을 할 수 없는가
모델 카드에는 트레이드오프가 명확히 명시되어 있습니다.
- 이미지 전용. 이미지 특화 디코더는 다중 프레임 비디오 재구성 품질을 크게 저하시키고 패치 그리드 고스팅 및 프레임 간 혼합을 유발할 수 있으므로 비디오 워크플로에서 원본 H3 VAE를 대체해서는 안 됩니다.
- 품질은 제한적입니다. 출력이 부드럽게 처리되어 미세한 텍스트, 얇은 윤곽선, 머리카락, 나뭇잎, 미세 질감이 손실될 수 있습니다. 위의 예시 이미지는 품질 보장을 암시하는 것이 아니라 실제 결과를 보여줍니다. 이것은 충실도 보장이 아닌, 실용적 유틸리티 경로입니다.
이 VAE의 목적은 H3에 실용적인 단일 이미지 왕복 경로를 제공하는 것입니다. 이는 H3 잠재 데이터를 이미지로 검사하거나 편집하려는 워크플로에 중요합니다.
학습 방법
원본 H3 인코더는 동결한 채 전체 디코더와 post_quant_conv를 미세 조정하여 단일 H3 시간적 잠재 데이터에서 실제 소스 이미지를 직접 재구성하도록 했습니다. 학습에는 51,083개의 고유 이미지(41,259개의 Booru Essence 이미지와 9,824개의 유사 카메라 사진)에 대해 256→384px 점진적 커리큘럼을 사용했으며, 디코더를 고려해 Charbonnier 재구성, 에지, SSIM 및 낮은 가중치 FDL/FDL-PIPS 손실을 결합한 목적 함수를 적용했습니다. 선택된 step-1597 디코더는 표준 H3 VAE 체크포인트에 다시 병합되었으므로 일반 H3 VAE 도구로 로드할 수 있습니다.
학습에 사용되지 않은 균형 잡힌 512px 세트(사진 32장 + 아트 이미지 32장)에서 이 체크포인트는 30.44dB PSNR, 0.939 SSIM, 0.0168 MAE를 기록했습니다. 약 13메가픽셀 범위의 배포 검증에서는 31.5533.43dB PSNR을 달성했습니다.
ComfyUI 사용법
minimax_h3_t1_image_vae_step1597.safetensors(약 5.2GB)를ComfyUI/models/vae/에 다운로드합니다.- 표준 VAE 로드 노드로 로드한 다음 일반 VAE 인코드/디코드 노드를 사용합니다.
- 이 모델은 MiniMax H3의 24채널 잠재 데이터 형식을 사용하며 단일 이미지(
T=1) 왕복용으로 설계되었습니다.
다운로드
체크포인트는 Hugging Face에서 받을 수 있습니다. H3 잠재 공간 워크플로를 위해 Mamad8이 이전에 공개한 2× 잠재 데이터 업스케일러와 함께 사용할 수 있습니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.