MiniMax H3 하이브리드 병합: FL2VA 품질과 Ref2VA 참조 지원을 결합한 ComfyUI 체크포인트
커뮤니티 병합이 MiniMax H3 FL2VA 품질과 Ref2VA 참조 조건화를 하나의 체크포인트로 결합하며, 전용 ComfyUI 하이브리드 로더 노드도 함께 제공합니다.
MiniMax H3는 동일한 아키텍처를 가진 두 개의 체크포인트로 제공됩니다. FL2VA는 더 높은 시각 및 오디오 품질을 제공하며, Ref2VA는 참조 기반 생성(이미지, 비디오 또는 오디오 참조 조건화)을 지원하는 유일한 변형이지만 원시 출력 품질은 눈에 띄게 낮습니다. 이제 커뮤니티 프로젝트가 두 모델을 단일 MiniMax H3 Hybrid 체크포인트로 병합했으며, 함께 제공되는 커스텀 노드가 이를 ComfyUI에서 직접 로드합니다.
공식 프로젝트 README의 권장 하이브리드 로더 설정
병합 배경
두 공식 체크포인트를 텐서별로 비교한 결과, 압도적 다수의 가중치(어텐션 QKV/출력 프로젝션, MLP, RMSNorm, 패치 프로젝션, 회전 위치 임베딩, 토큰 리파이너)가 FL2VA와 Ref2VA 간에 비트 단위로 동일하거나 매우 유사(코사인 유사도 ≥ 0.9997)한 것으로 나타났습니다. 의미 있는 차이는 블록별 adaln_proj 가중치에 집중되어 있습니다. AdaLN 변조 프로젝션은 텍스트, 오디오, 비디오 및 참조 모달리티 신호를 잔차 스트림으로 라우팅합니다.
참조 조건화 처리가 후반 블록의 AdaLN 가중치에 국한되어 있는 반면, 일반적인 시각/오디오 충실도는 공유 가중치에 있으므로, 손실이 큰 절충 대신 정밀한 병합이 유망해 보였습니다. 즉, 나머지 모든 부분은 FL2VA를 베이스로 사용하고, 구성 가능한 범위의 후반 트랜스포머 블록에 대해서는 Ref2VA의 adaln_proj 가중치를 가져오는 방식입니다.
사용 가능한 변형
병합은 추가 학습 없이 텐서 수준에서 수행되었습니다. 모든 변형은 FL2VA를 베이스로 사용하며, 50개의 트랜스포머 블록 중 몇 개가 Ref2VA에서 adaln_proj 가중치를 가져오는지만 다릅니다.
| 파일 | Ref2VA에서 가져온 블록 | 장단점 |
|---|---|---|
minimax_h3_hybrid_fl2va_ref2va_b30-49.safetensors | 30–49 (마지막 20개) | FL2VA에 가장 근접: 최고 출력 품질, 참조 기능 감소 |
minimax_h3_hybrid_fl2va_ref2va_b25-49.safetensors | 25–49 (마지막 25개) | 권장 기본 균형 |
minimax_h3_hybrid_fl2va_ref2va_b20-49.safetensors | 20–49 (마지막 30개) | Ref2VA에 더 근접: 더 나은 참조 준수, 약간 낮은 품질 |
minimax_h3_hybrid_fl2va_ref2va_b15-49.safetensors | 15–49 (마지막 35개) | 최고 참조 기능, 일부 품질 손실 |
각 변형은 소스 모델과 동일한 아키텍처와 텐서 레이아웃을 가진 독립형 체크포인트(약 21GB)이므로, 로드되면 일반적인 확산 모델처럼 동작합니다.
ComfyUI 사용법
하이브리드 모델은 ComfyUI의 기본 Load Diffusion Model 노드로는 로드할 수 없습니다. 기본 로더 중에는 두 체크포인트를 합성하는 방법을 아는 것이 없기 때문입니다. 동반 커스텀 노드인 MiniMax H3 Hybrid Loader(ComfyUI_MinimaxH3HybridLoader)가 이 공백을 메웁니다.
- 커스텀 노드를
ComfyUI/custom_nodes/에 설치하고 ComfyUI를 재시작합니다. model/loaders 아래에MiniMax H3 Hybrid Loader로 나타납니다. - 베이스 모델은 FL2VA 체크포인트로, 오버레이 모델은 Ref2VA 체크포인트로 설정합니다.
- 프리셋을 선택합니다.
ref2va_adaln_over_fl2va(Ref2VA의 블록별 AdaLN만 사용)를 고르거나,block_range_adaln과 함께block_range_start/block_range_end를 사용하여 더 세밀하게 제어할 수 있습니다(블록 인덱스는 0–49입니다). - 로더는 병합된 state dict를 ComfyUI의 기본 모델 로더에 전달하므로, 결과는
Load Diffusion Model로 로드된 모델과 구분할 수 없습니다. 동일한 패처, 동일한 멀티GPU 지원, 그리고 int8.comfy_quant동반 파일도 자동으로 함께 적용됩니다.
로더는 메모리 효율적입니다. 두 safetensors 파일 모두 mmap 기반으로 열리고 텐서를 하나씩 병합하므로, 최대 RSS는 두 모델 분량이 아닌 한 모델 분량 수준으로 유지됩니다.
다운로드
- 가중치: Hugging Face의 smhfacct/Minimax-H3-fl2va-ref2va-hybrid-models(4가지 변형, 각각 약 21GB)
- ComfyUI 노드: GitHub의 scottmudge/ComfyUI_MinimaxH3HybridLoader,
minimax_h3_analysis.md에 전체 텐서별 분석 포함 - 두 소스 체크포인트 모두 수정되지 않은 상태로 유지되며, 병합 모델은 원본 MiniMax H3 이용약관을 그대로 따릅니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.