MiniMax H3 Fused Turbo ComfyUI: 21GB 단일 파일, 4 스텝 비디오 및 오디오 생성

ComfyUI Wikinews

MATLOWAI 가 H3 터보와 Mystic LoRA 를 단일 INT8 ConvRot ComfyUI 파일에 통합했습니다: 오디오 포함 4 스텝 텍스트/이미지 기반 비디오 생성 및 레퍼런스 기반 비디오 생성으로 VRAM 약 21 GB 절감.

MiniMax-H3 Fused Turbo (INT8 ConvRot) (Hugging Face) 는 MATLOWAI 의 단일 21 GB ComfyUI 확산 모델 파일로, MiniMax H3 텍스트/이미지 기반 비디오 생성과 레퍼런스 기반 비디오 생성4 스텝으로 수행하며, 디스틸된 터보와 모션 스무딩 LoRA 가 이미 가중치에 통합되어 있습니다. LoRA 로더 없이 양자화 라운드트립도 없으며, 동일한 라이브 LoRA 설정 대비 VRAM 이 약 21 GB 적습니다.

4 스텝 단일 패스 레퍼런스 실행: 1152x640, 243 프레임 (오디오 포함 10 초), RTX PRO 6000 기준 76 초.

파일 내부 구성

이 통합은 프루닝된 fl2va 트랜스포머를 기반으로 하며, (ref2va - fl2va) 가중치 델타의 랭크 1024 SVD 가 융합되어 있어 하나의 파티션이 첫 번째/마지막 프레임 conditioning 과 reference conditioning 모두를 처리합니다. 여기에 다음 사항들이 추가됩니다:

통합됨강도소스
lightx2v FL2VA Turbo 8-step v1.01.0Kijai/MiniMax-H3_comfy, 랭크 24 크기 조정 (원본)
Mystic v2.0 (모션 부드러움)0.7Civitai 모델 2856467

단일 INT8 ConvRot 양자화 패스가 통합 이후 실행됩니다: 각 50 블록의 네 가지 주요 선형 가중치 (qkv_proj, out_proj, fc1, fc2) 는 ComfyUI 의 네이티브 comfy_quant 레이아웃에서 ConvRot(그룹 256, 채널별) 로 INT8 이며, 나머지는 BF16/F32 로 유지됩니다. 이 순서가 중요합니다: 통합된 가중치를 양자화하면 양자화된 베이스에 부동 소수점 델타가 결합될 때 발생하는 드리프트를 방지하며, 동일 시드 테스트에서 통합 결과가 라이브 LoRA 경로와 동일하게 측정되었습니다.

왜 LoRA 를 쌓는 대신 통합하는가

두 LoRA 파일의 총 크기는 약 540 MB 이므로 어댑터 자체가 문제는 아닙니다. LoRA 는 ComfyUI 가 로드 시 추가하는 저랭크 델타이며, 제거 가능하도록 접촉하는 모든 가중치의 정품 사본을 보관합니다. INT8 모델의 핵심 레이어 200 개 전체에 패치를 적용하면 그 백업은 메모리상의 두 번째 전체 모델이 됩니다. 동일한 시드로 8 스텝에서 두 번 측정했습니다:

설정최대 VRAM점유 메모리실제 시간
통합 (이 파일)47.8 GB42 GB103 s
라이브 LoRA68.9 GB64 GB103 s

동일한 테이크, 동일한 실제 시간, 오디오 미터는 노이즈 범위 내에서 동일합니다. 통합은 단순히 로더 두 개, 양자화 라운드트립 및 약 21 GB 패치 백업을 제거합니다. 조절 가능한 LoRA 강도가 필요한 경우 README 에 공개 파일을 사용한 동일한 라이브 경로가 문서화되어 있습니다.

스텝: 8 이라고 표기되지만 4 로 실행

통합된 터보는 lightx2v 의 8 스텝 LoRA 이지만, 4 또는 8 NFE 모델입니다. RTX PRO 6000 (96 GB), 1152x640, 243 프레임, SLA 희소 어텐션 환경에서 측정한 성능 비교는 다음과 같습니다:

파이프라인스텝실제 시간
레퍼런스, 단일 패스476 s
레퍼런스, 단일 패스680 s
레퍼런스, 단일 패스8103 s
레퍼런스, 단일 패스25292 s
디로프 (4 + 4)4 + 4~374 s

동일한 촬영을 25 스텝으로: 조금 더 날카로운 그림, 76 초 대신 292 초, 사운드트랙은 동일.

디로프는 4 스텝으로 실행해야 하는 이유입니다: 두 번째 패스는 'jerk oracle'이 검토 대상으로 표시한 프레임에만 스텝을 사용하므로, 4 + 4 는 25 스텝 패스 하나와 비용이 비슷하지만 보유 영역이 더 깨끗하게 나옵니다. 두 가지 레시피 발견 사항이 중요합니다: 4 스텝에서 오디오 품질은 res_multistepeuler 보다 우수합니다 (lightx2v 의 예시 그래프는 euler 를 권장함), 그리고 0.90 희소도를 가진 SLA 블록 희소 어텐션은 청각적으로 확인 가능하며, 밀집 어텐션이 평평하게 만드는 상단 사운드트랙 세부 사항을 복원하면서 약 40% 더 빠르게 실행됩니다.

워크플로

이 리포지토리에는 ComfyUI 그래프 5 개 (UI 및 API 형식) 가 포함되어 있으며, 각 그래프에는 모든 단계를 공급하는 하나의 PROMPT 상자가 있습니다. ComfyUI-MAINodes 와 SLA 희소 어텐션 노드 팩이 필요합니다:

시작하기

  1. minimax_h3_fused_refdelta_r1024_turbo8_mystic07_int8_convrot.safetensors(21 GB) 를 ComfyUI/models/diffusion_models/ 에 다운로드하고 기본 UNetLoader 로 로드하며, weight_dtype 는 default 로 설정합니다. 사용자 정의 양자화 로더는 필요하지 않습니다.
  2. Comfy-Org/MiniMax-H3 에서 동반 파일을 다운로드합니다: minimax_h3_video_vae_int8_convrot.safetensors, minimax_h3_audio_vae_fp32.safetensors(VAE) 및 qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors(텍스트 인코더).
  3. ComfyUI-MAINodes 와 SLA 희소 어텐션 노드 팩을 설치한 후 위의 워크플로를 드래그하여 넣습니다.

작은 카드에서도 작동합니다: ComfyUI 의 모델 관리는 필요에 따라 트랜스포머, 텍스트 인코더 및 VAE 를 로드하고 오프로드하므로 동일한 그래프가 실행되지만 속도가 느립니다. AMD/ROCm 의 경우, 이 레시피는 patientx 의 ComfyUI ROCm 포크가 포함된 AMD 시스템에서 개발되었으며, 여기에는 SLA 어텐션 노드의 ROCm 빌드도 포함되어 있습니다.

링크

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
MiniMax H3 Fused Turbo ComfyUI: 21GB 단일 파일, 4 스텝 비디오 및 오디오 생성 | ComfyUI Wiki