MiniMax H3 Acc LoRA: ComfyUI 공식 8 스텝 PDD 증류
Alibaba PAI 에서 MiniMax H3 를 위한 PDD 가속 LoRA 출시: CFG 없이 8 또는 4 스텝 샘플러로 전체 오디오 - 비디오 생성 및 네이티브 ComfyUI 노드 팩 포함.
무엇인가요
두 개의 -Acc-8Step 파일은 일반적인 LoRA 가 아닙니다. 랭크 64 트렁크 LoRA(network_alpha = 64, BF16) 와 함께 각 체크포인트에는 병렬 디코딩 증류 헤드 뱅크가 포함되어 있습니다: 각 샘플러 스텝마다 단일 평균 블록 속도 헤드로 융합되는 최종 레이어 비디오 및 오디오 투영의 32 개 간격 복사본입니다. 일반 LoRA 로더는 이 파일을 읽을 수 없으며, 헤드 뱅크를 삭제하면 증류 정보가 묵시적으로 손실됩니다.
- 8 스텝, CFG 없음 — 생성은
guidance_scale = 1.0으로 실행되며 스텝당 단일 포워드 패스를 사용합니다; 가이드는 어댑터에 증류됩니다. - 한 번의 패스로 오디오 + 비디오 — 증류는 시각 프레임뿐만 아니라 결합된 오디오 스트림을 커버합니다.
- 두 개의 트렁크 — 하나의 어댑터는 FL2VA(텍스트/첫 번째 - 마지막 프레임 조건부) 체크포인트를 대상으로 하고, 다른 하나는 Ref2VA(참조 조건부) 체크포인트를 대상으로 합니다.
- 공식 릴리스 — Shaul et al. 의 PDD 방법 (arXiv 2607.26004) 을 따르며 2026 년 8 월 26 일 Alibaba PAI 에서 게시되었습니다.
가중치
| 파일 | 크기 | 대상 베이스 | 링크 |
|---|---|---|---|
MiniMax-H3-FL2VA-Acc-8Step.safetensors | 1.4 GB | MiniMax-H3 (FL2VA) | HF |
MiniMax-H3-Ref2VA-Acc-8Step.safetensors | 1.4 GB | MiniMax-H3 (Ref2VA) | HF |
각 파일은 BF16 기준 1.4 GB, 랭크 64 이며, 기본 H3 트랜스포머 위에 강도 1.0 으로 적용됩니다. FL2VA 어댑터를 FL2VA UNET 과 짝짓고, Ref2VA 어댑터를 Ref2VA UNET 과 짝짓습니다 (bf16 원본 또는 int8 convrot 빌드 모두 작동합니다).
결과
Acc-8Step 어댑터를 LoRA 가중치 1.0 으로 사용하여 생성된 공식 데모 샘플:
FL2VA
FL2VA Acc-8Step 어댑터 사용 텍스트 기반 비디오 생성
Ref2VA
Ref2VA Acc-8Step 어댑터 사용 레퍼런스 기반 비디오 생성
모델 카드에는 비증류 베라인과 커뮤니티 Minimax-h3-Turbo 4 스텝 LoRA 와의 비교도 함께 제공됩니다.
ComfyUI 지원
Jalen-Brunson 의 ComfyUI-MiniMax-H3-PDD-Acc 는 릴리스를 위한 네이티브 ComfyUI 노드를 추가합니다. MiniMaxH3PDDAccApply 노드는 트렁크 LoRA 를 적용하고 최종 레이어에 PDD 헤드 뱅크를 설치하며, sigma 로 매 스텝마다 준비되어 루프 및 청크 샘플러가 동기화되도록 합니다. 동반 스케줄러 노드는 부분 디노이즈 워크플로우를 위해 훈련된 sigma 그리드를 방출합니다.
훈련된 레시피는 엄격합니다:
- 샘플러 — Euler; 각 스텝은 하나의 평균 블록 속도를 소비하므로, 다단계 샘플러는 그리드 밖에서 평가됩니다.
- 스텝 — 8(기본값, 훈련된 블록 크기), 4(공식 승인 재그룹화), 또는 6(비균일
8,8,4,4,4,4분할). 다른 스텝 수는 노드가 묵시적으로 저하하지 않고 거부합니다. - 가이드 —
BasicGuider사용 CFG 1.0. - Sigma shift — 정확히 12.0 / 3.0.
- 가지친 체크포인트 — 가지친 (곡선 테이블) H3 UNET 에서 50 개의 밀집 adaLN LoRA 모듈은 자동으로 모델의 곡선 베이스로 재기반화됩니다.
이 어댑터를 사용할 때 다른 증류 LoRA(lightx2v turbo 등) 를 제거하세요 — 증류는 스택되지 않습니다. 캐릭터 LoRA 는 정상적으로 스택됩니다.
두 가지 포맷이 지원됩니다: 원본 Alibaba 파일 (노드에 의해 메모리에서 변환됨) 또는 aptech0081/MiniMax-H3-Acc-LoRAs-ComfyUI 의 사전 변환된 ComfyUI 키 재배포 (파일당 1.7 GB).
사용처
ComfyUI 외부에서는 어댑터가 VideoX-Fun 추론 파이프라인을 통해 실행됩니다. VideoX-Fun 의 predict_t2v.py(FL2VA) 또는 predict_ref2v.py(Ref2VA) 예제 스크립트의 model_path 및 pdd_lora_path를 설정하세요. 이는 Diffusers 의 MiniMax-H3 ModularPipeline 을 사용하며 diffusers >= 0.40.0 가 필요합니다. 각 예제는 apply_pdd_lora 로 체크포인트를 로드하고 구성에서 필요한 추론 스텝 수를 유도합니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.