FastH3 8-Step V2, 네이티브 ComfyUI 템플릿 공식 지원
FastVideo FastH3 8-Step V2가 공식 t2v 및 첫/마지막 프레임 템플릿, BlockSparseAttention VSA 설정, Comfy-Org가 재패키징한 checkpoint와 함께 ComfyUI에서 네이티브로 실행됩니다.
8월 말 FastH3 Preview v1이 출시되었을 당시, ComfyUI에서 이를 실행하는 것은 현실적이지 않았습니다. VSA 어댑터가 FastVideo 자체 런처를 필요로 했기 때문에, 저희는 ComfyUI 사용자들에게 H3 Turbo-SLA나 PDD Acc LoRA 같은 distillation LoRA를 대신 안내했습니다. 이제 상황이 바뀌었습니다. FastVideo가 8-Step V2 checkpoint를 출시했고, Comfy-Org가 이를 ComfyUI용으로 재패키징했으며, 공식 워크플로 템플릿 저장소에 이제 두 개의 네이티브 FastH3 템플릿이 포함되었습니다.
ComfyUI 템플릿 브라우저에 표시된 공식 FastH3 텍스트 기반 비디오 생성 템플릿.
8-Step V2 checkpoint
FastVideo-FastH3-8-Step-V2는 80% sparsity의 VSA-H3 어텐션으로 학습된 MiniMax H3의 data-free DMD2 distillation입니다. 베이스 모델의 전체 스케줄 대신 8번의 transformer forward로 동기화된 비디오와 오디오를 생성하며, 이번 세대는 한 가지 허용적인 변경 사항과 함께 제공됩니다. checkpoint 자체의 README에 어텐션 요구 사항이 직접 문서화되어 있어, 추론 시 sparse 어텐션 패턴만 재현된다면 FastVideo 스택 외부에서도 서빙할 수 있습니다.
Comfy-Org는 증류된 transformer를 Comfy-Org/FastVideo-FastH3 저장소에 fastvideo_fasth3_8step_v2_pruned_int8_convrot.safetensors로 재패키징했습니다(해당 저장소는 FastVideo의 FastH3-Comfy로 리디렉션됩니다). 베이스 모델 text encoder와 비디오/오디오 VAE 파일은 Comfy-Org/MiniMax-H3에 있습니다.
| 구성 요소 | 파일 | 위치 |
|---|---|---|
| 증류된 transformer | fastvideo_fasth3_8step_v2_pruned_int8_convrot.safetensors | models/diffusion_models/ |
| Text encoder | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | models/text_encoders/ |
| 비디오 VAE | minimax_h3_video_vae_fp16.safetensors | models/vae/ |
| 오디오 VAE | minimax_h3_audio_vae_fp32.safetensors | models/vae/ |
두 가지 공식 템플릿
Comfy-Org/workflow_templates의 템플릿 버전 0.11.61에서 9월 15일 두 워크플로가 모두 추가되었습니다.
- video_fastvideo_fasth3_t2v.json: 텍스트 기반 비디오 및 오디오 생성.
MiniMaxH3ImageToVideo노드가 이미지가 연결되지 않은 상태로 실행됩니다. - video_fastvideo_fasth3_i2v.json: 텍스트 기반 비디오 생성과 첫/마지막 프레임 이미지 조건화. fl2va를 사용하려면
first_frame및/또는last_frame을 연결하세요.
FastH3 템플릿의 첫/마지막 프레임 변형.
두 템플릿 모두 하나의 중요한 공통점을 가집니다. checkpoint는 80% sparsity의 VSA-H3 어텐션으로 학습되었고, 템플릿은 이 패턴을 재현하기 위해 vsa 방법과 keep_percent 10으로 설정된 BlockSparseAttention 노드를 연결합니다. sol-attn과 sla sparse 방법은 이 checkpoint와 호환되지 않습니다. 해상도는 H3의 기본 768px 단변 캔버스로 유지되고, 재생 시간은 24 FPS에서 모델의 블록당 17프레임 그리드에 맞춰집니다.
적용 범위
증류된 checkpoint는 텍스트 기반 비디오 및 오디오 생성과 첫/마지막 프레임 조건화만 지원합니다. Ref2VA(다중 참조 조건화)는 증류되지 않았으므로, 참조 기반 작업에는 여전히 베이스 MiniMax H3 모델이 필요합니다. 이번 세대의 추가 장점이라면 FastVideo의 comfy-kitchen RoPE 경로 덕분에 템플릿이 FastVideo 스택이 아닌 표준 ComfyUI 최신 테스트 버전(nightly) 빌드에서 실행된다는 점입니다.
더 넓은 가속 환경에서 FastH3가 어디에 위치하는지에 대한 맥락은 H3 Acceleration Arena 블라인드 A/B 순위를 참고하세요.
댓글
GitHub로 로그인하고 토론에 참여하세요.