ComfyUI v0.32.0: 새로운 네이티브 어텐션 백엔드 및 LTX 2.5 지원
ComfyUI v0.32.0에 SageAttention 속도에 준하는 내장 어텐션 백엔드, STG 및 이중 CFG를 지원하는 네이티브 LTX 2.5, MiniMax H3 VAE 및 메모리 관련 수정, 파트너 노드가 추가되었습니다.
새로운 내장 어텐션 백엔드
v0.32.0은 ComfyUI 자체에 포함된 네이티브 어텐션 백엔드인 comfy kitchen attention을 구현합니다. 새로운 ModelAttentionBackend 노드를 사용하면 워크플로 내에서 모델별로 어텐션 구현을 직접 선택할 수 있으며, 현재 PyTorch 어텐션 또는 comfy kitchen attention 중에서 선택할 수 있습니다. 모든 모델에 적용하려는 사용자는 --use-ck-attention 시작 인자를 사용하여 모든 모델의 기본 백엔드로 설정할 수 있습니다(일부 모델에서는 문제가 발생할 수 있습니다).
초기 커뮤니티 벤치마크에서는 SageAttention과 동급 성능을 보여주었습니다. MiniMax H3에서는 SageAttention Auto와 동일한 성능을 보였으며, Z-Image Turbo 2048x2048 @ 9스텝 테스트에서는 새 백엔드가 14.55초, SageAttention(Auto)이 14.24초, 기본 PyTorch 어텐션이 23.16초가 걸렸습니다:
| 어텐션 백엔드 | Z-Image Turbo 2048x2048 @ 9스텝(3회 평균) |
|---|---|
| Comfy Kitchen Attention | 14.55초 |
| SageAttention (Auto) | 14.24초 |
| PyTorch Attention(기본값) | 23.16초 |
SageAttention 설치에 어려움이 있던 사용자라면, 이 백엔드가 ComfyUI에 내장되어 있으므로 그러한 번거로움이 완전히 사라집니다.
네이티브 LTX 2.5 지원
이제 ComfyUI에서 LTX 2.5를 시공간 가이드(STG), 이중 CFG, 재생 시간 예측과 함께 네이티브로 지원합니다. 이번 릴리스에는 새로운 LTXV 노드도 추가되었습니다:
- LTXV Spatio-Temporal Guidance: LTX 비디오 생성을 위한 STG 가이드
- LTXV Modality Guidance: LTX용 오디오/비디오 결합 가이드
- LTXV Dual CFG Guider: LTX 워크플로용 이중 CFG 가이드
- LTXV Duration Predictor: 캡션 토큰에서 자연스러운 샷 재생 시간 예측
MiniMax H3 최적화
v0.32.0의 여러 변경 사항은 MiniMax H3 생태계를 대상으로 합니다:
- 최적화된 MiniMax-H3 VAE: 더 빠른 인코딩 및 디코딩 지원
- MiniMax H3 생성 중 피크 메모리 문제 수정
- NestedTensor latent(MiniMax H3)에서 VAEDecodeTiled 충돌 수정
파트너 노드 업데이트
- Qwen Image 3.0: Qwen-Image 3.0 및 3.0 Pro 텍스트 기반 이미지 생성 및 편집 노드 추가
- LTX 2.5: LTX 2.5 텍스트/이미지/오디오를 비디오로 변환하는 파트너 노드 추가
- Grok Imagine Image 2.0: grok-imagine-image-2.0 모델 지원 추가
성능 및 안정성
- PyTorch 2.7이 이제 공식 지원되는 최소 PyTorch 버전입니다
- ER-SDE 노이즈 스케일러가 h(t) 스케일링으로 확장되었습니다
- Mistral 및 Llama 토크나이저가 더 이상 transformers에 의존하지 않습니다
- 비동적 저VRAM 모드에서 업스케일 모델이 중단되던 문제 수정
- 깨진 타일드 오디오 디코딩 수정
- CLIP Vision 회귀 문제 수정
- Create Layered Image 노드가 더 명확한 플래그로 검색 가능해졌습니다
전체 변경 로그는 공식 GitHub 릴리스 또는 ComfyUI 문서 변경 로그에서 확인하세요.
댓글
GitHub로 로그인하고 토론에 참여하세요.