ComfyUI 대비 빠른 Diffusion Compiler 와 Krea 2 Turbo 성능 향상 가이드

ComfyUI Wikinews

Diffusion 모델용 오픈 소스 C++20 컴파일러가 RTX 3090 Ti 에서 ComfyUI 보다 2 배 이상 빠른 Krea 2 Turbo 프롬프트에서 PNG 로의 변환을 수행하며, MiniMax H3 는 진행 중입니다.

alexone 이 Diffusion Compiler 를 공개했습니다. 이는 Diffusion 추론 및 학습용 독립적인 C++20 컴파일러 및 네이티브 런타임입니다. RTX 3090 Ti 에서 컴파일된 Krea 2 Turbo 실행은 프롬프트에서 PNG 까지 전체 체인을 26.58 초에 완료하는 반면, ComfyUI/PyTorch 에서는 59.14 초가 걸립니다. 비트 단위 수치 게이트를 통한 측정된 2.2 배 속도 향상입니다. 소스: 프로젝트 README.
Krea 2 샘플 출력물 쇼케이스

Krea 2 Turbo 는 컴파일러의 첫 번째 이미지 모델 대상입니다. 소스: Krea 2 오픈 가중치

개요

Diffusion Compiler 는 모델 체크포인트를 모델별 프론트엔드를 거쳐 검증된 중간 표현 (DiffIR) 으로 가져옵니다. 컴파일러는 이후 실행 계획을 수립하고, 공유된 네이티브 C++ 런타임이 해당 계획을 설치된 하드웨어 백엔드로 낮춥니다. NVIDIA 백엔드는 CUDA Driver API, NVRTC, cuBLASLt, cuDNN 및 커스텀 커널을 사용하며, 컴파일된 실행 파일은 libtorch 를 링크하거나 Python 워커를 호출하지 않습니다.

이 프로젝트는 일반적인 추론 스택과 엄격하게 차별화됩니다: 모든 모델 승인에는 수치 게이트 (코사인 유사도, 상대 L2, 비유한수 확인) 와 디코드된 아티팩트 검토가 필요하며, 단순한 빌드 성공만으로는 충분하지 않습니다. Krea 2 Turbo Denoiser 는 제작자 궤적과 비트 단위로 동일하게 유지되었으며, VAE 디코드는 코사인 0.99999339 로 통과했습니다.

Krea 2 Turbo 벤치마크

고정된 벤치마크는 RTX 3090 Ti 에서 공식 Krea 2 Turbo 체크포인트와 제작자 레시피를 사용합니다: 1024x1024 출력, BF16 수학, 8 Euler 단계, CFG 비활성화, 그리고 양쪽 실행 모두 동일한 체크포인트, 프롬프트, 시드 및 스케줄입니다.

측정 항목네이티브 컴파일ComfyUI/PyTorch BF16
콜드 첫 Denoise 단계3.57 초28.29 초
핫 Denoise 단계 중앙값2.25 초2.00 초
완전한 8 단계 Denoise19.36 초42.32 초
Tokenizer + 텍스트 인코더2.28 초9.05 초
VAE 디코드 + PNG3.43 초8.31 초
프롬프트에서 PNG 총계26.58 초59.14 초

이는 전체 체인에 대해 2.054 배 빠르며, Denoise 루프 단독으로 2.184 배 빠릅니다. 흥미로운 세부 사항은 속도 향상이 어디서 나오지 않는지에 있습니다: 핫 단계별 시간은 실제로 워밍업된 PyTorch 보다 약간 느립니다 (2.25 초 대 2.00 초). 이익은 워밍업 오버헤드 제거, 더 빠른 텍스트 인코더 및 VAE 단계, 그리고 루프에서 Python 을 완전히 제거하는 데서 나옵니다. 비교 대상은 표준 ComfyUI 이거 실행이며, README 에 따르면 torch.compile 은 별도의 매칭된 벤치마크가 될 것입니다.

프레임워크는 또한 동일한 DiffIR 과 런타임을 통해 LoRA 학습 구조를 지원하며, 역방향 모드 자동 미분, 그래디언트 누적, AdamW 및 체크포인트/재개를 포함합니다.

MiniMax H3 진행 중

첫 번째 프로덕션 규모 증명 프론트엔드는 실제로 Krea 2 가 아닌 MiniMax H3 비디오였습니다. 현재 H3 개발 체크포인트는 정확한 cuDNN 어텐션을 사용하는 네이티브 ConvRot INT8 투영 캐시를 사용하며, 같은 카드에서 스트리밍된 BF16 대비 Denoise 평가당 1.717 배 더 빠르게 실행됩니다. 근사 어텐션 후보는 2 배 타이밍 장벽을 넘었지만 변경되지 않은 궤적 게이트에서 실패하여 거부되었습니다. 전체 프롬프트에서 비디오 수용 실행은 여전히 열려 있으므로 아직 엔드투엔드 H3 속도 향상은 주장되지 않았습니다.

일일 요약 논의에 따르면, H3 ConvRot INT8 지원이 다음 런타임 대상이며, ComfyUI 통합 후크가 계획되어 있습니다.

배포

코드는 github.com/CodeAlexx/diffusion-compiler 에서 공개되었습니다. CMake 3.24+, C++20 컴파일러, 그리고 NVIDIA 백엔드를 위한 CUDA Toolkit 및 cuDNN 으로 빌드됩니다. 모델 체크포인트 및 생성된 아티팩트는 저장소에 배포되지 않으며, 컴파일러는 로컬로 다운로드된 가중치를 대상으로 작동합니다. 현재 런타임은 Krea 2 Turbo 와 MiniMax H3 개발 경로를 포괄합니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
ComfyUI 대비 빠른 Diffusion Compiler 와 Krea 2 Turbo 성능 향상 가이드 | ComfyUI Wiki