ComfyUI 용 SenseNova-U1.5 ConvRot: 12GB GPU 에서 실행 가능한 50GB 모델

ComfyUI Wikinews

ConvRot 양자화를 통해 ComfyUI 에서 12GB GPU 상으로 SenseNova-U1.5-8B-MoT 실행: INT8 (17.6GB) 및 하이브리드 W4A8(13.8GB) 체크포인트와 8 단계 속도 LoRA 포함.

SenseNova-U1.5-8B-MoT ConvRot 양자화 (weights | 커스텀 노드) 는 ComfyUI 에서 50GB bf16 any-to-any 모델 (텍스트 기반 이미지 생성, 이미지 편집, 다중 참조) 을 소비자용 GPU 로 가져오는 커뮤니티 릴리스입니다. 두 개의 ConvRot 체크포인트, INT8 빌드와 하이브리드 W4A8 빌드는 RTX 4070 12GB 에서 2048×2048 로 실행되며, 공식 8 단계 속도 LoRA 가 포함되어 있습니다.
동일 시드 A/B 비교: bf16 기준, INT8 ConvRot 및 하이브리드 W4A8 결과

릴리스 내용

양자화된 체크포인트 두 개와 공식 속도 LoRA:

파일크기포맷참고 사항
SenseNova-U1.5-8B-MoT-T8-int8-convrot-tagged.safetensors17.58 GiBINT8 ConvRot권장, 최대 충실도
SenseNova-U1.5-8B-MoT-T8-hybw4a8-L18-41.safetensors13.80 GiB하이브리드 INT8 + W4A8레이어 0-17 은 INT8, 레이어 18-41 은 참 W4A8
SenseNova-U1.5-8B-MoT-LoRA-8step-ComfyUI.safetensors0.76 GiB8 단계 속도 LoRAComfyUI 변환된 공식 LoRA

두 체크포인트 모두 ComfyUI/models/diffusion_models/SenseNovaU1.5/ 에 넣고, LoRA 는 ComfyUI/models/loras/ 에 넣습니다. 추론은 T8 래퍼 노드의 ConvRot 인식 포크를 통해 실행되며, 이는 INT8 에 대한 명시적 활성화 회전 및 수동 디쿼티라이제이션, Comfy-Org 의 comfy-kitchen 을 통한 W4A8 에 대한 커널 라우팅, 그리고 ComfyUI 의 가중치 스트리밍이 패킹된 양자화 텐서를 손상시키는 것을 막는 런타임 보호 장치를 추가합니다.

품질

동일 시드 풀 파이프라인 A/B 실행을 기준으로 bf16 원본과 비교 측정:

bf16 (기준)INT8 ConvRot (동일 시드)하이브리드 W4A8 (동일 시드)
bf16 기준INT8 ConvRot하이브리드 W4A8
기준0.43% 픽셀 차이시각적으로 구별할 수 없음

INT8 변형체는 전체 파이프라인 동일 시드 A/B 에서 0.43% 의 픽셀 차이를 보고하며, 레이어별 가중치 재구성 오류는 2% 미만입니다. 하이브리드는 4 비트 레이어에서 약 7% 의 상대 L2 오류 (Lloyd-Max 코드북, 그룹 크기 16, FP8 그룹 스케일) 를 보고하지만 동일 시드 테스트에서 bf16 과 시각적으로 구별할 수 없습니다. 동일 시드 궤적은 혼란스러우므로 저자들은 이미지를 픽셀 비교보다는 품질 샘플로 제시합니다.

하이브리드 사용 이유

릴리스 뒤의 흥미로운 발견: SenseNova-U1.5 는 후반부 레이어에서는 참 W4A8 활성화 양자화를 허용하지만 가장 초기 레이어에서는 허용하지 않습니다. 첫 번째 트랜스포머 블록을 양자화하면 프롬프트 일관성이 파괴되지만, 레이어 18+ 은 투명하게 W4A8 로 양자화됩니다. 저자들은 하이브리드 체크포인트의 이진 탐색 사다리로 경계를 경험적으로 찾았으며, 두 개의 독립적으로 검증된 체크포인트의 바이트 단위 병합을 통해 하이브리드 파일을 생성했습니다. 따라서 병합 동안 어떤 레이어도 다시 양자화되지 않았습니다.

성능

RTX 4070 12GB 에서 두 변형체 모두 가중치가 VRAM 을 초과함에도 빠르게 실행됩니다: ComfyUI 는 필요에 따라 가중치를 스트리밍하며, 양자화 형식은 빠른 정수 텐서 코어 커널을 통해 계산하는 동안 단계당 3-4 배 적은 바이트를 이동하므로 오버플로우가 느려짐으로 이어지지 않습니다. 동일한 카드의 bf16 은 단계당 약 47GB 를 스트리밍하며 훨씬 더 느립니다.

시작하기

  1. 커스텀 노드 설치: git clone https://github.com/Milor123/ComfyUI-SenseNova-U1.5-ConvRotComfyUI/custom_nodes/ 로 복제하고, comfy-kitchen >= 0.2.31 이 설치되어 있어야 합니다 (ComfyUI 커밋 82f839f5 로 테스트됨).
  2. 권장 INT8 체크포인트 (또는 하이브리드) 를 ComfyUI/models/diffusion_models/SenseNovaU1.5/ 로 다운로드하고 속도 LoRA 를 ComfyUI/models/loras/ 로 다운로드합니다.
  3. 저장소의 examples/ 폴더 중 예시 워크플로 중 하나를 실행하세요:

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
ComfyUI 용 SenseNova-U1.5 ConvRot: 12GB GPU 에서 실행 가능한 50GB 모델 | ComfyUI Wiki