ComfyUI 용 SenseNova-U1.5 ConvRot: 12GB GPU 에서 실행 가능한 50GB 모델
ConvRot 양자화를 통해 ComfyUI 에서 12GB GPU 상으로 SenseNova-U1.5-8B-MoT 실행: INT8 (17.6GB) 및 하이브리드 W4A8(13.8GB) 체크포인트와 8 단계 속도 LoRA 포함.
릴리스 내용
양자화된 체크포인트 두 개와 공식 속도 LoRA:
| 파일 | 크기 | 포맷 | 참고 사항 |
|---|---|---|---|
SenseNova-U1.5-8B-MoT-T8-int8-convrot-tagged.safetensors | 17.58 GiB | INT8 ConvRot | 권장, 최대 충실도 |
SenseNova-U1.5-8B-MoT-T8-hybw4a8-L18-41.safetensors | 13.80 GiB | 하이브리드 INT8 + W4A8 | 레이어 0-17 은 INT8, 레이어 18-41 은 참 W4A8 |
SenseNova-U1.5-8B-MoT-LoRA-8step-ComfyUI.safetensors | 0.76 GiB | 8 단계 속도 LoRA | ComfyUI 변환된 공식 LoRA |
두 체크포인트 모두 ComfyUI/models/diffusion_models/SenseNovaU1.5/ 에 넣고, LoRA 는 ComfyUI/models/loras/ 에 넣습니다. 추론은 T8 래퍼 노드의 ConvRot 인식 포크를 통해 실행되며, 이는 INT8 에 대한 명시적 활성화 회전 및 수동 디쿼티라이제이션, Comfy-Org 의 comfy-kitchen 을 통한 W4A8 에 대한 커널 라우팅, 그리고 ComfyUI 의 가중치 스트리밍이 패킹된 양자화 텐서를 손상시키는 것을 막는 런타임 보호 장치를 추가합니다.
품질
동일 시드 풀 파이프라인 A/B 실행을 기준으로 bf16 원본과 비교 측정:
| bf16 (기준) | INT8 ConvRot (동일 시드) | 하이브리드 W4A8 (동일 시드) |
|---|---|---|
![]() | ![]() | ![]() |
| 기준 | 0.43% 픽셀 차이 | 시각적으로 구별할 수 없음 |
INT8 변형체는 전체 파이프라인 동일 시드 A/B 에서 0.43% 의 픽셀 차이를 보고하며, 레이어별 가중치 재구성 오류는 2% 미만입니다. 하이브리드는 4 비트 레이어에서 약 7% 의 상대 L2 오류 (Lloyd-Max 코드북, 그룹 크기 16, FP8 그룹 스케일) 를 보고하지만 동일 시드 테스트에서 bf16 과 시각적으로 구별할 수 없습니다. 동일 시드 궤적은 혼란스러우므로 저자들은 이미지를 픽셀 비교보다는 품질 샘플로 제시합니다.
하이브리드 사용 이유
릴리스 뒤의 흥미로운 발견: SenseNova-U1.5 는 후반부 레이어에서는 참 W4A8 활성화 양자화를 허용하지만 가장 초기 레이어에서는 허용하지 않습니다. 첫 번째 트랜스포머 블록을 양자화하면 프롬프트 일관성이 파괴되지만, 레이어 18+ 은 투명하게 W4A8 로 양자화됩니다. 저자들은 하이브리드 체크포인트의 이진 탐색 사다리로 경계를 경험적으로 찾았으며, 두 개의 독립적으로 검증된 체크포인트의 바이트 단위 병합을 통해 하이브리드 파일을 생성했습니다. 따라서 병합 동안 어떤 레이어도 다시 양자화되지 않았습니다.
성능
RTX 4070 12GB 에서 두 변형체 모두 가중치가 VRAM 을 초과함에도 빠르게 실행됩니다: ComfyUI 는 필요에 따라 가중치를 스트리밍하며, 양자화 형식은 빠른 정수 텐서 코어 커널을 통해 계산하는 동안 단계당 3-4 배 적은 바이트를 이동하므로 오버플로우가 느려짐으로 이어지지 않습니다. 동일한 카드의 bf16 은 단계당 약 47GB 를 스트리밍하며 훨씬 더 느립니다.
시작하기
- 커스텀 노드 설치:
git clone https://github.com/Milor123/ComfyUI-SenseNova-U1.5-ConvRot을ComfyUI/custom_nodes/로 복제하고,comfy-kitchen >= 0.2.31이 설치되어 있어야 합니다 (ComfyUI 커밋82f839f5로 테스트됨). - 권장 INT8 체크포인트 (또는 하이브리드) 를
ComfyUI/models/diffusion_models/SenseNovaU1.5/로 다운로드하고 속도 LoRA 를ComfyUI/models/loras/로 다운로드합니다. - 저장소의
examples/폴더 중 예시 워크플로 중 하나를 실행하세요:


댓글
GitHub로 로그인하고 토론에 참여하세요.