SenseNova-U1.5 ConvRot для ComfyUI: модель 50 ГБ на GPU 12 ГБ
Квантование ConvRot запускает SenseNova-U1.5-8B-MoT в ComfyUI на GPU 12 ГБ: чекпойнты INT8 (17.6 ГБ) и гибридный W4A8 (13.8 ГБ) плюс 8-шаговый LoRA ускорения.
Что входит в релиз
Два квантованных чекпойнта плюс официальный LoRA ускорения:
| Файл | Размер | Формат | Примечания |
|---|---|---|---|
SenseNova-U1.5-8B-MoT-T8-int8-convrot-tagged.safetensors | 17.58 GiB | INT8 ConvRot | РЕКОМЕНДУЕТСЯ, максимальная точность |
SenseNova-U1.5-8B-MoT-T8-hybw4a8-L18-41.safetensors | 13.80 GiB | Гибридный INT8 + W4A8 | Слои 0-17 в INT8, слои 18-41 в истинном W4A8 |
SenseNova-U1.5-8B-MoT-LoRA-8step-ComfyUI.safetensors | 0.76 GiB | 8-step speed LoRA | Официальный LoRA, конвертированный для ComfyUI |
Оба чекпойнта помещаются в ComfyUI/models/diffusion_models/SenseNovaU1.5/, а LoRA — в ComfyUI/models/loras/. Вывод выполняется через форк узла обертки T8, учитывающий ConvRot, который добавляет явный поворот активации и ручную деквантовизацию для INT8, маршрутизацию ядра для W4A8 через comfy-kitchen от Comfy-Org и защиты во время выполнения, которые предотвращают повреждение упакованных квантованных тензоров потоковой передачей весов ComfyUI.
Качество
Измерено против оригинала bf16 с полными конвейерными тестами A/B с одинаковым seed:
| bf16 (эталон) | INT8 ConvRot (тот же seed) | Гибридный W4A8 (тот же seed) |
|---|---|---|
![]() | ![]() | ![]() |
| Эталон | Разница пикселей 0.43% | Визуально неразличимо |
Вариант INT8 показывает разницу пикселей 0.43% за полный full-pipeline тест A/B с тем же seed, ошибка реконструкции весов на слой значительно ниже 2%. Гибрид показывает около 7% относительной ошибки L2 на своих 4-битных слоях (кодбук Lloyd-Max, размер группы 16, масштабы группы FP8), но визуально неразличим от bf16 в тестах с тем же seed. Траектории с тем же seed хаотичны, поэтому авторы представляют изображения как образцы качества, а не сравнения пикселей.
Почему гибрид
Интересное открытие за этим релизом: SenseNova-U1.5 допускает истинное квантование активаций W4A8 в своих поздних слоях, но не в самых ранних. Квантование первых блоков трансформера разрушает связность промпта, тогда как слои 18+ квантуются в W4A8 прозрачно. Авторы эмпирически определили границу с помощью лестницы бисекции гибридных чекпойнтов, затем создали гибридные файлы путем побайтного слияния двух независимо проверенных чекпойнтов, так что ни один слой не подвергался повторному квантованию во время слияния.
Производительность
На RTX 4070 12 ГБ оба варианта работают быстро, несмотря на то, что веса превышают VRAM: ComfyUI загружает веса по требованию, а квантованные форматы передают в 3-4 раза меньше байт на шаг при вычислении через быстрые целочисленные ядра tensor-core, поэтому переполнение никогда не становится замедлением. bf16 на той же карте передает около 47 ГБ на шаг и работает значительно медленнее.
Начало работы
- Установите пользовательскую ноду:
git clone https://github.com/Milor123/ComfyUI-SenseNova-U1.5-ConvRotвComfyUI/custom_nodes/, с установленнымcomfy-kitchen >= 0.2.31(протестировано с коммитом ComfyUI82f839f5). - Скачайте рекомендуемый чекпойнт INT8 (или гибридный) в
ComfyUI/models/diffusion_models/SenseNovaU1.5/и LoRA ускорения вComfyUI/models/loras/. - Запустите один из примеров рабочих процессов из папки
examples/репозитория:


Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.