SenseNova-U1.5 ConvRot для ComfyUI: модель 50 ГБ на GPU 12 ГБ

ComfyUI Wikinews

Квантование ConvRot запускает SenseNova-U1.5-8B-MoT в ComfyUI на GPU 12 ГБ: чекпойнты INT8 (17.6 ГБ) и гибридный W4A8 (13.8 ГБ) плюс 8-шаговый LoRA ускорения.

SenseNova-U1.5-8B-MoT ConvRot квантование (weights | custom node) — релиз сообщества, который переносит модель 50 ГБ bf16 any-to-any (text-to-image, редактирование изображений, многократные ссылки) на потребительские GPU в ComfyUI. Два чекпойнта ConvRot, сборка INT8 и гибридная сборка W4A8, работают на RTX 4070 12 ГБ при 2048×2048, включен официальный 8-шаговый LoRA ускорения.
Сравнение A/B с одинаковым seed: эталон bf16, результаты INT8 ConvRot и гибридного W4A8

Что входит в релиз

Два квантованных чекпойнта плюс официальный LoRA ускорения:

ФайлРазмерФорматПримечания
SenseNova-U1.5-8B-MoT-T8-int8-convrot-tagged.safetensors17.58 GiBINT8 ConvRotРЕКОМЕНДУЕТСЯ, максимальная точность
SenseNova-U1.5-8B-MoT-T8-hybw4a8-L18-41.safetensors13.80 GiBГибридный INT8 + W4A8Слои 0-17 в INT8, слои 18-41 в истинном W4A8
SenseNova-U1.5-8B-MoT-LoRA-8step-ComfyUI.safetensors0.76 GiB8-step speed LoRAОфициальный LoRA, конвертированный для ComfyUI

Оба чекпойнта помещаются в ComfyUI/models/diffusion_models/SenseNovaU1.5/, а LoRA — в ComfyUI/models/loras/. Вывод выполняется через форк узла обертки T8, учитывающий ConvRot, который добавляет явный поворот активации и ручную деквантовизацию для INT8, маршрутизацию ядра для W4A8 через comfy-kitchen от Comfy-Org и защиты во время выполнения, которые предотвращают повреждение упакованных квантованных тензоров потоковой передачей весов ComfyUI.

Качество

Измерено против оригинала bf16 с полными конвейерными тестами A/B с одинаковым seed:

bf16 (эталон)INT8 ConvRot (тот же seed)Гибридный W4A8 (тот же seed)
Эталон bf16INT8 ConvRotГибридный W4A8
ЭталонРазница пикселей 0.43%Визуально неразличимо

Вариант INT8 показывает разницу пикселей 0.43% за полный full-pipeline тест A/B с тем же seed, ошибка реконструкции весов на слой значительно ниже 2%. Гибрид показывает около 7% относительной ошибки L2 на своих 4-битных слоях (кодбук Lloyd-Max, размер группы 16, масштабы группы FP8), но визуально неразличим от bf16 в тестах с тем же seed. Траектории с тем же seed хаотичны, поэтому авторы представляют изображения как образцы качества, а не сравнения пикселей.

Почему гибрид

Интересное открытие за этим релизом: SenseNova-U1.5 допускает истинное квантование активаций W4A8 в своих поздних слоях, но не в самых ранних. Квантование первых блоков трансформера разрушает связность промпта, тогда как слои 18+ квантуются в W4A8 прозрачно. Авторы эмпирически определили границу с помощью лестницы бисекции гибридных чекпойнтов, затем создали гибридные файлы путем побайтного слияния двух независимо проверенных чекпойнтов, так что ни один слой не подвергался повторному квантованию во время слияния.

Производительность

На RTX 4070 12 ГБ оба варианта работают быстро, несмотря на то, что веса превышают VRAM: ComfyUI загружает веса по требованию, а квантованные форматы передают в 3-4 раза меньше байт на шаг при вычислении через быстрые целочисленные ядра tensor-core, поэтому переполнение никогда не становится замедлением. bf16 на той же карте передает около 47 ГБ на шаг и работает значительно медленнее.

Начало работы

  1. Установите пользовательскую ноду: git clone https://github.com/Milor123/ComfyUI-SenseNova-U1.5-ConvRot в ComfyUI/custom_nodes/, с установленным comfy-kitchen >= 0.2.31 (протестировано с коммитом ComfyUI 82f839f5).
  2. Скачайте рекомендуемый чекпойнт INT8 (или гибридный) в ComfyUI/models/diffusion_models/SenseNovaU1.5/ и LoRA ускорения в ComfyUI/models/loras/.
  3. Запустите один из примеров рабочих процессов из папки examples/ репозитория:

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
SenseNova-U1.5 ConvRot для ComfyUI: модель 50 ГБ на GPU 12 ГБ | ComfyUI Wiki