SenseNova-U1.5 ConvRot para ComfyUI: 50 GB en una GPU de 12 GB

ComfyUI Wikinews

La cuantización ConvRot ejecuta SenseNova-U1.5-8B-MoT en ComfyUI en una GPU de 12 GB: checkpoints INT8 (17.6 GB) e híbrido W4A8 (13.8 GB) más un LoRA de velocidad de 8 pasos.

Cuantización SenseNova-U1.5-8B-MoT ConvRot (pesos | nodo personalizado) es un lanzamiento de la comunidad que trae el modelo any-to-any de 50 GB bf16 (texto-a-imagen, edición de imagen, referencia múltiple) a las GPUs de consumo en ComfyUI. Dos checkpoints ConvRot, una compilación INT8 y una compilación híbrida W4A8, se ejecutan en una RTX 4070 de 12 GB a 2048×2048, y se incluye el LoRA oficial de velocidad de 8 pasos.
Misma semilla A/B: referencia bf16, resultados INT8 ConvRot e híbrido W4A8

Qué contiene el lanzamiento

Dos checkpoints cuantizados más el LoRA de velocidad oficial:

ArchivoTamañoFormatoNotas
SenseNova-U1.5-8B-MoT-T8-int8-convrot-tagged.safetensors17.58 GiBINT8 ConvRotRECOMENDADO, máxima fidelidad
SenseNova-U1.5-8B-MoT-T8-hybw4a8-L18-41.safetensors13.80 GiBHybrid INT8 + W4A8Capas 0-17 en INT8, capas 18-41 en verdadero W4A8
SenseNova-U1.5-8B-MoT-LoRA-8step-ComfyUI.safetensors0.76 GiB8-step speed LoRALoRA oficial convertido para ComfyUI

Ambos checkpoints van a ComfyUI/models/diffusion_models/SenseNovaU1.5/, y el LoRA a ComfyUI/models/loras/. La inferencia se ejecuta a través de un fork del nodo wrapper T8 consciente de ConvRot, que añade rotación de activación explícita y descuantización manual para INT8, enrutamiento de kernel para W4A8 a través de comfy-kitchen de Comfy-Org, y protecciones en tiempo de ejecución que evitan que el streaming de pesos de ComfyUI corrompa tensors cuantizados empaquetados.

Calidad

Medido contra el original bf16 con corridas A/B de mismo-seed en pipeline completo:

bf16 (referencia)INT8 ConvRot (misma semilla)Híbrido W4A8 (misma semilla)
referencia bf16INT8 ConvRotHíbrido W4A8
ReferenciaDiferencia de píxeles del 0.43%Visualmente indistinguible

La variante INT8 reporta una diferencia de píxeles del 0.43% sobre una misma semilla A/B de pipeline completo, con error de reconstrucción de peso por capa muy por debajo del 2%. El híbrido reporta aproximadamente un 7% de error relativo L2 en sus capas de 4 bits (códigobook Lloyd-Max, tamaño de grupo 16, escalas de grupo FP8) pero es visualmente indistinguible de bf16 en pruebas de misma semilla. Las trayectorias de misma semilla son caóticas, por lo que los autores presentan las imágenes como muestras de calidad en lugar de comparaciones de píxeles.

Por qué el híbrido

El hallazgo interesante detrás del lanzamiento: SenseNova-U1.5 tolera la cuantización de activación W4A8 verdadero en sus capas posteriores pero no en las más tempranas. Cuantizar los primeros bloques transformadores destruye la coherencia del prompt, mientras que las capas 18+ se cuantizan a W4A8 transparentemente. Los autores localizaron el límite empíricamente con una escalera de bisect de checkpoints híbridos, luego produjeron los archivos híbridos mediante fusión a nivel de bytes de dos checkpoints validados independientemente, por lo que ninguna capa fue nunca recuantizada durante la fusión.

Rendimiento

En una RTX 4070 de 12 GB, ambas variantes se ejecutan rápido aunque los pesos exceden la VRAM: ComfyUI transmite los pesos bajo demanda, y los formatos cuantizados mueven 3-4 veces menos bytes por paso mientras computan a través de kernels rápidos de núcleo de tensor entero, por lo que el desbordamiento nunca se convierte en una lentitud. bf16 en la misma tarjeta transmite aproximadamente 47 GB por paso y es drásticamente más lento.

Primeros Pasos

  1. Instalar el nodo personalizado: git clone https://github.com/Milor123/ComfyUI-SenseNova-U1.5-ConvRot en ComfyUI/custom_nodes/, con comfy-kitchen >= 0.2.31 instalado (probado con el commit de ComfyUI 82f839f5).
  2. Descargar el checkpoint INT8 recomendado (o el híbrido) en ComfyUI/models/diffusion_models/SenseNovaU1.5/ y el LoRA de velocidad en ComfyUI/models/loras/.
  3. Ejecutar uno de los flujos de trabajo de ejemplo de la carpeta examples/ del repositorio:

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
SenseNova-U1.5 ConvRot para ComfyUI: 50 GB en una GPU de 12 GB | ComfyUI Wiki