SenseNova-U1.5 ConvRot pour ComfyUI : 50 Go sur une carte 12 Go
La quantification ConvRot exécute SenseNova-U1.5-8B-MoT dans ComfyUI sur un GPU 12 Go : checkpoints INT8 (17,6 Go) et hybride W4A8 (13,8 Go) plus un LoRA de vitesse à 8 étapes.
Ce que contient la sortie
Deux checkpoints quantifiés plus le LoRA de vitesse officiel :
| Fichier | Taille | Format | Notes |
|---|---|---|---|
SenseNova-U1.5-8B-MoT-T8-int8-convrot-tagged.safetensors | 17,58 GiB | INT8 ConvRot | Recommandé, fidélité maximale |
SenseNova-U1.5-8B-MoT-T8-hybw4a8-L18-41.safetensors | 13,80 GiB | Hybrid INT8 + W4A8 | Calques 0-17 en INT8, calques 18-41 en vrai W4A8 |
SenseNova-U1.5-8B-MoT-LoRA-8step-ComfyUI.safetensors | 0,76 GiB | 8-step speed LoRA | LoRA de vitesse officiel converti pour ComfyUI |
Les deux checkpoints vont dans ComfyUI/models/diffusion_models/SenseNovaU1.5/, et le LoRA dans ComfyUI/models/loras/. L'inférence s'exécute via une fourche du wrapper node T8 consciente de ConvRot, qui ajoute une rotation d'activation explicite et une déquantification manuelle pour INT8, un routage de noyau pour W4A8 via comfy-kitchen de Comfy-Org, et des gardes d'exécution qui empêchent le streaming de poids de ComfyUI de corrompre les tensors quantifiés empilés.
Qualité
Mesuré contre l'original bf16 avec des exécutions A/B complètes du pipeline même graine :
| bf16 (référence) | INT8 ConvRot (même graine) | Hybride W4A8 (même graine) |
|---|---|---|
![]() | ![]() | ![]() |
| Référence | Différence de 0,43 % des pixels | Indiscernable visuellement |
La variante INT8 rapporte une différence de 0,43 % des pixels sur une comparaison A/B complète du pipeline même graine, avec une erreur de reconstruction des poids par calque bien inférieure à 2 %. L'hybride rapporte environ 7 % d'erreur L2 relative sur ses calques 4 bits (codebook Lloyd-Max, taille de groupe 16, échelles de groupe FP8) mais est indiscernable visuellement de bf16 dans les tests même graine. Les trajectoires même graine sont chaotiques, donc les auteurs présentent les images comme échantillons de qualité plutôt que comparaisons de pixels.
Pourquoi l'hybride
La découverte intéressante derrière la sortie : SenseNova-U1.5 tolère la quantification d'activation W4A8 vrai dans ses calques ultérieurs mais pas dans ses premiers. Quantifier les premiers blocs Transformer détruit la cohérence du prompt, tandis que les calques 18+ se quantifient en W4A8 transparentement. Les auteurs ont localisé la frontière empiriquement avec une échelle de bissection de checkpoints hybrides, puis ont produit les fichiers hybrides par fusion au niveau des octets de deux checkpoints validés indépendamment, afin qu'aucun calque n'ait été re-quantifié pendant la fusion.
Performance
Sur une RTX 4070 12 Go, les deux variantes s'exécutent rapidement même si les poids dépassent la VRAM : ComfyUI stream les poids à la demande, et les formats quantifiés déplacent 3 à 4 fois moins d'octets par étape tout en calculant via des noyaux de cœur entiers rapides, donc le débordement ne devient jamais un ralentissement. bf16 sur la même carte stream environ 47 Go par étape et est considérablement plus lent.
Commencer
- Installer le Personnalisé node :
git clone https://github.com/Milor123/ComfyUI-SenseNova-U1.5-ConvRotdansComfyUI/custom_nodes/, aveccomfy-kitchen >= 0.2.31installé (testé avec le commit ComfyUI82f839f5). - Télécharger le checkpoint INT8 recommandé (ou l'hybride) dans
ComfyUI/models/diffusion_models/SenseNovaU1.5/et le LoRA de vitesse dansComfyUI/models/loras/. - Exécuter l'un des exemples de flux de travail du dossier
examples/du dépôt :


Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.